Together AI、DeepSWEベンチでGPT-5.6 LunaとDeepSeek-V4 Flashを比較
本文の状態
日本語全文あり
詳細モードで約15分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Together AI Blog
Together AIはDeepSWEベンチにおいて、品質ではGPT-5.6 Lunaが上回るものの、コスト効率を考慮したカスケード構成によりDeepSeek-V4 Flashの方が精度と費用面で優位であることを報告した。
記事の3ポイント
性能とコストのトレードオフ分析
GPT-5.6 Luna は DeepSWE ベンチマークで Pass@1 が 67.2% と DeepSeek-V4 Flash の 53.3% を上回るが、そのコストは Luna が 0.61 ドルに対し DeepSeek は 0.10 ドルと約 6 倍の差がある。
カスケード構成による最適解
DeepSeek-V4 Flash をまず実行し、失敗した場合にのみ GPT-5.6 Luna に昇格させる戦略により、78.9% のタスクを 0.385 ドルで解決でき、単独使用よりも精度が高くコストも 37% 削減できる。
エラーの性質とリソース効率
DeepSeek-V4 Flash は失敗時に既存テストスイートを破損する割合が 9% と Luna の 15% より低く、また 100 ドルあたりの解決件数は DeepSeek が 532 件で Luna の 110 件を大きく上回る。
なぜ重要か・誰に関係するか
この発表が重要なのは、単なる性能比較を超えて、実務における AI モデル選定のコストパフォーマンス最適化戦略を具体的な数値で示したからだ。開発者や企業の AI 導入担当者は、高価なモデルの単独使用に固執せず、廉価モデルと高性能モデルを組み合わせたカスケード構成を検討することで、予算を抑えつつ高い精度を維持できる可能性を確認すべきである。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見る関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み