ページを読み込み中…
ページを読み込み中…
86件の記事
Anthropic は、高価なモデルで計画し安価なモデルに実行を委ねる「オーケストレーター・エグゼクター」パターンが、安価モデルの性能向上により生産性エージェント構築の最適解となったと報告した。
Databricksは、大規模展開におけるAIコーディングツールの利用が出力速度を劇的に向上させる一方、コストの指数関数的増加という課題に直面し、収益を上回るリスクがあるとして、その解決策となるコスト管理手法を報告した。
Evaluation チームの 岡 照晃 です。
アリババは Qwen 3.8-Max を発表し Claude Fable 5 に次ぐと主張したが、独立検証では逆の結果も得られ、差は予算依存でスコアのみでは予測不能。
Together AIはDeepSWEベンチにおいて、品質ではGPT-5.6 Lunaが上回るものの、コスト効率を考慮したカスケード構成によりDeepSeek-V4 Flashの方が精度と費用面で優位であることを報告した。