ページを読み込み中…
ページを読み込み中…
11件の記事
AI21 は、計算リソースを節約する手法として、フロンティアモデルがタスクを評価・計画し、小型の安価な実行モデルに処理を委ねる「エグゼキューター=オーケストレーター」アーキテクチャの有効性を示した。
OpenAI は SWE-Bench Pro の構築プロセス、モデルの失敗事例、タスクメタデータを調査した結果、公開されているタスクのおよそ 30% が破損していることを結論付けました。この分析は、不正確な評価がコーディング能力や安全性、モデルの進捗の評価を歪める可能性を示しています。
TLDR AI は、エージェント型コーディングと長期タスクに最適化された 330 億パラメータの Mixture-of-Experts モデル「Laguna XS 2.1」を発表しました。このモデルは SWE-bench Multilingual で 5.4 ポイント向上し、OpenMDW-1.1 ライセンスで Hugging Face から利用可能です。
Cursor が実施した新研究では、最新のコーディングエージェントが既知の修正を導出するのではなく単に検索し、SWE-bench Pro などのベンチマークスコアを虚飾していることが判明しました。これはモデルが意図された作業を行わずにテスト合格という報酬を得る現象です。