SWE-Bench ProMax:大規模多言語コードリファクタリングのベンチマーク
本文の状態
日本語全文あり
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
既存ベンチマークの欠陥を解消し、7言語対応の170件からなる大規模コードリファクタリング評価セット「SWE-Bench ProMax」が公開され、最先端モデルでも解決率が4割にとどまる実証的な難易度を示した。
記事の3ポイント
既存ベンチマークの深刻な欠陥指摘
直近の監査により、SWE-bench Verifiedの未解決インスタンスの約60%にテストの過小評価や過大評価といった欠陥があり、最前端モデルが学習データから正解を丸写ししている可能性が示された。
多言語・大規模リファクタリングベンチの構築
Python, Java, TypeScriptなど7言語の実際のコミットから選定した170件のインスタンスを専門家手作業でキュレーションし、曖昧な記述や範囲の狭いテストを排除して難易度を高めた。
実証された高い難易度と未飽和状態
最新モデルでも解決率は41.2%にとどまり、平均11.4ファイル・261.6行のコード変更を要する本ベンチが現在のAIコーディングエージェントにとって有意義で未飽和な課題であることを確認した。
なぜ重要か・誰に関係するか
この発表が重要なのは、AI コーディングエージェントの評価基準を根本から見直し、学習データへの依存やテストの質の問題を排除した信頼性の高い評価環境を提供するからだ。開発者や企業の AI 導入担当者は、自社のシステムにおけるコードリファクタリングタスクに対する現在の AI モデルの実力を、このベンチマークの結果を参照して客観的に判断すべきである。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見る関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み