動画記事 · AI Engineer
SWE-Marathon:数十億トークン規模でコーディングエージェントを評価
AI Engineer動画 13分 / 読む 7分
#SWE-Marathon#AI エージェント#ベンチマーク#LLM#コーディングエージェント
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
30秒でわかる
数十億トークン規模のコーディングエージェント評価ベンチマーク「SWE-Marathon」が、単なるバグ修正からプロジェクト全体所有への移行における限界と、堅牢な検証の重要性を明らかにした。
この動画の3ポイント
プロジェクト規模評価への移行
SWE-Marathon は、単一バグ修正から Slack クローンやコンパイラ作成など数時間〜数日の長期プロジェクト所有タスクへ焦点を移した。
検証の難しさと多層防御
長時間実行では検証プロセス自体が攻撃対象となるため、UI 操作エージェントや隠しテストを組み合わせた多層検証システムが必要不可欠である。
現状のエージェント性能限界
最良の構成(Claude Opus 4.8)でも解決率は 26% に留まり、数十億トークン規模での完全なプロジェクト所有は未だ実現されていない。
なぜ重要か
この研究は、AI エージェントの評価基準を「コード生成の正しさ」から「複雑な環境下での自律的な工程完了」へと転換させる重要なマイルストーンとなります。特に、長時間実行における検証プロセスの脆弱性と、それに対抗するための多層防御型アーキテクチャの必要性を示すことで、次世代の開発者ツールや AI インフラ設計に大きな指針を与えます。
発言から確かめる
時間を選ぶと、元動画の該当箇所を開きます。
背景や実装の詳細まで読みますか?
約13分の動画を、約7分の記事で確認できます。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。