動画記事 · AI Engineer
DeepSWE:汚染耐性を持つコーディングベンチマーク — James Shi, Datacurve
AI Engineer動画 18分 / 読む 6分
#LLM#ベンチマーク#コーディング#AI エージェント#データ汚染
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
30秒でわかる
Datacurve の James Shi が、既存ベンチマークの汚染問題を解決し、モデル性能を明確に区別できる「DeepSWE」の設計思想と主要な知見について解説する。
この動画の3ポイント
汚染耐性の確保
既存ベンチが公開された PR からタスクを抽出しているため汚染リスクが高いのに対し、DeepSWE は新規作成によりモデルによる不正解答を防ぐ。
モデル特性の可視化
Claude が環境調査に依存する傾向や GPT シリーズがプロンプトを厳密に遵守する傾向など、各モデル固有の行動パターンが明確に示された。
課題作成の手法
GitHub の人気リポジトリから選定した専門家エンジニアが、実務の文脈に合わせてゼロから課題を作成し、現実的な難易度を担保している。
なぜ重要か
DeepSWE の登場により、生成 AI エージェントの真の実力を評価する基準が再定義され、開発者や企業はより信頼性の高いモデル選定が可能になる。また、ベンチマーク設計における「汚染」への意識が高まり、将来の AI 評価指標の標準的なあり方に影響を与える可能性がある。
発言から確かめる
時間を選ぶと、元動画の該当箇所を開きます。
背景や実装の詳細まで読みますか?
約18分の動画を、約6分の記事で確認できます。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。