動画記事 · AI Engineer
DeepSWE:汚染耐性を持つコーディングベンチマーク — James Shi, Datacurve
AI Engineer動画 18分 / 読む 6分
#LLM#AI エージェント#コーディングベンチマーク#汚染耐性#データ品質
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
30秒でわかる
Datacurve が公開した DeepSWE は、汚染耐性と実世界適合性を高めたコーディングベンチであり、モデルの真の実力を測る新たな基準となる。
この動画の3ポイント
- 01
汚染耐性の確保
既存ベンチとの決定的な違いとして、公開された PR からスクレイピングせず、100 以上の異なるリポジトリから 113 のオリジナルタスクをゼロベースで構築し、モデルによる不正や学習済みデータへの汚染を防止しています。
- 02
モデル特性の分析
Claude は環境調査に熱心だが多段指示で欠落が見られ、GPT-5 は指示を厳密に遵守し、強力なモデルほど自らテストを書く傾向があるなど、各モデルの行動特性が詳細に分析されています。
- 03
プロンプト設計の革新
従来の 4,500 文字を超える詳細指示ではなく、実務の新人エンジニアへの依頼のように高レベルな目標のみを提示するプロンプトを採用し、モデルの推論能力と自己解決能力を試す設計となっています。
なぜ重要か
DeepSWE の導入により、AI エージェント開発における評価基準が「データ汚染されたタスク」から「実世界に近い公平な課題」へとシフトし、モデル間の性能差を明確に識別できるようになります。これにより、企業はより信頼性の高い AI ツールを選定でき、開発者体験やセキュリティガバナンスの向上に寄与します。
背景や実装の詳細まで読みますか?
約18分の動画を、約6分の記事で確認できます。
Original Source
元動画で発言を確認

プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。