Vercel Blogコミュニティ·2026年7月27日 13:00·約9分
DeepsecBench:モデルのサイバー脆弱性発見性能を評価
30秒でわかる
Vercel は、アプリケーションコード内のセキュリティ脆弱性を発見する能力を評価するためのベンチマーク「DeepsecBench」を発表し、複数のモデルの性能スコアとコスト効率を比較した結果を開示した。
記事の3ポイント
新ベンチマーク DeepsecBench の公開
Vercel はアプリケーションコード内の脆弱性発見能力を評価する「DeepsecBench」をリリースし、リコール、精度、コスト、所要時間を測定した。
モデル性能の比較とランキング
GPT-5.6 Sol が最高スコアを獲得したが、Kimi K3 や Grok 4.5 など他のモデルも高い効率性を示し、コストパフォーマンスの多様性が確認された。
評価手法とセキュリティ対策
231 の人間が判定した脆弱性セットを用いてリコールを重視した F2 スコアを算出し、モデルが学習データに依存しないようベンチマークの構成情報を非公開とした。
なぜ重要か・誰に関係するか
この発表が重要なのは、AI モデルの実用的なセキュリティ評価基準を確立し、企業が高コストを避けて効果的な脆弱性発見ツールを選定できる道筋を示したからだ。開発者や企業の AI 導入担当者は、自社のコードベースの複雑さと予算に合わせて最適なモデルミックスを選択し、攻撃者が侵入する前に内部から防御体制を強化すべきである。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
この記事をシェア
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み