Google、誤検知削減の AI エージェント型脆弱性スキャン「Mantis」を公開
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
InfoQ AI/ML
従来の AI スキャンが抱える偽陽性の多さと真陽性率の低さ(7%未満)を解決するため、Mantis は開発された。
AI深層分析を開く2026年9月6日 21:50
AI深層分析
キーポイント
誤検知と幻覚バグの解消
従来の AI スキャンが抱える偽陽性の多さと真陽性率の低さ(7%未満)を解決するため、Mantis は開発された。
文脈理解による効率化
リポジトリ履歴やアーキテクチャを分析し、階層ツリー形式で要約することでトークン使用量を85%削減しながら構造情報を保持する。
多様なエージェントの連携
クリティック(批判)やレビューア(審査)、ストラテジスト、リサーチエージェントが協調し、脆弱性の検証と優先順位付けを行う。
サンドボックスでの再現性
LLM の判断に依存せず、安全な環境で脆弱性を再現することで、発見された事象が実際の脆弱性であることを証明する。
タスクに応じたAIモデルの戦略的選択
高速化のためには、論理的深さを必要としない分類やクラスタリングには軽量な「flash」または「lite」モデルを、深い文脈理解やゼロショット問題解決が必要な再現や修正生成には強力なモデルを使用する。
重要な引用
While sloppiness in AI code scanning frequently leads to hallucinated bugs and weak true-positive rates under 7%, we designed Mantis to be effective by combining industry-standard agentic techniques like critic and review agents with sandboxed reproduction of vulnerabilities for grounding.
Mantis analyzes repository history, previous security fixes, architecture, and threat models rather than blindly scanning files using brute force.
To maximize the speed and efficiency of your automated pipeline, you should strategically pair the right AI model class with the specific task. You do not need to use the heaviest, most advanced frontier models for every stage.
However, Google emphasizes that the filter should be used cautiously: low-risk findings should not automatically be classified as false positives, as an overly broad negative filter could reduce the system's ability to detect genuine vulnerabilities.
編集コメントを表示
編集コメント
AI エージェント技術が単なるコード生成から、複雑なセキュリティ課題の解決へと進化していることを示す事例である。特に「幻覚バグ」への対抗策として実証環境での再現を重視するアプローチは、実務における信頼性確保の重要な指針となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Google は、ソフトウェアの脆弱性ライフサイクルを自動化する AI エージェントフレームワーク「Mantis」をオープンソース化しました。このツールは、脆弱性の特定と検証から、再現と修正までを一貫してサポートします。
従来の AI 搭載コードスキャナが抱えていた課題——偽陽性の多さや、存在しない脆弱性を検知するハルシネーション(幻覚)現象——を解決するために Mantis は開発されました。
AI を用いたコードスキャンでは、不十分な処理によって偽のバグが多数報告されたり、真の脆弱性を見逃すケースが多発したりしています。Mantis は、批判役やレビュー役のエージェントといった業界標準的な手法と、検証のためのサンドボックス環境での再現機能を組み合わせることで、これらの課題に対処し、効果的なスキャンを実現しました。
Google によると、Mantis は単にファイルを無差別に走査するのではなく、リポジトリの履歴、過去のセキュリティ修正履歴、アーキテクチャ、脅威モデルなどを分析します。その結果をディレクトリやリポジトリレベルのコンテキストを含む階層ツリーとして要約することで、重要な構造的情報を保持しつつ、トークン使用量を 85% 削減しています。
Mantis は、批判役やレビュー役のエージェントといった業界標準的な手法を用いて偽陽性をフィルタリングし、意味のある発見を優先します。また、サンドボックス環境で脆弱性の再現を行い、LLM の判断だけに頼らず、安全かつ制御された方法で「これが実際の脆弱性である」という証拠を提供します。
Mantis は、Google が機械の速度で脆弱性を発見・修正するための「社内アプローチ」の一部です。批判役やレビュー役のエージェントに加え、Mantis は戦略立案エージェントを活用してコードの高レベル構造、脅威モデル、依存関係グラフを評価します。また、内部コード検索機能を用いて生ソースファイルを深く調査し、データフロー、制御フロー、サニタイゼーションロジックを追跡するリサーチエージェントも備えています。
Mantis はモジュール型のスキルスイートとして構成されており、15 以上のツールを順次または並列で実行できます。具体的には mantis-summarize、mantis-review、mantis-critic などがあります。各ステージは、ディスク上に保存された共有状態を読み書きすることで相互に通信します。
Mantis は複数のモデルをサポートしており、フェーズごとに異なるモデルを組み合わせることも可能です。
自動化パイプラインの速度と効率を最大化するには、特定のタスクに適した AI モデルクラスを戦略的に選択してください。すべての段階で最も重く高度な最先端モデルを使用する必要はありません。
例えば、Google は、論理的な深みを必要としないタスクには「flash」や「lite」といった軽量モデルのバリアントの使用を推奨しています。具体的には、mantis-researcher を用いた高速な分類タスクや、mantis-dedupe による類似テキストパターンのクラスタリングなどが該当します。
より強力なモデルは、mantis-reproduce のように機能的なクラッシュ再現コードを生成するタスクや、mantis-patch で実装されたコードベースに対する副作用のない修正を自動生成するタスクなど、深い文脈理解とゼロショットでの問題解決能力が求められる作業に最適です。
すべての脆弱性スキャンシステムは、避けられない「フラストレーションを感じるほどの」数の偽陽性を生み出します。Mantis はこれに対処するため、mantis-review ステージを設け、ルールベースのネガティブフィルタを適用して疑わしい偽陽性を排除しています。ただし Google が強調するのは、このフィルタは慎重に使用する必要があるという点です。リスクの低い発見事項を自動的に偽陽性と分類すべきではなく、過度に広範なネガティブフィルタは、システムが真の脆弱性を検出する能力を低下させる恐れがあります。
Mantis は GitHub で公開されています。利用可能な各ステージの詳細、ステージ間の契約仕様、およびフレームワークのベストプラクティスについては、エージェント参照ガイド をご確認ください。
著者について
セルジオ・デ・シモーネ
セルジオ・デ・シモーネはソフトウェアエンジニアです。25 年以上にわたり、シーメンスや HP、そして小規模なスタートアップなど、多様なプロジェクトや企業で活躍してきました。特にここ 10 年以上は、モバイルプラットフォームおよび関連技術の開発に注力しています。現在は BigML, Inc. に所属し、iOS および macOS の開発を統括しています。
詳細を表示する | 非表示にする
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み