CyberFactory: 野外インスタンスによるサイバーセキュリティ能力の拡張
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
CyberFactory は、公開された脆弱性情報から実行可能なタスクインスタンスを生成し、エージェント型学習を通じてセキュリティ専門モデル「Aegis」を開発する統一オープンソースフレームワークである。
AI深層分析を開く2026年8月26日 19:40
AI深層分析
キーポイント
統合的なオープンソースフレームワークの提案
データ構築、軌道合成、モデル訓練を統合し、PoC 生成や脆弱性パッチ適用など多様なセキュリティタスクに対応する CyberFactory を紹介している。
実行可能で検証可能なタスクインスタンスの自動生成
自然界(wild)から収集した CVE などの公開脆弱性情報を、実行可能かつ検証可能なタスクインスタンスに変換する仕組みを実装している。
スキル誘導型エージェント学習の実現
再利用可能な脆弱性分析スキルを用いて教師モデルがドメイン知識に基づき問題を解決し、実行フィードバックに応じて解決策を修正するエージェント型監督学習を採用している。
高性能なセキュリティ専門モデル「Aegis」の公開
CyberGym ベンチマークで 1 時間予算下 Pass@1 52.4% を達成し、ベースモデルである Qwen~3.5 よりも 22.8 ポイント向上する性能を示した。
重要な引用
CyberFactory, a unified open-source framework that connects data construction, trajectory synthesis, and model training
The resulting supervision is agentic: the model interacts with tools and target environments and revises its solutions according to execution feedback.
Aegis reaches 52.4% Pass@1 under a one-hour budget, improving over its Qwen~3.5 base model by +22.8 points
編集コメントを表示
編集コメント
この研究は、単なるモデルの性能向上にとどまらず、セキュリティ分野における LLM のトレーニングパイプラインそのものを再構築する可能性を秘めている。特に、公開された脆弱性情報を実際の学習データとして即座に活用できる点は、実社会での脅威への対応速度を劇的に高める要素となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
コード能力の向上が続く中、大規模言語モデル(LLM)がサイバーセキュリティ分野でも大きな可能性を秘めていることが注目されています。クローズドソースの LLM(例:Mythos)はすでに高度なセキュリティ機能を提供していますが、既存のオープンソース取り組みには依然として限界があります。
まず、最先端のオープンウェイトモデルでは再現可能なサイバーセキュリティのトレーニングソリューションが提供されていません。また、既存のオープンソースによるトレーニング手法は単一のタスクに限定されており、スケーラブルなエージェント用データが不足しています。さらに、エージェントロールアウトを拡張するには強力なドメイン事前知識が必要です。
本研究では、PoC(概念実証)生成、脆弱性パッチ適用、サイバーセキュリティ質問応答(CyberQA)の各領域にまたがるデータ構築、軌道合成、モデル学習を統合するオープンソースフレームワーク「CyberFactory」を発表します。CyberFactory は、野外から収集された CVE などの公開脆弱性情報を、実行可能かつ検証可能なタスクインスタンスへと変換します。
さらに、再利用可能な脆弱性分析スキルを活用し、教師モデルがソースコードの検査を行い、ドメイン事前知識を用いて問題を解決し、証拠に基づく検証を行うプロセスを支援します。その結果得られる監督信号は「エージェント型」であり、モデルはツールや対象環境と相互作用しながら、実行フィードバックに基づいて自らの解決策を修正していきます。
これらの軌跡データを用いて、私たちはモデルを訓練し公開しました。ギリシャ神話において「アイギス」はゼウスとアテナの守護の盾を指す言葉ですが、この名前はモデルが防御的かつセキュリティ指向の目的を持っていることを象徴しています。
本モデルは、推論時にスキルを必要とせずに、スキルのガイド付き手順を内部に組み込みます。CyberGym における評価では、1 時間の予算制限下で Pass@1 が 52.4% に達しました。これは Qwen~3.5 ベースモデルと比較して +22.8 ポイントの向上であり、同じスキャフォールド(骨格構造)の下で評価された汎用バックボーンモデル群よりも優れた性能を示しています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み