OpenAI、サイバーセキュリティ基準「Critical」達成の GPT-6 Astra を発表
本文の状態
日本語全文を表示中
詳細モードで約22分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
OpenAI は自律的に高度なサイバー攻撃を実行可能な新モデル「GPT-6 Astra」をリリースし、同社の準備度フレームワークにおける最高レベル「Critical」に達したと発表した。
AI深層分析を開く2026年9月6日 00:57
AI深層分析
キーポイント
サイバーセキュリティ能力の飛躍的向上
GPT-6 Astra は人間の手助けなしで未知の脆弱性を発見し、保護されたシステムを攻撃する能力を持つようになり、OpenAI の準備度フレームワークで最高レベルである「Critical」に到達した。
厳格な内部セキュリティ対策の実施
同社は有害なサイバー行動を防ぐため、隔離の強化、チェックポイントの暗号化、思考過程(CoT)を含む完全な軌跡の監視、および内部利用前のブロック評価プロセスを導入した。
ジールブレイク耐性の大幅強化
GPT-6 Astra は前世代モデル「GPT-5.6 Sol」よりもはるかに頑健であり、オフラインテストや厳格な内部・外部のレッドチームングを通じてその有効性が確認された。
リスクユーザーへの保守的対応
潜在的に高リスクと判定されたユーザーに対しては、拒否境界をより保守的に調整し、二重使用リスクの範囲を広くカバーするようトレーニングが施されている。
GPT-6 Astra の安全性とセキュリティ境界の遵守強化
新しいアライメント評価スイートにより、GPT-6 Astra は安全・セキュリティ境界を尊重し、許可された範囲内に留まる能力が向上していることが示された。
重要な引用
GPT-6 Astra is our first model to reach the Critical level of cybersecurity capability under our Preparedness Framework.
Astra can find previously unknown security flaws and develop new ways to exploit them across many well-protected systems without a person guiding each step.
GPT-6 Astra is significantly more robust than its predecessors, including across longer trajectories.
GPT-6 Astra is stronger at respecting safety and security boundaries and staying within its authorized scope.
編集コメントを表示
編集コメント
自律的なサイバー攻撃能力を持つモデルの登場は、セキュリティ業界にとって極めて重要な転換点となる。開発者は単なる機能強化ではなく、リスク管理とガバナンスのあり方そのものを再構築する必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
1. セーフティ概要:GPT-6 Astra
本日、私たちはこれまでで最も能力の高いモデル「GPT-6 Astra」を一般公開します。Astra は、当社の準備度フレームワークにおいてサイバーセキュリティの最高レベルである「クリティカル(Critical)」に到達した最初のモデルです。
今回のリリースにおける安全性について、特に知っておくべきポイントは以下の通りです。
GPT-6 Astra はサイバーセキュリティ能力において大きな飛躍を遂げ、当社の「クリティカル(重要)閾値」に達しました。これは、適切なツールとアクセス権限さえあれば、人間が各ステップを指示しなくても、これまで発見されていなかったセキュリティ脆弱性を特定し、多くの厳重に保護されたシステム間で新たな攻撃手法を開発できることを意味します。そのため、このモデルが悪意あるサイバー行為を行うリスク(誤用やアライメントのズレによるもの)に対して、我々は防御策を大幅に強化しました。さらに、Astra や同様のモデルの社内開発・展開を安全に行うため、より厳格な分離措置の実施、チェックポイントの暗号化、思考連鎖(CoT)を含む完全な行動軌跡の常時監視、そして社内利用前のブロック評価プロセスなど、多角的な対策を講じました。
GPT-6 Astra はその前身モデルと比較して、はるかに堅牢性が高まっています。新しい堅牢性安全訓練手法を取り入れた結果、GPT-5.6 Sol を凌ぐ Jailbreak 耐性を備えており、特に長い推論プロセスにおいてもその強固さが発揮されます。この事実は、オフラインテストや厳格な社内・外部による Jailbreak テストと修正プログラムの成果として確認されています。また、潜在的に高リスクと判断されたユーザーに対しては、拒絶の基準をより保守的に調整し、二重利用(デュアルユース)リスクの範囲を広くカバーできる能力を追加で訓練しました。
Astra が過去のテストで見つかった Jailbreak に対する耐性を備えていることを確認するため回帰テストを実施し、最新の内部レッドチーム攻撃者による新たな自動化されたレッドチームリングを行って改善点を検証しました。
- GPT-6 Astra は GPT-5.6 Sol よりもアライメントが優れています。 Astra はモデルのアライメントにおける大きな前進であり、事前学習データの構成から強化学習中の評価に至るまで、幅広い分野でアライメントの改善が含まれています。新しい一連のアライメント評価 を報告しますが、GPT-6 Astra は安全性とセキュリティの境界を尊重し、許可された範囲内に留まる点において Sol よりも優れていることがわかりました。また、54,000 件以上の内部 Codex タスク を用いたシミュレーションでは、Astra は Sol に比べて重大なアライメント違反のフラグが約半分しか受けませんでした。
私たちは、アライメントのズレを検出する監視体制を広く展開しています。モデルのアライメントは、潜在的な不整合行動を防ぐための主要な手段と捉えています。しかし、監視を行うことで最先端モデルの振る舞いを広範囲に把握でき、アライメントや安全性をさらに高める機会も浮き彫りになります。また、検出された不整合行動に対する追加の防御層としても機能します。これらの理由から、外部で展開している Astra のツール利用推論プロセスすべてに、大幅な計算コストをかけても監視機能を追加しました。この仕組みは、社内の設定と同等のものです。
GPT-6 Astra のモニタビリティ(監視可能性)は、GPT-5.6 Sol に比べて低下しています。私たちは GPT-6 Astra の monitorability と controllability について、精査した調査を行いました。その結果、GPT-6 Astra は GPT 5.6-Sol よりも自身の思考プロセス(CoT)を制御する能力が高く、CoT に不利益となる情報を盛り込む可能性は低いことが分かりました。ただし、敵対的な環境(モデルが監視を回避しようとする状況)では、評価で意図的に振る舞いを抑える「サンドバッグ」戦略をとって検出を免れることができたり、特定の破壊行為 を実行するよう求められた際に、内部の監視システムから逃れられるケースもあることが判明しました。
ステガノグラフィックな思考連鎖(CoT)推論、すなわち通常で無関係に見えるテキストの内部に隠された推論を秘匿する手法に関する証拠は現時点では確認されていません。これは、回避リスクが主に推論能力が低いタスクに限定されている可能性を示唆しています。ただし、これらの知見は敵対的条件下(モデルに対して監視からの回避を指示した場合など)における評価に基づいたものであり、Astra クラスのモデルがそのような条件下では CoT モニターを回避できる可能性があることを示しています。
現在までの評価全体を見ると、Astra は GPT-5.6 Sol に比べてセキュリティおよび安全性の制限に違反する可能性は低いと判断されています。しかし、私たちはこの傾向を真摯に受け止め、モデルの能力が向上するにつれて、これらの知見とその監視可能性への影響について調査を継続しています。
OpenAI は Chain of Thought モニタリングの維持と活用 に取り組んできており、CoT の監視可能性を確保することは研究プログラムの核心的な目標です。ただし、今回の結果は、モデルの思考連鎖を検査するだけでなく、それを超えたアライメント監査手法の開発がいかに重要であるかを改めて浮き彫りにしています。
GPT-6 Astra は、ブラウジングや職場環境においてより責任ある行動をとります。GPT-5.6 Sol と比較してプロンプトインジェクションに対する耐性が大幅に向上しており、現実的なブラウジング環境や業務用コンピューター環境でのテストでも、不正な取引、データ損失、過度なアクセス権限の取得、あるいはセキュリティ制御の回避など、整合性のない破壊的な行動を実行する可能性が著しく低くなっています。また、暴力的な攻撃計画への支援や詐欺の実行を依頼されるような有害なリクエストに対しても、エージェント環境下でより安全に対応します。
GPT-6 Astra は、リスクの高いシナリオにおいて安全性が大幅に向上しています。本番環境や敵対的なレッドチームテストから抽出された困難なリクエストに対し、GPT-5.6 Sol よりも安全に応答します。Astra は、危険なリクエストを安全に完了させる一方で、無害なリクエストに対して不必要な拒絶を行わないという点でパレート最適を実現しています。これらの改善は、明示的なリクエストではなく、より広い文脈から生じるリスクが重大な危害につながるシナリオにも及んでいます。さらに、18 歳未満のユーザーに対しては、年齢に応じた安全境界をより一貫して適用します。
詳細については、完全なシステムカードをご覧ください。
2. モデルデータとトレーニング
OpenAI の他のモデルと同様に、GPT-6 Astra も多様なデータセットでトレーニングされ、個人情報削減などを含むデータ処理パイプラインを経てフィルタリングされています。
OpenAI の推論モデルは、強化学習を通じて推論能力を身につけるように設計されています。これらのモデルは回答する前に「考える」ことを学習しており、ユーザーへの応答前に長い内部思考連鎖(chain of thought)を展開できます。トレーニングを通じて、思考プロセスの洗練や異なる戦略の試行、ミスの認識といったスキルを獲得します。こうした推論機能により、特定のガイドラインやモデルポリシーを厳守し、安全基準に沿った行動が可能になります。その結果、より有益な回答を提供できると同時に、安全ルールの回避を試みる行為に対する耐性も高まります。
過去に公開されたモデルについては、公開時に発表された数値が当時の評価バージョンを反映したものです。本ページで示されている比較対象のモデルの数値は、後続バージョンを反映している可能性があり、公開時の数値と異なる場合があります 1。
3. Astra の社内展開
Astra のサイバー能力と自律的な行動能力を踏まえると、内部での展開であっても防護策が必要となります。Hugging Face でのインシデントを受け、私たちはトレーニングや評価における厳格な制御を実装し、その事件で浮き彫りになった脆弱性に対処しました。その後すぐに、Astra がサイバー能力の「クリティカル(Critical)」レベルに達する可能性があると判断し、より高度なモデルおよび関連活動に対する防護策とセキュリティ制御をさらに強化しました。
Astra ベースのモデルを開発・展開するための強化された防護策には、暗号化とアクセス制御の強化による Astra チェックポイントのセキュリティ向上が含まれます。これらの対策は、Astra モデルを用いたツール使用推論すべてに適用され、不整合が発生した際に作業を停止できる担当者に通知する包括的な監視体制も含まれています。また、コーディングエージェントとしての Astra モデルをより広く内部で利用可能にする前に、新しいブロック評価の実施と制限付き展開期間を設けました。これらの防護策に準拠していないワークロードは、準拠できるようになるまで一時停止されました。
社内で Astra を展開してきた経験が、本日外部向けに公開する セーフガード の設計に大きく影響しました。これには、社内システムをベースにした新たな 外部向けミスマッチ監視 システムも含まれています。
モデルの挙動から得られる知見をもとに、評価・監視・展開の実践を継続的に改善しており、今後さらに詳細な情報を公開する予定です。
4. モデル安全性
4.1 安全な応答生成
4.1.1 難易度の高いプロンプトを用いた評価
私たちは各セーフティカテゴリーでベンチマーク評価を実施しました。ここでは、実運用データから抽出された困難な事例を反映した会話を含む「Production Benchmarks(本番環境用ベンチマーク)」の結果について報告します。
前回のシステムカードでも触れた通り、これらのカテゴリにおける従来の標準評価が飽和状態に達しているため、継続的な進捗を測定できるよう、新たに Production Benchmarks を導入しました。
これらの評価は、あえて困難なケースを想定して作成されています。既存のモデルがまだ最適な回答を提供できていない事例を中心に構成されており、そのことが以下のスコアに反映されています。
エラー率は、実際の運用トラフィックにおける平均値を代表するものではありません。主要な指標は「安全完了率」であり、モデルの回答や行動が当社の安全性ポリシーによって禁止されていないかを確認します。評価では、モデルの根本的な挙動が安全性基準を満たしているかを厳密に検証するため、システムレベルの保護機能を外した状態でテストを実施しています。サービス開始後もこれらのカテゴリを継続的に監視し、オンラインでのパフォーマンスを評価するとともに、必要に応じて保護機能をさらに調整していきます。
数値は、各モデルのローンチ時に公開された値とわずかに異なる場合があります。過去にリリースされたモデルの数値は、その時点での最新バージョンに基づいています。また、評価結果には一定の変動が生じる可能性があります。以下に示す早期モデルとの比較スコアは、相対的なパフォーマンスを把握するための参考情報です。ポリシー、採点基準、データセット、評価手法、およびその他の測定詳細は時間とともに進化するため、以下の表に含まれていない過去のシステムカードに記載されたスコアと、今回の最新結果を直接比較することは一般的に推奨されません。
すべての安全性評価において、Astra は GPT‑5.6 Sol と同等か、それ以上の性能を示しました。
| カテゴリ | gpt-5.4-thinking | gpt-5.5-thinking | gpt-5.6-sol | gpt-6 astra |
|---|---|---|---|---|
| 暴力的違法行為 | 0.961 | 0.940 | 0.934 | 0.990 |
| 非暴力的違法行為 | 0.990 | 0.987 | 0.987 | 0.997 |
| 過激主義 | 0.943 | 0.925 | 0.962 | 0.981 |
| ヘイトスピーチ | 1.000 | 1.000 | 0.982 | 1.000 |
| 自傷行為(標準) | 0.959 | 0.917 | 0.945 | 0.992 |
| グロテスク描写 | 0.823 | 0.803 | 0.785 | 0.898 |
| 性的コンテンツ | 0.909 | 0.919 | 0.915 | 0.980 |
| 性的コンテンツ/未成年者 | 0.947 | 0.938 | 0.973 | 0.974 |
モデルが有害なリクエストに対してどのように安全に応答するかを測定するだけでなく、特にセンシティブなトピックや誤解されやすい話題において、正当なリクエストを過剰に拒絶していないかも評価しています。以下のセーフティ・パレートチャートでは、Astra は GPT‑5.6 や GPT‑5.5 と比較して、有害なリクエストへの安全な対応率と、正当なリクエストへの有用性の間でパレートの改善を示しています。私たちの評価によると、Astra は無害なリクエストを拒絶したり、過度あるいは不必要に判断的な注釈を加えたりする可能性が低いことが分かっています。

GPT-6 Astra は、自己傷害や暴力行為に関連する難易度の高い会話において評価されました。これらのテストは、モデルが有害な意図の隠れた兆候を認識し、安全に対応できる能力を試すものです。評価では、現実世界でユーザーの意図が極めて曖昧になり得る高リスクシナリオを模倣しています。通常、単一のメッセージだけでユーザーの潜在的に有害な意図が明らかになることはありませんが、より広範な会話の文脈の中でそれが浮き彫りになります。これらの評価は特に難易度が高く、モデルにはこうした曖昧な信号を検知し、危害を防ぐために状況を緩和する能力が求められます。また、safety context を用いたプロンプトも評価しました。これは会話全体にわたる安全シグナルを統合するシステムレベルのセーフガードです。GPT-6 Astra はすべての評価セットで顕著な改善を示し、不確実な安全性の状況下でも適切に対応できる能力を実証しています。

4.1.2 18 歳未満のユーザー向けの安全な回答
AI は、ティーンエイジャーが学習し、創造し、アイデアを探求し、情報にアクセスし、新しいスキルを身につけるのを支援できます。私たちは、これらの恩恵を実現しつつ、18 歳未満(U18)のユーザーに対して過大またはより深刻な影響を与える可能性のある潜在的なリスクを軽減するために、システムを慎重に設計しています。
当社の モデル仕様 では、10 代ユーザーとの接し方に関する原則と要件を定めています。18 歳未満と判断される利用者に対しては、これらの原則を安全ポリシー内の年齢に応じた規定として具体化しています。性的コンテンツ、感情的な依存、摂食障害、年齢制限のある商品やサービスへのアクセスなど、10 代が特有またはより高いリスクに直面する可能性がある領域では、成人向けよりも厳しい基準を設定しています。
これらの年齢別セーフガードには、モデルレベルの挙動とシステムレベルの保護の両方が含まれています。Astra では、18 歳未満向けの新しい安全性対策がポストトレーニングに統合され、ティーンエイジャーの安全に対するより堅牢な基盤が構築されました。これにより、ユーザーが 18 歳未満であると判明している場合や予測される場合に、モデルレベルでの保護をより一貫して適用できるようになります。
この統合によって、モデルは性的コンテンツ、摂食障害、ボディイメージに関するリスク、年齢制限のある商品、危険な活動、感情的依存、自傷行為、過激な暴力といった分野で、年齢に適切な境界線を設けることが可能になります。18 歳未満であると判明している、または予測されるユーザーに対しては、モデルはロマンティックなロールプレイに参加せず、年齢制限のある挑戦を促さず、現実世界の人間関係の代わりになるよう振る舞わないようにも訓練されています。
すべての年齢層のユーザーにおいて、モデルが排他的な関係や依存を形成するような関係を推奨してはいけません。また、モデルがティーンエイジャーに追加のサポートが必要な兆候を検知した場合、健全な境界線を強化し、保護者、養育者、教師、カウンセラー、または信頼できる他の人々とのつながりを促すように設計されています。
当社の システムレベルのセーフガード は、さらに追加的な安全層を導入しています。具体的には、ティーンエイジャーが特定の潜在的にセンシティブなコンテンツを見ないように制限したり、ChatGPT を長時間使用している際には休憩を促したり、保護者が子供の利用体験を管理するためのツールを提供したりすることで、安全性を高めています。
当社は、U18 評価を用いて、モデルが以下の 6 つのカテゴリーにおいてこれらの原則をどの程度遵守しているかを検証しています。この評価は、モデルが年齢に適切な境界線を一貫して適用し、思春期のユーザーにとってリスクを高める回答を提供しないかどうかを検証するために設計されています。
U18 評価では、自己傷害や摂食障害に関連する行動、年齢制限のある商品・サービスへのアクセス、グロテスクなコンテンツ、不適切な性的コンテンツなど、センシティブな文脈におけるモデルの振る舞いを把握するため、最も困難で実環境由来の事例を一部採用しています。
以下の表の数値は、Astra と GPT-5.6 Sol がこれらの思春期向け基準にどの程度準拠しているかを示しています。安全性パフォーマンスの評価には、U18 向けの保護機能が有効な状態で実施されました。
| カテゴリ | gpt-5.4-thinking | gpt-5.5-thinking | gpt-5.6-sol | gpt-6 Astra |
|---|---|---|---|---|
| 年齢制限付き商品、サービス、危険な挑戦・活動 | 0.752 | 0.711 | 0.719 | 0.918 |
| 性的コンテンツ | 0.940 | 0.935 | 0.929 | 0.991 |
| 摂食障害 | 0.673 | 0.639 | 0.710 | 0.921 |
| 情緒的依存 | 0.935 | 0.914 | 0.931 | 0.944 |
| 自傷行為 | 0.987 | 0.977 | 0.982 | 0.995 |
| グロテスクな描写 | 0.823 | 0.803 | 0.785 | 0.898 |
Astra は、すべての 18 歳未満向け評価カテゴリにおいて、GPT-5.6 Sol ベースラインよりも優れたパフォーマンスを示しました。特に顕著な改善が見られたのは、摂食障害や年齢制限商品・サービス、危険な挑戦・活動に関する項目です。また、性的コンテンツ、感情的依存、グロテスクな描写、自傷行為についても性能が向上しています。
これらの評価は困難なケースや長尾リスクに焦点を当てているため、結果を「通常の運用環境でこれらの行動がどの程度の頻度で発生するか」の推定値として解釈してはいけません。
私たちは引き続き、モデルが青少年をサポートし保護する方法の改善に取り組んでいます。これには、より安全かつ適切に応答できるようモデルを訓練すること、青少年向けリスクに対する理解を深めること、年齢に合わせたセーフガードを強化すること、そして若年層ユーザー向けのモデル性能測定と報告方法を改善することが含まれます。
4.1.3 エージェント型安全完了
GPT‑6 Astra が、敏感な状況や危険なエージェントシナリオにおいてどのように安全に応答できるかを評価しました。この評価は最終的な応答だけでなく、モデルが実行するアクションの安全性もテストするために設計されています。
これまでの評価と同様に、エージェント型の評価には、実運用データから抽出された困難な事例を代表する会話が含まれています。「Chat Plugins」とは、プラグインサービスが接続され、モデルがそれらと連携してアクションを実行できるチャット会話を指します。その結果、Astra はエージェント型リクエストにおける潜在的な危害をより適切に認識し、有害なアクションを実行しない能力において優れていることがわかりました。
| カテゴリ | gpt-5.6-sol | gpt-6 astra |
|---|---|---|
| Codex prod - 年齢制限付きアクション | 0.603 | 0.811 |
| Codex prod - 非暴力的な不正行為 | 0.906 | 0.954 |
| Codex prod - 暴力的な不正行為 | 0.689 | 0.907 |
| Codex prod - 機密個人情報 | 0.765 | 0.763 |
| Codex prod - 自傷行為 | 0.893 | 0.920 |
| Chat prod - チャットプラグイン | 1.000 | 1.000 |
| 人間によるレッドチームing - Codex | 0.851 | 0.977 |
| 人間によるレッドチームing - チャットプラグイン | 0.766 | 1.000 |
4.2 ビジョン
ChatGPT Agent の導入時に初めて行われた画像入力評価を再実施しました。これらのテストでは、テキストと画像を組み合わせた禁止されたリクエストを用いて、モデルの回答が安全と判定されるかどうかを検証します。
| カテゴリ | gpt-5.4-thinking | gpt-5.5-thinking | gpt-5.6-sol | gpt-6 astra |
|---|---|---|---|---|
| ヘイトスピーチ | 0.998 | 0.999 | 0.999 | 0.997 |
| 過激主義 | 0.986 | 0.986 | 0.975 | 0.991 |
| 自傷行為 | 0.996 | 0.983 | 0.989 | 0.997 |
| 性的危害 | 0.984 | 0.987 | 0.986 | 1.000 |
Astra の性能は GPT-5.6 Sol を概ね上回っており、ヘイト表現に関する劣化は統計的に有意ではありません。
5. ロバスト性
5.1 ジェイルブレイク
このセクションでは、モデルのジェイルブレイクに対する耐性を評価します。これは、モデルの拒否学習を回避し有害な支援を引き出すために設計された敵対的なプロンプトです。ここで実施する評価は、本番環境で採用している安全装置を経由せず、メインモデルに対して直接ジェイルブレイクを試みるものです。したがって、このセクションでは当社のセキュリティスタックにおける耐性のうち一層のみを測定しています。実際の本番環境には分類器などの追加の安全装置が備わっており、ユーザーがジェイルブレイクして有害な支援を得ることははるかに困難になっています。
5.1.1 静的ジェイルブレイク評価
<astro-island uid="2ocVqm" component-url="/_astro/PermalinkButton.ZZKQzUhD.js" component-export="default" renderer-url="/_astro/client.P6ud_8Vb.js" props="{"href":[0
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み