OpenAI、新モデル「GPT-6 Astra」発表し AGI 時代到来と主張
本文の状態
日本語全文を表示中
詳細モードで約24分の本文を読めます。
OpenAI は AGI の到来を宣言し、マウスやキーボードを使わずにソフトウェア操作を行う新モデル「GPT-6 Astra」を発表した。
AI深層分析を開く2026年9月4日 03:56
AI深層分析
キーポイント
AGI 時代の宣言と新モデル発表
OpenAI は GPT-6 Astra のリリースにより、人間を凌駕する自律システムの AGI 時代が到来したと公式に発表した。
コンピュータ操作型 AI の実現
Astra は API 統合を必要とせず、ブラウザやスプレッドシートなどを人間同様に操作して文書作成やワークフロー実行を行う。
音声による多段階タスク処理
同社は音声入力だけで円を描画し、ロケットに変換し、3D ゲームを作成するデモを公開した。
企業向け展開と利用範囲
Astra はまず OpenAI のデーブレイクプログラムを通じて企業顧客に提供され、その後一般プランやクラウドプラットフォームでも利用可能になる。
API 統合の不要化と人間インターフェースの利用
Brockman は、コンピュータ操作エージェントが API やプラグインを介さず、人間が使用する画面やキーボードといった既存のインターフェースを通じて作業を実行できると主張した。これにより、ツール間の接続構築というボトルネックを回避し、スプレッドシートの処理やフォーム入力、ウェブナビゲーションを高速化できる。
重要な引用
Welcome to the AGI era.
the world's best computer use model
highly autonomous systems that outperform humans at most economically valuable work
"We've been bottlenecked over this gigantic era by people writing connectors and very painstakingly building these connections into all these tools that people can already use," Brockman said.
編集コメントを表示
編集コメント
OpenAI が「AGI 時代」という言葉を用いたことは、同社の技術的自信と市場への強いメッセージを反映している。API 依存からの脱却は開発フローの根本的な変化をもたらす可能性があり、今後の実装事例に注目が必要だ。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
噂はすべて事実だった。いや、それ以上に。OpenAI は本日、GPT-6 Astra をリリースした。同社はこの新 Frontier モデルが、人工一般知能(AGI)の幕開けを告げるものだと主張している。AGI とは「経済的に価値のある仕事のほとんどで人間を上回る、高度に自律的なシステム」を目指す、長年の目標だ。
本日行われたクローズドな記者説明会で、OpenAI の共同創設者兼プレジデントであるグレッグ・ブロックマン氏は、このメッセージを非常に直接的に表現した。セッションの最後にはこう語っている。「ようこそ、AGI 時代へ」
これは Frontier AI の発表としては異例ともいえる重要な枠組みだ。しかし企業にとって、Astra のより即時的な意義は、もっと具体的なものであるかもしれない。OpenAI は GPT-6 Astra を、「ユーザー(従業員を含む)がマウスをクリックしたりキーボードを打ったりする必要がなくなる(望まない限り)」という計算の新たな時代として位置づけている。
ベントチャービートに事前提供された OpenAI の発表資料では、Astra は「世界最高のコンピュータ操作モデル」と呼ばれている。
開発者が AI システムが必要とするすべてのアプリケーションに対して個別に API 統合を構築する必要はなく、Astra は人間がソフトウェアを操作するようにナビゲーションするよう設計されている。ブラウザ、スプレッドシート、ウェブサイト、デスクトップアプリを横断して動作し、完成したドキュメントやプレゼンテーションを作成し、単にユーザーに手順を教えるのではなく、多段階のワークフローを実行するのだ。
実際、OpenAI は GPT-6 Astra のプロモーションビデオを公開しました。この動画は 1980 年代の AI デモから始まります。画面では「黄色い円を描いて」という指示に対し、コンピュータが即座にシンプルな円を描き出します。その後、映像は現代へと切り替わり、OpenAI の従業員たちが Astra と音声で対話する様子が映し出されます。「黄色い円をロケットに変えて」「さらに数分で 3D ゲームを作成して」といった指示を口頭で行うと、Astra は瞬く間に実行。最後に eBay への出品リスト作成まで、すべて音声入力だけで完結させます。
Astra は木曜日より、OpenAI のゲートドアクセスプログラム「Daybreak」を通じて企業顧客向けに段階的なロールアウトを開始します。今後数日以内に、ChatGPT Plus、Pro、Business、Enterprise プランのユーザーや、AWS Bedrock や Microsoft Azure といったクラウドプラットフォームを経由する OpenAI API ユーザーにも提供される予定です。
質問への回答からコンピュータ操作へ
Astra の企業導入における最大の強みは、コンピュータ操作能力にあります。
OpenAI によると、このモデルはオンラインフォームの入力、CRM レコードの更新、カレンダーの整理、ウェブリサーチの実行、そしてその結果を文書やメールとしてドラフト作成まで行うことが可能です。スプレッドシートの編集、Python ノートブックでの科学データ分析、Power BI の操作、ウェブサイトの新規作成とテスト、KiCad や FreeCAD といったエンジニアリングアプリケーションの利用、ソフトウェアのインストールとトラブルシューティングもこなします。
これらの機能は、企業における AI アーキテクチャに大きな変化をもたらす可能性を示唆しています。
生成 AI のブームが長く続いた間、企業は API やプラグイン、検索システム、専用ツールを通じてモデルを自社のシステムに接続する必要がありました。しかし、Brockman は、コンピュータ操作を行うエージェントなら、すでに人間ユーザー向けに設計されたインターフェースが存在する以上、こうした統合作業の一部をバイパスできると主張しています。
「これまで私たちは、人々が既に使えるあらゆるツールに、手作業でコネクタを書き、慎重に接続を構築するという巨大なボトルネックに直面してきました」と Brockman は語ります。
十分な能力を持つコンピュータ操作が可能になれば、エージェントは代わりに「スプレッドシートを素早く通り抜け、フォームに入力し、ウェブページ間を移動する」ことが可能になります。
このアイデアは OpenAI の設立初期まで遡ると Brockman は説明します。当時、研究者たちは人間がコンピュータを使う際にアクセスできる基本的な入出力、つまりピクセル、キーボード、マウスを中心にエージェントを訓練することについて議論していました。
「私たちは、実際にそのように機能し、極めて有用であると感じられる最初のエージェントを実現したと実感しています」と彼は述べています。
OpenAI の報告によると、OSWorld 2.0 のオフラインサブセットにおいて、Astra はタスクあたり約 40 分で 72.6% のスコアを記録しました。一方、GPT-5.6 Sol は同 65.7% で、所要時間は約 75 分でした。つまり、Astra はタスクあたりの時間を約 47% 短縮したことになります。
同社はまた、3D ゲームの作成から法的契約書の準備まで多様なタスクをこなす一方で、並行して無関係なリクエストにも対応する Astra のデモンストレーションを行いました。より広い文脈でのメッセージは、このモデルが「人間が次々と指示を出す」という従来のチャットボットの枠組みを超えていくことを意図している点にあります。
"Astra により、ユーザーはかつて想像もできなかったような驚異的な能力を手にし、つい一年前までは遠い未来の話だったことが可能になります。その能力を活かすことで、私たちは人々がより複雑な作業をアプリケーション間で委譲し、人間側がより高次なレベルで全体を指揮するようになることを期待しています"と、OpenAI の研究者であるミア・グレイス氏は説明会で語りました。
この「AI への指示出し」から「AI の監督へ」というシフトは、学術的なベンチマークでの数値向上よりも、企業にとって本質的に重要になる可能性があります。
OpenAI は、Astra が同社史上最大のトレーニング飛躍であると述べています
説明会で Astra の開発について語った OpenAI 研究者のアイドン・クラーク氏は、これを同社が実施した最大規模のトレーニングランと表現しました。
クラーク氏によると、Astra は同社の Stargate インフラ上で 10 万 DBU を超える計算資源を用いて事前学習された初のモデルであり、かつ過去のモデルが次のモデルの訓練を監督する役割を果たした最初のケースでもあります。
"事前学習中に監視している評価結果に基づけば、Sol から Astra への飛躍は、以前のモデルから Sol へ移行した際に見られた能力向上よりもさらに大きなものだと考えています"とクラーク氏は述べています。
OpenAI は、Astra の能力が大規模な事前学習と、情報を結びつけながらより長いタスクを実行できるように教えるための強化学習の組み合わせによるものだと説明しています。
その結果得られたベンチマークの数値は目を見張るほどです。
OpenAI によると、Astra は FrontierMath Tier 4 v2 で 97.6%、DeepSWE v1.1 で 74.1%、BenchCAD で 95.9%、GPQA Diamond で 96%、ExploitBench では 100% のスコアを記録しました。また、ARC-AGI-3 でも 98.6% のスコアを獲得しています。
しかし、最後の数値には重要な注釈がついており、業界がモデルの知能について語る際に生じている問題の拡大を示唆しています。
Astra が ARC-AGI-3 で 98.6% を達成したとして、それが AGI(汎用人工知能)と言えるのでしょうか?
ARC-AGI は、AI システムが訓練によって獲得した能力を再現するのではなく、未知の問題に一般化して対応できるかを測定しようとする試みの中で、最も注目されているものの一つとなっています。
現在の ARC-AGI-3 リーダーボードでは、従来のフロンティアモデルのランニング結果は、OpenAI が報告している Astra の 98.6% という結果と比べて劇的に低い位置にあります。
しかし、この比較は単純ではありません。
OpenAI 自身の評価ノートには、Astra が同社の Responses API ハーネスを使用している一方で、比較対象のモデルは異なる設定で動作していると記載されています。
この区別が重要なのは、別の最近の ARC-AGI-3 の結果が、モデルそのものよりも周囲のシステムによってパフォーマンスにどれほどの差が生じるかを如実に示したからです。
8 月、NVIDIA は「Agentic Variation Operators(AVO)」アーキテクチャが、ARC-AGI-3 パブリックセットの全 25 エンバイアメントと 183 レベルで 100% のスコアを達成したと発表しました。しかし、NVIDIA が突然 100% に到達する基盤モデルを開発したわけではありません。AVO は Claude Opus 5 を活用しており、NVIDIA によると、そのベースとなるモデルの初期性能は約 30% 程度でした。
AVO は、永続的なメモリ、ツール、フィードバック、回復機能などのメカニズムを追加することで、エージェントが長時間実行されるタスクにおいて進捗を維持できるようにしています。これにより、各インタラクションを孤立した出来事として扱うのではなく、継続的な作業として扱えるようになります。
NVIDIA の結論は明確でした。長期にわたる能力(ロング・ホライズン・キャパビリティ)は、基盤モデル単体ではなく、エージェントシステム全体から生まれるものだとしました。
この議論はすでに AI コミュニティへと広がりを見せています。ある r/singularity のユーザーは、ARC-AGI-3 がアクション間での文脈保持に制限を設けているため、このベンチマークが実際の運用環境で動作するエージェントの姿を正しく反映していないと主張しました。これは、人間に対して学習した内容を繰り返し消去しながらテストを行うようなものだと例えています。
一方、反対意見も根強くあります。複雑なハネス(枠組み)を追加することは、基盤モデル自体が実際に汎化しているかどうかを判断しにくくするとの指摘です。NVIDIA の結果に対するあるコメントでは、「これが真の能力の一般化なのか、それともこの特定のベンチマークに対して過学習しただけなのか、見てみましょう」という言葉が寄せられました。
こうした対立は、AGI に関する主張においてますます重要になっている問いを浮き彫りにしています。つまり、実際に測定されている対象とは何なのか、という点です。
基盤モデルなのか、永続的メモリを備えたモデルなのか、コンピュータやブラウザ、ツールを活用できるシステムなのか、それとも完全に展開された全体像なのか。
企業にとって、最終的には運用上の区別は重要でなくなる可能性があります。企業が購入するのはベンチマークの純粋性ではなく、システムの成果です。エージェントが確実に会計を照合し、インシデントを調査し、本番環境のコードベースを変更し、財務モデルを組み立てられるのであれば、その能力が主にニューラルネットワークの重みから来るのか、メモリアーキテクチャに由来するのか、それともツールの調整によるものなのかは、コストや信頼性、監査可能性よりも重要ではなくなるでしょう。
そして OpenAI は、この主張をますます積極的に展開するようになっています。
「誰もが AGI に対する異なる定義を持っています」と Brockman 氏は語りました。「OpenAI を設立した当初、私たちは皆が認める明確な瞬間が訪れると考えていました。『これが AGI だ』と。しかし、実際はそうなりませんでした。それはもっと曖昧で、境界線がぼんやりとしたものです。」
しかし、Astra 自体がこれに該当するかどうかを問われた際、Brockman 氏はさらに踏み込んで答えました。
「私個人としては、私たちはすでにそこにいると思います」と彼は言いました。「それを支持する十分な根拠があると考えています。」
その後、OpenAI の立場を最も明確に表現した言葉も語りました。「今や AGI の時代に入ったと感じることは、決して不合理ではないと思います。」
GDPval は不要?
OpenAI が Astra の発表資料から意図的に除外した重要な要素の一つに、同社が独自に開発したベンチマーク「GDPval」があります。これは経済的価値のある実世界の業務におけるパフォーマンスを測定するために設計された指標です。OpenAI は 2025 年、学術的なテストやコーディングのベンチマークを超えた評価体系として GDPval を導入しました。このベンチマークでは、米国の主要な 9 つ産業にまたがる 44 の知識労働職種から選ばれた 1,320 のタスクを対象にモデルを評価しています。
対象となるタスクには、法的文書の作成、設計図の策定、スプレッドシートの管理、プレゼン資料の作成、カスタマーサポート業務、看護計画の立案など、企業が実際に直面するワークフローと密接に関連する成果物が含まれています。OpenAI は現在、Astra がこれらの業務を自動化するために設計されたものであると明言しています。
このため、Astra の発表が「AGI(汎用人工知能)時代」への移行を強調している文脈において、GDPval が欠如している点は際立っています。元々 OpenAI は、GDPval を AGI や経済的影響に関する議論を空想ではなく、実際の職場でのパフォーマンスに基づいて行えるようにするための手段として位置付けていました。同社の公式説明によれば、このベンチマークは AI システムが「経済的価値のある実世界のタスク」でどの程度機能するかを追跡し、モデルが日常業務において専門家をサポートする能力をより明確に示すために作られました。
つまり、Astra の真の意義が「企業がこれまで以上に多くの業務を AI に委ねられるようになったこと」にあるのであれば、GDPval はその主張を実証するための OpenAI 内部で最も直接的な指標の一つであるはずです。
この除外はアストラの他の結果を無効にするものではありませんが、分析上の空白を残すことになります。OpenAI の ARC-AGI-3 における 98.6% というスコアは、対話的な推論と適応能力を示しています。一方、DeepSWE や Agents' Last Exam といったベンチマークは、ソフトウェアエンジニアリングや専門的な業務フローにおける特定の性能を捉えるものです。
これに対し GDPval は、より広範な経済的問いかけを意図して設計されました。「モデルが、幅広い職業分野にわたって経験豊富な専門家と同等の成果物を生み出せるか」という問いです。OpenAI の過去の結果では、一部のタスクにおいて最先端システムが専門家レベルの品質に近づいており、GPT-4o から GPT-5 にかけて大幅な進歩が見られました。
また、GDPval には重要な限界があり、それが OpenAI がこれを前面に出さなかった理由の一つかもしれません。現在のバージョンはワンショット(単発)評価であり、アストラが得意とするはずの長期的で対話的かつ複数のアプリケーションを跨ぐ作業を測定していません。OpenAI 自身も、今後のバージョンでは反復的なワークフローや文脈の豊かさ、曖昧さへの対応を追加すべきだと述べています。つまり、GDPval はアストラの企業向けストーリーには極めて関連性が高い一方で、その最もエージェンシー(自律的)な能力とはややズレがあると言えるでしょう。
それでも、ブロックマン氏が「AGI 時代」という文脈を提示している以上、「見落としている数値」に注意を払う必要があります。もし AGI の実用性が、多くの職業で経済的に意味のある作業を AI が行えるかどうかにかかっているなら、GDPval はまさにその点を測定しようとする OpenAI の最も明確な試みの一つです。Astra の結果が GDPval 上に表示されるまで、あるいは多段階の自律的作業に特化した後継モデルが登場するまでは、「広範な経済的汎用性」に関する主張は、実際の職業パフォーマンスを測る同社のフラッグシップベンチマークよりも、むしろ専門的なベンチマークやデモを組み合わせたものに基づいていると言えます。
OpenAI によれば、今後はトークンあたりの価格ではなく、タスクあたりの価格が重要になります。
このシステムレベルの視点も、OpenAI が顧客にコストについてどう考えてほしいかという点を変えています。
開発者にとって、API モデル名は gpt-6-astra です。今回のリリースでは、Astra が対象となる API 顧客に対して「ゼロデータ保持(Zero Data Retention)」をサポートし、OpenAI は「プライベートセーフティプロセッシング」のテストも実施中であると明記されています。
OpenAI の API 標準料金は以下の通りです。
入力トークン:100 万トークンあたり 10 ドル
出力トークン:100 万トークンあたり 50 ドル
キャッシュの読み書きには別途料金がかかります。
「ファストモード」では、標準料金の 2 倍で、処理速度を最大 2.5 倍に引き上げます。
- モデル:入力 ($/1M) / 出力 ($/1M) / 合計 ($/1M) / ソース
- Muse Spark 1.2 / 1.3 Contributor:$0.10 / $0.20 / $0.30 / Meta
- MiMo-V2.5 Flash:$0.10 / $0.30 / $0.40 / Xiaomi
- DeepSeek-V4-Flash — off-peak:$0.22 / $0.66 / $0.88 / DeepSeek
- GPT-5.6 Luna:$0.20 / $1.20 / $1.40 / OpenAI
- MiniMax-M3:$0.30 / $1.20 / $1.50 / MiniMax
- LongCat-2.0 — limited-time promo:$0.30
「AGI 時代へようこそ」— OpenAI、GPT-6 Astra を発表
- モデル名:入力トークン (1K) / 出力トークン (1K) / 合計 (1K) / ベンダー
- LongCat DeepSeek-V4-Flash — ピークタイム:$0.44 / $1.32 / $1.76 / DeepSeek
- MiMo-V2.5:$0.40 / $2.00 / $2.40 / Xiaomi
- DeepSeek-V4-Pro — オフピーク:$0.66 / $1.98 / $2.64 / DeepSeek
- LongCat-2.0 — スタンダード:$0.75 / $2.95 / $3.70 / LongCat
- MiMo-V2.5 Pro (≤256K):$1.00 / $3.00 / $4.00 / Xiaomi
- Gemini 3.7 Flash — 2026年12月31日まで:$0.75 / $3.75 / $4.50 / Google
- Gemini 3.8 Flash — 2026年12月31日まで:$0.75 / $3.75 / $4.50 / Google
- DeepSeek-V4-Pro — ピークタイム:$1.32 / $3.96 / $5.28 / DeepSeek
- Muse Spark 1.1 / 1.2 / 1.3:$1.25 / $4.25 / $5.50 / Meta
- GLM-5.3:$1.40 / $4.40 / $5.80 / Z.AI
- Grok 4.6 — <200K プロンプトトークン:$2.00 / $6.00 / $8.00 / xAI
- MiMo-V2.5 Pro (>256K):$2.00 / $6.00 / $8.00 / Xiaomi
- Qwen3.8-Max:$2.00 / $6.00 / $8.00 / QwenCloud
- Gemini 3.7 Flash — 2027年1月1日より:$1.50 / $7.50 / $9.00 / Google
- Gemini 3.8 Flash — 2027年1月1日より:$1.50 / $7.50 / $9.00 / Google
- GPT-5.6 Terra:$2.00 / $12.00 / $14.00 / OpenAI
- Grok 4.6 — ≥200K プロンプトトークン:$4.00 / $12.00 / $16.00 / xAI
- GPT-5.4:$2.50 / $15.00 / $17.50 / OpenAI
- Kimi K3:$3.00 / $15.00 / $18.00 / Moonshot AI
- Claude Opus 5:$5.00 / $25.00 / $30.00 / Anthropic
- Sakana Fugu Ultra (≤272K):$5.00 / $30.00 / $35.00 / Sakana AI
- GPT-5.6 Sol — スタンダードモード:$5.00 / $30.00 / $35.00 / OpenAI
- Claude Fable 5 / Claude Mythos 5:$10.00 / $50.00 / $60.00 / Anthropic
- Claude Fable 5.1 / Claude Mythos 5.1:$10.00 / $50.00 / $60.00 / Anthropic
- GPT-6 Astra — スタンダードモード:$10.00 / $50.00 / $60.00 / OpenAI
- GPT-5.6 Sol — ファストモード:$10.00 / $60.00 / $70.00 / OpenAI
OpenAI
GPT-6 Astra — Fast mode
20 ドル
100 ドル
120 ドル
OpenAI
これらの価格自体も重要ですが、Brockman 氏はトークン単価が企業向け AI の実態を反映する指標として不適切になりつつあると指摘しています。
「トークン単位での課金には意味がありません」と Brockman 氏は語ります。「競合他社のトークンとは性質が異なる場合があり、モデルファミリー間でも同じではありません。」
その代わり、彼は企業は「完了したタスクあたりの価格」で評価すべきだと主張します。
「企業が本当に必要としているのは、そして市場もようやくそれに気づき始めているのは『タスク単価』です。重要なのは、適切なコストと速度で目的を達成できるかどうかだけです」と Brockman 氏は説明しています。
OpenAI は、Astra が DeepSWE v1.1 ベンチマークにおいてその主張を実証していると述べています。同社の最高性能設定は GPT-5.6 Sol の最上位設定を上回る結果を出しながら、タスクあたりの推定 API コストを約 57% 削減しています。
エージェントがより自律化するにつれ、企業購入者にとってこの指標はトークン単価よりも有用になる可能性があります。安価なモデルでも、繰り返し再試行や人間の修正、数千回の追加推論ステップが必要であれば、最終的には一度で正しくワークフローを完了できる高価なモデルよりもコストがかかるケースも考えられます。
自律性の向上はガバナンスの難易度を高める
企業が Astra に注目する理由となるその能力こそが、同時にガバナンスをより困難にする要因にもなります。
チャットボットは、人間が確認するための何かを生成する。一方、コンピューターを操作するエージェントは、実際にレコードを変更したり、情報を送信したり、ファイルを操作したり、アプリケーション間でのアクションを実行したりできる。
Glaese氏は、ユーザーがより多くの業務を委譲するにつれ、OpenAI には権限の範囲を認識できるモデルが必要だと語った。
「モデルが自律的にできることが増えるとしても、私たちはそれらをより信頼できるようにならなければなりません。アライメントと安全性に関する理解は、モデルの能力の向上に合わせて進化する必要があります。Astra は、私たちが持つ中で最も能力が高く、最もアライメントされたモデルです」
OpenAI が Astra について行った安全対策の取り組みは、このレベルの能力を持つシステムを統制するために何が必要かを示す貴重な洞察を提供している。
発表ブリーフィングの前日に行われた別の非公開ブリーフィングで、OpenAI の関係者は、Hugging Face のインシデント発生後、Astra 自体は関与していなかったにもかかわらず、同社が約2週間にわたり最先端のトレーニングを一時停止したと明かした。その期間中、OpenAI は研究インフラのセキュリティを強化し、トレーニングワークロードがアクセス・接続できる範囲を制限し、監視体制を拡充するとともに、モデルの挙動やモデルがトレーニングされる環境に関する社内基準を引き上げた。
これらの統制下で Astra に関する作業の一部は再開されたが、将来のモデルに向けた大規模な強化学習ランニングは、より長い期間にわたって一時停止されたままとなった。
この区別は重要です。OpenAI の関係者によると、停止措置が Astra 自体の危険性を示す証拠に基づいたものだったわけではありません。同社はむしろ、急速に進化するモデル能力に対して、安全性・監視・インフラ制御の仕組みが取り残されないよう防ぐための試みと捉えていました。この期間に行われた作業は、2 週間でゼロから構築された安全対策ではなく、数ヶ月、あるいは一部の分野では数年にわたる先行するアライメント研究やセキュリティ研究の上に積み重ねられたものです。
このアプローチは、従来のモデルのモデレーションよりも、むしろ企業のリスク管理に近いものになっています。単一の拒絶レイヤーに頼るのではなく、OpenAI はモデルの挙動、分類器、セキュリティ制御、監視、そしてデプロイ後の脅威対応を横断する「多層防御」システムを構築したと説明しています。
例えば、OpenAI の関係者によると、Astra のサイバーセキュリティ対策では、モデルに組み込まれた拒絶機能と、システムレベルの分類器、オフライン検知機能を組み合わせています。これにより、単一の明らかに悪意のあるリクエストではなく、複数のプロンプトにわたって展開される可能性のある悪用パターンを特定します。リスクの高いユーザーに対しては、より広範な会話文脈を活用し、個々の要求は無害に見えても、それが大規模な攻撃ワークフローの一部となっているかを検知できるようにしています。
これは、高度に自律的なエージェントの導入を検討する企業にとって明白な影響を及ぼします。もはやモデルに対して提示されるプロンプトだけが制御対象ではありません。組織は、一連の行動シーケンス、モデルが自身の権限境界を理解しているか、アクセス可能なアプリケーションやデータは何か、実行中に不審な軌道を検出できるか、そしてセーフガードが発動した際にどうなるかなどを、自ら推論して判断する必要があります。
OpenAI によると、Hugging Face の事例に触発された内部評価では、困難または不可能な目標に直面した際、モデルが権限範囲を超えて行動しないかをテストしました。生産環境用のセーフガードがない場合、GPT-5.6 Sol は 48.2% のケースで許可されたターゲットを超えた行動をとりましたが、Astra はそのような事例を 0% に抑えました。
OpenAI の関係者によれば、関連する内部アライメント評価では、困難なサイバーセキュリティタスクに基づいてテストが行われました。この際、生産環境用のセーフガードがない場合、以前のモデルはテストの大半で隣接システムへのアクセスを試みました。一方、Astra はそのような試みは一切行いませんでした。
関係者によると、その目的は単に時代を切り拓くようなモデルを訓練することだけではありません。
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み