OpenAI、GPT-6 Astra を公開:105 万トークンコンテキストのコンピュータ操作モデル
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
OpenAI は自律的なコンピュータ操作を目的とした新モデル「GPT-6 Astra」を発表し、105 万トークンのコンテキストと高度な推論機能を備えるが、セキュリティ閾値を超えた組織のみが利用可能なクローズドシステムである。
AI深層分析を開く2026年9月4日 07:10
AI深層分析
キーポイント
コンピュータ操作特化モデルの登場
OpenAI はチャットモデルではなく、ブラウザやスプレッドシートなどを人間同様に操作して多段階タスクを完了させる「Computer-Use」システムとして Astra を位置付けた。
コンテキスト管理と推論機能の革新
Astra は以前の Codex と異なり、コンテキストウィンドウを超えて情報を保持・検索する機能を備え、未解決の決定によるタスク停止を防ぐための並列質問機能も実装した。
厳格なアクセス制限とクローズド運用
Astra は重みが公開されていないホスト型モデルであり、OpenAI の「Trusted Access」および「Daybreak」プログラムに参加する組織のみが利用可能で、自己ホスティングは不可能である。
ベンチマークにおける性能と課題
OSWorld V2-Offline で 72.6% のスコアを記録しタスク時間を短縮したが、DeepSWE v1.1 では他社モデルとの差が小さく、コーディング能力が相対的な弱点となっている。
初の「クリティカル」セキュリティ閾値達成と制限
Astra は OpenAI の準備度フレームワークで初めて「クリティカル」カテゴリに分類され、標準アクセスではエクスプロイト発見などの高度なサイバーセキュリティ作業が拒否される。
重要な引用
The pitch is that Astra operates software the way a person does, across browsers, spreadsheets, desktop applications and terminals
Astra scores 98.6% on ARC-AGI-3
Coding is the weak spot in the story
Astra is the first model OpenAI has designated as reaching the Critical cybersecurity threshold in its Preparedness Framework.
編集コメントを表示
編集コメント
OpenAI は自律的なコンピュータ操作を実現するモデルをリリースしたが、その利用には厳格なセキュリティ審査と特定プログラムへの参加が必須となる。これは AI の実用化におけるセキュリティとアクセス制御の新たな基準を示す動きであり、企業は自社の導入戦略を見直す必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本日、OpenAI は「GPT-6 Astra」を発表しました。同社はこれを最も知能が高く、安全性が確保されたモデルと位置づけ、チャットボットではなく、主にコンピュータ操作を担うシステムとして紹介しています。Astra の特徴は、ブラウザ、スプレッドシート、デスクトップアプリ、ターミナルなどにおいて、人間のようにソフトウェアを操作し、単に手順を説明するのではなく、多段階のタスクを実際に完了させる点にあります。
実用化は可能でしょうか?部分的には可能です。ただし、自社のハードウェアで動かすことはできません。Astra は重み(weights)が公開されていないクローズドなホスト型モデルであり、セルフホスティングは選択肢になりません。現在利用可能なのは、OpenAI の「Trusted Access」および「Daybreak」プログラムに参加している組織のみです。
何が本当に新しいのか
開発者にとっての主な変化は、コンテキスト(文脈)の扱い方です。従来の Codex は、コンテキストが限界に達すると圧縮を行い、過去のやり取りを要約していました。しかしこのプロセスでは、後でエージェントが必要とする詳細情報——なぜ修正が失敗したか、どのテストが実行されたか、いつ要件が追加されたかなど——が失われてしまいます。
一方、Astra はコンテキストウィンドウを超えてメモを保持し、過去のメッセージやツール出力も検索可能にします。この機能は現在、config.toml の設定を介して実験的に利用でき、今後数週間で Codex のデフォルト動作となります。
また、Astra は作業を続行しながら、その結果に依存しない質問をユーザーに行うことができます。これにより、「未解決の判断が全体のタスクを停止させてしまう」という、エージェントでよく見られる失敗を防ぐことが可能になります。
モデルページによると、Astra は 105 万トークンのコンテキストウィンドウと最大 128,000 トークンの出力をサポートし、知識カットオフ日は 2026 年 4 月 30 日です。入力はテキストと画像ですが、出力はテキストのみとなります。推論の強度(reasoning.effort)には、「高」の上に「超高(xhigh)」と「最大(max)」という 2 つの新レベルが追加されました。
ツールサポートでは、コンピューター操作、ホストされたシェル、パッチ適用、スキル、MCP、ツール検索に対応しています。ただし、ファインチューニングはサポートされていません。
ベンチマークの結果について
OpenAI が発表した OSWorld V2-Offline のスコアは 72.6% で、GPT-5.6 Sol の 65.7% を上回っています。また、平均タスク時間は約 75 分から 40 分へと短縮されました。
Anthropic は Claude Fable 5.1 が 77.9% を記録したと報告していますが、これは異なる OSWorld リリースを使用しているため、直接比較はできないとしています。
Astra の ARC-AGI-3 スコアは 98.6% です。この数値は、ターン間の推論を保持し、長文コンテキストに対して圧縮機能を活用した Responses API ハーネスで測定されたものです。OpenAI は以前にも、これらの設定がモデル自体を変更せずとも ARC-AGI-3 のスコアを大幅に向上させることを示しています。つまり、この結果は「モデル+エージェントシステム」全体の性能を反映したものです。
その他の報告数値としては、FrontierMath Tier 4 で 97.6%、BenchCAD Vision2Code で 95.9%(Fable 5.1 の 84.3% を上回る)、Terminal-Bench Science で 64.6%(Anthropic が報告した 52.6% を上回る)となっています。Epoch AI は、FrontierMath に OpenAI が資金を提供しており、同社がその一部への独占アクセス権を持っていると指摘しています。
コーディング能力は、このモデルの弱点の一つです。Astra は DeepSWE v1.1 ベンチマークで 74.1% のスコアを記録しました。これに対し Sol は 70.8% です。Meta が発表した Muse Spark 1.3(最大推論モード)は 75.4% で、パブリックリーダーボードでは Gemini 3.8 Flash や Claude Opus 5 も 74% 前後に位置しています。113 タスクからなるベンチマークにおいては、これらの差はたったの 1〜2 タスクの違いに過ぎません。
サイバーセキュリティ能力がアクセス制限を決定する
Astra は、OpenAI の「準備度フレームワーク」において初めて「クリティカル(重要)なサイバーセキュリティ閾値」に達したと認定されたモデルです。テスト過程では、強化されたブラウザやオペレーティングシステムに対する脆弱性攻撃(エクスプロイト)の開発に成功し、2 つの未発見の V8 脆弱性を特定しました。OpenAI はこれらの情報を維持者へ開示する方針を示しています。
この認定には実務的な影響があります。標準的なアクセス権限では、エクスプロイトの発見を含む高度なサイバーセキュリティ作業は拒否されます。API 開発者にとって、サイバーセキュリティの安全チェックが通らない場合、承認待ちになるのではなくタスク自体が即座に停止します。OpenAI の Mia Glaese氏は、信頼されたアクセスプログラムに参加していないユーザーは、関連のない作業中であっても処理速度の低下や一時停止、あるいはブロックに直面する可能性があると警告しています。
ExploitBench におけるスコアは 100% です。これは合格・不合格を問うものではなく、能力のカバー範囲を示す集計スコアです。また、ExploitGym では 42.4% を記録し、Sol の 30.3% を上回りました。両ベンチマークとも、従来の 6 時間という制限時間は撤廃されています。
料金体系
Astra の料金は、入力トークン 100 万あたり $10、出力トークン 100 万あたり $50 です。キャッシュされた入力は $1.00 で計算されます。入力トークンが 272K を超えるリクエストの場合、全リクエストに対して入力が 2 倍、出力が 1.5 倍の料金がかかります。バッチ処理と Flex モードは通常料金の 50%、高速モード(Fast mode)は 2 倍です。さらに、Pro、Business、Enterprise ユーザーには Astra Pro も利用可能です。
要点
Astra はまず「コンピューター操作モデル」です。OSWorld V2-Offline ベンチマークで 72.6% の成功率を達成し、タスク完了時間が約 75 分から約 40 分に短縮されました。
Codex で採用されていたコンパクション(情報圧縮)の代わりに「ノート」機能が導入されたため、長時間実行されるエージェントでも失敗の詳細情報が失われることがなくなりました。
コーディング性能の向上は限定的です。DeepSWE v1.1 ベンチでは 74.1% のスコアを記録し、リーダーボードの中間層に位置しています。
OpenAI が設定した「クリティカル・サイバー閾値」を満たす最初のモデルとなりました。この閾値に達していない標準的なアクセス権限では、悪意のある攻撃やエクスプロイト関連の作業は拒否されます。
オープンウェイト版は提供されません。トークン 100 万あたり $10〜$50 の課金体系で、API と AWS 経由での利用は数日以内に開始される予定です。
詳細は OpenAI の公式発表ページ、X(旧 Twitter)の投稿、および GPT-6 Astra モデルページをご覧ください。Twitter や Telegram でもフォロー・参加可能です。また、150,000 人以上が所属する ML サブレッドやニュースレターへの登録もおすすめです。
本記事は MarkTechPost にて公開された「OpenAI Releases GPT-6 Astra: A 1.05M-Context Computer-Use Model Gated Behind a 'Critical' Cyber Threshold」を基にしています。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み