Google DeepMind、Gemini 3.8 Flash と Cyber を発表
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
Google はGemini 3.8 FlashとCyberをリリースし、同一基盤モデルに異なる安全制約を適用する新戦略を示した。
AI深層分析を開く2026年9月3日 03:00
AI深層分析
キーポイント
同一基盤による二重アプローチ
両モデルは同じ知的基盤に基づくが、Gemini 3.8 Flashは一般公開され、CyberはFairwindプログラムを通じた限定的アクセスに制限される。
推論コストと精度のトレードオフ
複雑なタスクでは追加の推論ステップを実行して精度を高めるが、その分トークン消費が増加し、計算効率重視なら旧バージョンの利用が推奨される。
ベンチマークでの性能向上
ソフトウェア工学やセキュリティ脆弱性発見のベンチマークで競合モデルを上回る結果を示したが、金融・法務分野では絶対値ではなく相対的な勝敗が報告された。
API仕様の重要な変更点
コンテキストウィンドウや入力形式は維持されるが、推論レベルの「MINIMAL」設定がサポートされなくなり、エラーとなる。
コアモデル共通の2バリアント構成
Gemini 3.8 Flash と Flash Cyber は同一のコアモデルを共有し、サイズではなく安全対策の違いで分かれている。Flash Cyber は脆弱性修正に最適化され、信頼できる防衛者に限定して提供される。
重要な引用
What separates them is not architecture, it is the safety envelope and who is allowed through it.
Google's own developer guide is candid that this buys better accuracy at the cost of higher token consumption
MINIMAL is not supported on 3.8 Flash and setting it returns an API validation error.
Google is explicit that it prioritized vulnerability fixing over offensive capabilities like exploitation.
編集コメントを表示
編集コメント
同一モデル基盤に異なる安全制約を適用するアプローチは、実用化におけるリスク管理の新たな基準を示している。開発者はコストと精度のバランスを慎重に判断し、セキュリティ要件に応じて適切なバージョンを選択する必要がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Google は、Gemini 3.7 Flash の発表からわずか 3 週間後に「Gemini 3.8 Flash」と「Gemini 3.8 Flash Cyber」を発表しました。これは 6 週間で 3 回目となる Flash シリーズのリリースです。
両モデルは同じ基盤となる知能を共有しており、背後にあるモデルを再帰的に評価する長期にわたるエージェント・ループを通じて洗練されています。決定的な違いはアーキテクチャではなく、「安全圏(セーフティ・エンベロープ)」と、その中に入ることが許可されるユーザーの範囲にあります。
実運用への導入可否についてはどうでしょうか?Gemini 3.8 Flash は本日、Gemini API、Google AI Studio、Antigravity、Android Studio、そして Gemini Enterprise を通じて一般利用可能になりました。これにより、本番環境のトラフィックを即座にこのモデルへルーティングすることが可能です。ただし、重み(ウェイト)はクローズドなままのため、セルフホストやオンプレミスでの運用はできません。
一方、Gemini 3.8 Flash Cyber は公開された形で導入することはできず、新しい「Fairwind Program」を通じてケース・バイ・ケースでアクセス権が付与される仕組みとなっています。
では、3.8 Flash で実際に何が変わったのでしょうか?
研究チームによると、3.8 Flash は 3.7 Flash をベースにしています。仕様の詳細は変更されておらず、1,048,576 トークンのコンテキストウィンドウと、最大 65,536 トークンの出力が可能です。入力としてはテキスト、画像、音声、動画に対応し、出力はテキストとなります。
思考レベル(Thinking levels)は引き続き「LOW」「MEDIUM」「HIGH」の 3 つから選択でき、デフォルトは MEDIUM です。ただし、移行を検討している開発者にとって重要な注意点として、MINIMAL モードは 3.8 Flash ではサポートされなくなりました。このモードを指定すると、API のバリデーションエラーが発生します。
この変化の本質は「行動」にあります。Google は成果を率直に説明しています。「3.8 Flash はより多くの努力を払う」というのがその要点です。複雑なタスクでは追加の推論ステップを実行し、ツールを反復的に呼び出すため、高レベルの処理を行うとトークン消費量が増える可能性があります。
Google の公式開発ガイドも率直に、「精度向上のためにはトークン消費量の増加という代償が必要である」と明記しています。計算リソースがボトルネックとなる場合は、引き続き 3.7 Flash を使用することを推奨しています。これは「新しいモデルがすべてのワークロードに最適なデフォルトではない」という、非常に直接的な認容です。
imagehttps://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
成果が現れる領域
DeepSWE v1.1 は、長期にわたるソフトウェア工学のベンチマークです。Google によると、3.8 Flash はコストを大幅に抑えながら、より大規模な最先端モデルの多くを上回る性能を発揮しました。
HLE-Verified では 54.9% のスコアを記録し、Vals Finance Agent V2 や Harvey's Legal Agent Benchmark においても、3.7 Flash および他の最先端モデルに対して優位性を示しています。なお、金融および法律分野の結果は相対的な勝利として報告されており、発表では絶対値のスコアは明記されていません。
Flash Cyber とそのゲート化について
Google が公開した標準的な脆弱性発見ベンチマーク「CyberGym」では、Gemini 3.8 Flash Cyber が Gemini 3.5 Flash Cyber を上回るだけでなく、はるかに大規模な他社の最先端モデルをも凌ぐフロントティアレベルのパフォーマンスを示しました。ただし、具体的な数値は公表されていません。CyberGym のテスト対象が主に C と C++ で構成されているため、Google はさらに 20 種類のプログラミング言語にわたる社内ベンチマークも実施し、発見成功率が 70% を超えることを報告しています。
パッチ生成に関する評価では、Collinear が運営する「CWE-Bench」において、Flash Cyber の pass@1(1 回目の試行での合格率)は 47.2% で、主要な最先端モデルの 47.8% にほぼ匹敵する結果となりました。Google は、この成果を単なるリーダーボードの首位獲得ではなく、「パレートフロンティア(最適解の境界線)」上に位置づけ、圧倒的なコスト効率で同等以上の性能を発揮できると主張しています。
Chrome Security の評価では、Flash Cyber は最も優れた大規模商用モデルと比較して、正しいパッチ生成数が 2.6 倍に達しました。また、Wiz が実施する社内ペネトレーションテストベンチマークでは、リコール(検出率)が 7.5% から 9.7% ポイント向上し、コストは 2.3 倍から 5.2 倍の削減を実現しています。さらに Google のクラウド脆弱性研究チームは、通常数ヶ月を要する重要な基盤レベルの脆弱性を、わずか 2 時間未満で特定・解決しました。
Google は明確に、攻撃的な機能(エクスプロイトなど)よりも脆弱性の修正を優先したと述べています。Flash Cyber はより寛容なサイバー対策機能を備えて出荷されており、その理由から信頼できる防衛者——政府機関、重要インフラの運営者、および Fairwind を通じて申請するソフトウェアメンテナ——にのみ利用が制限されています。
インタラクティブ解説
主なポイント
1 つのコアモデルから 2 つの変種が登場します。両者の違いはモデルサイズではなく、安全性対策の有無によって分けられています。
Gemini 3.8 Flash は、2026 年 12 月 31 日までの間、100 万トークンあたり 0.75 ドル/3.75 ドルという 3.7 Flash と同等の価格を維持します。
このモデルは、精度と引き換えにトークンを消費する仕組みです。推論ステップを増やし、ツール呼び出しを頻繁に行うことで、タスクあたりのコストは高くなります。
一方、Gemini 3.8 Flash Cyber は、最前線のモデルが 47.8% の達成率を示す CWE-Bench で 47.2% の pass@1 を記録しました。これは、圧倒的に低いコストで達成された成果です。
Cyber モデルへのアクセスは、価格表で購入できるものではなく、審査を通った防御者限定のゲート方式となっています。
この記事は MarkTechPost に掲載された「Google DeepMind Releases Gemini 3.8 Flash and Gemini 3.8 Flash Cyber: One Core Model, Two Access Envelopes」の翻訳です。
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み