Google、エンタープライズ向けAIコスト削減モデル発表
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
AI News
Google はエンタープライズ向け AI エージェントのレイテンシとトークンコスト削減を目的とした Gemini 3.6 Flash と 3.5 Flash-Lite を発表し、特定のベンチマークで性能向上とコスト効率の改善を示した。
AI深層分析を開く2026年7月27日 21:05
AI深層分析
キーポイント
Gemini 3.6 Flash のコスト削減性能
Google は Gemini 3.6 Flash が前バージョンより出力トークンを最大 17% 削減し、DeepSWE ベンチマークでは使用量が最大 65% 減ると発表している。
用途別モデルラインナップの明確化
コーディングや多モーダル推論には Gemini 3.6 Flash を、高ボリューム・低遅延作業には Flash-Lite を、脆弱性修復には制限付きの Cyber バリアントをそれぞれ割り当てた。
主要企業による実装事例
Figma はプロトタイピングに、Harvey と Hebbia は文書処理やレポート作成にこのモデルを採用し、OS 操作ツールの統合も進めている。
Gemini 3.5 Flash-Lite の性能と価格
ドキュメント処理や高ボリュームのエージェント検索に最適化され、出力速度は3.5シリーズで最速の秒間350トークンを実現した。
Gemini 3.5 Flash Cyber のセキュリティ特化モデル
コード脆弱性の検証と修復に特化したこのモデルは、悪用防止のため政府や審査済みパートナー限定のパイロットプログラムで配布される。
重要な引用
Google has released Gemini 3.6 Flash and 3.5 Flash-Lite as new workhorses designed to cut latency and token costs for enterprise AI agents.
A model needs to reason through a multi-step task competently, but every extra token it generates while doing so adds cost and delay to a workflow that might run thousands of times an hour.
Google reports drops in token usage of up to 65 percent.
The model is built to validate and remediate code vulnerabilities, and Google reports performance on the CyberGym benchmark competitive with frontier models
編集コメントを表示
編集コメント
Google は「ワークホース」としてのモデルを明確に位置づけ、エンタープライズが直面するコストとレイテンシの課題に対する直接的な回答を示した。ベンチマーク数値の向上だけでなく、実際の企業導入事例が示された点は、技術の実用化段階にあることを裏付けている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Google は、エンタープライズ AI エージェントのレイテンシとトークンコストを削減するために設計された新モデル「Gemini 3.6 Flash」と「3.5 Flash-Lite」を発表しました。
本番環境で自律型ソフトウェアエージェントを運用する経済性は、多くのベンダーが直接明言しないある一定の方程式に帰着します。モデルは多段階のタスクを適切に推論できる必要がありますが、その過程で生成されるトークンが増えるほど、1 時間に数千回実行される可能性のあるワークフローのコストと遅延が増大してしまいます。
チャットインターフェースではなくバックグラウンドで動作するエージェントを開発するチームにとって、重要なのはまずスループットであり、パラメータ数は二の次です。Google が今週発表したこの課題への回答は、3 つのモデルにトレードオフを分担させるものです。コーディングやマルチモーダル推論には「Gemini 3.6 Flash」、高ボリュームかつ低遅延な作業には「Gemini 3.5 Flash-Lite」、脆弱性対策に特化した制限付きバージョンとして「Gemini 3.5 Flash Cyber」です。
Gemini 3.6 Flash の数値的根拠
Google の開発者ドキュメントで Gemini 3.6 Flash が強調する一つの数字は、Artificial Analysis Index の測定結果に基づき、前世代の 3.5 Flash より出力トークンが 17% 削減されているという点です。
Datacurve DeepSWE ベンチマークなどの特定の合成テストでは、Google は最大で 65% に及ぶトークン使用量の削減を報告しています。料金は入力トークン 100 万あたり 1.50 ドル、出力トークン 100 万あたり 7.50 ドルに設定されており、オンデマンドではなく継続的に実行される推論ループに適した価格帯となっています。
DeepSWE では、3.6 Flash の成功率は 49% に達し、先行モデルの 37% を上回りました。MLE Bench ではスコアが 49.7% から 63.9% へ向上し、Google がコーディングパズルではなく実世界の知識労働を測定するために用意した「GDPval-AA v2」テストでも、3.6 Flash は 1421 を記録。これは旧モデルの 1349 を上回る結果です。
Figma、Hebbia、Harvey が活用
Figma は 3.6 Flash をプロトタイピングインフラに統合しました。同社製品エンジニアリング担当ディレクターのマット・コリアー氏によると、このモデルは出力品質を損なうことなく、開発者がデザイン反復作業をより迅速に進められるよう支援します。
法テックプラットフォームの Harvey と研究ツールの Hebbia は、マルチモーダル文書処理のためにデータをこのモデルに流しています。具体的には、生データの財務届出書の取り込みや文書構造の解析、埋め込まれたチャートの読み取り、レビュー用のドラフトレポート作成などです。
Google はまた、クライアントサイドでのコンピュータ操作機能を Gemini API や Gemini Enterprise プラットフォームに直接組み込みました。これにより、モデルが OS 上で動作するためにエンジニアが以前から構築していたカスタム仲介ソフトウェアは不要となりました。
同社は、OSWorld-Verified のスコアが 78.4% から 83.0% に向上したと報告しています。また、化学・生物・放射線・核兵器の悪用に対する新たな安全対策を強化し、不正な要求への耐性を高めつつも、通常の benign なリクエストに対する拒否率を引き上げることはありませんでした。
高ボリュームのバックグラウンドエージェント向けに低価格プランを追加
Gemini 3.5 Flash-Lite は、推論の深さよりも大量処理を重視するドキュメント処理やエージェント検索といった用途に特化しています。Google が発表した Artificial Analysis Index の測定では、このモデルは秒間 350 トークンの出力速度を記録し、3.5 シリーズ中最速となりました。
料金は入力トークン 100 万あたり 0.3 ドル、出力トークン 100 万あたり 2.5 ドルです。この価格設定なら、エンジニアリングチームは単純で大量のサブエージェント処理を低コストな「思考レベル」に割り当て、複雑な多段階タスクにはより高度なモデルを割り当てる柔軟なルーティングが可能になります。
Google の GDM-MRCR v2 長文コンテキストテストでは、Gemini 3.5 Flash-Lite は 72.2% の成功率を記録し、前世代の 60.1% を上回りました。また、GDPval-AA v2 のスコアも 642 から 1140 とほぼ倍増しています。なお、このモデルは Gemini 3.6 Flash と同じネイティブなコンピュータ操作ツールを搭載しています。
一方、Google は Gemini 3.5 Pro が本格リリース前のパートナーテスト中であることを明かしました。さらに、次世代となる Gemini 4 アーキテクチャの事前学習もすでに始まっています。
Gemini 3.5 Flash Cyber:コードパッチングに特化した制限付きモデル
自動脆弱性スキャナーは、セキュリティチームがパッチを適用する速度よりも速く欠陥を検出するようになり、このギャップを埋めるのが Gemini 3.5 Flash Cyber の役割です。
このモデルはコードの脆弱性を検証し、修正するための設計となっています。Google は CyberGym ベンチマークでの性能が最先端モデルと拮抗していると報告していますが、一般向けリリースほど詳細な数値は公開されていません。
配布は現在、政府機関と審査済みのパートナー限定のパイロットプログラムを通じて行われており、Google はこれを悪意ある利用のための攻撃コード生成を防ぐための安全対策として位置付けています。
Google のセキュリティエージェント「CodeMender」内部では、複数の 3.5 Flash Cyber インスタンスが並列で動作し、互いの検出結果をクロスチェックした上で、最終的に人間による承認を得る単一の修正レポートを生成します。
これらの新モデルを自社のエンジニアリングチームに統合したい場合は、Gemini API を通じて Google AI Studio、Android Studio、または Gemini Enterprise Agent Platform からアクセス可能です。一般ユーザーも Gemini アプリで利用でき、さらに軽量版の 3.5 Flash-Lite は Google Search でも順次展開されています。
関連記事:ブリストル・マイヤーズ スクイブ社が創薬研究のために Nvidia の AI システムを買収

AI算出
主要ニュースainew評価標準
AI エージェントのコスト削減を目的とした新モデル(Gemini 3.6 Flash, 3.5 Flash-Lite)の公式発表であり、具体的なベンチマーク結果や価格体系が明記されているため新規性と関連性は高い。ただし、日本企業への直接的な影響や日本語での一次情報がないため、日本の関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み