Google、Gemini Flash モデルに「エージェント型動画理解」を導入しトークン数を最大88%削減
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Google は Gemini Flash モデルにエージェント型動画理解機能を導入し、フレーム選択の最適化によりトークン使用量を最大88%削減すると発表した。
AI深層分析を開く2026年9月5日 14:15
AI深層分析
キーポイント
処理方式の転換
従来の全フレーム固定抽出から、モデルが自らの推論とツールを用いて必要なセグメントのみを選択・スキャンするループ処理へ変更された。
コストと精度の改善
同社によると、トークン使用量は最大88%削減され、コストは66%低下し、標準ベンチマークでの精度は7%向上するとしている。
API 実装と利用制限
この機能は Gemini API および Google AI Studio を通じてのみ提供され、オープンウェイトやセルフホストは不可能である。
アジェンティックモードによる効率化と精度向上
Gemini は動画のタイムラインをナビゲートするアジェンティックモードにより、固定1 FPSでの読み込みを回避し、トークンを最大88%削減してコストを66%下げつつ精度を7%向上させた。
対応モデルと静的モードの使い分け
Gemini 3.5 Flash-Liteから3.8までのFlashシリーズで単一の処理フィールドにより有効化可能だが、5分未満のクリップやフレーム単位の精密作業には依然として静的モードが推奨される。
重要な引用
Google reports up to 88% fewer tokens, up to 66% lower cost, and up to 7% higher accuracy on standard video benchmarks.
The model pairs its own reasoning with native video tools to search, scan, and inspect target segments across frames, audio, and transcripts, loading only what the prompt requires.
You can also mix modes per video inside a single request, agentic on the long lecture, static on the short clip.
Agentic mode lets Gemini navigate a video timeline instead of ingesting it at a fixed 1 FPS.
編集コメントを表示
編集コメント
動画処理におけるトークンコストの劇的削減は、実用化の障壁を大きく下げる重要な進展である。ただし、この機能は API 経由でのみ利用可能であり、オンプレミス環境やオフライン利用には対応していない点に注意が必要だ。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
動画は、推論コストが最も高いモダリティの一つです。これまで、Gemini モデルに 90 分間の講義動画を渡しても、「要約して」という質問であれ「発表者が価格スライドに切り替えるのは何時か」という質問であれ、1 秒あたり 1 フレームという固定レートで動画全体を処理していました。この単一パスの設計は、文脈として全タイムライン分のコストを支払うのか、それとも動画を事前に分割して重要な詳細を見逃すリスクを負うのか、どちらかを選ばせる悪いトレードオフを生み出しています。
今週、Google は Flash モデルシリーズ全体で「エージェント型動画理解」機能を導入しました。これはタイムラインをそのまま読み込むのではなく、Gemini が自らナビゲートし、「何を」「どのフレームレートで」「どのモダリティを通じて」見るかを判断する方式です。Google によると、標準的な動画ベンチマークにおいて、トークン数は最大 88% 削減され、コストは最大 66% 低下し、精度は最大 7% 向上したとのことです。
実用化可能でしょうか?はい、可能です。ただし、ホストされた API 機能としてのみ利用可能です。オープンウェイト版はなく、セルフホスティングもできません。この機能は Google AI Studio の Gemini API や、Gemini Enterprise Agent Platform を通じて提供され、ファイルアップロードと公開 YouTube URL の両方に対応しています。課金は通常の Gemini API トークン料金体系に基づき、追加の機能利用料は発生しません。
何が変わったのか
従来の Gemini モデルでは、すべての動画に対して「静的処理」がデフォルトで適用されていました。これは 1 フレーム毎(1 FPS)に画像を抽出し、音声は 1 Kbps の単一チャンネルのみを処理し、1 秒ごとにタイムスタンプを挿入する方式です。これに対し、「アジェンティック処理」では、モデルが自らの推論能力とネイティブの動画ツールを組み合わせてループを回す仕組みに変わります。
この新しいアプローチにより、モデルはフレーム、音声、トランスクリプト全体を一度に読み込むのではなく、プロンプトで指定されたターゲットセグメントを検索・スキャン・精査するために必要な部分だけを随時ロードします。以前は開発者が手動でこうした処理を組み立てる必要がありましたが、Gemini ではこのループ処理が内部で自動実行されるため、開発の手間が大幅に削減されます。
Google の評価結果によると、「アジェンティック理解」機能を備えた Gemini 3.7 Flash は、テストされたモデルの中で動画分析の「精度とコストのパレート最適化」を達成しています。特に、10 分間のハウツーガイドから数時間にわたる録画まで、長尺コンテンツにおける効率性の向上が顕著です。
API が返すレスポンスについて
アジェンティック処理では、レスポンスの steps アレイに 2 つの新しいステップタイプが追加されます。モデルが特定のセグメントやトランスクリプトを要求した際に生成される processing_call と、その読み込みが完了したことを示す一致する processing_result です。
これらは思考ステップ(thought steps)と交互に現れ、model_output の前に配置されます。この構造により、UI 上でリアルタイムの処理進行状況を追跡することが可能になります。また、これらのステップが存在するかどうかも、アジェンティックモードが実際に動作したことを確認する手段となります。
トークンの課金体系もこれに合わせて分割されます。ナビゲーションのための推論は「思考トークン(total_thought_tokens)」として請求され、オンデマンドで読み込まれたフレーム、音声、トランスクリプトは「ツール使用トークン(total_tool_use_tokens)」として請求されます。
この機能を有効にするには、動画パートの設定に 1 つのフィールドを追加するだけで済みます。
異なるブラウザを使用してください
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)1 つのリクエスト内で動画ごとにモードを切り替えることも可能です。例えば、長尺の講義には「エージェント型」を、短尺のクリップには「静的型」を適用できます。
主なポイント
- エージェント型モードでは、Gemini は固定の 1 FPS で動画をすべて読み込むのではなく、動画タイムラインをナビゲートして理解します。
- Google の発表によると、トークン使用量が最大 88% 削減され、コストは 66% 低下。また、動画ベンチマークにおける精度は 7% 向上しました。
- Gemini 3.8、3.7、3.6 Flash および 3.5 Flash-Lite でサポートされており、processing フィールドを指定するだけで有効化できます。
- ただし、5 分未満の短尺動画や、フレーム単位の精密な処理が必要なケースでは、従来の静的型モードの方が適しています。
API の従量課金プランはそのまま適用されますが、ナビゲーション推論に要したトークンは「思考トークン」として別途請求されます。
詳細は Google ブログ、Gemini API 動画理解ドキュメント、AI Studio の開発者ガイド、およびエージェント型ビジョンの発表記事をご覧ください。Twitter や 15 万人以上の ML 関連ユーザーが参加する SubReddit、そしてニュースレターもぜひフォローしてください。Telegram ユーザーの方も、今なら Telegram チャンネルに参加できます。
Google が Gemini Flash モデル向けに「エージェント型ビデオ理解」機能を導入し、動画トークンを最大 88%削減しました。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み