Google DeepMind、Gemini で動画分析の自律型機能を導入
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Google DeepMind
Google DeepMind は「Agentic Video Understanding」機能を Gemini に導入し、トークン消費量を最大 88%、コストを最大 66%削減しながら品質を最大 7%向上させる成果を発表した。
AI深層分析を開く2026年9月2日 03:17
AI深層分析
キーポイント
コストと効率の劇的改善
新機能によりトークン消費量が最大 88%、コストが最大 66%削減される。
品質向上の実現
リソース削減にもかかわらず、分析品質は最大 7%向上する。
Agentic アプローチの導入
Google DeepMind が Gemini に「エージェント型」の動画理解機能を搭載した。
コストとトークン使用量の劇的な削減
静的処理に比べ、分析コストが最大66%、トークン消費量が最大88%削減される。
精度の向上と新機能の実現
精度は最大7%向上し、サブ秒単位の瞬間検索や正確な異常検出などの機能が強化される。
重要な引用
Our new agentic feature for video analysis cuts token consumption by up to 88%, reduces costs by up to 66%, and boosts quality by up to 7%.
Gemini models with agentic video understanding reduce analysis costs by up to 66% and token consumption by up to 88%, while improving accuracy by up to 7%.
agentic video understanding pairs the model's core reasoning with native video tools to dynamically search, scan, and inspect target video segments across visual frames, audio, and transcripts.
Using agentic video understanding places Gemini 3.7 Flash at the accuracy-to-cost pareto frontier for video analysis.
編集コメントを表示
編集コメント
動画分析におけるコストと品質のトレードオフを打破する技術は、実運用における導入障壁を下げる重要な一歩となる。特にトークン消費量の劇的な削減は、長時間動画や高頻度処理を必要とするユースケースにおいて大きなメリットをもたらす。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2026 年 9 月 1 日
7 min read
最新の動画分析機能「エージェント型ビデオ・アンダスタンディング」の導入により、トークン消費量を最大 88%、コストを最大 66% 削減し、精度は最大 7% 向上しました。
ローハン・ドシ氏(Google DeepMind シニアプロダクトマネージャー)
マリオ・ルチッチ氏(Google DeepMind リサーチディレクター)

このブラウザでは音声再生に対応していません。
記事の音声を聞く
[[duration]] 分
本コンテンツは Google AI によって生成されています。生成 AI は実験的な技術です。
本日、最新のモデルである Gemini 3.7 Flash、3.6 Flash、および 3.5 Flash-Lite で、エージェント型ビデオ・アンダスタンディング(agentic video understanding)機能を正式にリリースします。この新機能は、動画分析における精度を向上させると同時に、トークン使用量とコストを劇的に削減します。
コード実行能力と Gemini モデルの画像理解機能を組み合わせた「エージェント型ビジョン」同様、今回の「エージェント型ビデオ・アンダスタンディング」も、Gemini のネイティブな動画ツールを活用してパフォーマンスを向上させます。これにより、サブ秒単位の瞬間検索や、より正確な異常検知、精密なカウント処理など、動画処理における新たな可能性が拓かれます。
本機能は、Google AI Studio および Gemini Enterprise Agent Platform 経由の Gemini API を通じて、動画アップロードおよび YouTube 動画に対して本日利用可能になりました。
ベンチマーク
現在の「静的」処理ではモデルが固定されたフレームレート(デフォルトは 1 FPS で、API を介して調整可能)で動画を摂取するのに対し、エージェント型動画理解では、モデルの中核的な推論能力とネイティブな動画ツールを組み合わせ、視覚フレーム、音声、文字起こしにわたる対象セグメントを動的に検索・スキャン・検査します。標準的な動画分析ベンチマークにおいて、エージェント型動画理解を搭載した Gemini モデルは、分析コストを最大 66%、トークン消費量を最大 88% 削減しつつ、精度を最大 7% 向上させます。
これらの効率化効果は、10 分間のハウツーガイドから 90 分の講義、あるいは数時間にわたる録画まで多岐にわたる長尺動画において特に顕著です。従来の静的処理では、開発者はトークンコストの高さか、重要な詳細情報が欠落する手法のいずれかを選ばざるを得ませんでした。
Gemini 3.7 Flash を用いてエージェント型動画理解を有効化すると、トークン消費量は最大 88% 削減され、精度は最大 7% 向上します。
これらの効果はサポート対象となるすべての 3 モデルに共通しますが、エージェント型動画理解を搭載した Gemini 3.7 Flash は、総合的な品質において最も優れており、品質とコスト効率の最適な組み合わせを提供します。これは、テストされた動画理解モデルの中で、精度対コストのパレートフロンティアに位置するものです。
エージェント型ビデオ理解機能を活用することで、Gemini 3.7 Flash は動画分析における精度とコストの最適なバランス(パレートフロンティア)を実現します。
仕組み
従来のモデルは固定されたフレームレートでメディアストリームを処理する静的なアプローチでしたが、エージェント型ビデオ理解では Gemini が能動的かつ目的指向的な役割を果たし、「何を」「どの速度で」「どのモダリティ(映像フレーム、音声、または文字起こし)を通じて」見るかを決定します。必要な瞬間や信号のみを取得するため、開発者は以前は手動で行っていた作業を、Gemini 自身がエージェントループを通じて自動実行できるようになります。内部ツールを呼び出して動画ファイルの関連部分をロードするだけで済むため、開発コストを大幅に削減できます。
機能と活用事例
エージェント型ビデオ理解により、開発者は多様な過酷なアプリケーションにおいて、長時間の動画コンテンツを処理する方法を変革できます。
- 1 秒未満の瞬間検索: 1 FPS で見逃されやすい数ミリの状態変化や、切り替え境界を特定可能に。これにより、精密な自動動画編集が実現します。
- 長尺動画からの「干し草の山の中の針」検索: 何時間にもわたる動画全体で複雑なクエリに応答しながら、数百万トークンの消費を防ぎます。
- 異常検知: 興味深い時間帯をより高い FPS で再サンプリングし、高速な動きや微妙な視覚アーティファクトを検出します。
- 動作・物体の計数: 時間経過に伴う反復する物理的な動きや、個々の物体を正確に追跡します。
実世界での成果
アジェンティック・ビデオ・アンダースタンディング(Agentic Video Understanding)の早期アクセスパートナーによるテストでは、多くのケースで高いパフォーマンスが確認されました。その具体的な声をご紹介します。
利用開始方法
アジェンティック・ビデオ・アンダースタンディングは、Gemini API を通じて利用可能です。利用先は Google AI Studio と Gemini Enterprise Agent Platform です。この機能は、Gemini 3.7 Flash、3.6 Flash、そして 3.5 Flash-Lite の各モデルで提供を開始しました。
利用料金は標準的な Gemini API トークン課金体系を採用しており、追加の機能利用料は発生しません。
利用を有効にするには、API 設定で処理モードを「agentic」に指定するだけです。この機能の詳細や導入方法については、開発者向けガイド をご覧ください。
また、このアジェンティック・ビデオ・アンダースタンディングの効率性と品質向上は、Google の製品を利用する数十億人のユーザーにも提供されます。まもなく、Flash および Flash-Lite モデルを搭載した Gemini アプリの全ユーザーに向けて展開される予定です。さらに今後数ヶ月のうちに、YouTube の動画視聴ページにある「Ask YouTube」機能でも活用され始めます。これにより、Gemini が映像内容に基づいた高品質な回答を提供できるようになります。
本稿への貢献に対する謝辞:Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin、および Agentic Vision チーム。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み