動画記事 · AI Engineer
動画に記憶なし。その解決策を十二ラボが構築
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
動画に記憶層を構築し、フレームの羅列ではなく時空間的関係を理解する「文脈グラフ」によるインフラ基盤の提案。
動画に記憶はない?十二ラボが提唱する「文脈グラフ」によるAIの革命
現在の動画 AI は、膨大な映像データを単なるフレームの集合やテキストトランスクリプトとして扱うことに終始しており、「時空間的な連続性」を見失っています。この課題を解決するため、十二ラボ(TwelveLabs)は動画に「記憶層」を構築し、数年にわたるアーカイブから意味のある知識を引き出す「文脈グラフ」という新たなアプローチを提唱しました。
動画はフレームの集合ではない:時空間的体積としての理解
多くの開発者や既存システムが陥っている最大の誤解は、「動画を画像のスタックとして扱う」ことです。フレーム単位で切り取ったり、音声だけをテキスト化して処理したりするアプローチでは、動画の本質である「連続性」が失われてしまいます。
動画は単なるフレームの集合ではなく、時空間的な体積(spatial temporal volume)として捉える必要があります。
この「体積」の中には、視覚情報、音声、動き、OCR(文字認識)、カメラワークの変化、シーン遷移、メタデータ、そして時間そのものが含まれています。重要なのは、この膨大な情報の間にある関係性をどう保存し、後からアプリケーションがそれをたどれるようにするかです。
従来の動画 AI が抱える3つの欠陥と「記憶層」の必要性
現在の技術スタックには、動画理解に必要な要素が欠けており、以下の3つの問題を引き起こしています。
- 文脈の誤り: 動画を無理やりテキストトークンの連続として扱うため、空間的な関係性や時間的な因果関係を見失います。例えば、同じ表情でも前後のシーンの順序によって意味が全く異なります。
- 記憶の欠如: テキスト処理では「ベクトル検索」や「コンテキストウィンドウの拡大」で対応できますが、動画には別の要件があります。「今日のシーン」と「数年前の別エピソード」「異なるカメラアングル」を結びつける、持続的な連続性が必要です。
- 推論能力の弱さ: テキストベースのシステムは、動きや因果関係をネイティブに推論できません。誰が現れ、何が変化し、どう関連しているかを自動的に構造化して記憶することが苦手です。
これらの課題を解決するには、動画知能のための「記憶層」が必要です。これは何を保存し、どのように接続し、どう再利用するかを決定する基盤となります。
動画データの5つの難解な性質と設計原則
動画データは以下の5つの性質を持つため、単純なデータベースでは対応できません。
- 時間依存性: 「前後の文脈」が意味を決定します。単一のフレームだけでは誤解を招きます。
- マルチモーダル性: 音声、映像、テキスト、ロゴなど複数の情報が混在し、信号の密度も不均一です。
- 情報の濃密さ: 数分の中に数十ものショットや人物、アクションが含まれます。
- 曖昧さ: 同じ人物が照明や角度によって別人のように見えたり、ブランド名が部分的にしか映っていなかったりします。
- コストと根拠の必要性: エンタープライズレベルでは、特定の主張の根拠を「いつ」「どこで」撮影されたソース映像に戻して示す必要があります。
これらに対処するため、十二ラボは動画記憶層構築のための5つの設計原則を提案しています。
- 一度取り込み、多数推論する: すべてのクエリごとに動画を再処理するのではなく、初期の解釈コストを上流で支払っておき、その後の推論を高速化します。これはデータベースの考え方と同じです。
- 答えではなく「プリミティブ」を保存する: 検索結果だけでなく、「瞬間」「エンティティ(人物・ブランド)」「出現履歴」といった基本構成要素を保存し、後続の分析や編集に再利用できるようにします。
- すべての主張に根拠を示す: AI が回答する際、必ず特定のタイムスタンプや映像ソースへのリンク(証拠)を提示させます。
- 意図で記憶を構成する: スポーツ分析、ブランドセーフティ、クリエイター分析など、用途によって必要な情報の切り出し方が異なります。システムに「何が重要か」を指示し、記憶の構造を柔軟に変えられるようにします。
- API 第一でコンポーザブルにする: 検索機能だけでなく、構造化されたメタデータや知識グラフを API で提供し、さまざまなアプリケーションと組み合わせ可能にします。
検索から「文脈グラフ」へ:動画の記憶をナビゲートする
従来の「検索(Search)」は、関連する瞬間を返すことに特化しており、連続性や物語性は提供しません。一方、「記憶(Memory)」は、システムがコレクション全体に対して「このコレクションは何を知っているのか」といった問いに答えることを可能にします。
十二ラボはこのために「文脈グラフ(Context Graph)」というモデルを採用しています。これは動画コレクションを、以下の階層で結びつけた永続的なクエリ可能な表現です。
- 下位: 時間限定の瞬間(シーンやショット)——証拠となる単位。
- 中位: エンティティの出現(誰が、いつ、どこに現れたか)。
- 上位: エンティティそのもの(人物、ブランド、場所、概念)。
- さらに上位: 関係性(同じブランドの連続的な登場、異なる場所間の移動など)。
- 最上位: コーパスレベルの文脈(全体のテーマ、パターン、ギャップ、カバレッジ)
このグラフ構造により、単純な検索だけでなく、「ある人物のストーリーライン」や「複数カメラからの証拠を統合した分析」といった複雑な問いに対して、時間軸やソースを超えて回答を生成できます。出力単位が「クリップの検索結果」から「構造化された知識・タイムライン・説明」へと変わるのです。
実社会への応用:スポーツ、セキュリティ、広告最適化
この技術はすでに多様な産業で具体的な価値を生み始めています。
- スポーツ分析: 戦術の検証やゴール判定において、数時間にわたる試合映像から特定のプレイパターンを抽出し、時系列で証拠を示すことが可能です。
- セキュリティ監視: 危険な行動を検知する際、単なるイベント検出ではなく、過去の類似事例や状況との関連性をグラフ上で追跡し、より精度の高いアラートを発令できます。
- 広告最適化: ブランドロゴがどのタイミングで、どのような文脈(ポジティブ/ネガティブ)で露出されたかを特定し、広告主にとって最適な編集や配信戦略を提案します。
動画 AI はもはや「記録の保存」から「意味のある知識グラフとしての再利用」へとパラダイムシフトを迎えています。十二ラボが構築した記憶層と文脈グラフは、AI エージェントが動画世界を深く理解し、自律的に行動するための基盤となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。