長編動画生成に関する解説記事(4 分読了)
本文の状態
日本語全文を表示中
詳細モードで約13分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
本記事は、AI を用いて数分の長さを持つ高品質な動画を生成する技術の現状と課題について解説している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
1 Google Cloud AI Research 2 シンガポール国立大学
抄録
一貫性があり、論理的な長編動画を合成することは依然として根本的な課題です。既存の方法は、長い時間軸において意味のドリフトや物語の崩壊に悩まされています。私たちは、創造的合成と一貫性の強制を分離するA²RD(/ɑːrd/)というAgentic Auto-Regressive Diffusion 構造を発表します。A²RD は、Retrieve–Synthesize–Refine–Update(検索–合成–精緻化–更新)サイクルを通じて、動画をセグメントごとに合成し自己改善するクローズドループプロセスとして長編動画合成を定式化しています。このアーキテクチャは以下の 3 つのコアコンポーネントで構成されています:*(1) モダリティ横断的な動画進行を追跡するマルチモーダル・ビデオメモリ*、*(2) 自然な進行と視覚的一貫性のために生成モードを切り替える適応型セグメント生成*、そして*(3) エラーの伝播を防ぐためにフレームレベルおよび動画レベルで各セグメントを自己改善する階層型テスト時自己改善*。さらに、長期的な一貫性を厳しくテストするための非線形エンティティおよび環境遷移を含む挑戦的なベンチマークであるLVBench-Cも導入しました。1 分から 10 分までの動画を対象とした公開ベンチマークと LVBench-C の両方で、A²RD は一貫性で最高峰のベースラインを最大 30%、物語的一貫性で最大 20% 上回りました。
用語
用語説明
ショット (Shot) カットなしで単一のカメラアングルから捉えられた連続するフレームのシーケンス。
シーン (Scene) 単一の物理的環境または場所内における連続した動作を表す物語上の単位。
セグメント (クリップ) (Segment (Clip)) A²RD における基本的な生成単位であり、柔軟に設計されており、1 つ以上のショットやシーンを跨ぐことができる。
セグメントコンテキスト (𝑆ᵢ) (Segment Context) 𝑖番目のセグメントの物語、動作、設定を規定するテキスト記述。
ストーリーライン (𝒮) (Storyline) 完全なビデオの物語を定義するセグメントコンテキスト {𝑆₁, …, 𝑆ₙ} の完全な連続コレクション。
外挿 (Extrapolation) 開始フレームのみから、前方へ向かうビデオセグメントを合成する生成モード。
内挿 (Interpolation) 固定された開始フレームと終了フレームをシームレスに接続するようにビデオセグメントを合成する生成モード。
メソッド概要
A²RD は、時間的整合性と物語的一貫性を強制しながら、動画拡散モデルが自己改善を行いながら長編動画を自己回帰的に合成することを可能にする。A²RD はトレーニングフリーであり、3 つの柱の上に構築されている:
- マルチモーダル・ビデオメモリ:既存の方法は視覚的な参照のみを保存するため、長い時間軸において物語の文脈が失われます。A²RD は合成セグメントからの構造化された文脈を保存し、各セグメントを 3 つのモダリティに分離します:テキスト状態(エンティティの同一性、属性の変化、運動、空間関係、カメラ軌跡)、フレーム(グローバル参照および境界キーフレーム)、ビデオ(運動の連続性を保つための完全なセグメント)。合成のためにオンライン検索と更新操作が有効化されています。
- 適応的セグメント生成:先行研究は、外挿または補間を固定された生成モードとして採用しています。外挿は自然な進行を可能にしますが、意味のドリフト(semantic drift)のリスクがあります;一方、補間はより強い一貫性を強制しますが、終端フレームの計画が不十分な場合に不自然なビデオ進行を引き起こすリスクがあります。A²RD はセグメントごとにモードを適応的に選択することで、自然なビデオ進行と強力な一貫性強制の両方を可能にします。
- 階層型テスト時自己改善(HITS: Hierarchical Test-Time Self-Improvement):1 つの不整合なフレームが、時間軸全体にわたってアーティファクトを連鎖させる可能性があります。既存のビデオリファインメント手法は短いクリップのみで動作します。A²RD は HITS を導入し、境界フレームから始めて完全なセグメントへと階層的に長編ビデオを自己改善することで、セグメント内およびセグメント間の整合性とビデオ品質に焦点を当て、修正されないエラーの伝播に対抗します。
ワークフローは 2 つの段階で進行します:
- メモリ初期化:エージェントは物語を推論してエンティティと環境を特定し、依存グラフを構築し、長期記憶としてグローバルな参照フレームを合成します。
- 自己回帰的セグメント合成と自己改善:各セグメントについて、エージェントはメモリから文脈を取得し、生成モードを選択し、境界フレームと動画を合成し、HITS(注:原文の略語)を適用し、メモリの更新を行った後に進行します。
image
## ベンチマーク:LVBench-C
LVBench-C(Long Video Bench-Challenge)を紹介します。これは、複雑なシナリオにおける時間的整合性をストレステストするために設計された挑戦的なベンチマークです。ここでは、長期にわたる期間でエンティティと環境が出現し、消え、再出現する状況(オプションの状態変化あり)を扱います。LVBench-C は、3 分、5 分、10 分のスケールにおけるマルチショットストーリーを特徴とし、非線形なエンティティおよび環境の遷移に富んでいます。
image
## SOTA セグメントベース長期動画合成ベースライン
シングルシーン (VBench-Long): 暖かいネオンやアニメーションされた街の看板に満ちた東京の通りを、スタイリッシュな女性が歩いています。彼女は黒いレザージャケット、長い赤いドレス、黒いブーツを着用し、黒いバッグを持っています。サングラスをかけ、赤い口紅をしています。自信と余裕を持って歩きます。通りは濡れていて反射しており、色とりどりの光の鏡面効果を生み出しています。多くの歩行者が行き交っています。
Direct Prompting (直接プロンプト)
Naive Parallel (単純並列)
Naive Autoregressive (単純自己回帰)
A²RD-Par (本手法)
A²RD (本手法)
マルチシーン (LVBench-C, 3 分間、スキューバダイバーのサンゴ礁探検): 以下のプロンプト。
Direct Prompting (直接プロンプト)
Naive Parallel (単純並列)
Naive Autoregressive (単純自己回帰)
A²RD (本手法)
A²RD シングルシーン/マルチシーン長編動画ギャラリー
A²RD マルチシーン超長編動画ギャラリー
(a) 3 分間: 名工の創造
シーン 1: 静かな朝のリビングルームで、灰色のポニーテールの男性が清潔な紺色のエプロンを身につけます。
シーン 2: 彼は台所に入り、様々な彫刻道具を小さな木箱に詰め込みます。
シーン 3:彼は家を出て、石畳の路地を歩き、アトリエへと向かいます。
シーン 4:明るいアトリエの中で、彼は大きな袋に入った湿った灰色の粘土に近づき、ワイヤーで大きな塊を切り取ります。
シーン 5:彼は重い粘土を担ぎ、ポタリーホイール(ろくろ)の中心にあるバットの上に力強く叩きつけます。
シーン 6:男はホイールに座り、粘土のセンターリングを開始し、彼の両手はすぐに厚い湿ったスリップで覆われます。
シーン 7:ホイールが回転する中、彼は粘土を上へと引き上げ、高く優雅な花瓶の形を形成します。
シーン 8:彼は湿ったスポンジを持ち上げて花瓶の外側を滑らかにし、灰色の水がエプロンに滴り落ちます。
シーン 9:彼は金属製のリブツールを使用して側面を削り、基部の周りに粘土のカスを山のように積み上げます。
シーン 10:男はホイールを止め、細いワイヤーを使って回転するヘッドから花瓶を慎重に切り離します。
シーン 11:彼は湿ったままの花瓶を持ち込み、木製の棚が並んだ乾燥室に入り、そっと置きます。
シーン 12:彼は作業台へと歩き、前日に作った皮革硬さ(レザーハード)の状態のボウルを手に取り、彫刻を開始します。
シーン 13:彼は細いニードルツールを使用してボウルに複雑な模様をエッチングし、粘土の粉が彼の腕に沈着します。
シーン 14:男は彫刻されたボウルを持ち込み、キルン室へと運び、大きな産業用キルン(窯)の中に慎重に入れます。
シーン 15:彼はキルンのデジタル設定を調整し、焼成プロセスを開始するためにスタートボタンを押します。
シーン 16:彼はグラジングステーション(釉薬掛け台)へと歩き、木製の棒で深い青色のグレイズ(釉薬)が入ったバケツをかき混ぜます。
シーン 17:彼は焼成済みの皿を青い液体に浸し、指先に顔料が付着する。
シーン 18:彼は釉薬をかけた皿をラックに置き、表面の変容を見つめる。
シーン 19:男は大型の業務用シンクへ歩き出し、手と前腕から厚い粘土をこすり落とす。
シーン 20:彼は紺色のエプロンを脱ぎ、そこには灰色の粘土と青い釉薬の斑点がひどく付着している。
シーン 21:彼はエプロンを壁のフックに掛け、木製の道具箱を手に取る。
シーン 22:彼は夕暮れの街灯が点滅する石畳の路地を再び歩く。
シーン 23:家に入ると、彼は道具箱をテーブルの上に置き、満足げに息をつく。
シーン 24:彼はリビングルームで立ちながらゆっくりとストレッチをし、顔には深い満足感が浮かんでいる。
(a) 3 分:スキューバダイバーのサンゴ礁探査
シーン 1:海の上にあるボートのデッキにダイバーが立っている。
シーン 2:ダイバーは黒いネオプレン製のウェットスーツを着用している。
シーン 3:ダイバーは重いエアタンクとハーネスを装着する。
シーン 4:ダイバーはウエストにウェイトベルトを締める。
シーン 5:ダイバーはボートのデッキの端に座る。
シーン 6:ダイバーはゴム製のマスクを目の上に引き被せる。
シーン 7:ダイバーはレギュレーターのマウスピースを口に入れる。
シーン 8:ダイバーは後方に倒れ込み、青い水中へと沈む。
シーン 9:ダイバーは海面の下へと潜っていく。
シーン 10:呼吸をする際、ダイバーのレギュレーターから泡が立ち上る。
シーン 11:ダイバーはカラフルなサンゴ礁に向かって泳いで潜っていく。
シーン 12:ダイバーは鮮やかな熱帯魚の群れを見る。
シーン 13:ダイバーは大きなウミガメのそばで浮遊する。
シーン 14:ダイバーはタンク内の空気圧ゲージを確認する。
シーン 15:ダイバーはゆっくりと水面へと泳ぎ始める。
シーン 16:ダイバーが水面を割る。
シーン 17:ダイバーはボートの側面にあるはしごに向かって泳ぐ。
シーン 18:ダイバーははしごを登ってデッキに上がる。
シーン 19:ダイバーは顔からゴム製のマスクを外す。
シーン 20:ダイバーは口からレギュレーター(呼吸調整器)を取り出す。
シーン 21:ダイバーは重い空気タンクとハーネスを外す。
シーン 22:ダイバーはボートのキャビンに入り、乾いた服に着替える。
シーン 23:ダイバーは濡れたウェットスーツを乾燥ラックに掛ける。
シーン 24:ボートが港に向かって航行し始める。
(b)5 分間:舞台恐怖症(クララ)
シーン 1: oversized のウールセーターとメガネを着用したクララは、埃っぽい屋根裏部屋でピアノの前に座っている。
シーン 2:髪は乱れており、シンプルなゴムバンドで後ろに結ばれながら、彼女はメロディを口ずさんでいる。
シーン 3:彼女は立ち止まり、鉛筆で丸められた楽譜の紙にメモを書き込む。
シーン 4:クララはピアノの鍵盤から埃の層を拭い取り、指がわずかに震えている。
シーン 5:大劇場のロビーには、タキシードとイブニングガウンを着た社交界の人々で満員だ。
シーン 6:金縁の制服を着た係員たちが、到着したゲストに光沢のあるプログラムを手渡している。
シーン7:ロビーには大きなポスターがあり、その中には「CLARA」という太字の名前と共にピアニストのシルエットが描かれています。
シーン8:舞台係員たちが巨大な黒色のグランドピアノをステージ中央へと運び込みます。
シーン9:オーケストラの指揮者がバトンを持ち直し、ポケットウォッチを見つめています。
シーン10:観客席に並ぶ赤いベルベットの座席へ、人々が列をなして入り始め、期待に満ちた囁き声が聞こえてきます。
シーン11-40: [全40シーンの物語は続きます...]
(c) 10分:大博物館強盗事件
シーン1:ヴィクターとサフロンは薄暗い地下室で、カジュアルなパーカーとジーンズ姿で座っています。
シーン2:二人はテーブルの上に青く光るロイヤル・ミュージアムのホログラフィック設計図を研究しています。
シーン3:サフロンは北ギャラリーのレーザーグリッドを指差しており、目は細められ集中しています。
シーン4:ヴィクターは小型ガラス切断装置の内部機構を確認しています。
シーン5:二人は冷たいコーヒーの入ったマグカップを軽く打ち合わせて、黙示の契約を完了させます。
シーン6:ロイヤル・ミュージアムは月光の下で堂々と佇み、高い石像の獅子に守られています。
シーン7:警備員が巡回中であり、懐中電灯の光が闇を切り裂いています。
シーン8:博物館の巨大な時計が真夜中の鐘を鳴らし、その音は空っぽになった通りへと響き渡ります。
シーン9-80: [全80シーンの物語は続きます...]
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み