動画記事 · AI Engineer
動画の質の低下を検証 — Character.ai の Maor Bril氏
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
動画生成モデルの進化に対し、従来のフレーム単位の評価では不十分であり、物語性や物理法則を評価する高速な小規模 VLM ベースの評価基盤とアジェンティックワークフローの重要性を説く。
生成動画の「質」をどう測るか?Character.ai が挑む、AI Slop 解決への新戦略
生成 AI の進化により動画作成が容易になる一方で、物理法則の破綻やストーリーの整合性がない低品質なコンテンツ(AI Slop)が溢れるという新たな課題が生じています。Character.ai の Maor Bril氏は、従来のフレーム単位の評価や大規模 LLM による遅い判定に代わり、「比較学習」を採用した軽量な視覚言語モデル(VLM)を開発し、生成プロセスの初期段階で品質を担保する画期的なアプローチを発表しました。
動画評価技術が追いつかない「AI Slop」の壁
現在、Kling、SeaDance、VEO、Sora といったモデルの進化により、動画生成の質は劇的に向上しています。しかし、その進歩に評価基準が追いついていないのが現状です。
多くのツールでは、Clip Score や LPIPS などの既存指標が使われています。これらは「特定のフレームがプロンプトと一致しているか」「フレーム間のズレを検知できるか」といった点には優れていますが、動画の本質である「物語性が伝わっているか」や「物理法則に従っているか」を判断することはできません。
「動画は単なる画像の羅列ではありません。それは物語を語るメディアです。」
例えば、「キャラクターが階段を下りる」というプロンプトに対し、モデルが浮遊して降りてきたり、指の本数が変わったり、音と映像の同期が取れていない場合、既存の評価指標では「高品質」と判定されてしまうリスクがあります。このため、人間が手作業でチェックするしかなく、コストと時間の制約から大量の高品質生成が困難な状況が続いていました。
大規模 LLM から軽量 VLM へ:評価の高速化と実装
以前は、動画の評価に大規模言語モデル(LLM)を「審査員」として使う試みが行われていました。しかし、この手法には明確な欠点がありました。
- 処理速度が遅い: 動画全体を分析するのに時間がかかりすぎる。
- コストが高い: 大規模モデルの利用料が膨らむ。
- プロンプト依存: 評価結果がプロンプトの書き方によって不安定になる。
Character.ai はこれらの課題に対し、軽量な視覚言語モデル(VLM)を評価エンジンとして採用しました。このモデルは、動画の内容を理解しつつも非常に高速に動作します。
「現在、我々のモデルでは 15 秒の動画を約 3 秒で評価できます。」
より大きなモデルを試した結果、精度はわずかに向上しましたが、その分処理速度が大幅に低下しました。開発プロセス全体でのコストと時間を考慮すると、「少しだけ遅い高品質」よりも、「圧倒的に速く十分な精度」を選ぶことこそが実用化への近道であると判断し、軽量モデルを採用しました。
「絶対評価」ではなく「比較学習」で精度を高める
この手法の最大の革新点は、評価基準の設計にあります。従来のように「10 点満点で何点か」という絶対的な点数付けを行わず、「A と B、どちらがより良いストーリーを語っているか」という比較(ペア比較)データを用いてモデルを訓練しました。
人間は特定の動画に 6 点をつけるかどうかで意見が分かれても、2 つの動画を並べて「どちらが優れているか」を選べば、大多数の人が一致する傾向があります。この「相対評価」データを大量に用意し、モデルを学習させることで、主観的な質の判定を一般化することに成功しました。
「絶対的な点数付けではなく、A と B の比較を通じてより良いものを検出するアプローチです。」
また、初期の実装では「映像の美しさ(ゴージャスさ)」や「人工的なノイズの有無」を検知してしまっているという過学習の問題が発生しました。例えば、カメラが全く動かない静止画でも「映画的だ」と判定したり、幽霊が浮遊する不自然な動画でも「物理法則が良い」と評価してしまう現象です。
これを解決するため、「人間の撮影した映像」と「AI 生成の映像」を対比させるデータセットを作成しました。ただし、モデルが単なる「AI 検出器(AI Detector)」に過学習してしまわないよう、両者のエンコーディングや注釈方法を厳密に統一し、純粋な「品質評価モデル」のみを学習させる工夫を行いました。
プロセスの早期介入で修正コストを劇的に削減
この高速な評価モデルは、生成プロセスの初期段階に組み込まれることで、その真価を発揮します。動画が完成してから不具合を見つけるのではなく、生成の途中や、短いクリップを繋げる前にエラーを検知するのです。
例えば、キャラクターの顔がフレーム間で微妙に変化している(ドリフト)場合、長い動画として完成させる前に 6 秒程度のクリップ段階で検知し、再生成すれば修正コストは極めて低く済みます。逆に、完成した後に発見すると、全体の再作成が必要になり、膨大なリソースを浪費することになります。
「不具合を早期に発見し、修正するほどコストは劇的に削減されます。」
さらに、この評価モデルを「エージェント(自律型 AI)」のワークフローに統合することで、AI 自身が自分の生成物を検証し、必要に応じて修正を行うサイクルを自動化しています。これにより、ユーザーが独自のキャラクターやストーリーを持つ際にも、柔軟に対応しながら品質を保証できる仕組みとなりました。
まとめ:標準化された評価基準がもたらす未来
Character.ai のアプローチは、生成 AI 業界における「品質保証の自動化」への明確な道筋を示しています。大規模 LLM に依存せず、軽量モデルと比較学習を組み合わせることで、開発者が手作業に頼らずとも高品質な動画コンテンツを大量生産できる基盤が完成しました。
評価基準の標準化が進むことで、業界全体で生成動画の質が向上し、信頼性の高い AI エージェントやエンタープライズ向けツールの実装が加速することが期待されます。今後は「どれだけ速く作れるか」ではなく、「いかに早く高品質なものを生み出せるか」という評価基準へとシフトしていくでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。