動画記事 · AI Engineer
リアルタイム動画対応の音声エージェント「Sidney」登場、LemonSlice が開発
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
LemonSlice は単一画像から生成するリアルタイム動画エージェント「Sidney」を発表し、誤差蓄積問題の解決と低コスト化によりアバター・チューリングテスト達成を目指す。
写真のような「Sidney」が実装された、リアルタイム動画エージェントの登場
AI エージェントに視覚的・感情的な深みを与える技術が、ついに実用レベルに到達しました。LemonSlice が開発した新世代のアバター「Sidney」は、単なる静止画の動きではなく、物理法則や感情を理解する世界モデルを基盤とし、長時間の対話でも劣化しないリアルタイム動画を実現しています。
写真のようなアバターが、なぜ重要なのか
LemonSlice の CTO 兼創業者である Sydney Primas 氏は、同社のミッションを「アバター・チューリングテストの突破」と定義します。これは、ビデオ通話において人間と見分けがつかないほど自然なアバターを作るという挑戦です。
「私たちは、写真のようなリアリティを持ち、人間の感情や微細な動きまで再現できるアバターを作っています」
同社が注目する背景には、人間の認知特性があります。私たちは文字や音声だけよりも、視覚的な要素を伴う情報の方が理解しやすいよう生物学的に設計されています。Sidney は、この「視覚層」を提供することで、従来のテキストや音声中心の AI 対話から、人間に近い臨場感のあるインタラクションへとパラダイムシフトを促します。
すでに実証済みのもあり、Microsoft と提携して作成されたテディ・ルーズベルト大統領のアバターは、ホワイトハウスの Oval Office を再現した空間で来訪者と 10 分以上にわたる対話を行いました。さらに、ドナルド・トランプ前大統領が実際に会場を訪れ、このアバターと直接対話する姿も撮影されています。
「世界モデル」への賭け:物理法則と感情の理解
既存のアバター技術とは異なり、LemonSlice は「人間特化型の世界モデル」をトレーニングしています。多くの競合他社が特定の動きや表情に最適化したアプローチを取る中、Sidney は物理法則や物体の相互作用、そして感情を理解する汎用的なモデルを目指します。
このアプローチの最大の利点は、一度モデルを完成させれば、以下のような複雑な挙動が「自然に」生まれる点です。
- 全身アバターの滑らかな動き
- 物体との自然な相互作用(例:イヤリングの揺れ、水の動き)
- 微細な表情や感情の表現
「他のアプローチではこれらはすべて追加コストがかかりますが、世界モデルを使えば、それらがより容易に実現できます」
動画内でのデモでは、唇のメイクが落ちている状態から、服を着替え、背景を変え、さらに物理法則に従ってイヤリングが揺れる様子が示されました。これは、モデルが単なる画像生成ではなく、世界の物理ルールを理解していることを証明しています。
8 時間連続生成を可能にする「誤差蓄積」の解決策
リアルタイム動画生成において最大の技術的障壁の一つが、「誤差蓄積(Error Accumulation)」です。過去のフレームに依存して生成を進める際、わずかなノイズや歪みが次のフレームで増幅され、長時間になると映像が劣化してしまう問題です。
Sidney はこの課題に対し、独自のアプローチで解決しました。同社は、モデルが「未来」を見ないようにする注意マスク(attention mask)を適用し、過去のデータのみから推論を行う構造にしています。これにより、リアルタイム性と双方向性の欠如という制約の中で、安定した生成を実現しています。
「テディ・アバターは、8 時間連続でフレームごとに生成され続けても、リセットなしで動作します」
この技術により、16 時間にわたる連続生成でも目立った劣化が見られない状態を維持可能にしました。これは、エンタープライズ向けの長時間対話や、没入型アプリケーションの実用化にとって不可欠な要素です。
リアルタイム化と低コスト化の両立
Sidney は、拡散モデル(Diffusion Model)のデノイジングステップを従来の約 30 ステップから「1 ステップ」に圧縮することで、即時性を確保しています。これにより、高解像度のリアルタイム動画生成が可能になりました。
さらに驚くべきはコスト効率です。通常、AI 動画生成はデータ量が膨大で高コストになりがちですが、Sidney はモデルを最適化し、音声モデルと同程度の低コストで運用できる体制を整えています。
「音声モデルと比較して、動画モデルの方が遥かに多くのピクセルデータを扱います。それが音声と同じコストで運用できるのは驚異的なことです」
この低コスト化により、消費者向けのエンターテインメントアプリや、言語学習、AI セールスなど、多様なユースケースへの展開が可能になりました。
API としての提供と今後の展望
LemonSlice は、LLM(大規模言語モデル)や音声合成エンジン自体を提供するのではなく、それらを組み合わせた「視覚層」を API として提供するビジネスモデルを採用しています。利用者は自社の LLM や音声を選択し、Sidney のアバター機能を追加することで、即座にビデオエージェントを構築できます。
この技術は、AI エージェントに人間らしい視覚的・感情的な深みを与え、従来のテキストや音声中心の対話から、人間に近い臨場感のあるインタラクションへとパラダイムシフトを促します。特に誤差蓄積問題の解決とコスト削減により、エンタープライズ向けの高品質アバターサービスや消費者向けの没入型アプリケーションの実用化が加速すると予想されます。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。