効率的な運動学生成のための長期運動埋め込みの学習
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、トラッカーモデルから得た大規模軌道データから長期運動埋め込みを学習する手法を開発し、動画合成に代わってシーン動態を効率的にモデル化・生成する技術を実現した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
運動の理解と予測は、視覚知能の基本的な構成要素です。現代のビデオモデルはシーンダイナミクスの強力な理解を示していますが、完全なビデオ合成を通じて複数の可能な未来を探索することは、実用的でないほど非効率的です。私たちは、トラッカーモデルから得られた大規模な軌道データから学習された長期運動埋め込み(long-term motion embedding)に対して直接操作することで、シーンダイナミクスを桁違いにより効率的にモデル化します。これにより、テキストプロンプトや空間的なポーク(spatial pokes)で指定された目標を満たす、長く現実的な運動を効率的に生成することが可能になります。これを実現するために、私たちは…
原文を表示
Understanding and predicting motion is a fundamental component of visual intelligence. Although modern video models exhibit strong comprehension of scene dynamics, exploring multiple possible futures through full video synthesis remains prohibitively inefficient. We model scene dynamics orders of magnitude more efficiently by directly operating on a long-term motion embedding that is learned from large-scale trajectories obtained from tracker models. This enables efficient generation of long, realistic motions that fulfill goals specified via text prompts or spatial pokes. To achieve this, we…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み