Apple、動画生成を高速化する新技術発表
Apple Machine Learning は、拡散モデルにおける計算ボトルネックである時空間アテンションの非効率性を解消し、生成速度を大幅に向上させる「Calibrated Sparse Attention」手法を発表した。
キーポイント
不要なトークン接続の特定とスキップ
多くの入力において、トークン間の接続スコアが実質的にゼロになるケースが多く存在し、これらを計算から除外しても結果への影響はほとんどないことを発見した。
局所ブロック間でもパターンが再現
この現象は個々のトークンだけでなく、ローカルなトークンブロック間の接続においても同様に観察され、広範な適用可能性を示している。
計算コストの削減による速度向上
上記の洞察に基づき、不要なアテンション計算をスキップする手法を提案することで、Transformer ベースのバックボーンにおけるボトルネックを解消し、動画生成のランタイムを加速させる。
重要な引用
a significant fraction of token-to-token connections consistently yield negligible scores across various inputs
their patterns often repeat across queries
the attention computation in these cases can be skipped with little to no effect on the result
影響分析・編集コメントを表示
影響分析
この技術は、Transformer ベースの拡散モデルが抱える根本的な計算コストの問題に対する具体的な解決策を示しており、リアルタイムまたは高頻度の動画生成アプリケーションの実現可能性を高める。特に、Apple が自社のハードウェアやソフトウェアエコシステムにおいて、より効率的なマルチモーダル処理を実現するための基盤技術として活用される可能性がある。
編集コメント
動画生成の速度課題に対する根本的なアプローチとして、不要な計算を排除する「スパース化」の考え方は非常に示唆に富んでいます。特に、そのパターンが普遍的であるという発見は、実用化に向けた重要な一歩と言えます。
近年の拡散モデルは高品質な動画生成を可能にしましたが、実行速度が遅いという課題を抱えています。これらのモデルで使用される大規模なトランスフォーマーベースのバックボーンは、時空間アテンション計算によってボトルネックとなっています。
本論文では、さまざまな入力においてトークン間の接続のうち相当数が一貫して無視できるスコアしか示さず、そのパターンがクエリ間でも繰り返し現れることを明らかにしました。つまり、これらのケースにおけるアテンション計算は、結果にほとんど影響を与えずに省略可能です。この観察結果は、局所的なトークンブロック間の接続についても同様です。
こうした知見に基づき、本研究では…
原文を表示
Recent diffusion models enable high-quality video generation, but suffer from slow runtimes. The large transformer-based backbones used in these models are bottlenecked by spatiotemporal attention. In this paper, we identify that a significant fraction of token-to-token connections consistently yield negligible scores across various inputs, and their patterns often repeat across queries. Thus, the attention computation in these cases can be skipped with little to no effect on the result. This observation continues to hold for connections among local token blocks. Motivated by this, we…
関連記事
今日のまとめ
AI日報で今日の重要ニュースをまとめ読み