TrajTok:軌跡トークンの学習により動画理解が向上
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らが、動画モデルの効率と拡張性を向上させるため、外部パイプラインに依存しない統合型トークナイザー「TrajTok」を提案した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
動画モデルにおけるトークン化は、通常パッチ化を通じて行われますが、これにより過剰かつ冗長な数のトークンが発生します。これは動画の効率性とスケーラビリティを著しく制限しています。最近では、動画の持続時間をトークン数から分離することで有望な解決策を提供する経路ベースのトークナイザーが登場していますが、これらは複雑で低速であり、タスクに依存しない外部セグメンテーションおよび追跡パイプラインに依存しています。私たちは、下流の目的のために動画モデルと完全に統合され共学習されるエンドツーエンド型の動画トークナイザーモジュール「TrajTok」を提案します。これは、意味的複雑度に応じて動的にトークンの粒度を適応させます…
原文を表示
Tokenization in video models, typically through patchification, generates an excessive and redundant number of tokens. This severely limits video efficiency and scalability. While recent trajectory-based tokenizers offer a promising solution by decoupling video duration from token count, they rely on complex external segmentation and tracking pipelines that are slow and task-agnostic. We propose TrajTok, an end-to-end video tokenizer module that is fully integrated and co-trained with video models for a downstream objective, dynamically adapting its token granularity to semantic complexity…
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み