ByteDance、多模態モデル DME を発表し SOTA 達成を報告
本文の状態
日本語全文を表示中
詳細モードで約34分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
ByteDance Engineering
ByteDance と中国人民大学が共同で開発した多模態検索モデル DME は、MMEB-v2 ベンチマークで SOTA を達成し、効率と細粒度を両立する新手法により AI 検索や Agent への応用を可能にした。
AI深層分析を開く2026年8月18日 20:51
AI深層分析
キーポイント
SOTA 性能の達成
DME モデルは MMEB-v2 ベンチマークにおいて、2B および 9B パラメータ規模で同サイズ最良(SOTA)を記録し、特に動画と視覚ドキュメント検索で顕著な成果を示した。
効率と細粒度の両立
「どこを見るか」と「何を記憶すべきか」を訓練段階で最適化することで、双编码器アーキテクチャでありながら、従来の手法が苦手とする細粒度的な検索能力を実現した。
実システムへの導入実績
DME の技術はすでに抖音のオンラインシステムに展開され、内部評価で 2.92% の相対向上と、生体指標(LT)において 0.1% の収益増を達成している。
AI 検索・Agent への適応
本モデルは単なる類似度信号ではなく、非対称な意味情報をベクトルに保持できるため、複雑な制約を持つ AI 検索や Agent の推論タスクに適している。
生成モデルからベクトルモデルへの転換アプローチ
DME は生成式大模型をベースに、まず大規模な対比学習で汎用的な表現能力を構築し、その後指令化データによるセマンティック・サフィシアンス学習で検索性能を強化する2段階の訓練を採用する。
重要な引用
「この発表の重要性は、効率と細粒度という相反する要件を両立させる新しいアプローチが実証された点にある」
「DME は MMEB-v2 の 78 データセットにおいて、2B および 9B パラメータ規模で同サイズ SOTA を達成した」
「オンラインシステムへの導入により、内部オフライン評価で 2.92% の相対向上と、LT 収益で 0.1% の改善を記録した」
生成式大模型天然面向生成任务,核心目标是基于隐层表示预测下一个 token;而向量模型面向表征与检索任务,核心目标是将不同模态、不同粒度的内容映射到统一向量空间中,并通过相似度完成匹配与召回。
編集コメントを表示
編集コメント
本モデルは、実運用環境での性能向上を明確に数値で示しており、研究段階の成果が即座にビジネス価値に変換された好例である。特に動画やドキュメントといった複雑なモダリティに対する検索精度の向上は、今後の AI アプリケーション開発において重要な指針となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2026 年 8 月 18 日 19:00 北京
抖音搜索多模态チームと中国人民大学の高瓴人工智能学院は共同で、抖音多模态表征モデル「DME(Douyin Multimodal Embedding)」を発表しました。多模态表征の権威ある評価ベンチマーク「MMEB-v2」(78 のデータセットを網羅し、画像・動画・視覚ドキュメントの 3 つの領域をカバー)において、DME モデルは 2B パラメータと 9B パラメータの両規模で SOTA(State-of-the-Art)を達成。全体のスコアはそれぞれ 74.8(2B)、78.4(9B)に達し、特に動画および視覚ドキュメント検索において顕著な優位性を示しています。
DME の技術はすでに抖音のオンラインシステムへ実装済みです。内部のオフライン評価セットでは全体で 2.92% の相対向上を記録。また、オンライン A/B テストにおいても、コアビジネス指標である LT(Lifetime)で 0.1% の収益増が確認されました。現在、生成型検索や視覚検索、AI 検索などのシーンで活用されています。
DME が検証した核心は、「検索表現の効率性」と「細粒度な理解」を両立できるという点です。「どこを見るべきか」「何を記憶すべきか」という 2 つのタスクを訓練段階で前倒しすることで、オンライン推論時の高効率性を担保しています。この能力は、10 億件規模の産業用検索シーンにも対応可能であり、検索結果に基づいて深い推論を行う AI 検索や Agent といった新興シナリオも支えることができます。これらのシーンでは、ベクトルが単なるソート用の類似度信号として機能するだけでなく、非対称な意味情報を真に担う必要があります。
MMEB-v2 における全体およびドメイン別のパフォーマンス:DME は 2B と 9B の両規模で同規模最優の成績を収め、特に動画と視覚ドキュメント検索での向上が顕著です。
論文リンク:https://arxiv.org/pdf/2608.02148
1. 背景:AI 時代において、検索能力はより基盤となる表現に依存する
大モデルの時代において、「表現(Embedding)」が担う役割は多様化しています。従来は主に検索や推薦システムを支えるものでしたが、現在は RAG(Retrieval-Augmented Generation)による外部知識の取得や、Agent が外部世界を認識するための検索ツールとして機能することも増えています。こうしたタスクが増加するほど、正確な証拠を呼び出すためにこの基盤層への依存度は高まります。
一方、新たな利用者が求めるものも変化しています。従来の検索ではクエリが短いキーワードであることが多く、「意味的に近い」コンテンツを関連づければ十分でした。しかし、AI 検索や Agent が発するものは、複数の制約を含む一連の指示文であることがほとんどです。求められるのは「見た目が関連している候補」ではなく、その後の推論を支える確かな証拠です。
これはベクトルに対して、これまで求められていなかった性質を要求します。単なるソート用の粗い類似度信号として機能するだけでなく、コンテンツの意味情報を真に担う必要があるのです。しかし、純粋な対比学習(Contrastive Learning)はこの点を保証しません。それは「どのペアが近づくべきか」のみを監督するものであり、ベクトル内にどのような意味情報が残っているかは考慮しないからです。
産業検索の現場では、この基盤層が同時に満たすべき二つの要件があります。第一に、タスクのカバレッジを十分に広げることです。クエリとコンテンツはどちらもテキスト、画像、動画、あるいはそれらの組み合わせとなり得ます。また、EC(電子商取引)やコンテンツ理解など多様なシナリオに対応する必要があります。第二に、10 億件規模のデータにおいても品質と効率を両立させることです。コンテンツはオフラインでエンコードしてインデックスを構築し、オンラインではクエリ側のエンコードのみを許容するという制約があります。
MMEB-v2 は広く利用されている公開ベンチマークであり、この基盤層の汎用的な信頼性を直接評価できる指標となっています。
抖音(TikTok)検索多模态チームが提案した DME も、まさにこれらの要件に焦点を当てて設計されています。堅固なデータとエンジニアリングを土台とし、さらに情報完全性を目的とした Stage 2 を革新的に追加しました。これにより、ベクトルは検索エビデンスの上に構築され、マッチング相手の微細な意味も保持されます。重要なのは、これらの能力がすべてトレーニング段階で完結しており、オンラインではほぼ追加の推論コストを発生させない点です。
MMEB-v2 における同規模モデルとの比較で SOTA(State-of-the-Art)を達成したことは、このアプローチの有効性を証明しています。品質も速度も十分に高いのです。
- 課題:現実的な産業検索システムの規模制約
三つのパラダイムのトレードオフ:対照学習は高速だが粗く、明示的な CoT は詳細だが遅い。DME はこの二つの利点を組み合わせた。
DME が解決しようとしているのは、ランキングボード上の課題ではなく、抖音(Douyin)の検索システムから生まれた実務的な問題です。動画プラットフォームである抖音では、検索対象となるコンテンツは数百億件に及び、そのモダリティも極めて複雑です。クエリは自然言語、画像、動画、あるいはそれらの組み合わせとなり得ます。一方、候補コンテンツには視覚フレーム、テキストと画像の組み合わせ、タイトル、OCR 文字、そして多様なメタデータが混在しています。
この規模と複雑さが、三つの重要な要件を突きつけました。そのうち二つは制約条件です。まず効率性について、数百億件のコンテンツをオフラインでエンコードしてインデックスを構築し、オンライン検索時にはクエリ側でのエンコードを一度だけ行う必要があります。これが双エンコーダーのアーキテクチャを決定づけます。次に細粒度性について、実際のクエリでは物体、属性、動作、OCR 文字、時間的・空間的な関係などに対する多重の制限が含まれることが多く、難易度の高いネガティブサンプルは正解サンプルと同じグローバルなシーンを共有し、局所的な領域や重要なフレームの違いのみで判別されるケースが珍しくありません。三つ目の要件は絶対的な能力への要求です。検索対象となるデータ量が膨大で分布も多様であるからこそ、モデルはまず広範かつ幾何学的に安定した表現空間を備えていなければなりません。そうでなければ、どれだけ精巧なメカニズムを導入しても効果を発揮できません。
これらの三つの要件に従えば、DME が取り組むべき課題と、それに対応する二つの学習フェーズが明確になります。
第一に、堅固なデータエンジニアリングによって広範な表現空間を構築することです。これが絶対的な能力の源泉となります。大規模で多様なモダリティを持つデータをスケーリングすることで、統一されたベクトル空間を広げます。特に動画や視覚ドキュメントといった、長いコンテキストと強い時系列特性を持つモダリティの上限を引き上げることに注力します。
第二に、効率性と細粒度性の二重制約の中で、モデルの細粒度感知能力を補完することです。ここでの難点は、デプロイ形態を変更できないことです。既存の対照学習アプローチは「どのインスタンス同士が近づくべきか」のみを監督しますが、「どこを見るべきか」「何を記憶すべきか」までは指示しません。一方、明示的な CoT(Chain of Thought)のような推論強化手法は細粒度性を向上させますが、テキスト生成や追加の前向き計算というコストを伴います。数百億件のコンテンツを扱うオンラインシステムにおいて、これを主要な検索エンコーダーとして機能させることは現実的ではありません。
- 方法論
3.1 学習の基盤:二段階学習、データのスケーリング、そして重要なトレードオフ
2 段階学習フレームワーク:第 1 段階は大規模な対比学習による事前学習、第 2 段階は意味的完全性の学習
学習の枠組み:2 段階学習
生成系大モデルは本質的に生成タスクを目的としており、その核心は隠れ層の表現に基づいて次のトークンを予測することにあります。一方、ベクトルモデルは表現と検索タスクに焦点を当てており、異なるモダリティや粒度を持つコンテンツを統一されたベクトル空間へマッピングし、類似度計算を通じてマッチングとリコールを実現します。
生成系大モデルを高品質なベクトルモデルへと転換するために、DME は 2 段階学習の枠組みを採用しました。まず大規模な対比学習によって汎用的な表現能力を構築し、その後、高品質な指令データを用いて検索シナリオにおける意味的完全性を強化します。
第 1 段階:大規模な対比学習による事前学習
第 1 段階では、約 2500 万組のデータペアを用いた大規模な対比事前学習を行います。目的は、網羅的で構造的に安定した統一多模態ベクトル空間を構築することです。この段階では、すべての訓練サンプルを「クエリ样本」と「関連样本」のペアとして構成し、テキスト、画像、動画など多様なデータ形態をカバーします。最適化には標準的な InfoNCE loss を採用しています。
大規模な対比学習を通じて、モデルは生成系モデルから表現モデルへの初期変換を完了し、モダリティやタスクを超えた基礎的な意味的アライメント能力を獲得します。これがその後の微調整の基盤となります。
ここで、image は第 i 番目のクエリサンプルを、
image は
image と一致する正解サンプル(ポジティブサンプル)を、
image はバッチ内における第 j 番目の候補サンプルをそれぞれ表します。また、
image は温度係数であり、類似度分布の滑らかさを調整する役割を果たします。
ステージ 2:意味的充足性の学習
第 2 段階では、約 500 万件の高品質データを用いて「セマンティック・サフィシェンシー(意味的充足性)」の学習を行います。
意味的充足性とは、単にベクトル表現が全体として関連するサンプルと整合していればよいのではなく、検索による証拠に基づいてモデル化され、かつ対象とのマッチングにおいて微細な意味情報を可能な限り保持することを指します。このため第 2 段階では、従来のコントラスト学習に加え、生成型連合訓練と暗黙的推論メカニズムを導入しました。これにより、モデルは単に「マッチする」だけでなく、「なぜマッチするのか」をより深く理解できるようになります。また、ハードネガティブ(難易度の高い負例)の学習も導入し、意味が似ているが等価ではないコンテンツを微細なレベルで区別する能力をさらに強化します。
訓練データ:構成と品質
データのスケーリング
モデルの基本性能は主に「データのスケーリング」によって確立されます。第 1 段階では、テキスト・画像・動画の 3 つのモダリティをカバーする大規模な弱監督データを主体とし、テキスト–テキストマッチング、画像–テキストマッチング、動画–テキストマッチングなど多様なデータ形態を含みます。これにより、異なるモダリティ間の基本的な意味アライメント能力をモデルに身につけさせます。
第 2 段階に入ると、訓練データはより高品質な監督データへと切り替わります。対象となるタスクには、画像–テキスト検索、動画–テキスト検索、ビジュアルドキュメント検索、QA(質問応答)、分類ベースの検索、そしてマルチモーダル検索などが含まれます。さらに、各タスクの目的を明確に理解できるよう、明示的なタスク指示も導入しています。
また、公開データでは不足している品質・シーンカバレッジ・時系列理解の部分を補うため、自社および合成データを追加で採用しました。具体的には、高品質な画像キャプションを用いて画像とテキストの意味アライメントを向上させます。長編動画のキャプションや、自社構築した動画–テキスト対照コーパスを活用することで、モデルが動画内容をより深くモデル化できるようになります。さらに、フレームレベルおよびクリップレベルでの密集監督を提供し、時系列情報や複雑な視覚シーンに対する理解力を高めます。
訓練中はタスクファミリーごとにバランスよくサンプリングを行い、特定のタスクや大規模データセットが訓練分布を支配してしまうのを防ぎます。これにより、多様な検索シナリオにおけるモデルの汎化能力と安定性を向上させます。
データクリーニング
訓練信号の安定性と一貫性を確保するため、すべてのサンプルを(クエリ样本,関連样本)という形式に統一し、空のサンプルや破損したデータ、低品質なキャプション、解像度の低い画像、および重複に近いサンプルを体系的に排除します。
負例空間の拡大
コントラスト学習において、負例空間の規模は訓練の難易度と表現の質に直結します。ここでは Batch Size を増やすことで in-batch 内の負例数を拡大し、モデルが各訓練ステップでより多くの候補ノイズに直面するようにしました。これによりマッチングタスクの識別難度を高め、モデルの表現能力をさらに強化しています。
ハードネガティブの掘り起こし
ランダムな負例のみでは、微細な意味差を区別する能力を十分に訓練できません。そのため、訓練前に既存モデルを用いて大規模な候補ライブラリに対してオフラインで検索・評価を行い、クエリと意味的に近く、モデルが誤って関連があると判断しやすいが実際にはマッチしないサンプルを選別します。これらをハードネガティブとして訓練に組み込みます。
ランダム負例と比較して、こうしたサンプルは実際の検索シーンにおけるノイズに近い存在です。より挑戦的な学習信号を提供し、モデルが「見た目は関連している」ものと「本当に関連がある」ものの境界をさらに明確に区別できるよう促します。その結果、類似するが等価ではないコンテンツの識別能力が高まり、検索結果の精度も向上します。
偽負例のフィルタリング
大規模なコントラスト学習では、一部の負例が正例と意味的に極めて近接しており、実際には妥当な回答となるケースもあります。こうしたサンプルをそのまま負例として訓練に用いると、モデルに誤った最適化信号を与えてしまいます。そこで、負例と正例ドキュメント間の類似度を計算し、スコアが高すぎるサンプル(潜在的な偽負例)をフィルタリングします。これにより、モデルが誤った勾配方向へ収束するのを防ぎ、訓練の安定性を高めています。
タスク均衡型 in-batch 混合サンプリング
同種タスク内での一貫性と、多様なデータタイプを混在させる柔軟性の両立を図るため、「タスク均衡型 in-batch 混合サンプリング」戦略を採用しました。これは、同じバッチ内で同一データソースから一定比率で連続的にサンプリングしつつ、異なるタスクタイプのデータを混入させる手法です。これにより、同種サンプルによる訓練安定性を維持しつつ、タスク間やモダリティ間の対照信号を増やし、より汎用的な統一表現を学習できるようになります。
訓練設定:効率、安定性、性能のバランス
訓練設定においては、主に 3 つのトレードオフに注力しました。まず限られたリソース下で大規模モデルをいかに効率的に適応させるか、次に大規模バッチでの対照学習(contrastive learning)における安定性をどう担保するか、そして多様なモダリティ入力による VRAM(ビデオ RAM)負荷をどう抑えるかです。
最終的に、パラメータ効率の高い微調整には LoRA を採用し、バッチサイズや学習率、温度係数といった重要なハイパーパラメータのチューニングに注力して、対照学習プロセスにおける収束安定性を確保しました。多モダリティ入力側では、画像トークン数と動画のフレーム抽出数を制限しています。具体的には、画像トークンは最大 1280 までとし、動画は均等に 32 フレームを抽出します。これにより、十分な視覚情報と時系列情報を保持しつつ、計算コストを抑えています。
また、訓練中は bf16 と gradient checkpointing、そして Zero オプションを組み合わせて VRAM 使用量を最適化し、大規模バッチや多モダリティの長文入力下でも安定した学習を実現しています。
Stage 2 訓練:対照学習による暗黙的推論と生成型監督の融合で、セマンティックな充分性を最適化
3.2 暗黙的推論:エンコーダーに「どこを見るべきか」を教える
Stage 1 の対照学習は最終的な類似度スコアのみを監督するものであり、エンコーダーが具体的にどの部分に注目すべきかは制約していませんでした。しかし、エージェント時代における検索要件では、モデルが暗黙的な推論要求を理解する必要があります。
DME のアプローチは、モデルに大量の明示的な推論テキストを生成させるのではなく、1 回のエンコーディングプロセスに少数の暗黙的トークンを追加し、簡易な内部推論フローを実行させることにあります。その手順は以下の通りです。
まず証拠を探す:モデルはテキスト、画像、または動画の中から最も重要な単語、領域、あるいはキーフレームを見つけ出します。各モダリティに対していくつかのアンカートークンを割り当て、学習可能な投影を通じて、アンカーの隠状態と同一モダリティ内のコンテンツトークンとのアテンション分布を計算します。これが「そのアンカーがどこを見ているか」を表します。教師モデルによって标注された証拠目標はトークンレベルの分布に変換され、証拠命中損失(evidence hit loss)によって監督されます。
次に証拠を理解する:単に「どこを見るか」だけでなく、「その部分が何を表しているのか」も理解する必要があります。アンカーの分布は同時に証拠表現を定義し、これを集約してグローバルな証拠表現を得ます。その後、教師モデルが生成したキャッシュベクトルとの余弦アライメントを行います。これはつまり、アンカーが正しい位置をカバーするだけでなく、プール化された証拠にもその位置本来持つべき意味情報が保持されることを要求しているのです。
そしてマッチング判断を行う:どの証拠が正例(positive sample)を支え、どの詳細が「似ているようで実は違う」ハードネガティブ(hard negative)を排除できるかを判断します。クエリ側には検索役割を持つ少数の暗黙的状態を追加配置し、その役割体系には localize(局所化)、align_pos(位置整合)、reject_neg(負例拒否)、summarize(要約)が含まれます。これらは 3 つの異なる目標によって監督されます。
- 意味定位状態:教師モデルの状態記述キャッシュベクトルとのアライメント
- 正例整合状態:軌道レベルの対照目標で訓練し、対応する正例を検索可能にする
- 負例拒否状態:相対的な負例よりも正例を優先するように学習させる
最後に検索ベクトルの生成:最終的に発見した証拠と判断結果を融合させ、後のベクトル検索に用いるための埋め込み(embedding)を作成します。
訓練時には、教師モデルが重要なテキストや画像領域、動画フレームを特定し、簡潔な意味的なヒントを提供することで、モデルが「どこを見るべきか」および「なぜその部分が重要なのか」を学習できるよう支援します。同時に、正例同士を近づけ、難易度の高いネガティブサンプルからは遠ざける学習も行われます。
このプロセスはすべて単一のエンコーダー順方向計算の内部で完結し、明示的な Chain of Thought (CoT) を生成することも、追加の多輪推論を必要ともしません。そのため、本番環境でも通常の埋め込みモデルと同様にベクトルを 1 つだけ出力すればよく、追加される遅延は極めて微小です。DME の目的は、双塔検索の効率性を維持したまま、埋め込みが単なる「全体の類似度」にとどまらず、真に関係性を決定づける局所的な証拠を保持できるようにすることにあります。
3.3 再構成損失:訓練目標であると同時に評価指標にも
3.2 節で「ベクトルがいかに形成されるか」の改善を図ったのであれば、本節では「ベクトルがどれだけ情報を保持すべきか」という制約を課します。チームは、純粋な対比学習による監督下では、MLLM のバックボーンから継承された微細な生成・理解能力が衰退し、かつベクトルに対して「関連するペアとそうでないものを明確に区別できる」意味情報が保持されるよう要求されていないことに気づきました。
訓練目標としての交叉条件再構成
手法を一言で要約すれば、「検索ベクトル自体を意味のボトルネックとして扱う」ということになります。
正規化前の読み出しベクトルを取得し、それをデコーダーシーケンスの最初のプレフィックストークンとして同じバックボーンに戻します。正样本ペアに対しては、query ベクトルを用いてドキュメント側のテキストを再構成し、対称的にドキュメントベクトルを用いて query 側のテキストを再構成します。このベクトルを正規化すれば検索用の埋め込みとなるため、「相手のテキストを再構成するために必要な情報」は必然的にこのベクトルを通じて流れることになります。
これに 2 つの補完的な目標を重ね合わせます。NTP(次トークン予測)では、相手側のテキストトークンのみに対してクロスエントロピーを計算します。一方、MTP(マルチトークン予測)では各位置でさらに D 個の未来トークンを追加監督し、ベクトルがより長距離にわたる相手の意味情報を捉えられるように促します。これにより、モデルは相手側の情報に対する理解をさらに最適化されます。
デコーダープロセスと MTP モジュールは、トークンレベルの勾配を共有バックボーンと読み出し層へ戻すためだけに使用され、推論時には完全に破棄されます。したがって、DME のオンライン運用では標準的な双エンコーダーとして動作し、追加のデコーディングは一切行われません。この監督学習は、オンライン検索チェーンに対してゼロの追加コストで完結します。
評価指標としての測定可能な表現完全性
「意味的十分性」を提唱した後、次なる課題はそれが実際に最適化されたことをどう証明するかです。チームは上記の監督手法を逆転させて評価指標を構築しました。
動機は極めて直接的です。「クロスエントロピーは無界であり、このベクトルが実際にはどの程度の情報を保持しているかが判別できない」からです。そこで NTP 目標を有界形式に改変し、池化されたベクトルを唯一の条件プレフィックスとして与え、教師強制(teacher-forcing)で実行します。そして、正解トークンが Top-K 予測に含まれる割合、すなわち acc@K を統計的に算出します(各サンプルは最大 10 位置のみ評価し、マイクロ平均化)。この指標は [0,1] の範囲に収まり、「ベクトルが Top-K 以内で目標の先頭トークンを何個回復できるか」をそのまま読み取れるため、データセットや方向、モダリティ間での比較が可能になります。
4 つの探査方向が 2 つのカテゴリの問題に答えます。自己再構成方向(q2q、d2d)はベクトルが自身のコンテンツをどの程度忠実に再現できるかを測定し、相互方向(q2d、d2q)はペアの相手側情報をどれだけ保持しているかを測定します。可視化結果については実験 4.3 節をご覧ください。
- 実験結果
4.1 MMEBv2 の SOTA レコード更新
MMEB-v2 の 78 データセット全体において、DME-2B は 74.8、DME-9B は 78.4 を記録し、いずれも同規模モデルの中で最良のスコアを達成しました。これはアリババや Meta などが提案した表現モデルの指標を上回るものです。Image(75.9 / 79.8)、Video(65.6 / 70.8)、VisDoc(79.9 / 82.0)の 3 つのドメインでバランスよく先行しており、多様なモダリティにおける汎用的な一般化能力を保証しています。
MMEB-v2 の主要結果(78 データセット):DME は 2B と 9B の両モデルサイズにおいて、同規模の最先端技術(SOTA)を達成しました。
4.2 消融実験
トレーニングモジュールの検証
Stage-2 のデータを用いて各モジュールを順次追加し、その有効性を段階的に確認しました。全体スコアは 70.9 から 74.8 に向上し、累積で +3.9 ポイントの改善が見られました。
Stage 1:大規模事前学習では +1.6(70.9→72.5)の向上があり、特に動画(+4.0)と視覚ドキュメント(+1.9)での効果が顕著でした。
Stage 2-A:潜在空間推論(Latent Reasoning)では +1.3(72.5→73.8)の改善が見られ、動画タスク単体で +4.4 の大きな伸びを記録しました。
Stage 2-B:再構成損失(Reconstruction Loss)の導入により +1.0(73.8→74.8)の上昇があり、3 つのドメインすべてで均等に効果が発揮されました。
累積トレーニング配方の診断:3 つのモジュールを順次追加することで、全体スコアは 70.9 から 74.8 に引き上げられました。
トレーニングパラメータの検証
負サンプル空間の拡大
バッチサイズ(Batch Size)を大きくすることで、バッチ内の負サンプル数を増やし、対比学習の難易度とモデルの識別能力を高めることができます。実験結果によると、バッチサイズを 128 から 8192 に増加させることで、各指標は全体的に順調に向上しました。しかし、さらにバッチサイズを増やすと性能の上昇は頭打ちとなり、場合によっては低下することさえあります。その主な原因は、バッチ内の偽の負サンプルによるノイズが増加し、困難な負サンプルに対する勾配が多数の単純な負サンプルによって希釈されてしまう点にあります。
負サンプル空間の拡大:バッチサイズが指標に与える影響
タスク均衡型 In-batch 混合サンプリング
単一タスク内での訓練の一貫性と、多様なデータソースを混合することによる多様性の両方を兼顾するために、タスク均衡型の In-batch 混合サンプリング戦略を検証しました。これは、同じバッチ内で異なるデータ源から一定の比率で連続的にサンプリングする手法です。その結果、サンプリング比率が 0.25 の場合に、タスクの一貫性とデータの多様性のバランスが最も良く、全体の性能も最適であることが示されました。
混合サンプリング:混合サンプリング比率が指標に与える影響
視覚解像度とフレーム数の最適化
動画のフレーム抽出戦略:トレーニングおよび推論時のフレーム数を 8 フレームから 32 フレームへ引き上げることで、長時間動画における動作や意味情報の捕捉能力を大幅に強化しました。
動画のフレーム抽出:動画のフレーム抽出戦略が指標に与える影響
画像トークンの拡張:トレーニングおよび推論時の画像入力解像度を高めることで、視覚的な詳細を表現する能力を強化しました。
画像解像度:画像解像度が指標に与える影響
4.3 表現の完全性:数値指標と可視化結果の相互検証
3.3 で定義した acc@K を用いて 4 つの方向性を評価した結果、ベクトルは単なる順序付けのための粗い要約ではなく、情報的に十分であることが示されました。具体的には、自己再構成方向で q2q が 87.9%、d2d が 74.3%(Top-1)、跨方向では d2q が 87.7%、q2d が 65.9% を記録しました。また、すべての方向において Top-10 の精度は 88% を超えています。
ドメインごとの差異も直感通りです。構造が整った VisDoc は最も再構成が容易で(q2d で 95.1%)、一方、動画における跨方向のタスクが最も困難でした(59.2%)。これは、テキストによる検索と時系列視覚目標の間には本質的な情報格差が存在することを反映しています。
「acc@K」の 4 つの評価軸:Self は自己再構築の完全度、Cross は相手側の完全度を指します。
ベクトルを唯一の前綴としてバックボーンに戻し、貪欲デコード(原始テキストや視覚トークンは一切提供しない)を行うと、これらの数値が何を意味するか直感的に理解できます。
ベクトルは依然として「言語で解読可能」です。純粋な画像入力や純粋な動画入力から得られたベクトルであっても、一貫性があり文脈に沿ったテキストを生成できます。これは対照学習が行っても、バックボーンの生成・理解能力が単なる類似度計算に圧縮されて崩壊していないことを示しています。
これは逐字コピーではなく抽象化されたボトルネックです。長い指示クエリは「Hamster eating food(ハムスターが食事をする)」といったコンパクトなフレーズとして解読され、検索の要点は保持されつつ表面的な詳細は捨てられています。
ベクトルには、クエリとターゲットの間の意味的な共通部分が浮かび上がります。例えば、クエリ側で「Hamster eating food」と解読された場合、ターゲット側では「Hamster」が解読されます。「Saxophone player in a music store(楽器店でサックスを演奏する人)」は「Saxophone player(サックス奏者)」に対応します。検索の関連性は本来、マッチングペア間の共有意味に基づいて定義されるものです。この現象は、再構築損失がなぜ有効なのかをメカニズムレベルで説明しています。同時に、これらのベクトルが単なるソート用の類似度信号ではなく、さらに消費可能な意味情報を担っていることも示唆しています。これは AI 検索やエージェントの検索において必要な性質です。
再構築の可視化:ベクトル 1 つのみを与え、原始入力は何も提供しない状態で両側を解読すると、共有概念が安定して浮かび上がります。
4.4 効率:性能と効率の両立。クエリあたりのコストは 1 ミリ秒未満
暗黙的推論(Implicit Reasoning)を有効化すると、クエリエンコーダーの p50 レイテンシ増加分は、純粋なテキストで +0.87 ms、テキストと画像の組み合わせで +0.08 ms、動画で +0.80 ms となりました(すべてクエリあたり)。いずれも 1 ミリ秒以内です。
この結果は設計通りのものです。暗黙的推論では自己回帰的な生成や多段階の推論を行わず、単に同一の前向計算内で数個の soft token を追加するだけです。特に動画のような入力の場合、計算量は元々原始視覚トークンによって支配されており、追加コストがさらに薄められます。
4.2 の結果と比較すると、MMEB-v2 で 3.9 ポイントの向上を達成しながら、オンラインでのコストは 1 ミリ秒未満。このコスパこそが、DME が主要な検索ループに組み込まれることを可能にした前提条件です。
クエリエンコーダーの p50 レイテンシ比較:暗黙的推論を有効化した場合の追加コストは、クエリあたりすべて 1 ミリ秒以内です。
4.5 実装効果:抖音(TikTok)でのオフライン評価で +2.92%、オンラインでは LT が +0.1%
DME を初期化モデルとして活用し、社内環境で関連技術を移植して継続訓練を行った結果、抖音(Douyin)の内部オフライン評価セットにおいて全体で相対的に 2.92% の向上を達成しました。特に 4 つのクロスモーダル方向において一貫した改善が見られ、Text2Video は +3.10%、Text2Image は +3.03%、Image2Video は +2.83%、Image2Image は +2.70% とそれぞれ高水準で向上しています。
オンライン運用においては、DME をすでに抖音の検索機能に導入し、生成型検索を支える基盤として機能するとともに、ランキング段階での特徴量としてスコアリングに活用されています。A/B テストの結果、主要業務指標である LT(Lifetime)が +0.1% 改善することが実証されました。現在では、生成型検索やビジュアル検索、AI 検索など、複数の実際のユースケースで広く採用されています。
5. まとめと展望
DME の取り組みは、産業現場における効率性と細粒度な制約の両立という課題にどう取り組むかを模索したものです。多モーダル表現のためのデータ構築、訓練のパラダイム、そして評価のガイドラインを体系的に探求することで、第一段階では表現の基礎能力を整備し、第二段階では対照学習が持つ「どの 2 つのインスタンスを近づけるか」という情報だけでは不足していた具体的なコンテンツの細粒度情報を補完しました。これを実現したのは、Latent Reasoning とクロス条件再建(Cross-condition Reconstruction)です。
生成目標を表現訓練に導入する意義はここにあります。検索結果が Agent や AI 検索によってさらに消費される時代において、ベクトル内に何が留められているかという点が、単なるランキング精度よりも重要視されるべきなのです。産業現場と次世代の Agent に奉仕する高品質かつ高効率な汎用多モーダル表現モデルを構築し、公開評価や抖音のオフライン・オンラインの多様なシナリオにおいて安定した成果をもたらしました。
検索精度向上のための従来のアプローチが、オンラインでの推論追加、ランキング加重、ツール呼び出しに依存する傾向が強まる中、DME はあえて逆方向の解法を示しました。つまり、認知負荷を訓練段階へ前倒しすることで、オンライン処理をシンプルに保つという発想です。遅延やインデックスコストに制約されるあらゆる検索システムにとって、このアプローチは参考になるはずです。
今後はチームがデータとモデル規模の 2 つのスケーリング軸に沿ってさらに推進していく予定で、初期の実験ですでに一貫した効果が見られています。
表現(Representation)とは、大規模モデル時代の古いインフラストラクチャではありません。むしろ、その土台となる基盤なのです。この基盤をより堅固に築くことで、その上に構築される推論が安定して機能するようになります。
6. チームへの参加
私たちは抖音を支える多モーダル検索技術チームです。多モーダル大規模モデルの技術を駆使して検索システムの世代交代を推進し、ユーザーにとって最適な多モーダル検索入口を創出することを目指しています。
当チームでは、2000 基以上の GPU からなる計算クラスターと超巨大規模の多モーダルデータに触れる機会があります。大規模な Continue Train、Post Train、CoT+RL(Chain of Thought + Reinforcement Learning)、生成型検索といった技術分野を実践的に学ぶことができます。チームは高い人材密度を誇り、活気ある技術文化が根付いています。
現在、2028 年以降に卒業予定の学生を対象にインターンシップ生を募集しています。多モーダル関連の経験と堅固な数理的基礎を持っていることが求められます。週 3 日以上出勤が可能で、4 ヶ月以上の継続的な实习(実習)が可能な方を歓迎します。
応募方法:履歴書を wangyuanjiang@bytedance.com まで送信してください。件名は「氏名 + 学校名 + 实习期間」の形式としてください。
WeChat で開く
原文を表示
Data-搜索 2026-08-18 19:00 北京
image
抖音搜索多模态团队联合中国人民大学高瓴人工智能学院,发布抖音多模态表征模型 DME(Douyin Multimodal Embedding),在多模态表征权威评测榜单 MMEB-v2(78 个数据集,覆盖图像、视频、视觉文档三大域)上,DME 模型在 2B、9B 两个参数量级下均取得对应规模 SOTA,整体得分分别达到 74.8(2B)、78.4(9B),视频与视觉文档检索的优势尤为突出。DME 的技术已部署进抖音线上系统:内部离线评测集整体相对提升 2.92%;线上 A/B 实验验证核心业务指标 0.1% 的 LT(Lifetime)收益,目前已应用于生成式搜索、视觉搜索、AI 搜索等场景。
DME 想验证的核心是:检索表征的“效率”与“细粒度”不必二选一。将 “该看哪里” 和 “必须记住什么” 两大任务前置至训练阶段,保障在线推理的高效性。该能力不仅适配百亿级工业检索场景,还可支撑 AI 搜索、Agent 等需要依托检索结果开展深度推理的新兴场景。在这类场景下,向量需要真正承载非对称语义,而不只是作为排序所用的相似度信号。
MMEB-v2 上的整体与分域表现:DME 在 2B 与 9B 两个量级上都取得同规模最优,视频与视觉文档检索的增益尤为明显。
论文链接:https://arxiv.org/pdf/2608.02148
- 背景:AI 时代,检索能力比以往更依赖底层表征
表征(Embedding)在大模型时代承接的任务变多了:此前主要服务搜索与推荐链路,如今还要为 RAG 取回外部知识、为 Agent 充当感知外部世界的检索工具。当承接的任务变得更多的时候,就越依赖这层地基把证据准确取回来。
而新调用方要的东西也变了。传统搜索的 query 多是短关键词,把"语义相近"的内容拉到一起就够用;AI 搜索与 Agent 发出的往往是一整句带多重约束的指令,要的不是"看起来相关的候选",而是能支撑后续推理的证据。这对向量提出了一个此前不被要求的性质:不能只留一个用于排序的粗糙相似度信号,还得真正承载住内容语义——而纯对比学习恰恰不保证这件事,它只监督"哪两个该靠近",不关心向量里留下了什么。
在工业检索场景,这层地基要同时满足两件事:一是覆盖足够广的任务——查询与内容都可能是文本、图像、视频或它们的混合,且包含电商、内容理解等各类场景;二是在百亿级规模下同时保住质量与效率——内容要能离线编码建索引,在线只允许一次查询侧编码。MMEB-v2作为被广泛使用的公开榜单,能够直接的衡量这层地基的通用可靠性。
抖音搜索多模态团队提出的 DME 就是围绕这两件事做的:以扎实的数据与工程为底座,再创新性地增加一个以信息完备为目标的 Stage 2——让向量建立在检索证据之上、并保留住匹配对面的细粒度语义。关键在于这些能力都被放在训练阶段完成,在线几乎不引入额外推理消耗。MMEB-v2 上的同量级 SOTA 验证了这条路走得通:质量足够高,速度也足够快。
- 痛点:真实的工业检索系统规模约束
三种范式的取舍:对比式够快但粗,显式 CoT 够细但慢,DME取二者优势交集
DME 面对的问题不是从榜单里来的,是从抖音的检索系统里来的。在抖音这样的视频平台上,待检索内容是百亿量级,且模态高度复杂:查询可能是自然语言、图片、视频或它们的混合,候选内容里同时存在视觉帧、图文、标题、OCR 文字与各类元信息。
这个规模与复杂度给出了三重要求。前两个是约束:效率上,百亿级内容必须能离线编码建索引、在线只允许一次查询侧编码,这直接锁定了双编码器形态;细粒度上,真实查询往往带有对物体、属性、动作、OCR 文字、时序或空间关系的多重限定,而难负例常与正样本共享同一个全局场景,只差一个局部区域或一个关键帧。第三个则是对绝对能力的要求:正因为待检索的数据量足够大、分布足够杂,模型必须先具备一个覆盖广、几何稳定的表征空间,否则再精细的机制也无从发挥。
顺着这三重要求,DME 需要做的事就很清楚了,也正好对应两个训练阶段:
用扎实的数据工程支撑起足够广阔的表征空间。这是绝对能力的来源——通过大规模、多模态的数据 scaling,先把统一向量空间撑开,尤其是视频与视觉文档这类长上下文、强时序模态的上限。
在效率与细粒度的双重约束下,补足模型的细粒度感知能力。难点在于不能为此改变部署形态:现有对比学习路线只监督"哪两个实例该靠近",不告诉模型该看哪里、该记住什么;而显式 CoT 一类的推理增强路线虽然能提升细粒度,却要付出文本生成与额外前向的代价,在百亿级在线系统里做主检索编码器并不成立。
- 方法
3.1 训练基石:两阶段训练、数据Scaling与关键取舍
两阶段训练框架:一阶段大规模对比学习预训练,二阶段语义充分性学习
训练范式:两阶段训练
生成式大模型天然面向生成任务,核心目标是基于隐层表示预测下一个 token;而向量模型面向表征与检索任务,核心目标是将不同模态、不同粒度的内容映射到统一向量空间中,并通过相似度完成匹配与召回。为了将生成式大模型改造为高质量向量模型,DME 采用了两阶段训练范式:先通过大规模对比学习建立通用表征能力,再通过高质量指令化数据强化检索场景下的语义充分性。
Stage 1:大规模对比学习预训练
第一阶段使用约 2500 万组数据对进行大规模对比预训练,目标是构建一个覆盖广泛、结构稳定的统一多模态向量空间。在这一阶段,训练样本统一组织为(查询样本,相关样本)形式,覆盖文本、图像、视频等多种数据形态,并采用标准的 InfoNCE loss 进行优化。通过大规模对比学习,模型能够完成从生成式模型到表征模型的初步转化,建立跨模态、跨任务的基础语义对齐能力,为后续精调打下基础。
其中,image表示第 i 个查询样本,
image表示与
image匹配的正样本,
image表示 batch 内第 j 个候选样本。
image表示温度系数,用于调节相似度分布的平滑程度。
Stage 2:语义充分性学习
第二阶段使用约 500 万条高质量数据进行语义充分性(Semantic Sufficiency)学习。所谓语义充分性,是指一个好的向量表示不仅要在整体语义上与相关样本对齐,还应当基于检索相关证据进行建模,并尽可能保留匹配对象中的细粒度语义信息。为此,Stage 2 在对比学习的基础上,进一步加入生成式联合训练与隐式推理机制,使模型不仅能 “匹配得上”,也能更充分地理解 “为什么匹配”。同时,本阶段引入难负例训练,进一步强化模型对语义相近但并不等价内容的细粒度区分能力。
训练数据:数据构成与质量
数据 Scaling
模型的基础能力主要依赖 数据 Scaling 来建立。Stage1 以大规模弱监督数据为主,覆盖文本、图像、视频三大模态,包括文本–文本匹配、图像–文本匹配、视频–文本匹配等多种数据形态,帮助模型在不同模态之间建立基础语义对齐能力。
进入 Stage 2 后,训练数据切换为更高质量的监督数据,覆盖图文检索、视频文本检索、视觉文档检索、问答、分类式检索和混合模态检索等多类任务,并显式引入任务指令,使模型能够更好地理解不同检索场景下的任务目标。
此外,我们还引入了一批自有和合成数据,用于补足公开数据在质量、场景覆盖和时序理解上的不足。例如,通过高质量图像 caption 提升图文语义对齐质量,通过长视频 caption 和自建视频–文本对齐语料增强模型对视频内容的建模能力,并为模型提供帧级与片段级的密集监督,从而提升其对时序信息和复杂视觉场景的理解能力。
训练过程中,我们按任务族进行平衡采样,避免单一任务或大规模数据集主导训练分布,从而提升模型在不同检索场景下的泛化能力与稳定性。
数据清洗
为保证训练信号的稳定性和一致性,我们将所有样本统一归一化为(查询样本,相关样本)格式,并系统剔除空样本、损坏样本、低质量 caption、低分辨率图像以及近重复样本。
负样本空间扩容
在对比学习中,负样本空间的规模直接影响训练难度和表征质量。我们通过增大 Batch Size 扩展 in-batch 负样本数量,使模型在每一步训练中面对更多候选干扰项,从而提升匹配任务的区分难度,并进一步增强模型的表征能力。
难负例挖掘
仅依赖随机负样本,往往不足以训练模型对细粒度语义差异的区分能力。因此,我们在训练前先使用已有模型对大规模候选库进行离线召回与打分,从中筛选出与 query 语义相近、模型容易误判为相关、但实际并不匹配的样本,作为难负样本加入训练。
相比随机负样本,这类样本更接近真实检索场景中的干扰项,能够为模型提供更有挑战性的学习信号。通过引入离线挖掘得到的难负样本,模型需要进一步学习区分 “看起来相关” 和 “真正相关” 的边界,从而提升对相似但不等价内容的判别能力,并增强检索结果的精确性。
伪负例过滤
在大规模对比学习中,部分负样本可能与正样本语义高度接近,甚至实际上也是合理答案。这类样本如果被直接作为负例参与训练,会向模型传递错误的优化信号。为此,我们通过计算负样本与正样本文档之间的相似度,过滤掉分值过高的样本,即潜在的伪负例,避免模型在错误梯度方向上收敛,提升训练稳定性。
任务均衡的 In-batch 混合采样
为了兼顾同任务训练的一致性与多类型数据混合的多样性,我们探索了任务均衡的 In-batch 混合采样策略:在同一个 Batch 内,对同一数据源按一定比例进行连续采样,同时混入不同任务类型的数据。这样既能保留同源样本带来的训练稳定性,又能增加跨任务、跨模态的对比信号,帮助模型学习更通用的统一表征。
训练配置:效率、稳定性与性能的平衡
在训练配置上,我们重点关注三类取舍:一是如何在有限资源下高效适配大模型,二是如何保证大 batch 对比学习的稳定性,三是如何控制多模态输入带来的显存压力。
最终,我们采用 LoRA 进行参数高效微调,并围绕 batch size、学习率和温度系数等关键超参进行调优,以保证对比学习过程中的收敛稳定性。多模态输入侧,我们对图片 token 数和视频抽帧数量进行了约束:图片 token 数最多为 1280,视频均匀抽取 32 帧,在保留足够视觉与时序信息的同时控制计算成本。
同时,训练中结合 bf16 与 gradient checkpointing 以及 Zero 优化显存使用,使模型能够在较大 batch 和多模态长输入下稳定训练。
Stage 2 训练:对比学习联合隐式推理和生成式监督优化语义充分性
3.2 隐式推理:让编码器知道"该看哪里"
Stage 1 的对比学习只监督最终相似度分数,不约束编码器该关注哪里,而 Agent 时代的检索要求模型理解隐含的推理要求。DME 的思路不是让模型生成一大段显式推理文本,而是在一次编码过程中加入少量隐式 token,让模型先完成一套简单的内部推理流程:
先找证据:模型从文本、图片或视频中找到最关键的词、区域或关键帧。模型为每个模态分配若干 anchor token,通过可学习投影计算 anchor 隐状态与同模态内容 token 的注意力分布,即"该 anchor 看向哪里";教师标注的证据目标转成 token 级分布后,用证据命中损失监督。
再理解证据:不只是知道“看哪里”,还要理解这部分内容表达了什么。anchor 分布同时定义出一个证据表征,聚合后得到全局证据表征,再与教师模型产出的缓存向量做余弦对齐。意义在于:不只要求 anchor 覆盖到正确位置,还要求池化出的证据保留住那个位置本该有的语义。
然后做匹配判断:判断哪些证据支持正样本,哪些细节能够排除那些“看起来很像、但其实不对”的 hard negative。查询侧额外放置少量带检索角色的隐式状态,角色体系包含 localize、align_pos、reject_neg、summarize,分别用三类目标监督:语义定位状态与教师状态描述的缓存向量对齐;正样本对齐状态以轨迹级对比目标训练,使其能检索出对应正样本;负样本拒绝状态要求相对负样本更偏好正样本。
最后生成检索向量:最终把找到的证据和最终判断融合成一个 embedding,用于后续向量检索。
训练时,教师模型会帮助标出关键文本、图片区域或视频帧,并给出简短的语义提示,指导模型学会“应该看哪里”和“这部分为什么重要”。同时,模型还会学习让正样本更接近、让难负样本更远。
整个过程都发生在同一次编码器前向计算内部,不会生成显式 CoT,也不需要额外多轮推理。因此上线时仍然和普通 embedding 模型一样,只输出一个向量,额外延迟很小。DME 的目标就是在保持双塔检索效率的前提下,让 embedding 不再只是“整体相似”,而是能够保留真正决定相关性的局部证据。
3.3 重建损失:既是训练目标,也是评估指标
如果说 3.2 改善的是"向量怎么形成",这一节约束的是向量必须留住多少信息。团队观察到,在纯对比学习监督下,MLLM 骨干继承来的细粒度生成理解能力会趋于退化,而且向量从未被要求保留那些"真正区分开一个相关对"的对面语义。
作为训练目标:交叉条件重建
做法可以概括为一句话:把检索向量本身当成语义瓶颈。
取归一化之前的读出向量,作为解码序列的第一个前缀 token 送回同一个骨干。给定正样本对,用 query 向量重建 document 侧文本,再对称地用 document 向量重建 query 侧文本。由于该向量归一化后就是检索用的 embedding,任何"重建对面文本所需的信息"都被迫从这个向量里流过。
在此之上叠加两个互补目标:NTP(下一 token 预测)只在对面侧文本 token 上计算交叉熵;MTP(多 token 预测)在每个位置额外监督 D 个未来 token,促使向量捕捉更长程的对面语义,进一步优化模型对于对侧信息的理解。
在解码过程与 MTP 模块只用于把 token 级梯度回传进共享骨干与读出层,推理时整体丢弃。因此 DME 在线仍是标准双编码器,不做任何额外的解码——这套监督对在线检索链路是零额外开销。
作为评估指标:可测量的表征完备度
提出"语义充分性"之后,紧接着的问题是怎么证明它真的被优化了。团队把上面的监督反过来做成了一个评估指标。
动机很直接:交叉熵无界,看不出"这个向量到底留住了多少内容"。于是把 NTP 目标改写成有界形式——只给一个池化向量作为唯一条件前缀,在 teacher-forcing 下跑一遍,统计 ground-truth token 落在 Top-K 预测里的比例,即 acc@K(每样本只评估前 10 个位置,micro 平均)。指标落在 [0,1],可直接读成"向量能在 Top-K 猜测内恢复出目标前若干 token 的比例",因而在数据集、方向与模态之间可比。
四个探测方向回答两类问题:自重建方向(q2q、d2d)衡量向量对自身内容的还原忠实度;跨向方向(q2d、d2q)衡量它留住了多少配对对面的信息。可视化结果见实验4.3章节。
- 实验结果
4.1 刷新公开榜单MMEBv2 SOTA 纪录
在 MMEB-v2 的 78 个数据集上,DME-2B 整体 74.8,DME-9B 整体 78.4,两个量级均为同规模最优。超过阿里和Meta等公司或团队提出的表征模型指标。三个域上均衡领先——Image 75.9 / 79.8、Video 65.6 / 70.8、VisDoc 79.9 / 82.0,保证了在多种模态下的通用泛化能力。
MMEB-v2 主结果(78 个数据集):DME 在 2B 与 9B 两个量级上均取得同规模 SOTA。
4.2 消融实验
训练模块消融
在同一份 Stage-2 数据上做累积式叠加,逐步验证三个模块的有效性。整体从 70.9 提升到 74.8,累积 +3.9 分
Stage 1 大规模预训练:+1.6(70.9→72.5),增益集中在视频(+4.0)与视觉文档(+1.9);
Stage 2-A Latent Reasoning:+1.3(72.5→73.8),视频单项 +4.4;
Stage 2-B 重建损失:+1.0(73.8→74.8),三个域增益均衡。
累积训练配方诊断:三个模块逐步叠加,整体从 70.9 提升到 74.8。
训练参数消融
负样本空间扩容
增大 Batch Size 可以扩展 in-batch 负样本空间,从而提升对比学习的训练难度和模型判别能力。实验显示,当 Batch Size 从 128 增加到 8192 时,模型在各项指标上整体稳步提升。但当 Batch Size 进一步增大时,性能提升趋于饱和甚至出现回落,主要原因在于batch内伪负样本的干扰加剧,以及困难负样本梯度被大量简单负样本稀释等。
负样本空间扩容:batch size对于指标的影响
任务均衡的 In-batch 混合采样
为了兼顾同任务训练的一致性与多类型数据混合的多样性,我们探索了任务均衡的 In-batch 混合采样策略,即在同一个 Batch 内,不同数据源按一定比例连续采样。结果显示,采样比例为 0.25 时,模型在任务一致性和数据多样性之间取得了较好平衡,整体效果最优。
混合采样:混合采样配比对于指标的影响
视觉分辨率与帧数优化
视频抽帧策略:将视频训练和推理时的抽帧数量从 8 帧提升至 32 帧,显著增强了对长视频动作和语义的捕获。
视频抽帧:视频抽帧策略对于指标的影响
图像 Token 扩展:通过增大训练和推理时的图像输入分辨率,强化对视觉细节的表征能力。
图像分辨率:图像分辨率对于指标的影响
4.3 表征完备度:指标与可视化相互印证
按 3.3 定义的 acc@K 探测四个方向,结果表明向量是信息完备的,而非只保留了一个用于排序的粗糙摘要:自重建方向 q2q 87.9%、d2d 74.3%(Top-1),跨向方向 d2q 87.7%、q2d 65.9%,四个方向的 Top-10 均超过 88%。分域差异也符合直觉——结构规整的 VisDoc 最易重建(q2d 达 95.1%),视频跨向最难(59.2%),反映文本查询与时序视觉目标之间天然的信息差。
四个方向的 acc@K:Self 为自重建完备度,Cross 为对面完备度
把向量作为唯一前缀送回骨干做贪心解码(不提供任何原始文本或视觉 token),可以直观看到这些数字对应什么:
向量仍是"语言可解码"的——包括纯图像、纯视频输入的向量,都能解码出连贯切题的文本,说明对比训练没有把骨干的生成理解能力压塌成纯相似度几何。
它是抽象瓶颈,不是逐字复制——长指令查询被解码成 "Hamster eating food" 这样的紧凑短语,保留检索要点、丢弃表面细节。
向量会浮现查询与目标的语义交集——查询侧解码出 "Hamster eating food",目标侧解码出 "Hamster";"Saxophone player in a music store" 对应 "Saxophone player"。检索相关性本就定义在匹配对的共享语义上,这一现象从机制上解释了重建损失为何有效;同时也说明这些向量承载的是可被继续消费的语义,而非仅够排序的相似度信号——这正是 AI 搜索与 Agent 检索所需要的性质。
重建可视化:只给一个向量、不给任何原始输入,两侧解码出的共享概念稳定浮现。
4.4 效率:性能与效率友好,代价每 query 不到 1 毫秒
启用隐式推理后,查询编码的 p50 延迟增量为 纯文本 +0.87 ms、图文 +0.08 ms、视频 +0.80 ms(每 query),全部在 1 毫秒以内。
原因符合设计预期:隐式推理不做自回归生成、不做多轮推理,只是在同一次前向里多加了几个 soft token;对视频这类输入,计算本就被原始视觉 token 主导,额外成本被进一步摊薄。
与 4.2 对照:3.9 分的 MMEB-v2 提升,在线代价不到 1 毫秒——这个性价比是 DME 敢于进主检索链路的前提。
Query 编码器 p50 延迟对比:开启隐式推理的额外成本每 query 均在 1 毫秒以内。
4.5 落地效果:抖音场景离线 +2.92%,线上 LT +0.1%
以 DME 为初始化,把相关技术迁移到内部设定下继续训练,在抖音内部离线评测集上取得整体相对提升 2.92%,四个跨模态方向高度一致:Text2Video +3.10%、Text2Image +3.03%、Image2Video +2.83%、Image2Image +2.70%。
线上侧,DME已部署于抖音搜索,支撑生成式搜索,并作为排序阶段的特征参与打分,A/B 实验验证核心业务指标 LT(Lifetime)+0.1%。目前已应用于生成式搜索、视觉搜索、AI 搜索等多个真实场景。
- 总结与展望
DME工作探索了如何在工业场景的高效与细粒度场景限制要求,通过系统探索多模态表征的数据组建、训练范式与评测引导,在一阶段搭建了完善了表征基础能力,第二阶段则是补充了对比监督信号的内容缺失,对比学习只告诉模型哪两个实例该靠近,确没有包含具体的内容细粒度信息——Latent Reasoning 与交叉条件重建共同补上了这件事。这也是我们认为生成式目标值得被引入表征训练的原因——当检索结果要被 Agent 或 AI 搜索继续消费时,向量里留下了什么,比它排得多准更值得关心。构建了服务于工业场景以及下一代Agent的高质高效通用多模态表征模型,在公开评测、抖音离在线多个场景取得了稳定的收益。
当提升检索精度的常规解法越来越倾向于在线加推理、加重排、加工具调用时,DME 给出的是一个反方向的样本——把认知负担前移到训练,让在线保持简单。对任何受延迟与索引成本约束的检索系统,这个方向都值得参考。接下来团队会沿数据与模型规模两条 scaling 继续推进,初步尝试均已带来一致增益。
表征不是大模型时代的旧基建,而是它的地基。地基做得更扎实,上面的推理才有可能站得更稳。
- 加入我们
我们是服务于抖音的多模态搜索技术团队,致力于用多模态大模型技术推动搜索系统代际升级,打造用户首选的多模态搜索入口。在这里,你有机会接触到 2000+ GPU 算力集群与超大规模的多模态数据,可以亲手实践大规模Continue Train、Post Train、CoT+RL、生成式搜索等技术方向。团队人才密度高、技术氛围浓厚,现招募 2028 年及之后毕业的实习生,要求具备多模态经验与扎实的数理基础,每周到岗≥3天,能持续实习4个月以上。
投递方式:发送简历至 wangyuanjiang@bytedance.com,邮件标题格式为「姓名 + 学校 + 实习时长」。
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み