WeChat、多モーダル埋め込みモデル「WeMM-Embedding」の技術報告を公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Tencent は WeChat の多様なコンテンツを扱うための汎用マルチモーダル埋め込みモデル「WeMM-Embedding」を発表し、小規模な 2B モデルが既存の大手オープンソースモデルを凌駕する性能を示した。
AI深層分析を開く2026年8月26日 12:41
AI深層分析
キーポイント
多様な入力形式と柔軟な出力
テキスト、画像、動画、視覚ドキュメント、および任意に交差するマルチモーダル入力をサポートし、柔軟な出力次元に対応するモデルファミリーである。
高性能なベンチマーク結果
2B バリアントは MMEB-v2 で既存の 8B ベースラインを上回り、9B バリアントは全体スコアで 80.6 の新記録を達成した。
実環境での大規模展開
WeChat Channels、公式アカウント、モーメンツ、EC サービスなど、26 の社内タスクと 14 のオンライン A/B テストで実証され、既に大規模に導入されている。
トレーニング手法の工夫
大規模なマルチモーダル整列段階と、厳選されたデータを用いた微調整段階という 2 つの段階を経て訓練が行われた。
重要な引用
WeMM-Embedding achieves leading performance on multiple public benchmarks.
the 2B variant already surpasses the previously leading 8B open-source baseline on MMEB-v2
It has been deployed at scale across recommendation and search applications
編集コメントを表示
編集コメント
WeChat の膨大なユーザーベースと多様なコンテンツ形式を背景に、実戦で検証された高性能な埋め込みモデルが公開された点は非常に注目される。特に小規模モデルで大型モデルを上回る成果は、リソース制約のある環境での導入を容易にする可能性を示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
ユニバーサルなマルチモーダル埋め込みは、現代の AI システムの中核コンポーネントとなりつつあります。これにより、検索や推薦、分類、エージェントシステムなどのアプリケーションで、多様なコンテンツを共有空間に表現することが可能になります。
本レポートでは、テキスト、画像、動画、視覚ドキュメント、そして任意に組み合わされたマルチモーダル入力を柔軟な出力次元でサポートする「WeMM-Embedding」というユニバーサル・マルチモーダル埋め込みモデルのファミリーを紹介いたします。このファミリーには 2B、4B、9B の 3 つのバリアントが含まれており、大規模なマルチモーダル整列ステージに続き、厳選されたデータ、微細な関連性監督、そしてクロススケールの知識転送を用いた精緻化ステージという 2 段階でトレーニングされています。
広範な評価において、WeMM-Embedding は複数の公開ベンチマークでトップクラスの性能を達成しました。特筆すべきは、2B バリアントがすでに以前最高の 8B オープンソースベースラインを上回る MMEB-v2 のスコアを記録している点です。さらに 9B バリアントでは、全体スコアで 80.6 という新たな最高記録を更新しました。
WeMM-Embedding はまた、WeChat 内のアプリケーションにおいても強力な実用性能を示しています。社内ベンチマークの 26 タスクで大幅な改善が見られ、14 のオンライン A/B テストでも一貫した向上が確認されました。すでに WeChat チャンネル、公式アカウント、モーメンツ、EC サービスなどを含む検索や推薦アプリケーションにおいて大規模に展開されています。
今後の研究を促進するため、モデルの重みとコードは https://github.com/Tencent/WeMM-Embedding で公開しています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み