多様なモダリティが統合学習する仕組みを解明する研究発表
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
本研究はマルチモーダル事前トレーニングの物理的メカニズムを解明し、言語・視覚理解・生成間の知識フローや非対称性を明らかにするとともに、早期統合の重要性と計算コスト削減のための具体的なレシピを提示する。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月9日 22:19
AI深層分析
キーポイント
知識フローの解明と非対称性
言語、視覚理解、視覚生成間の知識転送パターンを分析し、相互影響に明確な非対称性が存在することを示した。
相乗効果と競争の条件
データの複雑さがモダリティ間の関係性を決定し、共有アテンションや正規化などのアーキテクチャ選択が相乗効果を促進することが実証された。
早期統合の優位性とビジョン・ラジネス
初期段階からの統一トレーニングが後期整合性や逐次学習より効果的であり、遅れた統合は「ビジョン・ラジネス」現象を引き起こし言語 priors への依存を招くことが示された。
高効率な事前トレーニングレシピ
計算予算のわずか5%で強力な生成性能を発揮する効率的な事前トレーニングの手順が導出され、13.5B モデルでの大規模検証でも裏付けられた。
重要な引用
Unifying modalities from the very early stages and training them jointly is shown to be more effective than late alignment or sequential training.
This process uncovers a vision laziness phenomenon, where delayed integration leads models to rely on language priors.
We derive efficient pretraining recipes that achieve strong generative performance using only 5% of the compute budget.
編集コメントを表示
編集コメント
本研究は「なぜ」早期統合が有効なのかという物理的な理由を解明し、単なる経験則を超えた理論的基盤を提供している点で極めて価値が高い。開発者は今後、モデル設計において計算コストと性能のバランスを取る際、この論文で示された「ビジョン・ラジネス」のリスクや相乗効果の条件を厳密に考慮する必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
アブストラクト:ビジョンは、ファウンデーションモデルの進展における重要な軸であり、ネイティブに統合されたマルチモーダル事前学習への転換を牽引しています。しかし、この動きにもかかわらず、統合トレーニング中に各モダリティがどのように相互作用するかという設計空間や根本的なメカニズムについては、まだ十分に探求されていません。
私たちは、マルチモーダル事前学習の体系的な探索を通じて実証的な知見を提供します。合成データと大規模な実世界データの両方で行った制御実験から、マルチモーダル事前学習の物理法則に関する4 つの重要な洞察が得られました:
(i) 知識の流れ:言語、視覚的理解、そして視覚的生成が、どのようにして各モダリティ間で知識を転送するかを解明し、それぞれの影響と非対称性の明確なパターンを明らかにしました。
(ii) シナジーと競争:データの「複雑さ」が主に、モダリティ同士がシナジーを発揮するかどうかを決定することを示しました。また、共有アテンションやモダリティ固有のフィードフォワード層を持つ正規化など、シナジーを促進するアーキテクチャ上の選択を特定し、これらの振る舞いが異なるビジュアルトークナイザー設計においても一般化することを発見しました。
(iii) 早期統合:最初からモダリティを統一して共同でトレーニングすることは、後期の整合化や逐次的なトレーニングよりも効果的であることが示されました。このプロセスは「ビジョンの怠惰(vision laziness)」という現象も明らかにします。これは、統合が遅れるとモデルが言語の事前知識に依存してしまう状態です。
(iv) 実践的なレシピ:計算リソースのわずか 5% の予算で強力な生成性能を達成できる効率的な事前学習のレシピを導き出しました。
これらの核心的な知見は、さらに大規模な検証が行われます。具体的には、135 億パラメータの MoE モデルを複数作成し、2 トリオントークンのデータで学習させることで実証しました。本研究が、マルチモーダル事前学習の理解と拡張に向けた確固たる基盤となることを願っています。
| コメント: | プロジェクトページ:この https URL |
|---|---|
| 対象分野: | コンピュータビジョンとパターン認識 (cs.CV); 機械学習 (cs.LG); マルチメディア (cs.MM) |
| 引用形式: | arXiv:2608.05000 [cs.CV] |
| (またはこのバージョン用:arXiv:2608.05000v2 [cs.CV]) | |
| https://doi.org/10.48550/arXiv.2608.05000 arXiv 発行 DOI (DataCite 経由) |
提出履歴
投稿者:Junlin Han [メールを表示] [[v1]](https://arxiv.org/abs/2608.05000v1)
2026年8月5日(水)16:09:25 UTC (5,027 KB)**
[v2]**
2026年8月6日(木)17:18:02 UTC (5,025 KB)
原文を表示
Abstract:Vision offers a critical axis for advancing foundation models, driving a shift towards natively unified multimodal pretraining. Despite this momentum, the design space and the fundamental mechanisms of how modalities interact during unified training remain underexplored. We provide empirical clarity through a systematic exploration of multimodal pretraining. Our controlled experiments on both synthetic and large-scale real-world datasets yield four key insights into the physics of multimodal pretraining: (i) Knowledge Flow: We disentangle how language, visual understanding, and visual generation transfer knowledge across modalities, revealing distinct patterns of influence and asymmetry; (ii) Synergy vs. Competition: We show that data "complexity" largely determines whether modalities are synergistic, identify architectural choices that promote synergy: such as shared attention and normalization with modality-specific feed-forward layers, and find that these behaviors generalize across different visual tokenizer designs; (iii) Early Unification: Unifying modalities from the very early stages and training them jointly is shown to be more effective than late alignment or sequential training. This process uncovers a vision laziness phenomenon, where delayed integration leads models to rely on language priors; (iv) Recipes: We derive efficient pretraining recipes that achieve strong generative performance using only 5% of the compute budget. These core findings are subsequently validated at scale by training multiple 13.5B MoE models on 2T tokens. We hope this study provides a principled foundation for understanding and scaling multimodal pretraining.
| Comments: | Project page: this https URL |
|---|---|
| Subjects: | Computer Vision and Pattern Recognition (cs.CV); Machine Learning (cs.LG); Multimedia (cs.MM) |
| Cite as: | arXiv:2608.05000 [cs.CV] |
| (or arXiv:2608.05000v2 [cs.CV] for this version) | |
| https://doi.org/10.48550/arXiv.2608.05000 arXiv-issued DOI via DataCite |
Submission history
From: Junlin Han [view email] [[v1]](https://arxiv.org/abs/2608.05000v1)
Wed, 5 Aug 2026 16:09:25 UTC (5,027 KB)**
[v2]**
Thu, 6 Aug 2026 17:18:02 UTC (5,025 KB)
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み