Apple、言語モデルと正規化フローを統合した多モーダル生成モデル「STARFlow2」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
Apple Machine Learning は、自己回帰型正規化フローを用いた統一型多モーダル生成モデル「STARFlow2」を提案し、テキストと画像の連続的な理解・推論・生成を実現した。
AI深層分析を開く2026年8月25日 22:55
AI深層分析
キーポイント
既存アプローチの構造的欠陥の特定
既存のアプローチは、離散トークン化による視覚忠実度の低下や、因果的なテキスト生成と反復拡散に基づくノイズ除去を組み合わせる構造的不対称性、あるいはビジョン・ランゲージモデルの適応に伴う事前学習された理解力の劣化という構造的断絶に直面している。
自己回帰型正規化フローの採用
本研究は、自己回帰型トランスフォーマーと同等の因果マスク、KVキャッシュ機構、および左から右への構造を共有する「自己回帰型正規化フロー」が最適な解決策であることを示唆し、これを統合モデルに適用している。
統一されたマルチモーダル生成の実現
言語モデルと正規化フローを橋渡しすることで、テキストと画像の交差シーケンスを理解し、推論し、生成する構造的に断絶のない統一型マルチモーダルモデルの構築を目指す。
重要な引用
Unified multimodal models that understand, reason over, and generate interleaved text–image sequences remain structurally fragmented
existing approaches either sacrifice visual fidelity through discrete tokenization, impose structural asymmetry by combining causal text generation with iterative diffusion-based denoising, or degrade pretrained understanding when adapting vision-language models for generation
autoregressive normalizing flows are autoregressive Transformers—sharing the same causal mask, KV-cache mechanism, and left-to-right structure as LLMs
編集コメントを表示
編集コメント
Apple が公開したこの論文は、生成AIの分野におけるアーキテクチャの根本的な再設計を試みた重要な試みである。既存の手法が抱える構造的な矛盾を解消するアプローチとして、技術コミュニティから注目を集める可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
テキストと画像を交互に扱うシーケンスを理解し、推論し、生成する統合型マルチモーダルモデルは依然として構造的に断片化されています。既存のアプローチでは、離散トークン化によって視覚の忠実度が損なわれるか、因果的なテキスト生成と反復的な拡散ベースのノイズ除去を組み合わせることで構造的非対称性が生じるか、あるいは生成のためにビジョン・ランゲージモデルを適応させる際に事前学習された理解力が低下するという課題があります。我々は、自己回帰型正規化フローが因果マスク、KVキャッシュ機構、左から右への構造という点で LLM と同じく自己回帰型トランスフォーマーであることを見出しました。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み