LLaDA-Image:完全オープンな画像生成フレームワークと学習レシピ
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
LLaDA-Image は画像のみで事前学習した Diffusion Transformer を基盤とし、高解像度かつ指示追従性の高い画像生成を実現する新たなオープンソースモデルであり、2〜4 ステップでの推論も可能となる。
AI深層分析を開く2026年9月4日 11:50
AI深層分析
キーポイント
独自の前学習手法による性能向上
同社は最初から画像・テキストペアデータに依存せず、画像のみを用いた事前学習と中間学習(mid-training)によって強力な視覚生成_prior_を構築した。
効率的な最適化技術の採用
DiT 全体にパラメータフリーの RMSNorm と Muon オプティマイザを使用し、2.2 億サンプル(実画像 98 枚)を用いた大規模トレーニングを効率化した。
高速推論モデルの提供
LLaDA-Image を蒸留して LLaDA-Image-Turbo を作成し、2〜4 ステップのサンプリングで高速な推論を可能にした。
オープンソースベンチマークでの新記録
Qwen-Image-Bench において英語および中国語トラックでそれぞれ 53.53、53.38 のスコアを達成し、オープンソースモデル間で新たな最高記録となった。
重要な引用
We introduce LLaDA-Image, a unified framework that pairs a 6B Diffusion Transformer (DiT) trained from scratch with a frozen vision-language understanding module built on the LLaDA2.0-Mini diffusion language model backbone.
Instead of relying heavily on paired image-text data from the beginning, we first build a strong visual generative prior through image-only pre-training and mid-training.
On Qwen-Image-Bench, LLaDA-Image achieves overall scores of 53.53 and 53.38 on the English and Chinese tracks, respectively, setting a new state-of-the-art among open-source models on both tracks.
編集コメントを表示
編集コメント
画像データのみで事前学習を行う手法が、ペアデータの不足を補いながら高性能な生成モデルを実現した点は注目すべき技術的進展である。トレーニングレシピの完全公開により、業界全体での再現性と研究の加速が期待される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
LLaDA-Image は、ゼロからトレーニングされた 6B の Diffusion Transformer (DiT) と、LLaDA2.0-Mini の拡散言語モデルバックボーンを基盤とした固定のビジョン・ランゲージ理解モジュールを組み合わせた統合フレームワークです。初期段階で画像とテキストのペアデータに過度に依存するのではなく、まずは画像のみを用いた事前学習と中間学習を通じて強力な視覚的生成事前知識を構築します。
生成パイプラインには 2.2 億サンプルが含まれており、そのうち実写画像は 98 枚です。効率的かつスケーラブルな最適化のため、DiT 全体にパラメータ不要の RMSNorm と Muon オプティマイザーを採用しています。
結果として得られた統合モデルは、極めてフォトリアリスティックな画像を生成しつつ、微細な編集指示にも正確に従うことができます。さらに、LLaDA-Image を LLaDA-Image-Turbo に蒸留することで、2〜4 ステップのサンプリングで高速推論を実現しました。
Qwen-Image-Bench における評価では、LLaDA-Image は英語トラックで 53.53、中国語トラックで 53.38 の総合スコアを記録し、オープンソースモデル間で両トラックともに新たな最高性能(SOTA)を達成しています。
能力が高く効率的な生成モデルに関するさらなる研究を支援するため、当社はモデルの重み、トレーニングコード、詳細なレシピを公開します。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み