DiffusionGemma の技術報告書が公開され、詳細な実装と評価が明かされる
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
Google DeepMind が DiffusionGemma の技術報告を発表し、画像生成モデルのトレーニング効率を大幅に向上させる新しいアーキテクチャと学習手法を開発したことを明らかにした。
AI深層分析を開く2026年8月5日 23:55
AI深層分析
キーポイント
DiffusionGemma の新アーキテクチャ
Google DeepMind は、画像生成タスクにおいて従来の拡散モデルよりも効率的なトレーニングを実現する新しい DiffusionGemma アーキテクチャを提案した。
学習効率の劇的向上
同技術は、同等の性能を達成するために必要な計算リソースやデータ量を大幅に削減し、トレーニングコストの低減と速度向上を実現する。
オープンソース技術報告書の公開
DiffusionGemma チームは、詳細な実験結果とアーキテクチャ設計を記した技術報告書を arXiv に公開し、研究コミュニティへの貢献を示した。
並列トークン生成による高速化
DiffusionGemma は従来の自己回帰モデルと異なり、256 トークンのブロックを並列に反復的に改善することで、1 フォワードパスあたり約 20 トークンを生成する。これにより単一の NVIDIA H100 GPU で秒間約 1,500 トークンの出力速度を実現し、最先端の推測デコーディングを備えた自己回帰モデルよりも大幅に高速である。
計算効率の高い学習パイプライン
このモデルはスクラッチから訓練するのではなく、Gemma 4 モデルを微調整することで得られ、開始時の自己回帰モデルの総トレーニングトークン予算の 10% 未満で済む。2 つの段階的なトレーニングプロセスには、双方向ノイズ除去を教える教師あり微調整と、生成品質と推論効率を同時に向上させる強化学習およびサンプリャ蒸留が含まれる。
重要な引用
Authors: DiffusionGemma Team
DiffusionGemma Technical Report (49 minute read)
DiffusionGemma establishes a new Pareto frontier for the trade-off between generation speed and model capability.
Despite diffusion fine-tuning, it remains capable of AR generation with only minor performance degradation, suggesting a path toward hybrid diffusion-AR decoding.
編集コメントを表示
編集コメント
画像生成モデルのトレーニング効率化は、大規模モデル開発におけるコスト削減の鍵となる重要な進展である。技術報告書の公開により、研究コミュニティが迅速に検証・発展を進める環境が整ったと言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
著者:DiffusionGemma チーム
Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, [Jean
Tarbouriech 氏、Pavel Tyletski 氏、Çağlar Ünlü 氏、Cindy Wu 氏、Glenn Cameron 氏、Jerome Connor 氏、Sertan Girgin 氏、Maarten Grootendorst 氏、Alon Levkovitch 氏、Eliya Nachmani 氏、Omar Sanseviero 氏、Piotr Stanczyk 氏、Quentin Berthet 氏、Andrew Campbell 氏、Clément Crepy 氏、Valentin De Bortoli 氏、Arnaud Doucet 氏、Romuald Elie 氏
著者:Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor
要旨:DiffusionGemma は、離散拡散モデルを用いて極めて高速にテキストを生成する実験的なオープンウェイト言語モデルです。従来の自己回帰(AR)型大規模言語モデルが持つ逐次デコーディングのボトルネックを回避するため、DiffusionGemma は一度に 256 トークンのブロックを並列で反復的に精緻化します。
ゼロから学習するのではなく、活性化パラメータ 38 億、総パラメータ 252 億の混合専門家(MoE)モデルである Gemma 4 を微調整することで DiffusionGemma を構築しました。計算効率に優れた 2 段階のトレーニングパイプラインでは、元の AR モデルの学習トークン予算の 10% 未満しか使用しません。
第一段階では教師あり微調整(SFT)により双方向のノイズ除去を学習させ、第二段階では強化学習とサンプリャの蒸留を組み合わせて、生成品質と推論効率の両方を同時に向上させます。DiffusionGemma は、生成速度とモデル能力のトレードオフにおいて新たなパレート最適 frontier を確立しました。
包括的な評価スイート全体での平均値として、1 回のフォワードパスあたり約 20 トークンを生成し、単一の NVIDIA H100 GPU で秒間約 1,500 トークンの出力を実現します。これは最先端のスペキュレーティブ・デコーディングを備えた AR モデルと比較しても大幅に高速です。さらに DiffusionGemma は、思考モード(thinking mode)、マルチモーダル入力、および長いコンテキストへの対応という、元モデルが持つ機能も維持しています。
拡散モデルのファインチューニング後も、わずかな性能低下にとどまりながら、自己回帰(AR)生成を継続して実行できる能力を維持しています。これは、拡散と自己回帰を組み合わせたハイブリッドなデコーディングへの道筋を示唆するものです。
| 対象分野: | 計算言語学 (cs.CL); 人工知能 (cs.AI) |
|---|---|
| 引用形式: | arXiv:2608.00146 [cs.CL] |
| (またはこのバージョン用: arXiv:2608.00146v1 [cs.CL]) | |
| https://doi.org/10.48550/arXiv.2608.00146 arXiv 発行 DOI (DataCite 経由) |
提出履歴
送信者:ジャン・タブルリエシュ [メールを表示] [v1]
2026年7月31日(金)16:11:46 UTC (6,116 KB)
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み