動画記事 · AI Engineer
Google DeepMind の Brendon Dillon が語る Text Diffusion
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Google DeepMind の研究者が、テキスト拡散モデルの仕組み、自己修正機能、低レイテンシという利点と、バッチ処理時のスループット低下という課題について詳述。
テキスト生成の常識を覆す「Text Diffusion」:Google DeepMind が語る速度と自己修正の可能性
画像生成で SOTA(最先端)となっている拡散モデルを、テキスト領域へ適用する「Text Diffusion」。Google DeepMind の研究科学者 Brendon Dillon 氏は、この技術が従来の自己回帰型モデルとは異なる「双方向の文脈理解」と「動的な計算」を実現し、推論の質と速度のトレードオフを再定義する可能性を示しました。
ノイズからテキストを復元する仕組み
Text Diffusion の基本原理は、画像生成モデルと同じです。学習時には、完全な文章(クリーンなトークン)に徐々にノイズを加え、ニューラルネットワークがそのノイズを除去して元のテキストに戻すよう訓練します。
推論時(生成時)には、純粋なランダムなノイズからスタートし、反復的にノイズを除去していくプロセスを経て、最終的な文章を完成させます。自己回帰型モデルが「1 トークンずつ順に生成する」のに対し、拡散モデルは「トークンのシーケンス全体を一度に取り込み、数回のイテレーションで洗練させる」というアプローチを取ります。
最初はノイズだらけですが、徐々にテキストを埋めていき、最終的には比較的クリーンな出力が得られます。これは画像生成と同じ原理です。
自己回帰型との決定的な違い:双方向性と自己修正
Text Diffusion の最大の強みは、「双方向アテンション(注意機構)」の活用にあります。
従来の GPT や Gemini などの自己回帰モデルは、因果的アテンションを持つため、過去のトークンしか参照できません。一方、拡散モデルは生成途中であっても未来のトークンを参照できるため、以下のような高度な機能が実現されます。
1. 推論中の自己修正能力
モデルが生成途中でミスを検知した場合、過去に戻って修正することが可能です。Dillon 氏は、数学的な計算問題(81 の平方根に 2/3 を掛け、その結果を二乗して 36+3 を足すなど)のデモを示しました。
- 自己回帰モデル: GPT-4o や Gemini 2.5 Flash などの大規模モデルでさえ、最初の推測(例:「40」や「42」)に固執し、一度間違えると訂正できないケースがありました。
- Text Diffusion: 初期段階では「60」と誤答しても、数回のイテレーションを経て「49」へ修正。さらに推論を続け、最終的に正解の「39」に到達しました。
未来のトークンに基づいて自己修正生成的な処理が可能です。答えが間違っていると気づけば、後戻りして修正するといったこともできます。
2. 動的計算(Adaptive Computation)
問題の難易度に応じて、モデルが自動的に推論ステップ数を調整します。
- 簡単なタスク: パイの小数点以下 100 桁を記憶するだけなら、わずか 4 ステップで完了します。
- 複雑なタスク: コード生成(FizzBuzz)には約 18 ステップ、量子力学の説明には 31 ステップが必要になります。
モデル自身が「もう十分だ」と判断するまで計算を続けるため、簡単な問題では高速に、難しい問題では丁寧に回答できます。これは、推論コストと品質のバランスを最適化する画期的な特性です。
ハードウェアが支える「低レイテンシ」の正体
なぜ Text Diffusion は自己回帰型よりも遅いのに、「低レイテンシ(応答速度)」を実現できるのでしょうか?その理由は、GPU や TPU のハードウェアアーキテクチャにあります。
現在の AI チップは、計算能力(FLOPS)に比べてメモリ帯域幅がボトルネックとなっています。自己回帰モデルは 1 トークン生成ごとにネットワーク全体と KV キャッシュをメモリから読み込む必要があるため、この帯域制限に強く縛られます。
一方、Text Diffusion はトークンのシーケンス全体に対して数回のパス(例:24 パス)で処理を行うため、メモリへのアクセス回数を自己回帰型と比較して約 10 分の 1 に抑えることができます。メモリ帯域がボトルネックとなる環境では、このアプローチが劇的な速度向上をもたらします。
テキストから画像生成のモデルが自己回帰型モデルよりもはるかに低遅延である理由は、ハードウェア的な理由にあります。メモリ転送回数が減れば、約 10 倍高速になります。
実用化への課題:スループットとコストの壁
一方で、Text Diffusion には明確な弱点もあります。それが「大規模バッチ処理時のスループット低下」です。
自己回帰モデルは、1 クエリあたりの速度は遅いものの、大量のリクエストを並列処理(バッチ化)することで、全体のスループットとコスト効率を最大化できます。しかし、Text Diffusion は各クエリに対して複数回の順伝播が必要となるため、大量のクエリを捌くサーバーサイドでの運用には向いていません。
大規模なバッチ処理におけるスループットが低いことが主な欠点です。個々のユーザーにとってはレイテンシが低くても、全体のスループットは低下し、提供コストが高くなります。
このため、現時点では Claude や GPT-4o のような大規模クラウドサービス全体を置き換えるには至っていません。しかし、「オンデバイス」や「ロボット制御」など、大量クエリを捌く必要がなく、単一クエリの低遅延とリアルタイム性が求められる用途では、大きな可能性を秘めています。
結論:ハイブリッドな未来へ
Text Diffusion は、テキスト生成における「速度」と「推論の質」の関係性を根本から変える技術です。双方向性による自己修正や、問題に応じた動的計算は、複雑な推論タスクにおいて人間に近い柔軟さを生み出します。
大規模クラウドサービス全体への置き換えにはコスト効率の壁がありますが、用途を明確に分けたハイブリッドなアーキテクチャが主流になると予想されます。特に、エッジデバイスやリアルタイム性が求められる分野での AI 応用拡大に寄与し、私たちが想像もしていなかった新しいアプリケーションの可能性を開く鍵となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。