Google TPU上でLLM推論を高速化:拡散型予測デコーディングによる3倍の速度向上を実現
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Google Developers AI
UCSD(カリフォルニア大学サンディエゴ校)の研究チームは、Google TPU上でブロック拡散型予測デコーディング手法「DFlash」を実装し、従来の逐次推論のボトルネックを克服して推論速度を3倍に向上させることに成功した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

UCSD の研究者たちは、従来の自己回帰的ドラフト生成の逐次的ボトルネックを回避するために、ブロック拡散型推測デコーディング手法である DFlash を Google TPUs 上で実装することに成功しました。トークンを一つずつ予測するのではなく、候補となるトークンのブロック全体を単一の順方向パスで「描画」することで、システムは平均して 3.13 倍の高速化を実現し、EAGLE-3 などの既存手法と比較してピーク性能はほぼ倍増しました。このオープンソースでの vLLM エコシステムへの統合により、複雑な推論タスクにおいて「無料」と言える並列検証と高品質なドラフト予測を活用することで、TPU ハードウェアの最適化が達成されています。
原文を表示

Researchers at UCSD have successfully implemented DFlash, a block-diffusion speculative decoding method, on Google TPUs to bypass the sequential bottlenecks of traditional autoregressive drafting. By "painting" entire blocks of candidate tokens in a single forward pass rather than predicting them one-by-one, the system achieved average speedups of 3.13x, with peak performance nearly doubling that of existing methods like EAGLE-3. This open-source integration into the vLLM ecosystem optimizes TPU hardware by leveraging "free" parallel verification and high-quality draft predictions for complex reasoning tasks.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み