ブロック単位拡散による効率的なテキストから 3D 生成手法「Block3D」
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
研究チームは Block3D というブロック分割拡散フレームワークを提案し、TRELLIS-500K ベンチマークで生成時間を約 5.15 倍短縮しながら幾何学的忠実度を維持する成果を示した。
AI深層分析を開く2026年8月25日 18:40
AI深層分析
キーポイント
ブロック分割拡散フレームワークの提案
既存の自己回帰的デコードや全表現を反復処理する拡散モデルの課題に対し、離散形状トークン系列を連続するブロックに分割して生成・共同ノイズ除去を行う Block3D を提案した。
エラー蓄積の解消と精度維持
各ブロック確定前に低信頼度のトークンを修正する「自信度ガイド付きブロック内補正」を導入し、自己回帰モデル特有のエラー蓄積を緩和した。
推論コストの劇的削減
TRELLIS-500K のホールドアウトセットでの評価により、平均エンドツーエンド生成時間を 25.71 秒から 4.99 秒へ短縮し、自己回帰ベースラインに対して 5.15 倍の高速化を達成した。
重要な引用
Block3D, a block-wise diffusion framework that partitions the discrete shape-token sequence into contiguous blocks
To alleviate error accumulation, we introduce confidence-guided intra-block correction
reduces mean end-to-end generation time from 25.71 seconds to 4.99 seconds
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
テキストから3Dを生成する技術は急速に進化していますが、推論コストを抑えつつ高い幾何学的忠実度を達成することは依然として課題です。既存の手法では、離散的な形状トークンを自己回帰的にデコードするか、拡散モデルやフローマッチングモデルを用いてグローバルな3D表現を反復的に精緻化するアプローチが主流です。しかし、自己回帰的なデコードは逐次的に処理されるため一度発生した誤りを修正できず、一方、拡散やフローマッチングモデルは全表現を繰り返し処理するため、高品質な生成にかかるコストが膨らんでしまいます。
本研究では、Block3Dというブロック単位の拡散フレームワークを提案します。これは離散的な形状トークン系列を連続するブロックに分割し、ブロック単位で自己回帰的に生成しながら、現在のブロック内の全トークンを同時にノイズ除去する仕組みです。誤差の蓄積を防ぐため、「信頼度に基づくブロック内補正」を導入しました。これは各ブロックが確定する前に、信頼度の低いトークンを修正する機能です。
TRELLIS-500K から抽出した検証セットでの評価では、Block3D はエンドツーエンドの生成時間を従来の 25.71 秒から 4.99 秒に短縮しました。これは幾何学的忠実度を損なうことなく、微調整済みの自己回帰ベースラインと比較して約 5.15 倍の高速化を実現したことを意味します。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み