マイクロソフト、フルバンド幅トランスフォーマーを発表
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Microsoft は、生成されたトークンだけでなく直前の上位層隠れ状態もフィードバックする「フルバンド幅トランスフォーマー」を提案し、計算コストを増やさずに推論精度と効率を向上させる手法を実証した。
AI深層分析を開く2026年8月18日 22:00
AI深層分析
キーポイント
ラテンフィードバック機構の導入
従来のデコーディングステップで破棄されていた上位層隠れ状態をゲート付き線形ユニットを通じて入力に融合させ、非言語化された計算をスタックに戻す仕組みを採用した。
並列教師強制の維持と学習戦略
事前学習の後半でラテンフィードバックを導入し、深いフィードバックパスを少量混ぜるスケジュール付き多パス目的関数を用いることで、並列教師強制による学習効率を損なわないようにした。
性能向上と推論効率の両立
1B パラメータモデルで400B トークン訓練した結果、検証損失や数学・コーディング生成性能が向上し、同等以上の精度でより短い推論トレースを生成できることを確認した。
重要な引用
We introduce the full-bandwidth transformer, which widens this channel with latent feedback
latent feedback lets non-verbalized computation re-enter the stack with a renewed depth budget
full-bandwidth transformers match or approach standard transformers trained with roughly 1.5x more tokens
編集コメントを表示
編集コメント
この研究は、トランスフォーマーの内部状態をより効果的に活用するアーキテクチャ革新であり、大規模データ訓練への依存度を下げる有望なアプローチである。実用化に向けた検証が進めば、推論コスト削減と複雑タスク処理能力の向上に寄与する可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
PDF を見る
HTML(実験版)
要旨:自己回帰型トランスフォーマーは、生成されたトークンにわたる水平方向と、モデルの深さにおける垂直方向という 2 つの軸に沿って計算を行います。密着アテンション(Dense Attention)により各トークンは過去の情報を広く参照できますが、デコーディングステップ間の垂直フィードバックチャネルは依然として狭いままです。サンプリングされたトークンだけがスタックの底部に戻り、上位層の隠れ状態(hidden state)は捨てられてしまいます。
私たちは「フルバンド幅トランスフォーマー」を提案します。これは、ゲート付き線形ユニットを通じて前の上位層の隠れ状態とサンプリングされたトークンの埋め込みを融合し、それを次の入力としてフィードバックする「潜在フィードバック(latent feedback)」によってこのチャネルを広げます。潜在フィードバックにより、言語化されていない計算が新たな深さ予算を持ってスタックに再投入される一方、標準的なトランスフォーマーアーキテクチャ、KV キャッシュ、そして言語モデリングの目的は維持されます。
並列教師強制(parallel teacher forcing)を失わずにフルバンド幅トランスフォーマーを訓練するため、私たちはスケジュール化されたマルチパス目標関数を使用します。これは事前学習の後半で潜在フィードバックを導入し、安定性を保つために深いフィードバックパスの小さな割合を混合するものです。
10 億パラメータ規模のフルバンド幅トランスフォーマーを最大 4,000 億トークンまで訓練した結果、潜在フィードバックが検証損失の改善、5 ショット言語モデル評価、数学・コード生成、そして指令微調整(instruction-tuned)性能の向上をもたらすことが分かりました。
トークンあたりの復号オーバーヘッドは無視できるほど小さく、フルバンド幅トランスフォーマーは標準的なトランスフォーマーと同等かそれ以上の精度で、約 1.5 倍のトークン数で訓練されたモデルに匹敵する性能を発揮します。また、同じ精度を維持しながら、より短い推論トレースを生成することも可能です。
| 対象: | 人工知能 (cs.AI) |
|---|---|
| 引用形式: | arXiv:2608.08888 [cs.AI] |
| (またはこのバージョン用:arXiv:2608.08888v1 [cs.AI]) | |
| https://doi.org/10.48550/arXiv.2608.08888 arXiv発行のDOI (DataCite経由) |
提出履歴
送信者:Xi Wang [メールを見る] [v1]
2026年8月9日(日)19:59:45 UTC (222 KB)
原文を表示
Abstract:Autoregressive transformers compute along two axes: horizontally across generated tokens, and vertically through model depth. Dense attention gives each token broad horizontal access to the past, but the vertical feedback channel between decoding steps remains narrow: only the sampled token returns to the bottom of the stack, while the top-layer hidden state is discarded. We introduce the \emph{full-bandwidth transformer}, which widens this channel with \emph{latent feedback}: at each decoding step, the previous top-layer hidden state is fused with the sampled token embedding through a gated linear unit and fed back as the next input. Latent feedback lets non-verbalized computation re-enter the stack with a renewed depth budget, while preserving the standard transformer architecture, KV cache, and language-modeling objective. To train full-bandwidth transformers without losing parallel teacher forcing, we use a scheduled multi-pass objective that introduces latent feedback late in pretraining and mixes a small fraction of deeper feedback passes for stability. We train 1B-parameter full-bandwidth transformers up to 400B tokens and find that latent feedback improves validation loss, 5-shot language-model evaluation, math and coding generation, and instruction-tuned performance. With negligible per-token decoding overhead, full-bandwidth transformers match or approach standard transformers trained with roughly 1.5\times more tokens, and manage to produce shorter reasoning traces at equal or better accuracy.
| Subjects: | Artificial Intelligence (cs.AI) |
|---|---|
| Cite as: | arXiv:2608.08888 [cs.AI] |
| (or arXiv:2608.08888v1 [cs.AI] for this version) | |
| https://doi.org/10.48550/arXiv.2608.08888 arXiv-issued DOI via DataCite |
Submission history
From: Xi Wang [view email] [v1]
Sun, 9 Aug 2026 19:59:45 UTC (222 KB)
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み