パラメータ・計算量・深さを統制したアテンションのみトランスフォーマーの制御研究
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
研究者たちはパラメータ数、計算量、層数を厳密に制御した対照実験により、フィードフォワード層を除去したアテンションのみのトランスフォーマーが標準モデルと同等の性能を発揮することを示した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月12日 22:34
AI深層分析
キーポイント
厳密な条件での性能比較
パラメータ数、トレーニングFLOPs、層数をそれぞれ一致させた条件下で、フィードフォワード層を除去したアテンションのみのトランスフォーマー(SAN)と標準トランスフォーマーを比較した結果、前者も極めて高い性能を示すことが確認された。
アーキテクチャの再配分効果
フィードフォワード層で使われていた計算リソースをアテンションの深さに再配分することで、両者の性能差はほぼゼロ(0.006 nats)まで縮小し、モデル規模が5Bから105Bに拡大してもこの傾向が維持された。
知識と文脈の役割分担
アテンションのみのモデルは文脈に基づく回答には優れるが、重みからの知識抽出が必要な領域でわずかに劣るという特性があり、この差は低コンテキストのクエリ予測に集中していることが特定された。
学習可能性のメカニズム
48層のアテンションのみのスタックを学習可能にする要因はフィードフォワード層や残差ゲートではなく、QK正規化(QK-normalization)にあり、ルーティング行列とコンテンツ行列の挙動変化がその理由として示された。
研究の概要とメタデータ
この論文は10ページ8図で構成され、機械学習および計算言語学の分野におけるアテンションオントランスフォーマーの制御実験を扱っている。
重要な引用
Deleting feed-forward layers in place is costly: the standard transformer leads by 0.47 nats at matched depth and 0.26 nats at matched FLOPs.
Reallocating the freed budget into attention depth closes the gap: at matched parameters the difference is 0.006 nats
Within the tested regime, attention does the rest.
A Controlled Study of Attention-Only Transformers
編集コメントを表示
編集コメント
フィードフォワード層を排除しても性能が維持されるという結果は、現在の主流であるTransformerアーキテクチャの根本的な再考を促す画期的な発見である。計算リソースをアテンション深さに集中させる戦略の有効性が実証されたことで、今後のモデル設計における重要な指針となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
アテンションのみのトランスフォーマーに関する統制実験(1 分間読了)
フィードフォワードネットワークは、トランスフォーマーの埋め込み層以外のパラメータの約 3 分の 2 を占めていますが、その必要性を検証する研究として、パラメータ数・計算量・深さを同時に統制した実験はまだ行われていませんでした。本研究では、標準的なトランスフォーマーと比較して、パラメータ数、トレーニング時の FLOPs(浮動小数点演算回数)、および層数(2 層から 48 層)をそれぞれ厳密にマッチングさせた上で、アテンションのみのデコーダ型トランスフォーマー(Simple Attention Networks: SANs)を事前学習しました。対象としたデータ量は最大 105B トークン、パラメータ数は 6M から 87M の範囲です。
フィードフォワード層を単純に削除するだけではコストが高くつき、標準的なトランスフォーマーの方が、層数が一致した条件では 0.47 nats、計算量が一致した条件でも 0.26 nats 上回っていました。しかし、削減されたリソースをアテンションの深さに再配分することでこの差は縮まります。パラメータ数でマッチングさせた場合、その差はわずか 0.006 nats(損失の 0.27%)となり、シードペア間での再現性も万分之一の精度で確認できました。また、5B、30B、105B と予算規模を拡大するにつれてこの差はさらに縮小し、29 倍のサイズ範囲にわたっても約 0.02 nats の水準で維持されることが示されました。
残されたわずかな差の原因を特定するための三つの測定結果から、その要因が「パラメータによる記憶(parametric recall)」にあることがわかります。アテンションのみのモデルは文脈に基づいた回答においては優れていますが、知識を重みから引き出す必要がある場面では劣ります。その理由を重みのスペクトル分析が示しています。ルーティング行列(Q/K)は早期に結晶化し、コンテンツ行列はランクがゆっくりと蓄積していきます。フィードフォワード層を削除すると、このランクの蓄積がアテンション出力射影へと移転します。48 層のアテンションのみのスタックを学習可能に保っているのは、フィードフォワード層や残差ゲートではなく、QK の正規化です。この欠損は文脈依存度の低いクエリ予測に集中しており、最大の予算規模ではその影響が完全にそこに限定されることが確認されました。
事前登録されたテストがその仮説を検証しました。知識密度の高いウェブテキストでは、アテンションのみを用いたモデルと他の手法の間に 0.02 から 0.05 nat の差が生じることが予測されます。実際に fineweb-edu で訓練した対応するペアで測定すると、その差は 0.040 nat となりました。今回のテスト範囲内では、アテンションがそれ以外の役割を担っていることが確認できます。
| コメント: | 10 ページ、8 つの図 |
|---|---|
| 対象分野: | 機械学習 (cs.LG); 人工知能 (cs.AI); 計算言語学 (cs.CL) |
| ACM クラス: | I.2.7; I.2.6 |
| 引用形式: | arXiv:2607.18363 [cs.LG] |
| (またはこのバージョン用:arXiv:2607.18363v1 [cs.LG]) | |
| https://doi.org/10.48550/arXiv.2607.18363 arXiv 発行 DOI (DataCite 経由) |
提出履歴
送信者:ヘンリー・ンドブアク [メールを見る] [v1]
2026年7月20日(月)UTC 15:29(135 KB)
原文を表示
Abstract:Feed-forward networks hold two thirds of a transformer's non-embedding parameters, yet the architecture has not received a necessity test that controls parameters, compute, and depth at once. We pretrain attention-only decoder transformers (Simple Attention Networks, SANs) against standard transformers matched separately for parameter count, training FLOPs, and depth (2 to 48 layers), for up to 105B tokens at 6M to 87M parameters. Deleting feed-forward layers in place is costly: the standard transformer leads by 0.47 nats at matched depth and 0.26 nats at matched FLOPs. Reallocating the freed budget into attention depth closes the gap: at matched parameters the difference is 0.006 nats (0.27 percent of loss), reproducible to one part in ten thousand across seed pairs, shrinking across 5B, 30B, and 105B budgets, and holding near 0.02 nats across a 29x size range. Three measurements localize the remaining gap to parametric recall: attention-only models are better on context-grounded answers and worse where knowledge must come from weights. Weight spectra show why: routing matrices (Q/K) crystallize early, content matrices accumulate rank slowly, and removing feed-forward layers relocates this accumulation to the attention output projection. QK-normalization, not feed-forward layers or residual gating, keeps 48-layer attention-only stacks trainable. The deficit concentrates on low-context query prediction and localizes there entirely by the largest budget. A pre-registered test confirms the account: it predicts a 0.02 to 0.05 nat gap on knowledge-dense web text; a matched pair trained on fineweb-edu measures 0.040. Within the tested regime, attention does the rest.
| Comments: | 10 pages, 8 figures |
|---|---|
| Subjects: | Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Computation and Language (cs.CL) |
| ACM classes: | I.2.7; I.2.6 |
| Cite as: | arXiv:2607.18363 [cs.LG] |
| (or arXiv:2607.18363v1 [cs.LG] for this version) | |
| https://doi.org/10.48550/arXiv.2607.18363 arXiv-issued DOI via DataCite |
Submission history
From: Henry Ndubuaku [view email] [v1]
Mon, 20 Jul 2026 15:29:00 UTC (135 KB)
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み