OpenAI Astra はループド・トランスフォーマーではない
本文の状態
日本語全文を表示中
詳細モードで約4分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
記事は OpenAI の Astra モデルに関する「ループド・トランスフォーマー」技術の誤解を解き、このアーキテクチャが単なる層の再利用であり、推論の可視性を隠すものではないと指摘する。
AI深層分析を開く2026年9月5日 01:16
AI深層分析
キーポイント
ループド・トランスフォーマーの実態
これは重み参数を複製せずに同一の層スタックを複数回再使用することで、パラメータ数を増やさずにモデルの深さを拡張する技術である。
計算コストと効率性のトレードオフ
Nanbeige 4.2 の事例では、2回のパスが最も効率的であり、標準アーキテクチャに対し約75%のトークン効率を維持しつつ、推論コストは約2倍になる。
チェーン・オブ・サウト(推論)への影響
層の再利用自体が推論プロセスを隠すものではなく、中間推論トークンの生成数を減らし、計算を潜在状態で行う結果として可視性が低下する可能性はある。
技術的起源と誤解の解消
この概念は NeurIPS の論文に由来し、動的な再帰深さを学習するメカニズムを含んでいるが、Astra に関する「推論を隠す」という報道は技術的な誤解である。
再帰パスと中間推論トークンのトレードオフ
モデルがより多くの再帰パスを使用する場合、生成する中間推論トークンを減らす必要がある可能性がある。その結果、計算の多くはテキストとして読み取れない潜在活性化の中で行われることになる。
重要な引用
The looped transformer idea is just reusing layers in the transformer block.
Reusing layers does not by itself suppress visible chain of thought.
Astra may be a really good model, but this shouldn't be about this 'looped transformer aspect,' which is just a tiny architectural tweak.
if a model uses more of these recurrent passes, it may need to generate fewer intermediate reasoning tokens
編集コメントを表示
編集コメント
技術的な詳細を解説する記事は、過度な hype を抑え、実態に基づいた理解を促す点で価値がある。特に「推論の隠蔽」といったセンセーショナルな表現に対し、技術的根拠から冷静に反証している点は読者にとって有益である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
OpenAI の Astra モデルが「再帰的深層モデル」や「ループド・トランスフォーマー」と呼ばれている件について、少し整理しておきましょう。
約 2 ヶ月前に、私は Nanbeige のアーキテクチャ詳細を共有しました。そこでは、「Nanbeige4.2-3B は、層スタックを再利用して容量を増やしつつパラメータ数を増やさないループド・トランスフォーマーを用いて、28T トークンからゼロから事前学習されている」と記載されています。
つまり、ループド・トランスフォーマーのアイデアとは、トランスフォーマーブロック内の層を再利用するだけのものです。
Nanbeige の場合、主な考え方は、同じ 22 層のスタック(=トランスフォーマーブロック)を 1 回ではなく 2 回繰り返すことにあります。結果として、重みを複製することなく、22 層のアーキテクチャを実質的に 44 層に拡張していることになります。
簡単に言えば、これは埋め込み層と出力層を一時的に無視すれば、モデルのサイズが約 2 倍になったようなものです。しかし、ストレージや RAM の必要量が 2 倍になるのではなく、コンポーネントを再利用するため、モデル自体のサイズは変わりません。ただし、計算コストについてはほぼ 2 倍になります。埋め込みされたテキストをほぼ 2 倍の層数に通す必要があるためです。
なぜそうなるのかというと、Nanbeige 4.2 の技術レポートでは、2 回のパスが最もバランスの良いトレードオフをもたらすと結論付けられています。これは、標準的なアーキテクチャのトークン効率の約 75% を維持しつつ、それ以上のパス回数はわずかな性能向上しかもたらさず、学習速度を大幅に落とし、コストを急増させることがわかったためです。
私が知る限り、このアプローチを採用した最初の注目すべきオープンウェイトモデルは Nanbeige 4.2 ですが、そのアイデア自体は NeurIPS で発表された論文「Mixture-of-recursions: Learning dynamic recursive depths for adaptive token-level computation」にまで遡ります。実際、この論文では、各トークンに対して 1 回、2 回、あるいはそれ以上のパスを割り当てるかどうかを決定する学習済みルーターを追加し、より洗練されたメカニズムを提案しています。これにより、簡単なトークンは早期に処理を終了できる一方、難しいトークンには追加の計算リソースが与えられます。
要約すると、Astra は優れたモデルである可能性がありますが、この議論は単なるアーキテクチャ上の微調整に過ぎない「ループド・トランスフォーマー」の側面に焦点を当てるべきではありません。
また、「新しい技術は AI の推論プロセス(いわゆる思考連鎖)の一部またはすべてを隠蔽する形で動作する」という記述は、ループド・トランスフォーマー手法に関しては必ずしも真実ではありません。The Information の記者が別の技術を指しているか、あるいはループド・トランスフォーマーの仕組みを誤解した可能性があります。
レイヤーの再利用自体が可視的な思考連鎖を抑制するわけではありません。これは、次のトークンを生成する前に、通常のトランスフォーマー層と同様に隠れた状態(hidden states)内で計算を追加するに過ぎません。
しかし、現時点で入手できる情報に基づけば、最も妥当な解釈は以下の通りです。あるモデルが再帰的なパス(recurrent passes)をより多く使用する場合、中間推論トークンの生成数を減らす必要がある可能性があります。つまり、計算の大部分がテキストとして読み取れない潜在活性化(latent activations)内で行われることになります。
これは、モデルサイズを拡大した場合と同様の効果をもたらします。例えば、GPT 5.6 Luna から GPT 5.6 Sol へとスケールアップする際に見られるような効果です。

図 1. OpenAI Astra の再帰的深さ、Nanbeige 4.2 のループ型トランスフォーマー、および Mixture-of-Recursions におけるトークンレベルのルーティングに関する報告を比較した図。
再帰的深さとループ型トランスフォーマーについての動画解説は、以下の解説記事をご覧ください。
出典:私の Substack ノート のウェブ版。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み