不確実性を意識した連想記憶「Kalman Delta Networks」を提案
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
研究者らは線形アテンションの固定メモリ制約を克服するため、不確実性を追跡するカルマンフィルタを応用した「Kalman Delta Networks」を開発し、750M〜1.3Bパラメータ規模で既存モデルを上回る性能を示した。
AI深層分析を開く2026年9月9日 22:10
AI深層分析
キーポイント
不確実性追跡によるメモリ更新の最適化
従来のデルタ則モデルは記憶の不確実性を追跡できないが、本研究では線形ガウス状態空間モデルとして再定式化し、カルマンゲインを用いて累積証拠と観測信頼度に基づき書き込みを重み付けする。
GPU並列処理に適合した2つの近似手法
厳密な追跡は計算コストが高いため、対角ガウス分布への射影を行う「Diagonal KDN」と、ヘッドごとに不確実性スカラーを用いる「Isotropic KDN」の2つのスキャン互換近似を導入し、対数並列深さを実現した。
大規模事前学習での性能向上の実証
750Mおよび1.3Bパラメータのモデルで制御された事前学習を行い、KDNの各バリアントが最先端の線形アテンションモデルと比較してパープレキシティと平均ダウンストリーム精度を一貫して改善したことを確認した。
重要な引用
To represent this uncertainty explicitly, we reformulate recurrent associative memory as a linear--Gaussian state-space model
Their uncertainty recurrences are Mobius maps, enabling associative scans with logarithmic parallel depth.
Across controlled pretraining at 750M and 1.3B parameters, KDN variants consistently improve perplexity and mean downstream accuracy
編集コメントを表示
編集コメント
線形アテンションの弱点であるメモリ更新の非適応性を、制御理論の知見を用いて解決した試みは極めて興味深い。Hugging Face Daily Papers で紹介されるこの論文は、今後の効率的な大規模言語モデル開発における重要な技術的転換点となる可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
線形アテンションは、効率的な長文コンテキスト推論と定数メモリでのデコーディングのために、最先端の言語モデルでますます広く使われています。しかし、その固定サイズの再帰的メモリでは、各トークンごとにオンライン判断が必要です。つまり、「何を記録するか」「既存の関連付けをどの程度上書きするか」を、将来のクエリがどのような情報を必要とするかを知る前に決定しなければならないのです。
デルタ則モデルは、この更新強度を現在のトークン埋め込みから学習しますが、メモリ推定に対する信頼度を追跡しません。その結果、各書き込みが蓄積された証拠に応じて適応することができなくなります。この不確実性を明示的に表現するために、再帰的連想記憶を線形ガウス状態空間モデルとして再定式化しました。カルマンフィルタはこのモデルに対して最適な逐次推定器であり、ここに新しいモデルファミリーである「カルマンデルタネットワーク(KDN)」を導入します。
KDN 内では、遷移がメモリ状態とその不確実性の両方を伝播させます。これにより、カルマンゲインが各残差書き込みを、蓄積された証拠と観測の信頼度に基づいて重み付けできるようになります。この定式化の下では、デルタスタイルの更新は、予測共分散に対してトークンごとの等方性近似を代入し、共分散追跡を省略した特別なケースとして現れます。
しかし、正確な追跡には、状態依存のリカッティ再帰を含む密な計算が必要となり、これは GPU 並列化された線形アテンションのスキャン処理には適していません。この課題に対処するため、私たちは 2 つの KDN 近似手法を導入しました。これらはスキャン処理に互換性があります。
対角線 KDN は、オンライン平均場変分推論を通じて各ステップの事後分布を対角ガウス分布族に射影します。一方、等方性 KDN は、ヘッドごとに不確実性のスカラー値 1 つを用いる等方性近似を採用しています。両者の不確実性の再帰計算はモビウスの写像であり、対数並列深さで連想走査を可能にします。750M パラメータと 1.3B パラメータの制御された事前学習において、KDN の各バリアントは最先端の線形アテンションモデルと比較して、パープレキシティと下流タスクの平均精度を一貫して向上させました。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み