確率的 KV ルーティング:適応型深層別キャッシュ共有を実現
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、トランスフォーマー言語モデルの推論コスト削減のため、時間軸以外の「深さ」次元に焦点を当てた新しい手法「確率的 KV ルーティング」を提案し、キーバリューキャッシュのメモリ使用量を大幅に削減できることを示した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
高いスループットでトランスフォーマー言語モデルを提供するには、自己回帰生成中の冗長な計算を避けるためにキー・バリュー(KV)のキャッシュが必要です。KV キャッシュのメモリフットプリントは大きく、提供コストに大きな影響を与えます。本研究ではこれらのメモリ要件を軽減することを提案します。最近の研究は主に時間軸に沿った圧縮と退去を通じて KV キャッシュ削減に取り組んできましたが、我々は深さ次元が最適化のための直交かつ堅牢な道筋を提供すると主張します。先行研究では各層に対する完全なキャッシュは冗長であると示唆されていますが、実装…
原文を表示
Serving transformer language models with high throughput requires caching Key-Values (KVs) to avoid redundant computation during autoregressive generation. The memory footprint of KV caching is significant and heavily impacts serving costs. This work proposes to lessen these memory requirements. While recent work has largely addressed KV cache reduction via compression and eviction along the temporal axis, we argue that the depth dimension offers an orthogonal and robust avenue for optimization. Although prior research suggests that a full cache for every layer is redundant, implementing…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み