OasisKV: HBM を超えた KV キャッシュ拡張システム
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
LLM推論におけるHBMの希少性を解消するため、OasisKVはデコード時に必要なKVエントリのみをHBMに保持し、不要なデータを外部メモリから逐次フェッチする設計を採用している。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月12日 12:01
AI深層分析
キーポイント
HBM容量圧力の緩和アプローチ
LLM推論におけるHBMの希少性を解消するため、OasisKVはデコード時に必要なKVエントリのみをHBMに保持し、不要なデータを外部メモリから逐次フェッチする設計を採用している。
Lookaheadに基づく予測的プリフェッチ
スペキュレーティブ・ディコーディング(SD)で生成されたトークンを用いて将来重要なトークンを高精度に予測し、必要なKVブロックを事前にHBMへ転送する背景パイプラインを実現した。
vLLMベースの実装と性能向上
OasisKVはvLLM上で実装され、推論精度の低下が0.1ポイントに抑えられた状態で、推論ワークロードで1.69倍、マルチGPU環境では最大2.1倍のスループット向上を確認した。
プリフェッチ・デコード分離での効率化
プリフェッチとデコードを分離した構成において、KVキャッシュの削減量が6.5〜9.7倍となり、ホストメモリの使用量も2.2〜2.6倍削減しながらスループットを約2倍に引き上げた。
重要な引用
OasisKV, a memory-centric LLM inference system design that alleviates HBM capacity pressure by decoupling full KV-cache storage from HBM during LLM decoding.
The lookahead prediction is accurate enough to keep accuracy within 0.7 points of full attention under a 2,048-token KV budget.
This lets OasisKV turn sparsity into throughput gain: 1.69times over dense vLLM on the reasoning workload at 0.1 points of accuracy loss.
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)の推論サービスにおいて、計算リソースよりもメモリ容量がボトルネックとなるケースが増えています。長いコンテキストや長文推論ワークロードが普及するにつれ、トークン生成(デコード)段階におけるキーバリュー(KV)キャッシュは、メモリの使用量とトラフィックの両方を支配するようになりました。特に高帯域メモリ(HBM)の容量は希少で高価なリソースとなり、推論のバッチサイズやシステムのスループットを大きく制限しています。
本論文では、OasisKV というメモリアクセント型の LLM 推論システム設計を発表します。これは、LLM のデコード中に KV キャッシュ全体を HBM から切り離すことで、HBM の容量圧力を緩和するものです。デコード時のアテンションは本質的にスパース(疎)であるため、OasisKV は最も関連性の高いトークンの KV エントリーのみを HBM に保持し、アテンション計算に利用します。
我々は、スペキュレーティブ・ディコーディング(SD)によってドラフトされた lookahead トークンを用いることで、将来重要となるトークンを事前に高精度で予測できることを発見しました。OasisKV は、重要な KV ブロックを特定するための効率的なアテンション背景パイプラインを採用しています。これらは、より大容量のメモリ階層(ホストメモリやリモートメモリなど)からプリフェッチされ、次のデコードステップで使用される前に HBM にステージングされます。
OasisKV は vLLM をベースに実装されています。予測の精度は十分で、2,048 トークンの KV バudget 制約下でも、完全アテンションと比較して精度が 0.7 ポイント以内の誤差に収まります。これにより OasisKV は、スパース性をスループット向上に転換できます。推論ワークロードでは、精度損失を 0.1 ポイントに抑えつつ、密な vLLM よりも 1.69 倍のスループットを実現し、マルチ GPU による長文コンテキスト処理では最大 2.1 倍の性能向上を達成します。また、プリフェッチとデコードを分離したアーキテクチャでは、完全な KV 転送と比較して各リクエストに必要となる KV が 6.5〜9.7 倍少なくて済み、デコードノード側のホストメモリ使用量も 2.2〜2.6 倍削減しながら、密なスループットの約 2 倍を達成します。
原文を表示
Large language model (LLM) inference serving is increasingly constrained by memory rather than compute. As long-context and long-form reasoning workloads become more prevalent, the key-value (KV) cache dominates both memory footprint and memory traffic during LLM token generation, i.e., decode. In particular, HBM capacity has become a scarce and costly resource that heavily limits inference batch size and system throughput. This paper presents OasisKV, a memory-centric LLM inference system design that alleviates HBM capacity pressure by decoupling full KV-cache storage from HBM during LLM decoding. Because decode-time attention is naturally sparse, OasisKV keeps only the KV entries of the most relevant tokens in HBMs for attention computation. We observe that future important tokens can be predicted accurately in advance using lookahead tokens drafted by speculative decoding (SD). OasisKV employs an efficient attention background pipeline to identify important KV blocks. They are then prefetched from higher-capacity memory tiers (e.g., host or remote memory) and staged in HBMs before being used in the next decode step.
We implement OasisKV based on vLLM. The lookahead prediction is accurate enough to keep accuracy within 0.7 points of full attention under a 2,048-token KV budget. This lets OasisKV turn sparsity into throughput gain: 1.69times over dense vLLM on the reasoning workload at 0.1 points of accuracy loss, and up to 2.1times on multi-GPU long-context serving. Under prefill--decode disaggregation, OasisKV reaches about 2times dense throughput while admitting each request with 6.5--9.7times less KV and holding 2.2-2.6 less decode-node host memory than full KV transfer.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み