ページを読み込み中…
1件の記事
Anyscale Engineering は大規模 LLM サービングで KV キャッシュ再使用の限界を超え、Ray Serve LLM を用いたトークン負荷意識型の最適化手法を提案した。