ページを読み込み中…
1件の記事
vLLM は、エージェント AI の大規模コードや長いチャット履歴の推論に必要な KV キャッシュの効率化のため、アテンションヘッドによる分割に依存しない新しいデコード・コンテキスト並列化手法を発表した。