ページを読み込み中…
ページを読み込み中…
5件の記事
Apple Machine Learning は、長文対話時のメモリ使用量増大問題を解決する新手法「EpiCache」を発表した。この技術は、デバイス限界を超えないよう KV キャッシュを効率的に管理し、長期会話の実現を目指す。
マイクロソフトは、クラウドコンピューティングやAIを支える大規模ネットワークシステムの設計・運用に関する新研究と技術的進展を、USENIXシンポジウム「NSDI 2026」で発表した。
GPU の割り当て次第でスループットやレイテンシが変動する KV キャッシュの局所性が、再計算コストに直結し、ロードバランサーの設計変更が必要となる。
Together AIは、LLMの長文コンテキスト処理におけるCPDアーキテクチャを発表した。この手法は暖系と冷系の推論作業を分離し、スループットを40%向上させ、最初のトークン生成までの時間を大幅に短縮する。
OpenAIが大規模言語モデルの推論コンテナを発表し、トークン数の増加に伴うコストと性能の課題に対応する最新機能と性能向上を実現した。