ページを読み込み中…
ページを読み込み中…
35件の記事
vLLM は、エージェント AI の大規模コードや長いチャット履歴の推論に必要な KV キャッシュの効率化のため、アテンションヘッドによる分割に依存しない新しいデコード・コンテキスト並列化手法を発表した。
NVIDIAのNeMoチームは、研究者がアルゴリズム変更やパイプライン構築にかかるコストを削減するため、コンパクトで扱いやすいPyTorchネイティブのアジェンティック強化学習フレームワーク「Molt」を発表した。
Kimich K3 は標準的なトランスフォーマーとは異なる独自のアーキテクチャを持つ 2.8 兆パラメータのマルチモーダル MoE モデルであり、本記事は同モデルの構造を分析し、vLLM がこれをどのようにサービングするかを解説している。
Netflix は、異なるモデルサイズやハードウェア要件への対応、急速に進化する推論エンジンへの適応など、社内 LLM 推論プラットフォーム構築における実戦の教訓とアーキテクチャ選択について詳細を明らかにした。