ページを読み込み中…
ページを読み込み中…
8件の記事
腾讯エンジニアは、大規模言語モデルの出力結果を確定的に制御するための AI インフラ技術について解説した。
Anthropic が開発したオープンソース推論エンジン「WASTE」は、ホストマシンのメモリより大幅に重い重みを持つモデルを実行可能にし、Kimi K3 を最初の完全対応モデルとして発表し、コスト削減やデータプライバシー向上を目指す。
Kimich K3 は標準的なトランスフォーマーとは異なる独自のアーキテクチャを持つ 2.8 兆パラメータのマルチモーダル MoE モデルであり、本記事は同モデルの構造を分析し、vLLM がこれをどのようにサービングするかを解説している。
vLLMはTileRT技術と連携し、遅延が重要なサービス向けに特別に設計された推論機能を提供するようになった。これにより、リアルタイム性が求められるAIサービスの性能向上が期待される。
Hugging Face が、vLLM サーバーを Hugging Face Jobs 上で単一のコマンドで実行できる機能を導入した。これにより、大規模言語モデルの推論環境構築が簡素化された。