ページを読み込み中…
ページを読み込み中…
13件の記事
中国の AI 企業 DeepSeek は、既存モデルの重みを利用した推測的デコーディングフレームワーク「DSpark」と、その学習・評価コード「DeepSpec」をオープンソース化し、大規模モデルの推論速度を大幅に向上させた。
研究チームが開発した DFlash は、推論のボトルネックである逐次生成を改善し、小規模モデルで未来のトークンを並列にドラフトして大規模モデルが検証する手法により、NVIDIA Blackwell 上で最大 15 倍のスループット向上を実現しました。
Vercel は、Zai の提供する GLM 5.2 Fast モデルを AI Gateway 上で Wafer を介して提供開始した。ベンチマークによると、サーバーレス環境でのスループットは他社より 2 倍高く、小・大コンテキストともに高速な生成を実現している。
AWS は生成 AI モデルのスケールアウト時にエンドツーエンドのレイテンシを最大 2 倍短縮する「コンテナイメージキャッシング」機能を Amazon SageMaker AI 推論に追加した。