ページを読み込み中…
ページを読み込み中…
9件の記事
AWSはAmazon SageMaker AI上で生成AI推論を加速するG7eインスタンスを発表した。同製品はNVIDIA RTX PRO 6000 GPUを搭載し、開発者や企業のコスト削減と柔軟な運用ニーズに対応する。
AWS TrainiumとvLLMを用いた推測的デコードにより、Qwen3モデルのトークン生成速度が最大3倍向上し、出力品質を維持したままトークンあたりのコスト削減とスループット向上が実現された。
AWSは、Amazon SageMaker AIのトレーニングプランを使用して、指定期間のGPU容量を予約し、大規模言語モデルの推論デプロイを効率化する方法を発表した。
NVIDIAが、大規模言語モデル(LLM)推論ワークロードの複雑化に対応するため、Kubernetes上でプリフィル段階とデコード段階を分離した分散型推論アーキテクチャを提案している。