ページを読み込み中…
ページを読み込み中…
18件の記事
研究チームが、Mixture of Experts(MoE)モデルの推論効率を向上させる「ワープデコード」技術を開発した。この技術は、複数の専門家モデルを効率的に処理することで、推論速度とリソース使用率を改善する。
Together AIのカーネル研究チームは、FlashAttentionやThunderKittensの開発者であり、GPUハードウェアと本番環境のAIとの間のギャップを埋める役割を果たしている。
ScaleOpsがリアルタイムでインフラを自動化し、GPU不足とAIクラウドコスト高騰に対処するため、1億3000万ドルの資金調達を実施した。
NVIDIAが、Kubernetes環境でモデル要件とGPUサイズの不一致による非効率性を解消するため、未使用GPUワークロードを統合する手法を提案している。
NVIDIAが、大規模言語モデル(LLM)推論ワークロードの複雑化に対応するため、Kubernetes上でプリフィル段階とデコード段階を分離した分散型推論アーキテクチャを提案している。
ヤフーの画像認識技術研究者が、GPU上の推論サーバーのパフォーマンスチューニング方法について解説する。