ページを読み込み中…
ページを読み込み中…
9件の記事
Cloudflare は Workers AI で Kimi K シリーズと GLM を GPU 上で効率的に実行し、メモリ制約下での事前処理とデコードの分離により大規模モデルの高速・安全な提供を実現した。
Together AI は、大規模な合成データ生成におけるエージェント推論を 2 倍高速化する新モデル「ThunderAgent」を発表した。
Ramp Labs は、汎用的なタスク潜在表現と軽量なベースモデル別アライメントにより、1回の学習で複数の凍結済み基盤モデルに LoRA を適用可能なフレームワーク「PorTAL」をオープンソース化した。
MLCommonsは、大規模言語モデルの生産環境利用で急速に成長しているマルチターン型エージェント推論に対応するため、MLPerf Inferenceベンチマークスイートの進化が必要であると表明した。
TLDR AI は、生産環境で訓練済みAIモデルを効率的に実行する分野である「AI推論エンジニアリング」について解説し、遅延・スループット・コスト・品質の最適化が重要であると述べています。