ページを読み込み中…
2件の記事
NVIDIA は、LLM 呼び出しを同一モデルに集中させる非効率を解消するオープンソースのルーティング層「NeMo Switchyard」を発表し、コストとレイテンシ削減を実現した。
AI Shift のインターン生 MAO KEYU が、大規模言語モデルを用いた推論システムの研究成果を ACL 2026 にて発表した。