ページを読み込み中…
ページを読み込み中…
8件の記事
Netflix は既存インフラで LLM 推論を運用する方法を公開した。エンジン選定、モデルパッケージ化、API 設計、デプロイ戦略、出力制約、実負荷でのトレードオフについて詳述している。
Netflix の AI プラットフォームチームは、外部 API に依存せずモデル展開から推論まで自社の既存環境で完結させる独自 LLM サービング基盤の構築過程と、エンジン選定などの技術的トレードオフについて報告した。
SGLang チームは、エージェントワークフローを再利用可能な SKILL.md ファイルやベンチマーク契約、レビューループ、本番環境のデバッグプレイブックに変換する方法を明らかにした。これにより、実行・テスト・レビュー可能な手順的エンジニアリング知識としてのエージェント価値が強調された。
NVIDIA は、現代の大規模言語モデル(LLM)の推論サービス設定が複雑である課題に対し、モデルバックエンドや並列形状などの相互作用する選択をシミュレーションする「DynoSim」を発表した。これにより、最適なパフォーマンスとコストのバランス(パレートフロンティア)を効率的に見つけることが可能になる。