SGLang、メタの多モーダルモデル「Muse Glimmer」をローカル推論向けにサポート開始
本文の状態
日本語全文あり
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
LMSYS Blog
LMSYS は Meta Superintelligence Labs と提携し、ローカルハードウェア向けに最適化されたマルチモーダルモデル「Muse Glimmer」を SGLang に Day-0 サポートとして追加した。
記事の3ポイント
Muse Glimmer のアーキテクチャと性能
Muse Glimmer は 30B パラメータのマルチモーダルモデルであり、128k トークン以上のコンテキストウィンドウを備え、ローカルハードウェア上で競合他社に匹敵するエージェントワークフローのパフォーマンスを発揮する。
SGLang による高性能推論の達成
NVIDIA GeForce RTX 5090 環境において、DFlash と NVFP4 を活用した最適化により、1,452 tok/s のスループットと 236 tok/s のユーザーあたりデコード速度を SGLang が実現する。
多様なハードウェアへの展開対応
SGLang は NVIDIA GeForce RTX 5090、RTX PRO 6000、DGX Spark(SM120 ベンド)および Apple Silicon(MLX ベンド)を含む幅広い消費者向け・ワークステーション向けハードウェアで Muse Glimmer のデプロイを可能にする。
なぜ重要か・誰に関係するか
この発表の重要性は、ローカルハードウェア上で大規模なマルチモーダルモデルを高速かつ低遅延で実行する技術的障壁が下がり、実用的なエージェントワークフローの実装が容易になる点にある。開発者や企業の AI 導入担当者は、オンプレミス環境やエッジデバイスでの高性能推論インフラ選定において、SGLang と Muse Glimmer の組み合わせを即座に評価・採用する判断が可能となる。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見る関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み