SGLang、メタの多モーダルモデル「Muse Glimmer」をローカル推論向けにサポート開始
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
LMSYS Blog
LMSYS は Meta Superintelligence Labs と提携し、ローカルハードウェア向けに最適化されたマルチモーダルモデル「Muse Glimmer」を SGLang に Day-0 サポートとして追加した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月10日 20:11
AI深層分析
キーポイント
Muse Glimmer のアーキテクチャと性能
Muse Glimmer は 30B パラメータのマルチモーダルモデルであり、128k トークン以上のコンテキストウィンドウを備え、ローカルハードウェア上で競合他社に匹敵するエージェントワークフローのパフォーマンスを発揮する。
SGLang による高性能推論の達成
NVIDIA GeForce RTX 5090 環境において、DFlash と NVFP4 を活用した最適化により、1,452 tok/s のスループットと 236 tok/s のユーザーあたりデコード速度を SGLang が実現する。
多様なハードウェアへの展開対応
SGLang は NVIDIA GeForce RTX 5090、RTX PRO 6000、DGX Spark(SM120 ベンド)および Apple Silicon(MLX ベンド)を含む幅広い消費者向け・ワークステーション向けハードウェアで Muse Glimmer のデプロイを可能にする。
高度な推論機能のネイティブサポート
SGLang は Muse Glimmer に対して、DFlash によるスペキュレーション・ディコーディング、RadixAttention によるプレフィックスキャッシング、および切断可能な CUDA グラフといった機能をネイティブで提供する。
SGLang の最適化機能との互換性
Muse Glimmer は SGLang の低オーバーヘッドスケジューラ、RadixAttention プレフィックスキャッシュ、ブレーカブル CUDA グラフなどのネイティブ最適化と互換性がある。これらの最適化は MLX バックエンドにも実装され、Apple Silicon でのエージェントワークロードにおいて競争力のあるパフォーマンスを実現している。
重要な引用
SGLang delivers up to 1,452 tok/s of total output throughput and 236 tok/s of per-user decode speed on the NVIDIA GeForce RTX 5090
Muse Glimmer is a 30B-parameter multimodal dense model with a 128k+ token context window that delivers competitive performance on end-to-end agentic workflows from local hardware
Muse Glimmer is compatible with SGLang's many native optimizations, including the low-overhead scheduler, the RadixAttention prefix cache, and breakable CUDA graphs.
We provide Muse Glimmer checkpoints in several formats to meet the needs of users with different hardware, fidelity, and system performance requirements.
編集コメントを表示
編集コメント
ローカル環境での大規模モデル運用において、SGLang が提供する最適化技術が具体的な数値で裏付けられたことは開発者にとって大きな追い風となる。特に RTX 5090 などの最新 GPU との相性が確認されたことで、エッジ AI の実用化スピードが加速すると予想される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
SGLang は、Meta Superintelligence Labs と提携し、ローカルハードウェア上でエージェントワークフローを高速推論するための専用最適化を施した「Muse Glimmer」への Day-0 サポートを開始しました。
ハイライト
- モデル: Muse Glimmer は 30B パラメータのマルチモーダル密度モデルで、128k トークン以上のコンテキストウィンドウを持ち、ローカルハードウェア上でエンドツーエンドのエージェントワークフローにおいて競合他社と引けを取らない性能を発揮します。
- パフォーマンス: NVIDIA GeForce RTX 5090 上では、SGLang の SM120 バックエンド向けに最適化された結果、NVFP4 と DFlash を使用して、総出力スループットが最大 1,452 tok/s、ユーザーあたりのデコード速度が 236 tok/s に達します。
- 機能: SGLang は Muse Glimmer に対して、DFlash による推測的デコーディング、RadixAttention を用いたプレフィックスキャッシュ、そして切断可能な CUDA グラフなど、広範な機能をネイティブでサポートしています。
- ハードウェア: 開発者は、SM120 バックエンド経由で NVIDIA GeForce RTX 5090、RTX PRO 6000、DGX Spark、あるいは MLX バックエンド経由で Apple Silicon など、多様なコンシューマー向けおよびワークステーション向けハードウェア上で Muse Glimmer を展開できます。
Muse Glimmer モデルアーキテクチャ
Muse Glimmer は 30B モデルであり、27.9B の密度テキストデコーダ、1.9B の ViT(Vision Transformer)、および GELU ベースのマルチモーダル投影層で構成されています。テキストデコーダは 52 層のトランスフォーマー層からなり、各層には 32 クエリヘッドと 2 つのキーバリューヘッドを持つグループ化クエリアテンションが含まれ、その後に SwiGLU フィードフォワードネットワークが続きます。
スライディングウィンドウアテンション
デコーダーは、効率性を高めるためにハイブリッドなアテンションパターンを採用しています。これは、2,048トークンのスライディングウィンドウ層を3層交互に配置し、4ステップごとに1つのフルシーケンス層を挿入する構成です。
ローカルウィンドウにはRoPE(Rotary Positional Embedding)を、フルアテンション層にはNoPE(Non-Rotational Positional Embedding)を組み合わせることで、モデルはトレーニング時の制限を超えてコンテキスト長を拡張することが可能になります。
機能サポート
ローカルAIハードウェア向けの広範なバックエンドサポート
Muse Glimmerは、SGLangを通じて、ローカルでAIエージェントの構築や実行を行う開発者が一般的に使用する幅広いハードウェア上でデプロイできます。具体的には、Apple Silicon搭載のMac miniやMシリーズMacBook Pro、NVIDIA GeForce RTX 5090 GPU、そしてNVIDIA DGX Sparkなどが対象です。
NVIDIA SM120プラットフォームでは、SGLangが最適化されたGEMMおよびFlashInferバックエンドを活用して高スループット推論を実現します。一方、Apple SiliconデバイスではネイティブのMLXバックエンドを採用し、高性能なローカルサービスを提供します。
DFlashによるスペキュレティブ・デコーディング
低遅延推論を実現するには、SGLangが実装したDFlashを使用してください:
--speculative-algorithm DFLASH
SGLangネイティブ最適化
Muse Glimmerは、オーバーヘッドの低いスケジューラー、RadixAttentionによるプレフィックスキャッシュ、そして分割可能なCUDAグラフなど、SGLangが提供する多数のネイティブ最適化と互換性があります。
また、これらの最適化のうちいくつか(プレフィックスキャッシュを含む)をSGLangのMLXバックエンドにも実装しました。これにより、エージェントワークロードにおけるApple Siliconでのパフォーマンスも競争力のあるものとなっています。
BF16、NVFP4、GGUF、およびMLX 4-bitチェックポイント
Muse Glimmer のチェックポイントは、ハードウェアや精度、システム性能の要件が異なるユーザーのニーズに応えるため、複数の形式で提供しています。
最大限のモデル精度を必要とする開発者は、ネイティブの BF16 チェックポイントを単一の H100 GPU で実行できます。SM120 パスには、約 19.5 GB の混合 NVFP4+MXFP8 量子化レシピが含まれています。また、18 GB の NVFP4 チェックポイントに 5 GB の BF16 DFlash スペキュレーターを組み合わせることで、単一の RTX 5090 に余裕を持って収まり、NVIDIA GeForce RTX 5090 アクセラレータや DGX Spark 上で高性能なデプロイが可能になります。
さらに、2 つの GGUF チェックポイントも用意しています。より小型の方は Q4KM フォーマットで、グループサイズは 128 です。このチェックポイントは推論速度を向上させ、メモリ制約が厳しいハードウェアへの展開を可能にします。一方、Q4K-Dynamic はモデルの品質面で優れています。Apple Silicon デバイス上で開発を行う方には、前述の GGUF チェックポイントを MLX フォーマットでも提供しています。
Performance Results
SGLang を用いて Muse Glimmer の性能を 7 つのプラットフォームで測定し、バッチサイズは 1 から 8 まで範囲を広げて評価しました。以下に報告するのは、バッチ 1 時のインタラクション性(ユーザーあたりのトークン数/秒)と、バッチ 8 時の集計出力スループット(トークン数/秒)です。
| プラットフォーム | 精度 | デコーディング | tok/s/user (batch 1) | 出力 tok/s (batch 8) |
|---|---|---|---|---|
| NVIDIA B300 | bf16 | Standard | 91.77 | 21 |
| NVIDIA B300 | bf16 | DFlash | 308.51 | 261 |
| NVIDIA B300 | nvfp4 | Standard | 83.98 | 41 |
| NVIDIA B300 | nvfp4 | DFlash | 290.01 | 295 |
| NVIDIA RTX PRO 6000 | bf16 | Standard | 25.7 | 200 |
| NVIDIA RTX PRO 6000 | bf16 | DFlash | 108.08 | 33 |
| NVIDIA RTX PRO 6000 | nvfp4 | Standard | 58.04 | 51 |
| NVIDIA RTX PRO 6000 | nvfp4 | DFlash | 214.11 | 403 |
| NVIDIA DGX Spark | bf16 | Standard | 4.4 | 35 |
| NVIDIA DGX Spark | bf16 | DFlash | 19.1 | 134 |
| NVIDIA DGX Spark | nvfp4 | Standard | 12.1 | 92 |
| NVIDIA DGX Spark | nvfp4 | DFlash | 36.4 | 301 |
| NVIDIA RTX 5090 | nvfp4 | Standard | 63.9 | 501 |
| NVIDIA RTX 5090 | nvfp4 | DFlash | 236.4 | 1452 |
| NVIDIA RTX 5090 | q4_k_m | Standard | 72.6 | 230 |
| NVIDIA RTX 5090 | q4_k_m | DFlash | 140.7 | 332 |
| Apple M5 Pro | q4_k_m | Standard | 15.3 | 52.6 |
| Apple M5 Pro | q4 | Standard | 17.6 | 56.9 |
| Apple M5 Pro | q4k-dynamic | Standard | 12.6 | 49.1 |
プラットフォームや精度設定によって、DFlash はバッチサイズ 1 の対話処理速度を 1.9〜4.3 倍に向上させます。具体的には、RTX 5090 の GGUF パスを除くすべての構成で 3.0 倍以上の性能向上が見られ、GGUF パスでは 1.9 倍の改善となります。一方、バッチサイズ 8 の場合、その効果は小さく変動も大きく、1.4 倍から 4.2 倍の範囲に収まります。なお、MLX バックエンドでは推測デコーディング(speculative decoding)は利用できません。
謝辞
Muse Glimmer の Day-0 サポートを SGLang に実装するにあたり、Meta Superintelligence Labs のチームおよび SGLang コミュニティの皆様にご協力いただいたことに感謝いたします。
原文を表示
We're excited to partner with Meta Superintelligence Labs to bring Day-0 support for Muse Glimmer to SGLang, with dedicated optimizations tailored for high-performance inference of agentic workflows on local hardware.
Highlights
- Model: Muse Glimmer is a 30B-parameter multimodal dense model with a 128k+ token context window that delivers competitive performance on end-to-end agentic workflows from local hardware.
- Performance: SGLang delivers up to 1,452 tok/s of total output throughput and 236 tok/s of per-user decode speed (NVFP4 with DFlash) on the NVIDIA GeForce RTX 5090, powered by dedicated optimizations for SGLang's SM120 backend.
- Features: SGLang provides broad feature support natively for Muse Glimmer, including DFlash speculative decoding, RadixAttention prefix caching, and breakable CUDA graphs.
- Hardware: Developers can deploy Muse Glimmer across a variety of consumer and workstation hardware — NVIDIA GeForce RTX 5090, RTX PRO 6000, and DGX Spark via the SM120 backend, and Apple Silicon via the MLX backend.
Muse Glimmer Model Architecture
Muse Glimmer is a 30B model, consisting of a 27.9B dense text decoder, a 1.9B ViT, and a GELU-based multimodal projector. The text decoder has 52 transformer layers. Each layer contains grouped-query attention with 32 query heads and two key-value heads, followed by a SwiGLU feed-forward network.
Sliding Window Attention
The decoder uses a hybrid attention pattern that interleaves three 2,048-token sliding-window layers with a full-sequence layer every fourth step for efficiency. Combining RoPE on the local windows with NoPE on the full-attention layers allows the model to extend its context length beyond its training limits.
Feature Support
Extensive Backend Support for Local AI Hardware
Muse Glimmer can be deployed with SGLang across a wide range of hardware commonly used by developers building and running AI agents locally, including Apple Silicon devices (Mac mini and M-series MacBook Pro), NVIDIA GeForce RTX 5090 GPUs, and the NVIDIA DGX Spark. On NVIDIA SM120 platforms, SGLang leverages its optimized GEMM and FlashInfer backends for high-throughput inference, while Apple Silicon devices use the native MLX backend to deliver high-performance local serving.
Speculative Decoding with DFlash
To achieve low-latency inference, use SGLang's implementation of DFlash:
--speculative-algorithm DFLASH
SGLang Native Optimizations
Muse Glimmer is compatible with SGLang's many native optimizations, including the low-overhead scheduler, the RadixAttention prefix cache, and breakable CUDA graphs. We have also brought several of these optimizations, including prefix caching, to the SGLang MLX backend, enabling competitive performance on Apple Silicon for agentic workloads.
BF16, NVFP4, GGUF, and MLX 4-bit Checkpoints
We provide Muse Glimmer checkpoints in several formats to meet the needs of users with different hardware, fidelity, and system performance requirements.
Developers requiring maximum model fidelity can run the native BF16 checkpoint on a single H100 GPU. The SM120 path includes a ~19.5 GB mixed NVFP4+MXFP8 quantization recipe. An 18 GB NVFP4 checkpoint paired with a 5 GB BF16 DFlash speculator fits comfortably on a single RTX 5090, enabling high-performance deployment on NVIDIA GeForce RTX 5090 accelerators and DGX Spark.
We also provide two GGUF checkpoints. The smaller of the two is in Q4KM format with a group size of 128. This checkpoint allows for faster inference speeds and deployment on hardware with tighter memory constraints. Q4K-Dynamic delivers better model quality. For developers working on Apple Silicon devices, we provide the previously mentioned GGUF checkpoints in MLX format.
Performance Results
We measured Muse Glimmer with SGLang across seven platforms, sweeping batch sizes 1 through 8. Reported below are batch-1 interactivity (tok/s/user) and batch-8 aggregate output throughput (tok/s).
| Platform | Precision | Decoding | tok/s/user (batch 1) | Output tok/s (batch 8) |
|---|---|---|---|---|
| NVIDIA B300 | bf16 | Standard | 91.77 | 21 |
| NVIDIA B300 | bf16 | DFlash | 308.51 | 261 |
| NVIDIA B300 | nvfp4 | Standard | 83.98 | 41 |
| NVIDIA B300 | nvfp4 | DFlash | 290.01 | 295 |
| NVIDIA RTX PRO 6000 | bf16 | Standard | 25.7 | 200 |
| NVIDIA RTX PRO 6000 | bf16 | DFlash | 108.08 | 33 |
| NVIDIA RTX PRO 6000 | nvfp4 | Standard | 58.04 | 51 |
| NVIDIA RTX PRO 6000 | nvfp4 | DFlash | 214.11 | 403 |
| NVIDIA DGX Spark | bf16 | Standard | 4.4 | 35 |
| NVIDIA DGX Spark | bf16 | DFlash | 19.1 | 134 |
| NVIDIA DGX Spark | nvfp4 | Standard | 12.1 | 92 |
| NVIDIA DGX Spark | nvfp4 | DFlash | 36.4 | 301 |
| NVIDIA RTX 5090 | nvfp4 | Standard | 63.9 | 501 |
| NVIDIA RTX 5090 | nvfp4 | DFlash | 236.4 | 1452 |
| NVIDIA RTX 5090 | q4_k_m | Standard | 72.6 | 230 |
| NVIDIA RTX 5090 | q4_k_m | DFlash | 140.7 | 332 |
| Apple M5 Pro | q4_k_m | Standard | 15.3 | 52.6 |
| Apple M5 Pro | q4 | Standard | 17.6 | 56.9 |
| Apple M5 Pro | q4k-dynamic | Standard | 12.6 | 49.1 |
DFlash raises batch-1 interactivity by 1.9–4.3x depending on platform and precision: 3.0x or better on every configuration except the GGUF path on the RTX 5090, which gains 1.9x. The batch-8 gain is smaller and more variable, ranging from 1.4x to 4.2x. Speculative decoding is not available on the MLX backend.
Acknowledgements
We thank the teams at Meta Superintelligence Labs and the SGLang community for their collaboration in bringing Day-0 support for Muse Glimmer to SGLang.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み