Meta、ローカル型エージェントAI「Muse Glimmer」を公開
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
Meta は 30B パラメータの密結合型オープンウェイトモデル「Muse Glimmer」を公開し、120K 以上のコンテキストウィンドウと NVIDIA エッジ・デスクトップ・ワークステーションプラットフォームでの実行に対応した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月10日 23:17
AI深層分析
キーポイント
Muse Glimmer の基本仕様と最適化
Meta は 30B パラメータの密結合型オープンウェイトモデル「Muse Glimmer」を公開し、120K 以上のコンテキストウィンドウと NVIDIA エッジ・デスクトップ・ワークステーションプラットフォームでの実行に対応した。
チャット特化モデルとのアーキテクチャの違い
既存の LLM が単発対話や高速な初回トークン生成を優先するのに対し、Muse Glimmer はすべてのパラメータを各トークン処理に活性化させる密結合構造を採用し、信頼性と一貫性を高めている。
エージェントワークフローへの対応
ソフトウェアプロジェクトのスケーリングやドキュメントの改訂など、複数のツール呼び出しを必要とする長期的なエージェントタスクにおいて、予測可能なレイテンシと高いスループットを提供する。
ローカル処理による常時稼働の実現
単一 GPU で秒間 2 万トークンの処理速度を達成し、データをローカルで処理しながら複雑な多段階ワークフローを実行できる常時稼働型エージェントの基盤となる。
ローカルハードウェアにおけるプライバシー設計
Muse Glimmerはローカル環境で動作するアジェンティックAIワークフロー向けに、プライバシーを設計段階から考慮したアーキテクチャを採用している。
重要な引用
Meta returns to the open source ecosystem with the release of Muse Glimmer, a 30B open-weight dense model with a 120K+ context window built for local AI agentic work.
Muse Glimmer delivers 20K tokens/sec on a single GPU, enabling always-on agents to process data locally and execute complex, multi-step workflows.
Most LLMs are optimized for chat... but agentic workloads demand a different approach.
Side-by-side diagram, showing a dense model activating all 30B parameters per token versus an example of an MoE model routing to 2 of 7 experts
編集コメントを表示
編集コメント
チャット特化の LLM が主流となる中で、複雑なタスク実行に耐えうる密結合型モデルの実用化は業界の重要な転換点となる。特にローカル処理と高速スループットの両立は、プライバシー要件が厳しい現場での AI エージェント導入を加速させる可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Meta は、ローカル AI エージェントワークフロー向けに設計された 30B パラメータのオープンウェイト・デンスモデル「Muse Glimmer」をリリースし、オープンソースエコシステムへの復帰を果たしました。このモデルは 120K トークン以上のコンテキストウィンドウをサポートしています。
NVIDIA のエッジ、デスクトップ、ワークステーションなど幅広い AI プラットフォームでの実行に最適化された Muse Glimmer は、単一の GPU で *20K tokens/sec* の処理速度を実現。これにより、常時稼働するエージェントがローカルでデータを処理し、複雑なマルチステップのワークフローを実行することが可能になります。
会話だけでなく、長時間動作するエージェント向けに設計
多くの大規模言語モデル(LLM)は チャット最適化 を目指しており、単発の対話や最初のトークンまでの高速な応答を優先しています。しかし、エージェントワークロードには異なるアプローチが必要です。
ソフトウェアプロジェクトの構築やドキュメントの改訂、ナレッジベースの管理などを行うエージェントは、1 つのセッションで複数のツール呼び出しを順次実行する一方で、チャット特化型モデルでは対応できない高い信頼性、一貫性、長文脈における整合性、そして持続的なスループットが求められます。
Muse Glimmer は、トークン処理ごとにすべてのパラメータを活性化させるデンスアーキテクチャを採用しています。ルーティングやエキスパートの選択、トークン経路によるばらつきはありません。その結果、信頼性の高い指示実行、長文脈の整合性維持、予測可能なレイテンシ、そして故障モードの削減が求められるエージェントワークロードにおいて、特に優れた性能を発揮します。

ローカルハードウェアで設計されたプライバシー保護
個人ファイル、通信記録、認証情報、機密文書を扱うエージェントワークフローでは、推論処理が端末外に流出しないことが必須です。Muse Glimmer はこの要件に対して最適なバランスを実現しています。
複雑な多段階の推論が可能になる十分な規模を持ちながら、単一の NVIDIA GPU の VRAM に収まるサイズに抑えられています。モデルの分割(sharding)や CPU へのオフローディング、外部エンドポイントの利用といった追加手段は不要です。
NVIDIA Tensor Core アーキテクチャはこの計算パターンを加速し、フルコンテキスト長でのリアルタイムなエージェント推論を端末上で完結させます。
- NVIDIA GeForce RTX 5090 は、32 GB の VRAM と第 5 世代 Tensor Core を組み合わせることで、Muse Glimmer をローカル開発環境に導入します。これにより、機密コードを端末内に保持でき、トークンごとの推論コストも不要になります。
- NVIDIA DGX Spark は、ワークステーションクラスの性能とエンタープライズ向けエージェントパイプラインをコンパクトなシステムに統合しました。NVIDIA NVLink による高速メモリアクセスと、NIM コンテナを利用することで、ローカルでの Muse Glimmer デプロイは単一のコマンドで完了します。
NVIDIA の DGX Station は、クラウド推論が選択肢にならないエアギャップ要件やコンプライアンス枠組みの下で運用されるチーム向けに、オンプレミス環境へラックスケールの Blackwell Ultra コンピューティングをもたらします。
NVIDIA の Jetson は、ローカルの Muse Glimmer 推論をエッジデバイスに拡張し、ネットワークの分離が必須条件であり、すべての推論判断が行動の現場で即時に行われる必要があるロボットや産業用自動化システム、組み込みシステムを可能にします。
NVIDIA Blackwell Ultra 上で最適化された Muse Glimmer のパフォーマンス
NVIDIA Blackwell Ultra では、Muse Glimmer は BF16/NVF4 精度で *20 トークン/秒/GPU* を超える速度を発揮します。スループットと対話性のバランスを示す曲線を見ると、30B 密度アーキテクチャは MoE モデルのようなルーティングオーバーヘッドを伴わずに高い並行処理能力を維持しています。
1 つの Blackwell Ultra でモデル全体を VRAM に収めつつ、大規模な KV キャッシュバッファ用の余裕も確保できるため、常時稼働するエージェントをローカルインフラ上で完全に実行するために開発者が求める高スループットと低レイテンシに最適です。

エージェント活用ケースの構築とファインチューニング
セキュアな OpenShell 環境で NVIDIA NemoClaw を実行すれば、コード生成や自律型サポートなど、多様なタスクに対応した長期間稼働するパーソナルアシスタントを構築できます。

開発者は、NVIDIA の NeMo AutoModel を活用して、モデルのポストトレーニングを高いスループット効率で行うことができます。これは、モデル変換の必要なくネイティブな Hugging Face チェックポイントを直接サポートするファインチューニングライブラリです。
これにより、DGX Spark などの NVIDIA GPU で迅速な実験が可能となるよう最適化された、フル SFT や LoRA ファインチューニングがすぐに利用できます。また、NeMo RL を用いた強化学習も実行可能で、サンプルレシピ と参照用の精度検証曲線 validation curves が用意されています。
*Video 1. Run NeMoClaw and vLLM on DGX Spark*
Muse Glimmer の柔軟な展開パス
NVIDIA は、多様な開発者のニーズに応えるため、複数の推論スタックをサポートしています。
SGLang と vLLM は、NVIDIA によるアクセラレーションプラットフォーム上でパフォーマンスをより細かく制御したい開発者向けに、オープンソースの推論レシピを提供しています。
また、事前構築され最適化された推論コンテナである「NVIDIA NIM」としてダウンロードも可能です。この NIM はランタイム設定とサービング構成を自動選択するため、チームはエージェントの構築とスケーリングに集中できます。
Muse Glimmer とローカル AI エージェントの活用方法
まずは HuggingFace から Muse Glimmer の重み(weights)をダウンロードし、上記の推論レシピを使って NVIDIA GPU 対応プラットフォーム上で実行するか、ダウンロード可能な NIM を利用するか、build.nvidia.com で試すことができます。
執筆者について
原文を表示
Meta returns to the open source ecosystem with the release of Muse Glimmer, a 30B open-weight dense model with a 120K+ context window built for local AI agentic work.
Optimized to run across a range of NVIDIA edge, desktop, and workstation AI platforms, Muse Glimmer delivers *20K tokens/sec* on a single GPU, enabling always-on agents to process data locally and execute complex, multi-step workflows.
Built for long-running agents, not just conversations
Most LLMs are optimized for chat, prioritizing single-turn interactions and fast time to first token—but agentic workloads demand a different approach. An agent scaffolding a software project, revising documentation, or managing a knowledge base may execute several sequential tool calls in a single session, while requiring a level of reliability, consistency, long-context coherence, and sustained throughput that chat-first models aren’t built for.
Muse Glimmer uses a dense architecture that activates every parameter for each token it processes, with no routing, expert selection, or variance across token pathways. As a result, it excels at agentic workloads that demand reliable instruction following, long-context coherence, predictable latency, and fewer failure modes.

Privacy by design across local hardware
Agentic workflows involving personal files, communications, credentials, and proprietary documents require inference that never leaves the machine. Muse Glimmer hits an optimal balance. It’s large enough for complex multi-step reasoning, but small enough to fit within the VRAM of a single NVIDIA GPU, with no need for model sharding, CPU offloading, or using external endpoints.
NVIDIA Tensor Core architecture accelerates exactly this compute pattern, enabling real-time agentic inference fully on device at full context length.
- NVIDIA GeForce RTX 5090 pairs 32 GB of VRAM with fifth-generation Tensor Cores, bringing Muse Glimmer to local developer devices, keeping proprietary code on device, and eliminating per-token inference cost.
- NVIDIA DGX Spark brings workstation-class performance and enterprise agentic pipelines into a compact system. NVIDIA NVLink provides high-speed access to memory, and NVIDIA NIM containers make local Muse Glimmer deployment a one-command operation.
- NVIDIA DGX Station brings rack-scale Blackwell Ultra compute to on-prem enterprise environments for teams operating under air-gap mandates or compliance frameworks where cloud inference isn’t an option.
- NVIDIA Jetson extends local Muse Glimmer inference to the edge, enabling robotics, industrial automation, and embedded systems, where network isolation is a hard requirement, and every inference decision must happen at the point of action.
Optimized Muse Glimmer Performance on NVIDIA Blackwell Ultra
On NVIDIA Blackwell Ultra, Muse Glimmer delivers over *20 tokens/sec/GPU* at BF16/NVF4 precision, with the throughput-interactivity curve showing the 30B dense architecture sustaining high concurrency without the routing overhead of MoE models.
A single Blackwell Ultra handles the full model in VRAM with headroom for large KV cache buffers, making it well-suited for high throughput and low latency that developers need to run always-on agents entirely on local infrastructure.

Building and fine-tuning agentic use cases
Run NVIDIA NemoClaw in a secure OpenShell environment to create long-running personal assistants powered for tasks like code generation, personal assistant, autonomous support, and more.

Developers can further post-train the model using the NVIDIA NeMo AutoModel with high-throughput efficiency, which is a fine-tuning library for native Hugging Face checkpoint support with no model conversion requirements.
It enables full SFT and LoRA fine-tuning out of the box, optimized for rapid experimentation on NVIDIA GPUs, including DGX Spark. Developers can also perform reinforcement learning with NeMo RL, with sample recipes and reference accuracy validation curves.
*Video 1. Run NeMoClaw and vLLM on DGX Spark*
Flexible deployment paths for Muse Glimmer
NVIDIA supports multiple inference stacks to meet a variety of developer needs.
SGLang and vLLM provide open-source inference recipes for developers who require deeper control over performance on the NVIDIA accelerated platform.
It’s also available as a downloadable NVIDIA NIM, a prebuilt, optimized inference container that auto-selects runtime configuration and serving setup, so teams can focus on building and scaling agents.
Get started with Muse Glimmer and local AI agents
To get started, download Muse Glimmer weights from HuggingFace and deploy using the inference recipes listed above to run on NVIDIA GPU-accelerated platforms, use the downloadable NIM, or try it on build.nvidia.com.
About the Authors
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み