Meta AI、1 枚の GPU で動作する 30B オープンモデル「Muse Glimmer」を公開
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
6媒体で確認
Ollama Blog · LM Studio Blog · AI News · NVIDIA Developer Blog · PyTorch Blog · MarkTechPost
各社の報じ方を比較 ↓Meta は Muse Spark から蒸留された 30B モデルを約 4 ビットに量子化し、ブロックレベルの推測デコーディングを追加することで、単一のコンシューマー GPU や Mac でネットワーク接続なしに動作可能にした。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月11日 00:20
AI深層分析
キーポイント
ローカル実行とオープンウェイトの実現
Meta は Muse Spark から蒸留された 30B モデルを約 4 ビットに量子化し、ブロックレベルの推測デコーディングを追加することで、単一のコンシューマー GPU や Mac でネットワーク接続なしに動作可能にした。
厳格なデータ規制とオフライン環境への対応
医療、法務、金融、防衛などの業界で求められるデータ居住性やオフライン稼働に対応するため、Air-gappable(エアギャップ)可能なエージェントとして提供される。
高度なアーキテクチャとトレーニング手法
30B パラメータには視覚エンコーダーが含まれ、グループ化クエリアテンションやローカル/グローバルパターンを組み合わせることで、13 万トークン以上のコンテキスト長をサポートする。
開発者向けの実装オプション
Hugging Face で BF16 重み、GGUF k-quants、ExecuTorch ビルドが提供され、Solo デベロッパーから中堅企業までがオンプレミス推論を即日開始できる。
DFlashによる高速推論の実現
ブロック拡散ドラフター「DFlash」が1回のフォワードパスで16トークンを予測し、メインモデルが並列検証を行うことで、RTX 5090上で3.1倍の速度向上を達成する。
重要な引用
Meta compresses it to roughly 4-bit, then adds block-level speculative decoding so it answers fast enough to sit inside a real agent loop.
Self-hosting is the day-one path.
Regulated enterprises get an air-gappable agent.
DFlash, a block-diffusion drafter that predicts 16 tokens in one forward pass.
編集コメントを表示
編集コメント
コンシューマーハードウェアで動作する 30B モデルの実現は、ローカル AI エージェントの普及における決定的な転換点となる。特にデータ主権が重視される業界において、クラウド依存からの脱却を可能にする実用的なソリューションとして注目される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Meta は、Muse Spark から蒸留された 300 億パラメータの多モーダルモデル「Muse Glimmer」を公開しました。これは常時稼働するローカルエージェントワークフロー向けに調整され、Apache 2.0 ライセンスで提供されています。
通常、30B モデルはフル精度では 55 GB 以上のメモリが必要となりますが、Meta はこれを約 4 ビットに圧縮し、ブロックレベルのスペキュレティブ・ディコーディング(speculative decoding)を追加することで、リアルなエージェントループ内で動作する十分な速度を実現しています。その結果、このモデルは 1 つのコンシューマー GPU や Mac 上でネットワーク接続なしで実行可能です。
導入可能でしょうか?
はい、重みは Apache 2.0 の下でオープンです。Hugging Face コレクションには BF16 形式の重み、GGUF k-quants、ExecuTorch 向けビルド、そして DFlash ドラフターが用意されています。セルフホスティングが初日の運用パスとなります。
誰が使えるのか?
ソロ開発者やスタートアップは、24 GB GPU 1 台または M4/M5 Max Mac で実行できます。中堅企業チームはオンプレミス推論が可能で、トークン課金も不要です。規制の厳しい企業向けには、ネットワークから切り離せる(エアギャップ可能な)エージェントを提供します。Meta は、モデルを裸のエンドポイントとして提供するのではなく、システムレベルのガードレールを追加することを推奨しています。
適用業界は?
医療、法務、金融サービス、防衛・公共部門、製造業、およびフィールドサービスです。データ所在地の要件やオフライン動作、あるいはレイテンシがクラウド利用を妨げる環境こそが、このモデルの適した舞台となります。
主な用途は?
スクリーンショットを読み取るデスクトップエージェント、コーディング支援エージェント、スキーマベースの関数呼び出しです。また、ドキュメントやチャートの理解、合成データ生成、LLM-as-a-judge による評価などにも活用されます。
モデルとトレーニング
Muse Glimmer は、専用の知覚エンコーダーを備えた密結合因果トランスフォーマーです。ビジョンタワーを含めた総パラメータ数は約 30B です。グループ化クエリアテンション(Grouped-query attention)では、クエリヘッドが 32、KV ヘッドが 2 つ使用されます。アテンションは [Local, Local, Local, Global] のパターンを繰り返すスライディングウィンドウ方式で、ウィンドウサイズは 2,048 です。RoPE はローカル層にのみ適用され、theta パラメータは 500,000 に設定されています。
ビジョン側には、1 枚あたり最大 4,096 ビジュアルトークンを受け入れる、約 1.8B の ViT-G/14 知覚エンコーダーが搭載されています。コンテキスト長は 131,072 を超え、語彙数は 202,048 トークンです。知識の更新期限は 2026 年 1 月 4 日となっています。入力はテキストと画像で構成され、出力はテキストのみです。音声はサポートされておらず、動画は個別のフレームとして処理されます。
トレーニングは以下の 3 つのフェーズに分けて実施されました:
事前学習では、Muse Spark の出力に対するロジット蒸留(logit distillation)を行いました。
中期学習では、より長いコンテキストと推論トレースを豊富に含むエージェント主体のデータを追加しました。
事後学習では、一般タスク、推論、コーディング、そしてエージェントドメイン全体にわたって、教師あり微調整(SFT)、オンポリシー蒸留、強化学習を組み合わせて行いました。
30B モデルをコンシューマー向けハードウェアで動かす
フル精度で動作させるには、このモデルは 55 GB 以上のメモリを必要とします。Meta は重みを約 4 ビット精度に圧縮し、言語モデルのサイズを 20 GB 未満に抑えています。これにより、24 GB または 32 GB の VRAM を持つ環境でも余裕を持って動作させることが可能になります。KV キャッシュ、知覚エンコーダー、ドラフター(草案生成器)がこのメモリ領域を共有します。
Meta は 2 つの量子化版をリリースしています。「K-Quant-Dynamic」は平均誤差率 0.2% で 32 GB VRAM を対象とし、「K-Quant-17GB」は平均誤差率 1.0% で 24 GB VRAM を対象としています。この誤差率は、15 の一般的なベンチマークにおける精度指標を平均化した値です。
生成速度の向上には、ブロック拡散ドラフター「DFlash」が貢献しています。これは一度の順伝播で 16 トークンを予測する仕組みです。メインモデルは並列処理でこのブロックを検証します。ドラフターは 5 レイヤー構成で、スライディングウィンドウアテンション(窓幅 2,048)と、クエリヘッド 32/ KV ヘッド 8 を採用しています。
Meta が測定した K-Quant-17GB の性能では、バッチサイズ 1 で貪欲デコーディング(greedy decoding)を行った結果、RTX 5090 ではスループットが 74.9 tok/s から 233.4 tok/s に向上し、約 3.1 倍の高速化を達成しました。Apple M5 Max では 26.6 tok/s から 50.2 tok/s、M4 Max では 23.7 tok/s から 37.8 tok/s へと改善されています。
ベンチマーク
Meta は、思考モードにおいて Muse Glimmer を Gemma4-31B や Qwen3.6-27B と比較しました。その結果、MCP Atlas では 75.5 のスコアで両者を上回り(対する 54.2 および 62.5)、DeepSearch QA(74.6)、Gaia2(43.3)、SWE-Bench Pro(51.2)でも首位を維持しています。推論能力のスコアも高く、AIME 2026 で 94.7、IFBench で 77.0、AA-LCR で 80.0 を記録しました。
一方、OSWorld-Verified では Qwen3.6-27B が 75.6 と Muse Glimmer の 65.9 を上回っており、TerminalBench 2.1(60.7)や SWE-Bench Verified(77.2)でも先行しています。この傾向は明確で、Muse Glimmer はエージェントによるオーケストレーションと推論能力に優れていますが、コンピュータ操作やターミナル作業においてはやや劣っています。
安全性の観点では、Siren AgentDojo 攻撃に対する成功率は 28.4 で、実用性は 94.2 と評価されています。Meta は同モデルを「Advanced AI Scaling Framework」における Frontier AI の定義には当てはまらないと明言しており、化学・生物分野やサイバーセキュリティ、制御喪失に関するリスクは中程度以下であると判定しています。
Key Takeaways
- Apache 2.0 ライセンスのオープンウェイト、30B パラメータのエージェントモデル。Muse Spark から知識蒸留されています。
- 4-bit 量子化により、VRAM 24GB で動作可能。推論精度は約 1% の低下に抑えられています。
- DFlash による 16 トークンブロックの予測デコードを採用し、RTX 5090 で 3.1 倍の高速化を実現しました。
- MCP Atlas、DeepSearch QA、SWE-Bench Pro の各ベンチマークで比較対象モデルを上回りました。
- OSWorld-Verified と TerminalBench 2.1 では Qwen3.6-27B に劣っています。
Model weights は Hugging Face で公開されています。詳細は公式ブログをご覧ください。Twitter や 150k+ML SubReddit、ニュースレターへの登録もぜひご検討ください。Telegram ユーザーの方も、今なら Telegram チャンネルに参加できます。
本記事は、MarkTechPost にて公開された「Meta AI Releases Muse Glimmer: A 30B Open-Weights Agentic Model That Runs on One Consumer GPU」の翻訳です。
原文を表示
Meta has released Muse Glimmer, a 30-billion-parameter multimodal model distilled from Muse Spark. It is tuned for always-on local agent workflows, and ships under Apache 2.0. A 30B model normally needs over 55 GB of memory at full precision. Meta compresses it to roughly 4-bit, then adds block-level speculative decoding so it answers fast enough to sit inside a real agent loop. The result runs on one consumer GPU or a Mac, with no network call.
Is it deployable?
Yes, the weights are open under Apache 2.0. The Hugging Face collection carries BF16 weights, GGUF k-quants, ExecuTorch builds, and the DFlash drafter. Self-hosting is the day-one path.
Which companies: Solo developers and startups can run it on one 24 GB GPU or an M4/M5 Max Mac. Mid-market teams get on-prem inference without a per-token bill. Regulated enterprises get an air-gappable agent. Meta advises adding system-level guardrails rather than shipping the model as a bare endpoint.
Industries: Healthcare, legal, financial services, defense and public sector, manufacturing, and field service. These are the settings where data residency, offline operation, or latency rule out a cloud call.
Applications: Desktop agents that read screenshots, coding agents, and schema-based function calling. Also document and chart understanding, synthetic data generation, and LLM-as-a-judge evaluation.
Model and training
Muse Glimmer is a dense causal transformer with a dedicated perception encoder. Total parameters are roughly 30B, including the vision tower. Grouped-query attention uses 32 query heads and 2 KV heads. Attention repeats a [Local, Local, Local, Global] pattern with a 2,048 sliding window. RoPE is applied to local layers only, with theta 500,000. The vision side is a ~1.8B ViT-G/14 perception encoder accepting up to 4,096 visual tokens per image. Context length is 131,072+, vocabulary is 202,048 tokens, and the knowledge cutoff is January 4, 2026. Input is text and image; output is text. Audio is not supported, and video is processed as individual frames.
Training ran in three phases:
Pre-training used logit distillation on Muse Spark’s outputs.
Mid-training added longer-context, agent-heavy data with richer reasoning traces.
Post-training combined supervised fine-tuning with on-policy distillation and reinforcement learning across general, reasoning, coding, and agentic domains.
Fitting 30B onto consumer hardware
At full precision the model needs over 55 GB of memory. Meta compresses weights to approximately 4-bit precision, which brings the language model under 20 GB. That leaves headroom inside a 24 GB or 32 GB envelope. The KV cache, perception encoder, and drafter share it. Two quantized builds ship. K-Quant-Dynamic targets 32 GB VRAM at 0.2% average degradation. K-Quant-17GB targets 24 GB VRAM at 1.0%. Degradation is averaged over accuracy metrics across 15 common benchmarks.
Generation speed comes from DFlash, a block-diffusion drafter that predicts 16 tokens in one forward pass. The main model verifies the block in parallel. The drafter uses 5 layers, sliding-window attention at 2,048, and 32 query / 8 KV heads. Meta measured K-Quant-17GB at batch size 1 with greedy decoding. On an RTX 5090, throughput rises from 74.9 to 233.4 tok/s, a 3.1x speedup. Apple M5 Max moves from 26.6 to 50.2 tok/s, and M4 Max from 23.7 to 37.8 tok/s.
Benchmarks
Meta compares Muse Glimmer against Gemma4-31B and Qwen3.6-27B in thinking mode. It leads on MCP Atlas at 75.5, against 54.2 and 62.5. It also leads on DeepSearch QA at 74.6, Gaia2 at 43.3, and SWE-Bench Pro at 51.2. Reasoning scores follow: AIME 2026 at 94.7, IFBench at 77.0, AA-LCR at 80.0. Qwen3.6-27B stays ahead on OSWorld-Verified, 75.6 versus 65.9. It also leads TerminalBench 2.1 at 60.7 and SWE-Bench Verified at 77.2. The pattern is consistent. Muse Glimmer wins on agentic orchestration and reasoning. It trails on computer-use and terminal work.
On safety, Siren AgentDojo attack success rate is 28.4 with utility 94.2. Meta states the model does not meet the Frontier AI definition in its Advanced AI Scaling Framework. It rates chem/bio, cyber, and loss-of-control risk at moderate or lower.
Key Takeaways
30B open-weights agentic model, Apache 2.0, distilled from Muse Spark.
4-bit quantization fits it in 24 GB VRAM at 1.0% degradation.
DFlash 16-token block speculation gives 3.1x decode speedup on RTX 5090.
Beats both comparators on MCP Atlas, DeepSearch QA, and SWE-Bench Pro.
Trails Qwen3.6-27B on OSWorld-Verified and TerminalBench 2.1.
Check out the Model weights on HF, Details and Meta Blog. Also, feel free to follow us on Twitter and don’t forget to join our 150k+ML SubReddit and Subscribe to our Newsletter. Wait! are you on telegram? now you can join us on telegram as well.
Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.? Connect with us
The post Meta AI Releases Muse Glimmer: A 30B Open-Weights Agentic Model That Runs on One Consumer GPU appeared first on MarkTechPost.
同じ出来事を6媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み