NVIDIA、オンデバイス物理AIモデル「Cosmos 3 Edge」発表
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
NVIDIA はオンデバイスで推論と行動生成が可能な 40 億パラメータの「Cosmos 3 Edge」を公開し、メモリ制約のあるエッジ環境でもデータセンター並みの性能を実現する世界モデルとしてロボット制御への応用を加速させる。
AI深層分析を開く2026年7月27日 23:08
AI深層分析
キーポイント
オンデバイスでの高性能推論の実現
Cosmos 3 Edge はメモリ制約が厳しい工場や倉庫などのエッジ環境で、データセンターレベルの性能を発揮するように設計された 40 億パラメータの世界モデルである。
双塔型アーキテクチャによる多機能統合
同社は自己回帰塔と拡散塔という 2 つのトランスフォーマーを備えた Mixture-of-Transformers アーキテクチャを採用し、言語・動画・音声・行動の情報を統合して推論と生成を行う。
世界モデルによる環境理解と予測
このモデルは物体や運動、空間関係、および行動の影響を学習し、現在の状態を理解した上で将来をシミュレーションし、目標達成のための行動を生成する能力を持つ。
Cosmos 3 ファミリーにおける位置づけ
Cosmos 3 Edge は 2026 年 5 月 31 日に発表された Cosmos 3 Nano (16B) や Super (64B) に続く、最も小型のティアであり、Super の約 1/16 のサイズである。
多様な物理システムの統一された行動表現
Cosmos 3 は車両やカメラ、ロボットアームなど異なる物理システムを、変位・回転・操作状態を捉えるコンパクトな幾何ベクトルとして共通の表現に変換する。これにより制御と世界の視覚構造が結びつき、生成された動画は単なる予測ではなく行動への応答としての世界変化を表す。
重要な引用
Machines operate at the edge in factories, warehouses, and hospitals. They need data center–level performance on memory-constrained systems.
Cosmos 3 uses a Mixture-of-Transformers architecture with two towers... The autoregressive tower processes vision and text tokens for understanding and reasoning.
Actions are encoded as compact geometric vectors that capture translation, rotation, and manipulation state.
Action flows in both directions. The model can predict the effect of an action, or infer the action from its effect.
編集コメントを表示
編集コメント
エッジデバイスでの高性能な世界モデルの実現は、ロボット制御の自律性を高める重要なステップとなる。双塔型アーキテクチャによる推論と生成の統合は、複雑な環境下でのリアルタイム対応を可能にする技術的基盤として注目される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
NVIDIA は、デバイス上で動作するように設計された 40 億パラメータのオープンワールドモデル「Cosmos 3 Edge」をリリースしました。このモデルは、ロボットやビジョン AI エージェントが周囲を理解し、リアルタイムで推論を行い、ローカルでロボットの行動を生成するのを支援します。
Cosmos 3 シリーズには、2026 年 5 月 31 日の GTC Taipei で発表された Cosmos 3 Nano(16B)と Cosmos 3 Super(64B)が含まれています。Edge はその中で最も小さく、Super の約 1/16 のサイズです。
このモデルが解決する課題は明確です。工場や倉庫、病院などでは機械がエッジで動作します。しかし、メモリ制約の厳しいシステムでもデータセンター並みの性能が必要です。Cosmos 3 Edge はまさにそのギャップを埋めるために開発されました。
世界モデルはここで何をするのか
世界モデルは、環境が時間とともにどのように変化するかを学習します。これは物体や運動、空間的な関係性、そして行動の結果を表すものです。
例えば、ロボットが物体に手を伸ばす場面を考えてみましょう。物体の認識は最初のステップに過ぎません。ロボットはさらに、物体の位置を追跡し、グリッパーがどう動くか、接触時に何が起きるかを把握する必要があります。世界モデルはこの関係性について推論を行います。行動による視覚的な結果を予測したり、変化を引き起こした行動を推測したり、目標達成のための行動を生成したりできるのです。
Cosmos 3 Edge は、これらの機能を単一のオンデバイスモデルに統合しました。共有表現により、システムは現在の世界状態を理解し、可能な未来をシミュレーションし、それらを行動へと結びつけることが可能になります。
2 つのトランスフォーマータワーと 1 つの共有表現
Cosmos 3 は、NVIDIA の技術レポートで説明されている通り、Mixture-of-Transformers アーキテクチャを採用しています。これは 2 つのタワーから構成されています。
自己回帰型(autoregressive)のタワーは、理解と推論のためにビジョントークンとテキストトークンを処理します。一方、拡散型(diffusion)のタワーは、予測、生成、ニューラルシミュレーションのためにビジョン、オーディオ、アクショントークンを処理します。
2 つのタワーはそれぞれ独立した正規化層と多層パーセプトロン(MLP)を保持しています。しかし、言語、動画、音声、行動間の情報を整合させるマルチモーダルアテンション層は共有されています。これにより、モデルは出力を生成する前にシーンについて推論することが可能になります。
アテンションパターンは各モダリティに合わせて適応します。言語では因果アテンション(causal attention)が使用され、各トークンは過去のトークンに注目します。拡散トークンは利用可能なコンテキストに対してより広範な注意を向けるため、一貫性のある予測と生成が可能になります。タスクに応じて、モデルは自己回帰型タワーから推論トークンを出力するか、拡散型タワーからノイズ除去された動画やアクショントークンを出力します。
Cosmos 3 Edge の推論エンジンには 2B パラメータの密なトランスフォーマー(dense transformer)が使用されており、画像および動画の入力については Cosmos GitHub リポジトリに従い、Qwen3-VL と互換性のあるメッセージ形式を採用しています。
異なる物理システムでは、行動の表現方法が異なります。車両は自己位置と動きを、カメラはカメラ自身の運動を、ロボットアームはエンドエフェクタの姿勢をそれぞれ記述します。さらにグリッパーの場合は把持状態も加わります。
Cosmos 3 はこうした多様な実装体を、共通の行動表現へとマッピングします。行動は移動、回転、操作状態といった情報を捉えたコンパクトな幾何ベクトルとして符号化されます。
これにより制御と世界の視覚構造が結びつきます。モデルはピクセルの変化を物理的な運動や制御入力に関連付けます。生成された動画は単なる予測を超え、行動に対する世界の反応をどう変化させるべきかを示すものとなります。
サポートされる行動次元は実装体によって異なります。Cosmos の GitHub リポジトリには、カメラ運動(9D)、自律走行車(9D)、自己中心運動(57D)、シングルアームロボット(10D)、デュアルアームロボット(20D)、ヒューマノイドロボット(29D)が記載されています。
ポリシーモードは双方向で動作します。ポリシーとして Cosmos 3 Edge は、行動とその予想される視覚的帰結を同時に予測します。現在の状態を入力すると、行動とそれがもたらす可能性の高い視覚的結果が出力されます。
アクションは双方向に流れます。モデルはアクションの結果を予測することも、結果からアクションを推測することも可能です。これにより、世界モデルが直接ロボットのポリシー学習と評価につながります。
NVIDIA はまた、Cosmos 3 Edge Policy(DROID)も公開しました。これはピッキング&プレースタスク向けに DROID データセットでポストトレーニングされたロボット操作ポリシーで、トレーニングスクリプトも含まれています。開発者は、展開前に小規模な H100 クラスターや NVIDIA DGX Station でファインチューニングを行うことができます。
実用性はどうか
Cosmos 3 Edge は、NVIDIA のエッジコンピューティング機器全体でメモリ効率の高い推論を実現します。対象となるハードウェアは、NVIDIA RTX PRO GPU、NVIDIA DGX、GeForce RTX GPU、そして新たに発表された Jetson T2000 および T3000 モジュールを含む NVIDIA Jetson シリーズです。
ポストトレーニング済みの世界アクションモデル(WAM)として、このモデルは 640×360 の解像度でロボット制御に対応します。NVIDIA Jetson Thor では、1 回の推論で 32 アクションを生成しながら、15 Hz のリアルタイム制御も達成しています。生成タスクにおいては、Edge タイプが 256p と 480p の解像度、12〜30 fps、そして 50〜150 フレームのサポートを提供します。
オープンな Cosmos フレームワークを使用すれば、開発者は特定のロボット形態やセンサーセットに合わせて Cosmos 3 Edge を約 1 日でポストトレーニングできます。NVIDIA は、プロトタイピングのためのローカル環境として GeForce RTX 3070 以上を推奨しています。
(function(){var f=document.getElementById("mtp-deploy-c3edge");
window.addEventListener("message",function(e){if(f&&e.source===f.contentWindow&&e.data&&e.data.__mtpH){f.style.height=e.data.__mtpH+"px";}});})();
キーポイント
NVIDIA は 7 月 20 日、Hugging Face で「Cosmos 3 Edge」を公開しました。これはオンデバイスで動作する 4B パラメータのオープンワールドモデル(そのうち 2B が推論に特化した密な構造)です。
このアーキテクチャは Mixture-of-Transformers を採用しており、自己回帰型の推論タワーと拡散生成タワーを、共有されたマルチモーダルアテンションによって結合しています。
性能面では、640×360 の制御解像度を実現し、1 回の推論で最大 32 アクションを処理可能。NVIDIA Jetson Thor 上では 15Hz のリアルタイム制御が動作します。
生成されるアクションは、カメラ、車両、単腕ロボット、二腕ロボット、ヒューマノイドなど多様なエンボディメントに対応する、共通の並進・回転・操作表現にマッピングされています。
ベンチマーク結果(4B モデルで VANTAGE-Bench 1 位)は内部評価によるものですが、本モデルは Linux Foundation の OpenMDW-1.1 ライセンスの下で提供されます。
参考情報源:Hugging Face 公開記事、Cosmos3-Edge モデルカード、Cosmos 3 コレクション、NVIDIA 技術レポート(PDF)、Cosmos GitHub、NVIDIA デベロッパーブログ、Jetson Thor ブログ、および NVIDIA ニュースルーム(日本連合)。
AI算出
主要ニュースainew評価標準
記事は NVIDIA の最新モデル Cosmos 3 Edge の詳細なアーキテクチャ(Mixture-of-Transformers)、パラメータ数、およびオンデバイス推論能力という新しい技術的実体を報じており、新規性が高い。検索意図が非常に明確で特定バージョンの情報を求めるユーザーに直結する一方、日本企業や日本固有の導入事例に関する記述は含まれていないため、日本の関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み