Hugging Face、エッジ向け動画生成モデル「Cosmos 3 Edge」発表
本文の状態
日本語全文を表示中
詳細モードで約10分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Blog
Hugging Face Blog に投稿された記事は、NVIDIA の Pranjali Joshi と Saeed Babamohamadi が Cosmos 3 Edge という新しい世界モデルを発表したことを伝えている。
AI深層分析を開く2026年7月28日 02:09
AI深層分析
キーポイント
発表者の所属と動向
本記事は NVIDIA に所属する Pranjali Joshi と Saeed Babamohamadi が Hugging Face Blog で Cosmos 3 Edge の導入を発表したものである。
Cosmos 3 Edge の概要
NVIDIA は「Cosmos 3 Edge」という名称の新しい世界モデル(World Model)を公開し、その基本概念について解説を開始している。
記事構成とトピック
記事は「What Is World Modeling?」や「Two Transformer Towers One Shared...」といったセクションから構成され、技術的な背景やアーキテクチャの詳細を扱う予定である。
Cosmos 3 Edge Policy (DROID) とファインチューニング
DROID データセットでポストトレーニングされたピッキング・プレイス用ロボット操作ポリシー「Cosmos 3 Edge Policy」が公開され、H100 や NVIDIA DGX Station クラスターを用いてターゲットワークロード向けに効率的にファインチューニングが可能である。
高速推論を実現する Cosmos 3 Super 4-Step
拡散プロセスを 35〜50 ステップから 4 ステップに圧縮した「Cosmos 3 Super 4-Step」チェックポイントが公開され、画像・動画の品質を維持しつつ推論速度を最大 25 倍向上させる。
重要な引用
Back to Articles
What Is World Modeling?
Two Transformer Towers One Shared
Cosmos 3 is an open world foundation model platform.
編集コメントを表示
編集コメント
NVIDIA の研究者が Hugging Face Blog で Cosmos 3 Edge を発表しており、世界モデル技術の進展を示唆している。記事は技術的な詳細を段階的に解説する構成となっており、開発者にとって重要な参考資料となる可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
- 世界モデルとは何か?
- 2 つのトランスフォーマータワーと共有表現
- 行動ポリシーモデルのための共通表現
- パフォーマンス向上のための事後学習サンプル
- Cosmos 3 Edge を試す
現実の世界は広大であり、物理的な AI システムがその中で動作するためには、シーンの変化を理解し、次に何が起きるかを予測し、行動が世界にどのような影響を与えるかを判断する必要があります。
機械は工場や倉庫、病院などエッジ環境で稼働しています。これらの環境を理解して行動するには、メモリ制約のあるシステムでもデータセンター並みのパフォーマンスを発揮できるモデルが必要です。
本日、NVIDIA Cosmos 3 Edge を Hugging Face の Cosmos 3 リポジトリにて公開しました。これは 40 億パラメータを持つオープンな世界モデルで、ロボットやビジョン AI エージェントが周囲を理解し、リアルタイムで推論を行い、エッジデバイス上でロボットの行動を生成することを支援します。
モデルのダウンロード: https://huggingface.co/nvidia/Cosmos3-Edge
このモデルは、NVIDIA RTX PRO GPU や NVIDIA DGX、NVIDIA GeForce RTX™ GPU、そして新たに発表された Jetson T2000 および T3000 モジュールを含む NVIDIA エッジコンピューター上で、メモリ効率が高くスループットの高い推論を実現します。
コンパクトなオープンモデルとして設計されており、リアルタイム推論において最高クラスの処理速度と精度を誇る小規模なビジョン言語モデル(VLM)としても機能します。
ポストトレーニングされた世界行動モデル(WAM)である Cosmos 3 Edge は、ロボット制御に最適な解像度(640×360 の観測データ)で動作します。NVIDIA Jetson Thor 上で推論ごとに 32 アクションを生成し、15 Hz のリアルタイム制御を実現しています。
同規模(パラメータ数 4B)のモデル群の中で、Cosmos 3 Edge はビジョン分析ベンチマーク「VANTAGE-Bench」で第 1 位を獲得。ロボットポリシー学習においては最先端の性能を誇り、スマートインフラやロボティクス分野における新たな基準を打ち立てています。
ワールドモデリングとは何か?
ワールドモデルは、環境が時間とともにどのように変化するかを学習します。ここでは物体、運動、空間的な関係性、そして行動が及ぼす影響を表現します。
ロボットが物体に手を伸ばす場面を考えてみましょう。物体の認識は最初のステップに過ぎません。重要なのは、物体がどこにあるか、グリップ(把持部)がどのように動いているか、接触時に何が起きるか、そしてタスクを成功させるためにどの行動をとるべきかを理解することです。
ワールドモデルは、ロボットがこれらの関係性を推論するのを助けます。行動の結果としてどのような視覚的変化が生じるかを予測したり、何らかの変化を引き起こした行動を逆算したり、特定の成果を得るための行動を生成したりできます。
Cosmos 3 Edge は、これらの機能を一つのモデルに統合し、オンデバイスで実行可能にしました。共有された表現により、物理 AI システムは現在の世界状態を理解し、ありうる未来をシミュレーションして、それらを具体的な行動へと結びつけることが可能になります。
トランスフォーマーの 2 つのタワーと、一つの共有表現
Cosmos 3 は、2 つのトランスフォーマータワーを組み合わせています。
- 自己回帰型タワー:理解と推論のために、ビジョンとテキストのトークンを処理します。
- 拡散型タワー:予測、生成、ニューラルシミュレーションのために、ビジョン、オーディオ、アクションのトークンを処理します。
2 つのタワーは、それぞれ独立した正規化層と多層パーセプトロンを保持しています。一方、言語、動画、音声、アクションにわたる情報の整合性を図るマルチモーダルアテンション層は共有されています。
この設計により、モデルは出力を生成する前にシーンについて推論することが可能になります。タスクに応じて、Cosmos 3 は自己回帰型タワーから推論トークンを生成するか、拡散型タワーからノイズ除去された動画とアクショントークンを生成します。
情報の種類に応じて、アテンションパターンも適応されます。言語処理では因果的アテンション(causal attention)が用いられ、各トークンはそれ以前に出現したトークンにのみ注目します。一方、拡散モデルのトークンは利用可能なコンテキスト全体をより広く参照し、一貫性のある予測と生成を実現します。
これらの要素を組み合わせることで、モデルは「現在何が起きているか」「次に何が起こりうるか」、そして「行動が結果にどう影響するか」を共通の表現として捉えることができます。
行動のための共通表現
物理システムでは、行動の記述方法が異なります。車両は自己位置(ego pose)と移動によって行動を表し、カメラはカメラ自体の運動で表現します。ロボットアームはそのエンドエフェクタの姿勢を用い、手やグリッパーの場合は把持状態も同時に表現する必要があります。
Cosmos 3 はこうした多様なエンボディメントを、共通の行動表現へとマッピングします。
行動は、以下の要素を捉えるコンパクトな幾何ベクトルとして符号化されます。
- 空間的な位置関係
- 物体の形状と向き
- 動作の時間的変化
- 物理的な相互作用
- トランスレーション(移動)
- ロテーション(回転)
- マニピュレーション状態
これにより、制御と世界の視覚構造の間に直接的な結びつきが生まれます。モデルは画素の変化を物理的な運動や空間関係、そして制御入力と関連付けることができます。
その結果、生成された動画は単なる視覚予測を超えたものになります。これは、ある行動に対して世界がどのように変化すると予想されるかを表すものとなるのです。これにより、開発者は運動、制御、因果関係に基づいたトレーニングデータを入手できます。
ポリシーモード
ポリシーとして Cosmos 3 は、行動とその予想される視覚的帰結をセットで予測します。
モデルはシステムが取るべき行動を生成し、次に何が起こりうるかをシミュレーションできます。これにより、世界モデリングとロボットのポリシー学習・評価が直接結びつきます。
現在の状態を入力とし、行動と視覚的帰結を出力する。
これらのモードによって、1 つのモデルで因果関係や効果、そしてポリシーを学習することが可能になります。行動はモデル内を双方向に流れるため、Cosmos 3 Edge は行動の結果を予測することも、結果から行動を推論することもできます。

また、ピッキング&プレースタスク向けに DROID データセットでポストトレーニングされたロボットマニピュレーションポリシー「Cosmos 3 Edge Policy (DROID)」も公開します。同様に、ポストトレーニング用のスクリプトも併せてリリースしています。
開発者は、H100 または NVIDIA DGX Station の小規模クラスタを使用して、NVIDIA エッジおよびアクセラレーテッドコンピューティングプラットフォームへの展開前に、ターゲットワークロード向けに Cosmos 3 Edge を効率的にファインチューニングできます。
パフォーマンス向上のためのポストトレーニングサンプル
ベースモデルに加え、開発者が自身のアプリケーションに合わせて Cosmos 3 を適応・最適化できるよう、参照用のポストトレーニング済みチェックポイントとトレーニングレシピも公開しています。
Cosmos 3 はオープンワールドの基盤モデルプラットフォームです。高品質でドメイン固有のデータを用いてポストトレーニングを行うことで、専門的な用途における精度はさらに向上します。Cosmos は、オープンフレームワークを活用してドメイン適応型の世界モデルを構築するための出発点となります。
ポストトレーニングにより、開発者は出力品質を維持したままモデルのパフォーマンスを向上させることが可能です。このワークフローの実例として、64B モデル向けのより高速な参照実装を提供する「Cosmos 3 Super 4-Step Distillation」のチェックポイントと、ポストトレーニング用スクリプトも併せて公開しています。これにより、開発者は Cosmos を自らのドメインに適応させ、下流タスクでのパフォーマンスをさらに高めることができます。
Cosmos 3 Super 4-Step(テキストから画像へ・画像から動画へ): これらは分布整合型で蒸留されたチェックポイントとスクリプトであり、拡散プロセスのデノイジングステップ数を従来の 35〜50 からわずか 4 ステップに削減します。これにより、画像および動画の品質や忠実度を維持したまま、推論速度を最大 25 倍向上させることが可能です。
これらの例は、開発者が基盤として活用できる参考実装です。オープンソースのトレーニングスクリプトを使用すれば、Cosmos 3 Edge をカスタムロボットポリシー向けにポストトレーニングしたり、Cosmos 3 Super をアプリケーションに合わせて高速な画像・動画生成用に知識蒸留(ディストillation)したりすることが可能です。
Cosmos 3 Edge を試す
モデルのダウンロードはこちら:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3 Edge は、共通の世界表現を通じて「理解」「予測」「シミュレーション」「行動」を結びつけます。開発者はこれをデバイス上でセンサーに近い場所にデプロイできます。モデルは推論エンジンとして、あるいは行動生成器として機能します。
オープンソースの Cosmos フレームワークを活用して、モデルのカスタマイズや専門化を進めましょう。
Cosmos 3 の詳細はこちら:https://huggingface.co/collections/nvidia/cosmos3
これからの展望
Physical AI(物理的人工知能)向けに Cosmos 3 をさらに進化させ、インタラクティブな世界生成や運転シナリオのシミュレーション、ロボットポリシーに関する改善を順次リリースしていきます。
また、より幅広いハードウェアに対応した高速推論と効率的なポストトレーニングへの投資も進めています。これにより、下流モデルを構築する際に必要な時間と計算リソースを大幅に削減します。
具体的には、vLLM などのオープンソースの推論・最適化フレームワークを活用して Cosmos 3 のチェックポイントを最適化する取り組みを行っており、さらなる最適化機能や開発者向けツールの提供も間もなく開始されます。
AI算出
主要ニュースainew評価高い
記事は特定のバージョンを持つ新モデルの発表であり、技術的詳細(パラメータ数、ベンチマーク結果、動作環境)を含んでいるため新規性は高い。また、NVIDIA Jetson の新モジュール言及など日本開発者への実装価値があるが、日本固有の政策や企業発表ではないため中程度の関連性となる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 50
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み