エージェントスキルを用いて NVIDIA Cosmos 3 を1日でポストトレーニング
本文の状態
日本語全文を表示中
詳細モードで約20分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
コーディング AI エージェントと NVIDIA TAO のアジェンティック微調整スキルを活用することで、データ整形やハイパーパラメータ調整といった手作業を排除し、1 日以内でのポストトレーニングを実現する。
AI深層分析を開く2026年7月31日 02:00
AI深層分析
キーポイント
AI エージェントによる自動化ワークフローの確立
コーディング AI エージェントと NVIDIA TAO のアジェンティック微調整スキルを活用することで、データ整形やハイパーパラメータ調整といった手作業を排除し、1 日以内でのポストトレーニングを実現する。
LoRA と AutoML を組み合わせた精度向上
Low-Rank Adaptation (LoRA) の採用によりゼロショットベースラインから即座に精度を向上させ、さらに TAO AutoML による設定の体系的なスウィープで 93.35% という最高精度を達成した。
Cosmos 3 モデルのアーキテクチャ特性
NVIDIA Cosmos 3 はテキスト、画像、動画、音響、行動追跡を統合する混合トランスフォーマー (MoT) アーキテクチャを採用しており、汎用性能は高いものの実環境への適応にはドメイン特化が必要である。
Cosmos 3 MoT アーキテクチャの構成
堅牢な推論と計画のための自己回帰型トランスフォーマーと、未来の世界状態や行動を正確に予測する拡散型トランスフォーマーを組み合わせた双塔設計を採用している。
オープンモデルにおけるトップパフォーマンス
Super 64B や Nano 16B など複数のサイズで提供され、動画理解や物理的生成、行動ポリシーのベンチマークにおいてオープンモデルとして常に第1位を維持している。
重要な引用
condensing what was a multiday engineering effort into a single day of automated execution
instantly boosting the zero-shot baseline from 54.41% exact-match accuracy to an impressive 87.14%
pushed peak accuracy to 93.35%
NVIDIA Cosmos 3 MoT architecture uses an autoregressive transformer for robust reasoning and planning, paired with a diffusion transformer to accurately predict future world states and actions.
編集コメントを表示
編集コメント
本記事は、複雑なモデル微調整プロセスを AI エージェントに委譲する実用的なアプローチを示しており、開発現場の生産性向上への具体的な道筋を描いている。NVIDIA の Cosmos 3 と TAO ツールチェーンが連携することで、専門知識が限られる環境でも高品質なビジョンモデルの構築が可能になる点に注目すべきである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
自律型コーディング AI エージェントが、ほとんど手作業を要さずにビジョン推論モデルの精度を 90% 以上に引き上げられるとしたらどうでしょうか?ビジョン推論モデルを実際の動画タスクに適応させる際、開発者は多くの場合、データ形式の変換やコンテナ設定、トレーニングスクリプトの作成、ベースライン評価、ハイパーパラメータのスウィープなどに数日を費やし、ポストトレーニングが精度向上に寄与するのかどうかを確認する前に時間を浪費してしまいます。
オープンな物理 AI 世界基盤モデルである NVIDIA Cosmos 3 と、NVIDIA TAO エージェントスキルを組み合わせることで、この課題に対する解決策となります。Cosmos 3 は、共有のオムニモーダル・ワールドモデルを通じて理解、生成、シミュレーション、そして行動をつなぎます。テキスト、画像、動画、環境音、そして行動追跡を、Mixture-of-Transformers (MoT) アーキテクチャの下で統合しています。このモデルは優れた初期状態でのビジョン推論能力を提供しますが、現実世界への展開では、独自のカメラアングルやエッジケース、環境に対応するためにドメイン特化が不可欠です。そこがポストトレーニングの重要性を生むポイントとなります。
この記事では、コーディングエージェントとビジョンモデルの代理微調整スキルを提供する NVIDIA TAO ライブラリを活用し、NVIDIA Cosmos 3 Nano モデルをシームレスにポストトレーニングして動画質問応答タスクに対応させる方法をご紹介します。
NVIDIA の実験結果によると、Low-Rank Adaptation (LoRA) を活用することで、モデルの適応が効率的に行われ、ゼロショットベースラインの正確率(4 択形式)をわずか 54.41% から 87.14% に劇的に引き上げました。さらに TAO AutoML を用いて設定を体系的に探索し、試行錯誤を排除したことで、最高精度は 93.35% に達しました。これにより、本来数日かかるエンジニアリング作業が、自然言語プロンプト数個で駆動される自動実行プロセスとして一日で完了するようになりました。
*Video 1. NVIDIA TAO エージェントスキルを用いた Cosmos 3 Nano のポストトレーニングを、セットアップから AutoML スイープ、最終レポートまでステップバイステップで学ぶ*
Cosmos 3 MoT アーキテクチャのメリットとは?
NVIDIA Cosmos 3 の MoT アーキテクチャは、堅牢な推論と計画を実現する自己回帰型トランスフォーマーと、未来の世界状態や行動を高精度に予測する拡散トランスフォーマーを組み合わせたものです。Super 64B や Nano 16B など複数のサイズで提供されており、オープンモデルの中で一貫してトップランクを維持しています。
主なベンチマークでの実績は以下の通りです。
- ビデオ理解: VANTAGE-Bench
- 世界生成の精度: PAI-Bench および Physics-IQ
- 行動ポリシー: RoboLab と RoboArena
図 1 に示すように、このモデルは統一されたデュアルタワー構造を採用しています。自己回帰型の推論パスと反復的な拡散生成パスに分割されており、各モダリティ固有の入力はトークン化された後、個別の LayerNorm と MLP ブロックを通過します。その後、クロスストリーム接続を通じて相互作用し、テキストと視覚の文脈に対して、キー・バリュー状態(KAR, VAR)が生成用のフルアテンションブロックへ渡されます。

Cosmos 3 Nano の最適化にはどのポストトレーニング手法が適しているか?
Cosmos 3 に代表される基盤モデルは、膨大で多様なデータセットから汎用的なパターンを学習します。しかし、専門的なドメインタスクや独自の語彙、特定のカメラ視点などをより深く理解させるためには、ポストトレーニング(学習後の微調整)が不可欠です。
Cosmos 3 Nano のようなビジョン言語推論モデルをポストトレーニングする際、開発者は通常、以下の 2 つの手法から選択することになります。
・フルパラメータ教師あり微調整 (SFT): ドメインシフトが極めて大きい場合や、モデル構造そのものの変更が必要な場合に最適です。ただし、すべての重みを更新するため膨大な計算リソースを要し、汎用的な知識において性能が低下するリスクもあります。
・低ランク適応 (LoRA): 迅速なイテレーションに理想的です。LoRA はベースモデルの重みを凍結したまま、学習可能な低ランク分解行列を注入します。
本記事で詳述する例では、Cosmos 3 Nano の LoRA 後方トレーニングは、フルパラメータ SFT に比べて約 7 分の 1 の GPU 時間で済み、エンジニアチームが 1 日でのトレーニング完了を実現可能にしました。
Cosmos 3 Nano を後方トレーニングする方法の選択肢
Cosmos 3 Nano の後方トレーニングには、主に 2 つの方法があります。
- オープンフレームワーク: 完全な Open Cosmos 3 後方トレーニングフレームワーク を公開しており、トレーニングレシピやデータセット形式、設定ファイルを直接提供しています。これにより、後方トレーニングパイプラインのすべての工程を自前で構築・管理できます。カスタムな学習ロジックが必要だったり、既存インフラと統合したい場合に適しています。
- TAO エージェントスキル: この機能の上に「スキル」が積み重なり、自動化を実現します。コーディングエージェントがワークフローを推論し、データの問題を修正し、トレーニングコンテナを実行し、ハイパーパラメータの探索まで代行してくれます。この自動化こそが、数日かかるセットアップを、以下のセクションで詳述する「2 つのプロンプトで完了する 1 日の体験」へと圧縮している要因です。

NVIDIA TAO は、コードエージェントがサポート対象のモデルファミリー向けにビジョンモデルのポストトレーニングワークフローを実行できるよう支援する「エージェントスキル」を導入しました。これらのスキルには、モデルの訓練・評価・最適化・展開に必要なタスク固有の知識がパッケージ化されており、フレームワークの詳細やランチャーの動作、設定ファイルの構造、データ読み込み方法、評価ワークフローなどが含まれています。
手動でコマンドや設定ファイルを一つずつ組み立てる必要はなく、TAO のスキルを使えばコードエージェントがワークフローを推論し、正しい手順を自動生成できます。
Cosmos 3 のアーキテクチャは、その機能を「Reasoner タワー」と「Generator タワー」に分離しています。Reasoner タワーは多様なモダリティを理解し論理を処理するビジョン言語モデル(VLM)であり、Generator タワーは動画や行動の生成を担当します。
TAO エージェントスキルを使用すると、この 2 つの重みの分離が自動的に処理されます。これにより、後続タスク向けに Reasoner の重みだけを最適化し、効率的に微調整することが可能になります。
コーディングエージェント向けの TAO スキルインストール方法
TAO スキルセットは、あらゆるコーディングエージェントで利用可能です。本例では Codex を使用していますが、Claude 向けにも同様の設定手順が NVIDIA-TAO/tao-skill-bank リポジトリに記載されています。
最も迅速なセットアップ方法は、TAO スキルバンクリポジトリから自動インストールスクリプトを利用することです。もし手動で各ステップを踏みたい場合は、同リポジトリ内のスクリプトが個別のステップに分解されているので、それらを活用できます。
実験を開始する前に、ターミナル環境に必要なキーを設定してください。
export HUGGINGFACE_TOKEN="your_hf_token" #To pull missing models
export NGC_API_KEY="your_ngc_key" #For TAO Docker containers
export AUTOML_LLM_API_KEY="your_llm_key" #Required for LLM-guided hyperparameter sweeps in AutoML
データセット
本例では、トヨタが提供する Woven Traffic Safety (WTS) データセット を用いて、Cosmos 3 Nano のポストトレーニングを行う方法を示します。実験の焦点は、8,000 件以上の学習・検証サンプルを含む 4 択形式の動画質問応答タスクです。
このデータセットは、交通安全において詳細な実世界シーン理解が不可欠であるため、Cosmos 3 のポストトレーニングを説明する目的に最適です。モデルは、動画から複雑な道路構造や信号機、車両、歩行者、そして出来事の文脈について推論する必要があります(図 3)。ただし、このワークフローは倉庫監視、自動運転車の知覚、ロボットの作業セルなど、あらゆる下流の視覚的推論タスクにも応用可能です。
データセット例
質問: 道路の形状はどうなっていますか?
- A: 片側道(右カーブ)
- B: 片側道(直線)
- C: 交差点(信号なし)
- D: 交差点(信号あり)
正解: D
シングルプロンプトで LoRA ポストトレーニングを実行する方法
認証情報をエクスポートした同じ環境で、Codex プロンプトを 1 つ実行するだけで、エンドツーエンドの全体パイプラインを開始できます。
Cosmos 3 モデルを Woven Traffic Safety データセット上で LoRA 事後トレーニングしてください
トレーニングデータ:/home/…/WTS_dataset/wts_data_train (原文の技術表記: Perform LoRA post-training of the Cosmos 3 model on the Woven Traffic Safety dataset.、Training data: /home/…/WTS_dataset/wts_data_train)
検証データ:/home/…/WTS_dataset/wts_data_val
Hugging Face 上のベースモデル:nvidia/Cosmos3-Nano
ポストトレーニング後のモデルと比較するため、まずベースライン評価を実行してください。 (原文の技術表記: Validation data: /home/…/WTS_dataset/wts_data_val、Base model on Hugging Face: nvidia/Cosmos3-Nano、Also perform a baseline evaluation first, to compare with the post-trained model.)

裏側では、Codex が TAO ライブラリを照会し、Cosmos に特化した「reason」スキルを選択します。エージェントは基盤となるフレームワークやデータローダーの処理を自律的に行い、以下の手順を実行します:
自動エラー修正:エージェントがデータセット注釈をスキャンし、欠落している動画の FPS パラメータを検出すると、その場で設定パッチを適用します。
モデルキャッシュ:Hugging Face のトークンを使用して、Cosmos 3 の重みを安全に取得します。
ベースライン評価では、重みを変更する前にゼロショットでの評価を実施します。その結果、ベースとなる Cosmos 3 モデルの初期精度は 54.41% でした。
LoRA パイプラインの実行では、エージェントが最適化された LoRA のトレーニング設定を生成し、TAO トレーニングコンテナを起動します。
ポストトレーニング完了後、エージェントは LoRA で適応させたモデルを評価し、その結果をベースラインと比較します。
たった 1 ラン、8 台の NVIDIA A100 Tensor Core GPU で約 30 分のトレーニング時間だけで、精度は 87.14% に跳ね上がりました。これは 32 ポイントもの劇的な改善であり、すべてを人手を介さずに達成されています。
TAO AutoML を用いたビジョンモデルの最適化手法
LoRA は強力な初期結果をもたらしますが、ポストトレーニングのパフォーマンスは適切な設定の選択に大きく依存します。学習率、LoRA ランク、ドロップアウト、バッチサイズ、スケジューラーの設定など、さまざまなハイパーパラメータが最終的な精度に影響を与えます。
手動で一つずつ設定を試すのではなく、TAO AutoML を使えばエージェントが重要なポストトレーニングのパラメータに対して体系的な探索を実行できます。
TAO AutoML は、以下のようなパラメータ探索戦略をサポートしています(これらに限定されません):
- ベイジアン最適化
- Hyperband
- ベイジアン最適化と Hyperband の組み合わせ
- バッチファースト・ベイジアン最適化
LLM を活用した検索機能により、NVIDIA NIM、OpenAI、または OpenAI 互換のエンドポイントなどを用いた LLM ブレーンがハイパーパラメータを提案します。これには NVIDIA_API_KEY または AUTOML_LLM_API_KEY の取得が必要です。今回の実験では Gemini API エンドポイントを利用しました。
各アルゴリズムの詳細な解説については、TAO AutoML アルゴリズムのドキュメントをご覧ください。
同じコーディングエージェントのチャットで別のプロンプトを入力すると、エージェントに AutoML スイープの実行を指示できます:
Run an AutoML sweep to improve the LoRA result. Let TAO choose suitable search strategies (原文の技術表記: Run an AutoML sweep to improve the LoRA result. Let TAO choose suitable search strategies )
重要なトレーニングのハイパーパラメータを調整し、検証精度を最適化して、最良のモデルを要約します。
エージェントは複数の戦略を用いて候補トライアルを生成し、各実験を開始し、ハイパーパラメータを追跡し、結果を評価し、最適な設定を記録します。
LoRA と AutoML はどのような精度向上をもたらしたか?
TAO エージェントスキルによる自動化と TAO AutoML の最適化能力を組み合わせることで、モデルはゼロショットベースラインと比較して驚異的な精度の向上を達成しました。この実験全体は、整列されていないベースモデルから、たった 2 つのプロンプトを通じて高度に特化した交通安全の専門家へと進化しました。 (原文の技術表記: and tune the important training hyperparameters. Optimize validation accuracy and summarize 、the best models.)
| モデルバリアント | 戦略 | 検証精度 | ベースラインに対する改善幅 |
|---|---|---|---|
| Cosmos 3 Nano (Base) | ゼロショットベースライン | 54.41% | 参照値 |
| Cosmos 3 Nano + LoRA | シングルプロンプトベースライン LoRA | 87.14% | +32.73 パーセントポイント |
| Cosmos 3 Nano + AutoML | ベイズ最適化 | 93.35% | +38.94 パーセントポイント |
表1:異なるポストトレーニング戦略における Cosmos 3 Nano の検証精度の向上
どのようなハードウェアとランタイムが必要か?
TAO スキルの多構成実験スイープには、クラウド上の NVIDIA ハードウェアを使用しました。Cosmos 3 MoT アーキテクチャの高い効率性により、NVIDIA A100 (80 GB) GPU を搭載したノード上で LoRA ポストトレーニングの 1 エポックは約 30 分で完了します。つまり、1 時間未満で精度 87.14% を達成する高精度なモデルを迅速に構築できます。
ただし重要な注意点として、この閾値を超えてさらに精度を高めたい場合は、最適な設定を見つけるために TAO AutoML のハイパーパラメータスイープが必要です。今回の実験環境では、Oracle Cloud Infrastructure (OCI) 上でホストされた複数の A100 GPU ノードで並列実行した結果、43 の並行試行の処理に 19.5 時間かかりました。
比較のため、フルパラメータ SFT(Supervised Fine-Tuning)の実行には NVIDIA H100 GPU で 3 時間 34 分を要しました。
ポストトレーニングの定性的な結果は?
数値だけでは物語の全体像は見えません。ドメイン特化型の真価が発揮されるのは、複雑で曖昧な実世界のエッジケースを評価したときです。図 5 と図 6 は、モデルのポストトレーニング前後における定性的な比較を示しています。
Cosmos 3 のポストトレーニング済み LoRA アダプターのデプロイ方法
「Cosmos 3 Reasoner NIM」は、生産環境で使える OpenAI 互換の推論エンドポイントへ最短ルートを提供します。この製品には、効率的なオンデバイス推論のために設計された、独立して最適化された自己回帰型推論エンジンが搭載されています。
NIM マイクロサービスは事前に構築・最適化されたコンテナとして提供されるため、手動での vLLM 依存関係の解決や複雑な CUDA の組み合わせ設定を完全に省略できます。
テキスト、画像、動画の入力から直接テキスト出力を提供します。ポストトレーニング済みのモデルを展開するには、展開時に LoRA アダプターディレクトリを NIM 環境にそのまま渡すだけで十分です。
NVIDIA Cosmos 3 Reasoner NIM を使用して Cosmos 3 モデルの提供を行う手順については、動画チュートリアル「How to Run NVIDIA Cosmos 3 Reasoner NIM for Video Reasoning」をご覧ください。LoRA アダプターの組み込み方法については、「NVIDIA NIM documentation」を参照してください。
Cosmos 3 のポストトレーニングを開始する
汎用 AI から高度に特化した物理 AI への移行は、もはやインフラとの格闘を伴うものではありません。NVIDIA Cosmos 3 Reasoner タワーが持つ構造的推論能力と、NVIDIA TAO エージェントスキルによる自動化を組み合わせることで、生動画データから単一日で展開準備完了の特化型ビジョン・ランゲージモデルへ移行できます。
自然言語の指示 2 つだけで、コーディングエージェントがフレームワークの複雑さを処理し、データの不具合を修正し、ベースラインベンチマークを実行し、TAO AutoML を介して高度なハイパーパラメータチューニングを手動なしで実行します。これにより、エンジニアリングチームは物理 AI とロボティクスにおける核心的な課題解決に集中できます。
独自のビジョン推論モデルをポストトレーニングしたいですか?ローカル開発環境でこのワークフローを実装するためのリソースを確認してください:
- Cosmos 3 を試す: Hugging Face で Cosmos 3 Nano および Super チェックポイントをダウンロードします。
- 例とコードを探す: NVIDIA/cosmos GitHub リポジトリ を参照してください。
- Cosmos 3 Nano Reasoner モデル体験 と Cosmos 3 Nano モデル体験 をお試しください:build.nvidia.com/nvidia/cosmos3-nano-reasoner および build.nvidia.com/nvidia/cosmos3-nano
- 動画チュートリアルを見る: 「How to Run NVIDIA Cosmos 3 Reasoner NIM for Video Reasoning」
- TAO エージェントスキルをインストールする: インストールスクリプト、実装ガイド、およびスキルのリストは NVIDIA-TAO/tao-skill-bank GitHub リポジトリで入手できます。技術的な質問については TAO 開発者フォーラム をご利用ください。
AutoML の詳細については、ハイパーパラメータ最適化の戦略やコアレイヤーについて深く掘り下げるには、NVIDIA TAO ドキュメントをご覧ください。
チュートリアル動画は、Post-Train NVIDIA Cosmos 3 With TAO 7 Agent Skills の視覚的なセットアップ手順に従ってください。
ライブ配信に参加して質問もできます。7 月 16 日の Cosmos Labs ライブストリーム に視聴し、7 月 30 日の Cosmos Labs オフィスアワー にぜひご参加ください。
AI算出
技術分析ainew評価高い
NVIDIA Cosmos 3 のアーキテクチャと TAO エージェントスキルを用いた具体的なポストトレーニング手法、および LoRA と AutoML を活用した精度向上の数値データが中心であるため、技術分析として分類し、新規性も高いスコアとした。日本固有の導入事例や規制情報は含まれていないため、関連性は低めとした。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み