NVIDIA、DeepStream 9.1 でビジョン AI にエージェント機能追加
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
NVIDIA は DeepStream 9.1 をリリースし、マルチビュー 3D 追跡と自動キャリブレーション機能を「アジェンティックスキル」として実装することで、開発者が多カメラ環境での物体追跡を迅速に構築できるようにした。
AI深層分析を開く2026年7月29日 11:34
AI深層分析
キーポイント
アジェンティック AI スキルの追加
DeepStream 9.1 はコーディングエージェント向けの 13 の新しいスキルを提供し、開発者が概念から実行可能なパイプラインへ移行する速度を向上させる。
マルチビュー 3D 追跡 (MV3DT) の実装
複数のカメラからの検出結果を共通の 3D 座標系に投影し、同一オブジェクトへのグローバル一貫した ID を割り当てる機能により、手動キャリブレーション不要での跨カメラ追跡を実現する。
自動キャリブレーション (AMC) の導入
既存の動画ファイルやストリーム内の追跡オブジェクトを分析することでカメラネットワークのキャリブレーションを行い、チェッカーボードやダウンタイムを不要とする。
JetPack 7.2 とオープンソース化
NVIDIA Jetson Orin および Thor エッジデバイスに対応する JetPack 7.2 をサポートし、リポジトリは CC-BY-4.0 と Apache-2.0 のライセンスで統一された。
自動カメラ補正マイクロサービスの導入
AMCは既存の映像ファイルやストリーム内の追跡対象を分析して、カメラの内部・外部パラメータを推定する。これによりチェッカーボードやダウンタイムを必要とせず、レイアウト画像とアライメントポイントのみで補正が可能になる。
重要な引用
DeepStream is NVIDIA's streaming analytics toolkit for AI-based video and image understanding.
MV3DT projects detections from multiple calibrated cameras into a shared 3D coordinate system.
AMC calibrates a network by analyzing tracked objects in existing video files or streams.
"Rather than editing configuration files, you describe intent in natural language."
編集コメントを表示
編集コメント
DeepStream の新バージョンは、物理的なセットアップの複雑さを AI が解決するというアプローチが際立っており、実現場での導入障壁を下げると期待される。特に「アジェンティックスキル」として機能する点は、開発者の負担軽減という観点で非常に意義深い進展と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
NVIDIA が DeepStream 9.1 をリリースしました。このアップデートは、動画解析における長年の課題に焦点を当てています。従来、複数のカメラ間で一つのオブジェクトを追跡するには、手動でのカメラキャリブレーションと複雑な計算が必要でした。DeepStream 9.1 はこれに対し、「Multi-View 3D Tracking(MV3DT)」と「AutoMagicCalib(AMC)」の 2 つの新機能を追加することで解決を図ります。これらはどちらもコーディングエージェント向けの「アジェンティックスキル」として提供されており、開発者が概念から実行可能なパイプラインへと移行するスピードを劇的に向上させます。
DeepStream 9.1 とは何か
このアップデートを理解するには、まず基盤となるプラットフォームを確認する必要があります。DeepStream は、AI を活用した動画や画像の理解を実現するための NVIDIA のストリーミング解析ツールキットです。NVIDIA GPU 上でマルチストリームかつマルチモデル推論を行うための GStreamer ベースのフレームワークを提供しています。パイプラインには、ハードウェアアクセラレーションによるデコード・エンコード、TensorRT 推論、オブジェクト追跡、そしてメッセージブローカーとの連携が含まれています。
この基盤の上に、バージョン 9.1 では以下の 5 つの注目すべき機能が追加されました:
- コーディングエージェント向けの 13 のアジェンティックスキル
- カメラ間での追跡を可能にする MV3DT スキル
- 自動キャリブレーションを実現する AMC スキル
- Jetson Orin や Thor エッジデバイスに対応した NVIDIA JetPack 7.2 サポート
- CC-BY-4.0 および Apache-2.0 ライセンスの下、統合されたオープンソース GitHub リポジトリの公開
MV3DT はどのようにしてカメラ間での追跡を実現するのか
これらの新機能の中でも、MV3DT(マルチビュー 3D トラッキング)は中核となるスキルです。その仕組みを理解しておきましょう。
MV3DT の核心は、複数のキャリブレーション済みカメラからの検出結果を、共通の 3D 座標系に投影することにあります。その後、異なる視点から捉えられた同一オブジェクトの観測データを関連付け、最終的に一貫性のあるグローバルなオブジェクト ID を割り当てます。
具体的なデータフローは、以下の 4 つの段階で構成されています。
まず検出フェーズでは、各カメラストリームが個別にオブジェクト検出器を実行します。MV3DT では、以下の 3 つのモデルを標準でサポートしています:
- PeopleNetTransformer: トランスフォーマーベースの人検出器で、歩行者シーンにおけるデフォルト設定です。
- PeopleNet v2.6.3: DetectNet_v2 アーキテクチャに基づく高効率な検出器です。
- RT-DETR 2D: 歩行者、トランスポーター、フォークリフトなどを対象としたマルチクラス検出器です。
次に単眼 3D 知覚フェーズでは、各カメラが YAML 形式のキャリブレーションファイルに保存された 3×4 の射影行列を使用します。これにより、地面を基準とする仮定に基づいて、2D バウンディングボックスを 3D ワールド空間座標へ逆投影します。
続いてマルチビュー関連付けフェーズでは、トラッカーは Message Queuing Telemetry Transport(MQTT)を使用してトラックレットを共有します。MQTT は軽量なパブリッシュ/サブスクライブ型のメッセージングプロトコルです。2 つのカメラが同一人物を検知した場合、3D ワールド空間内での近接度に基づいてトラックレットをマッチングさせます。
関連付けが完了すると、結果は以下の 3 つの形式でストリーミングされます。
- On-Screen Display(OSD): 2D および 3D バウンディングボックスを含むタイル状グリッドを表示します。
- Bird's-Eye View(BEV): 上空からの視点による軌跡マップをレンダリングします。
- Kafka メッセージング:センサー ID、オブジェクト ID、3D バウンディングボックスなどのフレームごとの protobuf メタデータを配信します。
手動設定を不要にする AutoMagicCalib
MV3DT はキャリブレーション済みのカメラに依存しますが、従来はチェッカーボードの設置や稼働停止が必要でした。これに対し、AMC(AutoMagicCalib)は既存の動画ファイルやストリーム内の追跡対象を分析することでネットワークを自動キャリブレーションします。各カメラの内部パラメータ(焦点距離、主点、レンズ歪み)と外部パラメータ(回転、並進、世界座標上の位置)を推定するのです。
仕組みの詳細を見ると、このパイプラインは 5 つの段階で構成されています。具体的には「カメラごとの軌道抽出」「単一視点での補正」「複数視点間のトラックレットマッチング」「バンドル調整」、そして状況に応じて行われる VGGT(Visual Geometry Grounded Transformer)による微調整です。対象物の動きが限定的な場合でも、VGGT が精度を補完します。AMC は REST API と Web インターフェースを持つマイクロサービスとして動作し、ユーザーはレイアウト画像と数点の対応点を指定するだけで済みます。
エージェント型スキルのワークフロー
MV3DT と AMC の定義が整った今、実装の鍵となるのは「スキル」そのものです。設定ファイルを手動で編集するのではなく、自然言語で意図を記述するだけで動作します。これらのスキルは Claude Code、Codex、Cursor などのエージェントと連携して機能し、セットアップも非常に短時間で完了します。
Copy CodeCopiedUse a different Browser
git clone https://github.com/NVIDIA/DeepStream.git
cd DeepStream
Copy skills into your agent's skill directory (Codex shown)
mkdir -p ~/.codex/skills
cp -r skills/* ~/.codex/skills/
エージェントを起動すれば、単一のプロンプトで参照アプリケーションが実行されます。
Copy CodeCopiedUse a different Browser
deploy mv3dt on the 12-camera sample dataset
MV3DT スキルは、ここで前提条件の検証を行い、コンテナをプルして Kafka と Mosquitto ブローカーサービスをインストールします。さらにモデル重みのダウンロードやパイプライン設定の生成、そして追跡処理の起動も実行します。特筆すべき点として、キャリブレーションファイルが存在しない場合、自動的に AMC スキルがトリガーされる仕組みになっています。
DeepStream 9.0 と 9.1 の比較
背景を整理するために、以下の表に各バージョン間の主な変更点をまとめました。
| 機能 | DeepStream 9.0 | DeepStream 9.1 |
|---|---|---|
| エージェント型スキル | 2 つ (deepstream-dev, import-vision-model) | 13 のエージェント型スキル |
| マルチカメラ 3D 追跡 | スキルとして未実装 | MV3DT スキルとリファレンスアプリを提供 |
| カメラキャリブレーション | 手動設定 | AutoMagicCalib (AMC) マイクロサービスによる自動処理 |
| Jetson サポート | JetPack 7.1 GA | JetPack 7.2 (Orin, Thor 対応) |
| サンプルデータセット | なし | 4 カメラおよび 12 カメラの MV3DT セット |
| デリバリ方法 | NGC パッケージと GitHub ソースコード | 統合された GitHub モノレポ |
具体的なユースケースと事例
これらの機能を活用することで、以下のような具体的な導入が可能になります。
- 倉庫の安全性向上: RT-DETR 2D を使用し、フォークリフト付近で作業員を追跡。通路をまたいでも ID は統一されます。
- 小売分析: カメラのゾーン間を移動する顧客を追跡し、再識別エラーなく滞在時間を計測します。
- スマートビルディング監視: 各階の人数をカウントし、そのメタデータを Kafka を経由してダッシュボードへ送信します。
- ロボティクスとスマートシティ: ナビゲーションやインシデントレビューのために、一貫した世界座標系を共有できます。
インタラクティブな解説
仕組みを確認するために、以下の埋め込みデモでは、3 つのカメラ視野の間を歩く 1 人の人物をアニメーション化しています。単純な個別カメラごとの 2D 追跡と、MV3DT(Multi-View 3D Tracking)による 3D 融合を切り替えて、オブジェクト ID が一貫して維持される様子をご覧ください。
主なポイント
DeepStream 9.1 では、13 のエージェント機能(アジェンシー・スキル)が搭載されました。これにより、コーディングエージェントは自然言語のプロンプトだけで、マルチカメラのビジョンパイプラインを構築できるようになります。
MV3DT は、各カメラで検出されたデータを統合して 1 つの共有 3D ワールドを形成します。これによって、異なる視点間でも一貫したグローバルなオブジェクト ID を維持することが可能になりました。
AutoMagicCalib では、従来のチェッカーボードを使った手動キャリブレーションに代わり、既存の映像データからカメラの内部パラメータ(イントリック)と外部パラメータ(エクストリック)を推定して自動補正を行います。
JetPack 7.2 のサポートにより、Jetson Orin や Thor への展開が可能になりました。これらはすべて、統一されたオープンソースの GitHub モノレポ内で管理されています。
出力は OSD(画面表示)、Bird's-Eye View(上空視点)、Kafka プロトobuf メタデータとしてストリーミングされ、 downstream の分析やダッシュボードでの利用がすぐに始められます。
GitHub リポジトリや Hugging Face ページ、製品リリース、ウェビナーなどのプロモーションをご希望の場合は、パートナーシップについてお問い合わせください。
NVIDIA が DeepStream 9.1 をリリースし、ビジョン AI にアジェンシー AI を導入。13 のスキルとマルチビュー 3D トラッキングが実現
本記事は MarkTechPost で公開された「NVIDIA Released DeepStream 9.1: Bringing Agentic AI to Vision AI With 13 Skills and Multi-View 3D Tracking」の続編(6/6)です。
AI算出
主要ニュースainew評価高い
記事は AI エージェント機能やマルチビュー追跡など、DeepStream 9.1 の具体的な技術的変更点を詳細に報じており、新規性と検索意図の両方が高い。日本企業への直接的な影響記述はないが、Jetson などのハードウェア対応により開発者層に関連性がある。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 50
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み