Seed Research|Depth Anything 3:単一Transformerアーキテクチャによる任意視点の空間再構築を実現
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
字节跳动Seed
Seed Researchが、単一のTransformerアーキテクチャを用いて、任意の視点からの空間再構築を可能にする「Depth Anything 3」を発表した。この技術は、単眼深度推定と多視点再構築の技術的課題を克服するものである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Seed Research 2025-11-27 11:30 北京
単目深度推定と多視点再構築の技術的ボトルネックを突破
人間は一枚の写真や動画を見るだけで、瞬時に頭の中に空間の立体像を構築することができます。この能力は、異なる視点における空間幾何学的関係に対する理解と推論に由来するものであり、機械が物理世界を理解し参加するためには、空間知能を向上させ、シーンに対して精密な再構築を行う必要があります。
現在の視覚的空間再構築モデルの多くは、複雑なアーキテクチャと多タスク学習手法に依存しており、異なるネットワークモジュールを用いて深度推定、カメラ姿勢推定、多視点幾何学的再構築などのタスクをそれぞれ処理しています。しかし、これらの方法はしばしばアーキテクチャが過度に大規模であったり、タスク間の結合性が強すぎたりする問題に直面し、モデルが多様なタスクシナリオに対して柔軟に対応することを困難にしています。
このほど、ByteDance Seed チームは視覚的空間再構築モデル「Depth Anything 3(DA3)」を発表しました。
Depth Anything シリーズの最新オープンソース続編である DA3 は、単目深度推定の能力を任意の視点へと突破的に拡張するものであり、従来の多視点幾何学的再構築手法とは異なり、複雑な専用アーキテクチャに依存することなく、簡潔で効率的な Transformer モデル一つによって、異なる視点下での空間知覚を精密に実現します。
DA3 の二つの主要な特徴は以下の通りです:
(1)アーキテクチャの簡素化:Transformer を一個だけ使用すればよく、追加のカスタムアーキテクチャは不要であり、モデルは強力な視覚的事前学習能力を備えています。アーキテクチャが軽量であるため、訓練と展開がより効率的です。
(2)表現の統一:単一の「深度 - レイ」表現法を採用しており、追加の多タスク学習手法を導入する必要はありません。統一された表現により、モデルは核心的な空間幾何学的関係の学習に集中でき、複数のタスクにおいてより安定したパフォーマンスを発揮し、精度と効率の両面で最適化を実現します。
DA3 は異なるシーンにおける 3D 再構築タスクを迅速に完了できます
「簡潔な設計と精密な焦点」というアプローチを採用することで、DA3 は業界の視覚空間再構築における SOTA(State-of-the-Art:最良性能)レベルを刷新しました。カメラ姿勢精度のタスクでは、従来の主流モデルである VGGT に対して 35.7% の向上を達成し、幾何学的再構築精度においても VGGT を 23.6% 上回りました。また、単目深度推定タスクにおいては、DA2 がすでに SOTA 性能を達成していましたが、DA3 はさらにその性能を向上させました。
Depth Anything 3 の技術報告書とモデルコードが公開されました:
技術報告書:
https://arxiv.org/abs/2511.10647
コードリンク:
https://github.com/ByteDance-Seed/depth-anything-3
GitHub ホームページ:
https://depth-anything-3.github.io
HF Demo(Hugging Face デモ):
https://huggingface.co/spaces/depth-anything/depth-anything-3
- 余計なものを削ぎ落とし、空間再構築の根本メカニズムを抽出する
空間知能の分野において、3D 知覚再構築技術は、2 次元視覚情報と 3 次元物理世界をつなぐ重要な架け橋であり、自動運転、ロボット、仮想現実(VR)、建築測量など幅広い領域で活用されています。しかしながら、現在の主流モデルは、アーキテクチャの冗長性と出力表現の結合による非効率性という 2 つの大きな課題に直面しており、これが 3D 知覚再構築技術のさらなる発展を阻害しています。
DA3 は空間幾何学的モデリングの本質に戻り、「最小限のモデリング方式」を核心的な設計原則として据え、モデルが備えるべき重要な基礎能力を再定義しました。
DA3 は単一の Transformer を使用し、入力に適応したクロスビュー自己アテンション(Cross-view Self-Attention)メカニズムを導入することで、双 DPT(Dense Prediction Transformer:密推定トランスフォーマー)ヘッドを通じて、視覚特徴から深度マップとレイ図を予測します。
単一アーキテクチャで幾何学的本質に焦点を当てる
従来の手法では、視覚空間再構築モデルが異なるタスクに対応する際、それぞれネットワークモジュールやインターフェースを個別に構築する必要があり、その結果アーキテクチャが複雑化し、計算資源に対する要求が極めて高くなっていました。DA3 チームは、幾何学的空間再構築の本質はいずれもクロスビュー特徴の関連付けとグローバル空間モデリングに依存しており、これらは同一のモデリングメカニズムの中で統一的に処理可能であると判断しました。各タスクのために追加で専用モジュールを設計する必要はないのです。
タスクの抽象化に基づき、チームはモデル能力の根本的なメカニズムへと立ち返って導出を行いました。Transformer の自己アテンション(Self-Attention)メカニズムは本質的に長距離依存関係の捕捉をサポートしており、任意の数の入力ビューを柔軟に処理し、クロスビュー情報を動的に交換することができます。追加で特徴融合モジュールを設計する必要もなく、空間幾何学的モデリングの中核的なニーズに即座に対応可能です。
実験結果もさらに示唆していますが、複雑なカスタマイズアーキテクチャは特定のタスクにおいてわずかな性能向上をもたらす可能性がありますが、全体としての収益は限定的であり、訓練と展開のコストが大幅に増加し、モバイル端末や組み込み(Embedded)環境での応用を制限することになります。
上記の導出に基づき、DA3 は単一の Transformer を基本構造として採用し、簡潔なモデル設計を実現するとともに、さまざまな 3D タスクにおいて安定した効率的な推論性能を発揮します。
視覚的空間再構築のための最小限かつ完全な出力の実現
3D 再構築タスクでは、出力形式が特定のタスクに強く紐付けられており、異なる形式間には統一された論理的関連性が欠如しているため、情報の再利用や共有が困難となっています。また、冗長な出力は学習負荷を増大させ、中核となる幾何情報への学習と推論効率を妨げています。
DA3 チームは幾何モデリングの本質的な問いに立ち返りました:1 つのモデルが 3D 空間を完全に記述するために、いったい何を出力すべきなのか?チームは最終的に、「深度 - レイ」を統一表現として提案しました。深度はピクセルからカメラまでの距離を示し、レイはピクセルが三次元空間内で投影される方向を示します。この表現法は、3D 再構築に必要な中核的な幾何情報を完全かつ簡潔に網羅し、追加の冗長なタスク専用表現を必要としません。
既存の主流手法では通常、3D ポイントクラウドを中核表現として採用し、同一座標系下で異なる視点からのポイントクラウドを予測することで空間幾何の一貫性を制約しています。しかし、ポイントクラウドは空間幾何構造とカメラ運動を結合させてしまうため、モデルは両方の情報を同時に学習する必要が生じ、最適化の難易度が高まります。この結合を緩和するため、既存の主流手法では深度、カメラ運動情報、画像座標系におけるポイントクラウドをそれぞれ出力するための追加予測ヘッドを追加せざるを得ず、システム複雑性がさらに増大しています。
一方、「深度 - レイ」表現は幾何と運動を自然に解離させます。この方式により、モデルは高精度な幾何情報とカメラ運動情報をより容易に取得でき、3D ポイントクラウドも迅速に復元可能となり、出力表現の極簡化と高効率を実現します。
- 1 ステップで高精度出力を達成し、反復最適化を不要とする
上記の戦略を採用することで、DA3 は単なるフィードフォワード(前向き伝播)1 回で高精度な出力を生成でき、従来の手法で必要とされる複数回の反復最適化という複雑なプロセスを回避します。この設計により推論速度が大幅に向上し、学習と展開が簡素化されるとともに、3D 再構築タスクの精度と効率性が確保されます。
「パルクール」難易度のタスクにおいて、DA3 は優れた空間知覚能力を発揮しました。図に示す通り、モデルに長さ 28 秒のビデオを入力し、カメラレンズが高速で移動し、運動視点とシーンが急速に変化する状況下でも、DA3 は単一のフィードバック(前向き伝播)の中でカメラ運動、人物の運動軌跡、そしてシーンの詳細な変化を捉えることができます。
広範囲の環境において、精密な視覚幾何推定は SLAM(同期位置特定と地図構築)にとって極めて重要です。以下に示す通り、DA3 は 10 キロメートルという超大規模シーンにおける SLAM 再構築タスクにおいても優れた性能を維持しました。この優位性は、DA3 のアーキテクチャアプローチが小規模で静的なシナリオだけでなく、大規模で動的な環境においても信頼性の高い幾何再構築結果を提供できることを示しています。
実験により、DA3 は任意の画像に対するフィードフォワード 3D ガウス再構築および新視点レンダリングタスクにおいても、3D 空間構造を迅速に復元でき、新視点合成において極めて高い汎化能力を備えていることが示されました。
車両が複数の異なる視点から画像を撮影した場合、DA3 はシームレスに安定した融合可能な深度図を推定できます。このようにして、DA3 は自動運転システムが周囲環境の三次元構造をより精密に理解することを支援し、複雑なシーンにおける車両の知覚能力と意思決定能力を向上させます。
- チームの展望:人間レベルの視覚認識能力の実現
認知神経科学において、人間の大脳皮質は 2 つの視覚経路を通じて情報を処理します。1 つの経路は物体のアイデンティティや色などの意味情報(セマンティック・インフォメーション)を理解する役割を担い、もう 1 つの経路は物体の位置、運動、空間関係などの空間幾何情報(スペース・ジオメトリック・インフォメーション)を理解する役割を担います。人間はこの 2 つの経路の協働を通じて、視覚認識タスクを効率的に完了します。Depth Anything シリーズ研究の原点は、AI に人間のような空間知覚能力を持たせることにあります。
現在、視覚言語モデル(VLM)は意味理解の分野で顕著な進展を遂げており、一部のタスクではすでに人間レベルに達し、あるいはそれを上回るパフォーマンスを示しています。しかしながら、空間幾何知覚については依然として核心的な課題であり、AI はこの分野においてまだ初期段階にあり、さらなる技術的突破が必要です。
DA3 の進展は視覚空間再構築に新たな可能性をもたらしました。これは単眼深度推定(モノキュラー・ディプス・エスティメーション)や多視点再構築(マルチビュー・リコンストラクション)の技術的ボトルネックを打破し、精密な空間幾何知覚へと一歩前進したものです。チームは、空間インテリジェンスの発展に伴い、AI が画像内の意味情報だけでなく、意味認識と空間知覚を融合させることで、最終的に完全な視覚認識能力を実現することを期待しています。
原文を読む
WeChat で開くにはこちらへ
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み