Robostral Navigate:単眼カメラによる AI ナビゲーション(5 分読了)
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Robostral は単一 RGB カメラと自然言語指示のみで複雑な環境を自律移動できる 8B モデル「Navigate」を発表し、既存の多センサー系や単一カメラ系を上回る精度を実現した。
AI深層分析を開く2026年8月3日 11:18
AI深層分析
キーポイント
単一カメラでの高精度ナビゲーション
深度センサーや LiDAR を使用せず、単一の RGB カメラのみで R2R-CE ベンチマークにおいて未見環境で 76.6% の成功率を達成し、既存の最良システムを上回った。
シミュレーションとトークン効率化による開発
同社によると、本モデルは完全な社内開発であり、シミュレーションデータを用いてトレーニングされ、プレフィックスキャッシングによるトークン効率化技術が採用されている。
汎用性と多様なロボットへの対応
車輪式、脚式、飛行型など異なるタイプのロボットやサイズ、カメラの内部パラメータの違いに対して頑健であり、製造・物流・ホスピタリティなどの幅広い分野で応用可能である。
単眼カメラによる最先端のナビゲーション性能
LiDARや深度センサーを必要とせず、単一のRGBカメラのみで動作する。R2R-CEベンチマークにおいて検証済み環境で79.4%、未見環境で76.6%の成功率を達成している。
指し示しに基づく移動予測と汎用性
目標地点への「指し示し」を通じて次回の移動先を推定するため、カメラの内部パラメータや世界スケールの変動に対して自然に頑健である。このアプローチは車輪型、歩行型、飛行型ロボットすべてで動作し、サイズの違いにも対応する。
重要な引用
Robostral Navigate uses only one ordinary RGB camera and no depth sensors, yet still achieves 76.6% on R2R-CE validation unseen.
Consequently, it beats the best single-camera approach by 9.7 points and the best system using depth or multiple cameras by 4.5 points, despite using neither.
"Move 2 meters forward, 1.5 meters to the left, and turn 25 degrees left."
transforms training runs that would take months into runs that complete in days.
編集コメントを表示
編集コメント
単一カメラで多センサーに匹敵する性能を達成した点は、ロボティクス分野におけるコストと性能のバランスを劇的に変える可能性を秘めている。特にシミュレーションデータへの依存度が高い点は、実世界での学習コスト削減という観点からも注目すべきアプローチである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
思考
要約
Robostral Navigate は、単一の RGB カメラのみを用いてロボットが複雑な環境を自律的に航行可能にする 8B モデルであり、未見の R2R-CE ベンチマークで 76.6% の成功率を達成しています。これはマルチセンサーアプローチを上回る性能を示しつつ、より効率的です。シミュレーションデータとトークン効率化技術を駆使して完全に自社開発され、ロボットの種類を超えて汎用性を有し、トレーニング時に未体験の現実世界の障害物にも適応します。このモデルは、指差すようなナビゲーション手法と強化学習を組み合わせることで継続的な改善を実現し、ロボティクスにおける統一された具現化 AI の道を開くものです。
本日、私たちは具現化型ナビゲーションのために構築した最初のモデルである Robostral Navigate を発表します。これは RGB 画像と自然言語の指示を入力として受け取り、ロボットを環境内へ移動させる 8B モデルです:
「ロビーを出て、廊下を通り抜け、備品室に入り、2 番目の棚に向かい止まる。」
このようなタスクを実行する際、他のモデルはしばしば深度センサーや LiDAR(ライダー)、あるいは複数のカメラを連携させて使用します。一方、Robostral Navigate は通常の RGB カメラ 1 つのみを使用し、深度センサーは一切用いませんが、それでもトレーニングから除外された環境における指示追従のベンチマークである R2R-CE(Room-to-Room in Continuous Environments)の未見検証データで 76.6% のスコアを達成しています。その結果、単一カメラ方式の最良アプローチよりも 9.7 ポイント、深度センサーや複数カメラを使用する最良システムよりも 4.5 ポイント上回る性能を示しています。
当モデルはロボティックナビゲーションのために設計されており、オフィス、住宅・商業ビル、屋外環境などを含む複雑な環境を自律的に航行する能力を提供します。
*Robostral Navigate は、作業中のオフィス内を単一の長距離指示に従って完全に自律的に走行しています。*
この技術は製造業、配送、物流、ホスピタリティ分野において多数の応用可能性を開き、現在のお客様にとって最も需要の高い機能の一つとなっています。Robostral Navigate に1 つの指示を与えるだけで、そのロボットは人々や障害物で満たされたライブ空間を移動しながら、これまで見たことのない環境にも適応し、タスク全体を自律的に完了します。
ハイライト
- R2R-CE における最先端のパフォーマンス
- バリデーションデータセットでの成功率 79.4%
- バリデーション未見データセットでの成功率 76.6%
- LiDAR や深度センサーを必要とせず、単一の RGB カメラのみで動作
- 社内開発の 8B モデルであり、シミュレーション上で完全にトレーニング済み
- 車輪式、脚式、飛行型ロボットすべてに対応し、ロボットのサイズ間でも汎化可能
- カメラ内部パラメータの違いに対してロバスト
- プレフィックスキャッシングによるトークン効率の高いトレーニング
image%203-1.svg)
image%203-1.svg)
image%203-1.svg)
image%203-1.svg)
ポインティングによるナビゲーション
タスクと観測履歴が与えられた場合、Robostral Navigate は*ポインティング(pointing)*を通じてロボットが次に移動すべき場所を予測します。これは、ロボットの現在のカメラビューにおける目標地点の画像座標と、到着時の希望する向きを推論するものです。計測変位に依存するコマンドとは異なり、ポインティングはカメラの内部パラメータや世界のスケールの変化に対してポリシーが自然に頑健になるようにします。
しかし、この手法では目標地点が現在の視野外にある場合に対応できません。ポインティングが適用できない場合、モデルはロボットのローカル座標系における変位にフォールバックします。例えば:
「2 メートル前方へ移動し、1.5 メートル左へ移動し、25 度左へ回転する。」
一から構築されたシステム
Robostral Navigate は完全に自社開発であり、既存のオープンソース VLM(Vision-Language Model)に依存していません。
このモデルは、ポインティング、カウント、物体の位置特定などのグラウンディングタスクに特化したビジョン・ランゲージモデルから初期化されます。ナビゲーションはこれらの機能の自然な拡張として現れます:一度ものがどこにあるかを理解すれば、どのように移動するかを学習するのです。
私たちは、シミュレーションのみで効率的なデータ生成パイプラインを構築しました。これによりデータの迅速な反復が可能となり、6,000 シーンにわたって収集された約 400,000 の軌道(trajectories)からなるデータセットが実現されました。**
効率的な教師あり学習
Robostral Navigate の重要な要素の一つは、プレフィックスキャッシングに基づく効率的なトレーニングアルゴリズムです。ツリーベースのアテンションマスキング戦略を用いることで、本手法はエピソード全体を単一のシーケンスに圧縮し、すべての時間ステップにおけるトレーニングを単一の前向きパスで実行可能にしつつ、時間ステップ間の情報漏洩を防ぎます。
1 つのサンプルを各時間ステップで使用する従来のトレーニングと比較して、本アプローチは学習信号をすべて保持したまま、トレーニングトークンの数を22 倍削減します。実際には、この方法により、従来なら数ヶ月かかったトレーニング実行が、数日で完了するものへと変換されます。
オンライン強化学習
私たちは、大規模なポストトレーニング LLM(大規模言語モデル)に関する知見を活用し、オンライン強化学習(online reinforcement learning)を用いて Robostral Navigate の性能を向上させています。教師あり学習の段階の後、さらに CISPO というオンライン強化学習アルゴリズムを使用してモデルの性能を改善しています。これにより、モデルは試行錯誤から学び、失敗から回復し、探索的な行動を獲得することが可能となり、従来の行動クローニング(behavior cloning)が抱える分布シフト(distribution shift)の問題を効果的に緩和します。これだけで成功率は 3.2% 向上しました。現在、性能の頭打ち現象は見られておらず、さらなるトレーニングと実験によってこの数値がさらに引き上げられることに確信を持っています。
What's Next
Robostral Navigate は、統一された具身型エージェント(embodied agent)への第一歩に過ぎません。
私たちは、ナビゲーションが汎用ロボティクスにおける基盤的な能力であると信じています。大規模シミュレーション、効率的なトレーニング、そして強力な事前知識(grounding priors)を組み合わせることで、Robostral Navigate は、コンパクトなモデルと単一の RGB カメラのみで最先端の具身型ナビゲーションを実現できることを示しました。
具身型フロンティア AI への旅を始めましょう。私たちのチームにお問い合わせください。
BTW, we're hiring!
私たちのナビゲーションモデルのリリースは重要な一歩ですが、私たちの旅はまだ終わっていません。私たちの野望は、ロボットがオフィス、家庭、商業ビル、屋外空間といった複雑な環境を自律的に移動できるようにすることです。そして、まだやるべきことはたくさんあります。私たちは現在、ロボティクスチームを積極的に拡大しており、私たちの野望に共感する才能ある研究科学者やエンジニアを探しています。
至る所のロボットにシームレスなナビゲーションをもたらすという私たちのミッションに参加することに興味があれば、私たちのチームへの参加 を歓迎します。
*By Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh, Olivier Duchenne - AI Science Robotics*
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み