AI が視覚と言語を解決、ロボットは統合問題へ
本文の状態
日本語全文を表示中
詳細モードで約14分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Google DeepMind が発表したオンデバイス型ロボットモデルの進歩は目覚ましいが、物理世界での汎用性不足という構造的なデータ欠如が課題として浮き彫りになっている。
AI深層分析を開く2026年9月9日 01:51
AI深層分析
キーポイント
オンデバイス型 VLA の実装成功
Google DeepMind が公開した Gemini Robotics On-Device 2 は、テキスト指示とロボットの視点画像、自己位置情報を処理し、ネットワーク依存なくロボット上で動作する能力を実証している。
物理操作データの構造的不足
言語モデルが人類の蓄積データで学習できるのに対し、ロボット制御には個別に実機とオペレーターを投入して生成されたデータが必要であり、これがスケーラビリティのボトルネックとなっている。
ベンチマークにおける脆弱性の露呈
Libero ベンチマークなどでは高い成功率を示すものの、シーンに僅かな変化を加えるだけで成功率が 30% 以下に崩壊したり、ゼロになったりする現象が多数の論文で確認されている。
学習と記憶の違いによる限界
現在のモデルは物体操作を「学習」しているのではなく、特定の軌道パターンを「暗記」しており、わずかな外れ値に対して振る舞いが許容範囲以下に低下する傾向がある。
一般化の限界と既存ロボットの信頼性
Gemini Robotics On-Device 2 モデルは分布外タスクへの汎化能力に限りがあると認めており、現在の産業用ロボットは汎化せず特定の環境にプログラムされることで高い信頼性を達成している。
重要な引用
The hard part was the intelligence, and we have that now.
There's no equivalent corpus for manipulation.
On the Libero benchmark, success rates that sit around 95 percent collapse to below 30 percent under modest perturbations of the scene.
"limited ability" to generalize to out-of-distribution tasks
編集コメントを表示
編集コメント
記事はロボット工学の進歩を称賛する一方で、データ生成の物理的制約という現実的な壁を鋭く指摘している。この分析は、単なる技術の進化論を超えて、実社会での適用に向けた課題解決の方向性を示唆する重要な視点である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
今回の安心できる物語は「転移」に関するものです。視覚認識も言語処理もすでに解決済みです。AI が実体化するロボット工学は、単なる統合の問題に過ぎません。世界を理解しているモデルを持ち込み、それをアームとカメラに接続すれば、その能力は機械へと自然に流れ込むのです。かつて困難だったのは知能そのものでしたが、私たちは今やそれを持っています。
私は、質量と運動量を持つものを製造する企業と頻繁に関わっていますが、機械工学、電子回路、ソフトウェアを統合システムとして組み合わせることの複雑さを何度も目の当たりにしてきました。もしあなたが同様のシステムに取り組んだ経験があるなら、上記のような物語がどれほど信じがたいものか、私と同じように実感されるでしょう。
まず、視覚・言語・行動モデル(VLAs)について話しましょう。VLA は画期的なイノベーションであり、実際に機能し、急速に進化しています。7 月に発表された Google DeepMind の「Gemini Robotics On-Device 2」は、テキストによる指示とロボット自身の視点からの画像、そして自己位置情報データを入力とし、行動を出力します。最も重要なのは、これがロボット上で直接実行される点です。外部への往復通信も不要で、ネットワーク依存もありません。ロボット工学の領域では、エッジコンピューティングが単なるコスト削減策ではなく、特に安全性が懸念される場合、物理的な必須要件へと変化しています。
その能力は着実に高まりつつあります。しかし、課題は学習データの不足です。
言語モデルは、人類が蓄積してきた文章出力を学習対象とします。これらは本来別の目的で生成されたものであり、たまたま利用可能な状態にあるものです。一方、物理的な操作(マニピュレーション)に相当する同等のデータセットは存在しません。ロボットが未知の物体を、未知の姿勢で掴むような訓練事例一つひとつは、実際の機械によって、現実の時間の中で生成されなければなりません。通常、これは人間が遠隔操作して行われます。
このデータは、誰かがロボットとオペレーターに費用を払い、エピソードごとに一つずつ生成するまで存在しません。その速度は物理的な現実の速度、つまり人間の動作速度と同程度です。
これは規模拡大で解決できる一時的な不足ではありません。二種類のモデルが能力を獲得するプロセスにおける構造的な違いであり、それが結果にも明確に表れています。
2023 年 2 月から 2026 年 6 月までに発表された 1,228 件のビジョン・言語・アクション(VLA)論文を分析した最近の研究が、業界内で長らく静かに懸念されていた事実に数字で光を当てました。
Libero ベンチマークでは、成功率が約 95% の状況でも、シーンにわずかな擾乱を加えるだけで 30% を下回ってしまいます。別のベンチマークでは、性能は 90% を超えていたものが、正確にゼロへと低下しました。劣化したのではなく、完全にゼロです。
ロボットは同じパターンを正確に繰り返すのは得意ですが、わずかな変化でも動作が許容範囲を下回るほど劣化してしまうことがあります。これはモデルが物体を操作することを学んでいて「調子が悪い」からではなく、特定の軌道セットを暗記しているモデルに対して、その範囲から少し外れたタスクを求められているからです。
誠実な開発者たちもこれを認めています。Gemini Robotics On-Device 2 のモデルカードには、「分布外のタスクへの一般化能力は限定的である」と明確に記載されています。
ここで慎重に議論する必要があります。これはロボットに対する悲観論と誤解されやすいからです。しかし、私はそうではありません。ロボットは実際に機能していますし、その性能は極めて高いものです。国際ロボット連合(IFR)によると、2024 年に設置された産業用ロボットの数は 542,000 台に達し、世界の稼働在庫も 466 万台となりました。これは前年比で 9% の増加です。
これらの機械は溶接、配置、パレタイズを高い信頼性で行います。その精度は言語モデルが及ぶところではありません。しかし、その達成方法は「一般化」に依存していません。むしろ、一般化を行わないことで成り立っています。ロボットは特定の治具、部品、そして作業セルに対してプログラムされており、その範囲外にあるものは学習によって対応するのではなく、設計段階で排除されています。
これは従来の自動化技術であり、身体性を持つ知能(エンボディド・インテリジェンス)とは異なります。
ロボットが働くかどうかではなく、汎用ロボットが本当に機能するかが問われています。その点では、資金の規模ほど確固たる証拠はありません。
今年私が目にした最も示唆に富む数字は、BMW が導入した Figure 02 ユニットの稼働実績です。11 か月間で約 1,250 時間の運用時間 を記録しました。
この数字を少し考えてみてください。11 か月間、カレンダー上の稼働時間は平均して 1 日 4 時間未満でした。産業用資産として見れば、これは実用的な導入ではなく、長期にわたる高コストの実験です。
他方、2025 年にベンチャーキャピタルがロボット分野に投入した資金は 407 億ドルに達し、アメリカ銀行は 2026 年のヒューマノイドロボットの出荷台数が約 9 万台になると予測しています。資本と実際の稼働時間の間に存在する大きな隔たりこそが、現状を物語っています。
もちろん、最初の ChatGPT のバージョンは有用性が限定的でしたが、その後の進歩は目覚ましいものです。ロボット分野への VC 投資の拡大に伴い、この領域でも進展が見られるでしょう。しかし、LLM はロボットが夢見るしかないほどの膨大な学習データコーパスを持っています。
スタートアップにとって、これは「実際に何を構築すべきか」という問いを根本から変えます。モデルはダウンロード可能で、ハードウェアも入手しやすくなっている今、差別化のポイントはどこにあるのでしょうか?
私の答えは、自社の特定の物理的領域においてデータを生成する装置にあります。その対象範囲(スライス)が狭ければ狭いほど、成功の可能性は高まります。
「汎用ロボット」の実現という約束は確かに魅力的ですが、私の見解では、その正解は全く逆の方向にあると言えます。一般性(generality)とはある分布に関する主張に過ぎず、その分布を閉じる唯一の方法は、それを明確な範囲内に限定することです。
特定のタスク一つに絞り、一つの環境クラスで、単一のグリッパーを使用するスタートアップであれば、十分に多くの軌道データを収集して、稀に起こる事象(テール)までカバーできる可能性があります。そして、すべての価値とリスクの大半はまさにその「テール」の部分にあります。
一方、「何でもこなすロボット」を提供すると謳うスタートアップは、資金調達できないほど巨大なデータ収集問題に自らを縛り付けているようなものです。シード段階で問われるべき正しい質問は、「あなたのモデルはどれほど能力が高いか?」ではなく、「失敗率が許容範囲になるまでに、現実世界でのインタラクションは何時間必要なのか?そのコストを誰が負担するのか?」という点です。
自動運転車を考えてみてください。これは狭義の特殊なロボットと見なすこともできます。10 年以上にわたる約束にもかかわらず、まだ一般利用には至っていません。解決策は、ウェイモ(Waymo)などが行っているように、一つの都市、あるいはその一部での慎重な訓練にあります。あるいは物流分野では、倉庫から工場までの特定の区間だけを走る自律型トラックがそうです。
答えはシンプルです。ビジネスとして成立する限りにおいて、できる限り狭い範囲に特化することこそが正解なのです。
ここには明確に指摘する必要がある罠があります。Libero の数値がそれを具体化しているからです。
デモはトレーニング分布からのサンプリングに過ぎません。それは、その分布から一歩外れた場所での性能についてほとんど何も教えてくれません。90% から 0% への急激な崩壊は、外挿できる緩やかな傾斜ではありません。ロボット企業を評価する投資家や経営陣は、ハイライト映像ではなく、摂動(ノイズを加えた)テストの結果を見るべきです。
もしチームが、照明が変わったり物体が 45 度回転したりしたときに何が起こるのかを示せないなら、彼らは本当に重要なものを測定していないことになります。
大規模な既存企業にとっては、計算の式は再び逆転します。しかも今回は、非常に興味深い形で逆転するのです。
これら 466 万台の稼働中のマシンは、現在存在する中で最も膨大な物理的相互作用データの集合体です。しかし、そのほとんどが学習に使える形式で収集されていません。これらのロボットはすべて、長年にわたり動作し、ログを記録し、修正を行ってきました。
稼働中の設備を計測器として活用し、数十年にわたる産業用ロボットの動きをトレーニングデータに変換する方法を見出した者は、ベンチャーキャピタルの資金では決して複製できない真の資産を手に入れます。なぜなら、ロボットはすでに床に固定されているからです。
もう一方のリスクは、知能層における仲介機能の喪失です。もし機械が何ができるかを決定する主体がモデルそのものになった場合、優れたアームを製造しながらも知能機能を他社から購入する企業は、単なる汎用的な作動装置の供給元に成り下がってしまいます。既存企業にとってもスタートアップにとっても、今後どこに価値が存在するのかを理解することは極めて重要です。何十年にもわたるデジタル化が示してきた通り、ソフトウェア、データ、あるいは AI かどうかに関わらず、価値は「原子」から「ビット」へと移行していきます。
また、このシリーズの前半で触れた地理的な事実もここには当てはまります。2024 年の新規ロボット設置台数の 74% はアジアが占め、中国単独でも 295,000 台に達しました。さらに、中国国内メーカーが自国市場を占める割合は、10 年前の 28% から現在では 57% に上昇しています。計算資源(コンピュート・サブストレート)と、それを支える実体化層(エンボディメント・レイヤー)はいずれも特定の地域に集中していますが、その地域は必ずしも同じではありません。それでも、学習データが最大のボトルネックであるなら、新規設置されるロボットから最も多くのデータを収集できる場所がどこか、そしてそれがヨーロッパではないかは明白です。
社会の反応としては、すぐに雇用問題へと議論が向かいがちですが、この対話自体には意義があります。ただ、私が最も緊急性を感じているのは、私たちが許容しようとする範囲にズレが生じているという点です。
私たちは、言語モデルが時折誤りを犯すことは許容できるという合意に達しました。その理由は、間違った回答が出ても、誰かがそれを読んで次に進むだけで済むからです。しかし、この許容度は、質量を持つ機械と接触する瞬間には崩れ去ります。
人間付近で動作するヒューマノイドロボットが、95%の確率で正解であればよいわけではありません。生産現場での基準は、99.9%をはるかに上回るものでなければなりません。この2つの数字の違いは、単なる工程上の改良ではなく、全く異なる分野の問題です。
物理的AI(Physical AI)とは、その本質が確率的な振る舞いである技術を、過去1世紀にわたって「確率的な振る舞いを排除する」ことに注力してきた環境へと持ち込むものです。
たとえ人間の安全が脅かされない文脈であっても、ロボット自身が損傷したり、他のロボットや製品、周囲のインフラを破壊したりすることによる経済的損失は、ビジネスモデルそのものを破綻させます。物理世界と相互作用するシステムには、全く異なる信頼性、堅牢性、そして安全性の要件に基づいて設計されなければなりません。
私が夏以来一貫して追求してきたテーマが、今や避けられない局面に達しました。実装されたコードではなく学習されたポリシーとして認識が形成される場合、バージョン管理し、守るべきは「機械が遵守すべき契約」と、それが依然として履行されていることを示す継続的な証拠です。
物理システムにおいて、この契約には機械が何を行うかだけでなく、決して何を行わないかも明記されなければなりません。また、その証拠は設置時に一度収集するものではなく、連続的に取得されるものでなければなりません。現在、これを実現するための優れたエンジニアリング手法はまだ確立されていません。私たちは、回転させるとすぐに性能がゼロに陥るベンチマークを持っていますが、これは誰かが回帰テストの定義を書き下す前にソフトウェアテストが行っていた状況とほぼ同じです。
楽観的な見方では、マニピュレーション(操作)はデータの問題であり、業界はその問題がモデルの問題だと偽装するのをやめれば対処できる種類のものであると考えられます。一方、悲観的な見方では、物理現実の裾野(テール)は、誰の資本力よりも長いとされます。
私の考えは後者より前者に近いですが、タイムラインはより長く伸びると予想しています。狭く限定され、十分な計測機器が備えられた展開事例が、数年にわたって静かに積み重なるでしょう。その結果として初めて、「一般化された」と呼べるようなものが工場現場で現れるようになるはずです。
これは、ロボット工学の分野がまだ産業として確立される以前に、ある研究者がすでに指摘していた現代版の再解釈です。1988 年に出版された『Mind children』の中でハンズ・モラベックはこう述べています。「知能テストやチェスでの成人レベルの性能をコンピュータに発揮させることは比較的容易だが、知覚と移動能力において 1 歳児並みのスキルを与えるのは困難か不可能に近い。私たちはすでに『大人』を作ったが、『1 歳児』を作る作業はまだ続いているのです。」
*次回の連載:* *人間型ロボットの問い* — 汎用ボディこそが正解なのか、そしてその答えにはどのようなコストがかかるのか。
*この記事のような内容をさらに読みたい方へ:* jan@janbosch.com までニュースレターにご登録いただくか、janbosch.com/blog、LinkedIn (linkedin.com/in/janbosch)、X (@JanBosch) でフォローしてください。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み