Hugging Face、ロボット学習のボトルネック解消へ「VLAct」手法を提案
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Hugging Face Daily Papers は、計算資源を抑えつつ汎用ロボットモデルの性能を向上させる「VLAct」手法を発表し、既存産業システムや未見のヒューマノイドでも高い成功率を示した。
AI深層分析を開く2026年8月31日 19:40
AI深層分析
キーポイント
表現中心の継続事前学習アプローチ
固定されたロボットデータ予算下で、限られた軌跡を転移可能な視覚行動知識に変換する「VLAct」手法を提案し、VLM の事前知識を保持しつつ多様な実体化間での共通動作セマンティクスを促進する。
既存システムとの性能比較
LIBERO-Plus と RoboTwin 2.0 で ABot-M0 や LingBot-VLA を上回る成功率(それぞれ82.6%、92.5%)を記録し、RoboDojo では明示された世界行動モデル(WAM)エントリ全てを上回った。
未知の身体への転移能力
未見のヒューマノイド「RoboCasa-GR1」において、下流タスク軌跡の20%のみを使用してもフルデータで訓練された GR00T-N1.6 ベースラインを上回る性能を発揮した。
低計算リソースでの実現可能性
完全オープンソースデータと 16 GPU のトレーニング環境のみで高い競争力ある結果を達成し、データスケーリング以外の重要な進展軸であることを示した。
重要な引用
VLAct preserves the broad VLM prior and encourages shared action semantics across embodiments through VLM-prior preservation, multi-head continuous action co-supervision, and a partially unified cross-embodiment action layout
On RoboCasa-GR1, an unseen humanoid embodiment, VLAct using only 20% of downstream trajectories outperforms the full-data GR00T-N1.6 baseline.
These results are obtained using fully open-source data and only a 16-GPU training setup
編集コメントを表示
編集コメント
データ収集のボトルネックを打破する新たなアプローチとして注目される。低計算資源での高パフォーマンスは、実社会へのロボット導入コストを下げる鍵となる可能性を秘めている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
汎用的なビジョン・ランゲージ・アクション(VLA)モデルを構築する上でロボットデータのスケールアップは不可欠ですが、ウェブ規模の画像テキストデータに比べてロボット軌道データを拡張するのは困難です。その理由として、身体性のある収集にはコストがかかり、物理世界をカバーする範囲が限定的であることが挙げられます。このため、表現の質が中心的なボトルネックとなります。固定されたロボットデータの予算の下では、継続的な事前学習は限られた軌道データから転移可能な視覚・行動知識へと変換し、単に行動を適合させるだけでなく、その役割を果たす必要があります。
私たちは VLAct を提案します。これはタスク固有の微調整前に、広範で多様な、複数の身体性を持つロボットデータを用いて訓練された VLA 指向のビジョン・ランゲージ・モデル(VLM)バックボーンです。VLAct は、VLM の事前学習知識を維持し、マルチヘッド連続行動コサプバイションと部分的に統一されたクロス身体性の行動レイアウトを通じて、異なる身体性間での共有される行動意味を促進します。同時に、微調整時にはタスク固有の行動ヘッドも許容します。
シミュレーション環境、実世界、そして未見の身体性への転移において、VLAct は固定された微調整プロトコルの下で一貫してダウンストリーム性能を向上させます。LIBERO-Plus および RoboTwin 2.0 では、ABot-M0 や LingBot-VLA を含む産業用 VLA システムを上回り、成功率はそれぞれ 82.6% と 92.5% を達成しました。RoboDojo では、全ポリシーの中で成功率により第 6 位にランクインし、明示的に指定されたワールド・アクションモデル(WAM)エントリーのすべてを両方の指標で上回りました。
特筆すべきは、RoboCasa-GR1 という未見のヒューマノイド型ロボットにおいて、VLAct が下流タスクの軌道の 20% のみを用いて学習したにもかかわらず、フルデータで訓練された GR00T-N1.6 ベースラインを上回る性能を発揮したことだ。これらの結果は、すべてオープンソースのデータと、わずか 16 基の GPU を用いたトレーニング環境で得られたものである。これは、表現中心の継続事前学習が、限定的な計算リソース下でも非常に競争力のあるパフォーマンスを実現可能であり、データ量の拡大というアプローチに代わる、VLA(Vision-Language-Action)モデルの進展における重要な独立した軸であることを示している。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み