Generalist AI、1 回の実演で学習するロボット基盤モデル「GEN-1.5」を公開
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Generalist AI は、単一の短いデモから物理タスクを学習するロボット基盤モデル「GEN-1.5」を発表し、勾配更新なしで即座に動作する能力を実証した。
AI深層分析を開く2026年8月25日 00:00
AI深層分析
キーポイント
物理プロンプティングの確立
30 秒のコンテキストウィンドウにセンサーモーターデータを挿入するだけで、勾配更新や微調整なしにタスクを実行する「物理プロンプティング」というメカニズムが実装された。
学習効率と性能データ
10 種類の多様な操作タスクにおいて、事前学習モデル単体で平均 59% の成功率を達成し、5 分間のデータに対する 10 回の勾配ステップで 83% に向上した。
設計思想と学習メカニズム
この能力は意図的なアーキテクチャ変更やメタ学習ループではなく、物理相互作用データによる 8 ヶ月以上の継続的事前学習から自然に発生したものである。
現状の展開状況と制限
現在は研究リリースであり、公開重みや API は提供されておらず、直接パートナーシップを通じてのみ利用可能な段階にある。
包括的な一般化能力
独立して記録された複数のプロンプトを連鎖させたり、シミュレーションや人間の動作から実機へ転送したりする能力が事前学習から自然に発現している。
重要な引用
No gradient updates, no fine-tuning, no task-specific programming.
The capability emerged from pretraining scale, the same way one-shot prompting emerged in GPT-3.
This is the first model its team knows of where one-shot learning of physical skills has emerged at scale.
The model produces the bridging motions — repositioning, regrasping, error recovery — that appear in neither demonstration.
編集コメントを表示
編集コメント
この技術は、ロボットが新しいタスクを学習する際のデータ収集と計算リソースの壁を大きく下げる可能性を秘めている。ただし、現在は研究段階であり、実環境での安定性や安全性検証が今後の課題となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Generalist AI は、単一のデモから新しい物理タスクを学習するロボット基盤モデル「GEN-1.5」を発表しました。30 秒のコンテキストウィンドウに 3〜12 秒分のセンサー・モーターデータを投入するだけで、ロボットはそのタスクを実行できます。勾配更新も微調整も、タスク固有のプログラミングも不要です。
多様な 10 の操作タスクにおいて、事前学習済みモデルからそのまま実行したワンショット(一度きり)のコンテキストプロンプティングでは成功率が平均 59%(標準偏差±10%)でした。一方、各タスクあたり 5 分間のデータに対して 10 回の勾配ステップを適用すると、成功率は 83%(標準偏差±9%)に向上します。
Generalist AI はこの仕組みを「物理プロンプティング」と呼び、これは意図的に訓練されたものではないと強調しています。アーキテクチャの変更もメタ学習ループも補助目的関数もありません。これは、物理的な相互作用データを用いた 8 ヶ月以上の継続的な事前学習から自然に現れた能力です。
タスク自体はシンプルで短時間の範囲内のものであり、同社もその点を率直に述べています。しかし、物理スキルのワンショット学習がスケーラブルな規模で実現されたモデルとして、これがチームが知る限り初のケースとなります。
実用化可能でしょうか?
まだです。これは研究リリースであり、公開された重みも API も価格設定ページもないため、セルフサービス製品としての提供は行っていません。Generalist AI は GEN-1.5 を自社のロボット群とデータエンジン上で稼働させています。現在利用したい場合は、直接パートナーシップを結ぶ必要があります。
GEN-1.5 とは何か?
GEN-1.5 は、動画・センサーデータ・言語・自己位置情報(プロプリオセプション)を入力とし、30 秒分の記憶を保持しながら、100Hz の動作軌跡を出力する大規模マルチモーダルモデルです。このモデルは、家庭や倉庫、工場などで収集された物理的相互作用のデータを対象に、8 ヶ月以上にわたり継続的な事前学習を行ってきました。
その中核となる仕組みは「物理プロンプティング」です。センサーストリームと動作軌跡を組み合わせた感覚運動の例を、ドラッグ&ドロップインターフェースを通じて 30 秒のコンテキストウィンドウに挿入します。ウィンドウの残りの部分は、継続的に更新される観測データで埋められます。するとモデルは、勾配計算をゼロ回行い、微調整も不要な状態で即座にタスクを実行します。
重要なのは、これらの機能は何らかの設計意図によって組み込まれたものではないという点です。Generalist 社によると、コンテキスト内学習を促進するためのアーキテクチャの変更や、メタ学習ループ、あるいは臨機応変な対応を促す補助的な目的関数などは一切存在しません。この能力は、GPT-3 で「ワンショットプロンプティング」が出現したのと同じように、事前学習規模の拡大から自然に生じたものです。
性能の数値について
10 の多様なタスクにおいて、事前学習済みモデルに対してトレーニングを一切行わずにワンショット・インコンテキストプロンプティングを実施した結果、平均成功率は 59%(標準偏差±10%)でした。一方、各タスクあたり約 5 分間のデータ(おおよそ 50 のデモ)を用いて 10 回の勾配ステップを実行すると、成功率は 83%(標準偏差±9%)まで向上します。さらに極端なケースとして、1 つのタスクに対して 1 分のデータのみで 1 回の勾配ステップを適用し、未学習のタスクでも 66.5% の成功率を達成しました。この場合も、適応に特化したハイパーパラメータの探索は行われていませんでした。
計算リソースの活用方法こそが、この技術の最も興味深い点です。従来、ロボットの方針を適応させるには数万回の勾配ステップが必要とされていました。しかし、ここではわずか 10 ステップでモデルの重みが未見のタスクにおいて 0.15% も変化しないことから、ファインチューニングは新しい表現を構築するのではなく、モデルが既に持っている知識を再構成していることが示唆されます。Generalist はこれを、極めて限られたデータ量下でのテスト時学習として位置付けています。
知っておくべき 3 つの転移結果
構成的一般化:独立して記録された 2 つのプロンプトを文脈に組み込むことで、1 つの連続した行動へと連鎖させることができます。モデルは、デモには含まれていない中間動作——位置調整、把持し直し、エラー回復など——も生成します。
ゼロショットシミュレーションから実世界へ:事前学習データにレンダリングされた動画やシミュレーションダイナミクスが一切含まれていないにもかかわらず、シミュレーション環境だけで記録したデモを、実世界のロボットに対するプロンプトとして機能させることができます。一部のタスクでは、もはや物理的にデモを収集する必要はありません。
人間からロボットへの模倣:あるケースでは、人がロボットのカメラの視野内で自身の手を使ってデモンストレーションを行い、モデルがそれをロボットの腕で再現します。
軽いファインチューニングの後にも一般化能力は発揮されます。ブロックをボウルに入れる動作を 5 分間学習させた後、モデルはバナナを代わりのブラシとして使用したり、塵取り箒を使ってブロックを持ち上げて捨てたりしました。これは全く異なる接触シーケンスです。また、ボウルを覆っていた紙を取り除くこともでき、デモが片手で行われた場合でも両利きで動作することができました。
インタラクティブな解説
要点
GEN-1.5 は、30 秒のコンテキストウィンドウに読み込ませるだけで、たった 3〜12 秒のデモ映像から新しい操作タスクを学習します。
10 のタスク全体でワンショット(単一デモ)によるコンテキストプロンプティングが 59% の成功率を達成。また、5 分間のデータに対して勾配ステップを 10 回適用すると、83% に達しました。
ワンショット学習やシミュレーションから実世界への転移、人間からのロボットへの転移は、明示的な訓練なしに事前学習によって自然に獲得されたものです。
重みを変更する勾配ステップがわずか 10 回でも、重みの変化率は 0.15% に満たず、タスクごとの適応に必要な計算量を桁違いに削減できます。
このモデルには重みも API も製品化されたパッケージも存在しません。これは展開可能なシステムというより、スケーリングに関する研究のシグナルとして捉えてください。
GEN-1.5 の詳細は研究論文および @GeneralistAI の発表スレッドをご覧ください。チュートリアルやコード、ノートブックについては GitHub ページもご活用ください。
Twitter や 15 万人以上の ML 研究者が集まる SubReddit、ニュースレターへの登録もお忘れなく。Telegram ユーザーの方にも、ぜひ Telegram チャンネルへのご参加をご案内します。
本記事「Generalist AI Releases GEN-1.5: A Robot Foundation Model That Learns New Tasks From One 3–12 Second Demo」は、MarkTechPost に最初に掲載されました。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み