Zetta ζ:自己進化する物理的知能のための効率的なクローズドループ実装ハッチス
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Zetta は、ベースポリシーを凍結しつつコードベースの批評と回復スキルをオンラインで進化させる閉ループ型実体化ハネスであり、LIBERO-Pro や RoboCasa で高い成功率と推論速度の向上を実現した。
AI深層分析を開く2026年8月20日 13:36
AI深層分析
キーポイント
オンラインでの自己進化機能
Zetta はベースポリシーを凍結したまま、コードベースのランタイム批評と回復スキルをオンラインで進化させる閉ループ構造を採用している。
3 つの時系列ループによる制御
アクション周波数でのガバナンス、ロールアウトレベルでの批評・回復提案、検証ゲート付きのスキル更新という 3 つの時系列を分離したループを実装している。
Z-Infra によるインフラ分離
エージェントロジックと異種実行リソースを分離する Z-Infra を併用することで、柔軟かつ効率的なロールアウト環境を実現している。
高い性能とスケーラビリティ
LIBERO-Pro で 90.8%、RoboCasa で 93.6% の成功率を達成し、推論速度は 11.1 倍向上した。自己探索経験の蓄積とともに成功率がスケールする特性も確認されている。
重要な引用
We present Zetta, a closed-loop embodied harness that evolves code-based runtime critics and recovery skills online while keeping the base policy frozen.
Zetta achieves state-of-the-art success on LIBERO-Pro and RoboCasa under our current rollout budget, reaching 90.8% and 93.6%, with an 11.1x inference speedup
編集コメントを表示
編集コメント
この研究は、ロボットが物理環境と対話しながら自律的にスキルを改善する「閉ループ」の実現に向けた重要な一歩である。特にベースポリシーを固定しつつ批評機能を進化させる手法は、実用化における安定性と学習効率のバランスを示す有望なアプローチと言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
エンボディド・エージェントは、エンドツーエンドのポリシーモデルが残したギャップを埋めるためにますます活用されています。しかし、アジェンシーの道筋はまだ物理実行におけるクローズドループ学習を実現していません。既存のハーンネスは主にオープンループのまま、ロールアウト中は固定されたスキルに従い、エピソードが完了してからのみ振り返りを示すに留まっています。このような事後の振り返りは、進行中の実行を統制できません。なぜなら、物理的な相互作用には、今日の大型アジェンティック・モデルでは対応しきれない頻度で、急速に変化するロボットと環境の状態を追跡する意思決定が必要だからです。
私たちは Zetta を発表します。これは、ベースポリシーを凍結したまま、コードベースのランタイム批評家と回復スキルをオンラインで進化させるクローズドループ・エンボディド・ハーンネスです。Zetta は 3 つの時系列に分離されたループを通じて、アクション周波数での統制、ロールアウトレベルでの批評家による回復提案、そしてバリデーションゲート付きのスキル更新を提供します。
Z-Infra とともに、これはエージェントロジックと多様な実行リソースを切り離したロールアウトインフラストラクチャです。これにより Zetta は、現在のロールアウト予算下で LIBERO-Pro および RoboCasa で最先端の成功を達成し、それぞれ 90.8% と 93.6% の成功率を記録しました。また、推論速度は 11.1 倍向上しています。自己探索経験とともに成功はさらに拡大し、学習されたスキルはゼロショットで転移可能であり、明確なロボットの「アハ・モーメント」も現れます。
これらの結果は、クローズドループ・ハーンネスの自己進化が、信頼性の高い物理的知能のためのスケーリングパスを開くことを示しています。
原文を表示
Embodied agents are increasingly used to close the gap left by end-to-end policy models. Yet the agentic path has not realized closed-loop learning in physical execution: existing harnesses remain largely open-loop, following fixed skills during rollout and reflecting only after an episode completes. Such post-hoc reflection cannot govern execution as it unfolds, because physical interaction requires decisions to track rapidly changing robot-environment states at a frequency beyond today's large agentic models. We present Zetta, a closed-loop embodied harness that evolves code-based runtime critics and recovery skills online while keeping the base policy frozen. Through three timescale-separated loops, Zetta provides action-frequency governance, rollout-level critic-recovery proposal, and validation-gated skill updates. Together with Z-Infra, a rollout infrastructure decoupling agent logic from heterogeneous execution resources, Zetta achieves state-of-the-art success on LIBERO-Pro and RoboCasa under our current rollout budget, reaching 90.8% and 93.6%, with an 11.1x inference speedup; success continues to scale with self-exploration experience; learned skills transfer zero-shot, and clear robotic "Aha Moments" emerge. These results show that closed-loop harness self-evolution opens a scaling path for reliable physical intelligence.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み