今日关注:机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习

来源:机器之心Pro | 2026-08-18 12:30:30 |

端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而,这条在线学习路径在物理世界仍未真正走通。挑战在于,真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。


(资料图片仅供参考)

清华 AIR 与域变换联合推出 Zetta ζ,通过演进可高频执行的 critics,闭环物理智能体的在线学习:机器人不再只是事后总结失败,而是在执行过程中持续观察环境、触发恢复,并把 rollout 经验沉淀为可复用技能。

实验显示,Zetta ζ 的任务成功率会随着自探索经验持续提升,在有限 rollout budget 下 LIBERO PRO 和 RoboCasa 分别取得 90.8% 和 93.6%,远超现有其他方法。更惊艳的是,研究者捕捉到机器人的 “Aha Moment”,这让研究者看到了物理智能体 scaling intelligence 的新起点。

项目信息

  • 项目名称:Zetta ζ
  • 发布机构:清华 AIR、域变换 Z-Trans
  • 论文题目:Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
  • 项目主页:https://AIR-embodied-brain.github.io/zetta/

01 一个常见的机器人失败场景

想象一个很日常的机器人任务:拿取水杯。

视频链接:https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

物理智能体系统理解了这个指令,也做出了看似合理的抓取动作。但真正执行时,问题出现了:

  • 抓取力度太大,水杯直接抓坏;
  • 接近目标时姿态偏了,怎么都放不进去;
  • 智能体缺少在线反馈,无法调整。

为什么?

因为现有具身智能系统大多还是 “静态、开环” 的。它们能执行固定技能,却很难在物理执行过程中实时感知异常、主动修复并把失败经验转化为下一次可复用的能力。

物理世界是动态变化的,而大模型的反思往往发生在一次 episode 结束之后。智能体无法在线测试备选动作,以此验证反思结果是否正确;对完整轨迹做信用分配存在较大难度,同时回溯分析往往无法获取故障发生瞬间的精确状态。

Zetta ζ 要解决的,正是这个问题。

02 Zetta ζ:闭环物理智能体在线学习

Zetta ζ 是清华与域变换联合推出的闭环在线学习自进化物理智能体。Zetta ζ 能监督机器人每一步动作的执行,根据反馈生成下一步的执行,并渐进式学习监督和恢复技能,提炼可泛化、可复用的成功经验,让智能体越做越好。

为了加速进化,研究团队还为 Zetta ζ 研发了 Z-Infra,首个为物理智能体设计的 rollout 系统,通过解耦智能体和底层硬件,在各类异构设备上管理调度环境、模型、工具等资源需求,让自进化过程跑得更快、更省、更可扩展。

Zetta ζ 在线自主学习演进,破解具身智能落地难题:

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

03 Zetta ζ 演进的三个闭环

Zetta ζ 的核心是三个不同时间尺度的闭环,它们共同构成了一个 “自进化飞轮”。

第一环:Critic-Governed Action Loop(动作级闭环)

在动作执行频率上,Zetta ζ 的运行时批评者会持续监控机器人的物理状态。一旦发现异常,比如抓取滑落、接触丢失、运输停滞,系统会立即触发恢复动作,而不是等到整个 episode 失败后再反思。恢复完成后,还有一道严格的 “VLA Re-entry Contract”:只有确认故障已被清除、物理状态恢复稳定,控制权才会交还给原来的 VLA 模型。这相当于给机器人配了一位在线监测的安全员。

第二环:Rollout-Batch Candidate Optimization Loop(批量候选优化闭环)

机器人执行完一批任务后,Zetta ζ 会对失败轨迹进行聚类和因果诊断。它不只看 “任务最后有没有成功”,而是定位最早偏离正常状态的时间点,并渐进式沿着 “评估 → 批评者 → 状态表征 → 规划控制 → 恢复 → 参数” 的层级,找到真正需要修复的根因。随后,系统会自动生成候选的 critic、recovery 和 tool 更新。

第三环:Validation-Gated Skill Update Loop(验证门控更新闭环)

候选更新不能直接上线。Zetta ζ 会先做历史回归测试,再在严格隔离的 held-out 数据上验证。只有那些真正提升成功率、并且能泛化到新场景的更新,才会被写入技能记忆库。这保证了机器人不会为了 “背下某个失败样本” 而过度拟合。

04 机器人的 “Aha Moment”

在 Zetta ζ 的进化过程中,研究者观察到一个非常有意思的现象:成功率不是平滑上涨的,而是先经历平台期,然后突然跃升。就像人类解题时突然想通了一样,机器人也会出现 “顿悟时刻”。

如图展示的两个典型例子:

  • 把酒瓶放进碗里:成功率从15% → 95%
  • 把奶油奶酪放到碗里:成功率从5% → 90%;

在具身基准 RoboCasa 上,开电水壶、推洗碗机抽屉、关烤箱门、放置咖啡壶等任务,也出现了类似的跳跃式提升。以放置咖啡杯(CoffeeSetupMug)的任务为例:

  • Round0:策略模型能够正确识别咖啡杯和咖啡机,并开始执行运输;但在接近咖啡机时,由于缺少对抓取保持和碰撞间隙的持续检查,机械臂发生碰撞并丢失咖啡杯。策略模型未能及时识别这一局部物理异常,最终导致任务失败。(SR:70%)

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

  • Round1:Zetta ζ 从失败中演化出一个接触感知的操作 skill。其 critic 持续监控抓取保持、物体漂移和碰撞风险;触发后,recovery 在保持安全间隙的条件下运输咖啡杯,并在确认稳定放置后结束接管。(SR:86%)

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

在另一具身基准 Libero-Pro 上,也有同样的现象,以推盘子到炉灶前(Push the plate to the front of the stove)的任务为例。

  • Round0:遇到 failure0 “抓住盘子后未保持抓取” 而失败。(SR:0%)

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

  • Round1:提出 Critic1 (retained-grasp) 识别 “盘子是否被稳定抓起”,并用 Recovery1 (retained-object transport) 接管搬运,解决 failure0;随后遇到 failure1 “搬运过程中抓取丢失” 而失败。(SR:45%)

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

  • Round2:在 Critic1 和 Recovery1 生效的基础上,提出 Critic2 (carry-retention) 识别 “搬运中抓取抖动”,并用 Recovery2 (robust-carry Retry) 稳定抓取、降低搬运风险,解决 failure1,最终成功。(SR:95%)

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

更关键的是,这些跃升不是靠训练模型、增加参数量或者人为调参实现的。Zetta ζ 帮助机器人找到了决定成败的关键物理状态变量。比如:运输前是否确认 “抓取保持稳定”;接触目标时是否建立了 “足够稳定的物理接触”;接近目标前,末端执行器是否处于 VLA 模型 “熟悉” 的几何范围内。

这些发现看似简单,却是机器人能否从 “偶尔成功” 走向 “稳定可靠” 的分水岭。

05 持续进化与 “举一反三”

Aha Moment 不是孤立的一次性突破。更值得关注的是,随着进化轮次不断增加,Zetta ζ 的成功率呈现出持续、可复现的 scaling 趋势。在 LIBERO-Pro 上,纯 VLA 基线只有 34.5% 的平均成功率,随着 Zetta ζ 不断积累 Critic–Recovery,最终达到 90.8%。在 RoboCasa 上,成功率从 73.6% 提升到 93.6%。

每一轮进化做的事情,是识别并修复当前最主要的物理执行瓶颈,可能是错误的接近几何、不稳定的抓取保持、过早释放、执行停滞,或者任务关系未完成。随着这些 “小机制” 不断累积,机器人对物理世界的掌控力越来越强,任务成功率也就一步步逼近冻结 VLA 本身的能力上限。更有价值的是,Zetta ζ 学到的技能不是某个任务的 “标准答案”,而是可迁移的物理能力。

上图展示了 Zetta ζ 持续进化与零样本迁移效果。在 PnP-Stove 任务上,三轮进化分别针对任务中出错的预抓取、重抓取与放置阶段进行修复,将成功率从纯 VLA 的 78% 逐步提升至 84%、94% 和 96%;同一 harness 无需针对目标任务重新优化,即可在 PnP-Sink、PnP-Cabinet 和 PnP-Toaster 等任务上获得持续的零样本性能增益。(图右侧展示了各轮中 Critic 检测到的代表性失败模式及其对应的恢复行为。)

06 真实表现:Zetta ζ 在仿真基准上的表现远超现有方法

Zetta ζ 在 LIBERO-Pro Goal 平均成功率:34.5% → 90.8% ;在 RoboCasa 的 18 个 Atomic-Seen 任务平均成功率:73.56% → 93.56%;绝对提升20 个百分点,并且在接触丰富、长时程任务上提升尤为明显。这些提升全部来自执行系统的不断进化。且这些是在我们现有 rollout 迭代完的阶段成果,预计持续的 rollout 会继续提升成功率。

07 Z-Infra:Zetta ζ 高效自进化的基础设施

自进化需要大量 rollout 数据。环境是学习数据的来源,rollout 跑得越快,进化就越快。Zetta ζ 配套的 Z-Infra,是首个面向自进化具身智能体的 rollout 基础设施。它的设计思路很清晰:把 “智能体逻辑” 和 “异构硬件资源” 彻底解耦。

架构上分为三层:

  • Control Plane:统一调度、路由、生命周期管理;
  • Environment Worker:管理异构仿真环境、会话和物理状态;
  • Rollout Worker:负责 VLA/WAM 模型推理、动态 batching、异步调度。

Z-Infra 还实现了:

  • 模型分区部署:把 VLM 和 Action Expert 拆成独立进程,配合 CUDA IPC 传输;
  • 量化插件:按模块选择 W8A8 / W4A16 / W4A8,平衡速度与成功率;
  • 资源共享组:多个仿真会话共享模型编译和渲染上下文,显著降低重复开销。

效果也很直接:有效 rollout 吞吐从1.7 episodes/min 提升到 35.1 episodes/min,提升 20.6×;对比 HarnessVLA,吞吐提升12.8×;单 episode 延迟降低11.9×;π0.5 模型分区部署后,平均推理延迟降低53%,goodput 提升2.4×。

视频链接https://mp.weixin.qq.com/s/dgrptmhUPzZwcubdwUAqFw

08 为什么这值得被关注?

长期以来,具身智能的 scaling 思路主要是 “堆数据、堆参数、堆算力去训练更大的模型”。Zetta ζ 提出了另一条路径:不改变底层策略模型,而是持续进化它周围的执行系统。

这条路的价值在于:

  • 成本更低:不需要反复训练 / 微调大模型;
  • 部署更友好:可以在已有模型基础上直接增强可靠性;
  • 持续进化:机器人可以在部署后利用真实环境数据不断变强;
  • 可迁移:在一个任务上积累的物理技能,可以复用到相关任务。

当然,这并不意味着端到端 VLA/WAM 不再重要。相反,Zetta ζ 是在现有模型能力之上,补上了物理世界最需要的 “闭环治理能力”。研究团队也表示,未来计划将 Zetta ζ 规模化拓展到真实机器人:让真实机器人也能进行大规模并行 rollout;弥合 sim-to-real 差距;把真实机器人作为 Z-Infra 中的 “一等公民” 工作节点。

09 结语

从 “事后反思” 到 “动作频率级闭环治理”,从 “静态执行” 到 “三环自进化”,从 “人工调试” 到 “自动发现物理瓶颈”。Zetta ζ 让我们看到,具身智能的进化不一定要靠 “更大的模型”,也可以靠 “更聪明的智能体系统”。

机器人也有 Aha Moment。而 Zetta ζ 要做的,就是让这种顿悟和进化持续发生。