机器人智能体通常能在任务结束后总结失败,却很难在执行过程中及时干预。Zetta 试图补上这条闭环:基础策略保持冻结,系统在运行时在线演化代码形式的批评器与恢复技能,让机器人能够根据持续变化的自身状态和环境状态调整执行,而不是等整段轨迹结束后再反思。

三种时间尺度分工

Zetta 将闭环拆成三个不同时间尺度。第一层在动作频率上治理执行,用于跟踪快速变化的机器人—环境状态;第二层以一次 rollout 为单位,提出新的批评器与恢复方案;第三层通过验证门控决定是否更新技能。这样的设计把即时干预、经验归纳和技能写入分开,避免让当前的大型智能体模型直接承担高频控制。

论文强调,系统进化的是外围运行时能力,而非基础策略本身。这意味着 Zetta 更像一套包裹策略模型的 embodied harness:已有策略负责生成行为,批评器负责识别执行风险或偏差,恢复技能则在必要时介入。技能更新需要经过验证,而不是把每次探索结果直接加入系统。

基准结果与基础设施

配套的 Z-Infra 将智能体逻辑与异构执行资源解耦,用来支持 rollout。按照论文摘要披露的当前 rollout 预算,Zetta 在 LIBERO-Pro 和 RoboCasa 上分别达到 90.8% 与 93.6% 的成功率,作者称其达到当前最佳水平,同时报告了 11.1 倍推理加速。

结果还显示,成功率会随着自探索经验继续扩展,学到的技能能够零样本迁移,并出现清晰的机器人“Aha Moments”。不过摘要没有给出这些现象的具体任务、对照设置和统计细节,因此暂时不宜把它们进一步解释为普遍的自主发现能力。

我的判断

Zetta 的价值不在于训练出一个更大的机器人策略,而在于把在线纠错、恢复和技能验证组织成可迭代的工程闭环。它适合基础策略已有一定能力、失败主要发生在执行过程,并且可以承担持续 rollout 与验证成本的场景。

边界也很明确:目前结果来自 LIBERO-Pro 和 RoboCasa,成功率及速度优势是否能延伸到更多真实机器人、长时任务和更复杂的环境变化,材料尚不足以判断。基础策略冻结有利于控制更新风险,但系统最终仍受其能力上限,以及批评器和恢复技能质量约束。