机器人操作要获得稳定的泛化能力,需要覆盖足够广泛的物理经验。但带动作标签的机器人轨迹采集成本高,场景和行为多样性也受到限制。ZimaBlue提出的思路,是把更容易规模化获得的第一视角视频纳入训练,让模型从人和机器人与物体交互、接触动力学、工具使用以及长时行为中学习,再将这些视觉经验转化为可用于机器人控制的表示。
三阶段训练路径
ZimaBlue把训练过程分成三个阶段。第一阶段是因果具身视频预训练,使用大规模人类和机器人第一视角视频,学习环境随行为变化的时空规律。这里的视频本身没有动作标签,模型首先获得的是对具身世界动态的建模能力。
第二阶段进行视频—动作中期训练,把已经学习到的视觉动态与异构机器人轨迹连接起来,并采用统一的动作表示。这样做的重点,不是只记住某一台机器人的控制方式,而是让视频中的交互经验能够与不同机器人数据建立对应关系。第三阶段则针对目标机器人进行专门化,使模型具备部署所需的具体控制能力。
面向实时控制的系统设计
生成式世界动作模型通常容量较大,直接用于实时控制会带来推理延迟问题。ZimaBlue因此采用异步的 Slow-Fast 双系统架构:高容量的 Slow 世界模型负责提供具有泛化性的时空表示,轻量级 Fast 分支负责动作预测。材料显示,在 NVIDIA RTX 4090 上,Fast 分支可以达到 30 Hz 的动作预测速度。
在真实机器人零样本评测中,仅使用目标机器人数据时,成功率为 36.1%;将训练规模扩展到超过 120,000 小时的具身视频后,成功率提升到 77.8%。这组结果说明,视频数据并非只能作为视觉预训练素材,在合适的动作对齐和目标机器人适配流程下,也可能成为机器人控制扩展的重要经验来源。
我的判断
ZimaBlue的价值主要在于提出了一条清晰的扩展路径:用大规模、低标注成本的视频补充昂贵的机器人动作数据,再通过统一动作表示完成控制落地。它尤其适合需要跨环境、跨行为泛化的操作任务。不过,现有材料只给出了真实机器人零样本评测中的总体成功率变化,没有说明任务构成、机器人类型、数据来源细节或与其他方法的对比,因此不能据此判断其在所有操作场景中的普适性。30 Hz 也依赖特定硬件和双系统设计,实际部署仍需关注目标机器人适配与推理链路的完整延迟。