机器人操作策略长期面临一个数据矛盾:真机遥操作足够准确,却难以低成本扩展;无机器人 UMI 采集更容易规模化,但通常只用于预训练,后训练仍需少量真机数据作为“锚点”。HiFi-UMI选择了另一条路线:不再继续压缩真机数据占比,而是提高无机器人示范本身的保真度,尝试彻底移除后训练阶段的真机依赖。
高保真来自采集系统的协同设计
HiFi-UMI是一套便携式数据生产系统,针对轨迹精度、双夹爪相对位姿、时间同步与视野共同设计。系统采用头戴式离线双目惯性 SLAM;相对位姿直接采集,而非事后重建;通过共享的微秒级 GPIO 触发器完成同步;每只手配置两台广角相机,覆盖约 200 度视野。
在不依赖外部跟踪基础设施的情况下,该系统实现了工作空间局部坐标下 3 毫米的末端执行器精度。这里的重点不只是单项定位指标,而是让视觉、动作轨迹和双手关系尽可能保持一致,从源头减少示范数据与真实机器人执行之间的偏差。
仅用 UMI 示范完成后训练
研究者使用 HiFi-UMI 数据对策略进行后训练,过程中不加入真机遥操作示范,随后直接部署到真实机器人。实验覆盖视觉—语言—动作与世界—动作模型两类架构中的三个骨干:相较于同域真机遥操作基线,StarVLA-QwenPI、OpenPI-pi_0.5 和 LingBot-VA 的成功率差异分别为 -2.5、+3.1 和 -0.6 个百分点。
其中最强策略在精密插入任务上达到 85% 成功率。值得注意的是,遥操作基线数据采自评测场景,而 HiFi-UMI 没有任何轨迹来自该场景。这支持了“高质量无机器人数据可以替代后训练真机锚点”的核心判断,但不能据此推断整个训练流程完全不含机器人经验。
我的判断
这项工作的价值,在于把问题从“至少需要多少真机数据”改写为“无机器人数据需要达到什么保真度”。结果横跨三个骨干,说明收益未必局限于单一模型。不过,现有材料没有给出更完整的任务范围、数据规模、跨场景稳定性及长期部署表现;突出结果也集中在精密插入任务。3 毫米局部精度、严格同步和多相机覆盖可能是成功关键,同时也构成系统复现与维护成本。现阶段更适合将其视为移除真机后训练锚点的有力证据,而非对所有操作任务都成立的普遍结论。