多模态基础模型能借助互联网规模的图文数据学习“看”和“说”,但具身智能需要把观察、物理状态与动作绑定起来,无法直接复制这条路径。这篇工作提出“数据金字塔”,试图用统一框架解释机器人训练数据从哪里来、如何组合,以及不同配方可能支撑什么能力。
五类数据源如何互补
作者归纳了五类来源:真实机器人数据、UMI 风格数据、第一与第三视角数据、仿真数据,以及通用视觉—语言数据。框架的主轴是可扩展性与机器人对齐之间的张力,并以数据质量、多样性、可复用性和物理保真度描述每类来源。重点不是给出简单的优劣排序,而是说明不同来源提供的监督信号并不等价,需要按训练目标互补使用。
从数据规模转向数据配方
论文进一步从数据配方审视近期具身基础模型:预训练时选择哪些数据,如何完成对齐,又如何混合。讨论覆盖具身“大脑”模型、视觉—语言—动作模型和世界—动作模型,并将数据组成与感知、推理、规划、动作生成及世界预测能力联系起来。作者还列出六个开放问题:大规模触觉数据,失败与恢复数据,可扩展采集流水线,跨具身形态的动作对齐,利用第一视角数据训练灵巧操作,以及更有原则的数据配方设计。
我的判断
这项工作的主要价值,是为具身数据工程提供一套共同语言:团队可以据此检查训练集究竟偏向规模、机器人对齐还是物理真实性,也能更清楚地讨论混合不同数据的目的。它更适合作为领域地图和配方设计框架,而不是直接可执行的最优方案。从摘要信息看,尚无统一实验数字可用于比较不同配方的实际收益,因此不能据此断言某类数据源或某种混合方式必然更优;具体选择仍需结合机器人形态、任务目标与采集成本验证。