世界动作模型(World-Action Model,WAM)的目标,是把视频生成模型中积累的世界知识转化为机器人可执行的控制信号。但现有系统通常把生成骨干、视觉表征、网络架构、信息流、推理流程和训练数据绑定在一起。模型效果即使提升,也很难判断究竟是哪项设计发挥了作用。OpenWAM试图解决的首先不是单一指标,而是研究过程缺乏可解释对照的问题。

从完整系统转向可组合实验

OpenWAM包含基础设施与实验研究两部分。OpenWAM-Infra将世界动作模型的设计空间拆分为可组合模块,并统一训练、推理、部署和评估流程。这种设计允许研究者在保持其他条件相对稳定时,替换生成骨干、潜在表示或信息传递方式,从而分析不同组件的实际贡献。

OpenWAM-Study围绕三个问题展开受控实验:模型应该从上游生成模型继承什么,世界学习与动作学习如何相互作用,以及两者的协同效果如何随规模变化。论文据此归纳出一组设计原则,而不是把某个固定架构包装成唯一答案。

三项预训练原则

第一,上游知识能否有效迁移,取决于生成骨干是否具有足够能力,以及潜在空间是否紧凑且包含丰富信息。仅有视频生成先验并不意味着它会自然变成可执行能力,表示瓶颈仍然关键。

第二,世界建模与动作学习的协同需要专门的动作容量、明确的世界到动作信息流,以及同步的联合去噪。这说明动作预测不能只是生成模型末端附加的轻量输出头,训练过程也需要让世界状态与控制信号在时间和信息层面共同演化。

第三,具身预训练的主要收益被概括为提升分布外泛化。OpenWAM采用单阶段联合训练,将第一视角人类数据的环境覆盖与机器人数据的动作落地结合起来。基于这些原则构建的OpenWAM-α使用约6400小时第一视角人类与机器人数据预训练,并在仿真和真实世界基准上评估;现有材料未提供完整结果,不宜进一步推断其领先幅度。

我的判断

OpenWAM更重要的价值,是把世界动作模型从难以拆解的系统工程转化为可重复比较的研究框架。它适合用于验证表征、信息流和联合训练策略,也为复现和二次开发提供了较清晰的接口。不过,摘要只能支持设计原则与实验范围,尚不足以判断这些原则能否跨机器人形态、任务类型和数据规模稳定成立。约6400小时数据也意味着复现实验仍有较高资源门槛;开放架构降低了研究摩擦,但并未消除数据质量、控制频率和真实部署条件带来的差异。