复杂机器人任务往往不是“看到当前画面就能决定下一步”的简单反应,而是需要记住此前发生过什么、已经完成了哪些阶段,以及接下来应如何衔接。论文提出的 MaP-WAM,针对的正是这种非马尔可夫任务:当前观测不足以支持决策,策略必须依赖更长时间跨度的经验。
把记忆变成计划,而不是不断追加历史
现有记忆机制通常有几种路线:用语言概括历史、扩大视觉观测窗口,或者把两者结合起来。它们各有代价。语言摘要可能丢失细粒度视觉证据,持续增加视觉历史又会带来上下文长度和执行效率之间的权衡。MaP-WAM 的核心拆分是“记忆支撑的规划”和“计划条件下的执行”。
具体来说,系统把已经完成的任务片段保存为记忆记录,每条记录包含语言指令和稀疏视觉上下文。到了规划阶段,模型利用这些长期多模态情境,将情景记忆压缩为更紧凑的计划:一条面向下一阶段的语言计划,以及与之对应的视觉引导。执行器不再反复读取完整历史,而是围绕当前计划工作,因此执行阶段的上下文长度保持固定。结构化注意力还支持在规划和执行过程中使用键值缓存,有助于减少重复计算。
用进度预测控制分段切换
计划本身并没有规定每个阶段必须持续多少步。为此,论文引入 World-Action-Progress 模型,在推理时联合预测动作块和执行进度,让每个计划片段可以持续未知时长。系统再通过计划与当前观测之间的对齐,对预测进度进行校准:当观测表明当前片段已经完成,便自适应切换到下一段计划,并更新闭环上下文。
这意味着 MaP-WAM 不是一次性生成完整动作序列,而是把长任务拆成多个可检查、可转换的阶段。记忆负责提供跨阶段证据,计划负责压缩和组织这些证据,执行器则根据当前观测持续修正动作。摘要显示,该方法在 RMBench 上取得了当时的先进表现,但材料没有给出完整的数值和实验细节,因此不宜据此判断其对不同任务类型的普遍优势。
我的判断
MaP-WAM 的价值在于重新定义了机器人记忆的接口:记忆不一定要直接成为执行器的长上下文,也可以先被整理成可执行的阶段计划。这一设计对长时程、多步骤操作尤其有吸引力,并且固定执行上下文、缓存注意力等机制具备明确的工程意义。
但它的适用边界也很清楚。计划压缩会引入信息损失,稀疏视觉记忆能否保留真正关键的证据,取决于规划模型的判断;而计划—观测对齐和进度校准一旦出错,错误可能在阶段切换时累积。当前材料也没有提供更多任务规模、消融实验或真实环境表现。因而,这项工作更像是一个有说服力的长程机器人记忆架构方向,距离证明其在广泛场景中的稳定性,还需要更完整的实验支持。