世界动作模型(WAM)不只生成机器人动作,还会预测动作发生后的未来世界。过去,这种耦合常被视为增强鲁棒性、可解释性与安全性的基础:如果模型能先“看到”动作后果,系统就有机会检查动作是否合理。BadWAM指出,这个前提并不稳固——模型想象出的未来与实际执行的动作,可以被视觉扰动刻意拆开。

从动作攻击到世界—动作漂移

论文提出“世界—动作漂移攻击”:攻击者向视觉输入加入小幅扰动,破坏WAM内部未来预测与动作生成之间的对齐。它针对的不是单纯识别错误,也不只是让控制策略失效,而是利用WAM同时承担想象和执行两项任务所形成的新攻击面。

BadWAM用攻击强度与隐蔽性两个维度描述这一问题。前者关注能否让机器人产生导致任务失败的动作,后者关注异常是否会被模型自身的未来预测暴露。这种划分把明显的动作劫持和更隐蔽的内部失配放进了同一框架。

两类攻击暴露不同风险

当攻击者优先追求破坏效果时,BadWAM采用仅动作攻击,直接推动模型输出不利于任务完成的动作。当隐蔽性同样重要时,框架采用“保持想象”的攻击:在改变动作的同时,让预测未来尽量接近未受攻击时的结果。由此可能出现一种危险状态:模型仍呈现看似合理的未来画面,执行动作却已经与该画面失去同步。

论文在不同WAM变体上进行了评估,但给定摘要末尾不完整,无法确认具体指标、影响幅度及各模型之间的差异,因此不宜进一步推断攻击的普遍成功率。

我的判断

BadWAM最有价值的地方,是提醒开发者不能把“未来预测合理”直接等同于“动作执行安全”。如果监控机制只检查模型想象出的未来,这类保持想象的攻击可能绕过内部自检。对具身系统而言,安全验证应同时覆盖输入扰动、动作输出以及预测世界与真实执行之间的一致性。

不过,仅凭摘要还无法判断攻击需要怎样的访问权限、微小扰动在真实传感器链路中是否稳定,以及对不同任务和机器人平台的迁移能力。它更像是在定义一个值得重视的评测方向,而不是已经证明所有WAM架构都存在同等程度的现实风险。