视频世界模型正在从短片生成走向可操作的环境模拟,但画面连贯、动作可控,并不等于模型能支撑长期交互。PlayWorld瞄准的正是这一差距:不再要求不同模型执行完全相同的动作序列,而是让多模态 Agent Player 围绕指定目标自主交互,再评估目标过程与结果。
为什么固定动作脚本不够
同一目标在不同世界模型中,可能需要完全不同的操作路径。例如,检查环境是否保持一致,可以让玩家转身360度;验证水体反馈,则要先走入水中,再观察是否出现符合预期的波纹。若直接向所有模型输入固定动作,动作可能与各自生成的环境不匹配,因而难以形成公平的横向比较。
PlayWorld将评测单位从动作序列改为长期目标。多模态智能体根据观察持续选择动作,尝试在不同模型中完成同一个任务。这样的设计更接近人类实际体验交互式世界模型的方式,也把规划、观察和反馈纳入了测试流程。
171个场景如何衡量长期可靠性
该基准包含171个带明确目标的场景,并从四个核心维度评估模型:几何一致性、交互真实性、视野外演化和视野内演化。此外,它还保留视频质量与可控性等基础能力指标,避免只看任务是否完成而忽略生成质量。
论文对九个先进世界模型进行了实验。结果显示,现有模型在长期交互目标上仍不可靠,问题尤其集中在空间一致性和状态持续演化:环境可能无法在多次移动、转向或离开视野后维持稳定,交互造成的变化也未必能够被长期保存。
我的判断
PlayWorld的价值在于改变了比较对象:从机械复现同一串动作,转向让智能体追求同一目标。这更适合环境结构不同、操作路径不固定的交互式视频模型,也能暴露短时画质指标覆盖不到的长期错误。
边界也很明确:评测结果不仅涉及世界模型,还会受到 Agent Player 的观察与行动能力影响。仅凭摘要无法判断智能体策略的稳定性、不同运行之间的方差,以及各维度的具体评分方式。因此,它更适合作为长期交互可靠性的补充基准,而不是取代视频质量、可控性或固定条件测试的单一总榜。