视频世界模型正在从“生成看起来像真的画面”走向“维护一个能够持续运行的世界”。Programmable World Model 关注的核心问题是:当用户与场景进行较长时间的交互时,模型如何记住场景中每个实体的状态,并按照预先设定的规则推进世界,而不是每一帧都重新猜测结果。
把世界状态从画面中分离
这项工作的基本设计,是将世界状态的演化与视觉观察的生成解耦。智能体先把自然语言指令翻译成可执行程序,由程序明确描述实体状态以及状态转移规则。轻量级引擎负责执行这些程序,更新并维护一个显式、持久的全局世界状态。
这里的“状态”不只包括当前画面中能看到的内容,也包括画面之外的实体,以及非视觉属性。这样一来,用户可以直接控制某个实体,也可以规定实体之间如何互动。世界不再完全依赖视频模型隐含地记忆,而是由独立的状态机制负责保持连续性。
用中间表示连接规则与视频
为了让结构化世界状态能够驱动视频生成,论文引入了带状态信息的三维有向包围盒,也就是 state-augmented 3D oriented bounding boxes,作为中间表示。该表示结合目标相机轨迹后,会被确定性地编译成与像素对齐的时空条件信号,再交给预训练视频模型充当生成渲染器。
这条链路的重点在于分工:程序和引擎决定世界如何变化,三维表示描述实体在场景中的空间与状态,视频模型则负责把这些条件渲染成视觉结果。论文据此展示了创建可游玩游戏的能力,包括预定义机制、对单个实体的直接控制,以及贯穿游戏过程的持久世界状态。
论文还提出了 CombatStateBench,用于评估可编程世界模型在状态维护方面的能力。在该基准上,这一方法取得了 94% 的 Count Accuracy 和 98% 的 State Accuracy,并显著优于已有交互式视频世界模型。材料没有进一步说明评测设置、对比模型或指标细节,因此这些结果更适合被理解为该框架在特定状态一致性任务上的表现。
我的判断
这项工作的价值不在于单纯提升视频画面的逼真度,而在于为交互式世界模型补上了可检查、可执行的状态层。对于规则明确、实体关系相对结构化的游戏和模拟环境,这种架构比让视频模型独自承担长期记忆与逻辑约束更容易控制,也更便于评测。
但它的适用边界同样清晰。程序化规则、三维包围盒和状态属性能够约束世界,却不能自动解决开放环境中的复杂常识、模糊物理关系或规则本身的设计问题。视频模型仍然承担最终视觉渲染,状态正确也不等于画面在所有情况下都符合真实世界。就现有材料而言,这更像是把世界模型拆成“状态引擎加生成渲染器”的可行架构,而不是已经通用解决了长期交互问题。