把视频生成模型称为“世界模型”,关键不只是让它生成一段看起来合理的视频。对于同一个初始观察和动作,现实中的物理过程可能有多种有效结果。真正的世界模型因此还应当复现这些结果出现的可能性分布。PAWBench关注的,正是这一更严格的要求:概率对齐。

从单条视频到结果分布

现有视频生成模型的评测,大多判断一条视频是否符合常识、是否具有物理 plausibility,或者是否与输入条件一致。但单次生成只能说明模型给出了一个可能轨迹,无法回答它是否掌握了不同结果之间的概率关系。

论文将概率对齐形式化为世界模型的分布标准,并提出PAWBench,用来评估视频生成模型能否作为世界动力学的随机采样器。配套的PAWEval则把多次视频 rollout 转换为可能物理行为上的经验分布。这样,评测对象就从“这条视频是否合理”变成了“重复生成后,模型得到的结果范围和出现频率是否接近参考分布”。

现有系统的共同缺口

PAWBench覆盖50个场景,并评估了11个当前系统。材料给出的结论是:没有模型能够持续地同时匹配参考概率,并恢复全部有效行为范围。换言之,模型或许能生成某些合理轨迹,但这并不意味着它已经学会了同一条件下各种可能结果的分布。

论文还进一步考察了三类可能改变预测分布的因素:语言提示、初始噪声采样,以及模型训练。这些实验围绕一个实际问题展开:如果模型的分布不正确,能否通过输入控制、随机性来源或训练过程将其调整到更接近目标状态。材料没有给出这些方法分别带来的具体改善幅度,因此只能确认,作者把它们作为走向概率对齐的后续方向进行了测试。

我的判断

PAWBench的价值在于,它指出了“会生成合理视频”和“能够建模世界”之间的评测断层。对于需要预测未来状态、规划动作或处理不确定性的系统,只看单条样本确实不够,重复采样后的统计行为同样重要。

不过,这一基准目前更适合被理解为问题定义和评测框架,而不是对所有世界模型能力的完整判定。材料只说明现有系统尚未稳定实现概率对齐,不能据此推断它们在其他物理理解或视频生成指标上同样失败。对开发者而言,最直接的启发是:涉及不确定性的应用,应把多次 rollout、行为覆盖范围和结果频率纳入评测,而不能只挑选一条看起来最合理的生成结果。