视频生成模型正在表现出某些类似视觉推理的能力,但生成出一个看起来合理的结果,并不等于完成了可靠的推理。VGI-Bench试图把这个问题拆开评估:模型是否理解了视觉输入,能否生成有效的演化过程,以及它在不同难度任务上的表现是否稳定。论文认为,现有评测在这些方面仍不充分。
评测设计
VGI-Bench包含27项任务和810个实例,按照任务领域与技能标签构成两级分类体系,用于更细粒度地分析视频生成模型的视觉推理能力。与只检查最终画面是否合理的评测不同,该基准还要求模型生成符合要求的动态演化过程。换句话说,模型需要在视频变化中体现出有效的视觉理解,而不是仅仅抵达一个看似 plausible 的终态。
评测设计还强调三个条件:输入应当与当前视频模型已有的视觉先验相匹配,任务需要要求有效的过程而非单一结果,难度则应保持挑战性,同时让模型对部分任务具备完成可能。这样的设计目标,指向的是模型能力的可检验性,而不只是生成质量或画面观感。
结果与分析
实验显示,当前生成系统可以解决一部分有视觉依据的推理任务,但距离可靠仍有明显差距。在论文给出的评测标准下,表现最强的模型Seedance 2.0也只有51.0%。这个结果说明,视频生成模型展现出的推理迹象仍然具有较强的任务依赖性,不能直接外推为稳定的通用视觉智能。
论文还分析了几类影响因素,包括输出失败模式、对输入条件的敏感性,以及通过合成数据微调后能力迁移的边界。内部去噪过程的分析进一步显示,模型的自我修正能力有限:后续步骤主要是在早期假设上继续细化,而不是纠正其中的推理错误。这意味着生成过程中的逐步完善,并不必然代表模型发现并修复了错误判断。
我的判断
VGI-Bench的价值在于把视频生成模型的视觉推理从直观印象拉回到任务、过程和失败模式上,适合用于比较模型在不同视觉技能上的具体表现,也能帮助研究者定位能力边界。它的适用范围仍主要是论文定义的27项任务,不能据此概括所有视频理解或现实世界推理能力。51.0%的结果也更适合作为当前评测条件下的信号,而不是对模型整体智能水平的定论。对视频模型而言,下一步关键不只是生成更连贯的画面,还包括提高推理过程的可靠性,以及真正具备发现和纠正早期错误的能力。