视频生成是否“成功”,不一定要靠完整展示每个中间步骤来判断。SemComp-Bench提出“语义任务完成视频生成”:模型既要实现指令要求的最终结果,也要让该结果与参考图像保持任务相关的高层语义对应。评测因此从常规外观一致性和过程呈现,转向结果是否达成、语义是否落地。

评测目标从过程转向结果

这一定义刻意降低了对完整操作轨迹的要求。生成视频无需呈现一套完整的中间任务步骤,也不要求以传统方式维持参考图像的外观一致性;真正被检查的是生成结果本身。不过,这并不等于可以忽略参考图像。所谓语义落地,强调参考图像与最终结果之间,在当前任务所关心的高层语义上存在对应关系。换句话说,画面“像不像”不再是唯一重点,但“是否基于这个参考完成了正确事情”仍然重要。这样的拆分把结果达成与参考条件的有效使用放到同一评测框架中。

数据与评分如何组织

配套的SemComp-Data覆盖六个领域。每个样本由一张参考图像、一条详细指令、一条简短指令,以及一个以结果为中心的视频片段组成。论文还给出可扩展的四阶段整理流程,将原始视频转换成标准化样本,但摘要没有披露六个领域的具体构成与各阶段细节。

SemComp-Bench使用视觉语言模型回答结构化二元问题,并报告两项指标:OA Score对应Outcome Achievement,用于结果达成;GR Score对应Generation Reliability,用于生成可靠性。材料没有给出问题模板、聚合公式或阈值,因此不能进一步判断两项分数的统计性质。对代表性视频生成模型的实验表明,同时实现预期结果与任务相关语义落地仍然困难。

我的判断

这项工作的价值,在于把“视频看起来相似”与“任务真的完成”区分开,并提供数据、整理流程和可执行的VLM问答协议,适合结果导向的视频生成场景。它的边界也很明确:不要求完整过程,意味着它不能替代对步骤正确性、过程安全性或细粒度时序质量的评估;依赖VLM做二元判断,也使结论受提问设计和判别能力影响。摘要未提供数据规模、领域分布、人工一致性验证及具体模型成绩,目前更适合把它看作一种明确的评测方向,而非已经充分验证的通用标准。