关键帧正在成为视频生成的重要控制方式:创作者提供一组参考图像,模型负责补全中间过程。但支持多关键帧,并不等于能够按要求执行。KeyFrame-Compass 试图把关键帧是否出现、何时出现、能否保持,以及最终视频是否自然,放进同一套评测框架。
基准覆盖了哪些变量
作者将 KeyFrame-Compass 定位为首个面向关键帧条件视频生成的综合基准。它包含 386 个经过筛选的样本,覆盖三个应用领域、两种视频结构、两档提示词粒度、两种条件输入格式和四档关键帧密度。
这种设计的重点不是单纯扩大样本量,而是拆分影响生成结果的变量。研究者可以分别观察提示词详细程度、输入组织方式或关键帧数量变化后,模型执行能力如何改变。尤其是关键帧密度这一维度,直接对应实际工作流中的约束强度。
不只看画质,也检查是否照做
评测框架将关键帧执行拆成六项指标:出现、保真、时序、定位、持续和唯一性。它们分别检查指定内容是否生成、与参考图是否一致、顺序是否正确、是否出现在合适位置、能否维持,以及不同关键帧是否被错误混淆。
整体视频质量则由基于证据的多模态大模型判断,并结合专用感知模型。对九个代表性视频生成系统的实验显示,当前模型在忠实执行关键帧与自然合成视频之间存在明显取舍;关键帧约束越密,表现还会进一步下降。多数开源模型也无法把故事板网格正确理解为按时间排列的关键帧序列。
我的判断
这个基准的价值,在于把关键帧控制从主观观感问题转成可分项诊断的问题。它适合用于模型选型、工作流设计和多关键帧能力回归测试,也提醒开发者不要把“支持故事板输入”直接理解为“理解故事板时序”。
边界同样明确:材料只给出了总体趋势,没有披露九个系统的具体排名,也未提供自动评价与人工判断的一致性细节。因此,它足以说明现有方法的共性短板,但还不足以据此判断某个模型在特定业务场景中的绝对优劣。