视频大模型答对问题,并不一定真的看对了对象和时间。E-VQA 提出“带证据的视频问答”任务:模型除语义答案外,还必须输出相关时间片段,以及随对象运动而连续跟踪的像素级分割掩码。
为什么文本解释不够
自然语言理由可能由模型事后生成,稀疏边界框又很难表达遮挡、形变与跨帧身份。时间范围加密集 masklet 把证据变成可直接核验的视觉对象:答案依赖哪几秒、哪个实体、实体如何移动,都能与人工标注比较。
研究团队构建了经人工验证的 ST-Evidence 基准,以及约 16 万规模的 ST-Evidence-Instruct 数据。论文报告,现有模型的问答准确率与真实视觉感知明显脱节,单纯扩大模型规模没有消除这一问题;在相同规模的 7B 对比中,针对证据数据微调后,时序和分割指标分别获得显著提升。
对开发者的影响
在安防、体育分析、工业巡检和视频检索中,只评最终答案会掩盖“猜对”的情况。更可靠的验收标准应同时包含答案、时间定位、对象跟踪和证据一致性,必要时还要测试遮挡与镜头切换。
这会增加标注和推理成本,但也给错误分析提供了明确入口:是检索错了片段、跟丢了对象,还是在证据正确的情况下推理失败。不同故障需要完全不同的修复路径。
我的判断
E-VQA 的核心贡献不是再加一个视频分数,而是把可验证性写进输出协议。对高风险多模态应用,未来“答案 + 可机器检查的证据”很可能比自由文本思维链更有工程价值。