战争、灾害和公共紧急事件中的生成视频,不只是一般意义上的深伪内容:一旦进入社交传播链路,错误判断可能直接影响公众认知。RA-Bench试图回答一个更贴近现实的问题——现有检测器面对危机场景、不同生成条件和传播环境时,究竟能否稳定工作。
用真实危机视频作为评测锚点
RA-Bench共包含17,886段视频,其中有1,830段真实视频锚点,覆盖10类社会风险场景;另有16,056段生成视频,来自4个开源和5个闭源生成器。这里的关键设计是以真实视频为锚,而不是只汇总彼此无关的真实与合成样本,从而围绕具体危机场景比较生成内容及其可检测性。
基准还把生成质量、条件信息和采样种子纳入分析。这样可以区分检测结果究竟来自生成器本身、生成设置,还是单次采样的偶然差异,为研究检测器失效原因提供更细的观察维度。
三类检测路线都未稳定泛化
论文评估了7个传统检测器、10个零样本多模态模型,以及2个专门针对AI生成视频检测进行微调的多模态大模型;零样本模型还在3种审查设置下测试。结果并未显示哪一类方案具有一致优势:三类检测方法都不能在RA-Bench的不同实例上持续泛化。
生成属性对不同检测器家族的影响也不相同,说明“更高质量”或“更多条件信息”并不会对所有检测路线产生统一效果。与此同时,来源层面的检测模式在不同采样种子之间相对稳定,表明种子变化没有完全改写某一来源的总体特征,但这不等于单条视频就容易识别。论文还研究了人的真实性判断与社交传播中的检测可靠性,不过给定摘要没有披露相应数字和明确结论,不宜进一步推断。
我的判断
RA-Bench的价值不在于宣布一个新检测器胜出,而在于揭示危机视频检测仍缺少可稳定迁移的方案。真实视频锚点、多生成器和生成条件分析,使它适合用于压力测试与失效归因。但它覆盖的仍是特定场景、生成器和检测方法,不能直接代表所有平台上的真实传播环境。现阶段更合理的做法,是把检测器视为风险信号之一,而不是单独承担事实裁决。