多模态深度研究智能体正在从单张图片走向连续视频。Video-DeepResearch(Video-DR)关注的并非一般视频问答,而是需要跨帧定位视觉证据、再结合开放网络信息完成多跳推理的任务。论文认为,现有模型即使拥有视觉和搜索工具,也可能绕开真实的视频理解过程。
先约束工具使用顺序
作者在初步评估中识别出两个瓶颈。其一是模态偏置:智能体倾向于直接使用文本搜索,而不是调用视觉工具检查视频。其二是参数知识泄漏:模型可能依赖内部记忆回答问题,表面上完成任务,实际没有执行预期的工具增强流程。
Video-DR 因此采用解耦的感知—探索管线,并按阶段开放工具。模型需要先对视频进行较完整的跨帧视觉定位,之后才能使用网络检索。这个设计重点不是增加工具数量,而是通过执行顺序减少走捷径,让最终答案更可能建立在视频证据与外部资料的组合之上。
两阶段训练与自建评测
训练分为监督微调和 Group Relative Policy Optimization(GRPO)两个阶段。监督微调提供基本的工具调用轨迹,GRPO 则用于推动模型自主探索,试图突破单纯模仿既有轨迹的上限。
团队同时构建了 Video-DR-Bench,包含 200 道由人类与 AI 协作整理的复杂多跳视频问答。论文报告,Video-DeepResearch-35B-A3B 的平均准确率为 64.0%,高于 Claude-4.5-Sonnet 的 59.0%、Gemini 2.5 Pro 的 57.5%和 GPT-5 的 52.5%;30B-A3B 版本达到 59.3%。这些数字说明该训练与工具编排方案在这套基准上有效,但仍属于单一自建评测中的结果。
我的判断
这项工作的价值,在于把“是否真正看过视频、是否真正调用工具”提升为智能体设计的核心问题。分阶段解锁工具是一种直接且可审计的约束,适合证据分散在多个时间点、还需要外部检索补充背景的任务。
边界也很明确:基准只有 200 个样例,任务覆盖面、标注稳定性以及对不同视频长度和领域的泛化情况,仅凭摘要无法判断;与闭源模型的比较也只反映 Video-DR-Bench 上的准确率,不能直接外推为通用能力领先。后续更值得关注的是执行轨迹质量、视觉证据可验证性,以及强制先感知带来的额外计算成本。