多模态在线策略蒸馏通常让学生生成轨迹,再由拥有特权视觉信息的教师逐词纠正。但教师给出的概率变化并非都来自图像,也可能混入语言先验和教师自身偏好。VAD关注的不是“在哪些词上加强蒸馏”,而是先判断一项纠正究竟有多少能由视觉证据解释。
用反事实变化定位视觉贡献
在每个学生生成的前缀上,VAD固定同一个教师,分别输入相关视觉证据存在和被移除的两种条件。两次推断所得中心化对数概率之差被定义为带符号代理量 u_t:正负方向用于估计视觉证据是在支持还是反驳某个候选词。
这种设计试图控制教师模型本身的差异,避免把更换模型造成的变化误认成视觉贡献。它也不同于仅按“视觉优势”调整损失权重:VAD直接处理教师纠正的内容来源,而不只是改变每个 token 接受监督的强度。
从教师纠正中重建训练目标
VAD将原始教师纠正投影到 u_t 所表示的视觉证据方向,得到与干预一致的分量;无法由该代理解释的部分则作为残差。随后,算法基于学生当前分布和前一分量重建目标,让这一学生锚定的目标承担主要监督,特权视角教师只提供较弱的正则信号。
论文摘要称,在六个细粒度视觉基准、4B 与 9B 两种规模上,VAD优于直接使用特权视角教师的蒸馏,以及视觉优势加权方法。token 级和受控目标分析还显示,代理对齐分量更集中于任务相关视觉信息。不过摘要未提供具体提升幅度,也未列出各基准结果。
我的判断
VAD的价值在于把多模态蒸馏的问题从“教师是否更强”推进到“教师的这次纠正是否有视觉依据”。对于需要识别细粒度视觉线索、又担心语言先验主导答案的任务,这种归因后再重建目标的思路较有针对性。
边界也很明确:u_t 只是视觉归因的代理,其可靠性取决于移除证据是否构成合理对照;若移除操作引入额外分布变化,投影结果也可能偏离真实视觉贡献。方法还需要在每个前缀比较有无证据的教师输出,摘要没有报告训练开销。缺少具体增益和跨任务细节时,目前更适合将其视为一种值得验证的蒸馏机制,而非已证明普适的方案。