在策略自蒸馏不依赖外部教师,但仍要解决一个核心问题:同一个模型如何为自己提供更强的学习信号。已有方法通常向教师提供特权答案或额外视觉证据。VCSD进一步取消这些条件,只利用输入图像是否保留实例内容形成信息不对称,把视觉内容本身转化为蒸馏信号。
用两次预测识别视觉相关词元
训练时,学生先生成回答前缀。对于同一提示词和前缀,指数移动平均(EMA)教师分别基于原始图像和内容擦除后的对照图像,输出两个下一词概率分布。两者逐词元的对数概率差,可以突出那些因当前图像内容而提高概率的候选词元。
VCSD随后利用这组对比信号,对教师在原图条件下的分布进行锐化,但范围限制在原分布的合理支持之内,再将得到的完整概率分布蒸馏给学生。它不是只挑选一个答案作为硬标签,而是保留教师对候选词元的整体判断;监督差异也不来自另一个更大模型,而来自同一教师面对原图与对照图时的条件变化。
Qwen3-VL不同规模均有提升
论文使用ViRL39K数据集,并在Qwen3-VL与Qwen3.5模型上比较VCSD和配置匹配的OPSD。摘要称VCSD在这些实验中持续优于后者。以Qwen3-VL的七项基准聚合成绩为例,2B模型从62.27%提升至67.04%,4B从71.30%提升至73.16%,8B从72.51%提升至76.26%。
不同参数规模都出现提升,说明这种视觉对照信号并非只对单一尺寸有效。不过,摘要没有给出各项基准的独立结果、训练成本,以及内容擦除对照的具体构造方式,因此还不能判断收益集中在哪类视觉任务,也无法评估额外双分布计算带来的代价。
我的判断
VCSD的价值在于把“教师为何比学生更有信息”改写为一个输入条件设计问题:不增加外部教师,也不依赖特权答案,而是通过移除视觉内容估计哪些词元真正受图像支持。这一思路简洁,并且与视觉语言模型减少脱离图像的生成倾向存在直接关联。
其适用边界同样明确:方法依赖可靠的内容擦除对照。如果擦除过程残留关键信息,或同时引入明显的分布偏移,对数概率差就未必只反映实例级视觉内容。现有数字支持它优于匹配的OPSD基线,但材料不足以证明其能普遍提升所有视觉语言任务,仍需结合更细的消融、分任务结果和计算开销判断实际价值。