On-policy 自蒸馏正在被用于语言模型后训练:教师可以利用额外的特权信息提供更强监督,学生则从教师行为中学习。问题在于,学生部署后通常看不到这些信息,却可能学会依赖它们作答。论文将这种现象称为“特权幻觉”,并把教师训练条件与学生推理条件之间的信息不对称视为根因。
特权教师为何可能带偏学生
OPSD 的风险不只是学生缺少某项输入,而是训练过程可能让它表现得像那项输入仍然存在。教师基于特权信息形成的策略,在训练时看起来正确、稳定,但其中部分行为无法由学生的推理上下文支持。如果这类行为被直接迁移,学生就会形成不可复现的决策依据,最终导致性能下降。因此,关键不是继续增强教师,而是约束蒸馏中可被传递的信息条件。
两层锚定如何对齐信息条件
DAPD 包含两个层次。Dual-Path Anchoring(DPA)引入一条自条件化桥梁,在两条信息匹配的路径上对齐 reference 与 rollout 行为,目标是阻止依赖特权信息的行为进入推理阶段学生。它强调比较双方在可匹配信息条件下的策略,而不是让学生无条件追随更强教师。
Dual-Source Anchoring(DSA)进一步把这些路径同时用于 reference-to-rollout 与 rollout-to-reference 两个方向。这样既降低对特权 reference 指导的依赖,也保留正确性监督。摘要报告,DAPD 在 Qwen3-4B 的跨任务平均结果上比 OPSD 高 2.00 分;不同规模上的增益仍然存在,其中 4B 与 32B 分别达到 2.69 和 2.78 分。
我的判断
DAPD 的价值在于准确指出:蒸馏监督越强,不代表越适合部署条件;教师和学生可见信息是否对称,可能比教师本身的能力更关键。它适合教师在训练期拥有答案、反馈或其他额外上下文,而学生上线后无法获得同等信息的场景。不过,现有材料只给出了 Qwen3 系列及汇总增益,没有呈现具体任务、训练成本和与其他蒸馏方法的完整比较。因而更稳妥的结论是,双重锚定为缓解特权幻觉提供了有效方案,但其通用性仍需结合完整实验判断。