弱到强泛化关注一个关键问题:能力更强的学生模型能否从较弱监督者学习,并最终超过教师。它既关系到模型代际迁移,也影响多个领域模型的能力整合,因为每次都从头执行前沿规模的后训练,成本可能难以承受。传统蒸馏却通常把教师输出直接作为优化目标,学生因而可能被教师的能力上限约束。

从模仿教师转向利用教师方向

论文提出 On-Policy Reverse Distillation(OPRD)。它不要求学生持续逼近弱教师,而是在学生自身生成的轨迹上,评估教师当前策略相对其参考策略发生了怎样的位移,再提取这一位移与学生验证器驱动策略梯度一致的部分,并对其进行放大。

这一设计的重点是,教师提供的是优化方向上的辅助信号,而不是最终答案或固定目标。由于 OPRD 只重新缩放得到验证器支持的更新,作者认为它不会改变策略优化的驻点,却可以加快学生沿有效方向学习,从而为超越教师保留空间。

实验指向更快的能力迁移

摘要给出的结果覆盖两类场景:连续模型代际之间的能力转移,以及多个教师共同参与的蒸馏。与已有强化学习和蒸馏方法相比,OPRD用更少的学生更新取得了更高性能,但材料没有提供具体任务、模型规模和提升幅度,因此尚不能判断优势在不同设置下是否稳定。

响应风格分析显示,OPRD学生更接近仅使用验证器强化学习训练的模型,而不是弱教师。这支持了作者的解释:教师指导主要在加速学生原有的优化过程,而非把学生引向教师的行为模式。常规强到弱蒸馏结果还表明,该方法并不依赖教师与学生的固定能力顺序。

我的判断

OPRD的价值在于重新界定蒸馏中教师的角色:教师可以是方向提示器,而不必成为学生必须复制的性能终点。对已有可靠验证器、又需要复用旧模型或多领域教师的训练流程,这一思路具有现实吸引力。

它的适用边界也很明确。方法依赖验证器提供可信反馈,还需要教师策略相对参考策略的位移确实包含有用信息。摘要没有说明额外计算开销、对验证器误差的敏感性,以及面对明显失配或质量较差的教师时是否仍然有效。因此,目前更适合把 OPRD 看作一种有依据的训练加速机制,而不是弱监督必然产生更强模型的通用保证。