On-policy distillation(OPD)被视为强化学习与监督学习之间的一种折中方案:它让教师模型对学生自己生成的轨迹提供逐 token 的密集监督,以替代 RLVR 中较为稀疏的结果级优势信号。但这套机制有一个基础问题:学生生成的轨迹对教师而言本质上是 off-policy 的,因此教师给出的监督是否可靠,并不确定。该研究正是从这个问题出发,重新检查 OPD 到底在蒸馏什么。
教师监督并不稳定
研究者对 OPD 训练过程中的教师监督进行了定量分析,发现其中存在相当程度的噪声,而且教师规模越大,噪声出现得越多。这一结果直接削弱了“更大的教师会提供更可靠 token 级指导”的直觉。不过,实验同时显示,学生策略对这类噪声并不敏感:保留噪声监督,或将其移除,最终都能得到相近的性能。
这意味着,OPD 的收益未必主要来自教师对每个 token 的准确判断。进一步分析发现,模型的学习集中在低 log-probability token 上。即使不使用教师提供的优势值,只采用一个固定的负优势,也能达到相当的表现。换句话说,OPD 可能主要是在压低学生自身认为不太可能的尾部 token,而不是从教师那里获得细致的行为模仿信号。
OPSA:把教师信号改成自适应规则
基于这一观察,研究提出了 On-Policy Self-Adaptation(OPSA)。它不依赖教师监督,而是使用熵自适应的负优势:在熵较高的位置施加更强的学习信号,抑制尾部 token,同时在头部 token 之间更均匀地重新分配概率质量。其核心思路不是让学生复制某个教师的选择,而是利用自身分布识别不稳定位置,并降低低概率输出的影响。
在基于 Qwen3-1.7B 的比较中,OPSA 在 AIME24 上将 Avg@32 提高了 35.41 分,相对增幅为 263%;在三个基准上,Pass@32 都实现了超过一倍的提升。材料未给出其余对比结果的完整信息,因此这里不延伸判断 OPSA 与其他方法的全面优劣。
我的判断
这项工作的价值,在于把 OPD 的有效机制从“教师提供密集知识”重新审视为“训练过程抑制低概率 token”。如果这一解释成立,OPD 的教师成本和监督噪声都值得重新评估,某些场景下无需教师的自适应方法可能更简单。不过,现有材料主要支持特定实验设置下的机制分析,不能据此断言所有 OPD 任务都不需要教师。OPSA 的提升也应结合更多模型、任务和训练配置验证,尤其要区分它带来的普遍优化效果与特定基准上的收益。