RLVR与在策略蒸馏看似互补:前者把一个可验证的响应级奖励广播给所有 token,后者则借助更强教师逐 token 评分,提供更密集的优势信号。但直接按固定系数相加并不稳定。SAF-OPD关注的正是两类优势信号在尺度和训练时间上的错配。

固定融合为何导致熵坍缩

论文指出,第一个问题是幅度错配。RLVR优势有界,而 token 级OPD优势可能出现远高于它的尖峰,最终淹没RLVR信号。第二个问题是时间错配:如果训练全程保持足量OPD,学生会持续被拉向教师,探索空间受到限制,也更难突破教师质量上限。

这意味着问题不只是融合系数是否合适。一个静态系数很难同时应对局部尖峰与训练阶段变化:系数过大,蒸馏主导更新;系数过小,又可能无法充分利用教师提供的密集反馈。

只校准OPD优势的四阶段方案

SAF采用轻量的四阶段流水线,而且只处理OPD优势。幅度控制部分先稀疏、再压缩,用于削弱异常大的token级优势;时间控制部分先预热、再退火,让蒸馏信号逐步介入,随后降低其持续牵引。四个阶段可以独立开关,论文称额外开销可忽略,但摘要没有给出具体成本数据。

实验以GRPO实现RLVR,在七个数学推理与代码生成基准上评估Qwen3-1.7B、4B和8B。六个模型—领域设置中,SAF相较固定系数的GRPO+OPD融合均取得更高汇总分,提升范围为0.51%至2.70%,同时训练更稳定并避免熵坍缩。

我的判断

SAF的价值在于把“是否融合”推进到“如何校准融合信号”:不改动两种训练范式,而是针对OPD优势的幅度和时序做约束,工程路径清晰,也便于做组件消融。它适合已经同时使用可验证奖励与强教师蒸馏的训练流程。不过,目前材料只覆盖Qwen3三个规模以及数学、代码任务,尚不足以判断其对其他模型、开放式奖励或不同教师质量是否同样有效;各阶段的具体贡献和真实开销也需要结合完整实验进一步确认。