现有在线策略自蒸馏虽然强调“自我”,训练时通常仍需要标准答案、环境反馈或更大模型指导。这项工作提出 U-OPSD,尝试把这些外部信号全部移除,只依靠当前模型生成的多条回答及其内部一致性完成后训练。
从多数投票生成监督信号
U-OPSD首先对同一问题采样多条 rollout,并在满足自一致性阈值时,通过多数投票构造伪解。随后,它选择最短的伪解作为条件,形成教师分布,再把这一分布蒸馏到模型最长错误回答的各个前缀中。这里的“错误”是相对于伪解判断,而不是由真实答案标注。
这一设计的重点不是让模型模仿一条完整优质答案,而是定位其较长错误推理中“自信但错误”的位置,并从对应前缀开始纠正。教师信号和待修正轨迹都来自模型自身的在线采样,因此更接近严格意义上的自蒸馏。
数学基准上的结果
论文在 AIME24、AIME25、HMMT25、MATH500 和 AMC23 上测试了不同模型规模与推理模式。Qwen3非思考模式下,U-OPSD相对4B和8B基础模型分别提升8.5%和10.7%,相对有真实答案监督的OPSD平均高出3.2%和2.3%。
在思考模式下,U-OPSD与OPSD基本持平:4B高出0.9%,8B持平;相对GRPO则分别高出0.7%和1.1%。至少在摘要报告的这些数学任务上,无监督构造的内部信号没有明显弱于真实答案监督。
我的判断
这项工作的价值在于把自一致性从推理阶段的答案筛选工具,推进为可直接用于后训练的监督来源,并给出了一种针对错误前缀的细粒度蒸馏方式。它适合能够重复采样、答案具有较强一致性判定基础的任务。
边界也很明确:多数投票不保证多数答案正确,模型可能稳定地产生同一种错误;自一致性阈值、采样成本和伪解质量的关系,摘要没有提供足够细节。当前结果集中在数学基准,也不足以说明方法能同样适用于开放式生成或难以自动判定一致性的任务。