在线策略蒸馏(OPD)的优势,是让教师针对学生自己生成的轨迹提供逐 token 监督;但这也带来一个直接问题:学生一旦在前缀阶段选错推理方向,后续内容都会沿着偏差继续展开。此时教师面对的已是失败前缀,监督可靠性下降,较长的错误续写也会消耗训练资源。Relay-OPD试图在偏差扩大前,让教师临时“接棒”。

从续写分歧中寻找触发信号

论文观察到失败前缀上的教师—学生续写不对称:教师更倾向于改变方向,学生则往往沿原方向继续生成。作者将这种差异转化为无需标签的交接触发机制,用来判断何时应由教师介入。

这项设计针对的不是最终答案是否正确,而是推理轨迹已经出现方向性偏移的时刻。相比让学生把整条错误路径生成完再接受监督,提前识别关键位置有机会减少误导性续写。不过,摘要没有披露触发器的具体计算方式、阈值设置及额外开销,因此其稳定性仍需结合完整实验判断。

教师短暂接管,再把轨迹交还学生

触发后,教师不会完成余下全部推理,而是只生成一段“教师腿”,随后由学生恢复生成;学生再基于这条接力轨迹接受优化。有限的接力预算主要用于较早且关键的位置,一方面纠正方向,另一方面避免训练轨迹过度偏离学生自身策略。

实验采用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B与1.7B-Non-Thinking作为学生,在八个数学推理基准上评估。Relay-OPD在每项基准中均取得最好或第二好的结果。对1.7B学生,其平均成绩比标准OPD高5.73%,比最强基线FastOPD高1.49%;0.6B学生也获得一致提升。与此同时,训练轨迹长度减少超过50%。

我的判断

Relay-OPD的价值在于,它没有简单增加教师监督,而是把教师能力集中到学生最容易把后续轨迹带偏的位置。对长链数学推理蒸馏,这种“短暂纠偏后归还控制权”的方式兼顾了监督质量与学生策略覆盖,结果也显示出较好的模型规模一致性。

边界同样明确:目前证据来自两种规模的Qwen3学生和八个数学推理基准,尚不足以说明它能同样改善代码、开放式问答或其他任务。轨迹长度减半也不能直接等同于整体训练成本减半;触发检测和教师接管本身仍有代价。后续更值得关注的是触发机制的鲁棒性,以及接力预算变化对效果和成本的影响。