2026 年 8 月 14 日的 Hugging Face Daily Papers 收录了 SimpleOPD。它关注一个具体但棘手的场景:把长上下文教师模型 SU-01 的证明推理能力,迁移给上下文更短、分词器甚至不同的学生模型。作者没有要求师生共享词表,而是从训练目标和生成长度两端处理分布差异。
在共享文本空间对齐
不同分词器会把同一段文字切成不同 token,因而无法直接逐 token 对齐教师与学生的输出概率。SimpleOPD 将蒸馏放到共享文本空间中,只对师生分词后占据相同文本跨度的 token 进行对齐。这个设计绕开了强制统一 tokenizer 的要求,使同家族与跨家族模型都能进入同一套在策略蒸馏流程。
这种方法并未消除所有分词差异,而是选择只利用能够可靠对应的部分。其价值在于工程上更简单,也降低了错误对齐干扰训练的风险;相应地,那些无法形成相同文本跨度的 token 不会得到同等程度的教师监督。
控制长度爆炸与策略漂移
长上下文教师容易生成很长的推理过程,短上下文学生则可能频繁截断,并在训练中继续偏离初始策略。作者加入学生参考策略 KL 损失,限制学生相对初始策略的过度漂移;同时屏蔽 </think>、<|im_end|> 等特殊终止 token 的优势项,以促使响应长度更平稳地增长,而不是迅速失控。
实验覆盖 Qwen3、Qwen3.5、Intern-S2、GLM-4.7 和 Gemma-4,包括同家族与不同家族学生。数学推理,尤其自然语言数学证明,均获得一致提升。Intern-S2-Preview 在 ProofBench 上提高 21.2 分,达到 55.2,并超过 Gemini-2.5-Pro;HLE 和 HiPhO 科学基准也有提升。
我的判断
SimpleOPD 的亮点不是提出更复杂的蒸馏框架,而是抓住跨分词器对齐、终止行为和长度增长三个实际故障点,给出可组合的处理方式。它尤其适合教师上下文更长、学生架构异构的推理迁移任务。不过,现有材料未提供训练成本、不同对齐比例、稳定性方差及消融细节,因此还不能判断各组件分别贡献多少,也不能据此推断它对证明与科学推理之外的任务同样有效。