在可验证奖励强化学习(RLVR)中,模型能够通过结果是否正确获得反馈,从而提升推理能力。但训练也可能带来一个副作用:策略熵下降,模型越来越倾向于少数高置信度的推理路径,推理覆盖范围随之收窄。当评测关注较大的 pass@$k$ 时,这种变化尤其值得注意,因为模型需要在多次采样中覆盖更多可能路径,而不只是找到一条可行答案。
把探索交给外部前缀
题为《Boosting LLM Exploration via Weak-Model Guidance in RLVR》的论文提出了一种非参数的跨模型扰动方法。训练时,不让目标模型完全依赖自身已有的探索能力,而是先使用更小、更弱的语言模型生成部分推理轨迹,再要求目标模型基于这些不熟悉的前缀继续生成答案。
这些外部前缀的作用不是直接提供正确答案,而是打断目标模型原本过于自信的生成惯性。由于前缀来自不同模型,其分布与目标模型存在差异,目标模型需要在新的上下文下继续推理,从而被引导到不同的推理路径。论文围绕外部前缀展开了实证研究,重点分析分布差异如何影响RLVR训练中的探索动态。
主要观察
论文在多个数学基准上进行实验,结果显示,该方法持续优于标准RLVR。一个重要现象是,随着 $k$ 增大,性能收益变得更加明显。这意味着改进的重点并不只是提升单次采样的结果,也在于扩大模型能够覆盖的推理路径集合。
从训练特性看,方法能够有效缓解熵坍塌,同时不需要额外的监督微调(SFT)、更复杂的奖励设计或复杂提示词。它把探索问题部分转化为数据来源和上下文前缀问题,工程实现相对直接,也保留了目标模型原有的奖励机制。
我的判断
这项工作的价值在于提醒我们,RLVR中的探索不一定只能通过算法正则化或模型内部随机性来解决。引入弱模型生成的外部前缀,是一种成本和改造范围都较可控的思路,尤其适合关注大规模采样表现和推理覆盖的场景。
但材料目前只说明了数学基准上的结果,尚不足以判断它对其他任务、模型规模或训练配置的普适性。弱模型前缀的质量、分布差异的合适范围,以及额外生成前缀带来的训练成本,也都需要进一步评估。因此,更稳妥的结论是:它为缓解RLVR熵坍塌提供了一个值得验证的外部探索机制,而不是已经得到充分证明的通用方案。