强化学习已成为提升大语言模型复杂推理能力的重要手段,但预训练与 RL 后训练通常被分开研究。Hugging Face Daily Papers 收录的这项工作选择国际象棋作为受控测试场,尝试回答两个基础问题:预训练如何影响后续 RL 的算力回报,以及 RL 究竟改变了模型的什么能力。

从预训练到可验证奖励

研究沿用常见的大模型训练流程:先让参数规模从 500 万到 10 亿的语言模型学习人类棋局,再使用合成推理轨迹进行监督微调,最后在国际象棋谜题上执行 RL,并通过可验证奖励判断结果。

这样做的价值在于减少变量失控。相比规模庞大、来源复杂的通用语料,棋局的数据形式、任务目标与奖励都更明确,也更适合同时扫描预训练和后训练阶段的计算投入。不过,这仍是一个专门设计的推理环境,结论首先适用于该实验框架。

预训练决定 RL 的起点与增速

研究发现,在给定 RL 计算量时,后训练后的表现可以由预训练损失较好地预测。这意味着评估 RL 潜力时,不能只看后训练算法和预算,模型进入 RL 前的学习质量同样关键。

另一个结果是,RL 奖励曲线的斜率会随预训练 token 数增加而近似线性改善。换言之,更充分的预训练不仅可能提供更好的初始策略,也会改变继续投入 RL 算力时的收益速度。

行为分析还显示,RL 并非只是在监督微调策略上做简单锐化:面对容易的谜题,它会放大 SFT 已经偏好的正确走法;面对困难谜题,它还能让 SFT 策略中几乎没有出现的正确走法浮现出来。后者表明,RL 的作用不能完全归结为提高已有答案的置信度。

我的判断

这项工作的主要价值,是把预训练质量、RL 算力回报和策略变化放进同一条实验链路中,并给出可测量的关联。对训练决策而言,预训练损失或许能成为估计后续 RL 收益的实用信号。

但应谨慎外推:国际象棋具有清晰规则和可验证奖励,与开放式数学、代码或自然语言推理仍有明显差异;摘要也不足以判断这种预测关系在不同数据分布和奖励设计下是否稳定。因此,它更像一个机制研究框架,而不是已经适用于所有大模型训练的通用定律。