语言模型推理后训练常用组内相对优势,但进入多奖励场景后,一个看似自然的处理——先按固定权重合并奖励,再做组内标准化——可能让优化方向偏离真正的短板。SA-MRPO试图解决的不是奖励数量问题,而是训练预算是否仍被已经学会的目标持续占用。

固定加权为何不够

现有方法通常先将多个奖励目标压缩成一个加权和,再计算组内优势。论文指出,这会产生两个根本问题。第一,奖励构成明显不同的 rollout,可能在标量化后得到相同优势,模型因而看不到二者在具体目标上的差异。第二,各目标始终保持固定相对权重,不会随着训练进度调整。即使某个目标已经接近饱和,它仍会持续获得梯度预算;真正更难、剩余提升空间更大的目标,反而无法得到更多关注。

这不只是效率问题。多目标奖励之间可能对应正确性、行为约束等不同信号,把它们过早合并,会丢失奖励向量内部的结构,也使统一标准化掩盖各项目标当前的学习状态。

按饱和度重新分配优势

SA-MRPO的做法分为两步:先对每个奖励目标分别标准化,再根据批次级的目标饱和度估计,自适应降低已饱和目标对最终优势的贡献。这样,优化力度会动态转向尚未充分优化的目标,同时实验上仍能维持已经较好满足的目标表现。

值得注意的是,这种重加权不只是改变更新幅度。论文显示,当不同目标给出相互竞争的信号时,饱和度感知权重甚至可能反转一次更新的符号,直接改变策略梯度方向。这说明它更接近动态的目标选择机制,而非普通的学习率缩放。

在采用两项和三项奖励组合的数学推理实验中,SA-MRPO相较GDPO,在15组基准对比中的12组提升了更困难的正确性目标;AIME24上的最高增益为5%。这些结果支持了“少优化已掌握目标、多学习剩余短板”的核心判断。

我的判断

这项工作的价值在于抓住了多奖励训练中容易被忽视的预算分配问题,并给出与组相对优势框架兼容的改法。它尤其适合目标难度差异明显、且部分目标会较早饱和的推理后训练。

但现有材料主要报告数学推理及两到三项目标组合,尚不足以说明其在更多奖励、更强冲突或非推理任务中的稳定性。方法也依赖批次级饱和度估计;当批次分布波动较大时,估计是否可靠仍需进一步验证。因此,它更像一个有明确实证支持的优化方向,而不是已经普遍成立的多目标训练方案。