基于评分准则的强化学习可以分别检查格式、语义或其他明确要求,但常见训练流程并没有把这些结构化判断保留下来。CoRT 试图解决的正是这一断层:奖励仍在回答级计算,优化时却根据每个 token 对准则上下文的依赖程度,更细致地分配信用。

GRPO 的信用分配缺口

在典型的 GRPO 风格流程中,多项准则最终会被压缩为一个回答级标量奖励,再转换成回答级优势,并统一广播给整段输出的所有 token。这样做实现简单,却无法区分具体贡献来自哪里:满足某项准则的可能只是一个局部文本片段、一次格式选择或某个语义决定,但其他 token 也会获得相同方向和强度的更新信号。

问题不在于回答级奖励本身无效,而在于它缺少回答内部的显式信用分配机制。已有逐词方案通常需要额外训练相关性或打分模型,CoRT 则希望直接利用策略模型自身提供信号。

用反事实重放生成逐词权重

CoRT 对同一条已采样回答进行两次重新评分:一次使用原始的、包含评分准则的提示,另一次使用与之匹配但移除准则的提示。两种条件下逐 token 对数似然的差异,被用作该 token 对准则上下文依赖程度的代理信号。

这些差异随后被映射为有界、回答内归一化的权重,用来重新分配带符号的 GRPO 优势。方法不改变回答级奖励,也不引入辅助 token 打分器或单独的相关性学习阶段。论文摘要称,在不同指令微调模型和奖励粒度的实验中,CoRT 在绝大多数比较里优于匹配的回答级 GRPO,平均增益为 4.4 个百分点,并能与学习式逐词信用基线保持竞争力。

我的判断

CoRT 的价值在于改动边界清晰:保留现有奖励设计,把策略模型对准则上下文的敏感性转化为逐词训练权重,适合已经采用 rubric 和 GRPO、但不愿额外维护打分模型的团队。

不过,对数似然差只是依赖性的代理,并不等同于某个 token 对最终得分的直接因果贡献。材料也没有给出具体任务、基线细节、额外重放开销及失败案例,因此 4.4 个百分点的增益暂不宜外推。若准则对生成概率的影响不明显,或无准则提示难以做到严格匹配,这种信用信号的可靠性仍需进一步验证。