强化学习能够提升语言模型和视觉语言模型的推理能力,但现有强效果往往依赖可验证奖励等真实标注。随着任务超出人类稳定评估的范围,这类监督既昂贵又稀缺。Co-RL 尝试绕开这一瓶颈:不让单个模型反复相信自己,而是让一组模型在训练中彼此提供奖励信号。
从自我奖励转向同伴奖励
传统自奖励强化学习从模型自己的回答中生成反馈,减少了外部标注需求,却可能放大已有偏差和次优行为。相似回答持续互相确认后,输出多样性会下降,最终可能走向响应同质化乃至训练坍塌。
Co-RL 的核心变化是引入多个彼此解耦、完全不共享参数的模型,并同时通过强化学习进行优化。每个模型使用来自同伴的奖励,而不是只依赖自身生成的判断。论文据此提出,推理能力可以在没有真实标签监督的合作式多智能体训练中涌现。
多样性是机制重点
论文强调,模型数量并非唯一关键,群体内部是否足够多样更重要。Co-RL 通过混合不同模型家族、不同参数规模,以及对训练样本进行改写,减少多个模型同时犯下相同错误的概率。其目标是切断“错误判断被同类反馈反复强化”的循环。
摘要给出的结果是:增加群体多样性能够持续改善推理表现、保留行为差异,并缓解训练坍塌。在纯文本与多模态任务中,Co-RL 均优于基础模型和此前的无标签方法,同时达到或超过监督方法,而不依赖真实标注。
我的判断
Co-RL 的价值不只是把自奖励换成多模型投票,而是把“反馈误差是否相关”明确设为训练设计问题。对于真实标签难以获取、又能部署多个异构模型的推理任务,这一思路具有现实吸引力,也为无监督扩展提供了较清晰的方向。
但现有材料没有给出具体基准、模型配置、训练成本和提升幅度,因此还不能判断收益能否覆盖多模型并行训练的额外开销,也无法确认其对更强模型和长期训练是否稳定。它更适合作为一种值得验证的训练框架,而非已经证明可以普遍替代监督奖励的方案。