长程、多轮智能体训练的难点,不只是判断一条轨迹最终成功还是失败,更是识别哪些中间决策真正改变了结果。传统可验证奖励能提供轨迹级优势估计,却容易把功劳或责任平均分配给大量回合。AgentOPSD 试图在不引入额外评论器和额外 rollout 的条件下,把这种稀疏监督细化到回合级。
从概率差构造回合证据
AgentOPSD 建立在特权自蒸馏之上。它先计算教师与学生在 token 级别的对数概率差,再将这些差异聚合成回合级证据。相比直接使用细碎的 token 信号,这一步让监督粒度与智能体的交互结构对齐:一个回合中的观察、推理与动作被视为共同影响后续结果的决策单元。
关键之处不只是聚合。方法在对数几率空间中维护贝叶斯信念状态,并根据当前回合证据递归更新。相邻状态之间产生的边际信念修正,被用来衡量该回合对最终结果判断造成了多大变化。由此,历史上下文会参与当前信用分配,而不是把每个回合当作彼此独立的样本。得到的权重可以接入标准策略优化流程。
三类任务上的结果
论文在 ALFWorld、WebShop 和 Search-QA 上评测了 Qwen2.5 的 3B 与 7B 模型。AgentOPSD 的结果优于 GRPO 和多种较强的自蒸馏基线;其中,Qwen2.5-7B 在 ALFWorld 上达到 89.1% 成功率。消融实验将收益归因于两个设计:把 token 差异聚合到回合,以及使用依赖历史的递归信念更新。
我的判断
这项工作的价值在于,它把“关键回合”写成了可计算的信念修正,而不是依赖额外价值模型估计,因而适合已有可验证结果奖励、但交互链条较长的智能体训练。边界也很明确:现有证据来自三类任务和两个 Qwen2.5 规模,摘要没有提供更广模型、训练成本或各任务完整数据;方法还建立在教师—学生概率差能够形成有效证据的前提上。89.1% 是有吸引力的单项结果,但是否能稳定迁移到更开放、更长程的环境,仍需进一步验证。