大语言模型智能体处理多轮交互任务时,往往要到整条轨迹结束后才能获得一次结果级奖励。这样的稀疏信号难以指出具体哪些 token 或步骤值得强化。在线策略自蒸馏可以引入特权教师,提供更密集的 token 级监督,但前提并不是教师在每个位置都同样可靠。PCSD 试图解决的正是如何有选择地使用教师信号。

从单点差异转向持续一致性

已有做法通常依据孤立位置上的差异决定蒸馏强度,容易受到局部噪声影响;另一类方法为整个步骤分配统一权重,又可能忽略不同位置的变化。PCSD 不把某一位置上的教师优势视为充分证据,而是考察“教师更优”的相对信号能否在局部范围内持续存在。

具体而言,它通过自适应窗口收集邻近信号,并使用指数衰减聚合,让距离较近的位置贡献更大。方法还加入趋势感知调制:如果教师支持度在局部呈下降趋势,就削弱相应权重。最终,连续的蒸馏权重由 sigmoid 门控产生,而不是简单地对 token 做二元保留或丢弃。

与 GRPO 共同利用两类反馈

PCSD 的蒸馏目标与 GRPO 联合优化:教师提供密集指导,环境继续提供稀疏但直接对应任务结果的反馈。论文报告称,在不使用推理阶段技能的条件下,PCSD 在两个骨干模型上都取得了所有对比基线中最好的 ALFWorld Overall 结果,分别超过 GRPO 15.6 和 13.3 个点,超过 SDAR 6.2 和 5.5 个点。在未见过的 ALFWorld 划分上,它比 GRPO 高 15.8 个点;在 WebShop 上则保持有竞争力。

我的判断

PCSD 的价值不在于引入更强教师,而在于承认教师监督具有位置相关的不确定性,并用局部持续性过滤偶发信号。这一思路适合奖励稀疏、轨迹较长且能够获得特权教师输出的智能体训练。不过,现有材料只给出了 ALFWorld 与 WebShop 的结果,且未提供教师成本、训练开销及对窗口和衰减设置的敏感性,因此还不能判断收益能否稳定迁移到更多交互环境。它更像是一种有针对性的蒸馏加权机制,而不是对稀疏奖励问题的通用解决方案。