长程游戏要求智能体连续做出多步决策,但基于可验证奖励的强化学习通常只能在任务结束时获得成败信号。最终奖励虽然明确,却很难说明中间哪一步真正推动了成功。CAST 的核心目标,就是利用现成游戏求解器,把这种稀疏反馈细化到每个回合。

从状态价值变化分配信用

CAST 全称为 Credit Assignment from Solver Teachers。它观察求解器对行动前后状态的价值判断:如果执行某个动作后,状态价值向成功方向变化,这一变化就能反映该动作是否有效。方法进一步将价值差转化为求解器优势,并注入 RLVR,作为逐回合训练信号。

这条路径避开了只依赖最终结果进行信用分配的问题,也不要求教师模型输出完整动作分布。论文指出,在“求解器为软最优”的假设下,最大化求解器优势等价于对求解器进行在线策略蒸馏;训练只需要标量状态价值,而不是教师 logits。这里的关键并非替代最终可验证奖励,而是为其补充过程层面的方向判断。

游戏内训练与跨任务结果

实验覆盖 Sokoban、Minesweeper 和 Rush Hour。摘要报告称,在域内评估和未见难度评估中,CAST 在每款游戏上都超过了所有接受训练的对比基线。作者还将方法用于 ALFWorld 与 WebShop,并取得最高的平均零样本表现。这说明来自游戏求解器的逐步信用信号,可能不只适用于单一谜题环境,也能帮助需要多步交互的智能体学习。作者已公开代码,便于复现实验。

我的判断

CAST 的价值在于找到了一种相对直接的过程监督来源:不必索取教师的完整策略输出,只利用求解器状态价值的变化,就能判断单步行动是否让局面变好。它尤其适合拥有可靠求解器、状态价值可查询且成功标准清晰的环境。

边界也很明确。方法依赖求解器质量,并且理论等价关系建立在软最优求解器假设上;当求解器偏差较大,或真实任务缺少可用的状态价值估计时,信号是否仍然可靠,摘要没有给出答案。现有结果值得关注,但对开放式智能体任务的普适性仍需更广泛验证。