长程 LLM 智能体需要在环境中连续决策,交互分支会随步数增加,而奖励往往较为稀疏。论文据此质疑将单轮微调中的强化学习方案直接搬到长程任务:基于反向传播的训练栈较重,难以扩展到更大的模型;轨迹越长,将最终奖励归因到具体动作也越困难。作者因此提出以进化策略为核心的 Agentic ESOpt。

为什么改用进化策略

与 Agentic RL 相比,论文归纳了进化策略的三项优势。首先,它能以接近推理阶段的 GPU 显存需求执行全参数优化,使较大 LLM 的微调更可行。其次,ES 只依赖黑盒奖励反馈,因而更容易与提示词空间中的演化组合,包括技能优化和测试时计算。最后,它直接在完整轨迹层面对参数扰动进行归因,不必把奖励拆解到每一个时间步。作者认为,随着任务跨度增长,这种方式比 Agentic RL 更容易扩展。

ESOpt 如何更新模型

Agentic ESOpt 在当前 LLM 参数附近采样多组扰动,让扰动后的智能体分别执行任务,再依据获得的奖励进行在线、奖励加权的参数更新。其重点不是训练一个逐步估计回报的策略优化系统,而是把智能体整段行为作为评价对象。框架同时面向“参数—上下文共同演化”:模型参数可以更新,提示、技能或测试时计算策略也可以通过轻量的黑盒接口参与优化。不过,给定摘要在探索与适应如何进一步平衡处被截断,无法确认其具体机制。

我的判断

这项工作的主要价值,是把长程智能体微调重新表述为轨迹级黑盒优化问题,从方法上绕开反向传播显存和逐步信用分配两类障碍。它尤其适合奖励只能在任务结束后给出、但又能稳定比较整条轨迹质量的场景。边界也很明确:摘要没有提供任务范围、对照实验、实际 GPU 配置或训练效率数据,因此“推理级显存”和“随跨度增长更可扩展”目前只能视为论文主张,不能据此判断总体计算成本或普遍效果。是否优于强化学习,仍要结合完整实验验证。