长程智能体需要处理多轮交互、工具调用和环境反馈,但基于最终结果的强化学习通常只在整条轨迹结束后给出奖励。对模型而言,这类信号能说明任务是否完成,却难以指出中间哪些观察、动作或决策真正关键。SEED试图填补从轨迹级结果到逐词策略学习之间的监督空白。

从完整轨迹中提炼事后技能

SEED的核心不是引入一个固定的外部教师,而是让策略模型学习分析已经完成的轨迹,并生成自然语言形式的“技能”。这些技能可以描述可复用的工作流程、决定性的环境观察,或需要规避的失败模式。它们属于事后信息:模型先经历一次完整交互,再回头总结哪些规则可能帮助此前的决策。

框架首先对策略进行微调,使其具备轨迹分析和技能生成能力。进入强化学习阶段后,当前策略既负责采样新轨迹,也充当分析器,从自己的交互记录中抽取技能。随着策略更新,后续决策能力和轨迹分析能力可以一同变化,因此监督内容并非来自静态知识库,而是跟随当前策略分布演化。

把自然语言技能转成逐词信号

仅生成技能还不足以直接训练策略。SEED会分别在普通上下文和加入技能的上下文中,对已采样动作重新评分,再将技能导致的动作概率变化转换为密集的、逐词级别的同策略蒸馏信号。该信号与基于最终结果的强化学习目标联合优化。

这一设计的重点在于:辅助监督来自当前策略实际产生的轨迹,理论上比离线、固定教师提供的经验更贴近模型正在访问的状态和动作分布。自然语言技能在这里更像一种训练期脚手架,其行为影响最终通过概率差异回流到策略,而不只是作为提示词供推理时读取。

我的判断

SEED提供了一条有吸引力的中间路线:保留结果奖励易于获取的优势,同时利用轨迹复盘补充细粒度指导。它可能更适合存在长决策链、可记录完整交互且失败模式能够被语言概括的智能体任务。

边界也很明确。技能由当前策略自己提炼,其质量受模型分析能力限制;如果轨迹中的关键因果关系难以识别,概率变化未必代表可靠指导。材料只提到论文进行了文本和视觉任务实验,没有给出具体结果、对照方法或成本数据,因此目前无法判断收益幅度、训练开销以及跨环境泛化能力。