很多智能体能够在推理阶段为当前任务构造工作流,但一次执行结束后,这套流程通常也随之丢弃。FlowEvo关注的正是这部分被浪费的经验:它让工作流和可执行技能在推理时共同演化,把成功流程沉淀为之后可以调用的技能。

从工作流到可复用技能

FlowEvo是一个无需训练的框架。智能体先在任务中构造并执行工作流;如果结果成功,系统就将其编译成可调用技能,存入持久化技能库。后续遇到相关任务时,检索到的技能有两种用法:一是直接执行,二是作为上下文,帮助智能体构造新的工作流。

这套设计把技能库从一个离线组装的静态组件,变成了智能体自身运行经验的积累机制。更重要的是,FlowEvo并不只记录技能是否曾经成功,还会追踪每个技能对下游任务的效用。如果某项技能带来负迁移,系统会对其进行抑制,避免一次局部有效的经验持续干扰其他任务。

多项基准上的结果

论文使用共享的 GPT-4o-mini 骨干模型,与 8 个基线方法比较。在 ALFWorld、HumanEval、MBPP、GSM8K 和 MATH-500 的完整标准划分上,FlowEvo都取得了最高准确率。ALFWorld上的准确率为 85.6%,比最强基线高 26.4 个百分点,同时使用的 token 大约只有后者的三分之一。

跨模型测试覆盖 10 个基础模型,参数规模从 7B 到 671B。在 50 个模型与数据集组合中,FlowEvo 有 49 个超过 ExpeL。论文同时公开了代码,说明这项工作不仅提出了机制,也提供了可复现的实现入口。不过,材料没有进一步说明不同任务中技能库的规模、检索开销或长期运行后的稳定性。

我的判断

FlowEvo的价值在于明确处理了智能体的“经验记忆”问题:记忆不是简单保存对话,而是把成功过程转化为可执行结构,并依据后续效果持续筛选。这种架构尤其适合任务流程具有重复性、成功经验可以迁移的场景。

但它并不意味着智能体已经获得了普适的持续学习能力。技能能否被正确编译、检索和组合,仍取决于任务结构与基础模型能力;负迁移抑制也需要在更长时间、更复杂任务中的表现来验证。现有结果覆盖多个基准,结论较有说服力,但实际部署还应关注技能库膨胀、错误经验累积和额外管理成本。