智能体能力并不只取决于基础模型。工具调用、上下文组织和多智能体协作所依赖的执行框架,也会决定一次任务如何推进,并产生可能用于未来模型训练的执行轨迹。这篇工作关注一个更具体的问题:不持续改造供应商提供的通用脚手架,而是让用户为特定任务构造的框架自行迭代,能否用较少计算和更新轮次改善智能体表现。
把执行框架变成可迭代的提示词
论文提出 Recursive Harness Self-Improvement(RHI)。它将 harness 表示为对智能体循环的提示词级规范,再利用该框架自身修订历史中的成对反馈,反复生成和筛选新版本。优化对象因此不是模型参数,也不只是某一步提示词,而是控制任务执行流程、上下文传递和智能体协作方式的整体规范。
这一设定对应作者所说的“模型—框架共同演化”:harness 不再只是推理时的外围组件,它产生的执行轨迹还可能影响后续基础模型训练。因此,框架优化既要考虑当前任务表现,也应关注轨迹质量。不过,摘要没有给出这些轨迹被用于训练新模型后的直接验证结果,相关长期收益仍应视为研究动机,而非已经证实的结论。
收益主要来自更好的信息流
实验覆盖 30 个合成机器学习研究任务,涉及量化金融、机器人和药学。结果显示,只需少量 RHI 迭代,低推理强度智能体的性能上限就能显著提高,甚至超过对应的最高推理强度设置,同时推理成本最多降低 60%。
作者进一步指出,提升主要不是来自更长的推理轨迹,而是任务特定的上下文管理得到改善,尤其是智能体之间的信息流更有效。这意味着,增加推理预算并非唯一途径;当协作流程存在信息遗漏、重复或传递不当时,先优化执行框架可能更划算。论文还尝试用信息论假设描述 RHI 的隐式优化目标,但摘要提供的信息不足以判断该形式化解释的验证强度。
我的判断
RHI 的价值在于把“智能体编排”从人工维护的静态配置,推进为可搜索、可反馈的优化对象。它尤其适合任务结构相对稳定、能够比较不同执行结果,并且推理成本敏感的场景。边界也很明确:当前证据来自 30 个合成研究任务,尚不能直接外推到开放环境、长期运行或真实业务;成对反馈的质量、迭代稳定性以及框架是否过拟合特定任务,也未在摘要中充分展开。现阶段更合理的定位,是一种轻量的任务级流程优化方法,而不是通用智能体自我改进已经解决的证明。