面向工作、学习和生活的开放式请求,智能体往往要连续执行大量步骤,在不同环境、工具与附件之间切换,同时处理多模态信息。真正困难的并非单次回答,而是在长执行链中持续保存目标、约束与状态。OneDayAgent关注的正是这一层:不改造某个特定模型,而是用统一 harness 管理完整执行过程。
把长期任务变成受控流程
既有研究通常分别处理目标漂移、状态丢失或上下文溢出,OneDayAgent则试图把这些问题放进同一套执行框架。它首先将开放式请求拆解为边界明确的子任务,避免任务范围在多轮操作中不断扩张;随后在上下文压力下维护执行记忆,让关键目标、约束和中间状态能够跨步骤保留。
这套流程还覆盖最终交付阶段:系统会验证产出,并在发现问题后进行修复。其重点不是让模型一次生成正确答案,而是把规划、执行、记忆、检查和修复组织成一个可管理的闭环。对于需要跨工具、跨环境和处理附件的任务,这种流程层控制比单纯增加提示词更系统。
104项任务与跨后端表现
论文在AgentIF-OneDay基准的104项任务上评估该框架。以GLM-5.2为后端时,OneDayAgent取得0.821的总体得分,论文称其刷新了该基准的最佳结果。
同一套 harness 还运行在来自三个模型家族的五个后端大语言模型上,并且没有针对不同后端单独调优。结果显示,统一工作流能够跨后端发挥作用;与此同时,不同模型在相同流程下仍会形成不同的执行风格。这说明 harness 可以约束执行结构,但不会抹平底层模型本身的行为差异。
我的判断
OneDayAgent的价值,在于把长任务可靠性从零散补丁提升为流程工程问题,尤其适合开放式、跨环境、多步骤且需要最终交付物的智能体场景。跨五个后端运行也为框架复用提供了初步证据。
不过,现有材料没有给出各后端的具体分数、成本与延迟,也缺少不同模块的独立贡献,因此还不能判断收益主要来自拆解、记忆还是验证修复。0.821也只是特定基准上的结果,不能直接外推到所有真实任务。它更像一套值得验证的长任务执行骨架,而非已经解决智能体长期自主性的通用方案。