长程任务的难点不只是推理步骤多,还在于状态会持续变化。现有智能体框架通常把任务执行、状态记录和完成判断都留在不断增长的上下文中,既难追踪,也可能让一次错误的自我判断进入后续决策。LongHorizon-Harness 因此把问题重新定义为任务状态管理。

核心机制

框架将任务状态放在执行过程之外,并且只用从环境中独立验证的事实更新。其 Manage-Execute-Audit(MEA)循环分为三个角色:管理器维护当前状态并决定下一个子任务;执行器使用新的上下文完成该子任务;只读审计器检查执行后的环境状态,再进入下一轮。这样,执行结果不会仅凭模型自述写回任务状态。

论文还提供轻量级 AgentAdapter,使模型后端和智能体框架后端可以互换,同时不需要修改它们原有的 agent loop。这意味着该方案更接近可插拔的编排层,而不是绑定某个特定模型的工作流。

基准表现

在 WeaveBench 上,Qwen 3.7 Plus 从 51.8% 提升到 80.7%;在 Terminal-Bench 2.1 上从 69.7% 提升到 77.2%;在 OSWorld 2.0 上从 2.8% 提升到 8.3%。Claude Opus 4.7 在 OSWorld 2.0 的一个子集上也从 20.0% 提升到 34.3%。这些结果覆盖不同模型、框架和交互环境,但 Claude 的数字来自子集,不宜直接与完整基准成绩并列比较。

我的判断

这项工作的价值在于把长程智能体的可靠性问题从“继续扩大上下文”转向“明确管理并验证状态”,工程思路比单纯依赖模型自我反思更稳健。它尤其适合环境状态可读取、任务步骤相互依赖且结果能够独立核验的场景。

边界也很明确:如果环境反馈难以观察、验证标准含糊,或者审计本身成本很高,MEA 循环是否仍然有效尚不清楚。给定摘要也没有提供延迟、Token 与计算开销、消融实验等信息,暂时无法判断收益主要来自状态外置、上下文刷新还是审计环节。OSWorld 2.0 提升后的绝对成绩仍为 8.3%,说明框架改善了执行可靠性,但离解决开放桌面长程任务还有明显距离。