长程智能体的瓶颈不一定是模型不会做,而可能是执行过程中遗失可变状态、忘记此前经验、跳过已知流程,或过早终止。StateM选择不调整模型权重,而是扩展模型外部的运行时,以更稳定地组织任务执行。

从模型扩展转向运行时扩展

StateM将执行过程组织为持久状态、阶段局部上下文、受检查的状态转换、可恢复运行手册,以及带版本的操作实践。其核心思路是把原本散落在上下文中的进度、规则和经验变成可检查、可恢复的运行资产,并允许智能体与用户共同查看。这样做针对的不是单步推理能力,而是长任务中的流程一致性和错误恢复。

运行手册也被设计为可迁移组件。材料显示,为GPT-5.5构建的手册无需修改即可迁移至GPT-5.6;同一运行时、手册结构和通用规则也能用于DeepSeek-V4 Flash,但仍需要少量适配。

Terminal-Bench上的提升与成本

在Terminal-Bench 2.1上,StateM将GPT-5.5 xhigh提高到92.1%,高于83.1%的参考结果,也略高于GPT-5.6 Sol Ultra的91.9%。配合GPT-5.6 Sol xhigh时,它在445次试验中达到95.3%原始准确率,并让全部89项任务都至少成功一次。不过,至少成功一次不等于单次运行全部可靠,仍需结合重复试验理解。

冻结配置还将GPT-5.6 Luna从76.7%提高到85.4%,超过84.9%的Sol xhigh参考结果。DeepSeek-V4 Flash则从82.7%升至标准超时下的88.1%,在88项共同任务上达到89.1%;仅延长剩余延迟敏感任务的时限后,结果追平报告中的88.8% GPT-5.6 Sol max。最终计分阶段的API使用成本约为15美元,GPT参考为574.68美元;DeepSeek总支出为52.22美元。BusinessBench上,按模型家族构建的运行手册在留出集取得0.55个宏平均点和1.34个微平均点的增益。

我的判断

StateM的价值在于证明,智能体性能优化不应只盯着模型和提示词,执行状态、流程检查与恢复机制同样可能带来显著收益。它尤其适合步骤多、状态持续变化、失败后可以重试的终端任务。但这些数字主要来自特定基准,部分结果依赖多次试验或放宽单项任务时限,不能直接等同于真实环境中的一次成功率。运行手册能否跨任务域长期维护,以及其人工适配成本,也仍需要更多材料验证。