记住过去发生了什么,与记住“未来遇到某个时机要做什么”是两种不同能力。PM-Bench 聚焦前瞻记忆:智能体一边执行持续任务,一边保留延迟意图,并在时间、事件或环境状态满足条件时主动兑现。
一周模拟揭示延迟意图缺口
基准借鉴认知科学的 Virtual Week 范式,构造一个文本化的七天模拟环境。智能体不能只在对话末尾回答问题,而要持续判断是否有待办已经到期,同时监测不直接显示的环境变化。
研究比较八个前沿模型和八种智能体配置。论文报告最佳方案——基于 GPT-5.4 的智能体——F1 也只有 65.1%,而且没有一种记忆增强策略能在所有模型上稳定占优。这说明把提醒写进长上下文、外部记忆或提示模板,并不存在通用捷径。
对产品开发者的影响
日程助手、运维智能体和客户跟进系统不能把未来承诺只保存在自然语言历史里。更可靠的设计应把意图结构化为触发条件、目标动作、有效期和完成状态,由确定性调度器或事件系统负责唤醒,再让模型处理语义判断。
测试也应覆盖遗漏、提前执行、重复执行和错误触发,而不只是最终是否“想起来”。特别是依赖隐含状态的任务,需要记录智能体何时检查条件,以及检查时使用了什么证据。
我的判断
PM-Bench 把一个容易被“长上下文”掩盖的问题单独测了出来。当前模型可以理解提醒,却未必能可靠管理提醒的生命周期。面向真实责任的智能体,前瞻记忆应由模型与传统工作流引擎共同承担。