LLM 智能体经常把大量时间花在等待浏览器、代码执行器或远程服务返回结果上。Speculate with Memory 利用这段空闲:让一个更小、更便宜的模型预测下一步动作或观察,并提前启动可能需要的工作。与以往每次从零猜测不同,新方法会从历史轨迹中持续学习。
三种记忆各自解决一种错误
系统组合了三类在线记忆。对比式转移表统计动作序列的规律,情景记忆检索上下文相似的轨迹片段,混淆追踪器则记录反复出现的错误并抑制它们。论文在六个基准、三种推测任务上评测,报告动作预测的相对准确率提升 19% 至 39%,在动作空间重复的观察预测任务上最高提升到 2.5 倍。
作者把方案称为“无损”,含义不是预测永远正确,而是推测工作发生在原本的等待时间里;最终仍由主智能体决定轨迹,错误推测不会改变其行为。这个边界对生产部署很重要。
对智能体工程的影响
推测器不再只是一次性的轻量模型,而成为可积累局部工作流知识的性能层。客服、网页操作和企业流程中存在大量重复动作,在线记忆有机会把这些规律直接转化为更低延迟。
落地时需要严格隔离推测副作用。只读检索和可取消计算适合提前执行;发送消息、写数据库或付款等不可逆操作不能仅凭预测触发。团队还应记录命中率、被取消工作的资源成本,以及记忆分布漂移后的退化。
我的判断
这项工作把智能体加速从“换更快模型”推进到利用环境空隙和历史重复性。真正决定收益的不是单次基准峰值,而是业务流程是否重复、推测是否可安全取消,以及记忆维护成本能否低于节省的延迟。
一手来源:Speculate with Memory: Lossless Acceleration for LLM Agents