长程智能体面对的瓶颈不只在模型本身。任务持续时间变长后,外部信息处理、计算环境、状态恢复和结果验证都会影响最终表现。Prime Agent 的定位是一套开源智能体脚手架:它不替模型规定具体策略,而是提供较稳定的执行边界,让评测结果尽量接近模型可发挥的能力上限。

持久化环境承接长程计算

Prime Agent 提供持久化 IPython REPL,并按照递归语言模型(RLM)的思路,让模型通过程序处理上下文、调用外部计算,并在测试阶段投入更多计算资源。其 Continual Harness 会跨轨迹保留历史、记忆、技能、提示词与子智能体配置,减少任务中断后重新建立上下文的成本。

系统还统一处理执行、故障恢复、结果验证和资源核算。这一点对评测尤其重要:脚手架崩溃、状态丢失或验证流程不一致,都可能被误判为模型能力不足。Prime Agent 试图把这些工程变量收束起来,但策略如何构建仍交给模型决定。

递归子智能体与评测表现

Prime Agent 支持递归创建子智能体,并允许智能体之间直接通信。面向人类操作者的 Agents View 则用于检查和管理由守护进程支撑的会话。这套设计既服务于长程评测,也覆盖代码智能体工作流。

摘要报告称,Prime Agent 将 ARC-AGI-3 RHAE 的 Best@1 从 30% 提升到 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建和自主 nanoGPT 加速任务中达到或超过原生及常用脚手架。在 Factorio 实验中,持续细化支持技术进程不断推进,专用子智能体则可并行开展工作。不过,摘要没有给出各项对比的完整设置、资源预算与逐任务结果,跨脚手架优势仍需结合正文判断。

我的判断

Prime Agent 的主要价值不是提出新的智能体策略,而是把状态持久化、递归协作、恢复、验证和资源统计整合成统一基础设施。它适合需要长时间运行、频繁使用外部计算或组织多个子任务的研究与代码工作流,也有助于区分模型失败和运行环境失败。

但脚手架提高的是模型能力的可发挥程度,不等于模型获得了新的推理能力。ARC-AGI-3 上的大幅提升说明执行环境可能显著影响成绩,也意味着基准结果对脚手架选择较敏感。当前材料不足以判断这种收益能否稳定迁移到更多真实任务,尤其需要关注计算成本、公平预算和失败恢复机制带来的额外优势。