深度研究的难点往往不是找到一个看似合理的答案,而是让答案同时满足多项约束。AREX抓住了其中的不对称性:发现完整答案成本很高,但候选答案是否满足某项约束,通常可以拆成更容易执行的检查。基于这一点,智能体不再只是延长搜索时间,而是边研究、边核验、边修正。

双层循环如何工作

AREX是一组递归自我改进的深度研究智能体。内层研究循环负责收集证据并构造临时答案;外层自我改进循环则按约束审计该答案,识别尚未解决的论断,再启动有针对性的后续研究。

这种设计保留了部分完成状态的价值。已经获得验证的证据不必反复搜索,未满足的约束则成为下一轮研究的明确目标。研究过程由此从一次性生成,转向围绕当前答案持续缩小缺口。它特别适合需要联合满足多个条件、且单项条件能够独立核验的任务。

长周期训练与上下文压缩

递归改进会持续累积交互历史,带来上下文膨胀。AREX为此学习了一个自主的上下文更新工具,把历史压缩为紧凑的改进状态,同时保留已验证证据与未解决约束,而且不依赖外部模型。

训练使用经过验证的合成任务和高质量轨迹,结合智能体中期训练与长周期强化学习。针对最终奖励稀疏的问题,训练会强调两类关键步骤:获得决定性证据,以及纠正错误研究方向。作者实现了一个稠密4B模型和一个122B-A10B混合专家模型。材料还提到BrowseComp、WideSearch和DeepSea,但未给出完整结果与具体分数,因此暂时无法判断性能增益幅度。

我的判断

AREX最有价值的部分不是简单增加搜索轮次,而是把“已证实什么、还缺什么”变成可持续更新的中间状态。这为长周期研究智能体提供了比完整保存历史更明确的控制接口。

它的适用边界也很清楚:任务约束需要能够拆分,并且候选结论应当具备相对可靠的核验方式。若约束本身含糊、证据互相冲突,或核验器容易误判,递归循环可能固化早期错误。由于当前材料缺少完整评测结果,这套方法的实际稳定性、成本与跨任务泛化能力仍需谨慎观察。