评测大语言模型智能体正在成为一项昂贵的基础工作。论文称,前沿模型在智能体基准上完成一次完整评测,单次成本可能达到数百至数千美元,而且在迭代开发中需要反复支付。EarlyEval提出一个直接的降本思路:不只减少评测任务数量,也在单个任务执行过程中尽早判断结果,并在结论已经足够明确时提前停止运行。

从压缩任务到提前终止

此前的评测降本工作主要集中在基准测试蒸馏,即减少需要执行的任务数量,但保留下来的每个任务仍需完整运行。EarlyEval关注的是另一条效率轴:如果智能体的最终成败在中间行为中已经显现,就没有必要继续执行到流程结束。

论文将这一想法实现为一个轻量框架。系统训练成功和失败两个LightGBM分类器,输入包括智能体行为、文本信息以及参考解决方案特征。当任一分类器达到经过校准的置信度阈值时,EarlyEval便终止当前运行。论文强调,这种判断带来的单步额外开销很低,因此可以嵌入现有评测流程。

节省多少,代价是什么

在SWE-bench Verified、TerminalBench和Toolathlon三个基准上,EarlyEval可减少13%至26%的智能体执行步数,最多减少44.1%的输入令牌和29.4%的输出令牌。对应的预测准确率为89%至97%,而每个智能体的解决率平均只发生一到两个百分点的变化。

这些结果说明,节省并不只来自少调用几步工具。提前结束还会同步减少后续上下文输入和模型输出,尤其适合需要较长轨迹、并且会在开发周期中频繁重复运行的评测任务。不过,论文给出的收益是跨三个基准的结果,具体节省幅度仍取决于任务类型、模型行为和分类器阈值设置。

我的判断

EarlyEval的价值在于补充了基准蒸馏之外的降本方向:评测系统不必把“完整执行”默认当作唯一有效流程,而可以利用轨迹中的早期信号做动态终止。对代码智能体和工具调用型智能体而言,这一思路有现实吸引力,因为它直接作用于执行步数和上下文消耗。

但它并没有消除评测误判的风险。提前停止可能改变最终解决率,论文只报告了平均一到两个百分点的扰动,实际使用仍需要针对任务和模型校准阈值。对于结果只有在后续步骤才会反转、或中间行为信号不稳定的任务,收益和可靠性也不能仅凭这三个基准外推。更稳妥的定位,是把EarlyEval作为完整评测的成本优化层,而不是完全替代完整运行。