长程搜索智能体需要连续完成检索、验证与证据整合,但最终答案通常只能提供稀疏的成败信号。ABSeeker 的核心变化,是不再把同一条轨迹中的所有步骤视为同等有效,而是尝试判断每一步究竟提供了线索、走错了方向,还是仅仅重复已有信息。

从答案反推搜索过程

论文提出 Answer-Backtracked Credit Assignment(ABC)。面对问题及其标准答案,系统先执行“答案回溯式线索恢复”,从答案反向找出解决问题所需的中间线索;随后以这些线索为锚点,对轨迹中的每个搜索步骤进行评分。

这样,原本只有“最终答对或答错”的二元监督,被转换为更密集的步骤级奖励。其意义在于,一条最终失败的轨迹也可能包含有用检索动作,ABC 可以保留这些正向信号;相反,即使轨迹最终成功,其中的错误尝试和冗余步骤也不必被一并奖励。

同时用于 SFT 与强化学习

基于步骤评分,作者设计了两种训练方式。ABC-SFT 按每轮得分重新加权损失,让更有价值的步骤在监督微调中占据更大权重;ABC-GRPO 则直接把步骤级评分作为 GRPO 的奖励,将信用分配从整条轨迹下沉到具体动作。

作者以 Qwen3.5-4B 为基础,仅使用 8.5k 个样本训练 ABSeeker。摘要报告其在 BrowseComp 上取得 37.3%,在 BrowseComp-ZH 上取得 39.1%。不过,给定材料没有提供完整基线、消融实验或统计信息,因此这些结果更适合作为方法可行性的信号,暂不能据此判断相对优势有多大。

我的判断

ABC 抓住了长程智能体训练中的真实痛点:最终答案过于粗粒度,容易把偶然成功、无效绕路和关键动作混在一起。它尤其适合有标准答案、搜索链较长且中间证据可追溯的任务。

边界也很明确:方法依赖答案与回溯线索的质量。如果线索恢复不完整或存在偏差,步骤评分可能把错误继续传给 SFT 和强化学习;对开放式、答案不唯一或难以验证的问题,适用性仍需谨慎评估。现有摘要也不足以说明该方法在更大模型、更多搜索环境以及实际推理成本上的表现。