多步骤推理让基于大语言模型的智能体能够处理复杂任务,但执行失败仍然是影响可靠性的关键问题。失败发生后,系统需要判断究竟是哪个智能体、哪个步骤出了问题。论文提出的 DUOTRACE 将这一过程拆成两个阶段:先检测异常执行,再进行失败归因。其核心判断是,归因模型不必一开始就处理完整且冗长的轨迹,而应先获得经过筛选的证据。
现有方法的两类问题
现有失败归因方法大致有两条路线。一类利用轨迹的拓扑结构和频谱特征,能够从执行路径中提取结构信息,但往往忽略节点和步骤之间的细粒度语义。另一类直接使用大语言模型进行归因,能够理解语义线索,却容易受到长上下文退化影响,轨迹越长,关键信息越可能被稀释。
DUOTRACE采用“先检测、后归因”的流程。它先识别异常执行,再把聚焦后的轨迹证据交给下游的大语言模型归因方法。论文将其设计为可插拔的检测过滤器,因此重点不在于替换已有归因器,而在于改善归因器接收的输入。
检测器如何处理轨迹
为了对智能体轨迹进行基于变分自编码器的异常检测,DUOTRACE结合了双视角语义—结构节点表示、基于 Tree-LSTM 的轨迹编码器,以及前缀链和大语言模型驱动的数据增强方法。这样的组合分别对应轨迹中的几个特点:节点类型存在异构性,执行过程具有层级结构,而真实失败数据又相对有限。
实验覆盖六个基于大语言模型的失败归因基线。加入 DUOTRACE 后,智能体级归因准确率提升 8.7%,步骤级归因准确率提升 7.0%。从结果看,检测阶段提供的轨迹筛选确实能够帮助后续归因,但论文材料没有说明不同基线、数据集或失败类型下的具体表现,因此不宜将提升幅度外推到所有场景。
我的判断
DUOTRACE的价值在于重新安排失败分析的工作流:先缩小异常范围,再让模型解释原因。这一思路适合轨迹较长、节点结构复杂且失败样本有限的多智能体系统,也保留了既有大语言模型归因方法的可替换性。它的边界同样清楚:检测器本身若漏掉异常,后续归因获得的证据就可能不完整;而且当前材料只给出了总体提升,尚不足以判断方法在不同任务、拓扑或故障分布下是否稳定。对工程实践而言,它更像归因链路前端的质量过滤层,而不是独立解决失败诊断问题的完整方案。