代码智能体处理多轮任务时,工具输出会不断堆积,长上下文既抬高令牌成本,也让上下文管理变得困难。SWE-Pruner Pro的核心变化,是不再依赖独立代码分类器,而是直接利用智能体已经形成的内部表征,判断哪些代码行值得保留。

从“外挂分类器”到模型内剪枝

现有SWE-Pruner通过额外的代码分类器裁剪上下文。论文作者发现,智能体读取工具输出时,其内部表征本身已包含代码上下文相关性的信号。新方法为智能体增加一个小型预测头,把这些表征转换为逐行的保留或裁剪标签;同时加入与每次工具输出行数对应的长度感知嵌入。这样,剪枝决策发生在智能体内部,目标对象则是多轮交互中持续返回的工具输出。

节省令牌,也没有牺牲任务质量

在两个开放权重骨干模型和四项多轮基准上,该方法最多节省39%的提示与完成令牌,同时保持任务质量,推理开销被描述为有界。具体到MiMo-V2-Flash,SWE-Bench Verified的解决率还提高3.8%,长上下文Oolong准确率提高2.2个百分点。这两个增益说明剪枝未必只是压缩成本,也可能减少无关上下文干扰;但摘要没有给出各项设置的完整结果,不能把最佳值理解为稳定的平均收益。

我的判断

这项工作的价值,在于把“上下文是否相关”的判断复用到代码模型自身,而不是再维护一套独立分类器;对频繁接收长工具输出的代码智能体,这是一条直接的优化路径。它的适用边界也很清楚:方案需要访问模型内部表征,并以行为单位处理工具输出,因此从现有描述看,更适合可改造的开放权重代码智能体。当前材料未披露预测头的训练方式、推理开销上界、不同剪枝率下的质量曲线,也无法判断它对更多骨干模型和真实开发流程是否稳健。39%应被视为“最多”节省,而非默认收益;MiMo上的质量提升值得关注,但还不足以证明剪枝普遍会提高解题能力。