给基准问题前面加一段与任务无关的文字,模型整体准确率可能几乎不变,于是看起来足够鲁棒。但一项新研究发现,平均值会掩盖样本级翻转:一部分原本答对的问题变错,另一部分原本答错的问题变对,两者在汇总指标里相互抵消。

没有语义的字符也能改变答案

研究在受控实验中加入不同类型和长度的无关上下文。即使是随机组合字符形成、没有实际语义的伪词,也能显著改变少量样本的预测。现象出现在多种模型和数据集上,但容易被影响的具体样本往往因模型而异。

作者还发现,翻转程度受到上下文类型、长度、测试时计算量和模型开发阶段影响。这意味着“新模型平均分更高”不能自动推出它对每个输入都更稳定,增加推理计算也未必统一消除尾部风险。

对评测与 RAG 的影响

RAG、邮件助手和企业知识问答天然携带大量相关性不一的上下文。测试应记录加入上下文前后的逐样本一致率、由对转错和由错转对的比例,并建立成对回归集,而不只比较最终准确率。

检索层也要控制噪声:限制低相关片段、保持稳定排序,并对关键决策使用多次扰动测试。若轻微无关输入就改变结论,系统应降低自动执行权限或要求额外证据。

我的判断

这项工作提醒我们,可靠性是“同一个问题在无害扰动下是否保持判断”,不只是数据集平均得分。对高风险场景,少数不可预测的翻转可能比一个百分点的总体提升更重要,评测报告应把这种尾部不稳定单独列出。

一手来源:The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context