用大模型给大模型打分已经成为常见评测方法,但位置、措辞、长度等因素会让“裁判”偏离内容质量。一项覆盖七个裁判、七类偏差和九个基准的新研究,把观察范围从输入输出推进到模型隐藏状态。
偏差呈现为激活几何变化
研究者报告,正常评审输入的激活集中在较紧的流形附近,带偏差的输入则沿着类型相关的低维子空间发生位移,而且这种结构在更深层更明显。用三类估计方法得到的方向具有一致性。
更关键的是因果干预:沿偏差方向推动隐藏状态,可以让干净输入产生类似偏置的评分;反向干预则能让带偏差输入的评分靠近基线。相同范数的随机方向影响小一个数量级。论文还用这些方向的线性投影预测三个未见基准上的裁判失败。
对评测管线的影响
如果团队使用可访问隐藏状态的开放模型作为裁判,可以把偏差方向当作额外的监控信号。但这不应替代基础控制实验:交换答案顺序、统一长度、隐藏模型身份、使用多裁判投票,仍然是更容易审计的第一道防线。
闭源 API 通常无法实施激活干预,因此研究的直接工程收益主要在自托管评测模型。即便可干预,也要检查修正是否损伤真实质量差异,避免为了“去偏”把评分信号一并抹平。
我的判断
这项工作提供了一个比提示词补丁更深的解释,但低维方向是否能跨架构、跨语言和跨新版模型稳定迁移仍未知。生产评测最稳妥的做法,是把裁判模型视为带系统误差的测量仪器,并用人工金标持续校准。
一手来源:Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias