项目反应理论(IRT)正被越来越多地用于 AI 基准测试:估计模型能力、排列系统名次、筛选信息量较高的题目,以及诊断基准质量。但这项研究提醒,IRT 最初面向人类测验建立,其常见估计工具未必能直接适应 AI 评测的数据结构。
AI 基准不符合传统测验的数据条件
与人类测验相比,AI 基准通常只有较少的被测模型,却包含更多题目。模型能力也未必接近常见的正态分布,而可能呈现偏斜、聚集或多峰。这些差异不只是统计细节:IRT 需要同时推断潜在能力和题目参数,当被测模型数量有限、能力覆盖不均时,参数识别和排序都可能变得不稳定。
研究从六个广泛使用的大语言模型基准中提取题目参数与能力分布,在三种常见 IRT 模型下生成响应矩阵,并比较近期基准研究使用的四类估计工具:边际最大似然、马尔可夫链蒙特卡洛、变分推断,以及神经伪孪生估计器。
可扩展性不等于推断可靠
研究覆盖 18,000 种模拟条件,考察计算可行性、扩展能力,以及模型排名、预测表现和题目特征等推断是否可靠。结果显示,经典估计器在大型基准场景中可能变得不可行;更具扩展性的估计器虽然能处理更大的问题,但面对较少或非正态分布的模型集合时,题目层面的参数和模型排名可能不可靠。
这意味着,使用 IRT 得到一个能力分数或排序,并不自动代表结论稳健。评测者需要区分“算法成功运行”与“统计推断可信”,尤其不能仅因方法能够扩展到大量题目,就默认其适合当前模型样本。
我的判断
这项工作的价值,在于把 AI 评测中常被当作成熟工具的 IRT,重新放回其数据假设下检查。它并未否定潜在特质模型,而是指出适用边界:模型数量、能力分布和题目规模都会影响结论。对开发者而言,IRT 排名更适合作为有条件的统计分析,而不是脱离样本结构的权威榜单。摘要没有给出各估计器在具体条件下的完整阈值,因此目前还不能据此选择某一种工具;更稳妥的做法是报告估计方法与数据分布,并对排名和题目参数进行额外的稳定性检验。