带持久记忆的个性化大模型正在进入实际应用,但“记住用户”不等于“忠实理解用户”。这项研究关注过度推断(Over-Inference,OI):模型依据有限信息,生成证据并不支持的用户属性。结果显示,这不是少数模型的偶发现象,而是当前个性化能力中普遍存在的可靠性缺口。
MirageBench 如何测量画像失真
研究者构建了 MirageBench,包含 150 个角色画像,并在刻板、反刻板和中性三类设定之间保持平衡。基准设置 6 类个性化任务,覆盖不同程度的“想象梯度”,再用四分类忠实度体系逐条判断模型声明。
评判由独立模型完成,并与盲评人工标注者在 400 条声明上进行验证:四分类 Cohen’s kappa 为 0.863,合并成二分类后为 0.900。最终榜单覆盖 7 个模型家族中的 12 款模型,共评判 143616 条声明。这一设计的重点不是测试模型能否给出更丰富的个性化回答,而是区分哪些内容有证据、哪些只是模型自行补全。
所有受测模型都在过度推断
12 款模型无一例外,过度推断比例落在 35% 至 49% 之间;跨模型平均值为 41.6%,按声明数量加权后为 41.8%。OI 也明显依赖任务,不同任务的比例从 27% 到 59% 不等,说明风险不能仅用一个模型级总分概括。
更值得注意的是“自我监控倒置”:在模型选择层面,模型自评的 OI 与独立评判结果呈负向秩相关,rho 为 -0.60,p 为 0.044。也就是说,自称较少过度推断的模型,反而往往被判定编造得更多。不过,该结果样本只有 12 个模型,且 bootstrap 区间较宽、跨过零点,研究者将其视为探索性发现。单个模型内部的自审仍有一定排序能力,AUROC 为 0.58 至 0.83,但这不等于它适合跨模型比较。
我的判断
这项工作的价值,在于把“个性化是否贴心”改写为“用户画像是否有证据”,也提醒应用方不要把模型自信度或自我审查直接当作可靠性指标。MirageBench 的规模、人工一致性验证和逐声明评判,使结论具有较好的诊断意义。
边界同样明确:自我监控倒置目前只是小样本、宽区间的探索性结果,不能据此断言所有模型都会出现同样关系。对实际系统而言,更稳妥的做法是保留画像来源、区分事实与推断,并用外部评测持续检查;不能因为模型能解释自己的判断,就假设它真的了解用户。