法律问答的难点,有时不是找到适用法条,而是先判断用户给出的事实够不够。现实中的提问经常省略会改变法律结果的关键信息,但现有基准通常默认问题已经被完整定义。InsufficiencyBench把这个被忽略的环节单独拿出来:模型能否识别信息不足,指出还缺什么,并在事实未补齐前避免过早下结论。

评测什么

论文将“查询侧信息不足”形式化为八类典型缺失要素,并归纳为三种结构性失败模式:switch、gating 和 fatal prerequisite。它们分别对应不同的法律推理风险:缺失信息可能让适用的法律路径发生切换,也可能决定某项规则能否进入判断,或者直接构成不可绕过的前置条件。这样的设计没有把“回答得像不像法律意见”作为唯一标准,而是进一步追问模型是否识别了结论成立所依赖的事实。

基准包含202个项目,由58个基础查询和144个信息不足的变体组成,覆盖六个法律领域和24个美国司法辖区,并由执业律师进行标注。这个构造同时保留了完整问题与缺失信息版本,因而可以观察模型是否会把同一法律问题中的事实差异真正纳入回答,而不是对所有提问使用相同的保守话术。

结果与暴露的问题

论文评估了十个前沿模型。没有模型在缺失要素识别上的F2得分超过0.46,中位召回率为0.44。换句话说,模型往往无法稳定找出决定法律结论的全部缺口。更值得注意的是,模型主要表现为两种相反的失误:要么不加区分地使用模糊、保留式表达,要么默认了一些用户没有提供的事实后直接回答。

这说明“多加一句免责声明”并不等于完成了不确定性处理。真正困难的是把缺失事实具体指出来,同时说明它为什么影响判断。论文还指出,没有一个模型能够在面对信息不足的查询时既识别缺失要素、又适当限定回答,并在完整查询上直接作答。也就是说,模型尚未同时处理好谨慎性和有效性这两个要求。

我的判断

InsufficiencyBench的价值在于把法律AI中一个容易被综合准确率掩盖的问题明确化:模型是否知道自己缺少什么。对于法律咨询这类高风险场景,这比单纯比较最终答案可能更接近实际使用中的安全边界。它也提示评测设计需要区分“答错”“没发现前提不足”和“过度回避”。

不过,现有材料只展示了该基准上的总体结果,不能据此推断模型在所有法律任务或其他专业领域中的表现。基准覆盖的司法辖区、法律领域和缺失类型也构成了适用边界。对开发者而言,较稳妥的启示是:在法律问答流程中,把关键事实检查作为独立步骤进行评测,而不要只依赖通用的拒答或免责声明机制。