法律工作高度依赖大规模文本处理,因此常被认为是最可能受到大语言模型影响的领域之一。合同“scrubbing”指交易协议的最终审查,重点是发现错误与不一致之处。这项工作通常重复、细致且耗时,需要对长文档保持持续注意,也因此看起来很适合交给具备长上下文推理、一致性检查和命名实体识别能力的模型完成。

然而,过去并没有专门评估大模型合同终审能力的正式测试。来自 arXiv 的论文《ContractScrub: A benchmark for final review of legal contracts》提出了 ContractScrub,并将其定位为首个用于评估合同审查能力的基准。论文发表于 2026 年 8 月 20 日。

ContractScrub测什么

ContractScrub包含由有经验律师手工制作的合同,覆盖多类错误,包括已定义术语的误用、错误引用以及语言表述不一致。测试目标不是泛泛考察模型能否总结合同或回答法律问题,而是要求模型在最终审查环节中,准确找出文本内部的具体问题。

这个设计把合同审查中的关键难点直接暴露出来:模型需要跨越较长文本追踪术语和引用关系,还要判断同一概念在不同位置是否保持一致。表面上,这些能力与长上下文推理、实体识别和一致性检查等通用能力相关,但论文强调,相关通用基准上的良好表现,并不意味着模型能够胜任真实合同终审。

结果为何值得关注

论文称,前沿模型在这项任务上的表现“出人意料地差”。在测试模型中,只有一个模型达到了 0.75 的宏平均召回率。这里的关键指标是召回率:合同审查首先要求尽量发现已有错误,而不是只给出少量看似合理的修改建议。

这一结果说明,长文本能力与专业场景中的可靠检查之间仍有距离。模型可能能够处理长上下文,也可能在一般任务中表现出较强的推理或识别能力,但面对合同中细粒度、跨位置、强约束的一致性问题时,能力并不会自然迁移。论文因此强调,评估真实世界影响,需要面向具体任务和领域设计基准。

我的判断

ContractScrub的价值不在于证明大模型完全不能做合同审查,而在于提供了一个更接近实际工作环节的测量方式。它提醒开发者,法律文本自动化不能只参考通用长上下文或推理基准,还需要验证模型是否能稳定发现领域内真正重要的错误。

现阶段,更稳妥的结论是:大模型可以被研究为合同终审的辅助工具,但材料并不足以支持其独立承担最终审查责任。该基准覆盖的错误类型和测试结果,为后续比较模型能力提供了起点;至于模型在更广泛合同、不同法律体系或真实工作流中的表现,仍需要进一步评估。