企业文档抽取正在从“找出几个字段”变成更严格的智能体任务:系统既要遵循用户给定的 schema 输出正确结果,也要保留可追溯的来源证据。ExtractBench 的价值,在于把值是否正确、记录是否齐全、证据能否定位以及实际成本放进同一套评估,而不是只报告一个准确率。
基准覆盖什么
ExtractBench 包含 370 份企业文档、共 4869 页,覆盖 8 个业务领域和 67 种文档类型,并通过标签区分不同挑战场景。这个规模使它能够观察长文档、列表型记录和表单等不同输入对抽取系统的影响。
数据与真值的构建方式按文档类型有所区别:真实文档利用独立系统间的一致结果,合成列表直接使用已知值,表单则加入人工核验。这种组合兼顾了扩展规模与结果校验,但不同来源的真值质量仍需在实际使用中分别看待。
评测采用与顺序无关的值级 F1,因此记录排列变化不会直接影响准确性判断;来源溯源则同时计算词级和页级 F1,用于检查结果能否落到原文证据。除此之外,基准还记录成本,并把大规模记录完整性纳入评价范围。
模型表现暴露了长文档问题
摘要给出的主要结论是:商业视觉语言模型在短文档上表现较好,但面对长文档时,经常会截断记录列表。代码智能体能够维持更高准确性,代价则是明显更高的成本。LlamaExtract Agentic Plus 在值级 F1、词级溯源 F1 和页级溯源 F1 三项指标上均排名第一,其准确性与代码智能体相当,但成本只是后者的一小部分。
我的判断
ExtractBench 抓住了企业抽取最容易被忽略的两个问题:不能漏记录,也不能只给答案而不给证据。公开数据与评测代码也有利于团队复现并比较方案。不过,它针对的是 schema 引导的企业文档抽取,不应直接外推到通用文档理解任务;现有材料也没有给出逐模型数值、领域间差异和误差分布,因此还不足以判断领先幅度是否稳定。对选型而言,它更适合作为成本、完整性与可追溯性之间的联合参考,而不是单一排行榜。