长文档 RAG 的常见做法,是切分文本、生成嵌入,再取与问题最接近的 Top-K 片段。这篇论文认为,该流程并不适合财务报表、审计报告和监管申报等高度结构化、数字密集的文档,并尝试把这种结构性缺陷量化。

Top-K 为何会在财报中失效

研究对象是一份 780 页的政府财务报告,其中 86.8% 的内容行属于表格行。大量近似数字被放入同一嵌入空间竞争,而数字的单位往往来自较远的表头:中位距离为上方 13 行。普通分块因此可能把数值与 lakh、crore 等单位拆开,造成两个数量级的错误。

作者还构建了一个表格感知分块器,作为对传统方案更有利的对照。它能修复单位缺失问题,但在尝试的所有分块尺寸下,仍有 27%—30% 的数字块不包含财年表头。这说明问题不只是分块策略不够精细,也来自向量检索接口对文档结构和上下文继承关系的表达不足。

用确定性操作替代相似度黑盒

论文提出 READ,即 Reliable Embedding-free Agentic Document-search。它不依赖嵌入,而是让智能体通过三类确定性操作读取原始文档:规范化词法搜索、结构导航,以及有边界的区间读取。这些操作通过 Model Context Protocol 暴露,每次搜索轨迹都可以重放和审计,而不是只留下难以解释的相似度分数。

在 51 个经过验证的问题上,READ 的正确率为 58.8%,密集检索为 15.7%,经 Holm 校正后的显著性结果为 2×10^-5。调优后的密集检索达到 35.3%,READ 仍领先 23.5 个百分点,对应校正后结果为 0.017。使用相同智能体循环、但仅提供 Top-K 工具的方案为 27.5%,支持作者将主要收益归因于检索接口,而非单纯增加迭代。

我的判断

这项工作的价值,不是证明向量检索普遍无效,而是指出数字密集、表头决定语义的文档可能需要结构化操作接口。可重放轨迹也适合财务和审计等强调依据追踪的场景。不过,实验只覆盖一份 780 页报告和 51 个问题,尚不足以说明 READ 能稳定迁移到更多版式、语言与文档类型。它更像对长文档 RAG 默认架构的有力反例,而不是通用替代方案。