OvisOCR2 是一个面向文档解析的 0.8B 模型。它不再把版面分析、文字识别、公式识别和表格恢复拆成多段流水线,而是接收整页文档图像,直接按照自然阅读顺序生成 Markdown,统一覆盖文本、公式、表格与视觉区域。技术报告的核心信号是:端到端方法不仅简化了任务形式,也已经能在公开榜单上与成熟流水线竞争。
从页面图像直接生成 Markdown
传统文档解析系统通常由多个专用模块串联,模块间的误差可能逐级传递。OvisOCR2 把整页解析定义为单次图像到结构化文本的生成任务,目标输出本身就是可继续处理的 Markdown。对开发者而言,这种接口更接近实际应用需求:输入页面,得到保留阅读顺序和主要内容类型的结构化结果。
支撑这一目标的是一套混合数据引擎。真实文档部分使用经过过滤的标注;合成部分则从同一份 HTML 同时派生渲染图像与 Markdown 目标,从源头保持输入页面和监督标签的一致性。报告没有在摘要中披露两类数据的规模与配比,因此暂时无法判断性能提升主要来自数据量、数据质量,还是训练流程。
大模型训练,再蒸馏到 0.8B
训练方案并非只有监督微调。团队先在 4B 分支上采用带多组件奖励的强化学习,再通过 on-policy distillation 将能力迁移到 0.8B 模型,最后进行模型融合。这说明小模型的最终表现依赖一条相对完整的训练链路,而不是单纯缩小参数规模。
在 OmniDocBench v1.6 上,OvisOCR2 的总体得分为 96.58,达到该榜单最高水平;报告特别指出,此前榜首主要由流水线方法占据。在 PureDocBench 上,它取得最高的 Avg3 分数 75.06。团队还在覆盖更多长尾和困难场景的内部基准上进行了测试,并称其综合表现优于参与比较的方法,但摘要没有给出测试集组成、对手列表和分项结果。
我的判断
OvisOCR2 最有价值的地方,是证明 0.8B 级端到端模型可以在两项公开基准上取得领先成绩,同时把复杂文档统一输出为 Markdown。这对需要较轻部署成本、又希望减少系统模块数量的文档处理应用具有吸引力,模型也已在 Hugging Face 提供。
但目前材料不足以判断其真实部署效率,包括推理速度、显存占用、页面分辨率限制和长文档处理方式。公开榜单分数也不能直接代表扫描件噪声、特殊语言、复杂图表或极端版式下的稳定性;内部基准缺少可独立核验的细节。现阶段更适合把它视为值得实测的端到端基线,而不是已经全面替代流水线方案的结论。