AI文档解析Benchmark拉胯,根子不在模型,在评估标准——LlamaIndex这次把167K规则全亮出来了

AI 文档处理的人,这两年问的最多的问题是:模型跑分挺高,上线用起来怎么就不对?

这个问题,ParseBench 这次用 167K 条规则、2000 张真实企业文档,把根子扒清楚了——不是模型不行,是解析评估的标准和实际需求完全对不上。

LlamaIndex 4 月 13 日在 CVPR 2026 发了一篇论文,推出 ParseBench,是目前第一个专门面向 AI Agent 的文档解析基准。核心逻辑很简单:文档解析的及格线从「人能读懂」变成了「Agent 能可靠地基于它做决策」。

这句话听起来像废话,但做过的都知道这中间差了多少。

以前评解析质量,用的是 BLEU、ROUGE 这类文本相似度指标。 问题在哪?你把表格的列顺序换一下、给标题加了个星标,文本相似度可能还更高,但下游 Agent 拿到的是完全错误的数据。一张保单里「生效日期」和「终止日期」列颠倒了,Agent 审批的时候数字全对,但决策全错。

ParseBench 换了五个维度来测:

表格 — 合并单元格、多级表头夸页跨表。旧指标 TEDS 打出来高分,实际上 Textract 和 Azure Document Intelligence 在财务报表级表格上直接崩溃。ParseBench 引入 TableRecordMatch,把表格当记录集合来评分,列键对不上就扣分。

图表 — 绝大多数解析器直接把图表当图片嵌入,或者吐一段 OCR 文字。Agent 需要的是数值+系列名+轴标签,能接进下游计算的那种。实测大多数专用解析器图表维度得分低于 6%。

内容忠实度 — 漏字、臆造、阅读顺序错误。得分 90% 听起来不错,但一本 50 页的合同里 Agent 遇到有意义的内容错误概率大约是 5 页。

语义格式 — 删除线、上标下标、粗体,这些在法律文档里不是装饰,是含义。合同里的删除线表示条款已废止,脚注编号搞错了整个引用就废了。

视觉定位 — 每个提取结果要能追溯到页面上具体位置,监管场景里这是审计要求,不是可选项。

评估方法是纯规则驱动的,没有 LLM-as-judge,所以结果不会被打分通胀,每年基准发布时厂商临时刷分这种事在这里不成立。

14 种方法横评的结果:没有任何单一方法在五个维度上同时表现优秀。

LlamaParse Agentic 综合得分 84.9%,是唯一一个五个维度都能打的产品级方案。Gemini 2.5 Flash 71% 是外部最强基线,Reducto 67.8%。在成本-质量曲线右上角的,是 LlamaParse Agentic 模式,大约 1.2 美分每页,碾压所有其他付费方案。

ChartQA 之类学术数据集出来的解析器,在企业文档上全面拉胯,原因是数据集本身就不是企业场景。OmniDocBench 2024 年做了第一次多维度评估,但 6% 的企业内容占比和文本相似度指标让它无法真实反映生产环境的失败模式。

为什么这对外前端的我们有关系?

现在 AI Agent 落地最大的场景不是写代码,是处理文档——合同审查、保险理赔、财务报表分析、监管文件提取。这每一个场景的根节点都是「先把文档读对」。如果解析层不可靠,上层 Agent 越强,错误传播越快。

GitHub 上有完整的数据集和评测代码,HuggingFace 上可以直接跑自己的解析 pipeline 对比公开榜单。这个基准出现之后,企业选解析方案终于有一个可以放进 RFP 里的量化指标了,不用再靠厂商 PPT。

下一步:如果你的项目涉及 PDF/扫描件处理,先去 public leaderboard 上查一下你的方案在五个维度的得分——特别是 Chart 那个维度,大多数人的现有方案可能还不到 6 分。

评论区

0 条评论

登录后可评论。

AI 论文日报 80 阅读