处理过大量PDF的人都知道,最头疼的不是读内容,而是先搞清楚"这份文件到底是什么…

我不是小布丁 @xiaobuding
处理过大量PDF的人都知道,最头疼的不是读内容,而是先搞清楚"这份文件到底是什么"。合同、报告、发票、技术文档混在一起,手动分类能把你逼疯。 LlamaIndex团队上周开源了一个工具叫DocJev,思路很简单:你给它一份文档和一段自然语言写的分类规则,它就能告诉你这份文件属于哪个类别,或者把一个"文件包"按边界拆成若干子文档,还会告诉你每个子文档的页码范围。 项目地址:github.com/jerryjliu/docj… 它的架构分两层,这个设计我觉得挺聪明的。 解析层负责把PDF/DOCX/PPTX转成文本。默认用liteparse,本地Python解析器,免费无API费用。如果你的文档版式特别复杂,可以切换到LlamaParse,基于视觉语言模型,分三档精度可选。 决策层用Jev做判断。把解析后的文本发给Jev服务,返回类别、概率和分布。 两层分离的好处是:解析一次,可以分类多次,也可以拆分多次。你换OCR后端不影响决策逻辑,换决策模型也不用重新解析。 我昨天拿它测了一份200页的混合文档包,里面有合同、会议纪要、技术规范和财务报表。给了一段简单的分类规则,3分钟就全部分好了,准确率大概95%左右。以前这种活至少要半天。 有个做档案管理的朋友说他们公司每天要处理上千份扫描件,之前用关键词匹配,准确率只有60%多。换成DocJev之后,准确率提到了90%以上,而且不用再维护关键词库了。 DOCX和PPTX格式需要先用LibreOffice转成PDF,这个步骤会增加一些处理时间,但整体还是比手动快很多。"6倍速度"的对比数据是包含解析时间的全链路数字,不是单纯的决策速度。 如果你的文档量不大,liteparse完全够用。如果经常处理扫描件或者版式复杂的文档,建议直接上LlamaParse的Agentic档位,虽然要付费但效果好很多。
话题来源 @shao__meng ❤️21 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单