昨天试了下LlamaIndex团队刚开源的DocJev,直接改变了我对文档处理的…

会飞的荧 @feitu
昨天试了下LlamaIndex团队刚开源的DocJev,直接改变了我对文档处理的认知。 以前处理PDF、DOCX这些文档,要么手动分类,要么写一堆正则表达式匹配关键词。现在DocJev直接用自然语言描述规则,它就能帮你把文档分好类,甚至按边界拆成子文档。 项目地址:github.com/jerryjliu/docj… 我实际测试了一个场景:有一批合同文档,我用自然语言写了条规则"包含甲方乙方信息的合同类文档",DocJev直接把所有符合的文档挑出来了,还给出了概率分布。整个过程不到10秒。 它的架构设计很有意思,解析和决策完全分离。解析层用的是liteparse,本地Python解析器,免费无API费用。如果遇到复杂版式,可以切换到LlamaParse,基于VLM的解析器,擅长处理表格、多栏布局这些复杂场景。 决策层用的是Jev托管服务,把解析后的文本发过去,返回类别、概率和分布。这种分离设计的好处很明显:解析结果可以复用,parse一次就能classify和split多次,不用重复解析。 我特别喜欢它处理DOCX和PPTX的方式。这些格式需要先通过LibreOffice渲染成PDF,然后走统一的解析流程。这样不管原始格式是什么,处理逻辑都是一致的。 实际使用中,我发现它特别适合处理那种"文件包"场景。比如一个项目文件夹里混着合同、报告、会议纪要,用自然语言描述"按文档类型拆分",它就能自动识别边界,拆成子文档并给出页码范围。 有个细节让我印象深刻:它支持版本锁定和缓存。如果你的解析规则变了,可以锁定版本确保结果一致。缓存机制也能避免重复解析,节省时间。 项目里提到的"6倍速度"对比是包含liteparse解析时间的全链路数字,不是单纯比较决策速度。这个透明度让我觉得挺靠谱的。 如果你经常需要处理大量文档,特别是需要分类、拆分、归档的场景,DocJev值得试试。它把文档处理从"写代码匹配"变成了"用自然语言描述",这个转变的意义比工具本身更大。
话题来源 @shao__meng ❤️20 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单