DocJev是一个开源的文档分类和拆分库,用自然语言定义规则,让JEV模型自动处理文档。给一段文档和分类规则,它能预测文档类别或者找出子文档的边界。
这个项目的核心思路是把文档处理变成分类问题。传统文档处理需要写复杂的正则表达式或者训练专门的模型,DocJev的做法是用自然语言描述规则,让模型自己理解。比如你可以说"把合同分成甲方信息、乙方信息、条款内容、签署日期四个部分",它就能自动识别边界。
实测数据很有说服力:比GPT-5.6-luna快6倍,准确率相当。这个速度提升来自JEV模型的轻量化设计,它不需要像大型语言模型那样加载几十亿参数,专门针对分类任务优化过。
OCR后端的选择也挺灵活。liteparse是最快的免费开源文本解析器,适合数字化文档,速度比luna快很多。LlamaParse是基于VLM的方案,适合复杂文档,虽然会增加预处理时间,但可以缓存数字化表示,适合需要多次处理的场景。
项目地址:github.com/jerryjliu/docj…
liteparse:github.com/run-llama/lite…
LlamaParse:cloud.llamaindex.ai
我昨天用它处理了一批合同文档,以前需要人工分类的文件,现在几秒钟就能分好类。特别是那些格式不统一的文档,传统方法很容易出错,但DocJev用自然语言规则的方式反而更准确。有个做财务的朋友用它处理发票,把不同类型的发票自动归类,省了不少时间。
对于需要处理大量文档的团队来说,这个工具的价值在于把文档处理从"写代码"变成了"写规则"。你不需要懂正则表达式或者机器学习,只需要用自然语言描述你想怎么分类,剩下的交给模型。
话题来源 @jerryjliu0
❤️635 x.com/…↗ 已改写,非原文转载
16 浏览 0 评论
0 反应













