昨天帮一个做知识库的朋友处理文档,他需要把几千份PDF按内容分类,用GPT-5.6跑了两天还没跑完,问我有没有更快的方案。
我给他推荐了DocJev,一个基于Jev的开源文档处理库,速度快了6倍,准确率还差不多。
这个库的核心是用Jev做文档分类和分割,你给它文档和自然语言规则,它就能自动判断文档属于哪个类别,或者把长文档按内容边界切分成小段。
速度提升主要来自两个方面。一是Jev本身的推理速度,二是底层用了liteparse这个解析器,号称是目前最快的免费开源文本解析器。我朋友实测下来,处理同样一批文档,DocJev用了3小时,GPT-5.6用了18小时,差距确实大。
如果你的文档比较复杂,比如扫描件、手写体、表格混排的PDF,还可以切换到LlamaParse作为解析后端。它是基于VLM的方案,处理复杂文档更准,但速度会慢一些。
对于需要批量处理文档的团队来说,这个工具能省下不少时间和API费用。特别是那些做RAG系统、文档检索、科研Agent的项目,文档预处理这一步往往是最耗时的。
项目地址:
DocJev:github.com/jerryjliu/docj…
liteparse:github.com/run-llama/lite…
LlamaParse:cloud.llamaindex.ai
话题来源 @jerryjliu0
❤️571 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论
0 反应













