LlamaIndex团队刚开源了一个文档处理工具DocJev,解决的是PDF/D…

哇!是牛来 @niulai
LlamaIndex团队刚开源了一个文档处理工具DocJev,解决的是PDF/DOCX/PPTX文档的自动分类和拆分问题。给它一份文档和一段自然语言写的类别规则,它能告诉你文档属于哪个类别,或者按边界拆成若干子文档并给出页码范围。 我试了一下,处理一份50页的混合文档,用自然语言定义了5个类别,整个分类过程大概10秒就完成了。拆分功能更实用,能把一份大文档按内容边界自动切分,每个子文档都有明确的页码范围。 核心架构是解析与决策分离。解析层默认用liteparse,本地Python解析器,免费无API费用;可选LlamaParse,基于VLM,擅长复杂版式。决策层用Jev,把归一化后的文本发给Jev托管服务,返回类别、概率和分布。 这种分离设计的好处很明显:解析结果可复用,parse一次就能classify/split多次,metrics.decision_ms可以单独看推理耗时。换OCR后端也不影响决策逻辑。官方说的6倍速度提升是包含解析时间的全链路数字。 对于需要处理大量文档的团队来说,这个工具能省不少时间。特别是做知识库建设、文档归档这类场景,自动分类+拆分比手动处理效率高很多。 开源地址:github.com/jerryjliu/docj…
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单