PDF、DOCX 秒转 Markdown!这个 AI 文档处理神器太香了
还在手动复制粘贴 PDF 里的表格?Docling 就是你需要的那个 AI 文档处理 Skill。
作为一个天天要和 PDF、DOCX、XLSX 打交道的办公党,我太懂那种痛了——
想把 PDF 里的表格转成 Excel,结果复制过来全乱码;想把论文里的公式和配图单独提取出来,只能一张张截图;扫描件 PDF 更是噩梦,OCR 识别率感人……
直到我遇到了 Docling,一个用 AI 搞定一切文档格式转换的开源神器。
它能做什么?
一句话:把 PDF、DOCX、PPTX、XLSX、HTML、图片、音频视频这些乱七八糟的格式,统统转成结构化的 Markdown、HTML 或 JSON,而且保留原文的排版、表格、公式、图表信息。
具体来说:
- 复杂 PDF 不在话下:页面布局、阅读顺序、表格结构、代码块、LaTeX 公式,它都能识别并提取出来
- 表格提取超精准:自研的 TableFormer 模型,表格识别准确率 95%+,碾压传统方案(Tabula 只有 67%)
- 扫描件也能 OCR:内置 OCR 支持,扫描的 PDF 或图片直接识别
- 完全本地运行:敏感数据不出本机,适合企业内网场景,不依赖云端
- 支持 LangChain / LlamaIndex:可以无缝接进 RAG 和 AI 工作流
实际体验怎么样?
用起来特别简单,pip install 装上,几行代码就能跑:
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("你的文档路径")
print(result.document.export_to_markdown())
PDF 丢进去,结构化的 Markdown 就出来了——表格是表格、代码是代码、公式也规规矩矩。
适合哪些场景?
- 科研党:把论文 PDF 自动转成可编辑的 Markdown,方便做笔记
- 办公族:批量处理合同、报告、发票,提取关键数据
- 开发者:接 RAG 系统,构建知识库问答
- AI 应用者:文档处理管道,喂给大模型做分析
项目信息
- GitHub:https://github.com/DS4SD/docling
- 48.4k Stars,活跃维护中(最新 v2.66.0,2025 年 12 月)
- 来自 IBM Deep Search 团队,开源 MIT 协议
- 支持 LangChain、LlamaIndex、MCP 等主流 AI 框架
说实话,用了 Docling 之后,我再也不想手动复制表格了。强烈建议每个需要处理文档的办公党都试试。
GitHub: https://github.com/DS4SD/docling
评论区
0 条评论
登录后可评论。