PDF 转 Markdown 还带 OCR?这个 Claude Skill 让文档处理干净又利索

你是不是也遇到过这种情况——手头有一堆 PDF 合同、报告、论文,想丢给 Claude 处理,结果格式全乱、表格变成一坨<br/>

今天挖到一个超实用的 Claude Code Skill,叫 PDF to Markdown,专门解决这个问题。它能把 PDF 转成干净的、LLM 友好的 Markdown 格式,表格、标题、代码块、列表原样保留,还支持 OCR 扫描件。

这个 Skill 强在哪?

市面上的 PDF 转文本工具多了去了,但这个 Skill 解决了一个很细的痛点——Markdown 质量。它用 PyMuPDF4LLM 做提取,自带一套清理规则:

  • 自动去掉表格里的<br/>标签,合并断行
  • 保留多级标题层级(不是所有工具都做到这点)
  • 列表、代码块、引用块完整保留
  • 支持 OCR(用 Tesseract),扫描件 PDF 也能读
  • 支持批量处理,整文件夹丢进去转

官方给了个超直观的 before/after 对比——原始 PyMuPDF4LLM 输出表格单元格里有大量<br/>,清理后变成干净的表格。这个细节很关键,因为这些脏字符会直接污染 LLM 的上下文。

安装超简单

一行命令搞定:

cd ~/Projects
git clone https://github.com/paulmaunders/claude-skill-pdf-to-markdown.git
ln -s ~/Projects/claude-skill-pdf-to-markdown ~/.claude/skills/pdf-to-markdown

装完 Claude Code 会自动识别,以后跟它说”帮我把这个 PDF 转成 markdown”,它就知道调用这个 Skill。

怎么用?

基础用法:

uv run --with pymupdf4llm==0.3.4 --with pymupdf-layout==1.27.2.3 -- python ~/.claude/skills/pdf-to-markdown/scripts/pdf_to_markdown_pymupdf.py document.pdf

支持参数:-o输出路径、--page-chunks每页单独文件、--ocr开启 OCR、--ocr-language语言选择。

适合谁用?

  • 法务/财务:处理合同、报表,需要结构化输入给 AI 分析
  • 研究员/学生:读论文、做文献整理,直接把 PDF 内容丢给 Claude 总结
  • 开发者:需要从 PDF 提取技术文档、API 手册

依赖 uv做包管理,Python 3.8+ 就能跑。OCR 功能需要装 Tesseract(macOS brew install tesseract,Ubuntu sudo apt install tesseract-ocr)。

总结

这个 Skill 不炫技,但实实在在解决 PDF + LLM 工作流里的格式痛点。安装简单、效果干净,适合所有用 Claude Code 处理文档的人。

GitHubhttps://github.com/paulmaunders/claude-skill-pdf-to-markdown


GitHub: https://github.com/paulmaunders/claude-skill-pdf-to-markdown

评论区

0 条评论

登录后可评论。

白鹿 9 阅读