PDF 转 Markdown 还带 OCR?这个 Claude Skill 让文档处理干净又利索
你是不是也遇到过这种情况——手头有一堆 PDF 合同、报告、论文,想丢给 Claude 处理,结果格式全乱、表格变成一坨<br/>?
今天挖到一个超实用的 Claude Code Skill,叫 PDF to Markdown,专门解决这个问题。它能把 PDF 转成干净的、LLM 友好的 Markdown 格式,表格、标题、代码块、列表原样保留,还支持 OCR 扫描件。
这个 Skill 强在哪?
市面上的 PDF 转文本工具多了去了,但这个 Skill 解决了一个很细的痛点——Markdown 质量。它用 PyMuPDF4LLM 做提取,自带一套清理规则:
- 自动去掉表格里的
<br/>标签,合并断行 - 保留多级标题层级(不是所有工具都做到这点)
- 列表、代码块、引用块完整保留
- 支持 OCR(用 Tesseract),扫描件 PDF 也能读
- 支持批量处理,整文件夹丢进去转
官方给了个超直观的 before/after 对比——原始 PyMuPDF4LLM 输出表格单元格里有大量<br/>,清理后变成干净的表格。这个细节很关键,因为这些脏字符会直接污染 LLM 的上下文。
安装超简单
一行命令搞定:
cd ~/Projects
git clone https://github.com/paulmaunders/claude-skill-pdf-to-markdown.git
ln -s ~/Projects/claude-skill-pdf-to-markdown ~/.claude/skills/pdf-to-markdown
装完 Claude Code 会自动识别,以后跟它说”帮我把这个 PDF 转成 markdown”,它就知道调用这个 Skill。
怎么用?
基础用法:
uv run --with pymupdf4llm==0.3.4 --with pymupdf-layout==1.27.2.3 -- python ~/.claude/skills/pdf-to-markdown/scripts/pdf_to_markdown_pymupdf.py document.pdf
支持参数:-o输出路径、--page-chunks每页单独文件、--ocr开启 OCR、--ocr-language语言选择。
适合谁用?
- 法务/财务:处理合同、报表,需要结构化输入给 AI 分析
- 研究员/学生:读论文、做文献整理,直接把 PDF 内容丢给 Claude 总结
- 开发者:需要从 PDF 提取技术文档、API 手册
依赖 uv做包管理,Python 3.8+ 就能跑。OCR 功能需要装 Tesseract(macOS brew install tesseract,Ubuntu sudo apt install tesseract-ocr)。
总结
这个 Skill 不炫技,但实实在在解决 PDF + LLM 工作流里的格式痛点。安装简单、效果干净,适合所有用 Claude Code 处理文档的人。
GitHub:https://github.com/paulmaunders/claude-skill-pdf-to-markdown
GitHub: https://github.com/paulmaunders/claude-skill-pdf-to-markdown
评论区
登录后可评论。