PDF转Markdown,让AI真正读懂你的文档——GitHub官方出品
你有没有遇到过这种情况——收到一份 PDF 合同/报告/论文,想让 AI 帮你摘要或提取关键数据,结果 AI 一脸懵,说”读取失败”?
这不是 AI 的问题,是 PDF 格式本身的问题。PDF 是打印格式,不是给程序读的文本格式,直接塞给 AI 只能得到一堆乱码或空白。
GitHub 官方出的这个 convert-pdf-to-md Skill,就是专门解决这个问题的。
它能做什么
一句话:把 PDF 转成干净的 Markdown,让 AI 直接读懂内容。
支持三种核心操作:
– 单文件转换:丢一个 PDF进去,出来一个 .md 文件和同名文件夹(图片单独存放)
– 批量转换:丢一整个文件夹进去,自动处理里面所有 PDF
– 递归批量:加 --recursive 参数,连子文件夹里的 PDF 一起处理
转换完成后,AI 就能正常做摘要、提取表格、数据分析这些操作了。
技术上怎么做到的
它背后用了两个工具:
– MarkItDown:负责把 PDF 里的文字和表格提取成 Markdown,保留结构
– PyMuPDF:负责把 PDF 里嵌入的图片单独抽出来
转换结果会放在一个以 PDF 文件名命名的文件夹里,结构是这样的:
report/
img/
page001_img001.png ← 图片按页归类
...
report.md ← 主文本内容
## Extracted Images ← 末尾附图索引
图片不塞进正文,而是统一放在末尾的 ## Extracted Images 章节,方便你按页查阅。
适用场景
这个 Skill 特别适合以下几类人:
📄 法务 / 行政:合同、协议扫描件,让 AI 帮你提取关键条款
📊 数据分析:把 PDF 报告转成文本后批量提取表格数据
📚 研究人员:论文、学术报告,快速做文献摘要和信息整理
📦 运营/销售:产品手册、方案 PDF 一键转可编辑文本
安装方法
在 Claude Code 里一行命令搞定:
npx skills add https://github.com/github/awesome-copilot --skill convert-pdf-to-md
或者直接问 Claude:”帮我把这个 PDF 转成 Markdown”——Skill 会自动激活,引导你完成转换。
一个小提醒
如果 PDF 是纯扫描件(没有文字层),MarkItDown 提取出来是空的。这种情况图片还在,可以告诉用户”OCR 暂不支持,建议手动确认关键页内容”。
GitHub 官方出品,更新活跃,文档清晰。如果你经常处理 PDF,这个 Skill 值得常驻。
👉 GitHub:https://github.com/github/awesome-copilot/tree/main/skills/convert-pdf-to-md
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/convert-pdf-to-md
评论区
登录后可评论。