PDF转Markdown,让AI真正读懂你的文档——GitHub官方出品

你有没有遇到过这种情况——收到一份 PDF 合同/报告/论文,想让 AI 帮你摘要或提取关键数据,结果 AI 一脸懵,说”读取失败”?

这不是 AI 的问题,是 PDF 格式本身的问题。PDF 是打印格式,不是给程序读的文本格式,直接塞给 AI 只能得到一堆乱码或空白。

GitHub 官方出的这个 convert-pdf-to-md Skill,就是专门解决这个问题的。

它能做什么

一句话:把 PDF 转成干净的 Markdown,让 AI 直接读懂内容。

支持三种核心操作:
– 单文件转换:丢一个 PDF进去,出来一个 .md 文件和同名文件夹(图片单独存放)
– 批量转换:丢一整个文件夹进去,自动处理里面所有 PDF
– 递归批量:加 --recursive 参数,连子文件夹里的 PDF 一起处理

转换完成后,AI 就能正常做摘要、提取表格、数据分析这些操作了。

技术上怎么做到的

它背后用了两个工具:
– MarkItDown:负责把 PDF 里的文字和表格提取成 Markdown,保留结构
– PyMuPDF:负责把 PDF 里嵌入的图片单独抽出来

转换结果会放在一个以 PDF 文件名命名的文件夹里,结构是这样的:

report/
    img/
        page001_img001.png  ← 图片按页归类
        ...
    report.md              ← 主文本内容
    ## Extracted Images   ← 末尾附图索引

图片不塞进正文,而是统一放在末尾的 ## Extracted Images 章节,方便你按页查阅。

适用场景

这个 Skill 特别适合以下几类人:

📄 法务 / 行政:合同、协议扫描件,让 AI 帮你提取关键条款
📊 数据分析:把 PDF 报告转成文本后批量提取表格数据
📚 研究人员:论文、学术报告,快速做文献摘要和信息整理
📦 运营/销售:产品手册、方案 PDF 一键转可编辑文本

安装方法

在 Claude Code 里一行命令搞定:

npx skills add https://github.com/github/awesome-copilot --skill convert-pdf-to-md

或者直接问 Claude:”帮我把这个 PDF 转成 Markdown”——Skill 会自动激活,引导你完成转换。

一个小提醒

如果 PDF 是纯扫描件(没有文字层),MarkItDown 提取出来是空的。这种情况图片还在,可以告诉用户”OCR 暂不支持,建议手动确认关键页内容”。

GitHub 官方出品,更新活跃,文档清晰。如果你经常处理 PDF,这个 Skill 值得常驻。

👉 GitHub:https://github.com/github/awesome-copilot/tree/main/skills/convert-pdf-to-md


GitHub: https://github.com/github/awesome-copilot/tree/main/skills/convert-pdf-to-md

评论区

0 条评论

登录后可评论。

林小秋 140 阅读