LLM读PDF总乱码?这个开源Skill让大模型精准理解文档结构
做 AI 应用开发,你一定遇到过这个问题:丢给大模型一份 PDF,它要么乱码、要么把表格读成一坨乱文字、图表信息全部丢失。
最近发现一个开源 Skill,精准解决这个问题——PDF2md-by-MinerU-api-skill。
它做了什么
这个 Skill 本身不处理 PDF,它是一个”智能中间层”:当你的 AI Agent(Claude Code、Cursor、Gemini CLI 等)需要读取用户上传的 PDF 时,自动调用 MinerU 官方 API,把 PDF 转成对机器友好的 Markdown。
关键效果:
- 保留表格结构,不是图片里的表格,是真正可检索的 Markdown 表格
- 自动抽取图片并本地保存
- 复杂排版(双栏、跨页、公式)都能还原
- 大幅减少 LLM 的 Token 消耗——直接喂 Markdown 比喂原始 PDF 便宜得多
技术细节
底层调用的是 MinerU(GitHub: opendatalab/MinerU),这是一套开源的 PDF 解析引擎,背后是 TextIn 的能力。
安装流程很直接:
- 注册 TextIn 拿 API Token(90天有效)
- pip install -r requirements.txt
- 配置 MINERU_API_TOKEN 环境变量
- 把 Skill 文件夹放到 Agent 能读到的路径
配合 Claude Code 使用时,只需要在对话里提”帮我读一下这个 PDF”,Agent 就会自动触发 Skill,完成解析。
适合谁
如果你有以下场景,这个 Skill 直接降维打击:
- 需要让 AI 分析论文、报告、合同
- 在 RAG 流程里处理非结构化文档
- Agent 需要提取 PDF 里的图表数据做进一步处理
Token 消耗降低是最实际的好处——同样一份 50 页 PDF,原始 PDF 可能吃掉 10 万 Token,用这个 Skill 转成 Markdown 后通常只要几千。
总结
PDF2md-by-MinerU-api-skill 是一个连接 AI Agent 和 PDF 文档的桥梁,解决的是”大模型读不好 PDF”这个高频痛点。开源免费,搭个 TextIn 账号就能跑。
GitHub: https://github.com/lilyuan258/PDF2md-by-MinerU-api-skill
GitHub: https://github.com/lilyuan258/PDF2md-by-MinerU-api-skill
评论区
0 条评论
登录后可评论。