一条命令搞定14种格式!这款Markdown转换神器太实用了
你有没有遇到过这种情况?
AI 给你返回了一堆 # 标题、**加粗** 乱七八糟的符号,你直接复制到 Word 里格式全乱,还得手动一行行删。
这就是 Markdown。但问题是——你手里的文件是 PDF、Word、PPT,怎么快速转成 AI 能直接读的 Markdown?
今天挖到一个神器:markdown-converter,来自 GitHub 6.6k+ stars 的独立开发者 steipete。
一句话说清楚它是干嘛的
用一条命令,把 PDF、Word、Excel、PPT、图片、音频、网页 全部转成干净的 Markdown。整个过程不需要安装任何软件依赖,直接一条 uvx markitdown 命令搞定。
支持多少种格式?
说出来吓你一跳:
- 文档:PDF、Word (.docx)、PowerPoint (.pptx)、Excel (.xlsx/.xls)
- 数据:HTML、CSV、JSON、XML
- 媒体:图片(OCR 提取文字)、音频(语音转文字)
- 其他:ZIP 压缩包、YouTube 链接、EPub 电子书
总共覆盖 14+ 种格式,基本涵盖了日常接触的所有文件类型。
实际用起来有多简单?
不需要 pip install,不需要配置环境,直接:
# 转 PDF
uvx markitdown 报告.pdf -o 报告.md
# 转 Word
uvx markitdown 文档.docx > 文档.md
# 从管道输入
cat 文件.pdf | uvx markitdown -x .pdf > 输出.md
第一次运行会自动缓存依赖,之后就是秒级转换。
适合谁用?
- 做 RAG / 知识库:需要把大量 PDF/Word 丢进向量数据库,先转成 Markdown 结构化文本
- 喂文档给 AI:把老旧文档快速转成 AI 能理解的格式,丢进 ChatGPT / Claude 处理
- 批量文档迁移:旧项目文档从 Word/PPT 转成 Markdown 做静态网站
- 提取视频字幕:直接
uvx markitdown "YouTube链接"拿到字幕文本
进阶玩法:Azure 文档智能
如果你的 PDF 是扫描件或格式复杂,默认提取可能不完美。加一行参数切换到 Azure Document Intelligence:
uvx markitdown 扫描件.pdf -d -e "https://你的-endpoint.cognitiveservices.azure.com/"
对于图片里的文字、表格结构,识别精度会大幅提升。
总结一下
markdown-converter 解决的是一个很具体但又很高频的痛点:各种格式的文件,如何快速统一成 AI 能处理的 Markdown。
一条命令、零配置、支持 14+ 格式。GitHub 6.6k stars + Smithery 1700+ 次安装,社区验证过的实用工具。
工具信息
GitHub:https://github.com/steipete/agent-scripts
Skill 文件:skills/markdown-converter/SKILL.md
评论区
0 条评论
登录后可评论。