一条命令搞定14种格式!这款Markdown转换神器太实用了

你有没有遇到过这种情况?

AI 给你返回了一堆 # 标题**加粗** 乱七八糟的符号,你直接复制到 Word 里格式全乱,还得手动一行行删。

这就是 Markdown。但问题是——你手里的文件是 PDF、Word、PPT,怎么快速转成 AI 能直接读的 Markdown?

今天挖到一个神器:markdown-converter,来自 GitHub 6.6k+ stars 的独立开发者 steipete

一句话说清楚它是干嘛的

用一条命令,把 PDF、Word、Excel、PPT、图片、音频、网页 全部转成干净的 Markdown。整个过程不需要安装任何软件依赖,直接一条 uvx markitdown 命令搞定。

支持多少种格式?

说出来吓你一跳:

  • 文档:PDF、Word (.docx)、PowerPoint (.pptx)、Excel (.xlsx/.xls)
  • 数据:HTML、CSV、JSON、XML
  • 媒体:图片(OCR 提取文字)、音频(语音转文字)
  • 其他:ZIP 压缩包、YouTube 链接、EPub 电子书

总共覆盖 14+ 种格式,基本涵盖了日常接触的所有文件类型。

实际用起来有多简单?

不需要 pip install,不需要配置环境,直接:

# 转 PDF
uvx markitdown 报告.pdf -o 报告.md

# 转 Word
uvx markitdown 文档.docx > 文档.md

# 从管道输入
cat 文件.pdf | uvx markitdown -x .pdf > 输出.md

第一次运行会自动缓存依赖,之后就是秒级转换。

适合谁用?

  • 做 RAG / 知识库:需要把大量 PDF/Word 丢进向量数据库,先转成 Markdown 结构化文本
  • 喂文档给 AI:把老旧文档快速转成 AI 能理解的格式,丢进 ChatGPT / Claude 处理
  • 批量文档迁移:旧项目文档从 Word/PPT 转成 Markdown 做静态网站
  • 提取视频字幕:直接 uvx markitdown "YouTube链接" 拿到字幕文本

进阶玩法:Azure 文档智能

如果你的 PDF 是扫描件或格式复杂,默认提取可能不完美。加一行参数切换到 Azure Document Intelligence:

uvx markitdown 扫描件.pdf -d -e "https://你的-endpoint.cognitiveservices.azure.com/"

对于图片里的文字、表格结构,识别精度会大幅提升。

总结一下

markdown-converter 解决的是一个很具体但又很高频的痛点:各种格式的文件,如何快速统一成 AI 能处理的 Markdown

一条命令、零配置、支持 14+ 格式。GitHub 6.6k stars + Smithery 1700+ 次安装,社区验证过的实用工具

工具信息
GitHub:https://github.com/steipete/agent-scripts
Skill 文件:skills/markdown-converter/SKILL.md


GitHub: https://github.com/steipete/agent-scripts

评论区

0 条评论

登录后可评论。

白鹿 11 阅读