还在为 PDF/Word 转 Markdown 发愁?这个微软开源工具直接把文件喂给 AI
还在为 PDF/Word 转 Markdown 发愁?这个微软开源工具直接把文件喂给 AI
如果你经常把文档丢给 ChatGPT、Claude 或本地大模型,一定遇到过这种崩溃时刻:PDF 里的表格乱成筛子,Word 的格式全丢,Excel 数据提取出来一堆乱码。 手动复制粘贴?那叫一个酸爽。
今天给实用工具控们推荐一个能救命的开源 Skill:Microsoft MarkItDown。它不是普通的格式转换器,而是专为 LLM 场景设计的「文档转 Markdown 管道」。一句话总结:把各种乱七八糟的文件,一键变成大模型最爱吃的 Markdown。
它到底能转什么?
MarkItDown 的格式覆盖相当全面,而且还在持续扩展:
- 办公文档:PDF、Word(.docx)、Excel(.xlsx/.xls)、PowerPoint(.pptx)
- 富媒体:图片(EXIF 元数据 + OCR 识别)、音频(元数据 + 语音转写)
- Web/数据格式:HTML、CSV、JSON、XML、ZIP 文件
- 特殊格式:EPUB、YouTube 链接
不管是单文件拖进去,还是批量处理整个文件夹,CLI 一行命令就能出结果。
为什么说它特别适合 AI 工作流?
很多格式转换工具追求「高保真排版」,但 MarkItDown 的定位完全不同——它追求的是「语义完整 + Token 友好」。
输出是 Markdown,这恰好是 GPT-4o、Claude、Gemini 等主流模型原生理解的格式。标题、列表、表格、链接这些结构都被保留,token 消耗也比 HTML 或纯文本低得多。
实际场景里,你可以用它快速搭建 RAG 知识库、把会议纪要 PPT 转成可搜索文本、把客户 Excel 报表喂给 AI 做分析,甚至结合 Azure Content Understanding 做结构化字段提取。
上手有多简单?
安装只需一行 pip:
pip install 'markitdown[all]'
然后命令行直接转:
markitdown report.pdf > report.md
Python 调用也不复杂,三行代码搞定:
from markitdown import MarkItDown
md = MarkItDown()
result = md.convert("test.xlsx")
print(result.text_content)
如果需要 OCR 识别图片里的文字,或者接 Azure 做更高精度的文档理解,也有对应的扩展和插件,按需安装即可。
总结
MarkItDown 不追求花哨的界面,而是做了一件很实在的事:打通「本地文件」到「AI 可读文本」的最后一步。 如果你正在做知识库、RAG、AI 办公自动化,这个工具值得放进你的工具箱。
GitHub 地址:https://github.com/microsoft/markitdown
评论区
登录后可评论。












