16万Star的免费Obsidian入库转换神器:微软官方开源 MarkItDown — PDF/Word/PPT 一键转 Markdown
16万Star的免费Obsidian入库转换神器:微软官方开源 MarkItDown — PDF/Word/PPT 一键转 Markdown
原文来自:公众号 obsidian黑曜石 · 2026-07-08 收藏

一句话说清楚它是什么
MarkItDown 是微软 AutoGen 团队开源的 Python 工具,专做一件事:把任何文件转成干净 Markdown。
不是生硬抽文本,而是完整保留标题层级、列表结构、表格、链接——转出来的 Markdown 人看得舒服,AI 读得顺畅。
- GitHub 16 万 Star
- PyPI 周下载量超 150 万
- MIT 开源,免费商用
支持什么格式?20+ 种
| 类别 | 格式 |
|---|---|
| Office | Word (.docx)、PPT (.pptx)、Excel (.xlsx/.xls) |
| 文档 | PDF(含扫描件 OCR)、EPUB |
| 多媒体 | 图片(OCR + 元数据)、音频(语音转写) |
| 数据 | CSV、JSON、XML |
| 网页 | HTML |
| 黑科技 | ZIP 自动解压批量转、YouTube 链接扒字幕 |
最常用的场景:PDF → Markdown,标题、段落、列表分得清清楚楚,比 PyPDF2 抽出的乱文好得多。

3 行代码上手
安装:
pip install 'markitdown[all]'
按需装:
pip install 'markitdown[pdf,docx,pptx]'
Python 调用:
from markitdown import MarkItDown
md = MarkItDown()
result = md.convert("项目报告.pdf")
print(result.text_content)
命令行一行搞定:
markitdown 项目报告.pdf -o 输出.md
Obsidian 最佳搭档
日常流程:
① 拖入文件 → ② MarkItDown 自动转 Markdown → ③ 写入 Obsidian vault
同事发来的 Word 周报、客户给的 PDF 方案、会议录音转写的文本——全部一键变成 Obsidian 笔记。
如果搭了 RAG 知识库或用 AI 做文档分析,MarkItDown 是预处理第一步。大模型读 Markdown 比读 PDF 省 Token、解析更准。

进阶:接大模型做图像描述
PPT 里的图、扫描件里的照片,默认转不出来文字。接上 GPT-4o 即可:
from markitdown import MarkItDown
from openai import OpenAI
client = OpenAI()
md = MarkItDown(llm_client=client, llm_model="gpt-4o")
result = md.convert("季度汇报.pptx")
print(result.text_content)
PPT 里的流程图、架构图——AI 自动生成文字描述,嵌进 Markdown。带图的 PPT 转出来不再是「[图片]」占位符。

谁适合用
- Obsidian 用户:外部文档一键入库,双向链接就绪
- 搭 RAG 知识库的开发者:文档预处理省掉 80% 清洗工作
- 职场人:统一团队文档格式、做 AI 摘要、整理项目资料
- 学生/研究者:课件转笔记、文献整理、录音转文字
❌ 不适合:需要高保真排版(比如出版级 PDF 还原)——MarkItDown 的目标是"让 AI 读懂",不是"让人打印"。

入手方式
pip install 'markitdown[all]'
- GitHub:github.com/microsoft/markitdown
- 16 万 Star,MIT 开源,微软维护,持续更新

🖼️ 文章配图存档

📥 通过 OpenClaw 自动收藏至 Obsidian · 2026-07-08(图片已下载至 attachments 目录)