
MarkItDown 使用指南把 PDF、Word、Excel 转成 Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown把文档喂给大模型之前多数人要先手动复制粘贴、重新整理格式表格和标题层级经常在这一步丢光。MarkItDown 是一个开源的 Python 文档转 Markdown 工具能把 PDF、Word、Excel、HTML、EPUB、CSV、音频等 20 多种格式统一转成保留标题、列表、表格和链接的 Markdown 文件本地运行即可适合做 RAG 知识库、文档问答、批量文本分析这类场景的开发者使用。它选择 Markdown 作为输出格式并非随意Markdown 接近纯文本、标记极少主流大模型在训练时接触过大量 Markdown 内容理解起来更省力token 消耗也更低。需要说明的是MarkItDown 的输出主要是给文本分析工具消费的——它保真的是文档结构而不是排版效果。如果你要的是给人看的高保真打印级文档它不是合适的选择。适合谁用不适合谁用适合这三类人正在构建 RAG、文档问答、智能检索应用需要把存量办公文档变成可索引文本的开发者需要批量提取 Word、Excel、PPT 内容的运营或数据分析人员一条命令就能处理整批文件文档里有扫描图片或内嵌图片、想把图中文字也提取出来的团队可以配合官方 OCR 插件或 Azure 文档智能服务。不太适合追求所见即所得排版还原的用户它的目标是让机器读懂而不是替人排版无法安装 Python 3.10 及以上环境的使用者期望开箱即用处理视频文件的用户视频转换必须走 Azure Content Understanding 云端。如何安装 MarkItDown 并跑通第一条转换命令要求是 Python 3.10建议放在虚拟环境里。安装只需一行pip install markitdown[all][all]会装齐全部格式依赖。如果只处理 PDF 和 Word用pip install markitdown[pdf, docx]就够了环境更干净。装完即可在终端使用markitdown命令markitdown paper.pdf -o paper.md也支持管道比如cat 数据.csv | markitdown 结果.md。在 Python 里则只需几行from markitdown import MarkItDown md MarkItDown() result md.convert(report.xlsx) print(result.text_content)result.text_content是转换后的纯文本result.markdown是完整 Markdownresult.metadata里还有文件元数据可以直接进流水线。四个值得留意的能力转换后文档结构不丢普通文本提取工具往往只给一坨拍平的文字MarkItDown 会把文档骨架一起带过去Word 里的标题变成对应层级的#标题Excel 的行列变成 Markdown 表格网页中的链接保持可点击。对 LLM 来说章节关系和表格行列正是理解文档的关键线索这一步省掉了大量后处理。依赖按格式拆分每种格式对应一个独立的可选依赖组如[pdf]、[docx]、[xlsx]、[pptx]、[xls]、[outlook]、[audio-transcription]、[youtube-transcription]。做 PDF 处理的服务器不必背着 PPT 的依赖跑按需安装即可。插件机制让 LLM 视觉补上 OCR官方插件 markitdown-ocr 会把 PDF、Word、PPT、Excel 中内嵌图片里的文字交给视觉大模型识别不需要额外安装传统 OCR 引擎或二进制依赖。插件默认关闭用markitdown --list-plugins查看已安装插件转换时加--use-plugins参数启用如果不配置 LLM 客户端插件会静默跳过 OCR、回退到内置转换器。可选的云端增强默认转换完全本地完成不依赖网络。遇到扫描件、复杂表格或者需要从发票、合同里抽取结构化字段金额、日期、条款时可以接入 Azure Document Intelligence 或 Content Understanding后者还支持音频和视频。注意这些是计费的云端 API 调用可按需限定哪些格式走云端。迷你工作流一篇论文 PDF 怎么变成可用的文本输入一份论文 PDF。项目测试目录里就放着一份样本论文AutoGen 论文首页它代表了 MarkItDown 日常要处理的典型文档形态上面这张图是测试资产中的论文首页包含标题、作者列表、图表和摘要等结构。处理执行markitdown paper.pdf -o paper.md转换器识别文本层把标题、作者、摘要、图注按原顺序写入 Markdown标题层级和列表结构保留在 paper.md 中。输出一份 paper.md人可以直接读更重要的是可以切片建索引或直接交给 LLM 生成文献综述、抽取关键词章节脉络依然完整。使用提醒限制与权限输出面向机器消费不保证高保真排版多栏版式、复杂图文混排的还原能力有限。格式支持取决于安装的 extras没装[pdf]的实例转换 PDF 会直接报错先按目标格式装依赖。安全方面MarkItDown 以当前进程权限读写文件。处理来路不明的输入前应先校验路径和内容服务端场景建议只调用最窄的convert_local()或convert_stream()而不用通用的convert()。云端增强会产生计费调用且视频转换只有这条路径支持纯本地使用时留意大文件的内存占用。延伸入口各格式转换器实现packages/markitdown/src/markitdown/converters/每种格式一个文件想改某个格式的行为从这里入手OCR 插件源码与测试样本packages/markitdown-ocr/第三方插件开发示例packages/markitdown-sample-plugin/照它就能给自己的格式写一个插件。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考