尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

MarkItDown转Markdown完整教程:一条命令把PDF、Word、Excel批量转成Markdown

MarkItDown转Markdown完整教程:一条命令把PDF、Word、Excel批量转成Markdown MarkItDown转Markdown完整教程一条命令把PDF、Word、Excel批量转成Markdown【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownMarkItDown 是一个 Python 开源工具把 PDF、Word、Excel、PPT、HTML、音频、图片等常见文件转成保留结构的 Markdown解决文档格式五花八门AI 管道却只吃文本的麻烦。它适合要批量转 Markdown 文档给 LLM 用的开发者、做素材整理和内容再创作的人以及需要把报告、表格喂进 RAG 流程的普通用户。装完一条命令就能转完第一个文件批量目录也只需一行 for 循环。项目简介与核心能力速览MarkItDown基于 Python 的轻量级文件转 Markdown 转换工具为 LLM 和文本分析场景而生。结构保真 — 标题、列表、表格、链接等以 Markdown 语法保留不只是抓一堆纯文本格式覆盖广 — PDF、PPTX、DOCX、XLSX、HTML、EPUB、CSV、JSON、XML、音频、图片、ZIP、YouTube 链接均可转命令行与管道 — 一条命令转换支持 stdin/stdout天然适合写进脚本Python API — 三个不同宽度的转换入口按场景取最小权限调用插件机制 — 第三方插件可扩展新格式markitdown-ocr插件可为文档内嵌图片加 OCR 说明云端可选 — 可接 Azure Document Intelligence 或 Content Understanding 提升扫描件质量安装 MarkItDown 与运行环境系统要求Python 3.10 及以上Windows、macOS、Linux 均可。官方建议用虚拟环境避免依赖冲突。python -m venv .venv source .venv/bin/activatepip 安装推荐pip install markitdown[all][all]会装齐所有格式的可选依赖只想转少数格式时按需安装更小pip install markitdown[pdf,docx]源码安装git clone https://gitcode.com/GitHub_Trending/ma/markitdowncd markitdown pip install -e packages/markitdown[all]Docker 部署可选docker build -t markitdown:latest .docker run --rm -i markitdown:latest report.pdf out.md容器方式不用本地 Python 环境文件走标准输入输出干净省事。核心使用流程三步转完一批文件Step 1 验证命令可用目的确认安装成功。运行markitdown -v输出类似markitdown 0.1.6的版本号说明命令行入口已就绪。Step 2 转换第一个文件目的跑通一次完整的 PDF 转 Markdown。假设当前目录有report.pdf运行markitdown report.pdf -o report.md成功后同目录生成report.md内容包含原文档的标题层级、段落和表格。不加-o时结果直接打到终端也可以重定向markitdown report.pdf report.md。Step 3 批量转换多个文件目的把一整个目录的文档转成 Markdown。两种做法for f in docs/*.pdf; do markitdown $f -o out/$(basename $f .pdf).md; done或者把文档打成一个docs.zip直接markitdown docs.zip -o docs.md内置 ZIP 转换器会逐个处理压缩包内每个文件并合并输出文件夹级批量转换就这一步的事。Step 4 看一眼输出长什么样用仓库自带的测试图test_llm.jpg包含文字与几何图形做转换演示能直观看到输出质量对这类图片文件转换结果是 EXIF 元数据加上 LLM 生成的图像描述对 PDF、Excel 等文件输出则是带结构的正文。拿到report.md后检查标题和表格是否符合预期再放进你的 LLM 管道即可。常用参数与三种运行模式速查参数类型作用默认值-o, --output字符串输出文件路径标准输出-x, --extension字符串文件扩展名提示用于管道输入自动识别-m, --mime-type字符串MIME 类型提示自动识别-c, --charset字符串字符编码提示如 UTF-8自动识别-d, --use-docintel开关改用 Azure Document Intelligence 云端提取关-e, --endpoint字符串Document Intelligence 端点无--use-cu开关改用 Azure Content Understanding 云端提取关-p, --use-plugins开关启用已安装的第三方插件关典型修改场景管道输入或文件没有扩展名时加提示参数告诉工具文件类型markitdown -x pdf scan.pdf cat data.csv | markitdown -x csv -c GBKPython 脚本里调用则不用记参数from markitdown import MarkItDown md MarkItDown() print(md.convert(report.xlsx).markdown)Docker 与 CLI 怎么选CLI 是默认形态装好 pip 包后markitdown 文件路径即可参数即配置。Docker 把同样的入口打包进镜像适合不想动本地环境的场景文件从标准输入进去、标准输出出来。MCP 服务器模式给本地 Agent 用的第三种形态。安装markitdown-mcp包后运行markitdown-mcp --http --host 127.0.0.1 --port 3001它只暴露一个convert_to_markdown(uri)工具支持 http、file、data 三种 URI。HTTP 模式默认只绑本机适合接 Claude Desktop 这类本地客户端默认 STDIO 模式则直接markitdown-mcp启动。进阶批量、图片说明、扫描件与插件批量导入for 循环适合每个文件一个 md的归档场景ZIP 方式适合合并成一份的场景。图片加 LLM 说明场景 — PPT 和图片里常有图纯文本丢失信息。配置from openai import OpenAI md MarkItDown(llm_clientOpenAI(), llm_modelgpt-4o)效果 — 转换 PPTX 或图片时自动附上模型生成的图像描述任何 OpenAI 兼容客户端都能传进来不配置则跳过。扫描件与复杂表格场景 — 扫描 PDF 没有文本层本地转换效果有限。配置markitdown scan.pdf -d -e 你的端点或改用--use-cu --cu-endpoint 端点。效果 — 云端 OCR 与版面分析输出质量明显提升注意每次调用都是计费的 Azure API 请求Content Understanding 还支持字段提取和音视频。MCP 服务器接入本地 Agent场景 — 想让 Agent 自己读文档。配置 — 按上节命令启动并在客户端配置里指向该镜像或命令。效果 — Agent 调用convert_to_markdown即可拿到任意文件的内容。第三方插件场景 — 需要内置之外的格式。配置 — 例如pip install markitdown-ocr再在命令行加-p、在 Python 里传enable_pluginsTrue。效果 — 该插件给 PDF、DOCX、PPTX、XLSX 的内置转换器加上基于 LLM 的图片 OCR 能力不需要额外装 ML 库。常见问题与排错Q转换时提示缺少依赖或无法识别格式结论只装了基础依赖对应格式的 extras 没装。看报错里提到的格式比如 pdf运行pip install markitdown[pdf]补装想省心就重装markitdown[all]。Qcat file | markitdown报无法识别结论管道输入没有扩展名信息工具猜不出格式。加-x提示如cat report.pdf | markitdown -x pdf必要时再配-m或-c或者干脆直接传文件路径绕开管道。QDocker 里访问本地文件失败结论容器看不到宿主机文件系统。加挂载参数如docker run --rm -it -v /home/user/data:/workdir markitdown:latest在容器内引用/workdir/文件名重新运行转换命令。Q扫描件转出来是空的或乱码结论本地转换器只能提取文本层扫描图没有文本层。改用--use-docintel -e 端点或--use-cu --cu-endpoint 端点走云端或安装markitdown-ocr插件并配置 OpenAI 兼容客户端注意云端方案均产生 API 费用。写在最后MarkItDown 的价值一句话一条命令把 PDF、Word、Excel 转成保留结构的 Markdown还能顺手批量处理一整个目录。下一步挑一个你手边的文档目录跑一遍 Step 3 的批量命令检查输出结构是否符合预期。转换不理想的格式、或者想支持的类型欢迎去项目 Issues 里提交你的需求。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表