尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

3 分钟上手:用 MarkItDown 把办公文档转成 Markdown 完整实战指南

3 分钟上手:用 MarkItDown 把办公文档转成 Markdown 完整实战指南 3 分钟上手用 MarkItDown 把办公文档转成 Markdown 完整实战指南【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown手上一堆扫描版 PDF 要喂给大模型之前得先变成可检索的文本PPT 里的图表、Word 里的表格也得摊平成模型能读懂的结构化文字。MarkItDown 是一个轻量的 Python 工具把 PDF、Word、PPT、Excel、音频、HTML 等格式的文件转成保留标题、列表、表格等结构的 Markdown配 LLM 视觉插件还能识别扫描件里的文字。为什么值得放进你的文档处理链路 它的设计目标不是像素级还原排版而是给 LLM 和文本分析管道喂一份干净、结构化、省 token 的输入——主流大模型本身就说Markdown转换结果可以直接进模型。几个实用点保留文档结构标题、列表、表格、链接在输出中都有对应表示而不是拍平成一段纯文本格式覆盖广办公文档、音频、HTML、CSV/JSON/XML、ZIP、EPub 等都能转插件机制装上第三方的markitdown-ocr插件即获得 LLM 视觉 OCR 能力识别扫描页和文档内嵌图片CLI 与 Python API 双通道命令行一键转换Python 里几行代码嵌进脚本3 分钟拿到可验证的结果pip install markitdown[all] markitdown report.pdf -o report.md第一行装齐所有格式的依赖第二行把 PDF 转成 report.md——打开文件标题和表格都还在。如果只想装部分格式把[all]换成具体 extras 即可见下文进阶部分。三个典型使用场景场景一用 LLM 视觉 OCR 把扫描件变成可检索文本谁有这个需求财务、档案、医疗从业者要把发票、医疗报告扫描件送进搜索或大模型而扫描页的文字画在图片里内置解析器提不出来。怎么操作先装插件和 OpenAI 客户端pip install markitdown-ocr openai然后from markitdown import MarkItDown from openai import OpenAI md MarkItDown(enable_pluginsTrue, llm_clientOpenAI(), llm_modelgpt-4o) print(md.convert(invoice_scan.pdf).text_content)结果长什么样插件自动检测无文字可提取的扫描页按 300 DPI 渲染后整页发给视觉模型识别出的文字以*[Image OCR] ... [End OCR]*块的形式插回文档对应位置——既能全文搜索又不破坏原有版式顺序。下面这张项目测试文件就是这类图文混排输入的典型代表场景二给 PPT 和图片自动生成图片描述谁有这个需求做文档问答或知识库时PPT/图片里的内容模型看不见需要把图变成文字。怎么操作传入llm_client和llm_model可用llm_prompt定制描述要求该能力目前作用于 PPT 和图片文件from openai import OpenAI md MarkItDown(llm_clientOpenAI(), llm_modelgpt-4o, llm_prompt用三句话概括这张图的信息) print(md.convert(chart.jpg).text_content)结果长什么样输出的 Markdown 里图片原位置会带上模型生成的描述文本下游检索时相当于读到了图里的内容。这张图就是项目里用来验证 LLM 描述行为的官方测试图文字指令加红色圆形、蓝色方形场景三命令行批量处理办公文件谁有这个需求要归档一整批 PPT、Word 的人不想逐个打开转换。怎么操作一条命令直接转或管道喂给它markitdown quarterly_report.pptx -o report.md cat notes.docx | markitdown结果长什么样PPT 按页组织成带大纲结构的 Markdown 写入 report.md管道输入的 docx 转换结果直接打到终端方便随手抽查转换质量。进阶与调参按需装依赖pip install markitdown[pdf, docx, pptx]只装三种格式的依赖比[all]轻很多适合最小化部署。定制 LLM 提示词llm_promptExtract all text from this image, preserving table structure.对发票、报告类专项文档更稳覆盖默认的提取提示。无扩展名时给类型提示cat raw.bin | markitdown -x pdf用-x告诉 MarkItDown 输入类型-m参数还能指定 MIME type。避坑提醒 ⚠️转某种格式报不支持异常→ 没装该格式的可选依赖按 extras 补装如pip install markitdown[pdf]核心包本身不含格式解析器。OCR 输出里没有识别文字、也没报错→llm_client/llm_model没传或插件未启用插件会静默回退到内置转换器先跑markitdown --list-plugins确认ocr插件已装。LLM 接口报错密钥失效、额度不足、模型不支持视觉→ 插件把错误降级为警告并继续转换结果是文档正文保留、仅缺该图文字检查密钥换支持视觉输入的模型。服务端应用把用户上传的文件直接喂给它→ 不要将不可信输入直接传给convert()先做校验改调更严格的convert_local()或convert_stream()。从这里开始你的下一次转换先把手头一份 PDF 转出 Markdown 看看结构还原度再把 OCR 插件和描述提示词按场景打开。更多参数和云端转换选项如 Document Intelligence、Content Understanding在两份官方文档里项目主文档README.mdOCR 插件文档packages/markitdown-ocr/README.md【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表