
MinerU 实战三步把复杂 PDF 文档转成 LLM 可用的 Markdown【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU把文档喂给 RAG 知识库或 Agent 工作流之前第一步往往卡在同一处多栏排版的论文、扫描版合同、夹带公式和表格的 PDF用常规工具提出来的文本顺序混乱、结构尽失。MinerU 是一个开源的高精度文档解析引擎可以把 PDF、图片以及 DOCX、PPTX、XLSX 转成保留版面和阅读顺序的 Markdown 与 JSON直接供大模型消费。MinerU 是什么从 PDF 到结构化 Markdown 与 JSONMinerU 的定位是面向 LLM 时代的文档数据准备工具输入是 PDF、图片、Office 文档输出是按人类阅读顺序排好的 Markdown、JSON 和带丰富版面信息的中间格式。核心能力集中在三件事上版面检测与阅读顺序还原单栏、多栏、复杂混排都能处理表格识别转 HTML、公式识别转 LaTeX以及对扫描件和乱码页的自动检测与 OCR支持 109 种语言。页眉、页脚、脚注、页码这类噪声元素会在解析时被自动剔除文本语义保持连贯。从官方架构看MinerU 分为五层预处理层做元数据提取、乱码检测和扫描版识别模型层负责 layout 检测、公式检测和文本 OCR管线层做坐标修复、表格合并、段落合并等模型数据处理输出层产出可视化结果、Markdown 和 content list质检层则针对论文、教材、试卷、研报等多类文档做了 benchmark 覆盖。各阶段的中间态统一落到 middle_json 里任何一步出了问题都能定位修正这是它做批量生产时比较稳的原因之一。MinerU 本地部署的三步流程第一步是安装。Python 环境执行pip install mineru[all][all]包含全部核心功能兼容 Windows、Linux 和 macOS想装源码版本可以克隆仓库https://gitcode.com/GitHub_Trending/mi/MinerU后运行uv pip install -e .[all]。第二步是准备模型。首次解析时 MinerU 会自动下载所需模型并缓存之后直接复用本地缓存。如果网络无法访问默认模型源执行export MINERU_MODEL_SOURCEmodelscope切换到国内镜像即可这一步不需要改任何代码。第三步是解析。一条命令搞定mineru -p 输入路径 -o 输出路径输入可以是单个文件也可以是整个目录批量处理。没有 GPU 的设备加上-b pipeline即可在纯 CPU 环境下运行。跑完之后输出目录里按文档分好文件夹Markdown、提取出的图片和结构化 JSON 都在里面这就是完整闭环。版面检测与阅读顺序多栏文档怎么不乱序论文、教材这类多栏版面是最常见的翻车场景朴素地从上到下抽文本会把左右两栏的内容交错公式还会插到错误的段落中间。MinerU 的做法是在模型层并行跑 layout 检测和公式检测再由管线层对坐标做修复与排序把版面还原成人类阅读顺序同时把页眉页脚、页码作为无用区块移除。效果是抽出来的 Markdown 按先左栏后右栏的顺序连贯流动公式留在原位标题层级保留。图中这种 layout 可视化是随解析一起产出的页面上每个区块都被标注了类型正文、标题、公式批量解析时可以拿它直接做人工质检不用逐份翻原文对结果。表格与公式解析PDF 表格转 HTML、公式转 LaTeX合同里的价格表、研报里的数据表、论文里的推导公式是文档转换里最容易碎的两块内容。MinerU 对表格走结构识别路线识别结果直接输出为 HTML 表格标签并支持跨页表格合并、表格内嵌图片和公式的场景公式部分基于 UniMERNet 系列模型转成 LaTeX 源码行间公式和公式序号都能处理。实际效果是表格不再是错位的一行行纯文本公式是可以再次渲染的 LaTeX入库或渲染时基本不用手工修。MinerU 解析后端怎么选pipeline 还是 hybridMinerU 提供三类后端选择逻辑不复杂。pipeline 后端走传统 CVOCR 管线纯 CPU 就能跑硬件要求最低在官方 OmniDocBench v1.6 端到端评测中得分 86.47hybrid-engine 混合原生文本提取与 VLM 引擎精度更高high 档 95.39但需要 Volta 及以后架构的 GPU 或 Apple Silicon、8GB 显存vlm-engine 则纯走视觉语言模型。日常建议有 GPU 就用默认的 hybrid-engine只有 CPU 就用 pipeline。还有两个开关值得知道。parse_methodauto会自动判断当前页该走文本提取还是 OCR扫描件和文本 PDF 混排也不用手动切换hybrid 后端的effort分 medium 和 high 两档3.3 版官方数据显示 medium 相比 high 综合精度只降低 0.13解析速度在不同平台上提升 35% 到 220%默认就是 medium追求极致精度时再切 high。落地场景RAG 知识库、扫描件数字化与 Office 文档转换搭建 RAG 或 Agent 应用的开发者通常把 MinerU 放在数据准备的第一环把产品手册、API 文档、行业报告批量解析成 Markdown 和按阅读顺序排的 JSON因为输出保留了标题层级和段落结构后续切分 chunk 的边界更干净向量检索的命中质量也更好。MinerU 有 Dify 官方插件也可通过 LangChain、RAGFlow 等框架直接调用。如上图所示在 Dify 市场安装 MinerU 插件后文档解析可以直接作为工作流节点使用无需单独部署解析服务其他框架同理都是调用现成接口。法律与档案工作者处理扫描版合同、档案卷宗时走的是另一条路parse_methodauto自动识别出扫描页并触发 OCR支持 109 种语言中英文混合的涉外合同也能处理解析同时清掉页眉、页码等噪声产出的 Markdown 可以直接被检索、引用用于条款比对或沉淀进合同知识库。3.4 版本已将 OCR 模型升级到 PP-OCRv6官方评测中 OCR 指标提升约 11%、处理速度提升约一倍千页级档案的批量数字化因此更实际了。文档管理员还多了一个选择MinerU 3.0 起支持 DOCX 原生解析3.1 补齐 PPTX 和 XLSX不必再走先转 PDF 再解析的中间环节官方数据比传统流程快一个数量级。Word 合同、PPT 材料、Excel 台账和 PDF 可以走同一条管线输出格式统一方便归档和二次处理。写在最后MinerU 把文档转换这件事收敛成了一条可以批量、稳定、可质检的流水线一条命令进结构化 Markdown 和 JSON 出精度和硬件需求之间还有多档后端可选。快速开始指南docs/zh/quick_start/官方中文文档docs/zh/解析后端核心源码mineru/backend/【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考