
MinerU4GB 显存跑通文档解析输出 LLM 可用的 Markdown 与 JSON【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU 场景把一批扫描件和 Office 报告喂进 RAG 管线你正在给 RAG检索增强生成管线喂语料手里是一堆扫描版论文加几份 Office 报告。转成 Markdown 后双栏阅读顺序错乱、跨页表格断成两半、行内公式变成乱码而想调用 72B 级的 VLM视觉语言大模型来救场显存又不够。MinerU 要解决的就是这类问题把 PDF、图片、DOCX、PPTX、XLSX 一次转成结构化 Markdown 和带坐标的 JSON且最低 4GB 显存、纯 CPU 也能跑。MinerU 是什么本地后端的文档解析工具MinerU 是一个文档解析工具当前 3.4.4基于 Apache 2.0 的开源许可。输入 PDF、图片、DOCX、PPTX、XLSX输出 Markdown、middle.json、content_list.json等结构化文件块级带 0–1000 归一化坐标。它和 pdfplumber 这类纯文本提取库的差别在于有布局理解模型公式还原成 LaTeX数学公式标记语言、表格还原成 HTML而不是一串裸字符串它和 72B 级 VLM 服务的差别在资源门槛pipeline 后端最低 4GB 显存、支持纯 CPUOmniDocBench公开文档解析评测集v1.6 得分 86.47与 8GB 显存的 VLM 后端95.30相差约 9 分换来的是 CPU 可运行和更低部署成本。⚙️ 从零跑通装、配、跑、看输出装Python 要求 3.10–3.13用 uvRust 写的加速包管理器装全功能包包含 vlm、pipeline、gradio 三个组件。pip install --upgrade pip pip install uv uv pip install -U mineru[all]配默认从 huggingface 拉模型国内网络切换成 modelscope 镜像源即可不配则保持默认。# 仅国内网络需要首次运行会自动下载模型到本地缓存 export MINERU_MODEL_SOURCEmodelscope跑一条命令完成解析-p是输入文件也支持目录-o是输出目录未传--api-url时 CLI 自动拉起本地临时服务。# GPU 机器Volta 及以后架构或 Apple Silicon默认走 hybrid-engine 后端 mineru -p ./demo/pdfs/demo1.pdf -o ./output # 纯 CPU 或低显存机器显式指定 pipeline 后端 mineru -p ./demo/pdfs/demo1.pdf -o ./output -b pipeline看输出输出目录按后端名和输入文件名分层核心是demo1.md带公式和表格的 Markdown另有*_middle.json含 bbox 坐标的中间结构、*_content_list.json按阅读顺序平铺的块列表、*_layout.pdf每页检测框可视化框上数字是阅读顺序pipeline 后端还会多出*_span.pdf行内 span 标注。首次运行自动下载模型README 建议磁盘 20GB 以上推荐 SSD、内存最低 16GB、推荐 32GB 以上Windows 上 CUDA 加速若不可用按 PyTorch 官网对应版本重装 torch。 能力拆解三个让你愿意换 MinerU 的点公式还原成 LaTeX。你拿到的是行内$...$、独立公式直接成块的 Markdowncontent_list.json里 equation 块的text_format明确标注latex二次开发不用猜。背后是mineru/model/mfr/下的 Unimernet 公式识别模型配合管线层的公式替换逻辑mineru/backend/pipeline/3.4 版本 pipeline 后端换用 PP-OCRv6 后OCR 相关指标提升约 11%OCR 处理速度提升约 100%这些收益直接反映在公式密集文档的吞吐上。表格还原成 HTML跨页自动拼接。你拿到的是能直接渲染的table表题、脚注随表保留跨页断开的表格拼回一张。结构识别实现在mineru/model/table/SLANet 与 UNet 两条路线跨页合并在mineru/utils/table_merge.py同一 OmniDocBench v1.6 上hybrid-engine 后端high95.39 分、vlm-engine 95.30 分明显高于 pipeline 的 86.47 分复杂表格场景建议直接上 8GB 显存的 engine 后端。Office 格式原生解析OCR 覆盖 109 种语言。传 DOCX 不用先转 PDFmineru/model/docx/、mineru/model/pptx/、mineru/model/xlsx/直接读 OOXMLOffice 文档内部 XML 结构README 标注 DOCX 原生解析端到端比先转 PDF 再解析快数十倍扫描件走mineru/model/ocr/的 OCR 链路支持 109 种语言检测与识别扫描版和乱码 PDF 会自动识别并启用 OCR。 选型对比5 个后端的显存与精度取舍后端最低显存OmniDocBench v1.6 得分纯 CPU适用pipeline4GB86.47支持CPU 机器、批量扫描件vlm-engine8GB95.30不支持复杂版面、手写体hybrid-engine默认8GB95.39high/ 95.26medium不支持文本 PDF 与 OCR 混合日常默认hybrid-http-client2GB95.39不需要瘦客户端 远端 OpenAI 兼容推理服务数据来源README「本地部署」后端对比表与 3.3/3.4 更新记录。选型建议没有 GPU 或只有一台 4GB 显存的机器选 pipeline接受 86.47 分的精度换 CPU 可运行单机追求精度就用默认 hybrid-engineeffort取medium比high快 35%–220% 而精度只低 0.13 分已有 vLLM 等推理服务时用*-http-client后端把本地显存压到 2GB。 适用与不适用✓ 推荐场景RAG 语料生产多格式混排PDF 扫描件 Office要带坐标的 JSON 做后续切块公式、表格密集的科技文献、技术报告且机器只有 CPU 或 4GB 显存需要可视化质检_layout.pdf、_span.pdf的批量解析任务✗ 不建议场景要求秒级返回的在线单文档服务本地解析是分钟级应走mineru-api异步接口或远端推理服务极低清扫描、潦草手写OCR 有错误率README 建议先用在线版验证效果再部署只要提取 PPTX 里一张表格直接走mineru/model/pptx/原生解析比截图走 OCR 稳定资源入口源码安装git clone https://gitcode.com/GitHub_Trending/mi/MinerU随后uv pip install -e .[all]官方文档docs/zh/usage/index.md含命令行参数、模型源配置、Docker 部署输出格式说明docs/zh/reference/output_files.mdmiddle.json 与 content_list 字段定义FAQdocs/zh/faq/index.md安装与 CUDA 加速问题大多有现成答案【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考