
MinerU WebUI 实战指南3 步把 PDF 变成 Markdown【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU给大模型整理语料时最费时间的环节常是把扫描版 PDF、带公式的论文转成干净的 Markdown而命令行参数一多就劝退。MinerU Gradio WebUI 把这件事搬进了浏览器上传文件、选后端、点转换就能得到带公式和表格结构的 Markdown 与 JSON。读完这篇文章你可以做到用几条命令装好 MinerU 并启动本地 WebUI上传 PDF、图片、DOCX、PPTX、XLSX拿到渲染视图、原始文本和 JSON 三种输出按自己的硬件在pipeline、hybrid-engine、vlm-engine之间做选择✅ 处理端口占用、模型下载失败、扫描件识别差这几类高频卡点安装 MinerU 并启动 WebUI先确认环境Python 需要 3.10–3.13本地解析后端最低 16GB 内存推荐 32GB、20GB 磁盘。装核心包只需一条命令mineru[all]已包含 WebUI 所需的全部依赖并会按系统带上 vLLMLinux、LMDeployWindows或 MLXmacOSpip install -U mineru[all]国内网络如果拉不动默认的 huggingface 模型源在启动前把模型源切到 modelscope 即可export MINERU_MODEL_SOURCEmodelscope然后执行启动命令默认监听 7860 端口mineru-gradio --server-name 0.0.0.0 --server-port 7860浏览器打开http://127.0.0.1:7860就能看到界面。--server-port默认 7860 → 可改成任意空闲端口 → 端口被占用时才需要改。首次启动会自动下载模型进度看终端日志。从源码安装需要改代码或跟进最新提交时从源码装更直接git clone https://gitcode.com/GitHub_Trending/mi/MinerU cd MinerU uv pip install -e .[all]完成你的第一次 PDF 转 Markdown打开页面后是左右双栏左侧控制右侧预览与输出。把文件拖进上传区支持 PDF、常见图片和 DOCX、PPTX、XLSX。上传后右侧立刻出现文档预览可以直接翻原页对照。上传之后界面上会多出这几项解析后端下拉框默认选中hybrid-engine标注Hybrid 推荐下文单独讲怎么选。最大转换页数滑动条初始拉满上限由--max-convert-pages决定默认 1000 → 可滑到 1~上限之间 → 文档很大、只想先转前几页时往左拖。高级选项点开后是表格识别、公式识别、图片分析、OCR 语言、强制 OCR 等开关默认状态已经适合大多数文档不必每项都碰。点转换后状态面板会依次走完准备请求 → 检查服务 → 提交任务 → 排队 → 解析 → 下载结果 → 整理输出 → 完成。长文档解析期间左侧的结果文件区域先出现打包好的完整输出含中间文件右侧三个标签页同步刷新Markdown 渲染公式按 LaTeX 显示、Markdown 文本可整段复制、JSON 内容列表按阅读顺序的结构化数据。输出文件的完整清单见输出文件说明。顺手一提在启动目录放一个examples文件夹里面丢几份常测的 PDF--enable-example默认 true → 可改成 false → 不想要示例入口时才改WebUI 会列出这些文件点一下就能直接开转省得反复上传。选对解析后端五个公开后端的硬件与精度要求如下精度为 OmniDocBench v1.6 端到端总分后端精度最低显存纯 CPUpipeline86.474GB✅hybrid-engine默认95.39high/ 95.26medium8GB❌vlm-engine95.308GB❌vlm/hybrid-http-client与对应本地后端一致2GB✅两个容易忽略的点hybrid-engine有解析强度选项effort默认medium→ 可切high→ 需要图片分析或最高精度时切 highmedium 不支持图片分析但快不少。两个 http-client 后端是轻量客户端把推理放到远端 OpenAI 兼容服务上。vlm-http-client本地连 torch 都不用装hybrid-http-client需要本地具备mineru[pipeline]依赖。想启用远端选项启动时加--enable-http-client true默认 false → 只在这一个值上切换 → 你要接 vLLM、SGLang、LMDeploy 等已部署服务时才开随后在界面服务器地址里填服务地址。按硬件和使用目标做取舍走这张决策图长文档、扫描件与 Office 文件长文档怎么喂--max-convert-pages默认 1000 → 可改到 1 页起步 → 显存吃紧或只想抽样检查时调小。MinerU 3.0 起解析链路带滑动窗口机制并支持流式落盘超长文档不再需要手工切分成小段直接整份上传即可。扫描件和 OCR 语言OCR 语言下拉框默认选中chOCR 覆盖 109 种语言自 3.4 版本起日、繁中、英、拉丁语场景统一路由到ch模型选项更简洁了。强制启用 OCR默认关闭 → 只有开关一个状态 → 仅在识别效果极差时打开且要先选对 OCR 语言。LaTeX 分隔符样式由--latex-delimiters-type控制默认all→ 可取a仅$风格、b仅()[]风格→ 下游渲染只认一种分隔符时才改。Office 文件走原生解析通道上传后识别选项会自动收起取而代之的是在线预览区该预览依赖外部 Microsoft 服务点不再提示可关闭转换本身不受影响。解析结果不对劲时怎么办先做质量自检。下载的结果文件里带可视化调试页layout.pdf用色块标出每个内容块类型右上角数字是阅读顺序专治顺序乱了、块认错了span.pdf仅pipeline后端生成用彩色线框标出文本片段排查丢字、行内公式未识别很方便。自检之后还定位不了对照下表逐项排现象原因处理启动即提示端口占用7860 已被占用--server-port 7861换端口模型下载慢或中断默认模型源访问不畅设置MINERU_MODEL_SOURCEmodelscopeWindows 上推理明显慢CUDA 版 torch 未装对按显卡架构安装对应 CUDA 的 torch/torchvisionLinux 下中文等文字缺失系统缺 CJK 字体安装fonts-noto-cjk后执行fc-cache -fv扫描件整页乱码或空段落OCR 语言选错选对 OCR 语言必要时开强制启用 OCR更细的安装与运行问题比如 WSL2 缺libgl、Blackwell 显卡装 LMDeploy在官方 FAQ里基本都有现成答案想看界面逻辑WebUI 核心源码也值得翻一翻。先装包、再启 WebUI、传一份手头的 PDF 走完转换流程整个过程不到十分钟。第一次跑通后把effort、OCR 语言和最大页数按你的文档习惯调一遍之后基本就是拖文件、等结果。本文基于 MinerU 3.x 编写各参数与界面文案以官方文档为准版本迭代后建议对照 使用指南 复查一遍。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考