尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

用 MinerU 把 40 页扫描合同变成可检索的 Markdown,只需 5 分钟

用 MinerU 把 40 页扫描合同变成可检索的 Markdown,只需 5 分钟 用 MinerU 把 40 页扫描合同变成可检索的 Markdown只需 5 分钟【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU周五下午五点你把一份 40 页的扫描版合同丢进MinerU等吃完工作餐输出目录里已经躺着一份可以全文检索的 Markdown——原来手动复制、重排要花两个小时的活儿现在压到 5 分钟以内文档里的表格还保持完整。MinerU 是一款开源免费的文档解析工具核心能力就是把 PDF 和 Office 文档转成机器可读的 Markdown 与 JSON喂给大模型或知识库前不再需要人工整理。MinerU 能做什么三种格式进三种格式出MinerU 支持 PDF、图片以及 DOCX、PPTX、XLSX 作为输入输出 Markdown、按阅读顺序排好的 JSON 和信息丰富的中间格式。解析过程中它会剥掉页眉页脚、脚注、页码这类噪音保留标题层级和阅读顺序公式转成 LaTeX表格转成 HTML。说白了它交出来的不是乱码文字流而是大模型能直接消费的结构化内容。完整链路走一遍喂文件 → 开开关 → 看结果喂文件命令行入口就一条命令mineru -p 合同.pdf -o output/合同.pdf换成目录也能批量处理CLI 会在后台自动拉起本地临时服务不用你自己起服务。Linux 和 macOS 上会自动尝试 cuda/mps 加速纯 CPU 环境也能跑。开这几个开关无论走 Dify 插件、Cherry Studio 还是 API 入口解析参数都一致重点看三个表格识别合同里有付款计划、条款清单就打开、公式识别纯商务合同可以关、解析方式默认auto文字版 PDF 走文本抽取扫描版自动转 OCR不用你区分。语言提示默认ch后端类型可选 pipeline、hybrid-engine、vlm-engine。看结果并质检输出目录里是现成的 Markdown、按阅读顺序排的 JSON 和提取出来的图片。别急着入库先打开可视化结果过目一遍layout 图能直接看到每个表格、段落、公式被框在哪框歪了哪页有问题一目了然。表格还原与 109 种语言 OCR两个真正解痛点的能力合同里的金额表直接还原成 HTML 表格。法律文档最折磨人的往往是表格付款计划、条款对照表、数据统计。MinerU 用独立的表格结构识别模型处理输出 HTML 表格表头和单元格内容都保住Markdown 里不会出现金额跑到哪一列去了的错位。这部分实现放在 mineru/backend/pipeline/想弄清原理可以翻源码。扫描件和中英混排合同交给 OCR。扫描版 PDF 会被自动检测并启用 OCR支持 109 种语言的检测与识别涉外合同里中英条款混排一份文档直接解析不用拆开分别处理。OCR 相关模型结构在 mineru/model/ocr/基于 PaddleOCR 体系改造。数字说话时间到底省了多少40 页扫描合同手工复制粘贴约2 小时表格还要手工重排MinerU 单机解析5 分钟以内普通文字版 PDF单文件一般几十秒出结果产出Markdown / JSON / 中间 JSON 三种格式OCR 覆盖109种语言具体数值因机器和是否上加速而异量级感受就一句话从一个下午变成一杯咖啡。谁适合以及怎么接进现有流程法务和文档管理员直接用命令行把整个合同目录批量跑一遍结果进知识库就能全文检索。开发者用mineru-api起 FastAPI 服务/tasks异步提交、轮询取结果多机多卡场景再加一层mineru-router编排。仓库里有个能直接改着用的 Python 示例demo/demo.py。插件用户在 Dify、Coze、Cherry Studio 等平台都有现成插件或 MCP工作流里串上传文件 → 解析 → LLM三个节点即可不用自己部署解析服务。我踩过、提前告诉你的坑第一次跑一定慢——模型是首次使用时自动下载的。国内网络连不上 huggingface 的话设一行环境变量MINERU_MODEL_SOURCEmodelscope就能换源别傻等超时。扫描质量决定 OCR 上限。图太糊模型再好也认不对。解析前先把 PDF 翻两页看看清晰度低清扫描件不如重扫。表格还原不到位先看 span 可视化再定位。span 图把每个文本块逐框标出哪段被合并、哪行被切断一眼可见比对着成品 Markdown 逐行找快得多。更细的参数、部署方式和 API 说明直接看官方文档的快速开始指南docs/zh/quick_start/。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表