尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

PaddleOCR 完整上手指南:3 步跑通多语言 OCR 与文档结构化

PaddleOCR 完整上手指南:3 步跑通多语言 OCR 与文档结构化 PaddleOCR 完整上手指南3 步跑通多语言 OCR 与文档结构化【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR扫描件、PDF、图片里的文字是喂给大模型前最麻烦的一环版面乱、语言杂、表格和公式混排。PaddleOCR 是一套开源的轻量级 OCR 工具包把文字检测、文字识别、文档结构化收敛成一条产线把任意 PDF 或图像转成结构化数据支持 100 种以上语言。项目能做什么4 类核心能力拆解先把边界画清楚PaddleOCR 能覆盖的能力大致分四类能力一句话说明端到端 OCR检测 识别一条龙复杂版面、多语言混合图文都能出带坐标的结果文档结构化PP-StructureV3 产线做版面分析、表格结构识别、公式与印章识别整页 PDF 转 Markdown / Word关键信息抽取从发票、表单、病历等单据中抽取出姓名、金额、日期等键值对多语言识别覆盖 100 种以上语言多语言模型对韩文、日文、德文、法语等 80 种语言有专门优化从 0 到 13 步跑通第一个 PaddleOCR 示例第 1 步装推理引擎PaddleOCR 3.x 提供 PaddlePaddle 与 Transformers 两套推理引擎二选一即可。这里以 CPU 端飞桨为例python -m pip install paddlepaddle3.2.0 -i https://www.paddlepaddle.org.cn/packages/stable/cpu/ # GPU 端改为 paddlepaddle-gpu包名后按实际 CUDA 版本选择对应的源这条命令装的是底层推理引擎PaddlePaddle 3.x 是 PaddleOCR 3.x 的硬性要求GPU 用户只需按 CUDA 版本切换安装源。第 2 步装 PaddleOCR 本体python -m pip install paddleocr[all]装完就能用[all]表示带上文档解析、信息抽取、翻译等全部可选依赖只跑通用 OCR 的话改成pip install paddleocr更轻量各依赖组对应哪些功能见docs/version3.x/installation.md。第 3 步3 行代码跑通第一次识别from paddleocr import PaddleOCR ocr PaddleOCR( use_doc_orientation_classifyFalse, # 关方向分类 use_doc_unwarpingFalse, # 关扭曲矫正 use_textline_orientationFalse, # 关行级方向分类 ) for res in ocr.predict(./general_ocr_002.png): res.print() res.save_to_img(output) res.save_to_json(output)这段脚本对图片做检测 识别并把识别框标注图与 JSON 结果存到output目录三个开关都是关掉文档预处理子模块普通拍平的图片上关掉跑得更快。不想写脚本的话命令行一行等价paddleocr ocr -i ./general_ocr_002.png --use_doc_orientation_classify False --use_doc_unwarping False --use_textline_orientation False。典型场景实战从一张名片到一整页文档场景一名片文字提取——最简单的结构化入口输入一张英文名片照片PaddleOCR 检测出每个字段所在的文本框并逐框识别直接给出姓名、职位、邮箱、电话的结构化结果每个字段带置信度。左侧是原始名片右侧是带检测框的识别结果CRR-TECHNOLOGIES、William Ferguson、邮箱、电话全部命中输出就是rec_texts数组加坐标丢进数据库或 LLM 提示词都不用二次清洗。这类单行、少字段的场景是最适合验证链路是否跑通的起点。场景二整页英文报告结构化——复杂版面交给 PP-StructureV3整页文档才是 PaddleOCR 的主战场表格、公式、多栏文本、印章混排。PP-StructureV3 产线一次完成版面分析、表格结构识别与文字识别paddleocr pp_structurev3 -i ./pp_structure_v3_demo.png \ --use_doc_orientation_classify False --use_doc_unwarping False跑完在输出目录得到.json与.markdown两份文件Markdown 可直接喂给 LLM。以这份医疗报告为例检验项目、患者结果、参考区间三列被完整解析成表格结构LOW等异常值标记逐行识别下方诊断段落保持原段落顺序——右侧每一格绿框、红框都是产线定位出的版面元素。对 RAG 场景的价值在于表格不再被拍平成乱序纯文本LLM 读到的顺序与版面一致。注意首次运行会自动下载所需模型预留几分钟。进阶技巧3 个新手高频坑与解法坑一PaddlePaddle 版本不匹配。现象是import paddleocr或首次 predict 时报RuntimeError/ 算子缺失原因是环境里装着飞桨 2.x而 PaddleOCR 3.x 依赖 3.0 及以上版本。解法python -m pip install -U paddlepaddle3.2.0对齐版本版本对照见docs/version3.x/installation.md。坑二大图小字漏检。现象是整页扫描件上密集小字整行丢失原因是图像长边超过 960 像素时会被等比缩小再送检测小字被缩没了。解法预测时把det_db_box_thresh从默认 0.5 调小到 0.3 观察召回同时用det_limit_side_len放大参与检测的边长调参前先拿 20 张自己业务的样图做阈值对比别盲调。坑三首次运行卡在下载。现象是第一条命令半天没输出甚至超时报错原因是每个模型首次使用都会从远端下载到本地缓存网络不通就卡住。解法先在能联网的环境把目标模型跑一遍生成缓存再同步到目标机器或者改用 Transformers 引擎装好transformers5.8.0后在命令行加--engine transformers、在代码里加enginetransformers切换不依赖飞桨。总结与下一步PaddleOCR 把文字检测、文字识别、文档结构化收敛成一个包输出直接是 LLM 能读的 Markdown 和 JSON。建议下一步按docs/version3.x/installation.md把环境与你的设备对齐再翻一遍docs/FAQ.md——检测漏检、模糊文本、印章干扰这类高频问题在 1.5 节垂类场景实现思路里都有现成解法。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表