
PaddleOCR 营业执照识别怎么做从跑通第一张图到字段抽取【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR把营业执照、发票、票据这类证照图片变成可编辑、可入库的文本数据PaddleOCR 的 Python 接口和命令行都能完成先检测文字位置再识别内容配合 PPStructureV3 管线还能解析版面、还原表格、导出 Markdown。本文面向第一次安装使用的读者按跑通最小示例 → 场景用法 → 模型选型 → 问题排查的顺序讲一遍代码均可在本地直接执行。 先看三块核心能力这一节说明 PaddleOCR 拿到一张图后每一步输入什么、得到什么方便你判断该用哪个入口。文本检测 文本识别PaddleOCR管线。输入是一张证照图片处理时分两步检测模型先给出每个文字行的四边形位置框识别模型再逐行输出字符串和置信度输出是一个结果对象rec_texts是文字列表rec_scores是对应的置信度调用res.save_to_img(output)可以保存画了框的效果图res.save_to_json(output)保存结构化结果。默认引擎已包含文档方向分类和弯曲矫正等预处理正放且清晰的图可以关掉以省时间。版面解析PPStructureV3管线。输入是一张结构复杂的文档图处理时先做版面区域检测文字块、标题、表格、图片等再对表格区域做结构识别、对印章区域做识别、对公式区域做识别输出可以是 JSON 或 Markdownres.save_to_markdown(output)。营业执照、发票这类带印章和多栏版式的证照用这条管线比纯 OCR 管线拿到的信息更完整。字段抽取。营业执照需要的统一社会信用代码、法定代表人、注册资本、成立日期等字段不在模型输出里单独成列——它们都在识别结果的文本列表里。做法是遍历rec_texts用正则或关键词匹配把值对应到字段上再拼成字典或写入数据库。字段名固定的证照这一步通常几十行规则就能覆盖不需要额外训练。 最小可运行示例这一节给出最短路径装好依赖、跑一张图先求通再谈参数。python -m pip install paddleocr[all]from paddleocr import PaddleOCR ocr PaddleOCR( use_doc_orientation_classifyFalse, # 关闭方向分类 use_doc_unwarpingFalse, # 关闭弯曲矫正 use_textline_orientationFalse, # 关闭行方向判断 ) result ocr.predict(license.jpg) for res in result: for text, score in zip(res[rec_texts], res[rec_scores]): print(text, round(score, 4))第一次predict会自动下载默认模型之后走本地缓存。三个use_*开关控制预处理方向分类处理倒置的图弯曲矫正处理卷曲扫描件行方向判断处理竖排文字行证照图大多正放清晰关掉三个开关单张耗时会更低。想保存画框图或 JSON在循环里加res.save_to_img(output)、res.save_to_json(output)即可。完整参数说明见 docs/quick_start.md。 什么材料、什么环节会用它财务核对进项发票一批扫描件按目录批量识别把predict的输入从单个路径换成文件路径列表再逐张落库核对金额、税号字段。证照档案数字化营业执照、开户许可证等入库前批量转文本配合上一节说的字段匹配规则生成标准数据表减少人工录入。移动端拍照回传手机拍的证照常带倾斜或阴影初始化时保持use_doc_orientation_classify和use_doc_unwarping默认开启预处理兜底服务端部署时再按需关闭。⚖️ 模型怎么选、参数往哪调按部署位置先定档再按精度要求微调。识别模型精度数据取自官方文档 docs/version3.x/inference_deployment/local_inference/cpp/OCR.md。部署位置建议模型识别精度 (Avg %)模型大小说明服务器 / GPU 节点PP-OCRv5_server_rec默认86.3881 MB精度优先复杂版式更稳普通笔记本 CPUPP-OCRv5_mobile_rec81.2916 MB换约 5 个点精度体积小、快边缘设备 / 移动端PP-OCRv4_mobile_rec78.7410.5 MB极致轻量容忍精度损失有 GPU 时按 docs/quick_start.md 安装对应paddlepaddle-gpu推理吞吐会上一个台阶纯 CPU 部署优先 mobile 档模型比换机器便宜得多。调优主要动三处一是上面三个use_*预处理开关按输入质量取舍二是检测参数limit_side_len大图高分辨率扫描适当调大可改善小字漏检代价是耗时上升三是识别模型档位如表所示切换。 出问题时按现象查现象首次运行卡在下载或下载失败。原因是模型首次自动拉取网络不稳或内网环境容易中断。处理在内网机器上预先把模型包下好放到 PaddleX 的模型缓存目录再运行确认安装的是paddleocr[all]完整功能。现象扫描件上部分文字没被检测到。原因通常是图像模糊或分辨率过低检测阶段就漏了。处理提高扫描分辨率仍漏检时调大检测的limit_side_len让模型看到更大尺寸的特征图。现象旧项目代码在 3.x 上直接报错。原因是 2.x 的use_angle_cls、langch这类参数在 3.x API 中已变更。处理按 docs/quick_start.md 的写法迁移预处理统一改为use_doc_orientation_classify、use_doc_unwarping、use_textline_orientation三个开关语言由模型本身决定不再单独传lang。小结PaddleOCR 的完整链路是预处理 → 检测 → 识别 → 结构化输出本地一条命令即可跑通证照场景再叠上 PPStructureV3 做版面与表格解析按硬件选模型档位即可。安装细节见 docs/quick_start.md模型清单与精度数据见 docs/version3.x/inference_deployment/local_inference/cpp/OCR.md。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考