尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

PaddleOCR数据合成|单卡一晚3000张样本|OCR训练集搭建实践记

PaddleOCR数据合成|单卡一晚3000张样本|OCR训练集搭建实践记 PaddleOCR数据合成单卡一晚3000张样本OCR训练集搭建实践记【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR上周帮一个做票据识别的同事配训练集真实数据只有四百来张数字和特殊字符的覆盖明显不够。我试了PaddleOCR数据合成这条路脚本跑了一晚上产出三千多张合成文本行图片第二天早上训练曲线就比上一轮收敛得快。这篇记录我使用PaddleOCR数据合成工具链的完整过程从装工具、跑通第一批图到混配比的设定。数据合成到底在做什么本质是文本渲染加背景混合数据合成一句话定义把文字渲染到图像上同时自动写好位置和字符标注。可以把它理解成文字版的批量做图先用字体文件把字符画出来再铺到背景上顺手加一点光照、透视、模糊这些效果最后把每个字符的坐标存成标注文件。工具怎么选PaddleOCR官方文档在docs/data_anno_synth/data_synthesis.md里整理了一份工具清单常用的几个对比如下工具解决什么问题一句话说明text_renderer单字符、文本行图像多字体多语言渲染可加噪点、模糊SynthText自然场景文本把文字写进真实照片背景更逼真TextRecognitionDataGenerator简单场景快速生成轻量好上手适合先跑通流程选型的思路很简单要干净文本行就用渲染类工具要街景、书本这种自然场景就选 SynthText 这类背景融合工具。⚡ 跑通第一批合成图克隆仓库并装依赖新终端里执行这三行克隆仓库并装依赖git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR cd PaddleOCR pip install -r requirements.txt执行完用python -c import paddleocr验证一下不报错就算装好了如果报ModuleNotFoundError通常是 Python 版本低于 3.8 或者装到了别的虚拟环境里。用 text_renderer 生成中文文本行text_renderer 是独立的外部包单独装一下pip install text_renderer仓库里已经自带了一组字体放在doc/fonts/目录下中文用simfang.ttf日文用japan.ttc不用再到处找字体文件。具体参数字号、字距、背景色、加噪开关十几个详见该工具的 README 示例我常用的组合是 48 号字、行距 1.5、背景随机灰阶。用真实照片做背景提真实感SynthText 的思路是从真实照片里随机选一块区域渲染文字标注跟着透视一起变。我实际跑的时候200 张背景图配 5000 行文本单卡每小时大约能出 3000 张瓶颈在磁盘 IO 而不是算力建议输出目录挂机械盘。合成数据训练的踩坑记录合成图太假怎么办现象合成图上识别精度 99%真实图片掉 5 个点。原因合成背景太干净没有模糊、光照不均这些干扰。解法后处理加一遍高斯模糊加透视扰动再混入两到三成真实照片做背景真实感能补回来大半。训练集混配比怎么定我实测跑过两组真实与合成 50:50以及 70:30。文本行级任务上 70:30 收敛更快最终精度还高 1 到 2 个点字符级训练可以把合成比例提到五成。如果你的真实数据不足 2000 张建议直接 50:50 起步边训边看验证集。标注对不齐的排查思路现象识别文本正确框却整体偏移。原因加透视时图像变形了标注点没有同步做仿射变换。解法检查标注生成是否和图像用了同一组变换矩阵随机抽 20 张肉眼比对对不齐就重新生成标注文件不要手工修。合成与标注工具链配合使用合成数据是生数据真实数据标注环节省不了。官方文档docs/data_anno_synth/data_annotation.md整理了几个标注工具我配合 PaddleOCR 数据合成用得最多的三个工具擅长什么什么时候用PPOCRLabelOCR 辅助标注新数据批量标注预标注后只改错labelImg矩形标注简单文本区域上手最快VoTT矩形加多边形多人协作、需要统一格式时labelImg 的界面是这样的画框加输入文字两步搞定VoTT 支持多边形和快捷键多人并行标注时用它导出的 JSON 格式比较省心需要标注不规则形状文本时labelme 的多边形模式更顺手这篇文章覆盖了 PaddleOCR 数据合成的工具选型、最小上手路径和混配比设定代码部分只保留了跑通所需的最少命令。下一步可以去看tools/train.py的合成数据接入方式把合成批次直接挂进训练配置里跑一轮完整实验。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表