尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

CnSTD 快速上手:中英文场景文字检测、数学公式检测与版面分析一个包搞定

CnSTD 快速上手:中英文场景文字检测、数学公式检测与版面分析一个包搞定 CnSTD 快速上手中英文场景文字检测、数学公式检测与版面分析一个包搞定【免费下载链接】CnSTDCnSTD: 基于 PyTorch/MXNet 的 中文/英文 场景文字检测Scene Text Detection、数学公式检测Mathematical Formula Detection, MFD、篇章分析Layout Analysis的Python3 包项目地址: https://gitcode.com/gh_mirrors/cn/CnSTD如果你正在搭文档解析流水线要解决的第一件事不是文字说了什么而是文字、公式、表格在图的哪个位置。CnSTD 是一个开源的 Python 3 包基于 PyTorch覆盖场景文字检测STD、数学公式检测MFD和版面分析Layout Analysis三件事装完就能跑自带训练好的模型。它帮你省掉了什么以前想在一张照片里找到文字得自己找模型、转格式、写预处理、一个个调阈值。用 CnSTD 是 pip 装完就能跑模型首次运行自动下载到~/.cnstd目录之后就不用再管它。1. 在图片里定位文字场景文字检测能做什么检测中、英文文字支持带角度的文本框和竖排文字输出 4 点坐标框和置信度还附带裁好并摆正的cropped_img。自研 DBNet 模型db_resnet34测试集 IoU 0.7322和 PP-OCRv4/v5/v6 的 ONNX 版本都有最小的模型约 7.9M。对你意味着什么电商商品图、招牌、中英混排截图直接拿到文字在哪把cropped_img交给 cnocr 识别文字即可不用自己再处理。2. 把数学公式找出来MFD能做什么基于 YOLOv7 架构用英文 IBEM 与中文 CnMFD_Dataset 两个数据集训练区分行内嵌入公式embedding和独立行公式isolated两类。对你意味着什么把教材页、笔记图片转 Markdown 时先用它把公式位置框出来OCR 环节就不会把公式当乱码文字识别。3. 把文档版面拆成块Layout Analysis能做什么同一个LayoutAnalyzer类model_name换成layout即可识别正文、标题、图片、图片标题、表格、表格标题、页眉、页脚、注释、公式共 10 种元素。对你意味着什么论文 OCR、文档归档场景里哪一块是什么由检测结果直接给出不用自己训 YOLO。拿到手就能用的路径不写代码pip install cnstdPython 3.8 及以上依赖 opencv然后在终端跑cnstd predict -i examples/taobao.jpg -o outputs单张图片或整个目录都行cnstd analyze -m mfd同理。写代码from cnstd import CnStdCnStd().detect(examples/taobao.jpg)即得检测结果MFD 与版面分析用LayoutAnalyzer。 仓库scripts/目录还有配合 Label Studio 的标注脚本方便在自己的数据上继续微调。适合谁、什么时候别用适合搭文档解析、OCR 流水线的开发者要在中文文档里定位公式的人想训自己的 DBNet 文字检测模型的人自带cnstd train命令。不适合只做文字识别的人——它只找位置、不认内容识别要配 cnocr 一起用只检测普通物体的场景选更通用的目标检测方案更省事。下一步项目在持续更新最新的 V1.2.82026.07.04加入了 PP-OCRv6 多语种检测模型由作者 breezedeus 一人维护。下一步clone 仓库 https://gitcode.com/gh_mirrors/cn/CnSTD 跑一遍examples/里的示例图看效果遇到坑直接提 issue。✅【免费下载链接】CnSTDCnSTD: 基于 PyTorch/MXNet 的 中文/英文 场景文字检测Scene Text Detection、数学公式检测Mathematical Formula Detection, MFD、篇章分析Layout Analysis的Python3 包项目地址: https://gitcode.com/gh_mirrors/cn/CnSTD创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表