尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

OCRmyPDF 自动纠偏教程:3 步把歪斜扫描件变成可搜索 PDF

OCRmyPDF 自动纠偏教程:3 步把歪斜扫描件变成可搜索 PDF OCRmyPDF 自动纠偏教程3 步把歪斜扫描件变成可搜索 PDF【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描件的页面常常歪几度、没有文本层直接搜索永远搜不到内容。开源工具 OCRmyPDF 的自动纠偏功能可以帮你校正这些歪斜的页面同时给文档加上一层可搜索的 OCR 文本层隐藏在扫描图像之下、专门供搜索引擎和复制功能使用的文字层。整个过程只需要三步。OCRmyPDF 能替你做什么在动手之前先花 30 秒认识一下这个工具加文本层为扫描 PDF 添加 OCR 文本让全文搜索、文字复制成为可能自动纠偏通过--deskew参数检测每页的倾斜角度并旋转校正图像预处理配合--clean、--unpaper-args等参数清理噪点、处理双页版面并行处理多核心并行几千页的大文档也能跑完它接受 PDF也能直接处理 JPEG、PNG、TIFF 图片所以单张歪斜的照片也能喂给它。一份典型的打字机文档扫描件——这类老旧资料经过 OCRmyPDF 处理后同样可以变成可搜索、可复制的电子文档第一步免费安装 OCRmyPDF先按你的系统选一条安装命令直接复制即可Ubuntu/Debiansudo apt install ocrmypdfmacOSbrew install ocrmypdfHomebrewWindows在 WSL 里执行上面的 apt 命令即可如果你要处理中文文档还需要 Tesseract 的中文语言包sudo apt install tesseract-ocr-chi-sim简体中文或sudo apt install tesseract-ocr-chi-tra繁体中文。更多系统的支持情况可以看 docs/installation.md。第二步一条命令启用自动纠偏这条命令帮你完成核心任务读取input.pdf校正每页的倾斜再附加 OCR 文本层结果写入output.pdf。ocrmypdf --deskew input.pdf output.pdf参数不多但作用明确--deskew打开自动纠偏其余两个位置分别是输入和输出文件。要处理中文内容时可以一次把语言、纠偏、页面旋转都配上——下面这条命令会用简体中文加英文两种语言做识别同时纠偏并把整体方向摆正的页面自动转正ocrmypdf -l chi_simeng --deskew --rotate-pages 中文文档.pdf 已处理文档.pdf文字密集的整页文档——OCRmyPDF 为这类页面补上文本层后其中的每一段话都可以被搜索命中第三步针对棘手文档的组合参数前两步解决普通文档下面几种情况需要组合参数顺带清理画面加上--clean --rotate-pages让 unpaper 引擎在识别前做图像清理--clean与--clean-final均由 unpaper 实现只做图像处理不做 OCR使用--ocr-engine none跳过识别可再配--output-type pdfa直接产出 PDF/A 归档文件双页扫描的书籍告诉底层引擎一张图里有左右两页每页独立清理和纠偏下面这条命令帮你处理一次扫了两页的书影ocrmypdf --clean --clean-final --unpaper-args --layout double --deskew 书籍扫描.pdf 处理后的书籍.pdf--layout double会经--unpaper-args原样转交给 unpaper。注意部分 unpaper 特性会挪动文字位置所以搭配--clean-final在输出图像上也跑一遍清理是更稳妥的做法。参数细节参见 docs/advanced.md。常见疑问与避坑提醒先把几个高频疑问一次说清纠偏会不会拖低识别准确率相反。页面摆正后文本行更符合 OCR 引擎的预期识别结果通常更好。歪得很厉害的页面能救吗支持范围最大可达 ±45 度日常扫描件基本都在覆盖范围内。处理完文件会变大吗一般不会明显增长图像压缩优化后体积有时反而会缩小。能直接扔图片进去吗可以JPEG、PNG、TIFF 都能直接处理不限于 PDF。再记四条避坑习惯大文档先试跑用--pages 1-5只处理前 5 页确认效果别一次性全量跑永远保留原件输出文件名与原件区分开原始扫描件不要覆盖要归档就上 PDF/A--output-type pdfa产出适合长期保存的格式盯进度用-v3详细日志级别能让你看清每一页处理到哪一步彩色地图类文档经过处理后色彩与原貌得以保留同时获得可搜索的文本层想深入再读纠偏到底是怎么做的上面的命令背后是一串四步流程Tesseract 引擎的页面分析先找出各页文本行的走向再由此算出倾斜角度然后对图像做无损旋转最后把摆正的页面交给 OCR 识别。检测精度可以到 0.1 度级别——也就是说肉眼几乎察觉不到的歪斜也会被校正掉。整个过程逐页并行这也是它能扛住大文档的原因。写在最后纠偏本身只占三步里的一小步但它和文本层、清理、PDF/A 输出组合起来覆盖了扫描件数字化最常见的需求。建议从一份你手头歪得最明显的 PDF 开始试起先--pages试跑再全量处理原文件始终留一份。工具保持更新OCRmyPDF 和 Tesseract 语言包都如此新版本的识别效果只会更好。小贴士双页书籍扫描别忘了--unpaper-args --layout double让左右两页各自独立纠偏处理完记得检查-v3日志里有没有报错页面有问题先补页再归档。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表