
3 条命令让扫描 PDF 可检索OCRmyPDF 做 OCR PDF 转换【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描出来的 PDF 文字是图片怎么选都复制不出来。OCRmyPDF 帮你把可检索文本层垫到图片下面是一款免费的 OCR PDF 转换命令行工具识别文字和原图精确对齐。它凭什么比隔壁强不少 OCR 产品要开 GUI、拖文件、等进度。这个是纯命令行装好之后一条命令就能跑可以直接塞进脚本或者计划任务里。它离线运行文件不出你的机器。Tesseract 引擎内置装好语言包就能识别中文、日文等上百种语言不用单独调包。输出默认是 PDF/A长期归档格式归档场景不用再转一遍。我用下来三个月体感是结果稳复制粘贴对得准省了不少校对时间。第一次跑起来要装什么Debian/Ubuntu 上用官方包管理器是最短路径# 中文注释主程序和OCR引擎一次装齐 sudo apt install ocrmypdf tesseract-ocrmacOS 把这一行换成brew install ocrmypdf tesseract。然后一条命令就出结果# 中文注释输入扫描文件输出可搜索版本 ocrmypdf input.pdf output.pdf输入不一定是 PDFJPG、PNG 也行# 中文注释扫描图片直接转成带文本层的文档 ocrmypdf scan.jpg output.pdf这就是典型的扫描页。处理完之后图片里每个字下面都垫了一层隐形文字。跑完终端长这样每一步都有进度条然后是图像优化比例最后验证输出是合法的 PDF/A。原图没动只是多了文本层。出结果后你用平时的阅读器打开就行页面和原来长得一样但现在能选中、能复制、能搜索了。真正好用的几个点下面是我使用频率最高的三个参数加一个习惯用法。中文文档加个语言参数就行场景最常见的就是中英混排的合同、论文或者纯中文的古籍。# 中文注释同时识别简体中文和英文 ocrmypdf -l chi_simeng input.pdf output.pdf混排文字一次识别完中英文不打架复制出来不乱码。注意系统里要先有对应语言包sudo apt install tesseract-ocr-chi-sim后缀换成你需要的语言。页面歪了、图像脏先让它修场景扫描件经常是斜的图上还有噪点直接识别准确率会掉。# 中文注释先把页面摆正、去噪点再识别 ocrmypdf --deskew --clean input.pdf output.pdf跑完页面是正的图像干净了识别率明显高细字体文档尤其受益。扫描特别差的件再加个--threshold 0.5做二值化弱文本更容易认出来。想导出文本校对生成侧车文件场景识别结果要人工复核或者你只要一份纯文本。# 中文注释处理同时导出一份纯文本文件 ocrmypdf --sidecar text.txt input.pdf output.pdfoutput.pdf 照常带文本层text.txt 是纯文本。用任意编辑器打开就能直接改错字改完再和 PDF 对照。一整个文件夹并行开起来命令不用变加个--jobs 4就行。8 核机器上实测大概是 3 倍速度。文件页数特别多时可以配合--skip-big跳过大页。只想处理其中几页用--pages 1-5指定。输出本来就是 PDF/A 归档格式需要写标题作者就加--title和--author归档时很顺手。别踩这几个坑⚠️ 症状命令跑完了输出和输入一模一样。原因原 PDF 自带文本层默认会跳过这些页。解法加--redo-ocr强制重新识别。❌ 症状报 Language not installed 或找不到语言。原因语言包没装。解法先sudo apt install tesseract-ocr-chi-sim换成对应代码再重跑。⚠️ 症状macOS 上apt install提示找不到命令。原因macOS 没有 apt。解法改用brew install ocrmypdf tesseract。它适合谁扫描件文字清晰、以印刷体为主的文档它最拿手合同、论文、古籍、说明书批量加脚本场景特别稳。手写体、严重模糊、褪色的页面它干不动那种得看专门的手写识别模型或者先把图扫清晰一点再跑。商业云 OCR 服务在超低质量手写上有优势但文件要上云按你的场景取舍。继续深入安装说明覆盖 macOS、Windows、FreeBSD 等平台高级参数说明优化、元数据和校验的细节【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考