尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR:截图和扫描件本地变文本的离线OCR工具

Umi-OCR:截图和扫描件本地变文本的离线OCR工具 Umi-OCR截图和扫描件本地变文本的离线OCR工具【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上季度部门把300页扫描版PDF甩给我要求整理成可搜索的文档。在线OCR要么要账号要么就是把合同页一张张传上云端怎么看都不合适。最后我用了一个叫 Umi-OCR 的开源离线OCR工具截图识别、批量图片OCR、文档识别到双层可搜索PDF全部在本机完成不联网、不上传、免费。先跑起来发行版是一个.7z压缩包也有自解压的.7z.exe解压后直接双击Umi-OCR.exe启动没有安装步骤也不需要联网。软件支持 Windows 7 x64 及以上Linux x64 用同目录的umi-ocr.sh启动即可。启动后是一个标签页界面默认打开截图OCR页旁边还有批量OCR文档识别二维码全局设置几个标签左上角可以切换窗口置顶右上角能锁定标签页防止误触关闭。第一次打开时界面语言会按系统自动切换。核心能力按工作流走代码截图识别缩进原样保留打开截图OCR页用快捷键唤起截图划选屏幕区域后左侧出原图预览右侧记录栏列出历次识别结果每条带置信度和时间。记录可以编辑、划选复制在别处复制过图片的话也可以直接粘贴进来识别。真正有用的是右侧设置里的文本后处理 - 排版解析方案。识别代码截图时选单栏-保留缩进行首缩进和行中空格都会保住识别完直接复制进编辑器不用再手动对缩进。学术论文这类多栏版面则选多栏-按自然段换行让段落顺序读起来顺。一批300张图含水印也不怕几百张带水印的截图、几十张发票丢进批量OCR页就行。它支持jpg, png, webp, bmp, tif等格式没有数量上限结果可保存为txt, jsonl, md, csv(Excel)。左栏是文件名、耗时、置信度的任务列表右栏是逐张的识别文本。水印有固定位置的话进右栏设置的忽略区域编辑器按住右键画几个矩形框框内的文字会在任务中被丢弃。注意它忽略的是整个文本块而不是单个字符所以矩形要画得大一些把水印可能出现的位置完全包住。跑完几百张后还可以勾选任务完成后自动关机或待机。从扫描件到可搜索的双层PDF文档识别页接受pdf, xps, epub, mobi, fb2, cbz格式内嵌文本的文档直接提取纯扫描的走OCR最后可以输出双层可搜索PDF——原文保留在底层上层是可选中复制的文字层。这一页同样支持忽略区域适合排掉每页固定的页眉页脚也支持任务完成后自动关机/休眠。二维码标签页顺便提一句支持19种协议截图、粘贴、拖入图片都能读码一图多码也没问题反向输入文本还能生成二维码图片。再挖深一点命令行批处理主程序本身就是命令行入口前提是全局设置里的HTTP服务保持开启默认就是开的。把几个路径一起传进去结果追加写进一个文件umi-ocr --path D:/img1.png D:/img2.png D:/scan_folder --output_append result.txt--screenshot配合screen0 rectx,y,w,h可以免鼠标划选对固定区域自动截图识别所有指令支持前缀简写参数用--clip复制到剪贴板、--output写入文件。HTTP接口调用默认端口1224。先调GET /api/ocr/get_options能拿到当前OCR引擎支持的全部参数定义和默认值不用翻手册然后向POST /api/ocr发一张 base64 编码的图片就返回识别结果。文档识别是上传、轮询状态、生成、下载、清理五步流程仓库里带了现成示例Pythondocs/http/api_doc_demo.pyWebdocs/http/api_doc_demo.html把这套接口接进自动化脚本或小网页工具比自己再包一层OCR引擎省事得多。踩过的坑命令行/HTTP调用没反应跨进程通信依赖本地HTTP服务。去全局设置确认HTTP服务没被关掉主机保持仅本地即可。超长截图识别不全引擎默认把边长超过 960px 的图压缩这是速度优先的默认值。在页面设置里把限制图像边长调高2880 / 4320大图精度就上来了。忽略区域没生效它是按整个文本块丢弃的框太小、只包住半个字就不会触发。矩形画大、把水印位置完全盖住。批量跑几百张太慢换 RapidOCR 引擎、适当调低图像边长限制或者分批跑并勾选任务完成后待机。接着看docs/README_CLI.md命令行手册含范围截屏和指令简写docs/http/README.mdHTTP接口手册OCR / 文档 / 二维码三套接口CHANGE_LOG.md版本更新日志UmiOCR-data/py_src/Python源码界面QML源码在 UmiOCR-data/qt_res/UmiOCR-data/plugins/离线OCR引擎插件目录PaddleOCR 与 RapidOCR 在这里切换回到开头那份300页的扫描PDF现在可以直接拖进文档识别页出一版可搜索的双层PDF交差。下一步可以试的是拿同一批图分别在 PaddleOCR 和 RapidOCR 引擎下跑一遍对比耗时和准确率挑一个留作默认引擎。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表