尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR 离线OCR终极攻略:截图识别、批量识别、PDF扫描件一网打尽

Umi-OCR 离线OCR终极攻略:截图识别、批量识别、PDF扫描件一网打尽 Umi-OCR 离线OCR终极攻略截图识别、批量识别、PDF扫描件一网打尽【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR深夜加班同事发来一份扫描版PDF合同。你想引用其中一段条款全选、复制屏幕上却只有一行提示——无法从此PDF复制文字。这正是很多人的日常而 Umi-OCR 这款免费、开源、完全离线的 OCR 文字识别软件就是要终结这种抓狂。Umi-OCR 把识别引擎整个搬进你的电脑截图、图片、PDF扫描件里的文字统统在本地变成可复制、可搜索的文本全程不出你的电脑不用注册、不用联网、不计次数。这篇文章会像带旅行团一样陪你走完四段任务先花三分钟把它请进电脑再依次攻克屏幕文字随抓随用几百张图片一次处理扫描版PDF变成可搜索档案三座山头最后把软件调得更顺手甚至装进你自己的命令行工作流。我们出发。先看能力地图这个离线工具到底能替你干什么很多人一听到 OCR 就头大觉得是技术活。别急先记住一句话OCR 就是把图片里的文字抠出来变成可以复制、编辑、搜索的文本。Umi-OCR 就是这个抠字工具只不过它把识别引擎整个搬到本地离线也能干活。开跑之前先看一张能力地图心里有个数能力典型场景一句话说明截图识别看到一段文字想立刻复制划个框文字就出来批量识别几十上百张图片要处理拖进去一起识别文档识别扫描版PDF、电子书变成可搜索的双层PDF忽略区域水印、页眉页脚碍事画个框自动无视二维码扫码 / 生成码19种码制通吃命令行与HTTP接口想把识别塞进自己的脚本程序化调用表格里的前四行就是下面四站要逐个攻克的真实任务。第一站 三分钟跑起来免安装的完整上手步骤Umi-OCR 是绿色软件不需要安装这也是它最讨喜的地方。上手一共三步下载从项目发布页拿到.7z压缩包或.7z.exe自解压包。如果电脑没装压缩软件选自解压包双击就能解开。解压解压到任意目录比如D:/Tools/Umi-OCR。路径里尽量不要带中文和空格能省掉很多莫名其妙的兼容问题。启动Windows 下双击Umi-OCR.exeLinux 下运行umi-ocr.sh就这样没有安装向导也没有注册流程。第一次启动时软件会自动读取你电脑的系统语言把界面切成对应语言想手动改随时去全局设置里调。有个容易忽略的细节启动前最好把软件目录加进杀毒软件白名单。因为 Umi-OCR 内置了本地 OCR 引擎和运行库部分杀软会误报加白名单能少很多为什么一开就闪退的烦恼。打开后你会看到软件主体像浏览器一样由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置都在其中。左上角可以切换窗口置顶右上角能锁定标签页防止日常使用中手滑关掉。第二站 截图OCR屏幕上看到的文字随抓随用的方法日常最高频的场景就是看到一段文字想立刻复制。切到截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏。几个很实用的小习惯不用截图也能识别在别处复制一张图片比如聊天窗口里回到 Umi-OCR 直接粘贴它照样帮你识别。结果可以二次编辑右侧记录栏里的文字能直接改错还能划选多条记录一起复制识别完顺手整理成你想要的格式。竖排文字也不怕排版解析会自动处理横排和竖排从右到左的文本只要识别引擎本身支持竖排即可。排版解析给OCR结果排座位OCR 引擎吐出来的文字往往是散装的谁先谁后、怎么断行需要排版解析来安排。Umi-OCR 内置了多套预设方案选对方案输出的文本才符合阅读习惯方案适用场景多栏-按自然段换行两栏/三栏排版的论文、书籍自动按段落断行最常用多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制整段合并成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理识别引擎原始输出不做整理其中单栏-保留缩进值得单独点名表扬把代码截图扔进去输出能基本保持缩进结构。下图左边是原始代码截图右边是排版解析后的识别结果行首缩进和空格都保住了。如果你不确定选哪个直接选多栏-按自然段换行就好它能覆盖大多数场景遇到特殊排版再逐个切换对比。第三站 批量OCR几百张图片一次处理的完整流程截图识别只是开胃菜。遇到几十上百张截图、扫描件、相册照片一张张去截屏就太亏了。切到批量OCR标签页把图片直接拖进窗口一次拖几百张也没数量上限支持jpg、png、webp、bmp、tif、tiff等常见格式。点下开始任务右侧会逐张显示文件耗时、置信度和识别结果。任务跑完可以按需输出成 txt、jsonl、md、csv 四种格式——csv 用 Excel 直接就能打开。如果你习惯深夜挂机跑任务它还支持任务完成后自动关机或待机睡前扔进去几百张图醒来直接拿结果。忽略区域让水印、页眉页脚自动隐身批量识别有个高频痛点图片角落的水印、LOGO、页眉页脚每次都会混进识别结果还得人工删。Umi-OCR 的忽略区域功能就是为这个设计的。在批量识别页右侧设置里进入忽略区域编辑器按住鼠标右键在图片上绘制多个矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被自动排除。做学术论文批量转换时用这个功能把统一的页眉页脚一次框掉输出会干净很多。这里有个必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住否则漏框一次结果里就混进一行杂音。另外批量任务还支持中途暂停v2.1.2 起只要软件不退出待机、休眠后回来可以继续跑不用重新开始。第四站 文档识别扫描版PDF转可搜索文本的快速方法如果说前面是热身文档识别就是 Umi-OCR 的压轴戏。它支持 pdf、xps、epub、mobi、fb2、cbz 六种格式其中扫描版PDF是最典型的应用场景。底层逻辑可以概括为三步解析 → 识别 → 重组。PDF 先被解析引擎拆开区分出本来就有的文本层和需要OCR的扫描图片层扫描图片交给本地 OCR 引擎逐页识别最后按阅读顺序重新拼装输出成你指定的格式。有两个亮点值得展开双层可搜索PDF这是很多人的刚需。对扫描版PDF做OCR后输出为底层是原图、上层是透明文字的双层PDF。外观上跟原扫描件一模一样但里面的文字可以搜索、复制、划线。给公司做合同归档、给学校做论文数字化这个功能都能直接顶上去。灵活的提取模式Umi-OCR 会优先尝试提取 PDF 自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切到OCR。你也可以主动选择整页强制OCR或反过来只提取原文本。从 v2.1.2 起还支持输出单层纯文本PDF想要体积小、好编辑的文件时可以选它。文档识别同样支持忽略区域可以按页码范围设置用来排除扫描件的页眉页脚也能设置任务完成后的自动关机。家里有一堆扫描版书想转成可搜索存档的话这个标签页能帮你省下大量人工。 小提醒如果你手头有旋转过方向的扫描件一定要用最新版。v2.1.5 修复了 PDF 页面旋转导致的文本错位问题旧版本可能会把竖着的内容横着拼出来。第五站 让软件更顺手多语言切换、性能调节与避坑清单界面多国语言一套软件多张面孔Umi-OCR 的界面语言支持简体中文、繁体中文、英文、日文、俄语、葡萄牙语等多种语言由社区译者协作维护版本更新还在持续新增。切换路径全局设置 → 语言/Language。顺带分清一件事界面语言和识别语言库是两码事。界面语言管按钮菜单长什么样识别语言库管 OCR 引擎认哪种文字可以在各标签页的文字识别设置里单独选择或下载。比如你的界面用中文但日常识别日文书籍二者完全可以搭配使用。性能微调长图、内存与渲染三个常见性能问题各自有标准答案识别长图/大图不完整去文字识别设置里调高限制图像边长。默认边长限制是为了平衡速度与内存遇到像素特别大的长截图适当调高数值即可别盲目放大原图——过度放大会增加噪声反而降低准确率。内存占用偏高如果用的是 PaddleOCR 插件v2.1.4 起默认内存占用被限制在系统总内存的一半以内想进一步压内存可以在插件配置里调低线程数。截屏闪烁或界面错位这是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常能解决。新手避坑速查表把前面提到的高频问题汇总成一张表遇到问题直接对号入座现象标准答案忽略区域画了却没效果框太小只有整个文本块完全在框内才会被忽略再确认保存了配置长图识别缺字调高限制图像边长不是放大原图截图闪烁、界面错位切渲染器或关硬件加速命令行指令没反应检查全局设置里 HTTP 服务是否开启默认开启多栏论文输出顺序乱切到多栏-按自然段换行代码截图排版全乱切到单栏-保留缩进文件夹里几万个文件很卡v2.1.5 优化了异步加载稍等加载完成即可界面会显示进度 顺便一提Umi-OCR 依赖本地 HTTP 服务做进程间通信但通信只在系统内部环回进行不经过物理网卡、不会外泄数据离线使用可以放心。进阶玩法把Umi-OCR装进你自己的命令行与HTTP工作流对普通用户来说图形界面已经够用。但如果你想把它嵌进自己的工作流Umi-OCR 还开了两条程序化通道。命令行模式入口就是主程序本身几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件--output 后跟输出路径 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录结果汇总到 all_result.txt umi-ocr --path D:/scans --output all_result.txt # 生成二维码依次是内容、输出路径、边长像素 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256参数含义逐条解释--screenshot唤起截屏并识别--clip把结果复制到剪贴板--path后面跟图片或文件夹路径--output指定结果输出文件--qrcode_create后面依次是二维码内容、输出图片路径、边长像素。所有指令都支持用前几个字母简写如--sc完整手册见 docs/README_CLI.md。HTTP 接口启动软件后本地 HTTP 服务提供 OCR、文档识别、二维码等接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把上传图片→返回JSON识别结果封装进自己的自动化流程。引擎与插件生态软件默认内置 Rapid-OCR 引擎兼容性好和 PaddleOCR 引擎速度稍快在全局设置里可以随时切换。项目还有独立的插件库支持扩展更多 OCR 引擎公式识别等功能也在开发路线图上属于远期计划可以保持关注。 想了解每个版本改了什么看项目的 CHANGE_LOG.mdv2.1.0 加入文档识别、v2.1.2 支持单层纯文本PDF与任务暂停、v2.1.3 登陆Linux并支持Docker部署、v2.1.5 修复了PDF旋转错位并优化大文件夹加载。写在最后把整篇文章压成三句话Umi-OCR 是一款免费、开源、离线运行的 OCR 工具解压即用、不用联网、不上传任何文件截图、批量、文档识别三大能力覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。回到开头的场景——下次再收到扫描版PDF合同或者一堆带水印的图片时打开 Umi-OCR你会发现无法从此PDF复制文字那行提示已经跟你没什么关系了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表