
免费离线OCR软件Umi-OCR实操指南3步上手截图识别7个技巧盘活PDF与批量图片【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的OCR文字识别软件截屏即识、批量图片识别、扫描PDF转双层可搜索PDF、二维码扫描与生成内置多国语言识别库解压即用。这篇文章不打算讲太多高深原理而是想和你聊聊当屏幕上的文字复制不了的时候普通人该怎么体面地解决。整篇只围绕一条主线——把各种形态的文字变成能复制、能搜索、能编辑的文本。一、一个加班夜的故事当复制粘贴全部失灵晚上十一点小陈还趴在工位上。她要赶一份季度汇报资料却散落得让人抓狂领导在微信里发来的几张聊天记录截图里面的数据要抄进表格客户传的扫描版合同PDF关键条款一个字都选不中一个行业网站的正文右键菜单里根本没有复制。于是她只能一边放大图片一边一个字一个字敲进文档。敲到第三页的时候她差点把键盘扔出窗外。这个场景屏幕前的你大概率也经历过。文字明明就画在屏幕上可你就是拿不走它。这时候你需要的是一个识字师傅——而 Umi-OCR 就是这个师傅的完美化身随叫随到、不需要联网、工资为零还自带多国语言技能包。二、3步极速上手从下载到第一次识别只需几分钟先别急着研究技术原理我们先把工具跑起来让成就感来得快一点。第一步解压即用不需要安装Umi-OCR 的发行版是一个.7z压缩包。从项目发布页下载最新版如Umi-OCR_Rapid_v2.1.5.7z解压后双击Umi-OCR.exe就能启动。它不写注册表、不装服务、不需要管理员权限真正意义上的绿色软件。想自己动手折腾源码仓库地址是 https://gitcode.com/GitHub_Trending/um/Umi-OCR git clone下来即可研究。第二步打开截图OCR按下快捷键框选启动后默认就在截图OCR标签页。按下快捷键唤起截图用鼠标框住屏幕上的任何区域右侧立刻吐出识别出的文字。识别结果支持划选复制也可以整段复制到剪贴板。这一步有多快快到你可以把它当成屏幕上的文字搬运工网页、视频、图片里的字框一下就到手。甚至在其他软件里复制一张图片粘贴进 Umi-OCR也能直接识别。第三步选对排版方案让文字按你想要的顺序出来很多人不知道识别出文字只是第一步顺序才是关键。Umi-OCR 在右侧提供了一个排版解析下拉框常见的有多栏-按自然段换行适合报纸、杂志等分栏排版自动按阅读顺序整理单栏-保留缩进适合代码截图保留行首缩进与行中空格不做处理返回引擎的原始输出。选错方案最典型的现象是字全对但句子乱序读起来像踩了香蕉皮。多试两次找到匹配你素材的那一项就好。顺带一提如果界面语言和你的习惯不符或者想换主题去全局设置里改即可支持简体中文、繁体中文、英语、日语等多国语言。三、深度玩法别人没告诉你的7个隐藏技巧如果你只把它当截图识字工具那真是大材小用了。下面这几个功能是很多人用了很久都没发现的隐藏实力。1. 忽略区域把水印和页眉页脚直接划掉批量识别截图时最烦的就是图片角落的水印、LOGO 和页码。它们会被当成正文识别出来混进结果里。Umi-OCR 的忽略区域功能就是为此设计的在批量识别页进入忽略区域编辑器按住右键在图片上画几个矩形框把水印可能出现的位置都包住。任务开始后这些区域里的文字会被直接跳过。小提示矩形框画大一点完全包住水印所有可能出现的位置而且只有完全落在框内的整个文本块才会被忽略。这正是OCR忽略水印区域的正确姿势——与其事后删不如事前划掉。2. 7种排版解析方案多栏、竖排、代码缩进都能hold住除了前面提到的几种方案Umi-OCR 的排版解析还支持**竖排从右到左**文本的自动整理。这意味着日文漫画、竖排古籍截图也能按正确的阅读顺序输出。最让我惊喜的是它对代码截图的处理选择单栏-保留缩进后行首缩进和行中空格原样保留识别结果几乎可以直接粘贴回编辑器里跑。3. 命令行调用给OCR装上一个遥控器不想点鼠标Umi-OCR 自带完整的命令行接口主程序Umi-OCR.exe就是入口# 识别指定图片或文件夹 umi-ocr --path D:/img1.png D:/img2.png D:/image/test # 指定屏幕区域自动截图识别无需手动框选 umi-ocr --screenshot screen0 rect50,100,300,200 # 识别结果直接追加写入文件 umi-ocr --path D:/img.png --output_append D:/notes.txt # 读取二维码 / 生成二维码 umi-ocr --qrcode_read D:/qr.png umi-ocr --qrcode_create 你好 D:/out.png 256更有意思的是你可以把范围截图命令绑定到系统快捷键上按一下 F10 就自动截取固定区域并识别——OCR命令行调用从此不再是程序员的专利。4. 双层可搜索PDF扫描件的CtrlF自由扫描版PDF最让人崩溃的地方就是明明能看却不能搜、不能选、不能引用。Umi-OCR 的文档识别标签页可以处理这个问题。它支持pdf、xps、epub、mobi、fb2、cbz等格式输出时选择双层可搜索PDF底层保留原始扫描图像保证排版和签章原汁原味顶层叠加一层透明文本让 PDF 支持关键词搜索和文字复制。打个比方就像师傅用一张透明纸把文字誊写好轻轻覆在原图上——看还是那张图但文字已经活了。这正是扫描PDF转双层可搜索PDF的核心价值保真与可检索两个都要。5. 二维码识别与生成一站搞定Umi-OCR 内置二维码工具支持 19 种条码协议QRCode、Code128、PDF417、DataMatrix、Aztec 等可以一图多码识别也能输入文本直接生成二维码图片还能调整纠错等级和宽高。这意味着你的电脑上又多了一个不需要联网的扫码枪。6. HTTP接口把识别能力嵌进自己的小工具在全局设置里开启 HTTP 服务后默认仅本地监听不会暴露到外网Umi-OCR 就变成了一个可以随时调用的识别服务图片 OCR、PDF 文档识别、二维码识别与生成都有对应的接口。如果你会写一点脚本就可以用它搭建自己的资料自动整理流水线比如把下载的截图自动识别、重命名、归档。7. 那些藏在角落的便利设计一些不起眼的小功能用起来才觉得贴心标签页框架按需打开/关闭标签页还能锁定防止误关、置顶窗口双栏模式大部分标签页可切换左右/上下布局Esc 一键隐藏主窗口v2.1.5 新增摸鱼党的福音批量任务完成后自动关机/待机晚上挂着跑几百张图早上醒来直接收结果暂停/恢复任务中途离开再回来任务不会断OCR 引擎可切换内置 RapidOCR 与 PaddleOCR 两套引擎还可以通过插件自由更换多国语言界面简体中文、繁体中文、英语、日语、葡萄牙语、俄语等译者社区Weblate持续在线协作。四、完整实战把扫描教材 课件截图变成可检索资料库光说不练假把式。我们用一个真实场景走完整个流程小陈这次要整理期末复习资料——手头有一本扫描版教材 PDF200 页和 40 多张课件截图。第 1 步需求拆解素材分两类处理方式也分开素材处理标签页目标产物40 张课件截图批量OCR一份 Markdown 复习笔记200 页扫描版 PDF文档识别可搜索的双层 PDF第 2 步批量处理课件截图切到批量OCR标签页把 40 张截图一次性拖进去支持 jpg、png、webp、tif 等常见格式。右侧设置里识别语言选中文排版解析选多栏-按自然段换行输出格式选md进忽略区域编辑器把图片底部的页码和角标框住。点击开始任务进度条实时显示每张图的处理状态。跑完后所有识别结果按图片顺序写入一份 Markdown 文件。因为设置了忽略区域结果里干净利落没有一个页码混进来。第 3 步处理扫描版教材 PDF切到文档识别标签页导入 PDF。输出格式选择双层可搜索PDF忽略区域可以只作用于指定页数范围比如前几页的目录页眉。200 页的扫描件交给它慢慢跑勾上完成后自动休眠今晚不熬夜。第 4 步验证结果第二天醒来检查两件事打开生成的双层 PDF按CtrlF搜索一个教材里的专业名词——能搜到就说明文本层生成成功抽查 5 处文字与原文对比确认没有明显错字。至于那份 Markdown 笔记直接导入你惯用的笔记软件复习时全文搜索即可。第 5 步把常用动作固化下来以后每周都会有新课件。与其每次开界面拖文件不如把命令固定下来umi-ocr --path D:/课件/本周 --output_append D:/复习笔记.md每周把新截图丢进同一个文件夹跑一次命令笔记自动追加。整个过程不到一分钟。五、避坑锦囊8个高频问题一次讲清用 Umi-OCR 的过程中下面这些问题出现频率最高。按问题→原因→对策对照着查1. 界面闪烁、UI 错位→ 软件默认开了显卡加速渲染个别机器兼容性不佳。 → 对策全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速。2. 超长图、超清大图识别不全或卡顿→ 图片边长超出默认限制被自动缩放或截断。 → 对策页面设置 → 文字识别 → 限制图像边长把数值调高。3. 多栏文档识别出来顺序混乱→ 排版解析方案与素材不符。 → 对策换多栏系列方案必要时用总是换行观察区块顺序。4. 结果里混进一堆水印文字→ 没设置忽略区域。 → 对策批量页进忽略区域编辑器把水印可能出现的位置全部框住。5. 启动后界面是外语→ 软件首次启动跟随系统语言自动切换。 → 对策全局设置 → 语言/Language手动改成简体中文。6. 命令行识别时总弹出主窗口→ 截图OCR标签页里弹出主窗口选项处于开启状态。 → 对策在截图OCR页关闭该选项命令行任务就会安静地在后台跑。7. 大批量连续调用 HTTP 接口偶尔报错→ 后端组件对并发支持有限。 → 对策不要并发调用偶发报错直接重发请求即可不影响整体流程。8. 长时间批量任务占用内存过高→ 默认引擎线程数较多。 → 对策在插件设置里调整线程数与内存上限PaddleOCR 插件默认内存不超过系统总内存一半可按需调低。六、写在最后离线是一种踏实的自由聊到这里你可能已经发现了 Umi-OCR 最大的魅力所在它把所有识别能力都装进了你的电脑。隐私不离开本地——合同、病历、内部资料不需要上传到任何云端断网照样干活——出差路上、内网环境、没信号的会议室识字师傅随叫随到开源可审计——代码透明不用担心被夹带私货。再加上解压即用的零门槛它几乎是为普通办公场景量身定做的。从项目动态看开发者还在持续投入新版加入了日志机制、配置热重载、Linux 与 Docker 支持远期计划里还有数学公式识别、表格转 Excel、图片翻译、GPU 加速等方向。对一个免费开源项目来说这份持续力本身就很难得。如果今晚你也像小陈一样对着复制不了的文字发愁——不妨花五分钟下载一个 Umi-OCR框选、复制、粘贴一气呵成。你会发现被截图和扫描件困住的文字其实早就该自由了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考