尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR 离线文字识别完整指南:免费开源OCR软件的6步上手指南

Umi-OCR 离线文字识别完整指南:免费开源OCR软件的6步上手指南 Umi-OCR 离线文字识别完整指南免费开源OCR软件的6步上手指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你是否遇到过这样的尴尬时刻急用资料里的一段文字打开在线OCR网站却发现网络不稳、上传半天、识别结果还带着水印或者涉及隐私文件根本不敢传到云端。事实上一个成熟的解决方案早已存在——Umi-OCR一款开源、免费、完全离线的OCR文字识别软件支持截屏识别、批量导入图片、PDF文档识别、二维码扫描与生成内置多国语言库解压即用。读完这篇文章你将掌握它的完整使用流程从下载安装到批量转换双层可搜索PDF再到用命令行和HTTP接口实现自动化全程无需联网。一次断网也要识图的困境设想这样一个场景你正坐在高铁上手头是一份扫描版的会议纪要想引用其中一段话却发现输入法不支持图片转文字打开手机里的在线OCR应用信号时好时坏上传一张图转了半分钟还没结果。更头疼的是这种在线服务往往把图片传到别人的服务器上——对需要保密的合同、病历来说这几乎是不可接受的。离线OCR正是为解决这类问题而生识别模型运行在本地图片不出电脑速度不受网络波动影响。而 Umi-OCR 把这件事做到了解压即用的极致——不需要安装、不需要配置Python环境、不需要联网下载模型双击Umi-OCR.exe就能开始工作。它凭什么值得装五大核心优势在深入操作之前先快速看一下这款工具的核心价值完全免费项目代码全部开源无任何功能限制或付费墙本地离线识别全程在本地完成不联网、不上传隐私安全有保障解压即用无需安装适用于 Windows 7 x64 与 Linux x64兼容 Docker 部署批量化处理批量OCR无数量上限可一次性导入几百张图片文档识别支持pdf / xps / epub / mobi / fb2 / cbz六种格式多语言支持内置简体中文、繁体中文、英语、日语、韩语、俄语等识别库界面语言同样支持多国切换v2.1.5 新增俄语与泰米尔语6步上手从下载到完成第一次批量识别接下来是实操环节以 v2.1.5 版本为例整个流程大约只需十分钟。第1步获取并解压软件。从项目发布页下载Umi-OCR_Rapid_v2.1.5.7z压缩包若需研究源码或二次开发可克隆仓库 https://gitcode.com/GitHub_Trending/um/Umi-OCR 解压后无需安装直接点击Umi-OCR.exe启动。若系统环境不适配还可使用备用启动器UmiOCR-data/RUN_GUI.bat。第2步检查全局设置。首次打开时软件会按系统语言自动切换界面语言。进入全局设置标签页可以调整语言、主题内置多个亮/暗主题、字体大小等参数。如果在你的机器上出现截屏闪烁或UI错位记得前往界面和外观→渲染器尝试切换到不同渲染方案或关闭硬件加速。图1全局设置页可配置语言、主题、渲染器等基础参数第3步体验截图OCR。切换到截图OCR标签页用快捷键唤起截图框选区域识别结果会实时显示在右侧记录栏中支持划选复制也可以直接在别处复制一张图片粘贴到窗口内识别。右上角可锁定标签页防止日常使用中误触关闭。图2截图OCR支持快捷键唤起、图片粘贴识别右侧实时展示识别结果第4步批量导入图片。进入批量OCR标签页拖入或点击添加图片支持jpg / png / webp / bmp / tif / tiff等格式右侧面板选择识别语言、排版解析方案点击开始任务即可。任务支持暂停与恢复完成后还可设置自动关机/待机。图3批量OCR支持多文件并行处理左侧进度条与状态栏实时反馈第5步利用忽略区域过滤干扰。批量识别带有水印或LOGO的图片时识别结果常被干扰。点击右侧忽略区域编辑器按住右键框选水印可能出现的位置任务执行时这些区域内的文本块将被自动忽略。文档识别中同样支持此功能常用于排除页眉页脚。第6步文档识别与输出。将 PDF、EPUB 等文档拖入文档识别标签页可选择输出双层可搜索PDF保留原始扫描图像、叠加透明文本层、单层纯文本PDF、txt、jsonl、csv 等格式还能设定忽略区域过滤页眉页脚。幕后机制离线OCR是怎么把图片变成文字的知其然也要知其所以然。Umi-OCR 的识别链路可以拆解为四个环节引擎识别 → 文本块后处理 → 输出格式化 → 结果落盘。OCR引擎是识别能力的来源。Umi-OCR 采用插件机制默认支持 PaddleOCR-json 与 RapidOCR-json 两套离线引擎就像同一辆车可以换装不同发动机——想换引擎在全局设置中切换插件即可互不影响。文本块后处理TBPU是整个软件最具巧思的部分。OCR引擎输出的往往是一堆零散的文块text block每块可能只有几个字顺序混乱。可以把这些文块想象成一盒打乱的拼图碎片而 TBPU 模块就是拼图师它依据文块的坐标、大小、间距判断哪些碎片属于同一行、哪些属于同一段落再按正确阅读顺序拼接。源码位于UmiOCR-data/py_src/ocr/tbpu/提供了 8 种排版解析方案例如多栏-按自然段换行适合报纸杂志排版单栏-保留缩进则专为代码截图设计。双层PDF的输出逻辑同样值得一看。它的原理可以类比为在老照片上贴一层透明便利贴底层保留扫描原图保证视觉完全还原上层写入识别出的文字但透明度设为0——人眼看不见搜索引擎和 CtrlF 却能摸到这些文字。核心实现在UmiOCR-data/py_src/ocr/output/output_pdf_layered.py关键逻辑如下# 双层PDF核心逻辑简化示意 for tb in res[data]: text tb[text] # 识别出的文本 box tb[box] # 文本块坐标 fontsize calc_font_size(text, box) # 按文本块宽高计算字号 page.insert_text( fitz.Point(x0, y2), text, fontsize, fontnamecjk, stroke_opacity0, # 描边透明度为0 fill_opacity0, # 填充透明度为0 → 文字不可见但可检索 )值得一提的是v2.1.5 还修复了生成单层PDF时未写入原PDF自带文本以及提取文本未考虑页面旋转等问题细节处理相当到位详见项目内 CHANGE_LOG.md。进阶玩法命令行与HTTP接口实现自动化对普通用户来说图形界面已经够用但对程序员和自动化爱好者Umi-OCR 还开放了命令行与HTTP接口两扇大门文档见 docs/README_CLI.md 与 docs/http/api_doc.md。命令行以主程序Umi-OCR.exe为入口几个最常用的指令# 鼠标划选截屏识别 umi-ocr --screenshot # 识别指定路径图片/文件夹可传多个 umi-ocr --path D:/img1.png D:/image/test # 识别结果写入文件 umi-ocr --path D:/scans --output result.txt # 识别/生成二维码 umi-ocr --qrcode_read D:/code.png umi-ocr --qrcode_create 你好世界 D:/out.jpeg 256 256所有指令支持前几个字母简写如--sc配合 HotkeysCMD 等工具还能自定义全局快捷键。v2.1.5 起新增--reload指令可重新加载配置文件./UmiOCR-data/.settings方便脚本动态调整参数。HTTP接口默认监听127.0.0.1:1224仅本机访问不经过物理网卡无泄露风险。以文档识别为例流程为上传文件→轮询任务状态→生成目标文件→下载→清理一个最小化的 Python 调用长这样import json, requests BASE http://127.0.0.1:1224 # 查询当前OCR引擎支持的参数定义 options json.loads(requests.get(f{BASE}/api/ocr/get_options).text) print(json.dumps(options, indent2, ensure_asciiFalse)) # 上传图片并识别base64编码 data {base64: ..., options: {data.format: text}} res requests.post(f{BASE}/api/ocr, jsondata).json() print(res[data])项目还提供了可直接运行的示例代码 api_doc_demo.py 与 api_doc_demo.htmlWeb 前端接入也十分方便。值得注意接口对并发支持较弱建议顺序调用大批量长时调用偶发连接报错时重发一次请求即可。高频问题排查手册把实践中最容易踩的坑整理成了一张速查表现象原因解决动作截屏时画面闪烁、UI错位渲染器与显卡驱动不兼容全局设置→界面和外观→渲染器切换方案或关闭硬件加速长图/大图识别不出文字图片被默认边长限制压缩批量OCR页→设置→文字识别→限制图像边长调高如 4320 或无限制识别结果顺序混乱排版解析方案不匹配切换为多栏-按自然段换行代码截图选单栏-保留缩进水印/LOGO文字混入结果未设置忽略区域在忽略区域编辑器中框选水印注意只有完全落入框内的文本块才会被忽略文档识别失败或卡住文档加密或含异常图片加密文档需填写密码更新至 v2.1.5 以上版本需要排查运行故障无有效日志v2.1.5 起支持命令行查看实时日志ERROR级别日志保存在UmiOCR-data/logs目录它还能用在哪些地方四个行业的真实用法教育科研学生党可把纸质教材扫描件批量转为双层可搜索PDFCtrlF 秒查知识点老师用截图OCR快速提取试题中的文字配合单栏-保留缩进方案甚至能直接还原代码截图见下图右侧识别结果与左侧代码高度一致。图4代码截图识别示例右侧结果保留缩进与换行结构软件开发技术文档、历史代码打印件的数字化管理——保留原始格式的同时实现函数名、API 的快速检索。医疗与法律病历、合同这类对保密性要求极高的文档离线识别杜绝了数据外泄风险双层PDF保留原始签名与印章又让关键条款可被检索、可被比对。档案数字化企事业单位可将积压的纸质档案批量扫描后统一转换建立可检索的电子档案库大幅降低人工录入成本。结语回到开头那个断网也要识图的场景现在你只需打开 Umi-OCR按下快捷键框选文字便出现在屏幕上——不依赖网络不担心隐私甚至不需要懂任何技术。这就是离线OCR软件的价值把识图取字从一件需要权衡条件的事情变成一件理所当然的小事。而 Umi-OCR 的想象空间还不止于此。从 v2.1.0 加入文档识别到 v2.1.2 支持单层PDF与任务暂停再到 v2.1.5 完善日志机制与多语言界面迭代节奏清晰可见。官方路线图中表格识别输出Excel、基于GPU的离线OCR、图片翻译、固定区域识别等功能也已列入计划。对普通用户它是随取随用的效率工具对开发者它是可二次开发的开源底座——无论从哪个角度看都值得在你的工具箱里为它留一个位置。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表