尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

从截图到扫描件:如何把免费离线 OCR 工具 Umi-OCR 用成文字提取利器

从截图到扫描件:如何把免费离线 OCR 工具 Umi-OCR 用成文字提取利器 从截图到扫描件如何把免费离线 OCR 工具 Umi-OCR 用成文字提取利器【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线 OCR文字识别工具适合不想折腾的新手和办公用户解压即用、无需联网。截图 OCR、批量图片识别、PDF 扫描件转换、二维码扫码与生成全部在本地完成你的图片文字不会上传到任何服务器。为什么值得先试试离线 OCR 对隐私敏感、图片量又大的人离线方案的价值很直接文字不出电脑识别全部由本机引擎完成断网也能用扫描件、合同、截图都可以放心处理。免费且零安装项目代码全部开源没有注册、激活、按次付费解压到任意目录就能启动。能力完整不只是截图转文字批量图片、PDF 文档、二维码都在一个软件里搞定。灵活调用手动界面之外还支持命令行和 HTTP 接口方便写进自己的自动化流程。下图是主界面整体预览四个核心标签页一目了然三步跑起来从下载界面启动拿发行版下载.7z压缩包没有压缩软件就选.7z.exe自解压包。本仓库就附带了发布包 Umi-OCR_Rapid_v2.1.5.7z支持 Windows 7 x64 及 Linux x64。解压放到任意目录即可软件无需安装。启动双击Umi-OCR.exe运行Linux 用户先下载对应的运行库再执行umi-ocr.sh启动脚本。Windows 与 Linux 的差异和首次设置Windows除了直接解压也可以用 Scoop 包管理器一条命令安装先执行scoop bucket add extras再执行scoop install extras/umi-ocr装 RapidOCR 引擎版装scoop install extras/umi-ocr-paddle则是 PaddleOCR 引擎版。Linux额外一步是部署运行库之后由umi-ocr.sh拉起主程序流程与 Windows 一致。首次启动软件会按系统语言自动切换界面想手动改的话去「全局设置 → 语言」即可同一页面还能切换亮/暗主题、调整字体大小、一键添加桌面快捷方式或设置开机自启。屏幕与图片里的文字随手截屏秒变可编辑文字网页上的字、软件界面里的文案复制不了这就是截图 OCR 要解决的。打开「截图 OCR」标签页按快捷键唤起截图框选区域后结果立刻出现在右侧左侧预览栏可以直接划选复制右侧历史记录支持编辑、合并多条再复制。从别处复制的图片也可以直接粘贴进来识别。细节在「文本后处理」默认方案能自动识别多栏排版、按自然段换行如果你的截图是代码换成「单栏-保留缩进」行首缩进和空格都会原样保留。几十张图片一次性转文本扫描件、截图、聊天记录图片攒了一文件夹一张张处理太慢。把它们直接拖进「批量 OCR」页就能排队识别没有数量上限几百张一起跑也没问题。支持输入jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff结果可导出为txt, jsonl, md, csv(Excel)任务跑完可设置自动关机/待机下班前扔进任务、第二天来收结果「忽略区域」编辑器里按住右键画矩形框框内的水印文字会被跳过适合批量图片都带同一水印的场景文档与条码场景扫描件秒变可搜索 PDF手里只有扫描版 PDF文档识别页支持pdf, xps, epub, mobi, fb2, cbz六种格式。对扫描件做 OCR或提取文档里已有的文本最终能输出「双层 PDF」——既能看原文排版、又能直接搜索和复制文字的那种 PDF。页眉页脚固定出现的话同样可以画忽略区域把它们排除掉。扫码 生成二维码一站搞定二维码页左右两个方向都能用扫码截图、粘贴或拖入本地图片读取其中的二维码/条形码支持一张图里多个码覆盖 19 种协议QRCode、DataMatrix、PDF417、EAN13、Code128等。生成输入文本即出二维码图片可调纠错等级支持指定图片宽高。从手动到自动让 OCR 替你跑脚本⚡ 前面的操作都是手点接下来两种方式可以把识别流程接进你的自动化任务。命令行脚本命令行入口就是主程序本身。它在后台通过本机环回的 HTTP 通信传递指令默认开启仅本地、不经过网卡所以使用时保持 Umi-OCR 在后台运行即可。最常用的几条umi-ocr --screenshot # 鼠标截屏识别 umi-ocr --path D:/images # 批量识别一个文件夹里的图片 umi-ocr --qrcode_read D:/code.png # 识别二维码 umi-ocr --qrcode_create 文本内容 out.png 128 # 生成 128 像素二维码结果默认复制到剪贴板也可用--output file.txt直接写入文件。完整参数手册见 docs/README_CLI.md。HTTP 接口集成想从自己的程序里调用直接请求本机服务即可默认地址为http://127.0.0.1:1224主要端点/api/ocrBase64 图片识别/api/ocr/get_options可先查询支持的参数/api/qrcode二维码识别与文本生成图片/api/doc/upload→/api/doc/result→/api/doc/download文档识别三步流程上传、查状态、下载结果文件/argv等价的命令行接口仅允许本地环回调用两点注意后端并发能力较弱别并发调用长时间大批量调用偶发ECONNREFUSED时重试即可。接口文档见 docs/http/。实战调优与避坑四条高频问题按现象→原因→解法对照排查现象截图闪烁、界面 UI 错位。原因界面默认使用显卡加速渲染部分显卡适配不佳。解法全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速。现象超长的大图、长图识别失败或被截断。原因默认开启了「限制图像边长」超大图受限。解法页面设置 → 文字识别 → 限制图像边长把数值调高。现象水印、页眉页脚总是混进识别结果。原因忽略区域没画或没盖住水印可能出现的所有位置。解法右键画大一点的矩形框把水印区域完全包进去注意区域内是整块文本被忽略而不是按单字切割。现象命令行或 HTTP 调用没反应。原因HTTP 服务被关掉或主程序没在后台运行。解法确认全局设置中允许 HTTP 服务默认开启并保持 Umi-OCR 常驻。插件架构与扩展路径✅ Umi-OCR 采用模块化设计OCR 引擎本身就是插件——这也是它能同时兼容 RapidOCR 和 PaddleOCR 的原因两者定位不同RapidOCRPaddleOCR获取方式发行版默认自带Scoop 的umi-ocr-paddle版或导入插件特点兼容性好速度稍快工程结构上主程序与数据分离**标记为仓库内可见的源码部分Umi-OCR ├─ Umi-OCR.exe # Windows 主程序 ├─ umi-ocr.sh # Linux 启动脚本 └─ UmiOCR-data ├─ main.py # 主入口 ├─ py_src/ # Python 源码 ├─ plugins/ # 插件目录引擎、能力扩展都挂在这里 └─ i18n/ # 多语言翻译文件想动手扩展时可以 fork 仓库研究git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR参考plugins/下现有引擎插件的接入方式即可尝试新引擎或新的文本后处理插件。项目生态与后续规划版本更新发行版链接长期维护、版本稳定更新记录见 CHANGE_LOG.md当前发布为 v2.1.5。翻译协作界面支持简繁中文、英语、日语、葡萄牙语、俄语、泰米尔语等多语言基于 Weblate 平台开放协作本仓库 dev-tools/ 目录里还附带了翻译文件互转脚本和完整翻译步骤文档想补一门语言可以直接上手。问题反馈遇到 Bug 或有功能建议在仓库 Issue 区提交即可。路线图远期计划里包括独立的数学公式识别插件LaTeX 渲染、图片翻译与离线翻译、表格图片识别输出 Excel、固定区域识别、基于 GPU 的离线 OCR以及 macOS 等平台兼容。发行版压缩包就在仓库里解压双击今天就能开始你的第一次免费离线文字识别。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表