尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR 快速上手:免费离线OCR软件,3步搞定截图、批量与PDF识别

Umi-OCR 快速上手:免费离线OCR软件,3步搞定截图、批量与PDF识别 Umi-OCR 快速上手免费离线OCR软件3步搞定截图、批量与PDF识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费的离线文字识别软件在 Windows 和 Linux 上解压即用截屏提字、批量处理图片、把扫描版 PDF 变成可搜索文档全程无需联网。适合常和截图、扫描件打交道又不想把文件传上云的办公、学习与自动化场景。 快速开始5分钟跑出第一次识别结果不用装依赖、不用配环境拿到压缩包解压就是全部安装步骤。Windows从项目发布页Releases下载.7z或.7z.exe自解压包解压后双击Umi-OCR.exe启动。Linux需要先部署运行库环境从源码构建的话克隆仓库即可git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/um/Umi-OCR启动后默认停在截图OCR标签页。按快捷键框选屏幕任意区域右侧记录栏会立刻出现识别出的文字——这就是你的第一次成功。左侧预览栏可以直接用鼠标划选、复制结果。装完先别急着翻设置。第一遍先只用默认参数把每个标签页点一遍熟悉入口位置即可后面按需再调。核心场景实操从屏幕直接抠文字目标网页、PPT、聊天记录里的文字框一下就能拿走。步骤打开截图OCR标签页 → 按快捷键默认见页面上方提示唤起截图 → 框选区域松手出结果。如果手头图片是刚从别处复制的直接CtrlV粘贴进来也能识别。结果在右侧记录栏支持划选复制、批量复制多条记录。这里有个容易被忽略的设置文本后处理。识别正文选多栏-按自然段换行阅读顺序最自然识别代码截图选单栏-保留缩进行首空格不会丢。一次跑完一整个文件夹目标几十上百张截图、扫描件批量出文字文件。步骤切到批量OCR标签页 → 点选择图片导入支持 jpg、png、bmp、tiff、webp 等常见格式无数量上限→ 在右侧选好输出格式txt、md、jsonl、csv和保存位置 → 点开始任务。结果逐条显示在右侧记录栏每张图片的耗时和置信度都标在列表里。跑大任务前建议看一眼两件事输出格式是否匹配后续用途如果图片角落有固定水印提前画好忽略区域见下条。忽略区域是批量页的隐藏利器进入右栏设置的忽略区域编辑器按住右键画若干矩形框框内的文字块会被整体跳过。画的时候宁大勿小把水印可能出现的位置都包住页眉页脚、角标 logo 这类干扰就干净了。扫描版PDF变可搜索文档目标把纯图片的 PDF 扫描件变成能 CtrlF 的文档。步骤打开文档识别标签页 → 导入文件支持 pdf、xps、epub、mobi、fb2、cbz→ 选择输出方式 → 提交任务。扫描件走 OCR 提取已有文本层的文档直接抽取原文两种情况它都会自动处理。结果是双层可搜索PDF底层保留原图上层是可选中、可复制的隐形文字层。同样支持画忽略区域排除页眉页脚大文档任务还能勾选完成后自动关机睡前扔进去跑第二天收结果。扫码与生成二维码目标手头图片里的码要读出来或者要把一段文本变成码图。二维码标签页左半区放码图截图、粘贴、拖入都行一张图里多个码也能一次读出来支持 QRCode、DataMatrix、PDF417、EAN 等 19 种协议右半区输入文本即可生成码图纠错等级、图片尺寸都可调生成后保存为本地图片。⚙️ 进阶与自动化命令行调用主程序Umi-OCR.exe本身就是命令行入口输入umi-ocr --help可查看全部指令。最常用的是这几条umi-ocr --screenshot # 弹出框选截图识别 umi-ocr --path D:/images # 识别整个文件夹支持传多个路径 umi-ocr --qrcode_read D:/code.png # 识别二维码结果默认进剪贴板加--output file.txt可写入文件指令支持前缀简写--screenshot写成--sc也行。注意命令行依赖软件内部的本地 HTTP 服务仅走本机回环不经过网卡需确认该服务已开启。完整参数见命令行手册。HTTP 接口想在自己的程序里调用可以走 HTTP 接口/api/ocr传图片Base64返回识别结果/api/qrcode负责二维码识别与生成/api/doc提供文档识别能力。文档识别是异步的上传 → 轮询任务状态 → 拿下载链接 → 取结果文件四步走完。字段说明和示例代码在 HTTP 接口手册 里按文档照抄就能通。引擎切换与界面定制软件内置 RapidOCR 和 PaddleOCR 两套离线引擎RapidOCR 兼容性更好PaddleOCR 速度稍快二选一作为默认即可也可以从插件仓库引入新引擎随时替换插件放在UmiOCR-data/plugins目录下。语言、主题、字体大小、开机自启、桌面快捷方式都在全局设置标签页里首启时会按系统语言自动切换之后手动改也行。避坑指南现象双击启动报缺少运行库或组件错误。原因系统缺少 C 运行库。解决安装 Visual C Redistributable 运行库或直接使用官方发布的完整版压缩包已内置依赖。现象截图时界面闪烁、UI 错位。原因显卡加速渲染与当前驱动不兼容。解决全局设置 → 界面和外观 → 渲染器换一种渲染方案或关闭硬件加速。现象识别结果顺序乱、断行很怪。原因没选合适的排版解析方案。解决正文选多栏-按自然段换行代码选单栏-保留缩进在截图OCR页右侧设置里即可切换。现象超宽长图、超大图识别不了。原因默认对图像边长做了限制。解决页面设置 → 文字识别 → 限制图像边长把数值调高后再提交任务。现象命令行输入指令没反应。原因本地 HTTP 服务未开启指令无法送达后台进程。解决全局设置中确认 HTTP 服务已启用主机选仅本地即可。 生态与展望社区参与主要有三个入口界面翻译在 Weblate 平台协作简体中文、英语、日语、俄语等十余种语言都可以补充校对功能问题通过项目的 Issue 反馈作者响应较快引擎和新格式则通过配套的插件仓库扩展。版本方面每个稳定版都有对应的release分支可长期下载改动明细随时可查更新日志。路线图上的方向包括基于 GPU 的离线识别、独立的数学公式识别与 LaTeX 渲染、离线翻译、表格图片输出为 Excel以及 macOS 等更多平台的兼容。想现在就试的话去项目发布页下载最新发行版解压后 5 分钟内就能完成第一次截图识别要参与构建或二次开发直接克隆仓库并查看命令行手册与HTTP接口手册即可上手。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表