尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

免费离线OCR怎么用?3步跑通截图、批量、PDF文档识别

免费离线OCR怎么用?3步跑通截图、批量、PDF文档识别 免费离线OCR怎么用3步跑通截图、批量、PDF文档识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR先讲一件我上周干过的蠢事。同事发来一份扫描版合同我想引用其中一句条款全选、复制——弹窗冷冷地提示无法从此PDF复制文字。我只好打开在线识别网站结果文件超了大小限制、免费额度用完更要命的是这份敏感合同得先上传到别人的服务器。最后我装了Umi-OCR一款免费、开源、完全离线的OCR文字识别软件三分钟解决了这个痛点图片和PDF全程留在本地硬盘识别多少张、多大、多快全由自己说了算。这篇指南就按我踩过的路重走一遍你照着做就能立刻上手。一、离线OCR到底赢在哪一次对比说清楚先别急着下载花三十秒搞懂这个选择值不值。在线OCR的典型流程是上传图片 → 排队等待 → 限量识别 → 下载结果中间还夹着文件超限免费次数用完和数据泄露三个隐藏代价。而 Umi-OCR 把OCR引擎整个搬进了你的电脑本地运行、本地计算给你三个实打实的好处不限量识别多少张都由你说了算深夜挂机跑几百张图也不会被限流。零泄露图片和文档不离开硬盘合同、论文、身份证件随便丢进去。免安装绿色软件解压即用连注册账号和联网激活都省了。一句话总结它的定位给Windows和Linux用户的一把本地文字剪刀剪哪里、剪多少全凭你。下面我们正式上路。二、从下载到启动全程只要3个动作Umi-OCR 不需要安装这是它最舒服的一点。拿到压缩包后你只需要做三件事下载从项目发布页获取.7z压缩包或.7z.exe自解压包。如果电脑没装压缩软件直接选自解压包双击就能解开。解压解压到任意目录比如D:/Tools/Umi-OCR。这里有个小提醒——路径里别带中文和空格可以减少一些莫名其妙的兼容问题。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。第一次启动时软件会自动读取你的系统语言把界面切成对应语言。程序主体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置就像浏览器的标签栏想用哪个点哪个右上角还能锁定标签防止误关。还有一个容易被忽略的细节启动前把软件目录加入杀毒软件白名单。因为内置了本地OCR引擎和运行库部分杀软会误报加个白名单能省去后续为什么闪退的烦恼。三、截图OCR屏幕上看见的字1秒变可复制文本日常最高频的场景是看到一段文字想立刻复制。打开截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏里。看这张图左侧是截图预览右侧是识别记录识别完直接划选复制不用再经过任何中转。几个很实用的小习惯试过就回不去不用截图也能识别在聊天窗口复制一张图片回到 Umi-OCR 直接粘贴它照样帮你识别。结果能二次编辑右侧记录栏里的文字可以直接改错多条记录一起划选复制识别完顺手就能整理成想要的格式。竖排文字也不怕排版解析会自动处理横排和竖排从右到左的文本只要OCR引擎本身支持竖排即可。四、批量OCR几百张图一起扔进去顺手干掉水印截图识别只是开胃菜真正体现效率的是批量OCR。遇到几十上百张截图、扫描件、相册照片一张张截屏就太亏了。切到批量OCR标签页把图片直接拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张也没有数量上限。注意看右侧每张图片的耗时、置信度和识别结果逐条列出任务跑完可以按需导出。点下开始任务右侧会逐张显示耗时、置信度和结果。任务跑完后能按需输出成txt、jsonl、md、csvExcel可直接打开四种格式。对于挂机场景它还支持任务完成后自动关机或待机——睡前扔进去几百张图醒来直接拿结果。v2.1.2 起还支持暂停任务只要软件不退出待机/休眠后可以接着跑。这里重点讲一个高频痛点解法忽略区域。批量图片角落的水印、LOGO、页眉页脚每次都会混进识别结果里。在批量识别页右侧设置里进入忽略区域编辑器按住右键在图片上绘制多个矩形框把水印可能出现的位置全部框住识别时这些区域内的文字就会被自动排除。但有一个必须记住的机制只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住否则漏框一次结果里就混进一行杂音。五、文档识别把扫描版PDF变成可搜索的文本如果说前面是热身文档识别就是压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式扫描版PDF是最典型的应用场景。底层逻辑可以概括为三步解析 → 识别 → 重组。PDF先被拆开区分出本来就有的文本层和需要OCR的扫描图片层扫描图片交给本地OCR引擎逐页识别最后按阅读顺序重新拼装输出。操作上有两个亮点值得展开双层可搜索PDF对扫描版PDF做OCR后输出底层是原图、上层是透明文字的双层PDF。外观跟原扫描件一模一样但里面的文字可以搜索、复制、划线。给公司做历史合同归档、给学校做论文数字化这个功能能直接顶上去。灵活的提取模式Umi-OCR会优先尝试提取PDF自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切换OCR。你也可以主动选择整页强制OCR或反过来只提取原文本。v2.1.2 起还能输出单层纯文本PDF想要体积小、好编辑的文件就选它。文档识别同样支持忽略区域可按页码范围设置用来排除扫描件的页眉页脚也能设置任务完成后的自动关机。手头有一堆扫描版书要转成可搜索存档的话这个标签页能省下大量人工。六、新手最容易搞砸的4件事一次性说清把最常见的报错集中成一份清单遇到问题直接对号入座忽略区域画了却没效果检查矩形框是否够大——只有整个文本块完全在框内才会被忽略再确认是否保存了忽略区域配置。长图识别结果缺胳膊少腿去文字识别设置里调高限制图像边长而不是盲目放大原图——过度放大会增加噪声反而降低准确率。截图时界面闪烁、错位这是显卡渲染兼容问题。去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常能解决。命令行指令没反应Umi-OCR 依赖本地HTTP服务进行进程间通信请确认全局设置里HTTP服务已开启默认开启且仅监听本地环回不经过物理网卡数据不会外泄。遇到界面闪烁或语言不对答案都在这一页渲染器开关、界面语言、主题切换全在这里解决。七、进阶玩法命令行和HTTP接口把OCR塞进你的工作流对普通用户来说图形界面已经够用但如果你想把它嵌入自己的工作流Umi-OCR 还提供两条程序化通道。命令行模式入口就是主程序本身。几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256配合快捷键工具如 HotkeysCMD还能实现按一个键自动截指定屏幕区域并识别的骚操作。所有指令支持简写比如--screenshot可以缩写成--sc。完整参数和简写规则见项目内的命令行手册docs/README_CLI.md。HTTP接口方面Umi-OCR 启动后本地服务会提供OCR、文档识别、二维码等接口接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成自动化流程实现上传图片 → 返回JSON识别结果接口同样只在本地环回通信不会外泄数据。最后记住这三句话就够了Umi-OCR 是一款免费、开源、离线运行的OCR工具解压即用截图、批量、文档识别三大功能覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版PDF或一堆带水印的图片时打开它你会发现自己已经不再需要在线工具和手动抄录了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表