尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR 怎么用?免费离线OCR软件截图、批量、PDF识别全攻略

Umi-OCR 怎么用?免费离线OCR软件截图、批量、PDF识别全攻略 Umi-OCR 怎么用免费离线OCR软件截图、批量、PDF识别全攻略【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源、可完全离线运行的 OCR 文字识别软件不需要联网、不需要安装解压就能用。不管是截图里的一段文字、堆积如山的图片还是扫描版 PDF 文档它都能一键识别成可编辑文本还内置了多国语言库。这篇指南会带你从第一次截图识别一路玩到命令行和 HTTP 接口的自动化玩法。这个场景你一定不陌生同事发来一份扫描版的 PDF 合同你想引用里面的一句话结果发现文字根本选不中翻到网上找在线 OCR先注册、再排队上传还总担心文件被泄露截图里有一段报错信息想发给别人只能对着键盘一个字一个字地敲……这些让人抓狂的时刻正是 Umi-OCR 的用武之地。它把图片/文档 → 文字这件事做到了极致简单而且全程离线你的文件永远只待在你自己的电脑里。更难得的是它完全免费、代码开源还支持 Windows 7 x64 和 Linux x64老电脑也能跑得欢。五分钟上手三步完成第一次文字识别先别急着研究参数跟着我走一遍10 秒就能出第一份结果。第一步获取软件解压即用Umi-OCR 是绿色软件官方发布包里已经打包好了离线 OCR 引擎下载后直接解压双击Umi-OCR.exe就能启动无需任何安装步骤。如果你手头正好拿到了Umi-OCR_Rapid_v2.1.5.7z这个发行包解压即可开箱使用。想研究源码或参与开发的读者可以用下面的命令把仓库完整克隆到本地git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR第二步截图框选松开打开截图OCR标签页用快捷键唤起截图用鼠标框选屏幕上任何想识别的区域。松开鼠标的那一刻文字就被识别出来了——左侧图片上的文字还会被高亮标记一眼就能核对识别是否准确。第三步复制结果走人右侧的识别记录栏里就是纯文本结果支持直接编辑、多选合并复制。以后遇到网页里选不中的文字、视频里的字幕、软件弹窗里的提示通通一个截图搞定。从框选到拿到文字整个过程不到 10 秒。这就是 Umi-OCR 最核心的日常用法。一眼看懂Umi-OCR 能帮你做什么用一张清单速览它的能力版图截图OCR框选即识别看图取字最快的方式️批量OCR一次性丢进几百张图片自动识别、批量导出文档识别扫描版 PDF、EPUB、MOBI 等转成可搜索文本或输出双层 PDF忽略区域框掉水印、页眉页脚让识别结果干干净净二维码既能扫码又能生成码支持 19 种协议多国语言界面和识别模型都支持中、英、日等多语言⚙️开放接口命令行 HTTP API可无缝接入自动化工作流个性化主题、字体、开机自启、渲染器都能自定义先看界面与个性化部分。在全局设置标签页里你可以一键添加快捷方式、设置开机自启、切换亮/暗主题、调整字体大小配置非常齐全多语言支持也做得很用心。软件首次启动会跟随系统语言自动切换你也可以在全局设置 → 语言/Language里手动选择简体中文、繁体中文、英语、日语等界面语言完整实操把扫描版 PDF 变成可复制、可搜索的文字说完了截图我们来走一遍大家问得最多的场景扫描版 PDF 的文字提取。① 添加文档打开批量OCR标签页文档识别就在这里面把 PDF 直接拖进窗口。左侧文件列表会实时显示文件状态和处理进度。它支持的文档格式很广pdf, xps, epub, mobi, fb2, cbz基本覆盖了常见的电子书和扫描件。② 选对内容提取模式这是文档识别最关键的一步。一份 PDF 可能既有扫描图片又有原生文本四种模式决定了处理策略混合模式默认图片区域走 OCR有原生文本就直接用速度和效果最均衡整页强制OCR每一页都按图片识别适合低质量扫描件仅OCR图片跳过原生文本只识别图片部分更快仅拷贝原有文本不调用识别引擎直接把 PDF 自带的文字抠出来秒出结果③ 设置忽略区域强烈建议扫描件最常见的干扰源就是页眉、页脚、页码和水印。点开忽略区域编辑器按住右键画出矩形框把这些位置圈起来——识别时框内的文字会被自动排除。批量处理学术论文时这个功能能帮你省下大量校对时间。④ 选择输出格式Umi-OCR 允许同时勾选多种输出格式txt、jsonl、md、csv也可以保存为双层可搜索 PDF。所谓双层 PDF就是底层保留原始扫描图像上层覆盖一层透明的文字——既完整保留原排版又能全文搜索、直接复制特别适合存档。⑤ 点击开始任务进度条会实时显示处理进度完成后自动打开输出目录。识别完别急着关预览功能可以把原始图像和识别结果放在一起对比方便你抽查准确度数据说话模式与参数怎么选面对这么多选项选错配置确实会影响效果。我用三张表帮你把逻辑理清楚。内容提取模式对比模式适用场景效果特点混合模式图文混排的普通扫描件识别与直取文本结合速度质量均衡整页强制OCR低质量扫描、特殊符号多识别最彻底但速度最慢仅OCR图片正文几乎全是图片跳过原生文本节省时间仅拷贝原有文本本来就是文字版 PDF不调用引擎几乎是瞬间完成输出格式对比格式特点推荐场景txt纯文本通用快速编辑、喂给其他程序jsonl带坐标的结构化数据数据挖掘、二次开发mdMarkdown 格式写文档、发博客csv表格数据Excel 打开、数据整理双层PDF原排版 隐藏文字层存档、全文检索关键参数参考参数作用建议值限制图像边长 limit_side_len压缩大图提速默认 960长图可调至 2880纠正文本方向 cls修正倾斜、倒置的扫描件扫描质量差时开启排版解析方案控制多栏/单栏的换行规则多栏 PDF 选多栏-按自然段换行并行任务数平衡速度与内存占用8GB 内存建议设为 2避坑指南新手最容易踩的 5 个坑这些坑我几乎都踩过现在总结成错误做法 → 正确做法对照帮你绕开❌ 识别超长截图结果一片空白✅ 到设置 → 文字识别 → 限制图像边长里调高数值如 2880长图大图就能正常出结果。❌ 水印、LOGO 文字混进识别结果✅ 使用忽略区域功能把水印圈起来识别时会自动跳过。记得矩形框画大一点完全包住水印可能出现的位置。❌ 倾斜的扫描件识别得乱七八糟✅ 开启纠正文本方向cls选项让引擎自动判断并修正文字方向。代价是速度略降值得。❌ 双栏 PDF 识别后文字顺序错乱✅ 在排版解析方案里选择多栏-按自然段换行引擎会按阅读习惯重新排序文本块。❌ 批量任务卡顿、内存爆满✅ 降低并行任务数同时把 limit_side_len 调回 960。识别速度与资源占用之间要学会取舍。另外补一个小贴士如果截图时出现画面闪烁或界面错位多半是显卡渲染不兼容去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速即可。进阶玩法命令行和 HTTP 接口把 OCR 接入你的工作流如果 Umi-OCR 只是个图形工具那还称不上神器。它真正出彩的地方是开放的命令行和HTTP 接口可以无缝嵌入你的自动化流程。命令行一条命令完成识别在全局设置中开启 HTTP 服务默认开启选仅本地即可命令行就生效了。常用指令# 鼠标框选截图并识别结果自动复制到剪贴板 umi-ocr --screenshot --clip # 识别整个文件夹里的所有图片 umi-ocr --path D:/scans --output result.txt # 识别二维码 / 生成二维码图片 umi-ocr --qrcode_read D:/qr.png umi-ocr --qrcode_create 你好Umi-OCR D:/qr.png更完整的指令说明见 docs/README_CLI.md还支持--show、--hide、--quit等软件操控指令配合快捷键工具可以玩出很多花样。HTTP 接口写个脚本批量处理Umi-OCR 默认监听本地1224端口提供完整的文档识别流程 API。核心思路是上传文件 → 轮询任务状态 → 生成并下载结果文件。参考 docs/http/api_doc_demo.py 的示例上传文档只需几行 Pythonimport requests, json base http://127.0.0.1:1224 with open(document.pdf, rb) as f: r requests.post( base /api/doc/upload, files{file: f}, data{json: json.dumps({doc.extractionMode: mixed})}, ) task_id r.json()[data] print(任务ID:, task_id)拿到任务 ID 后轮询/api/doc/result获取识别进度与文本再通过/api/doc/download生成双层 PDF 或文本文件。除了文档识别还提供图片 OCR/api/ocr和二维码/api/qrcode接口接口说明见 docs/http/README.md。写在最后现在就上手试试回头看Umi-OCR 打动我的地方就三点免费开源、完全离线、解压即用。它没有把简单的事情复杂化——截图取字 10 秒搞定批量图片和 PDF 识别也只要点几下鼠标剩下的交给命令行和接口去发挥想象力。给你一个上手路线建议先玩熟截图OCR立刻有成就感再试试批量OCR处理手头积压的图片和扫描件最后按需探索忽略区域、双层 PDF 和 HTTP 接口这些高阶能力。想深入了解某个功能仓库里的 CHANGE_LOG.md 记录了每个版本的演进细节值得一翻。好的工具不该被埋没。现在就打开 Umi-OCR把第一张截图变成文字吧——相信我用过一次你就回不去了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表