尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR 批量识别指南:离线免费,一次导入几百张图片识别成文字

Umi-OCR 批量识别指南:离线免费,一次导入几百张图片识别成文字 Umi-OCR 批量识别指南离线免费一次导入几百张图片识别成文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、离线的 OCR 工具截屏、批量图片导入、PDF 文档识别、二维码扫描都装在同一个软件里全部识别过程在本地完成不上传任何文件。如果你手头攒了一堆需要提取文字的图片这篇指南带你把它跑起来。 什么时候需要离线批量OCR先对号入座看看你是不是下面这三种情况之一。档案室里的一沓扫描件。你把一批扫描文件转成了图片想批量导出里面的文字又不放心把合同、财务数据传到云端 OCR 服务。代码截图进笔记。IDE 里的报错、终端里的日志你想转成纯文本存进笔记软件缩进结构还得保住。几百张截图等处理。截图工具里堆了几百张带水印的截图一张张手动识别不现实需要排队一次性跑完。Umi-OCR 的批量页没有数量上限支持jpg、png、webp、bmp、tif等格式还能给任务配完成后自动关机——夜里挂机识别早上看结果。⚡ 四步跑通批量识别流程最短路径如下全程不用配环境、不用装依赖。下载解压。拿到.7z压缩包后解压双击Umi-OCR.exe启动Windows或umi-ocr.shLinux。目的是得到一个解压即用的程序不写注册表、不需要安装步骤。导入图片。打开批量OCR标签页点选择图片可多选文件或整个文件夹。目的是把待识别图片排进左侧任务列表。选语言和排版方案。在右侧设置里选识别语言再从 OCR 文本后处理里挑一个排版解析方案。目的是让输出顺序、换行符合文档类型这一步直接决定结果好不好用。开始任务并保存结果。点开始任务进度条走完识别文本按你选的格式txt、md、jsonl、csv存入指定目录支持每张图一个文件或多图合并。 不想点按钮的话Umi-OCR 也能被命令行驱动把上面的步骤写进脚本里。 核心功能四个标签页各管一事截图OCR识别完还能整理排版按快捷键截一块屏幕右侧立刻出识别记录。左侧预览栏支持划选复制右侧记录栏可以编辑、合并复制多条记录在别处复制图片也能直接粘贴进来识别。识别只是第一步文本后处理的排版解析方案会按文档结构重新排序文字多栏 / 单栏 × 自然段换行 / 总是换行 / 无换行共六种预设代码截图用单栏-保留缩进行首空格原样保留以上方案都能自动处理横排和竖排从右到左的文字方向。批量OCR导入、排队、保存批量页就是上面演示的流程左侧列图片、耗时和状态右侧看每张图的识别记录。除了格式齐全它还有两个批量场景常用的设计——支持任务完成后自动关机或待机以及下面的忽略区域。⚠️ 注意超长的长图默认会被压缩到边长上限以内再识别像素超大的图记得先调高设置里的限制图像边长。忽略区域把水印从结果里抹掉批量页设置里可以打开忽略区域编辑器按住右键在预览图上画若干矩形框框内出现的文字在整个任务中都会被跳过。矩形框要画大一点把水印可能出现的所有位置都包进去生效粒度是整个文本块不是单个字符框内的文本块全部忽略框外保留。文档识别PDF 扫描件变可搜索 PDF支持pdf、xps、epub、mobi、fb2、cbz六种格式。对扫描版 PDF 做 OCR对已有文本层的 PDF 直接提取原文最后能输出双层可搜索 PDF——上层是原图下层是可复制搜索的文字。它同样支持忽略区域排除页眉页脚很方便。界面与调用方式界面语言跟随系统自动切换也可在全局设置 → 语言里手动改内置繁中、英文、日文、俄语等。命令行 / HTTP 接口识别单图、整目录、二维码读写都能被外部程序调用适合做自动化流程细节见命令行手册和HTTP接口手册。 场景实战输入、参数、输出怎么配技巧散着记容易忘按场景打包成输入 → 参数 → 输出的组合照抄就行。学术论文 PDF按自然段还原文档输入300DPI 扫描件导出的 PDF或页面截图。参数文档识别识别语言选中文排版方案选多栏-按自然段换行页眉页脚用忽略区域框掉。输出双层可搜索 PDF段落和栏序与原文一致方便复制和检索。代码截图缩进一个空格都不丢输入IDE 或终端截图。参数识别语言选英文排版方案选单栏-保留缩进。输出带缩进的纯文本代码直接粘回编辑器能跑。超长截图先调边长再识别输入几万像素高的整页长图。参数设置 → 文字识别 → 限制图像边长调大数值。输出长图完整识别不丢底部内容。带水印的截图画两个框就干净了输入四角带水印或 LOGO 的截图。参数批量页开启忽略区域编辑器右键画矩形框包住水印区域。输出结果里没有水印文字正文完整。 常见问题现象、原因、解法1. 批量任务跑得很慢。现象一张图要几秒几十个文件排到怀疑人生。 原因离线引擎走的是 CPU 单线程处理速度受硬件限制这是离线方案换取不联网的代价。 解法分批跑任务排在空闲时段并勾选完成后自动关机/待机长任务交给命令行或HTTP接口后台执行界面别盯着。2. 大图识别后内容缺了、字也不全。现象超长图只识别出一部分或整行文字缺字。 原因原图边长超过默认上限被压缩后再送进引擎细节丢了。 解法在设置 → 文字识别 → 限制图像边长里调高数值再重跑。3. 多栏文档的结果顺序是乱的。现象左右两栏的文字被拼成了一行接一行的乱序段落。 原因用的是不做处理或栏数不匹配的方案原文顺序没被重排。 解法按实际版式换方案——多栏排版选多栏-按自然段换行普通文档选单栏-按自然段换行换完立刻看记录页对比。4. 竖排繁体文档识别不全。现象从右往左排的繁体字有的整列没被识别。 原因识别语言库选的是简体中文引擎本身不覆盖竖排繁体。 解法识别语言改选繁体中文配合排版解析方案的竖排方向自动处理。写在最后Umi-OCR 的价值很朴素离线、免费、批量没有数量上限截屏到 PDF 都在一个软件里。想继续深入命令行手册和HTTP接口手册是入口。打开批量OCR标签页先拿十个文件试一把比读十篇教程都直接。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表