尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Umi-OCR 离线OCR免费指南:从截图识别到扫描件PDF的4个典型场景

Umi-OCR 离线OCR免费指南:从截图识别到扫描件PDF的4个典型场景 Umi-OCR 离线OCR免费指南从截图识别到扫描件PDF的4个典型场景【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 软件截图文字识别、批量图片识别、扫描版 PDF 提取文字图片不离开本机。新手解压后几分钟就能跑起来本文带你跑通 4 个典型场景并调好识别产出。一、Umi-OCR 安装下载、解压路径与启动方式Umi-OCR 是免安装程序不需要运行安装向导路径选对就能直接用下载发布包官方提供.7z压缩包电脑没装解压缩软件就选.7z.exe自解压包。解压到纯英文路径建议D:\Tools\Umi-OCR这类无空格、无中文的目录能避开一批兼容性小毛病。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。首次启动会按系统语言自动切换界面之后可在全局设置 → 语言/Language手动改支持中文、繁体中文、英文、日文、俄语、葡萄牙语等。最容易踩的坑软件内置了本地识别引擎和运行库体积大、行为像陌生程序部分杀毒软件会误报甚至直接杀掉进程导致闪退。把整个软件目录加入杀软白名单比排查半天有用。二、Umi-OCR 能干什么4个高频识别场景截图OCR设置怎么把屏幕上的字抓下来 适合所有文字看得见、复制选不中的时刻——图片上的字、锁屏前的聊天窗口、软件里渲染出的文字。入口打开截图OCR标签页按快捷键唤起截图框框住目标文字识别结果立刻出现在右侧记录栏。关键操作记录栏里的文字可直接手动改错支持划选多条记录一起复制左侧图片预览也能鼠标划选。容易忽略的细节不截图也行——在别处比如聊天窗口复制一张图片回到 Umi-OCR 直接粘贴同样进入识别。批量OCR设置怎么一次识别几百张图片适合手里有一整文件夹图片票据、扫描件、书影要批量转文字的场合。入口批量OCR标签页把图片直接拖进窗口jpg、png、webp、bmp、tif、tiff等格式都收数量没有上限。关键操作点开始任务右侧逐张显示文件耗时、置信度和识别结果跑完可导出txt、jsonl、md、csv四种格式其中 csv 用 Excel 直接打开。容易忽略的细节v2.1.2 起任务支持暂停——不退出软件待机或休眠后回来接着跑过夜挂机时很实用。文档识别怎么把扫描版PDF转成文字适合手里的 PDF 是扫描件、双击打开只见图片不见字的情况。该标签页支持pdf、xps、epub、mobi、fb2、cbz六种格式。入口文档识别标签页拖入文件即可。关键操作默认策略是优先提取 PDF 自带文本层快、零识别误差纯扫描页才自动切 OCR也可以在设置里强制整页 OCR或反过来只提取原文本。容易忽略的细节输出可以选双层可搜索 PDF——底层是原图、上层是透明文字外观和扫描件一致但能搜索、能复制v2.1.2 起还能导出单层纯文本 PDF体积小、好编辑。页眉页脚同样能用忽略区域排除并可指定按页码范围生效。二维码标签页怎么扫码和生成码适合需要批量读码工牌、包装、屏幕上的码或临时生成二维码图片的场合。入口二维码标签页。关键操作截图、粘贴或拖入图片都能读码一张图里有多个码也支持覆盖 QRCode、PDF417、EAN13 等 19 种协议反向输入文本则生成二维码图片可指定尺寸和纠错等级。容易忽略的细节生成的二维码参数调整后会自动刷新预览v2.1.5不用反复点确认。三、Umi-OCR 产出怎么调排版解析、忽略区域与引擎切换OCR 引擎直接输出的是按坐标切出来的文字块最终读起来顺不顺取决于下面几个后处理设置。设置项在哪调用途 调完的变化排版解析方案各识别页文字识别设置决定输出顺序和换行多栏-按自然段换行覆盖两栏论文书籍等最广场景单栏-保留缩进专治代码截图行首缩进和行中空格能保住不做处理则原样输出引擎结果忽略区域批量页右侧设置 → 忽略区域编辑器按住右键在图上画多个矩形框内文字识别时自动排除。改动后的变化水印、LOGO、页眉页脚不再混进结果。注意只有整个文本块完全落在框内才被忽略框要画大、画全识别引擎全局设置 → 插件内置 Rapid-OCR兼容性好和 PaddleOCR速度稍快两套识别不准或报错先换引擎往往比调其他参数见效快限制图像边长文字识别设置默认值平衡速度与内存超长截图识别缺块时调高此数值即可。改动后的变化大图不再被压缩采样识别更完整。别反过来放大原图——噪声更多准确率反而降渲染器全局设置 → 界面和外观 → 渲染器界面默认走显卡加速渲染截图闪烁、窗口错位时切换渲染方案或关闭硬件加速界面即恢复正常识别语言库各识别页文字识别设置决定引擎认哪种文字与界面语言互不干扰界面用中文、识别库选日文可以识别日文书籍。改动后的变化引擎会加载对应语言模型首次使用需下载内存方面v2.1.4 起 PaddleOCR 插件默认把内存占用限制在系统总内存的一半以内想再压可以调低插件配置里的线程数。四、Umi-OCR 卡住了怎么办常见症状对照识别结果不干净Q忽略了区域水印文字却还在→ 原因忽略判定按整个文本块而不是单字符框没把文本块完整包住或画完没保存配置。 → 解法把矩形放大到完全包裹水印可能出现的全部位置然后保存设置再跑任务。Q长截图识别缺胳膊少腿→ 原因图片尺寸超过了限制图像边长的默认值被采样压缩了。 → 解法在文字识别设置里调高该数值不要放大原图——过度放大只会增加噪声。Q代码截图出来的缩进全乱→ 原因排版方案还是默认的多栏类把代码当成了普通段落重排。 → 解法切到单栏-保留缩进行首缩进和行中空格基本能保住。界面与性能Q截屏时画面闪烁、窗口错位→ 原因显卡硬件加速渲染不兼容。 → 解法全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速通常立刻恢复。Q拖入几万张图的文件夹界面卡死→ 原因旧版本同步加载整个目录。 → 解法升级到 v2.1.5 及以上该版本改为异步加载并可预览加载进度等进度走完再操作即可。任务与命令行Q批量任务跑到一半想休息会丢进度吗→ 原因与结论v2.1.2 起批量任务支持暂停只要不退出软件待机/休眠后回来可继续跑。Q命令行输入了指令主程序毫无反应→ 原因Umi-OCR 的命令行靠本地 HTTP 服务做进程间通信服务没开或入口用错都无效。 → 解法确认全局设置里 HTTP 服务已开启默认开启仅监听本地环回数据不出机器命令行入口必须用主程序Umi-OCR.exeUmiOCR-data/RUN_GUI.bat这类备用启动器可能不支持。五、Umi-OCR 命令行与HTTP接口把离线OCR接进自己的脚本 除了界面Umi-OCR 还提供两条程序化入口都默认开箱可用。命令行模式入口就是主程序所有指令支持前缀简写--screenshot可写--sc。三条常用指令可直接复制umi-ocr --screenshot --clip umi-ocr --path D:/扫描件.png --output result.txt umi-ocr --qrcode_create 你好 D:/qrcode.png 256第一条截屏识别后结果直接进剪贴板第三条生成 256 像素的二维码图片。配合快捷键工具还可以指定屏幕区域自动截图--screenshot screen0 rectx,y,w,h实现按一下键识别固定区域。完整参数见命令行手册。HTTP 接口启动后本地服务提供图片 OCR、文档识别、二维码三类接口上传图片 → 返回 JSON 结果几十行代码就能封装成本地小工具接口参数详见HTTP 接口手册。识别引擎想再扩展可导入插件库切换其他离线识别后端版本演进记录在 CHANGE_LOG.mdv2.1.3 登陆 Linux 并支持 Docker 部署v2.1.5 修复了旋转页面的 PDF 文本错位并优化超大文件夹加载——手头有旋转过方向的扫描件建议直接上最新版。Umi-OCR 的价值一句话屏幕上的字不上传、不注册、本地拿走。现在就可以动手下载最新.7z发布包解压到纯英文路径双击启动后随手截一张图——识别结果就出来了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表