Umi-OCR:开源离线OCR的全场景实战指南——从安装配置到批量处理

      在日常工作中,你是否经常遇到这样的场景:从截图里复制文字、把扫描版PDF转成可编辑文本、批量处理一堆图片中的文字信息……市面上虽然有很多OCR工具,但要么需要付费订阅,要么必须联网上传图片,隐私堪忧。

Umi-OCR 是一款开源、免费的离线OCR软件,支持截屏识别、批量导入、PDF文档识别,甚至能排除水印/页眉页脚。项目在 GitHub 上拥有 25k+ Stars,是国内OCR工具中的佼佼者。

Article Image

一、核心功能介绍#

Article Image

Umi-OCR 的核心功能覆盖了从日常截图识别到批量文档处理的完整链条:

  • 截屏OCR:全局快捷键(默认 Ctrl+G)截图即识别,识别结果自动复制到剪贴板
  • 批量导入:支持文件夹拖拽、单个或批量图片导入,适合处理大量截图
  • PDF识别:直接将 PDF 文档拖入,逐页识别并输出为 txt / md / csv 格式
  • 水印/页眉页脚排除:通过设置排除区域,自动过滤干扰文字
  • 二维码引擎:内置扫码和批量生成功能,无需额外工具
  • 多国语言:内置简中、繁中、英、日、韩、法、德等 30+ 语言识别库

二、安装与初始化配置#

下载安装#

Umi-OCR 提供 Windows(绿色版/安装版)和 Linux(AppImage)版本:

# Windows 用户(推荐绿色版)
下载 Umi-OCR_xxx.7z → 解压 → 运行 Umi-OCR.exe

# Linux 用户
wget https://github.com/hiroi-sora/Umi-OCR/releases/latest/download/Umi-OCR-x86_64.AppImage
chmod +x Umi-OCR-x86_64.AppImage
./Umi-OCR-x86_64.AppImage

首次配置优化#

  1. 切换OCR引擎:默认使用 PaddleOCR-json,可切换为 RapidOCR-json(速度更快,精度略低)
  2. 设置快捷键:推荐 Ctrl+Shift+G 作为全局截图快捷键,避免与其他软件冲突
  3. 开启开机自启:设置 → 开机自启动,常驻系统托盘
  4. 配置排除区域:在设置中添加需要屏蔽的区域(如水印位置)
  5. 选择输出格式:设置默认输出为"纯文本"还是"保留换行"

三、PDF批量识别实战#

# 直接拖拽PDF到软件窗口即可
# 或者使用命令行模式(v2.0+支持):
Umi-OCR.exe --pdf input.pdf --output result.txt --lang chs

# 批量处理:
for %%f in (*.pdf) do (
    Umi-OCR.exe --pdf "%%f" --output "%%~nf.txt" --lang chs
)

性能测试数据

PDF类型页数识别耗时准确率
扫描版书籍50页45秒~92%
清晰文档100页80秒~98%
带水印文档30页28秒~95%(含排除)
手写体文档20页25秒~75%

四、水印/页眉页脚排除设置详解#

Umi-OCR 的特色功能之一是"排除区域"——通过设定矩形区域,让软件在识别时主动忽略这些位置的文字。

适用场景

  • 扫描版PDF上的页眉页脚页码
  • 公司内部文档的水印文字(如"机密/Confidential")
  • 图片角落的时间戳、LOGO文字
  • 扫描文件中的印章文字
# 排除区域配置(config.json 片段)
{
  "excludeRegions": [
    {"x": 0, "y": 0, "w": 2480, "h": 80},
    {"x": 0, "y": 3450, "w": 2480, "h": 80},
    {"x": 2000, "y": 1500, "w": 400, "h": 400}
  ]
}

五、踩坑记录#

坑1:PaddleOCR-json 首次加载很慢

首次启动时,PaddleOCR-json引擎需要加载模型文件(约200MB),耗时10-30秒。这是正常现象,后续启动会快很多。如果觉得慢,可以切换为RapidOCR-json引擎。

坑2:中英混杂时换行错误

# 换行修复 Python 脚本
import re
text = open("raw_output.txt").read()
text = re.sub(r'(?<=[a-z])\n(?=[a-z])', ' ', text)
text = re.sub(r'(?<=[。!?])\s*', '\n', text)
open("fixed.txt", "w").write(text)

坑3:GPU加速需手动配置

Umi-OCR 默认CPU识别。启用GPU加速(NVIDIA CUDA)需手动下载cudnn并配置环境变量,然后在设置中切换到"PaddleOCR-json(GPU)"引擎。

坑4:多显示器截图偏移

在 Windows 多显示器环境下(不同DPI缩放),截图区域可能出现偏移。升级到 v2.1+ 版本或统一缩放比例为100%。

六、适用场景总结#

场景推荐方案优点
日常截图/代码片段截屏OCR(Ctrl+G)最快最方便
批量老照片/扫描件批量导入 + 排除区域准确率高
PDF文档归档PDF拖入识别一键批量处理
自动化工作流命令行模式可嵌入脚本

Umi-OCR 是目前国内开源OCR工具中综合体验最好的选择之一。它完全免费、无需联网、支持丰富功能,无论是普通用户日常使用,还是开发者集成到自动化工作流中,都能胜任。

欢迎点赞、收藏,欢迎评论区交流你使用OCR工具的经验和技巧!