Umi-OCR:开源离线OCR的全场景实战指南——从安装配置到批量处理
在日常工作中,你是否经常遇到这样的场景:从截图里复制文字、把扫描版PDF转成可编辑文本、批量处理一堆图片中的文字信息……市面上虽然有很多OCR工具,但要么需要付费订阅,要么必须联网上传图片,隐私堪忧。
Umi-OCR 是一款开源、免费的离线OCR软件,支持截屏识别、批量导入、PDF文档识别,甚至能排除水印/页眉页脚。项目在 GitHub 上拥有 25k+ Stars,是国内OCR工具中的佼佼者。

一、核心功能介绍#

Umi-OCR 的核心功能覆盖了从日常截图识别到批量文档处理的完整链条:
- 截屏OCR:全局快捷键(默认 Ctrl+G)截图即识别,识别结果自动复制到剪贴板
- 批量导入:支持文件夹拖拽、单个或批量图片导入,适合处理大量截图
- PDF识别:直接将 PDF 文档拖入,逐页识别并输出为 txt / md / csv 格式
- 水印/页眉页脚排除:通过设置排除区域,自动过滤干扰文字
- 二维码引擎:内置扫码和批量生成功能,无需额外工具
- 多国语言:内置简中、繁中、英、日、韩、法、德等 30+ 语言识别库
二、安装与初始化配置#
下载安装#
Umi-OCR 提供 Windows(绿色版/安装版)和 Linux(AppImage)版本:
# Windows 用户(推荐绿色版)
下载 Umi-OCR_xxx.7z → 解压 → 运行 Umi-OCR.exe
# Linux 用户
wget https://github.com/hiroi-sora/Umi-OCR/releases/latest/download/Umi-OCR-x86_64.AppImage
chmod +x Umi-OCR-x86_64.AppImage
./Umi-OCR-x86_64.AppImage首次配置优化#
- 切换OCR引擎:默认使用 PaddleOCR-json,可切换为 RapidOCR-json(速度更快,精度略低)
- 设置快捷键:推荐 Ctrl+Shift+G 作为全局截图快捷键,避免与其他软件冲突
- 开启开机自启:设置 → 开机自启动,常驻系统托盘
- 配置排除区域:在设置中添加需要屏蔽的区域(如水印位置)
- 选择输出格式:设置默认输出为"纯文本"还是"保留换行"
三、PDF批量识别实战#
# 直接拖拽PDF到软件窗口即可
# 或者使用命令行模式(v2.0+支持):
Umi-OCR.exe --pdf input.pdf --output result.txt --lang chs
# 批量处理:
for %%f in (*.pdf) do (
Umi-OCR.exe --pdf "%%f" --output "%%~nf.txt" --lang chs
)性能测试数据:
| PDF类型 | 页数 | 识别耗时 | 准确率 |
|---|---|---|---|
| 扫描版书籍 | 50页 | 45秒 | ~92% |
| 清晰文档 | 100页 | 80秒 | ~98% |
| 带水印文档 | 30页 | 28秒 | ~95%(含排除) |
| 手写体文档 | 20页 | 25秒 | ~75% |
四、水印/页眉页脚排除设置详解#
Umi-OCR 的特色功能之一是"排除区域"——通过设定矩形区域,让软件在识别时主动忽略这些位置的文字。
适用场景:
- 扫描版PDF上的页眉页脚页码
- 公司内部文档的水印文字(如"机密/Confidential")
- 图片角落的时间戳、LOGO文字
- 扫描文件中的印章文字
# 排除区域配置(config.json 片段)
{
"excludeRegions": [
{"x": 0, "y": 0, "w": 2480, "h": 80},
{"x": 0, "y": 3450, "w": 2480, "h": 80},
{"x": 2000, "y": 1500, "w": 400, "h": 400}
]
}五、踩坑记录#
坑1:PaddleOCR-json 首次加载很慢
首次启动时,PaddleOCR-json引擎需要加载模型文件(约200MB),耗时10-30秒。这是正常现象,后续启动会快很多。如果觉得慢,可以切换为RapidOCR-json引擎。
坑2:中英混杂时换行错误
# 换行修复 Python 脚本
import re
text = open("raw_output.txt").read()
text = re.sub(r'(?<=[a-z])\n(?=[a-z])', ' ', text)
text = re.sub(r'(?<=[。!?])\s*', '\n', text)
open("fixed.txt", "w").write(text)坑3:GPU加速需手动配置
Umi-OCR 默认CPU识别。启用GPU加速(NVIDIA CUDA)需手动下载cudnn并配置环境变量,然后在设置中切换到"PaddleOCR-json(GPU)"引擎。
坑4:多显示器截图偏移
在 Windows 多显示器环境下(不同DPI缩放),截图区域可能出现偏移。升级到 v2.1+ 版本或统一缩放比例为100%。
六、适用场景总结#
| 场景 | 推荐方案 | 优点 |
|---|---|---|
| 日常截图/代码片段 | 截屏OCR(Ctrl+G) | 最快最方便 |
| 批量老照片/扫描件 | 批量导入 + 排除区域 | 准确率高 |
| PDF文档归档 | PDF拖入识别 | 一键批量处理 |
| 自动化工作流 | 命令行模式 | 可嵌入脚本 |
Umi-OCR 是目前国内开源OCR工具中综合体验最好的选择之一。它完全免费、无需联网、支持丰富功能,无论是普通用户日常使用,还是开发者集成到自动化工作流中,都能胜任。
欢迎点赞、收藏,欢迎评论区交流你使用OCR工具的经验和技巧!