Umi-OCR离线文字识别工具完全指南:MIT协议、批量识别与水印过滤实战

Umi-OCR离线文字识别工具完全指南

资源概览

项目内容
资源名称Umi-OCR
版本v2.1.5
开源协议MIT(可商用、可二次分发、可修改)
适用平台Windows 7 x64 及以上、Linux x64(暂不支持 macOS)
体积Rapid 引擎版 98.6MB,Paddle 引擎版 128.1MB
项目主页https://github.com/hiroi-sora/Umi-OCR
官方直链https://github.com/hiroi-sora/Umi-OCR/releases/download/v2.1.5/Umi-OCR_Rapid_v2.1.5.7z.exe

Umi-OCR 是 GitHub 上获得 4.7 万 star 的开源 OCR 项目,累计下载量超过 57 万次。它的核心价值在于三点同时成立:识别准确率可达商用水平、完全免费无任何付费墙、所有文字识别在本地完成不经过任何服务器。

这一点对处理合同、证件、内部技术文档的场景尤其重要。市面上大量在线 OCR 服务虽然免费额度可用,但图片会被上传到第三方服务器,存在数据泄露风险;而 Umi-OCR 断网也能正常工作。

核心功能亮点

截图识别,快捷键唤起。 默认快捷键 Win+Alt+C 框选屏幕任意区域即可识别文字,Win+Alt+V 可直接粘贴剪贴板中的图片进行识别。识别结果会保留排版顺序,支持中英文混排。

批量识别,无数量上限。 一次可导入数百张图片(jpg/jpeg/png/webp/bmp/tif 等格式),输出支持 txt、jsonl、md、csv 四格式。任务完成后可设置自动关机或待机,适合夜间批量处理归档扫描件。

忽略区域,过滤水印。 批量识别页右栏内置忽略区域编辑器,按住右键绘制矩形框,框内的整个文本块会被排除在结果之外。这个功能对处理带页眉页脚、带机构水印的扫描件非常实用,避免水印文字污染识别结果。

扫描PDF转双层可搜索PDF。 文档识别支持 pdf、xps、epub、mobi、fb2、cbz 格式,可提取原有文本层,也可对纯扫描件做 OCR 后输出双层 PDF——保持原图外观的同时,文字可以选中、复制和全文检索。

命令行与HTTP接口。 除了图形界面,Umi-OCR 提供完整的命令行手册和 HTTP 接口手册,可以被自动化脚本、爬虫、工单系统集成调用。

双引擎可选。 内置 PaddleOCR 和 RapidOCR 两套离线引擎,可在设置中一键切换。Paddle 引擎速度稍快但占用较高,不兼容奔腾、赛扬、凌动等老旧 CPU;Rapid 引擎速度略慢但内存占用低、兼容性好。

适用场景

场景说明
合同/证件信息提取涉密文件不便上传云端,本地识别规避合规风险
技术文档归档批量把历史扫描版技术手册转成可搜索 PDF
代码截图转文本排版解析方案中的「单栏-保留缩进」可保留行首缩进和行中空格
水印文档清洗用忽略区域排除机构水印、页眉页脚
自动化流水线通过 HTTP 接口把 OCR 能力接入内部系统
老旧设备复用Rapid 引擎兼容性好,可在低配机器上运行

下载与安装

官方下载渠道(三个,均为长期维护):

  • GitHub Releases:https://github.com/hiroi-sora/Umi-OCR/releases/latest

  • SourceForge:https://sourceforge.net/projects/umi-ocr

  • 蓝奏云(国内免注册不限速):https://hiroi-sora.lanzoul.com/s/umi-ocr

版本选择:
- Umi-OCR_Rapid_v2.1.5.7z.exe(98.6MB)——自带 Rapid 引擎,兼容性好,推荐低配机器
- Umi-OCR_Paddle_v2.1.5.7z.exe(128.1MB)——自带 Paddle 引擎,速度稍快,需要较高配置

安装步骤(Windows 绿色版,无需安装):

第一步,下载 .7z.exe 自解压包。文件名以 .7z.exe 结尾的包是自解压程序,即使电脑没装压缩软件也能直接双击解压。

第二步,解压到任意目录(建议避开含中文和空格的路径,例如 D:\Tools\Umi-OCR)。

第三步,双击目录中的 Umi-OCR.exe 启动程序。程序会自动扫描系统语言并切换界面(支持简体中文、繁体中文、English、日本語等)。

第四步,在「全局设置」中添加快捷方式或设置开机自启。

Scoop 命令行安装(可选):

scoop bucket add extras
scoop install extras/umi-ocr          # Rapid 引擎版,兼容性好
# 或
scoop install extras/umi-ocr-paddle   # Paddle 引擎版,速度稍快

注意不要同时安装两个版本,快捷方式会被覆盖。可以先装一个,之后按需导入插件切换引擎。

Linux 安装: 下载 Umi-OCR_Linux_Paddle_2.1.5.tar.xz(264.5MB)解压后执行目录内的 umi-ocr.sh 启动脚本。

快速上手

场景一:截图识别单张图。 打开「截图OCR」标签页,按 Win+Alt+C 框选区域,识别结果立即出现在右侧记录栏,可直接编辑或复制。右侧支持划选多条记录批量复制。

场景二:批量处理扫描件。 打开「批量OCR」标签页,拖入全部图片。在右栏设置中:
1. 选择「文本后处理」为「多栏-按自然段换行」(适合大部分场景)
2. 若图片带水印,进入「忽略区域」编辑器绘制排除框
3. 设置输出格式为 txtcsv
4. 点击开始任务

场景三:HTTP 接口调用。 开启 HTTP 服务后,可以用脚本批量提交识别任务:

import requests, json

# 提交图片识别任务
url = "http://127.0.0.1:1224/api/ocr"
with open("screenshot.png", "rb") as f:
    import base64
    img_b64 = base64.b64encode(f.read()).decode()

payload = {
    "base64": img_b64,
    "options": {"data.format": "text"}
}
resp = requests.post(url, json=payload, timeout=60)
data = resp.json()
if data.get("code") == 100:
    print(data["data"])
else:
    print("识别失败:", data.get("data"))

场景四:扫描版PDF提取文本。 打开「文档识别」标签页,拖入 PDF。若只需提取文本,选择输出 txt;若要生成可检索的扫描件,选择输出「双层可搜索PDF」,并可在设置中指定忽略区域排除页眉页脚。

同类资源对比

工具授权协议离线运行批量识别接口调用平台支持
Umi-OCRMIT完全离线支持,无上限命令行 + HTTPWindows 7+/Linux
Tesseract OCRApache-2.0完全离线需自行编码命令行 + API全平台
PaddleOCRApache-2.0完全离线需自行编码Python API全平台
RapidOCRApache-2.0完全离线需自行编码Python/命令行全平台

选型建议: Tesseract、PaddleOCR、RapidOCR 都是识别引擎库,需要写代码集成,适合开发者把 OCR 能力嵌入自己的程序;Umi-OCR 是把这些引擎包装成开箱即用的桌面软件,适合不写代码但需要批量处理文档的用户。两者的授权协议都是宽松开源协议,商用无限制。

注意事项

授权协议说明。 Umi-OCR 主仓库采用 MIT 协议,允许商用、修改、二次分发,只需保留原始版权声明。其内置的 PaddleOCR 与 RapidOCR 引擎分别为 Apache-2.0 协议,同样允许商用。软件本体不包含任何付费功能或试用限制。

系统要求。 Windows 版本要求 Windows 7 x64 及以上,不支持 32 位系统;Linux 版本要求 x64 架构。暂不支持 macOS,Mac 用户可考虑用 Homebrew 安装 Tesseract,或通过虚拟机运行 Windows 版。

已知限制。
- 数学公式识别目前是实验性功能,复杂公式的识别准确率有限
- 极端像素尺寸的超长图(如超过 20000px 的长截图)需要手动调高「限制图像边长」参数,否则可能识别不全
- 部分老旧 CPU(奔腾、赛扬、凌动系列)无法运行 Paddle 引擎,需改用 Rapid 引擎
- 界面在某些显卡驱动下可能出现截屏闪烁或 UI 错位,可在「界面和外观 → 渲染器」中切换渲染方案或关闭硬件加速

数据安全说明。 软件默认不联网,所有图片和 PDF 均在本地处理。如需完全隔离,可在防火墙中禁止 Umi-OCR.exe 出站连接,软件功能不受影响(仅"检查更新"不可用)。