好家伙,这个免费OCR工具居然能离线识别45K星?Umi-OCR新手使用全教程

Umi-OCR封面

🤔 你是不是也遇到过这种尴尬?

网上看到一张表格截图,想把里面的数据复制出来,结果发现——选不中。

扫描版的PDF合同要签字,需要提取里面某段文字,复制粘贴出来全是乱码。

领导甩过来一张海报图片,让你把上面的文案整理成文档,你只能一个字一个字手敲……

说实话,这些场景太常见了。以前我的做法是打开某个在线OCR网站,上传图片,等识别完再复制。但问题是:有些内容涉及隐私,不方便上传到第三方服务器。而且网速慢的时候,等得人着急。

今天给大家安利一个完全免费、开源、而且可以离线使用的OCR工具——Umi-OCR。GitHub上已经斩获45000+ Star,是国内开发者 hiroi-sora 一个人用业余时间维护的项目,良心到不行。

✨ Umi-OCR 是什么?一句话说清楚

Umi-OCR 是一款免费开源的离线OCR文字识别软件。简单说就是:你截个图,它帮你把图里的文字”抠”出来,变成可以复制粘贴的文本。

最牛的是:全程在你自己的电脑上运行,不需要联网。你的图片、你的文字,一个字节都不会上传到任何服务器。对处理合同、证件、财务报表这些敏感内容来说,安全感拉满。

而且它不是那种简陋的命令行工具,界面做得很漂亮,中文支持也好,解压就能用,零门槛上手。

📥 怎么下载安装?3分钟搞定

第一步:去下载

官方下载地址(推荐蓝奏云,国内免注册不限速):

🔗 蓝奏云:https://hiroi-sora.lanzoul.com/s/umi-ocr

🔗 GitHub Releases:https://github.com/hiroi-sora/Umi-OCR/releases/latest

第二步:选版本

下载的时候你会看到两个版本:

  • Rapid 引擎版(推荐大多数用户)— 兼容性好,老电脑也能跑
  • Paddle 引擎版 — 速度稍快,但需要更好的硬件配置

如果你不确定选哪个,选 Rapid 版就对了。

第三步:解压运行

下载的是 .7z 压缩包(或者 .7z.exe 自解压包)。解压到一个没有中文和空格的路径(比如 D:\Tools\),然后双击 Umi-OCR.exe,程序就启动了。

不需要安装任何东西,不需要注册账号,不需要联网。就是这么简单粗暴。

🖼️ 核心功能一:截图OCR(最常用)

Umi-OCR截图识别界面

这是最高频的功能,也是我觉得最实用的。

操作步骤:

  1. 打开「截图OCR」标签页
  2. 按快捷键 Win + Alt + C(可以自定义)唤起截图模式
  3. 用鼠标框选屏幕上你想识别的区域
  4. 松开鼠标,等一两秒,文字就出来了!

识别结果会显示在右侧的记录栏里,可以直接编辑、划选复制。左侧还有图片预览,你甚至可以直接在预览图上用鼠标选文字。

还支持直接粘贴图片——在微信、QQ里看到的图片,Ctrl+C 复制,然后到 Umi-OCR 里 Ctrl+V 粘贴,直接识别。不用保存到本地再导入,效率翻倍。

📦 核心功能二:批量OCR(处理大量图片)

Umi-OCR批量识别界面

如果你手上有几百张截图或者扫描件需要识别,批量OCR就是救星。

操作步骤:

  1. 打开「批量OCR」标签页
  2. 把图片文件夹直接拖进去(支持 jpg、png、webp、bmp、tiff 等格式)
  3. 选择输出格式(txt、csv、jsonl、md 都可以)
  4. 点「开始任务」,去泡杯咖啡,回来就搞定了

支持忽略区域功能——如果图片上有水印或LOGO,你可以在设置里框出这些区域,识别时会自动跳过,不会把水印文字混进结果里。这个功能太贴心了。

还有一个排版解析功能,可以自动整理识别结果的排版顺序。多栏文章、代码截图这些复杂排版,选对方案后输出的文字顺序会顺畅很多。

任务完成后还支持自动关机——睡前挂一批图,勾上自动关机,第二天起来结果文件就在那了。

📄 核心功能三:PDF文档识别

打开「文档识别」标签页,把扫描版 PDF 拖进去,它会逐页识别文字。

支持输出双层可搜索 PDF——上面是原始图片,下面隐藏着可检索的文字层。以后想搜PDF里的内容,直接 Ctrl+F 就行了。

还支持 epub、mobi、xps 等格式,堪称万能文档识别器。

📱 核心功能四:二维码识别和生成

Umi-OCR二维码功能

没想到吧,一个OCR工具还能扫二维码。

截图、粘贴、拖入图片,自动识别里面的二维码或条形码。支持一图多码,19种编码协议。反过来也能用——输入文本,生成二维码图片。

🆚 和同类工具比,Umi-OCR 好在哪?

对比项 Umi-OCR 在线OCR网站 ABBYY
价格 完全免费 免费/付费 几百到几千元
离线使用 ✅ 完全离线 ❌ 必须联网 ✅ 可离线
隐私安全 ✅ 数据不出本机 ❌ 图片上传服务器 ✅ 本地处理
中文支持 ✅ 内置中文库 ✅ 支持 ✅ 支持
批量处理 ✅ 无上限 ⚠️ 通常有限制 ✅ 支持
老电脑兼容 ✅ Win7也能跑 ✅ 浏览器就行 ❌ 配置要求高

💡 使用感受

用了大半年了,说说真实体验:

最爽的场景:开会时拍了张白板照片,回来直接截图识别,3秒钟文字就出来了,比手打快了不知道多少倍。

最惊喜的:排版解析功能。以前用别的OCR工具,多栏文章识别出来文字顺序乱七八糟,Umi-OCR 选对方案后基本是”所见即所得”的顺序。

唯一的小遗憾:目前只支持 Windows 和 Linux,Mac 用户暂时没福气。不过作者说了,Mac 支持在远期计划里,耐心等等吧。

另外,如果你是开发者,Umi-OCR 还提供了命令行接口和 HTTP 接口,可以把它集成到自己的自动化脚本里。比如用 Python 调用 Umi-OCR 的 HTTP 接口,实现批量自动识别,这个就留给大家自己探索了。

📌 总结

如果你经常需要从图片、截图、扫描件里提取文字,Umi-OCR 绝对是你电脑里应该有的一款工具。

免费、开源、离线、隐私安全、功能全面——这些关键词叠在一起,你很难找到第二款能做到同样水准的工具了。

GitHub 45000+ Star 不是白来的,是真的好用。


关注公众号:「实用软技」,在公众号窗口里回复关键字「软件」即可免费获取

100T高转存免费网盘资源精选【持续更中~~~~】:点击查看

发表回复