深度解析MicroPython WebREPL架构:从原理到高级应用
Umi-OCR实战:免费离线OCR软件,把截图与扫描件一键变成可搜索文字
备考那年,我的复习资料库里堆着五本教材的扫描件、两百多张课堂PPT截图和一沓手机拍的书页照片。麻烦在于:这些文件里的字看得清清楚楚,却一个也复制不出来,想检索一个知识点,只能一页页翻。我最终靠 Umi-OCR 这款免费、开源、可批量的离线OCR软件,把所有"看得见却复制不出来"的文字全部变成了可搜索的文本。这篇教程,就是我从头到尾走完的完整过程。
一、被"死文字"困住的备考周
那阵子我每天要做的事就一件:把扫描版教材里的重点段落抄进笔记软件。PDF 在我眼前摊开,内容一目了然,可鼠标一划,选中的只有空白——扫描件没有文字层,本质上就是一张张照片。想查一个术语在哪几本书里出现过,只能凭记忆逐页翻,眼睛都快看花了。
我试过手机上的 OCR 应用,一次只能拍一页,识别完还要手动校对排版,几百页下来手都麻了。那段时间我几乎默认了"扫描件就该靠肉眼啃"这个事实,直到我意识到:应该有工具能解决这个问题。
二、一圈试下来,为什么最后选了它
在认真找工具之前,我先在脑子里过了一遍候选方案。
在线OCR网站首先被排除。我的课件和教材涉及老师未公开的讲义,上传到别人的服务器上,心里始终不踏实,何况免费额度少、还要注册排队。商用OCR软件倒是功能全,可一看年费价格,直接劝退。命令行工具我也试着碰过,安装环境、下载语言包、调识别参数,每一步都是门槛,对只想快点出结果的我来说太陡了。
就在纠结的时候,我在开源社区刷到了 Umi-OCR。项目页上写着一句话:"免费,开源,可批量的离线OCR软件,解压即用。"离线、免费、批量、免安装——这四个词正好戳中我所有的顾虑。我下载了发行包,决定试试看。
三、解压即用:三分钟搭好离线识别环境
Umi-OCR 不需要安装。下载的 .7z 压缩包解压后,双击 Umi-OCR.exe 就能启动,第一次打开还会按系统语言自动切换界面,我直接看到的就是简体中文。主界面是标签页式的:截图OCR、批量OCR、文档识别、二维码、全局设置,想用哪个点哪个,还能锁定标签防止误关。
我做的第一件事是打开"全局设置"过一遍配置:语言下拉框里有简体中文,也能切英文、日文;主题有亮色暗色多套;字体和界面缩放比例都能调。如果你的电脑上出现截屏闪烁或界面错位,把"渲染器"切到别的方案,或关闭硬件加速即可。整个环境三分钟搭完,全程没碰过网络。
四、第一场实战:快捷键截屏,右侧秒出文字 ⚡
环境就绪,我直接打开了"截图OCR"标签页,按下预设的截图快捷键(在设置里可以改成自己习惯的组合键),屏幕上出现取景框。我框住PPT里一段 Python 代码截图,松开鼠标,右侧面板瞬间吐出识别好的文字——连行首缩进都原样保留了。
这里有个一开始被我低估、后来觉得最关键设置:"文本后处理"里的排版解析方案。识别代码截图时选"单栏-保留缩进",行首缩进和行中空格原样保留;读多栏排版的论文页面就选"多栏-按自然段换行",左右栏文字按阅读顺序输出,不会交叉错乱。右侧的记录栏支持划选多条一起复制,也可以把剪贴板里的图片直接粘贴进来识别。一下午的课件整理,被压缩成了半小时。
五、规模化:几百张图片与整本扫描PDF ⏳
课件是零散的,教材却是整本的。我先处理那两百多张PPT截图:全部拖进"批量OCR"页的任务列表,点"开始任务",进度条开始跳动,每张图下方标注着耗时和状态。
批量OCR没有数量上限,一次跑完几百张图,结果能导出为 txt、jsonl、md 或 csv(Excel)格式。更贴心的是"忽略区域"功能:我的手机照片里总有时间水印和页角阴影,进入忽略区域编辑器,按住右键在水印可能出现的位置画上矩形框,任务里这些区域内的文字整块被忽略,识别结果干净得多。
最难啃的是那五本扫描版教材 PDF。Umi-OCR 的"文档识别"页面支持 pdf、xps、epub、mobi、fb2、cbz 等格式,可以提取原有文本,也可以对扫描件做 OCR,输出成双层可搜索PDF:底层保留扫描原图,顶层覆盖透明文字层。处理长文档时,别忘了同样设置忽略区域,把页眉、页脚、页码排除掉,避免它们混进正文。几本书同时排队,加上"完成后自动关机",睡一觉醒来,整个文献库全部"活"了——之后我写笔记时直接全文检索某个术语,几秒钟定位到所有相关段落 🔍。
六、彩蛋与进阶:二维码、命令行与多语言界面
处理完正事,我还捡到几个彩蛋。"二维码"页面既能截图扫码(支持一图多码、19 种码制协议),也能输入文本生成二维码,并调整纠错等级。
想自动化的人,软件还提供命令行和 HTTP 接口。比如一条 umi-ocr --path "文件夹路径" 就能批量识别整个文件夹里的图片,umi-ocr --screenshot 可唤起截屏,umi-ocr --qrcode_read 和 umi-ocr --qrcode_create 负责二维码的读取与生成。更详细的用法写在项目 docs 目录下的命令行手册和 HTTP 接口说明里,把 OCR 能力嵌进自己的小工具也完全可行。
界面本地化同样做得认真——简体中文、繁体中文、英文、日文等多语言切换,社区翻译持续推进。英文资料看多了的时候,切到英文界面也不别扭。
七、复盘:为什么它成了我的默认OCR工具
一周用下来,最打动我的不是某个炫技功能,而是三点:完全离线,资料不过别人的手;没有学习成本,核心功能都放在显眼处;批量能力扎实,图片、PDF 都能成批处理。免费开源、支持 Windows 与 Linux,功能演进都写在更新日志里,看得见变化。
如果你手头也压着扫描件、截图和旧 PDF,别急着逐字手打。去项目仓库下载最新发行版,解压双击就能用;想研究源码的开发者,可以执行 git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR 一探究竟。挑一份你最头疼的文档跑一遍,也许你的效率困局,就从这一次双击开始松动。🌟
更多推荐







所有评论(0)