ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Umi-OCR 一篇讲透:免费离线 OCR,从截图取文到批量处理一文件夹文档

Umi-OCR 一篇讲透:免费离线 OCR,从截图取文到批量处理一文件夹文档 Umi-OCR 一篇讲透免费离线 OCR从截图取文到批量处理一文件夹文档【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR文字识别工具识别全程在你自己的电脑上完成不联网。它的活主要有四类把屏幕截图变成可选中文字、把一文件夹图片批量转成文本文件、把扫描版 PDF 变成可搜索 PDF外加二维码扫码/生成。适合需要频繁整理文档资料的办公用户也适合想把 OCR 接进自己脚本的开发者界面默认中文几乎零学习成本。它是什么为什么值得装一个几个点一次说清不联网OCR 引擎RapidOCR / PaddleOCR内置在本地识别速度只取决于你自己的电脑资料不出机器。解压即用发布包是.7z压缩包或.7z.exe自解压包解压后双击Umi-OCR.exe就能跑没有安装环节 两种调用方式图形界面之外还支持命令行与 HTTP 接口写脚本调它只差一条命令功能细节见 README.md。双系统都能跑Windows 7 x64 与 Linux x64 均支持。界面支持多国语言第一次启动时按系统语言自动切换之后随时可手动改路径是「全局设置 → 语言/Language」已覆盖简体中文、英语、繁体中文、日语、俄语、葡萄牙语等。从下载到第一次出文字只需三步下载发布包解压到一个你记得住的目录路径保持纯英文别带空格和特殊字符。双击Umi-OCR.exe启动Linux 用户直接运行umi-ocr.sh软件默认打开在「截图OCR」标签页。按页面上的快捷键唤起截图框选屏幕上的文字区域松手后结果就出现在右侧「记录」栏直接右键选「复制」即可。到这儿就成功了。图省事的话还可以跳过框选从别处复制一张图片直接粘贴进窗口同样能识别。先干一票真的把一文件夹扫描件变成可搜索 PDF功能清单先放一边咱拿真实活练手桌面上有个文件夹放满扫描版 PDF要把它们变成能 CtrlF 的文件 准备新建一个output文件夹存放结果打开「文档识别」标签页。把扫描文件拖进任务列表支持pdf, xps, epub, mobi, fb2, cbz。操作如果每页页脚都有页码水印先进「忽略区域」编辑器用右键把页脚条框住。注意被忽略的是框内「整个文本块」框要完全包住水印可能出现的位置。输出格式勾选「双层可搜索PDF」只想要纯文本内容的话也可以选「单层纯文本PDF」。任务完成设置选「自动关机」就可以去忙别的了。进度条逐页推进中途电脑休眠也没关系任务支持暂停后恢复不用从头再来。结果验证打开output文件夹能看到与原件同名的双层可搜索PDF版式和原件一模一样但鼠标能选中、能复制、CtrlF 能搜到任意文字页脚页码也不再混进结果。任务跑完机器按设置自动关机。四个标签页各管一段活网页和软件界面里的文字选不中看截图OCR这是软件默认的第一个标签页好用点在三处左预览、右记录左侧预览栏直接用鼠标划选复制右侧「记录」栏可以先编辑文字再复制还支持划选多条记录一起复制。排版解析方案决定可读性在「文本后处理 - 排版解析方案」里报刊双栏内容选「多栏-按自然段换行」代码截图选「单栏-保留缩进」行首空格、行内空格都保留想要引擎原始输出就选「不做处理」。横排竖排都能自动处理竖排从右到左也能识别前提是引擎本身支持。代码截图是个好试金石选「单栏-保留缩进」时缩进和空行都保住了一次框选文字带着正确排版回来记录面板还会保留历史随时翻回去补选。一文件夹图片一次性转成文本文件用批量OCR手机拍的讲义、扫描件照片一个文件夹几十张甚至几百张要逐张过字的活交给这一页把图片文件夹拖进任务列表支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff格式数量没有上限。右栏勾选输出格式txt, jsonl, md, csv(Excel)可以多选同时保存。图片角落有水印或 LOGO 的话进「忽略区域」编辑器用右键画矩形框住框内整个文本块会被跳过。提交任务还能设任务完成后自动关机 / 自动待机。跑完一整批每张图都会留下一个一一对应的文本文件任务列表里还标着每张图的耗时与置信度方便你把没认好的挑出来重跑。扫描版 PDF 想被搜到用文档识别这一页就是给搜不了字的纯扫描文档准备的拖入文档支持pdf, xps, epub, mobi, fb2, cbz。文档自带文本层的直接提取原文不重复识别纯扫描件则逐页 OCR。输出勾选「双层可搜索PDF」版式不动、叠加一层可搜索文字或「单层纯文本PDF」。搭配「忽略区域」可以把页眉页脚之类的文字排除在外。产物是一份能归档、能检索的PDF样子和原来没区别但 CtrlF 是真能用的。二维码扫得出来也生成得出来扫码方向截图、粘贴或拖入本地图片读取其中的二维码、条形码支持一图多码覆盖QRCode、EAN13、DataMatrix、PDF417等 19 种协议。生成方向输入文本选定协议、纠错等级和图片尺寸就能产出一张二维码图片。两种方向的结果都能直接用前者还你解码后的文本后者还你一张能存下来就用的二维码图。这几个地方调对了事半功倍限制图像边长→ 要识别超大长图、大图时 → 在识别页「设置 → 文字识别」里把数值调高否则超出的部分会被压缩截断识别结果不完整。排版解析方案→ 多栏文档、代码截图时 → 分别选「多栏-按自然段换行」或「单栏-保留缩进」别一直用默认方案将就。OCR引擎插件→ 想对比速度和准确率时 → 在「全局设置」里于 Rapid 与 Paddle 之间切换大任务前先拿十几张小图试跑。语言/模型库→ 要识别外语时 → 在 OCR 插件设置里勾选对应语言勾得越多占内存越多纯中文场景不必全开。渲染器→ 老机器出现截图闪烁、界面错位时 → 「全局设置 → 界面和外观」里切换渲染方案或关闭硬件加速。日志保存级别→ 排查问题想留证据时 → 在全局设置标签页调整级别日志存放在UmiOCR-data/logs目录。出问题先看这里 批量识别超大长图结果不完整。原因默认开启了图像边长限制超出部分被压缩或截断。 解决在「设置 → 文字识别」里调高「限制图像边长」数值。结果里总混着水印、页眉页脚。原因没画忽略区域或框没包住整个文本块。 解决用右键画矩形框被忽略的是框内整个文本块框要把水印可能出现的所有位置都圈进去。老显卡机器截图时闪烁、UI 错位。原因默认显卡加速渲染与该机型不兼容。 解决「全局设置 → 界面和外观 → 渲染器」里切换渲染方案或关闭硬件加速。脚本里调命令行收不到识别结果。原因umi-ocr的结果不能用系统的或|重定向。 解决改用--output file.txt写文件或--output_append追加完整参数表见 命令行手册。Linux 老系统启动报错。原因运行库依赖不满足。 解决选用稳定的 release 分支Linux 侧要求 glibc 2.31 以上大致对应 Debian 11、Ubuntu 20 及之后的系统。版本信息、文档与源码去哪拿当前稳定版本为v2.1.52025.3.26这一版新增了日志机制和--reload配置重载指令完整沿革见 更新日志。开发者向命令行调用方式见 docs/README_CLI.mdHTTP 接口可传 Base64 图片直接识别见 docs/http/README.md具体接口参数还能在 docs/http/api_ocr.md 里展开。遇到 Bug 直接到项目的 Issue 页面提交界面翻译在 Weblate 平台上协作维护已覆盖十几种语言也欢迎译者参与。拿源码日常使用建议看 release 分支main、dev可能含有开发中的不稳定功能git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/um/Umi-OCR解压一个发行版先框一次截图你会发现离线 OCR 离你的工作流只差一个快捷键 【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进