Umi-OCR 离线文字识别指南:截图识别、批量图片识别、扫描件转可搜索 PDF

发布时间:2026/9/19 12:50:50
Umi-OCR 离线文字识别指南:截图识别、批量图片识别、扫描件转可搜索 PDF
Umi-OCR 离线文字识别指南截图识别、批量图片识别、扫描件转可搜索 PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR在线 OCR 网站的免费次数半天就用光内网、断网环境里的图片根本传不上云付费工具还要按年订阅。Umi-OCR 是一款开源免费的离线文字识别工具解压即用、免安装、不联网。截图、批量图片、扫描版 PDF 全在本地识别结果直接复制、直接导出。这篇攻略带你从下载到拿到第一个识别结果并讲清排版解析、命令行、HTTP 接口三种进阶用法。30 秒看清新Umi-OCR 是一款开源免费的 OCR 软件支持 Windows x64可下探 Win7与 Linux x64内置 PaddleOCR、RapidOCR 两套离线引擎和多语言识别库。免费、免安装代码全部开源绿色便携解压后双击Umi-OCR.exe直接运行全程离线图片和文档数据完全不出本机内网、断网环境也能照常识别不止识别还能输出双层可搜索 PDF让旧扫描件可全文搜索、可划选、可复制零成本、解压即用、数据不出本机这三件事同时成立在免费 OCR 工具里不多见。从 0 到第一个离线文字识别结果下载发行版.7z压缩包或.7z.exe自解压包后者没装压缩软件也能用解压双击Umi-OCR.exe启动Linux 用umi-ocr.sh首次打开界面语言自动跟随系统打开「截图 OCR」标签页按下软件的截图快捷键唤起选框框住一段文字后松手在右侧「记录」面板里编辑结果右键「复制」带走到这里只花了约 5 分钟 从下载到复制出第一段文字没有注册、没有联网、没有安装向导。按场景挑着看屏幕文字截图 OCR 操作步骤入口是「截图 OCR」标签页。截图松手后左侧是图片预览可直接用鼠标划选文字右侧是识别记录记录支持编辑右键可「复制」CtrlC或「全选」CtrlA还能选中多条记录一次复制。在别处复制的图片也能直接粘贴进 Umi-OCR 识别。小坑提醒截网页长图或大海报时如果丢字把该页设置里的「限制图像边长」调高默认 9602880 是质量与速度的平衡值该参数仅对 PaddleOCR 引擎生效。本地图片Umi-OCR 批量图片识别步骤入口是「批量 OCR」标签页。把图片拖进列表支持 jpg、png、webp、bmp、tif 等格式点「开始任务」列表里能看到每张图的耗时和置信度如 0.92。结果可保存为txt/jsonl/md/csv(Excel)任选格式数量没有上限几百张图一次跑完还支持任务完成后自动关机/待机晚上挂机、次日收结果。图片带水印或 LOGO 时在右侧设置进入忽略区域编辑器按住右键画矩形框框内文字不参与输出注意被忽略的是整个文本块不是单个字符。小坑提醒批量识别带同款水印的论文时矩形框画大一点完全包裹住水印可能出现的位置。文档 / PDF扫描件转可搜索 PDF入口是「文档识别」标签页支持pdf、xps、epub、mobi、fb2、cbz。拖入文档原生文字直接提取扫描页走 OCR 识别并可输出双层可搜索 PDF——给扫描件加上隐形文字层后全文可搜索、可复制、可划选。同样支持设置忽略区域排除页眉、页脚、水印任务完成后可自动关机。小坑提醒PDF 里复制不出任何文字说明它是纯扫描件、没有文本层走一遍「文档识别」输出双层 PDF 就一劳永逸。想更进一步排版解析多栏论文、竖排文字、代码截图都有现成方案。「文本后处理」设置里提供 6 种预设排版解析方案——多栏文档选「多栏-按自然段换行」代码截图选「单栏-保留缩进」保留行首缩进和行中空格所有方案都能自动处理横排与竖排从右到左的排版。命令行调用入口就是Umi-OCR.exe主程序本身备用启动器不可用命令行HTTP 服务默认开启一条命令批量识别整个文件夹umi-ocr --path D:/scans --output D:/result.txt全部参数见 docs/README_CLI.md。HTTP 接口适合供其他程序调用。流程是上传文件获取任务 ID → 轮询任务状态 → 下载生成文件文档识别、二维码也有专门接口详见 docs/http/api_doc.md。全局设置桌面快捷方式、开机自启、界面语言与主题、OCR 引擎插件切换都在这一页完成。排版解析管读得顺命令行和接口管接得上——截图、脚本、外部程序调用的都是同一个本地 OCR 引擎附加配置只有全局设置里的 2 个开关。常见问题问识别大图、长图时丢字、结果残缺答在对应页面「设置 → 文字识别 → 限制图像边长」把数值调高2880 是平衡点。默认 960 像素会把超大图压缩过度信息直接压没了。问多栏文档识别后顺序错乱左右栏串行答在「排版解析方案」里选「多栏-按自然段换行」文本会按阅读顺序重排。默认方案不区分多栏布局左右栏才会交替输出。问PDF 里复制出来的全是乱码或空白答这份 PDF 是纯扫描件、没有文本层用 Umi-OCR 的「文档识别」跑一遍并输出双层可搜索 PDF之后搜索、复制都正常。问命令行指令umi-ocr没有反应答入口必须是Umi-OCR.exe本体并确认「全局设置」中 HTTP 服务处于开启状态默认开启、主机选「仅本地」。命令行是靠本地回环的 HTTP 接口与后台进程通信这个服务关了是最常见的原因。你遇到的问题大概率就是这 4 个全部能在 1–2 次设置点击内解决不用翻源码。现在动手下载并解压发行版双击Umi-OCR.exe启动跑一次截图 OCR快捷键框选复制识别结果再试一个进阶场景把一个 PDF 拖进「文档识别」或把一个文件夹丢给命令行更多资料README.md功能一览· docs/README_CLI.md命令行手册· docs/http/api_doc.mdHTTP 接口· CHANGE_LOG.md更新日志想深入源码二次开发git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考