Umi-OCR
Umi-OCR
Active

Umi-OCR

Umi-OCR 是一款免费的 MIT 许可的离线 OCR 桌面应用程序,适用于 Windows 和 Linux,涵盖屏幕截图、批处理图像、PDF、QR/条形码和可选的公式插件。本指南比较了 Paddle 和 Rapid 构建、隐私、准确性测试、布局/PDF QA、自动化和替代方案。

171

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Umi-OCR离线OCR免费OCR开源OCR截图OCRPDF OCR二维码识别本地OCRWindows OCRLinux OCR

Product Preview

A quick visual look at Umi-OCR before you visit the official site.

Published 1/21/2026
Umi-OCR screenshot

Editorial Review

About Umi-OCR

Umi-OCR 是一款免费的开源桌面应用程序,用于在 Windows 和 Linux 上本地识别文本。它支持屏幕截图、批量图像、文档/PDF 处理、可搜索的双层 PDF、QR/条形码和可选的引擎插件(例如公式识别)。官方存储库使用 MIT 许可证并分发带有校验和的可移植版本。

其最大的优势是操作隐私:配置的本地引擎可以处理文档,而无需将其像素发送到托管的 OCR 服务。这并不会让周围的所有动作都离线。下载、更新检查、第三方插件、用户配置的 HTTP 接口、同步文件夹或下游翻译可以创建网络或数据共享路径。当机密性很重要时,使用网络监视器验证准确的设置。

Official Umi-OCR logo
Umi-OCR 是本地 OCR 工作台,而不是云文档理解服务。识别输出仍必须根据源像素进行检查。

每个功能解决哪些工作流程?

模式最佳使用输出/证据主要限制
截图OCR从应用程序或图像复制文本立即识别的文本小 UI 文本和缩放伪像
批量图像OCR扫描件、收据和页文件夹具有可重复设置的每个文件文本复杂布局的阅读顺序
文件/PDF扫描的档案和书籍文本导出或可搜索双层PDF表格、脚注和隐藏文本对齐
二维码/条形码解码机器可读符号显示有效负载以供审核负载可能是恶意 URL
公式插件转换孤立的数学区域类似 LaTeX 的表示符号和结构需要目视验证
HTTP接口本地自动化/集成机器可读的 OCR 结果如果绑定超出本地主机,可能会暴露文档

OCR 管道及其独立错误

 源页面/屏幕
         |
   裁剪 + 旋转 + 纠偏
         |
         v
   文本检测框
         |
         v
   线路识别
         |
         v
 布局排序/忽略区域
         |
   .-----+------------。
   伏
 纯文本可搜索 PDF
   |                 |
 人工检查:姓名、数字、否定、阅读顺序

即使识别准确,检测也可能会错过某个区域。识别可能会误读正确框中的字符。布局排序可以按错误的顺序排列正确的行。可搜索的 PDF 看起来可能完全相同,但其不可见的文本层包含错误。单独检查每一层,而不是将可读页面外观视为 OCR 正确性。

Paddle 与 Rapid 构建

官方发行说明将 Paddle 包描述为速度更快/资源更高,适合更强的机器,而 Rapid 版本使用更少的内存并具有更广泛的 CPU 兼容性,但可能更慢。较早的版本文本特别警告说 Paddle 可能会在某些 Pentium、Celeron 和 Atom CPU 上出现故障。当前的 v2.1.5 工件列出了 Windows Rapid 软件包和 Linux Paddle 软件包;可用资源可能因版本而异,因此请检查实时页面。

选择从这里开始,当基准测试回退信号
桨构建现代兼容 CPU 和更高的文档容量页数/分钟、峰值 RAM 和准确性初始化错误、不兼容或内存压力
快速构建较旧/资源较低的 Windows 设备相同的测试集和端到端校正时间对于容量来说吞吐量太慢
Linux 包支持的 x64 桌面环境库、字体、剪贴板和捕获行为特定于发行版的依赖性故障
Docker/运行时受控服务器或可重复部署API 暴露、卷、CPU 和冷启动需要桌面功能或硬件集成

不要仅根据包装尺寸进行选择。运行 50 个代表性页面并测量字符错误、遗漏区域、处理时间、内存和手动校正。如果可以节省审查,更准确的引擎可能会更慢但更便宜;更快的引擎可以赢得干净、重复的页面。

安全下载并安装

使用官方 GitHub 发布页面或其中指定的镜像。将下载的 SHA-256 与为确切资产发布的值进行比较。 v2.1.5 版本审查了 Windows Rapid 和 Linux Paddle 存档列出的 SHA-256 值。一个自解压的 .7z.exe 可以作为存档打开;在执行之前检查并根据组织政策进行扫描。

便携式软件仍然会写入设置和日志。 v2.1.5 下添加了日志 UmiOCR-数据/日志,具有可配置的已保存严重性。在处理机密之前查看日志:文件路径、错误或识别的片段可能会成为保留的数据。保护整个 UmiOCR 数据目录、备份和导出结果。

构建特定于文档的 OCR 基准

从手动验证的页面创建基本事实。对实际预期的最困难条件进行采样,而不是清晰的屏幕截图。包括多个脚本、小字体、倾斜、手机照片、低对比度、图章、手写、垂直文本、混合列、表格和带有页眉/页脚的页面。

公制它捕获什么为什么单靠它是不够的
字符错误率插入、删除和替换一个错误的数字比许多标点错误更重要
字错误率词级可用性不适合没有简单单词边界的脚本
区域召回完全错过了文本块不对已识别的内容评分
阅读顺序准确性列和脚注排序需要结构性的基本事实
临界场精度姓名、总数、日期、ID 和否定特定领域,但对于决策至关重要
更正分钟/页真实的工作流程成本取决于审稿人的技能和界面

按用例设置接受度。搜索索引可以容忍适度的错误;合同条款、医疗价值或发票总额可能需要复录或合格审查。切勿从不同的语言、模型或扫描分布推断“99% 准确”。

图像准备通常胜过模型切换

旋转到正确的方向,裁剪不相关的边框,在手机照片上使用足够的分辨率和正确的视角。保留未受影响的来源。避免使用激进的阈值来删除细字符、小数点或变音符号。测试副本的灰度、对比度和二值化。

问题预处理实验风险
倾斜扫描在保留页面边缘的同时进行纠偏插值模糊小文本
透视照片四角修正错误的角会使柱子变形
低对比度副本上的局部对比度纸张纹理变成假笔画
水印/标题使用忽略区域或后过滤规则规则可能会删除合法的重复文本
小人物以更高的光学分辨率重新扫描放大无法恢复丢失的细节
手写使用手写专家替代方案印刷文本 OCR 可能会输出自信的废话

多语言识别

为文档安装或选择正确的语言库。广泛的多语言模型可能会识别混合文字,但会混淆视觉上相似的字符;当语言已知时,较窄的语言模型可以提高准确性。测试拉丁文/西里尔文易混淆项、中文/日文变体、标点符号、重音符号和从右到左的顺序。

OCR 不是翻译。保留已识别的源文本,然后使用自己的术语表和审阅在单独的步骤中进行翻译。如果翻译使用云模型,即使 OCR 处于离线状态,工作流程也不再完全本地化。

复杂的布局和间隙树排序器

Umi-OCR v2.1 引入了重写的布局解析,描述为多列文档的间隙树排序算法。测试带有侧边栏、报纸、表格、脚注和标题的期刊。视觉上正确的识别仍然可以交错列或将标题附加到错误的图像上。

  • 将纯文本顺序与人类阅读路径进行比较。
  • 检查是否一致地排除页眉和页脚而不删除正文。
  • 当下游引用需要可追溯性时,保留页面边界和坐标。
  • 当必须保留单元结构时,使用专门的表/文档解析器。

可搜索的双层 PDF

双层 PDF 保留页面图像并覆盖不可见的文本层以供搜索、复制和索引。 Umi-OCR 发行说明声明支持从原始 PDF 生成;其他导入的文档格式可能会生成文本,但不一定会生成重建的 PDF。确认确切的版本行为。

质量检查如何失败后果
视觉保真度像素比较渲染的页面档案页面变更
文本对齐跨页选择/复制行复制了错误的附近文本
阅读顺序提取整页并进行比较屏幕阅读器/搜索片段变得不连贯
页数/轮换自动和目视检查页面缺失或倒置
文件大小比较原始/输出和压缩无法管理的存档或降级的图像
PDF安全扫描附件/脚本并使用独立查看器恶意输入仍然危险

二维码和条形码是不可信数据

首先解码并显示文字负载;不自动打开 URL、加入 Wi-Fi、发送电子邮件或执行应用程序操作。标准化相似的域名、阻止危险方案并独立扫描链接。对于库存或付款,验证校验位并与可信记录进行比较。

公式识别需要语义检查

可选插件可以将公式图像转换为类似 LaTeX 的文本。检查上标、下标、减号、乘法符号、矩阵、括号、希腊字母和方程对齐。编译输出并进行直观比较,然后让领域专家验证含义。视觉上相似的角色可能会逆转结果。

自动化和 HTTP 接口安全

Umi-OCR 的本地 HTTP 功能可以将屏幕截图或批量识别连接到另一个应用程序。默认情况下绑定到环回,在暴露时进行身份验证,限制文件路径和请求大小,并拒绝远程 URL,除非明确要求。切勿将许可的 OCR 服务直接暴露到互联网上。

具有唯一 ID 的队列作业、存储源哈希、捕获引擎/插件版本并返回坐标/置信度(如果可用)。定义超时并隔离损坏的图像/PDF。对不受信任的文档使用单独的帐户/容器,因为图像和 PDF 解码器有自己的攻击面。

替代方案

选项最适合与 Umi-OCR 的权衡
Umi-OCR私人桌面截图、批量和PDF OCR有限的协作/云文档智能
直接PaddleOCR定制训练/部署的 OCR 管道更多工程设计,更广泛的当前模型访问
超立方体成熟的 CLI/库和确定性自动化布局/语言质量各不相同
OCRmyPDF命令行可搜索 PDF 管道桌面捕获/UI 功能较少
云文档人工智能表格、表格、规模和托管 APIs上传、经常性成本和提供商治理
多模式法学硕士几页的语义问题会产生幻觉,并且对于确切的提取证据较弱
人工数据输入高风险领域和模糊扫描成本较高但验证可靠

常见问题

Umi-OCR 免费吗?

是的。官方存储库已获得 MIT 许可。分销、硬件和组织支持仍然会产生成本。

是完全离线的吗?

识别可以是本地的。分别验证更新、插件、同步文件夹、HTTP 集成和下游翻译。

它可以在 macOS 上运行吗?

官方项目主要分发 Windows 和 Linux 版本。 macOS 用户应该比较本机 OCR、VM 或其他受支持的工具。

我应该选择哪个构建?

Benchmark Paddle 首先在兼容的现代硬件上运行,Rapid 在资源较低或不兼容的 Windows CPU 上运行;使用校正时间作为最终措施。

它可以使扫描的 PDF 变得可搜索吗?

是的,使用源 PDF 的双层 PDF 工作流程。归档前检查隐藏文本的对齐方式和阅读顺序。

OCR 结果可以自动信任吗?

没有结果数据。验证姓名、数字、日期、否定、表格单元格和每个决策驱动字段。

它能识别手写体吗?

性能取决于引擎/插件和脚本;使用代表性测试并在需要时首选手写专用系统。

主要来源

上次审核日期为 2026 年 7 月 25 日。Umi-OCR 引擎、插件和平台包独立发展。验证文档上的确切发布资产、校验和、语言模型和离线行为。

Ready to try Umi-OCR?

Visit the official website to get started

Visit Umi-OCR

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/6/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool