Umi-OCR 是一款免费的开源桌面应用程序,用于在 Windows 和 Linux 上本地识别文本。它支持屏幕截图、批量图像、文档/PDF 处理、可搜索的双层 PDF、QR/条形码和可选的引擎插件(例如公式识别)。官方存储库使用 MIT 许可证并分发带有校验和的可移植版本。
其最大的优势是操作隐私:配置的本地引擎可以处理文档,而无需将其像素发送到托管的 OCR 服务。这并不会让周围的所有动作都离线。下载、更新检查、第三方插件、用户配置的 HTTP 接口、同步文件夹或下游翻译可以创建网络或数据共享路径。当机密性很重要时,使用网络监视器验证准确的设置。

每个功能解决哪些工作流程?
| 模式 | 最佳使用 | 输出/证据 | 主要限制 |
|---|---|---|---|
| 截图OCR | 从应用程序或图像复制文本 | 立即识别的文本 | 小 UI 文本和缩放伪像 |
| 批量图像OCR | 扫描件、收据和页文件夹 | 具有可重复设置的每个文件文本 | 复杂布局的阅读顺序 |
| 文件/PDF | 扫描的档案和书籍 | 文本导出或可搜索双层PDF | 表格、脚注和隐藏文本对齐 |
| 二维码/条形码 | 解码机器可读符号 | 显示有效负载以供审核 | 负载可能是恶意 URL |
| 公式插件 | 转换孤立的数学区域 | 类似 LaTeX 的表示 | 符号和结构需要目视验证 |
| HTTP接口 | 本地自动化/集成 | 机器可读的 OCR 结果 | 如果绑定超出本地主机,可能会暴露文档 |
OCR 管道及其独立错误
源页面/屏幕
|
裁剪 + 旋转 + 纠偏
|
v
文本检测框
|
v
线路识别
|
v
布局排序/忽略区域
|
.-----+------------。
伏
纯文本可搜索 PDF
| |
人工检查:姓名、数字、否定、阅读顺序
即使识别准确,检测也可能会错过某个区域。识别可能会误读正确框中的字符。布局排序可以按错误的顺序排列正确的行。可搜索的 PDF 看起来可能完全相同,但其不可见的文本层包含错误。单独检查每一层,而不是将可读页面外观视为 OCR 正确性。
Paddle 与 Rapid 构建
官方发行说明将 Paddle 包描述为速度更快/资源更高,适合更强的机器,而 Rapid 版本使用更少的内存并具有更广泛的 CPU 兼容性,但可能更慢。较早的版本文本特别警告说 Paddle 可能会在某些 Pentium、Celeron 和 Atom CPU 上出现故障。当前的 v2.1.5 工件列出了 Windows Rapid 软件包和 Linux Paddle 软件包;可用资源可能因版本而异,因此请检查实时页面。
| 选择 | 从这里开始,当 | 基准测试 | 回退信号 |
|---|---|---|---|
| 桨构建 | 现代兼容 CPU 和更高的文档容量 | 页数/分钟、峰值 RAM 和准确性 | 初始化错误、不兼容或内存压力 |
| 快速构建 | 较旧/资源较低的 Windows 设备 | 相同的测试集和端到端校正时间 | 对于容量来说吞吐量太慢 |
| Linux 包 | 支持的 x64 桌面环境 | 库、字体、剪贴板和捕获行为 | 特定于发行版的依赖性故障 |
| Docker/运行时 | 受控服务器或可重复部署 | API 暴露、卷、CPU 和冷启动 | 需要桌面功能或硬件集成 |
不要仅根据包装尺寸进行选择。运行 50 个代表性页面并测量字符错误、遗漏区域、处理时间、内存和手动校正。如果可以节省审查,更准确的引擎可能会更慢但更便宜;更快的引擎可以赢得干净、重复的页面。
安全下载并安装
使用官方 GitHub 发布页面或其中指定的镜像。将下载的 SHA-256 与为确切资产发布的值进行比较。 v2.1.5 版本审查了 Windows Rapid 和 Linux Paddle 存档列出的 SHA-256 值。一个自解压的 .7z.exe 可以作为存档打开;在执行之前检查并根据组织政策进行扫描。
便携式软件仍然会写入设置和日志。 v2.1.5 下添加了日志 UmiOCR-数据/日志,具有可配置的已保存严重性。在处理机密之前查看日志:文件路径、错误或识别的片段可能会成为保留的数据。保护整个 UmiOCR 数据目录、备份和导出结果。
构建特定于文档的 OCR 基准
从手动验证的页面创建基本事实。对实际预期的最困难条件进行采样,而不是清晰的屏幕截图。包括多个脚本、小字体、倾斜、手机照片、低对比度、图章、手写、垂直文本、混合列、表格和带有页眉/页脚的页面。
| 公制 | 它捕获什么 | 为什么单靠它是不够的 |
|---|---|---|
| 字符错误率 | 插入、删除和替换 | 一个错误的数字比许多标点错误更重要 |
| 字错误率 | 词级可用性 | 不适合没有简单单词边界的脚本 |
| 区域召回 | 完全错过了文本块 | 不对已识别的内容评分 |
| 阅读顺序准确性 | 列和脚注排序 | 需要结构性的基本事实 |
| 临界场精度 | 姓名、总数、日期、ID 和否定 | 特定领域,但对于决策至关重要 |
| 更正分钟/页 | 真实的工作流程成本 | 取决于审稿人的技能和界面 |
按用例设置接受度。搜索索引可以容忍适度的错误;合同条款、医疗价值或发票总额可能需要复录或合格审查。切勿从不同的语言、模型或扫描分布推断“99% 准确”。
图像准备通常胜过模型切换
旋转到正确的方向,裁剪不相关的边框,在手机照片上使用足够的分辨率和正确的视角。保留未受影响的来源。避免使用激进的阈值来删除细字符、小数点或变音符号。测试副本的灰度、对比度和二值化。
| 问题 | 预处理实验 | 风险 |
|---|---|---|
| 倾斜扫描 | 在保留页面边缘的同时进行纠偏 | 插值模糊小文本 |
| 透视照片 | 四角修正 | 错误的角会使柱子变形 |
| 低对比度 | 副本上的局部对比度 | 纸张纹理变成假笔画 |
| 水印/标题 | 使用忽略区域或后过滤规则 | 规则可能会删除合法的重复文本 |
| 小人物 | 以更高的光学分辨率重新扫描 | 放大无法恢复丢失的细节 |
| 手写 | 使用手写专家替代方案 | 印刷文本 OCR 可能会输出自信的废话 |
多语言识别
为文档安装或选择正确的语言库。广泛的多语言模型可能会识别混合文字,但会混淆视觉上相似的字符;当语言已知时,较窄的语言模型可以提高准确性。测试拉丁文/西里尔文易混淆项、中文/日文变体、标点符号、重音符号和从右到左的顺序。
OCR 不是翻译。保留已识别的源文本,然后使用自己的术语表和审阅在单独的步骤中进行翻译。如果翻译使用云模型,即使 OCR 处于离线状态,工作流程也不再完全本地化。
复杂的布局和间隙树排序器
Umi-OCR v2.1 引入了重写的布局解析,描述为多列文档的间隙树排序算法。测试带有侧边栏、报纸、表格、脚注和标题的期刊。视觉上正确的识别仍然可以交错列或将标题附加到错误的图像上。
- 将纯文本顺序与人类阅读路径进行比较。
- 检查是否一致地排除页眉和页脚而不删除正文。
- 当下游引用需要可追溯性时,保留页面边界和坐标。
- 当必须保留单元结构时,使用专门的表/文档解析器。
可搜索的双层 PDF
双层 PDF 保留页面图像并覆盖不可见的文本层以供搜索、复制和索引。 Umi-OCR 发行说明声明支持从原始 PDF 生成;其他导入的文档格式可能会生成文本,但不一定会生成重建的 PDF。确认确切的版本行为。
| 质量检查 | 如何 | 失败后果 |
|---|---|---|
| 视觉保真度 | 像素比较渲染的页面 | 档案页面变更 |
| 文本对齐 | 跨页选择/复制行 | 复制了错误的附近文本 |
| 阅读顺序 | 提取整页并进行比较 | 屏幕阅读器/搜索片段变得不连贯 |
| 页数/轮换 | 自动和目视检查 | 页面缺失或倒置 |
| 文件大小 | 比较原始/输出和压缩 | 无法管理的存档或降级的图像 |
| PDF安全 | 扫描附件/脚本并使用独立查看器 | 恶意输入仍然危险 |
二维码和条形码是不可信数据
首先解码并显示文字负载;不自动打开 URL、加入 Wi-Fi、发送电子邮件或执行应用程序操作。标准化相似的域名、阻止危险方案并独立扫描链接。对于库存或付款,验证校验位并与可信记录进行比较。
公式识别需要语义检查
可选插件可以将公式图像转换为类似 LaTeX 的文本。检查上标、下标、减号、乘法符号、矩阵、括号、希腊字母和方程对齐。编译输出并进行直观比较,然后让领域专家验证含义。视觉上相似的角色可能会逆转结果。
自动化和 HTTP 接口安全
Umi-OCR 的本地 HTTP 功能可以将屏幕截图或批量识别连接到另一个应用程序。默认情况下绑定到环回,在暴露时进行身份验证,限制文件路径和请求大小,并拒绝远程 URL,除非明确要求。切勿将许可的 OCR 服务直接暴露到互联网上。
具有唯一 ID 的队列作业、存储源哈希、捕获引擎/插件版本并返回坐标/置信度(如果可用)。定义超时并隔离损坏的图像/PDF。对不受信任的文档使用单独的帐户/容器,因为图像和 PDF 解码器有自己的攻击面。
替代方案
| 选项 | 最适合 | 与 Umi-OCR 的权衡 |
|---|---|---|
| Umi-OCR | 私人桌面截图、批量和PDF OCR | 有限的协作/云文档智能 |
| 直接PaddleOCR | 定制训练/部署的 OCR 管道 | 更多工程设计,更广泛的当前模型访问 |
| 超立方体 | 成熟的 CLI/库和确定性自动化 | 布局/语言质量各不相同 |
| OCRmyPDF | 命令行可搜索 PDF 管道 | 桌面捕获/UI 功能较少 |
| 云文档人工智能 | 表格、表格、规模和托管 APIs | 上传、经常性成本和提供商治理 |
| 多模式法学硕士 | 几页的语义问题 | 会产生幻觉,并且对于确切的提取证据较弱 |
| 人工数据输入 | 高风险领域和模糊扫描 | 成本较高但验证可靠 |
常见问题
Umi-OCR 免费吗?
是的。官方存储库已获得 MIT 许可。分销、硬件和组织支持仍然会产生成本。
是完全离线的吗?
识别可以是本地的。分别验证更新、插件、同步文件夹、HTTP 集成和下游翻译。
它可以在 macOS 上运行吗?
官方项目主要分发 Windows 和 Linux 版本。 macOS 用户应该比较本机 OCR、VM 或其他受支持的工具。
我应该选择哪个构建?
Benchmark Paddle 首先在兼容的现代硬件上运行,Rapid 在资源较低或不兼容的 Windows CPU 上运行;使用校正时间作为最终措施。
它可以使扫描的 PDF 变得可搜索吗?
是的,使用源 PDF 的双层 PDF 工作流程。归档前检查隐藏文本的对齐方式和阅读顺序。
OCR 结果可以自动信任吗?
没有结果数据。验证姓名、数字、日期、否定、表格单元格和每个决策驱动字段。
它能识别手写体吗?
性能取决于引擎/插件和脚本;使用代表性测试并在需要时首选手写专用系统。
主要来源
- 官方 Umi-OCR 存储库
- 官方英文自述文件
- 官方版本、软件包和校验和
- 官方 Linux 运行时和 Docker 指南
- 官方插件目录
- 项目许可
- PaddleOCR 官方文档
- PaddleOCR 3.0 技术报告
- 美国国会图书馆 PDF 格式保存信息
上次审核日期为 2026 年 7 月 25 日。Umi-OCR 引擎、插件和平台包独立发展。验证文档上的确切发布资产、校验和、语言模型和离线行为。