Umi-OCR
Umi-OCR
Active

Umi-OCR

Umi-OCR は、MIT ライセンスの Windows および Linux 用の無料のオフライン OCR デスクトップ アプリで、スクリーンショット、バッチ イメージ、PDF、QR/バーコード、およびオプションの数式プラグインをカバーします。このガイドでは、Paddle と Rapid のビルド、プライバシー、精度テスト、レイアウト/PDF QA、自動化、および代替手段を比較します。

115

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Umi-OCRオフラインOCR無料OCRオープンソースOCRスクリーンショットOCRPDF OCRローカルOCR

Product Preview

A quick visual look at Umi-OCR before you visit the official site.

Published 1/21/2026
Umi-OCR screenshot

Editorial Review

About Umi-OCR

Umi-OCR は、Windows および Linux 上でローカルにテキストを認識するための無料のオープンソース デスクトップ アプリケーションです。スクリーンショットのキャプチャ、バッチ画像、ドキュメント/PDF 処理、検索可能な 2 層 PDF、QR/バーコード、数式認識などのオプションのエンジン プラグインをサポートしています。公式リポジトリは MIT ライセンスを使用し、チェックサム付きのポータブル ビルドを配布します。

その最大の利点は運用上のプライバシーです。構成されたローカル エンジンは、ホストされた OCR サービスにピクセルを送信せずにドキュメントを処理できます。だからといって、周囲のすべてのアクションがオフラインになるわけではありません。ダウンロード、更新チェック、サードパーティのプラグイン、ユーザー構成の HTTP インターフェイス、同期フォルダー、またはダウンストリーム変換により、ネットワークまたはデータ共有パスを作成できます。機密性が重要な場合は、ネットワーク モニターを使用して正確な設定を確認してください。

Official Umi-OCR logo
Umi-OCR は、クラウド文書理解サービスではなく、ローカル OCR ワークベンチです。認識出力は依然としてソース ピクセルに対してチェックする必要があります。

各機能はどのワークフローを解決しますか?

モード最適な使用方法成果物/証拠主な制限事項
スクリーンショット OCRアプリまたは画像からテキストをコピーするすぐに認識されるテキスト小さな UI テキストとスケーリングアーティファクト
バッチ画像OCRスキャン、レシート、ページフォルダー繰り返し可能な設定を備えたファイルごとのテキスト複雑なレイアウト全体での読み取り順序
ドキュメント/PDFスキャンされたアーカイブと書籍テキストのエクスポートまたは検索可能な 2 層 PDF表、脚注、隠しテキストの配置
QR/バーコード機械可読シンボルをデコードするレビューのために表示されたペイロードペイロードは悪意のある URL である可能性があります
数式プラグイン孤立した数学領域を変換するLaTeX 風の表現シンボルと構造は視覚的に確認する必要があります
HTTPインターフェースローカル自動化/統合機械可読な OCR 結果localhost を超えてバインドされている場合、ドキュメントが公開される可能性があります

OCR パイプラインとその独立したエラー

 ソースページ/画面
         |
   トリミング + 回転 + 傾き補正
         |
         v
   テキスト検出ボックス
         |
         v
   線認識
         |
         v
 レイアウトの並べ替え / 領域の無視
         |
   .-----+---------------。
   v v
 プレーンテキスト検索可能な PDF
   |                 |
 人間によるチェック: 名前、数字、否定、読み取り順序

認識が正確であっても、領域を検出できない可能性があります。正しいボックス内の文字を誤って認識する可能性があります。レイアウトを並べ替えると、正しい行が間違った順序で配置される場合があります。検索可能な PDF は、視覚的には同一に見えますが、非表示のテキスト レイヤーにはエラーが含まれていることがあります。読みやすいページの外観を OCR の正しさとして扱うのではなく、各レイヤーを個別に検査します。

パドルビルドとラピッドビルド

公式リリースノートでは、Paddle パッケージは高速かつ高リソースで強力なマシンに適していると説明されていますが、Rapid ビルドはメモリ使用量が少なく、幅広い CPU 互換性がありますが、速度が遅くなる可能性があります。古いリリース テキストでは、一部の Pentium、Celeron、Atom CPU で Paddle が失敗する可能性があると特に警告していました。現在の v2.1.5 アーティファクトには、Windows Rapid パッケージと Linux Paddle パッケージがリストされています。利用可能なアセットはリリースによって異なる場合があるため、ライブ ページを確認してください。

選択ここから始めてくださいベンチマークフォールバック信号
パドルビルド最新の互換性のある CPU と大量のドキュメントページ/分、ピーク RAM および精度初期化エラー、非互換性、またはメモリ不足
迅速なビルド古い/低リソースの Windows デバイス同じテストセットとエンドツーエンドの修正時間ボリュームに対してスループットが遅すぎる
Linuxパッケージサポートされている x64 デスクトップ環境ライブラリ、フォント、クリップボード、およびキャプチャの動作ディストリビューション固有の依存関係のエラー
ドッカー/ランタイム制御されたサーバーまたは反復可能な展開API エクスポージャ、ボリューム、CPU、コールド スタートデスクトップ機能またはハードウェア統合が必要

パッケージサイズだけで選ばないでください。代表的な 50 ページを実行し、文字エラー、欠落領域、処理時間、メモリ、および手動修正を測定します。より正確なエンジンは、レビューを省略できる場合、速度は遅くなりますが、より安価になります。クリーンで反復的なページでは、より高速なエンジンが最適です。

安全にダウンロードしてインストールします

公式 GitHub リリース ページ、またはそこに指定されているミラーを使用します。ダウンロードした SHA-256 を、正確なアセットに対して公開された値と比較します。 v2.1.5 リリースでは、Windows Rapid および Linux Paddle アーカイブのリストされた SHA-256 値がレビューされました。自己解凍型 .7z.exe アーカイブとして開くことができます。実行前に組織のポリシーに基づいて検査し、スキャンします。

ポータブル ソフトウェアは引き続き設定とログを書き込みます。 v2.1.5 にログを追加しました UmiOCR-データ/ログ、設定可能な保存された重大度を備えています。シークレットを処理する前にログを確認します。ファイル パス、エラー、または認識されたスニペットがデータとして保持される可能性があります。 UmiOCR-data ディレクトリ全体、バックアップ、エクスポートされた結果を保護します。

ドキュメント固有の OCR ベンチマークを構築する

手動で検証されたページからグランド トゥルースを作成します。きれいなスクリーンショットではなく、実際に予想される最も厳しい条件をサンプリングします。複数のスクリプト、小さなフォント、傾き、携帯電話の写真、低コントラスト、スタンプ、手書き、縦書きテキスト、混合列、表、ヘッダー/フッター付きのページが含まれます。

メトリック何が引っかかるのかなぜそれだけでは不十分なのか
文字エラー率挿入、削除、置換桁の 1 桁の間違いが、句読点の間違いよりも重要になる可能性があります
単語エラー率単語レベルのユーザビリティ単純な単語境界のないスクリプトには不向き
地域のリコール完全に抜け落ちたテキストブロック認識されたコンテンツにスコアを付けません
読み取り順序の精度列と脚注の順序付け構造的なグラウンドトゥルースが必要
クリティカルフィールドの精度名前、合計、日付、ID、および否定ドメイン固有だが意思決定には不可欠
修正分/ページ真のワークフローコストレビュー担当者のスキルとインターフェースに依存します

ユースケースごとに受け入れを設定します。検索インデックス作成では、多少のエラーは許容される場合があります。契約条項、医療価値、または請求額の合計については、二重入力または適格なレビューが必要な場合があります。異なる言語、モデル、またはスキャン分布から「99% 正確である」と推測しないでください。

多くの場合、イメージの準備はモデルの切り替えよりも優先されます

正しい向きに回転し、無関係な境界線をトリミングし、十分な解像度を使用し、携帯電話の写真を正しい遠近法で撮影します。手を加えていないソースを保存します。細い文字、小数点、発音記号を消去するような積極的なしきい値処理は避けてください。コピーのグレースケール、コントラスト、二値化をテストします。

問題前処理実験リスク
斜めスキャンページの端を維持しながら傾きを補正する補間により小さなテキストがぼやける
パース写真四隅補正コーナーが間違っていると柱が歪む
低コントラストコピー上の局所的なコントラスト紙のテクスチャが偽のストロークになる
透かし/ヘッダー無視領域またはポストフィルタールールを使用するルールにより、正当な繰り返しテキストが削除される場合があります
小さな文字より高い光学解像度で再スキャンしますアップスケーリングでは欠落したディテールを復元できません
手書き手書き専門の代替手段を使用する印刷されたテキストの OCR が確信を持ってナンセンスを出力する可能性がある

多言語認識

ドキュメントに適した言語ライブラリをインストールまたは選択します。広範な多言語モデルは混合スクリプトを認識する可能性がありますが、視覚的に類似した文字を混同する可能性があります。言語モデルが狭いと、言語がわかっている場合の精度が向上します。ラテン語/キリル文字の混同可能な文字、中国語/日本語の異体字、句読点、アクセント、右から左への順序をテストします。

OCRは翻訳ではありません。認識されたソース テキストを保持し、独自の用語集を使用して別の手順で翻訳し、レビューします。翻訳でクラウド モデルを使用する場合、OCR がオフラインであっても、ワークフローは完全にローカルではなくなります。

複雑なレイアウトとギャップツリーソーター

Umi-OCR v2.1 では、複数列ドキュメントのギャップ ツリー ソート アルゴリズムとして説明される書き換えられたレイアウト解析が導入されました。サイドバー、新聞、フォーム、脚注、キャプションを備えたテスト日記。視覚的に正しく認識されても、列がインターリーブされたり、間違った画像にキャプションが付加されたりする可能性があります。

  • プレーンテキストの順序を人間の読み取りパスと比較します。
  • 本文テキストを削除せずに、ヘッダーとフッターが一貫して除外されているかどうかを確認します。
  • 下流での引用にトレーサビリティが必要な場合は、ページの境界と座標を保持します。
  • セル構造を保持する必要がある場合は、特殊なテーブル/ドキュメント パーサーを使用します。

検索可能な2層PDF

2 層 PDF では、ページ画像が保持され、検索、コピー、インデックス作成のために非表示のテキスト レイヤーがオーバーレイされます。 Umi-OCR リリース ノートには、元の PDF からの生成がサポートされていると記載されています。他のインポートされたドキュメント形式ではテキストが生成される場合がありますが、必ずしも再構築された PDF であるとは限りません。正確なバージョンの動作を確認します。

QAチェックどのように失敗の結果
視覚的な忠実度レンダリングされたページのピクセル比較アーカイブページの変更
テキストの配置ページ全体の行を選択/コピーする近くにある間違ったテキストがコピーされました
読む順番ページ全体を抽出して比較するスクリーン リーダー/検索スニペットが支離滅裂になる
ページ数/回転数自動化された視覚的チェックページの欠落または反転
ファイルサイズオリジナル/出力と圧縮を比較する管理できないアーカイブまたは劣化したイメージ
PDF の安全性添付ファイル/スクリプトをスキャンし、独立したビューアを使用する悪意のある入力は依然として危険です

QRコードとバーコードは信頼できないデータです

まずデコードして、リテラルのペイロードを表示します。 URL を開いたり、Wi-Fi に接続したり、電子メールを送信したり、アプリのアクションを自動的に実行したりしないでください。類似ドメインを正規化し、危険なスキームをブロックし、リンクを個別にスキャンします。在庫や支払いについては、チェックデジットを確認し、信頼できる記録と比較します。

数式認識にはセマンティックチェックが必要

オプションのプラグインを使用すると、数式画像を LaTeX のようなテキストに変換できます。上付き文字、下付き文字、マイナス記号、乗算記号、行列、括弧、ギリシャ文字、方程式の配置を確認します。出力をコンパイルして視覚的に比較し、ドメインの専門家に意味を検証してもらいます。見た目が似ているキャラクターでも結果が逆転する可能性があります。

自動化とHTTPインターフェースのセキュリティ

Umi-OCR のローカル HTTP 機能は、スクリーンショットまたはバッチ認識を別のアプリケーションに接続できます。デフォルトでループバックにバインドし、公開された場合は認証し、ファイル パスとリクエスト サイズを制限し、明示的に必要でない限りリモート URL を拒否します。寛容な OCR サービスをインターネットに直接公開しないでください。

一意の ID でジョブをキューに入れ、ソース ハッシュを保存し、エンジン/プラグインのバージョンをキャプチャし、可能な場合は座標/信頼性を返します。タイムアウトを定義し、破損した画像/PDF を隔離します。画像および PDF デコーダには独自の攻撃対象領域があるため、信頼できないドキュメントには別のアカウント/コンテナを使用してください。

代替案

オプションベストフィットトレードオフと Umi-OCR
Umi-OCRプライベートデスクトップのスクリーンショット、バッチ、PDF OCR限定的な共同作業/クラウド ドキュメント インテリジェンス
PaddleOCR を直接カスタムでトレーニング/デプロイされた OCR パイプラインエンジニアリングの強化、現行モデルへのアクセスの拡大
テッセラクト成熟した CLI/ライブラリと確定的自動化レイアウト/言語の品質が異なる
OCRmyPDFコマンドラインで検索可能な PDF パイプラインデスクトップ キャプチャ/UI 機能が少ない
クラウドドキュメントAIフォーム、テーブル、スケールおよびマネージド APIsアップロード、定期的なコスト、プロバイダーのガバナンス
マルチモーダル LLM数ページにわたる意味論的な質問幻覚を起こす可能性があり、正確な抽出証拠には弱い
人的データの入力一か八かのフィールドとあいまいなスキャンコストはかかるが責任ある検証

よくある質問

Umi-OCR は無料ですか?

はい。公式リポジトリは MIT ライセンスを取得しています。配布、ハードウェア、組織のサポートには依然としてコストがかかる可能性があります。

完全にオフラインですか?

認識はローカルなものになる可能性があります。アップデート、プラグイン、同期フォルダー、HTTP 統合、ダウンストリーム翻訳を個別に確認します。

macOSでも動作しますか?

公式プロジェクトは主に Windows と Linux のビルドを配布します。 macOS ユーザーは、ネイティブ OCR、VM、またはその他のサポートされているツールを比較する必要があります。

どのビルドを選択すればよいですか?

Paddle は互換性のある最新のハードウェアで最初にベンチマークされ、Rapid は低リソースまたは互換性のない Windows CPU でベンチマークされます。修正時間を最終的な尺度として使用します。

スキャンした PDF を検索可能にすることはできますか?

はい、ソース PDF からの 2 層 PDF ワークフローを使用します。アーカイブする前に、隠しテキストの配置と読み取り順序を検査します。

OCR 結果は自動的に信頼できますか?

結果データの場合はいいえ。名前、数値、日付、否定、表のセル、および意思決定を左右するすべてのフィールドを検証します。

手書きは認識されるのでしょうか?

パフォーマンスはエンジン/プラグインおよびスクリプトによって異なります。代表的なテストを使用し、必要に応じて手書きに特化したシステムを優先します。

一次情報源

最終レビュー日は 2026 年 7 月 25 日です。Umi-OCR エンジン、プラグイン、プラットフォーム パッケージは独立して進化します。ドキュメント上の正確なリリース資産、チェックサム、言語モデル、およびオフライン動作を確認します。

Ready to try Umi-OCR?

Visit the official website to get started

Visit Umi-OCR

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/4/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool