Umi-OCR は、Windows および Linux 上でローカルにテキストを認識するための無料のオープンソース デスクトップ アプリケーションです。スクリーンショットのキャプチャ、バッチ画像、ドキュメント/PDF 処理、検索可能な 2 層 PDF、QR/バーコード、数式認識などのオプションのエンジン プラグインをサポートしています。公式リポジトリは MIT ライセンスを使用し、チェックサム付きのポータブル ビルドを配布します。
その最大の利点は運用上のプライバシーです。構成されたローカル エンジンは、ホストされた OCR サービスにピクセルを送信せずにドキュメントを処理できます。だからといって、周囲のすべてのアクションがオフラインになるわけではありません。ダウンロード、更新チェック、サードパーティのプラグイン、ユーザー構成の HTTP インターフェイス、同期フォルダー、またはダウンストリーム変換により、ネットワークまたはデータ共有パスを作成できます。機密性が重要な場合は、ネットワーク モニターを使用して正確な設定を確認してください。

各機能はどのワークフローを解決しますか?
| モード | 最適な使用方法 | 成果物/証拠 | 主な制限事項 |
|---|---|---|---|
| スクリーンショット OCR | アプリまたは画像からテキストをコピーする | すぐに認識されるテキスト | 小さな UI テキストとスケーリングアーティファクト |
| バッチ画像OCR | スキャン、レシート、ページフォルダー | 繰り返し可能な設定を備えたファイルごとのテキスト | 複雑なレイアウト全体での読み取り順序 |
| ドキュメント/PDF | スキャンされたアーカイブと書籍 | テキストのエクスポートまたは検索可能な 2 層 PDF | 表、脚注、隠しテキストの配置 |
| QR/バーコード | 機械可読シンボルをデコードする | レビューのために表示されたペイロード | ペイロードは悪意のある URL である可能性があります |
| 数式プラグイン | 孤立した数学領域を変換する | LaTeX 風の表現 | シンボルと構造は視覚的に確認する必要があります |
| HTTPインターフェース | ローカル自動化/統合 | 機械可読な OCR 結果 | localhost を超えてバインドされている場合、ドキュメントが公開される可能性があります |
OCR パイプラインとその独立したエラー
ソースページ/画面
|
トリミング + 回転 + 傾き補正
|
v
テキスト検出ボックス
|
v
線認識
|
v
レイアウトの並べ替え / 領域の無視
|
.-----+---------------。
v v
プレーンテキスト検索可能な PDF
| |
人間によるチェック: 名前、数字、否定、読み取り順序
認識が正確であっても、領域を検出できない可能性があります。正しいボックス内の文字を誤って認識する可能性があります。レイアウトを並べ替えると、正しい行が間違った順序で配置される場合があります。検索可能な PDF は、視覚的には同一に見えますが、非表示のテキスト レイヤーにはエラーが含まれていることがあります。読みやすいページの外観を OCR の正しさとして扱うのではなく、各レイヤーを個別に検査します。
パドルビルドとラピッドビルド
公式リリースノートでは、Paddle パッケージは高速かつ高リソースで強力なマシンに適していると説明されていますが、Rapid ビルドはメモリ使用量が少なく、幅広い CPU 互換性がありますが、速度が遅くなる可能性があります。古いリリース テキストでは、一部の Pentium、Celeron、Atom CPU で Paddle が失敗する可能性があると特に警告していました。現在の v2.1.5 アーティファクトには、Windows Rapid パッケージと Linux Paddle パッケージがリストされています。利用可能なアセットはリリースによって異なる場合があるため、ライブ ページを確認してください。
| 選択 | ここから始めてください | ベンチマーク | フォールバック信号 |
|---|---|---|---|
| パドルビルド | 最新の互換性のある CPU と大量のドキュメント | ページ/分、ピーク RAM および精度 | 初期化エラー、非互換性、またはメモリ不足 |
| 迅速なビルド | 古い/低リソースの Windows デバイス | 同じテストセットとエンドツーエンドの修正時間 | ボリュームに対してスループットが遅すぎる |
| Linuxパッケージ | サポートされている x64 デスクトップ環境 | ライブラリ、フォント、クリップボード、およびキャプチャの動作 | ディストリビューション固有の依存関係のエラー |
| ドッカー/ランタイム | 制御されたサーバーまたは反復可能な展開 | API エクスポージャ、ボリューム、CPU、コールド スタート | デスクトップ機能またはハードウェア統合が必要 |
パッケージサイズだけで選ばないでください。代表的な 50 ページを実行し、文字エラー、欠落領域、処理時間、メモリ、および手動修正を測定します。より正確なエンジンは、レビューを省略できる場合、速度は遅くなりますが、より安価になります。クリーンで反復的なページでは、より高速なエンジンが最適です。
安全にダウンロードしてインストールします
公式 GitHub リリース ページ、またはそこに指定されているミラーを使用します。ダウンロードした SHA-256 を、正確なアセットに対して公開された値と比較します。 v2.1.5 リリースでは、Windows Rapid および Linux Paddle アーカイブのリストされた SHA-256 値がレビューされました。自己解凍型 .7z.exe アーカイブとして開くことができます。実行前に組織のポリシーに基づいて検査し、スキャンします。
ポータブル ソフトウェアは引き続き設定とログを書き込みます。 v2.1.5 にログを追加しました UmiOCR-データ/ログ、設定可能な保存された重大度を備えています。シークレットを処理する前にログを確認します。ファイル パス、エラー、または認識されたスニペットがデータとして保持される可能性があります。 UmiOCR-data ディレクトリ全体、バックアップ、エクスポートされた結果を保護します。
ドキュメント固有の OCR ベンチマークを構築する
手動で検証されたページからグランド トゥルースを作成します。きれいなスクリーンショットではなく、実際に予想される最も厳しい条件をサンプリングします。複数のスクリプト、小さなフォント、傾き、携帯電話の写真、低コントラスト、スタンプ、手書き、縦書きテキスト、混合列、表、ヘッダー/フッター付きのページが含まれます。
| メトリック | 何が引っかかるのか | なぜそれだけでは不十分なのか |
|---|---|---|
| 文字エラー率 | 挿入、削除、置換 | 桁の 1 桁の間違いが、句読点の間違いよりも重要になる可能性があります |
| 単語エラー率 | 単語レベルのユーザビリティ | 単純な単語境界のないスクリプトには不向き |
| 地域のリコール | 完全に抜け落ちたテキストブロック | 認識されたコンテンツにスコアを付けません |
| 読み取り順序の精度 | 列と脚注の順序付け | 構造的なグラウンドトゥルースが必要 |
| クリティカルフィールドの精度 | 名前、合計、日付、ID、および否定 | ドメイン固有だが意思決定には不可欠 |
| 修正分/ページ | 真のワークフローコスト | レビュー担当者のスキルとインターフェースに依存します |
ユースケースごとに受け入れを設定します。検索インデックス作成では、多少のエラーは許容される場合があります。契約条項、医療価値、または請求額の合計については、二重入力または適格なレビューが必要な場合があります。異なる言語、モデル、またはスキャン分布から「99% 正確である」と推測しないでください。
多くの場合、イメージの準備はモデルの切り替えよりも優先されます
正しい向きに回転し、無関係な境界線をトリミングし、十分な解像度を使用し、携帯電話の写真を正しい遠近法で撮影します。手を加えていないソースを保存します。細い文字、小数点、発音記号を消去するような積極的なしきい値処理は避けてください。コピーのグレースケール、コントラスト、二値化をテストします。
| 問題 | 前処理実験 | リスク |
|---|---|---|
| 斜めスキャン | ページの端を維持しながら傾きを補正する | 補間により小さなテキストがぼやける |
| パース写真 | 四隅補正 | コーナーが間違っていると柱が歪む |
| 低コントラスト | コピー上の局所的なコントラスト | 紙のテクスチャが偽のストロークになる |
| 透かし/ヘッダー | 無視領域またはポストフィルタールールを使用する | ルールにより、正当な繰り返しテキストが削除される場合があります |
| 小さな文字 | より高い光学解像度で再スキャンします | アップスケーリングでは欠落したディテールを復元できません |
| 手書き | 手書き専門の代替手段を使用する | 印刷されたテキストの OCR が確信を持ってナンセンスを出力する可能性がある |
多言語認識
ドキュメントに適した言語ライブラリをインストールまたは選択します。広範な多言語モデルは混合スクリプトを認識する可能性がありますが、視覚的に類似した文字を混同する可能性があります。言語モデルが狭いと、言語がわかっている場合の精度が向上します。ラテン語/キリル文字の混同可能な文字、中国語/日本語の異体字、句読点、アクセント、右から左への順序をテストします。
OCRは翻訳ではありません。認識されたソース テキストを保持し、独自の用語集を使用して別の手順で翻訳し、レビューします。翻訳でクラウド モデルを使用する場合、OCR がオフラインであっても、ワークフローは完全にローカルではなくなります。
複雑なレイアウトとギャップツリーソーター
Umi-OCR v2.1 では、複数列ドキュメントのギャップ ツリー ソート アルゴリズムとして説明される書き換えられたレイアウト解析が導入されました。サイドバー、新聞、フォーム、脚注、キャプションを備えたテスト日記。視覚的に正しく認識されても、列がインターリーブされたり、間違った画像にキャプションが付加されたりする可能性があります。
- プレーンテキストの順序を人間の読み取りパスと比較します。
- 本文テキストを削除せずに、ヘッダーとフッターが一貫して除外されているかどうかを確認します。
- 下流での引用にトレーサビリティが必要な場合は、ページの境界と座標を保持します。
- セル構造を保持する必要がある場合は、特殊なテーブル/ドキュメント パーサーを使用します。
検索可能な2層PDF
2 層 PDF では、ページ画像が保持され、検索、コピー、インデックス作成のために非表示のテキスト レイヤーがオーバーレイされます。 Umi-OCR リリース ノートには、元の PDF からの生成がサポートされていると記載されています。他のインポートされたドキュメント形式ではテキストが生成される場合がありますが、必ずしも再構築された PDF であるとは限りません。正確なバージョンの動作を確認します。
| QAチェック | どのように | 失敗の結果 |
|---|---|---|
| 視覚的な忠実度 | レンダリングされたページのピクセル比較 | アーカイブページの変更 |
| テキストの配置 | ページ全体の行を選択/コピーする | 近くにある間違ったテキストがコピーされました |
| 読む順番 | ページ全体を抽出して比較する | スクリーン リーダー/検索スニペットが支離滅裂になる |
| ページ数/回転数 | 自動化された視覚的チェック | ページの欠落または反転 |
| ファイルサイズ | オリジナル/出力と圧縮を比較する | 管理できないアーカイブまたは劣化したイメージ |
| PDF の安全性 | 添付ファイル/スクリプトをスキャンし、独立したビューアを使用する | 悪意のある入力は依然として危険です |
QRコードとバーコードは信頼できないデータです
まずデコードして、リテラルのペイロードを表示します。 URL を開いたり、Wi-Fi に接続したり、電子メールを送信したり、アプリのアクションを自動的に実行したりしないでください。類似ドメインを正規化し、危険なスキームをブロックし、リンクを個別にスキャンします。在庫や支払いについては、チェックデジットを確認し、信頼できる記録と比較します。
数式認識にはセマンティックチェックが必要
オプションのプラグインを使用すると、数式画像を LaTeX のようなテキストに変換できます。上付き文字、下付き文字、マイナス記号、乗算記号、行列、括弧、ギリシャ文字、方程式の配置を確認します。出力をコンパイルして視覚的に比較し、ドメインの専門家に意味を検証してもらいます。見た目が似ているキャラクターでも結果が逆転する可能性があります。
自動化とHTTPインターフェースのセキュリティ
Umi-OCR のローカル HTTP 機能は、スクリーンショットまたはバッチ認識を別のアプリケーションに接続できます。デフォルトでループバックにバインドし、公開された場合は認証し、ファイル パスとリクエスト サイズを制限し、明示的に必要でない限りリモート URL を拒否します。寛容な OCR サービスをインターネットに直接公開しないでください。
一意の ID でジョブをキューに入れ、ソース ハッシュを保存し、エンジン/プラグインのバージョンをキャプチャし、可能な場合は座標/信頼性を返します。タイムアウトを定義し、破損した画像/PDF を隔離します。画像および PDF デコーダには独自の攻撃対象領域があるため、信頼できないドキュメントには別のアカウント/コンテナを使用してください。
代替案
| オプション | ベストフィット | トレードオフと Umi-OCR |
|---|---|---|
| Umi-OCR | プライベートデスクトップのスクリーンショット、バッチ、PDF OCR | 限定的な共同作業/クラウド ドキュメント インテリジェンス |
| PaddleOCR を直接 | カスタムでトレーニング/デプロイされた OCR パイプライン | エンジニアリングの強化、現行モデルへのアクセスの拡大 |
| テッセラクト | 成熟した CLI/ライブラリと確定的自動化 | レイアウト/言語の品質が異なる |
| OCRmyPDF | コマンドラインで検索可能な PDF パイプライン | デスクトップ キャプチャ/UI 機能が少ない |
| クラウドドキュメントAI | フォーム、テーブル、スケールおよびマネージド APIs | アップロード、定期的なコスト、プロバイダーのガバナンス |
| マルチモーダル LLM | 数ページにわたる意味論的な質問 | 幻覚を起こす可能性があり、正確な抽出証拠には弱い |
| 人的データの入力 | 一か八かのフィールドとあいまいなスキャン | コストはかかるが責任ある検証 |
よくある質問
Umi-OCR は無料ですか?
はい。公式リポジトリは MIT ライセンスを取得しています。配布、ハードウェア、組織のサポートには依然としてコストがかかる可能性があります。
完全にオフラインですか?
認識はローカルなものになる可能性があります。アップデート、プラグイン、同期フォルダー、HTTP 統合、ダウンストリーム翻訳を個別に確認します。
macOSでも動作しますか?
公式プロジェクトは主に Windows と Linux のビルドを配布します。 macOS ユーザーは、ネイティブ OCR、VM、またはその他のサポートされているツールを比較する必要があります。
どのビルドを選択すればよいですか?
Paddle は互換性のある最新のハードウェアで最初にベンチマークされ、Rapid は低リソースまたは互換性のない Windows CPU でベンチマークされます。修正時間を最終的な尺度として使用します。
スキャンした PDF を検索可能にすることはできますか?
はい、ソース PDF からの 2 層 PDF ワークフローを使用します。アーカイブする前に、隠しテキストの配置と読み取り順序を検査します。
OCR 結果は自動的に信頼できますか?
結果データの場合はいいえ。名前、数値、日付、否定、表のセル、および意思決定を左右するすべてのフィールドを検証します。
手書きは認識されるのでしょうか?
パフォーマンスはエンジン/プラグインおよびスクリプトによって異なります。代表的なテストを使用し、必要に応じて手書きに特化したシステムを優先します。
一次情報源
- 公式 Umi-OCR リポジトリ
- 公式英語版 README
- 公式リリース、パッケージ、チェックサム
- 公式 Linux ランタイムと Docker ガイダンス
- 公式プラグインカタログ
- プロジェクトライセンス
- PaddleOCR 公式ドキュメント
- PaddleOCR 3.0 テクニカル レポート
- 米国議会図書館の PDF 形式保存情報
最終レビュー日は 2026 年 7 月 25 日です。Umi-OCR エンジン、プラグイン、プラットフォーム パッケージは独立して進化します。ドキュメント上の正確なリリース資産、チェックサム、言語モデル、およびオフライン動作を確認します。