Umi-OCR ist eine kostenlose Open-Source-Desktopanwendung zur lokalen Texterkennung unter Windows und Linux. Es unterstützt Screenshot-Erfassung, Stapelbilder, Dokument-/PDF-Verarbeitung, durchsuchbare Doppelschicht-PDFs, QR/Barcodes und optionale Engine-Plugins wie Formelerkennung. Das offizielle Repository nutzt die MIT-Lizenz und verteilt portable Builds mit Prüfsummen.
Sein größter Vorteil ist der betriebliche Datenschutz: Eine konfigurierte lokale Engine kann Dokumente verarbeiten, ohne ihre Pixel an einen gehosteten OCR-Dienst zu senden. Das bedeutet nicht, dass alle umliegenden Aktionen offline sind. Durch Downloads, Update-Prüfungen, Plugins von Drittanbietern, vom Benutzer konfigurierte HTTP-Schnittstellen, synchronisierte Ordner oder nachgelagerte Übersetzungen können Netzwerk- oder Datenfreigabepfade entstehen. Überprüfen Sie die genaue Einrichtung mit einem Netzwerkmonitor, wenn es auf Vertraulichkeit ankommt.

Welchen Workflow löst jedes Feature?
| Modus | Beste Verwendung | Ausgabe/Beweis | Haupteinschränkung |
|---|---|---|---|
| Screenshot-OCR | Text aus einer App oder einem Bild kopieren | Sofort erkannter Text | Kleine UI-Text- und Skalierungsartefakte |
| Stapelbild-OCR | Scans, Quittungen und Seitenordner | Text pro Datei mit wiederholbaren Einstellungen | Lesereihenfolge in komplexen Layouts |
| Dokument/PDF | Gescannte Archive und Bücher | Textexport oder durchsuchbares doppelschichtiges PDF | Tabellen, Fußnoten und Ausrichtung versteckter Texte |
| QR/Barcode | Dekodieren Sie maschinenlesbare Symbole | Nutzlast zur Überprüfung angezeigt | Payload kann eine bösartige URL sein |
| Formel-Plugin | Konvertieren Sie isolierte mathematische Regionen | LaTeX-ähnliche Darstellung | Symbole und Struktur bedürfen einer visuellen Überprüfung |
| HTTP-Schnittstelle | Lokale Automatisierung/Integration | Maschinenlesbares OCR-Ergebnis | Kann Dokumente offenlegen, wenn sie über localhost hinaus gebunden sind |
Die OCR-Pipeline und ihre unabhängigen Fehler
Quellseite/Bildschirm
|
Zuschneiden + Drehen + Geradeausrichten
|
v
Texterkennungsfelder
|
v
Linienerkennung
|
v
Layoutsortierung / Regionen ignorieren
|
.-----+-----------.
v v
durchsuchbares PDF im Klartext
| |
menschliche Prüfung: Namen, Zahlen, Negation, Lesereihenfolge
Bei der Erkennung kann eine Region übersehen werden, selbst wenn die Erkennung genau ist. Die Erkennung kann ein Zeichen in einem korrekten Feld falsch lesen. Durch die Layoutsortierung können die richtigen Zeilen in der falschen Reihenfolge angeordnet werden. Eine durchsuchbare PDF-Datei kann optisch identisch aussehen, während ihre unsichtbare Textebene Fehler enthält. Überprüfen Sie jede Ebene einzeln, anstatt das lesbare Erscheinungsbild der Seite als OCR-Korrektheit zu betrachten.
Paddle- versus Rapid-Builds
Offizielle Versionshinweise beschreiben das Paddle-Paket als schneller/ressourcenreicher und für stärkere Maschinen geeignet, während der Rapid-Build weniger Speicher verbraucht und eine breitere CPU-Kompatibilität bietet, aber möglicherweise langsamer ist. In älteren Veröffentlichungstexten wurde ausdrücklich gewarnt, dass Paddle auf einigen Pentium-, Celeron- und Atom-CPUs ausfallen könnte. In den aktuellen Artefakten der Version 2.1.5 sind ein Windows Rapid-Paket und ein Linux Paddle-Paket aufgeführt. Die verfügbaren Assets können je nach Release variieren. Schauen Sie daher auf der Live-Seite nach.
| Wahl | Beginnen Sie hier, wann | Benchmark | Rückfallsignal |
|---|---|---|---|
| Paddelbau | Moderne kompatible CPU und höheres Dokumentenvolumen | Seiten/Minute, Spitzen-RAM und Genauigkeit | Initialisierungsfehler, Inkompatibilität oder Speicherdruck |
| Schneller Aufbau | Älteres/ressourcenärmeres Windows-Gerät | Gleicher Testsatz und gleiche End-to-End-Korrekturzeit | Der Durchsatz ist für das Volumen zu langsam |
| Linux-Paket | Unterstützte x64-Desktop-Umgebung | Bibliothek, Schriftart, Zwischenablage und Erfassungsverhalten | Verteilungsspezifische Abhängigkeitsfehler |
| Docker/Laufzeit | Kontrollierter Server oder wiederholbare Bereitstellung | API Belichtung, Volumes, CPU und Kaltstart | Desktop-Funktionen oder Hardware-Integration erforderlich |
Wählen Sie nicht ausschließlich nach der Packungsgröße. Führen Sie 50 repräsentative Seiten aus und messen Sie Zeichenfehler, fehlende Bereiche, Verarbeitungszeit, Speicher und manuelle Korrektur. Die genauere Engine kann langsamer und dennoch kostengünstiger sein, wenn sie die Bewertung spart; Die schnellere Engine kann für saubere, sich wiederholende Seiten gewinnen.
Sicher herunterladen und installieren
Verwenden Sie die offizielle GitHub-Release-Seite oder die dort genannten Mirrors. Vergleichen Sie den heruntergeladenen SHA-256 mit dem veröffentlichten Wert für den genauen Vermögenswert. In der Version 2.1.5 wurden die Werte SHA-256 für Windows Rapid- und Linux Paddle-Archive überprüft. Ein selbstextrahierender .7z.exe kann als Archiv geöffnet werden; Überprüfen Sie es und scannen Sie es vor der Ausführung gemäß den Organisationsrichtlinien.
Portable Software schreibt weiterhin Einstellungen und Protokolle. v2.1.5 hinzugefügte Protokolle unter UmiOCR-Daten/Protokolle, mit konfigurierbarem gespeichertem Schweregrad. Überprüfen Sie Protokolle, bevor Sie Geheimnisse verarbeiten: Dateipfade, Fehler oder erkannte Snippets können zu gespeicherten Daten werden. Schützen Sie das gesamte UmiOCR-Datenverzeichnis, Backups und exportierte Ergebnisse.
Erstellen Sie einen dokumentspezifischen OCR-Benchmark
Erstellen Sie Ground Truth aus manuell überprüften Seiten. Probieren Sie die tatsächlich erwarteten härtesten Bedingungen aus, kein sauberer Screenshot. Fügen Sie mehrere Skripte, kleine Schriftarten, Schräglage, Telefonfotos, geringen Kontrast, Stempel, Handschrift, vertikalen Text, gemischte Spalten, Tabellen und Seiten mit Kopf-/Fußzeilen ein.
| Metrisch | Was es fängt | Warum es allein nicht ausreicht |
|---|---|---|
| Zeichenfehlerrate | Einfügungen, Löschungen und Ersetzungen | Eine falsche Ziffer kann mehr ausmachen als viele Satzzeichenfehler |
| Wortfehlerrate | Benutzerfreundlichkeit auf Wortebene | Schlecht für Skripte ohne einfache Wortgrenzen |
| Regionsrückruf | Völlig fehlende Textblöcke | Bewertet erkannte Inhalte nicht |
| Genauigkeit der Lesereihenfolge | Spalten- und Fußnotenreihenfolge | Benötigt strukturelle Grundwahrheit |
| Genauigkeit im kritischen Feld | Namen, Summen, Daten, IDs und Negation | Domänenspezifisch, aber entscheidungsrelevant |
| Korrekturminuten/Seite | Echte Workflow-Kosten | Hängt von den Fähigkeiten und der Benutzeroberfläche des Prüfers ab |
Legen Sie die Akzeptanz nach Anwendungsfall fest. Bei der Suchindizierung können geringfügige Fehler toleriert werden. Eine Vertragsklausel, ein medizinischer Wert oder ein Rechnungsbetrag erfordern möglicherweise eine doppelte Eingabe oder eine qualifizierte Prüfung. Schließen Sie niemals „99 % genau“ aus einer anderen Sprache, einem anderen Modell oder einer anderen Scanverteilung ab.
Die Bildvorbereitung ist oft besser als der Modellwechsel
Drehen Sie es in die richtige Ausrichtung, beschneiden Sie irrelevante Ränder, verwenden Sie bei Telefonfotos eine ausreichende Auflösung und die richtige Perspektive. Bewahren Sie eine unberührte Quelle. Vermeiden Sie aggressive Schwellenwerte, die dünne Zeichen, Dezimalpunkte oder diakritische Zeichen löschen. Testen Sie Graustufen, Kontrast und Binärisierung auf Kopien.
| Problem | Vorverarbeitungsexperiment | Risiko |
|---|---|---|
| Verzerrter Scan | Geradeausrichten unter Beibehaltung der Seitenkanten | Durch die Interpolation wird kleiner Text unscharf |
| Perspektivisches Foto | Vier-Ecken-Korrektur | Falsche Ecken verzerren die Spalten |
| Geringer Kontrast | Lokaler Kontrast auf einer Kopie | Die Papierstruktur wird zu falschen Strichen |
| Wasserzeichen/Kopfzeile | Verwenden Sie Ignorierungsbereiche oder Nachfilterregeln | Die Regel kann zulässigen wiederholten Text löschen |
| Winzige Charaktere | Erneut scannen mit höherer optischer Auflösung | Durch die Hochskalierung können fehlende Details nicht wiederhergestellt werden |
| Handschrift | Verwenden Sie eine auf Handschrift spezialisierte Alternative | OCR für gedruckten Text kann selbstbewussten Unsinn ausgeben |
Mehrsprachige Erkennung
Installieren Sie die richtige Sprachbibliothek für das Dokument oder wählen Sie sie aus. Ein breites mehrsprachiges Modell erkennt möglicherweise gemischte Schriften, verwechselt jedoch visuell ähnliche Zeichen. Ein engeres Sprachmodell kann die Genauigkeit verbessern, wenn die Sprache bekannt ist. Testen Sie lateinische/kyrillische Verwechslungszeichen, chinesische/japanische Varianten, Zeichensetzung, Akzente und die Reihenfolge von rechts nach links.
OCR ist keine Übersetzung. Behalten Sie den erkannten Quelltext bei und übersetzen Sie ihn dann in einem separaten Schritt mit eigenem Glossar und überprüfen Sie ihn. Wenn die Übersetzung ein Cloud-Modell verwendet, ist der Workflow nicht mehr vollständig lokal, obwohl OCR offline war.
Komplexe Layouts und der Gap-Tree-Sorter
Umi-OCR v2.1 führte eine neu geschriebene Layout-Analyse ein, die als Gap-Tree-Sortieralgorithmus für mehrspaltige Dokumente beschrieben wird. Testzeitschriften mit Seitenleisten, Zeitungen, Formularen, Fußnoten und Bildunterschriften. Bei einer visuell korrekten Erkennung können immer noch Spalten verschachtelt oder dem falschen Bild eine Beschriftung hinzugefügt werden.
- Vergleichen Sie die Klartextreihenfolge mit einem menschlichen Lesepfad.
- Überprüfen Sie, ob Kopf- und Fußzeilen konsequent ausgeschlossen werden, ohne den Textkörper zu entfernen.
- Behalten Sie Seitengrenzen und Koordinaten bei, wenn nachgelagerte Zitate eine Rückverfolgbarkeit erfordern.
- Verwenden Sie spezielle Tabellen-/Dokumentparser, wenn die Zellstruktur erhalten bleiben muss.
Durchsuchbare doppelschichtige PDFs
Ein doppelschichtiges PDF behält Seitenbilder bei und überlagert eine unsichtbare Textebene zum Suchen, Kopieren und Indexieren. In den Versionshinweisen Umi-OCR heißt es, dass die Generierung aus Original-PDFs unterstützt wird. Andere importierte Dokumentformate erzeugen möglicherweise Text, aber nicht unbedingt ein neu erstelltes PDF. Bestätigen Sie das genaue Versionsverhalten.
| QS-Prüfung | Wie | Konsequenz des Scheiterns |
|---|---|---|
| Visuelle Treue | Pixelvergleich gerenderter Seiten | Änderungen der Archivseite |
| Textausrichtung | Zeilen über die Seite auswählen/kopieren | Falscher Text in der Nähe kopiert |
| Lesereihenfolge | Ganze Seite extrahieren und vergleichen | Screenreader/Suchausschnitte werden inkohärent |
| Seitenzahl/Rotation | Automatisierte und visuelle Kontrollen | Fehlende oder invertierte Seiten |
| Dateigröße | Vergleichen Sie Original/Ausgabe und Komprimierung | Nicht verwaltbares Archiv oder beschädigtes Image |
| PDF-Sicherheit | Scannen Sie Anhänge/Skripte und verwenden Sie den isolierten Viewer | Böswillige Eingaben bleiben gefährlich |
QR-Codes und Barcodes sind nicht vertrauenswürdige Daten
Zuerst dekodieren und die wörtliche Nutzlast anzeigen; Öffnen Sie nicht automatisch eine URL, verbinden Sie sich nicht mit WLAN, senden Sie keine E-Mails oder führen Sie eine App-Aktion aus. Normalisieren Sie Lookalike-Domains, blockieren Sie gefährliche Schemata und scannen Sie Links unabhängig voneinander. Überprüfen Sie bei Inventar oder Zahlungen die Prüfziffern und vergleichen Sie sie mit einem vertrauenswürdigen Datensatz.
Die Formelerkennung erfordert eine semantische Überprüfung
Optionale Plugins können Formelbilder in LaTeX-ähnlichen Text konvertieren. Überprüfen Sie hochgestellte, tiefgestellte Zeichen, Minuszeichen, Multiplikationssymbole, Matrizen, Klammern, griechische Buchstaben und die Ausrichtung von Gleichungen. Kompilieren Sie die Ausgabe und vergleichen Sie sie visuell. Lassen Sie dann einen Fachexperten die Bedeutung überprüfen. Ein optisch ähnliches Zeichen kann ein Ergebnis umkehren.
Automatisierung und HTTP-Schnittstellensicherheit
Die lokale HTTP-Funktion von Umi-OCR kann eine Screenshot- oder Stapelerkennung mit einer anderen Anwendung verbinden. Standardmäßig an Loopback binden, bei Offenlegung authentifizieren, Dateipfade und Anforderungsgröße einschränken und Remote-URLs ablehnen, sofern dies nicht ausdrücklich erforderlich ist. Setzen Sie einen freizügigen OCR-Dienst niemals direkt dem Internet aus.
Stellen Sie Jobs mit eindeutigen IDs in die Warteschlange, speichern Sie Quell-Hashes, erfassen Sie die Engine-/Plugin-Version und geben Sie Koordinaten/Konfidenz zurück, sofern verfügbar. Definieren Sie Zeitüberschreitungen und isolieren Sie beschädigte Bilder/PDFs. Verwenden Sie ein separates Konto/einen separaten Container für nicht vertrauenswürdige Dokumente, da Bild- und PDF-Decoder ihre eigene Angriffsfläche haben.
Alternativen
| Option | Beste Passform | Kompromiss versus Umi-OCR |
|---|---|---|
| Umi-OCR | Privater Desktop-Screenshot, Batch- und PDF-OCR | Eingeschränkte kollaborative/Cloud-Dokumentenintelligenz |
| PaddleOCR direkt | Individuell geschulte/bereitgestellte OCR-Pipeline | Mehr Technik, breiterer Zugang zu aktuellen Modellen |
| Tesserakt | Ausgereifte CLI/Bibliothek und deterministische Automatisierung | Layout-/Sprachqualität variiert |
| OCRmyPDF | Über die Befehlszeile durchsuchbare PDF-Pipeline | Weniger Desktop-Capture-/UI-Funktionalität |
| Cloud-Dokument-KI | Formulare, Tabellen, Skalierung und verwaltete APIs | Upload, wiederkehrende Kosten und Anbieter-Governance |
| Multimodales LLM | Semantische Fragen auf wenigen Seiten | Kann halluzinieren und ist für den exakten Extraktionsbeweis schwächer |
| Eingabe menschlicher Daten | Hochriskante Felder und mehrdeutige Scans | Höhere Kosten, aber nachvollziehbare Überprüfung |
Häufig gestellte Fragen
Ist Umi-OCR kostenlos?
Ja. Das offizielle Repository ist MIT-lizenziert. Für Vertrieb, Hardware und organisatorische Unterstützung können dennoch Kosten entstehen.
Ist es vollständig offline?
Die Anerkennung kann lokal erfolgen. Überprüfen Sie Updates, Plugins, synchronisierte Ordner, HTTP-Integrationen und Downstream-Übersetzungen separat.
Funktioniert es unter macOS?
Das offizielle Projekt vertreibt hauptsächlich Windows- und Linux-Builds. macOS-Benutzer sollten native OCR, eine VM oder ein anderes unterstütztes Tool vergleichen.
Welchen Build soll ich wählen?
Benchmarking Paddle zuerst auf kompatibler moderner Hardware und Rapid auf ressourcenschwächeren oder inkompatiblen Windows-CPUs; Verwenden Sie die Korrekturzeit als letztes Maß.
Kann es gescannte PDFs durchsuchbar machen?
Ja, mit einem zweischichtigen PDF-Workflow aus Quell-PDFs. Überprüfen Sie vor der Archivierung die Ausrichtung und Lesereihenfolge des verborgenen Texts.
Können OCR-Ergebnissen automatisch vertraut werden?
Nein für Folgedaten. Überprüfen Sie Namen, Zahlen, Daten, Negationen, Tabellenzellen und alle entscheidungsrelevanten Felder.
Erkennt es Handschrift?
Die Leistung hängt von der Engine/Plugin und dem Skript ab; Verwenden Sie repräsentative Tests und bevorzugen Sie bei Bedarf ein auf Handschrift spezialisiertes System.
Primärquellen
- Offizielles Umi-OCR-Repository
- Offizielle englische README-Datei
- Offizielle Veröffentlichungen, Pakete und Prüfsummen
- Offizielle Linux-Runtime- und Docker-Anleitung
- Offizieller Plugin-Katalog
- Projektlizenz
- PaddleOCR offizielle Dokumentation
- PaddleOCR 3.0 technischer Bericht
- Informationen zur Aufbewahrung des PDF-Formats der Library of Congress
Zuletzt überprüft am 25. Juli 2026. Umi-OCR Engines, Plugins und Plattformpakete entwickeln sich unabhängig voneinander. Überprüfen Sie das genaue Release-Asset, die Prüfsumme, das Sprachmodell und das Offline-Verhalten Ihrer Dokumente.