Umi-OCR
Umi-OCR
Active

Umi-OCR

Umi-OCR ist eine kostenlose, vom MIT lizenzierte Offline-OCR-Desktop-App für Windows und Linux, die Screenshots, Stapelbilder, PDFs, QR/Barcodes und optionale Formel-Plugins abdeckt. Dieser Leitfaden vergleicht Paddle- und Rapid-Builds, Datenschutz, Genauigkeitstests, Layout-/PDF-Qualitätssicherung, Automatisierung und Alternativen.

115

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Umi-OCROffline OCRkostenlose OCROpen Source OCRScreenshot OCRPDF OCRlokale OCR

Product Preview

A quick visual look at Umi-OCR before you visit the official site.

Published 1/21/2026
Umi-OCR screenshot

Editorial Review

About Umi-OCR

Umi-OCR ist eine kostenlose Open-Source-Desktopanwendung zur lokalen Texterkennung unter Windows und Linux. Es unterstützt Screenshot-Erfassung, Stapelbilder, Dokument-/PDF-Verarbeitung, durchsuchbare Doppelschicht-PDFs, QR/Barcodes und optionale Engine-Plugins wie Formelerkennung. Das offizielle Repository nutzt die MIT-Lizenz und verteilt portable Builds mit Prüfsummen.

Sein größter Vorteil ist der betriebliche Datenschutz: Eine konfigurierte lokale Engine kann Dokumente verarbeiten, ohne ihre Pixel an einen gehosteten OCR-Dienst zu senden. Das bedeutet nicht, dass alle umliegenden Aktionen offline sind. Durch Downloads, Update-Prüfungen, Plugins von Drittanbietern, vom Benutzer konfigurierte HTTP-Schnittstellen, synchronisierte Ordner oder nachgelagerte Übersetzungen können Netzwerk- oder Datenfreigabepfade entstehen. Überprüfen Sie die genaue Einrichtung mit einem Netzwerkmonitor, wenn es auf Vertraulichkeit ankommt.

Official Umi-OCR logo
Umi-OCR ist eine lokale OCR-Workbench und kein Cloud-Dienst zum Verstehen von Dokumenten. Die Erkennungsausgabe muss weiterhin anhand der Quellpixel überprüft werden.

Welchen Workflow löst jedes Feature?

ModusBeste VerwendungAusgabe/BeweisHaupteinschränkung
Screenshot-OCRText aus einer App oder einem Bild kopierenSofort erkannter TextKleine UI-Text- und Skalierungsartefakte
Stapelbild-OCRScans, Quittungen und SeitenordnerText pro Datei mit wiederholbaren EinstellungenLesereihenfolge in komplexen Layouts
Dokument/PDFGescannte Archive und BücherTextexport oder durchsuchbares doppelschichtiges PDFTabellen, Fußnoten und Ausrichtung versteckter Texte
QR/BarcodeDekodieren Sie maschinenlesbare SymboleNutzlast zur Überprüfung angezeigtPayload kann eine bösartige URL sein
Formel-PluginKonvertieren Sie isolierte mathematische RegionenLaTeX-ähnliche DarstellungSymbole und Struktur bedürfen einer visuellen Überprüfung
HTTP-SchnittstelleLokale Automatisierung/IntegrationMaschinenlesbares OCR-ErgebnisKann Dokumente offenlegen, wenn sie über localhost hinaus gebunden sind

Die OCR-Pipeline und ihre unabhängigen Fehler

 Quellseite/Bildschirm
         |
   Zuschneiden + Drehen + Geradeausrichten
         |
         v
   Texterkennungsfelder
         |
         v
   Linienerkennung
         |
         v
 Layoutsortierung / Regionen ignorieren
         |
   .-----+-----------.
   v v
 durchsuchbares PDF im Klartext
   |                 |
 menschliche Prüfung: Namen, Zahlen, Negation, Lesereihenfolge

Bei der Erkennung kann eine Region übersehen werden, selbst wenn die Erkennung genau ist. Die Erkennung kann ein Zeichen in einem korrekten Feld falsch lesen. Durch die Layoutsortierung können die richtigen Zeilen in der falschen Reihenfolge angeordnet werden. Eine durchsuchbare PDF-Datei kann optisch identisch aussehen, während ihre unsichtbare Textebene Fehler enthält. Überprüfen Sie jede Ebene einzeln, anstatt das lesbare Erscheinungsbild der Seite als OCR-Korrektheit zu betrachten.

Paddle- versus Rapid-Builds

Offizielle Versionshinweise beschreiben das Paddle-Paket als schneller/ressourcenreicher und für stärkere Maschinen geeignet, während der Rapid-Build weniger Speicher verbraucht und eine breitere CPU-Kompatibilität bietet, aber möglicherweise langsamer ist. In älteren Veröffentlichungstexten wurde ausdrücklich gewarnt, dass Paddle auf einigen Pentium-, Celeron- und Atom-CPUs ausfallen könnte. In den aktuellen Artefakten der Version 2.1.5 sind ein Windows Rapid-Paket und ein Linux Paddle-Paket aufgeführt. Die verfügbaren Assets können je nach Release variieren. Schauen Sie daher auf der Live-Seite nach.

WahlBeginnen Sie hier, wannBenchmarkRückfallsignal
PaddelbauModerne kompatible CPU und höheres DokumentenvolumenSeiten/Minute, Spitzen-RAM und GenauigkeitInitialisierungsfehler, Inkompatibilität oder Speicherdruck
Schneller AufbauÄlteres/ressourcenärmeres Windows-GerätGleicher Testsatz und gleiche End-to-End-KorrekturzeitDer Durchsatz ist für das Volumen zu langsam
Linux-PaketUnterstützte x64-Desktop-UmgebungBibliothek, Schriftart, Zwischenablage und ErfassungsverhaltenVerteilungsspezifische Abhängigkeitsfehler
Docker/LaufzeitKontrollierter Server oder wiederholbare BereitstellungAPI Belichtung, Volumes, CPU und KaltstartDesktop-Funktionen oder Hardware-Integration erforderlich

Wählen Sie nicht ausschließlich nach der Packungsgröße. Führen Sie 50 repräsentative Seiten aus und messen Sie Zeichenfehler, fehlende Bereiche, Verarbeitungszeit, Speicher und manuelle Korrektur. Die genauere Engine kann langsamer und dennoch kostengünstiger sein, wenn sie die Bewertung spart; Die schnellere Engine kann für saubere, sich wiederholende Seiten gewinnen.

Sicher herunterladen und installieren

Verwenden Sie die offizielle GitHub-Release-Seite oder die dort genannten Mirrors. Vergleichen Sie den heruntergeladenen SHA-256 mit dem veröffentlichten Wert für den genauen Vermögenswert. In der Version 2.1.5 wurden die Werte SHA-256 für Windows Rapid- und Linux Paddle-Archive überprüft. Ein selbstextrahierender .7z.exe kann als Archiv geöffnet werden; Überprüfen Sie es und scannen Sie es vor der Ausführung gemäß den Organisationsrichtlinien.

Portable Software schreibt weiterhin Einstellungen und Protokolle. v2.1.5 hinzugefügte Protokolle unter UmiOCR-Daten/Protokolle, mit konfigurierbarem gespeichertem Schweregrad. Überprüfen Sie Protokolle, bevor Sie Geheimnisse verarbeiten: Dateipfade, Fehler oder erkannte Snippets können zu gespeicherten Daten werden. Schützen Sie das gesamte UmiOCR-Datenverzeichnis, Backups und exportierte Ergebnisse.

Erstellen Sie einen dokumentspezifischen OCR-Benchmark

Erstellen Sie Ground Truth aus manuell überprüften Seiten. Probieren Sie die tatsächlich erwarteten härtesten Bedingungen aus, kein sauberer Screenshot. Fügen Sie mehrere Skripte, kleine Schriftarten, Schräglage, Telefonfotos, geringen Kontrast, Stempel, Handschrift, vertikalen Text, gemischte Spalten, Tabellen und Seiten mit Kopf-/Fußzeilen ein.

MetrischWas es fängtWarum es allein nicht ausreicht
ZeichenfehlerrateEinfügungen, Löschungen und ErsetzungenEine falsche Ziffer kann mehr ausmachen als viele Satzzeichenfehler
WortfehlerrateBenutzerfreundlichkeit auf WortebeneSchlecht für Skripte ohne einfache Wortgrenzen
RegionsrückrufVöllig fehlende TextblöckeBewertet erkannte Inhalte nicht
Genauigkeit der LesereihenfolgeSpalten- und FußnotenreihenfolgeBenötigt strukturelle Grundwahrheit
Genauigkeit im kritischen FeldNamen, Summen, Daten, IDs und NegationDomänenspezifisch, aber entscheidungsrelevant
Korrekturminuten/SeiteEchte Workflow-KostenHängt von den Fähigkeiten und der Benutzeroberfläche des Prüfers ab

Legen Sie die Akzeptanz nach Anwendungsfall fest. Bei der Suchindizierung können geringfügige Fehler toleriert werden. Eine Vertragsklausel, ein medizinischer Wert oder ein Rechnungsbetrag erfordern möglicherweise eine doppelte Eingabe oder eine qualifizierte Prüfung. Schließen Sie niemals „99 % genau“ aus einer anderen Sprache, einem anderen Modell oder einer anderen Scanverteilung ab.

Die Bildvorbereitung ist oft besser als der Modellwechsel

Drehen Sie es in die richtige Ausrichtung, beschneiden Sie irrelevante Ränder, verwenden Sie bei Telefonfotos eine ausreichende Auflösung und die richtige Perspektive. Bewahren Sie eine unberührte Quelle. Vermeiden Sie aggressive Schwellenwerte, die dünne Zeichen, Dezimalpunkte oder diakritische Zeichen löschen. Testen Sie Graustufen, Kontrast und Binärisierung auf Kopien.

ProblemVorverarbeitungsexperimentRisiko
Verzerrter ScanGeradeausrichten unter Beibehaltung der SeitenkantenDurch die Interpolation wird kleiner Text unscharf
Perspektivisches FotoVier-Ecken-KorrekturFalsche Ecken verzerren die Spalten
Geringer KontrastLokaler Kontrast auf einer KopieDie Papierstruktur wird zu falschen Strichen
Wasserzeichen/KopfzeileVerwenden Sie Ignorierungsbereiche oder NachfilterregelnDie Regel kann zulässigen wiederholten Text löschen
Winzige CharaktereErneut scannen mit höherer optischer AuflösungDurch die Hochskalierung können fehlende Details nicht wiederhergestellt werden
HandschriftVerwenden Sie eine auf Handschrift spezialisierte AlternativeOCR für gedruckten Text kann selbstbewussten Unsinn ausgeben

Mehrsprachige Erkennung

Installieren Sie die richtige Sprachbibliothek für das Dokument oder wählen Sie sie aus. Ein breites mehrsprachiges Modell erkennt möglicherweise gemischte Schriften, verwechselt jedoch visuell ähnliche Zeichen. Ein engeres Sprachmodell kann die Genauigkeit verbessern, wenn die Sprache bekannt ist. Testen Sie lateinische/kyrillische Verwechslungszeichen, chinesische/japanische Varianten, Zeichensetzung, Akzente und die Reihenfolge von rechts nach links.

OCR ist keine Übersetzung. Behalten Sie den erkannten Quelltext bei und übersetzen Sie ihn dann in einem separaten Schritt mit eigenem Glossar und überprüfen Sie ihn. Wenn die Übersetzung ein Cloud-Modell verwendet, ist der Workflow nicht mehr vollständig lokal, obwohl OCR offline war.

Komplexe Layouts und der Gap-Tree-Sorter

Umi-OCR v2.1 führte eine neu geschriebene Layout-Analyse ein, die als Gap-Tree-Sortieralgorithmus für mehrspaltige Dokumente beschrieben wird. Testzeitschriften mit Seitenleisten, Zeitungen, Formularen, Fußnoten und Bildunterschriften. Bei einer visuell korrekten Erkennung können immer noch Spalten verschachtelt oder dem falschen Bild eine Beschriftung hinzugefügt werden.

  • Vergleichen Sie die Klartextreihenfolge mit einem menschlichen Lesepfad.
  • Überprüfen Sie, ob Kopf- und Fußzeilen konsequent ausgeschlossen werden, ohne den Textkörper zu entfernen.
  • Behalten Sie Seitengrenzen und Koordinaten bei, wenn nachgelagerte Zitate eine Rückverfolgbarkeit erfordern.
  • Verwenden Sie spezielle Tabellen-/Dokumentparser, wenn die Zellstruktur erhalten bleiben muss.

Durchsuchbare doppelschichtige PDFs

Ein doppelschichtiges PDF behält Seitenbilder bei und überlagert eine unsichtbare Textebene zum Suchen, Kopieren und Indexieren. In den Versionshinweisen Umi-OCR heißt es, dass die Generierung aus Original-PDFs unterstützt wird. Andere importierte Dokumentformate erzeugen möglicherweise Text, aber nicht unbedingt ein neu erstelltes PDF. Bestätigen Sie das genaue Versionsverhalten.

QS-PrüfungWieKonsequenz des Scheiterns
Visuelle TreuePixelvergleich gerenderter SeitenÄnderungen der Archivseite
TextausrichtungZeilen über die Seite auswählen/kopierenFalscher Text in der Nähe kopiert
LesereihenfolgeGanze Seite extrahieren und vergleichenScreenreader/Suchausschnitte werden inkohärent
Seitenzahl/RotationAutomatisierte und visuelle KontrollenFehlende oder invertierte Seiten
DateigrößeVergleichen Sie Original/Ausgabe und KomprimierungNicht verwaltbares Archiv oder beschädigtes Image
PDF-SicherheitScannen Sie Anhänge/Skripte und verwenden Sie den isolierten ViewerBöswillige Eingaben bleiben gefährlich

QR-Codes und Barcodes sind nicht vertrauenswürdige Daten

Zuerst dekodieren und die wörtliche Nutzlast anzeigen; Öffnen Sie nicht automatisch eine URL, verbinden Sie sich nicht mit WLAN, senden Sie keine E-Mails oder führen Sie eine App-Aktion aus. Normalisieren Sie Lookalike-Domains, blockieren Sie gefährliche Schemata und scannen Sie Links unabhängig voneinander. Überprüfen Sie bei Inventar oder Zahlungen die Prüfziffern und vergleichen Sie sie mit einem vertrauenswürdigen Datensatz.

Die Formelerkennung erfordert eine semantische Überprüfung

Optionale Plugins können Formelbilder in LaTeX-ähnlichen Text konvertieren. Überprüfen Sie hochgestellte, tiefgestellte Zeichen, Minuszeichen, Multiplikationssymbole, Matrizen, Klammern, griechische Buchstaben und die Ausrichtung von Gleichungen. Kompilieren Sie die Ausgabe und vergleichen Sie sie visuell. Lassen Sie dann einen Fachexperten die Bedeutung überprüfen. Ein optisch ähnliches Zeichen kann ein Ergebnis umkehren.

Automatisierung und HTTP-Schnittstellensicherheit

Die lokale HTTP-Funktion von Umi-OCR kann eine Screenshot- oder Stapelerkennung mit einer anderen Anwendung verbinden. Standardmäßig an Loopback binden, bei Offenlegung authentifizieren, Dateipfade und Anforderungsgröße einschränken und Remote-URLs ablehnen, sofern dies nicht ausdrücklich erforderlich ist. Setzen Sie einen freizügigen OCR-Dienst niemals direkt dem Internet aus.

Stellen Sie Jobs mit eindeutigen IDs in die Warteschlange, speichern Sie Quell-Hashes, erfassen Sie die Engine-/Plugin-Version und geben Sie Koordinaten/Konfidenz zurück, sofern verfügbar. Definieren Sie Zeitüberschreitungen und isolieren Sie beschädigte Bilder/PDFs. Verwenden Sie ein separates Konto/einen separaten Container für nicht vertrauenswürdige Dokumente, da Bild- und PDF-Decoder ihre eigene Angriffsfläche haben.

Alternativen

OptionBeste PassformKompromiss versus Umi-OCR
Umi-OCRPrivater Desktop-Screenshot, Batch- und PDF-OCREingeschränkte kollaborative/Cloud-Dokumentenintelligenz
PaddleOCR direktIndividuell geschulte/bereitgestellte OCR-PipelineMehr Technik, breiterer Zugang zu aktuellen Modellen
TesseraktAusgereifte CLI/Bibliothek und deterministische AutomatisierungLayout-/Sprachqualität variiert
OCRmyPDFÜber die Befehlszeile durchsuchbare PDF-PipelineWeniger Desktop-Capture-/UI-Funktionalität
Cloud-Dokument-KIFormulare, Tabellen, Skalierung und verwaltete APIsUpload, wiederkehrende Kosten und Anbieter-Governance
Multimodales LLMSemantische Fragen auf wenigen SeitenKann halluzinieren und ist für den exakten Extraktionsbeweis schwächer
Eingabe menschlicher DatenHochriskante Felder und mehrdeutige ScansHöhere Kosten, aber nachvollziehbare Überprüfung

Häufig gestellte Fragen

Ist Umi-OCR kostenlos?

Ja. Das offizielle Repository ist MIT-lizenziert. Für Vertrieb, Hardware und organisatorische Unterstützung können dennoch Kosten entstehen.

Ist es vollständig offline?

Die Anerkennung kann lokal erfolgen. Überprüfen Sie Updates, Plugins, synchronisierte Ordner, HTTP-Integrationen und Downstream-Übersetzungen separat.

Funktioniert es unter macOS?

Das offizielle Projekt vertreibt hauptsächlich Windows- und Linux-Builds. macOS-Benutzer sollten native OCR, eine VM oder ein anderes unterstütztes Tool vergleichen.

Welchen Build soll ich wählen?

Benchmarking Paddle zuerst auf kompatibler moderner Hardware und Rapid auf ressourcenschwächeren oder inkompatiblen Windows-CPUs; Verwenden Sie die Korrekturzeit als letztes Maß.

Kann es gescannte PDFs durchsuchbar machen?

Ja, mit einem zweischichtigen PDF-Workflow aus Quell-PDFs. Überprüfen Sie vor der Archivierung die Ausrichtung und Lesereihenfolge des verborgenen Texts.

Können OCR-Ergebnissen automatisch vertraut werden?

Nein für Folgedaten. Überprüfen Sie Namen, Zahlen, Daten, Negationen, Tabellenzellen und alle entscheidungsrelevanten Felder.

Erkennt es Handschrift?

Die Leistung hängt von der Engine/Plugin und dem Skript ab; Verwenden Sie repräsentative Tests und bevorzugen Sie bei Bedarf ein auf Handschrift spezialisiertes System.

Primärquellen

Zuletzt überprüft am 25. Juli 2026. Umi-OCR Engines, Plugins und Plattformpakete entwickeln sich unabhängig voneinander. Überprüfen Sie das genaue Release-Asset, die Prüfsumme, das Sprachmodell und das Offline-Verhalten Ihrer Dokumente.

Ready to try Umi-OCR?

Visit the official website to get started

Visit Umi-OCR

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/8/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool