Umi-OCR est une application de bureau gratuite et open source permettant de reconnaître du texte localement sous Windows et Linux. Il prend en charge la capture d'écran, les images par lots, le traitement de documents/PDF, les PDF double couche consultables, les codes QR/barres et les plugins de moteur en option tels que la reconnaissance de formules. Le référentiel officiel utilise la licence MIT et distribue des versions portables avec des sommes de contrôle.
Son plus grand avantage est la confidentialité opérationnelle : un moteur local configuré peut traiter les documents sans envoyer leurs pixels à un service OCR hébergé. Cela ne rend pas toutes les actions environnantes hors ligne. Les téléchargements, les vérifications de mises à jour, les plugins tiers, les interfaces HTTP configurées par l'utilisateur, les dossiers synchronisés ou la traduction en aval peuvent créer des chemins de réseau ou de partage de données. Vérifiez la configuration exacte avec un moniteur réseau lorsque la confidentialité est importante.

Quel flux de travail chaque fonctionnalité résout-elle ?
| Mode | Meilleure utilisation | Résultats/preuves | Principale limite |
|---|---|---|---|
| Capture d'écran ROC | Copier du texte à partir d'une application ou d'une image | Texte reconnu immédiatement | Petit texte de l'interface utilisateur et artefacts de mise à l'échelle |
| OCR d'images par lots | Scans, reçus et dossiers de pages | Texte par fichier avec paramètres reproductibles | Ordre de lecture sur des mises en page complexes |
| Document/PDF | Archives et livres scannés | Exportation de texte ou PDF double couche consultable | Tableaux, notes de bas de page et alignement du texte masqué |
| QR/code-barres | Décoder les symboles lisibles par machine | Charge utile affichée pour examen | La charge utile peut être une URL malveillante |
| Plugin de formule | Convertir des régions mathématiques isolées | Représentation de type LaTeX | Les symboles et la structure nécessitent une vérification visuelle |
| Interface HTTP | Automatisation/intégration locale | Résultat OCR lisible par machine | Peut exposer des documents s'ils sont liés au-delà de localhost |
Le pipeline OCR et ses erreurs indépendantes
page/écran source
|
recadrer + faire pivoter + redresser
|
v
boîtes de détection de texte
|
v
reconnaissance de ligne
|
v
tri de la disposition / ignorer les régions
|
.-----+-----------.
v v
PDF consultable en texte brut
| |
vérification humaine : noms, nombres, négation, ordre de lecture
La détection peut manquer une région même lorsque la reconnaissance est précise. La reconnaissance peut mal lire un caractère à l’intérieur d’une case correcte. Le tri par mise en page peut organiser les lignes correctes dans le mauvais ordre. Un PDF consultable peut sembler visuellement identique tandis que son calque de texte invisible contient des erreurs. Inspectez chaque couche séparément au lieu de traiter l’apparence lisible de la page comme l’exactitude de l’OCR.
Constructions Paddle contre Rapid
Les notes de version officielles décrivent le package Paddle comme étant plus rapide/plus gourmand en ressources et adapté aux machines plus puissantes, tandis que la version Rapid utilise moins de mémoire et a une compatibilité CPU plus large mais peut être plus lente. Le texte d'une version plus ancienne avertissait spécifiquement que Paddle pourrait échouer sur certains processeurs Pentium, Celeron et Atom. Les artefacts v2.1.5 actuels répertorient un package Windows Rapid et un package Linux Paddle ; les ressources disponibles peuvent varier selon la version, alors consultez la page en direct.
| Choix | Commencez ici quand | Référence | Signal de repli |
|---|---|---|---|
| Construction de pagaie | Processeur compatible moderne et volume de documents plus élevé | Pages/minute, RAM maximale et précision | Erreur d'initialisation, incompatibilité ou pression mémoire |
| Construction rapide | Appareil Windows plus ancien/avec moins de ressources | Même ensemble de tests et même temps de correction de bout en bout | Débit trop lent pour le volume |
| Paquet Linux | Environnement de bureau x64 pris en charge | Comportement de la bibliothèque, de la police, du presse-papiers et de la capture | Échecs de dépendance spécifiques à la distribution |
| Docker/environnement d'exécution | Serveur contrôlé ou déploiement reproductible | API exposition, volumes, CPU et démarrage à froid | Fonctionnalités de bureau ou intégration matérielle nécessaires |
Ne choisissez pas uniquement en fonction de la taille de l'emballage. Exécutez 50 pages représentatives et mesurez l’erreur de caractère, les régions manquées, le temps de traitement, la mémoire et la correction manuelle. Le moteur le plus précis peut être plus lent mais moins cher s'il enregistre l'examen ; le moteur plus rapide peut gagner pour des pages propres et répétitives.
Téléchargez et installez en toute sécurité
Utilisez la page de version officielle de GitHub ou les miroirs qui y sont nommés. Comparez le SHA-256 téléchargé avec la valeur publiée pour l'actif exact. La version v2.1.5 a examiné les valeurs SHA-256 répertoriées pour les archives Windows Rapid et Linux Paddle. Un auto-extractible .7z.exe peut être ouvert comme archive ; inspectez-le et analysez-le conformément à la politique de l’organisation avant son exécution.
Le logiciel portable écrit toujours les paramètres et les journaux. v2.1.5 journaux ajoutés sous Données/journaux UmiOCR, avec une gravité enregistrée configurable. Examinez les journaux avant de traiter les secrets : les chemins de fichiers, les erreurs ou les extraits reconnus peuvent devenir des données conservées. Protégez l’intégralité du répertoire de données UmiOCR, les sauvegardes et les résultats exportés.
Créer un benchmark OCR spécifique au document
Créez une vérité terrain à partir de pages vérifiées manuellement. Échantillonnez les conditions les plus difficiles réellement attendues, pas une capture d'écran nette. Incluez plusieurs scripts, petites polices, inclinaison, photos de téléphone, faible contraste, tampons, écriture manuscrite, texte vertical, colonnes mixtes, tableaux et pages avec en-têtes/pieds de page.
| Métrique | Ce qu'il attrape | Pourquoi c'est insuffisant seul |
|---|---|---|
| Taux d'erreur de caractère | Insertions, suppressions et substitutions | Un chiffre erroné peut avoir plus d’importance que de nombreuses erreurs de ponctuation |
| Taux d'erreur de mots | Convivialité au niveau des mots | Mauvais pour les scripts sans limites de mots simples |
| Rappel de région | Blocs de texte complètement manqués | Ne note pas le contenu reconnu |
| Précision de l'ordre de lecture | Séquencement des colonnes et des notes de bas de page | Nécessite une vérité fondamentale structurelle |
| Précision du champ critique | Noms, totaux, dates, identifiants et négation | Spécifique au domaine, mais essentiel aux décisions |
| Procès-verbal/page de correction | Coût réel du flux de travail | Dépend des compétences et de l'interface du réviseur |
Définissez l’acceptation par cas d’utilisation. L'indexation de la recherche peut tolérer des erreurs modestes ; une clause contractuelle, une valeur médicale ou le total de la facture peuvent nécessiter une double saisie ou un examen qualifié. Ne déduisez jamais « 99 % de précision » à partir d'une langue, d'un modèle ou d'une distribution de numérisation différents.
La préparation des images surpasse souvent le changement de modèle
Faites pivoter vers la bonne orientation, recadrez les bordures non pertinentes, utilisez une résolution suffisante et une perspective correcte sur les photos du téléphone. Préservez une source intacte. Évitez les seuils agressifs qui effacent les caractères fins, les points décimaux ou les signes diacritiques. Testez les niveaux de gris, le contraste et la binarisation sur les copies.
| Problème | Expérience de prétraitement | Risque |
|---|---|---|
| Analyse asymétrique | Redresser tout en préservant les bords de la page | L'interpolation brouille le petit texte |
| Photo en perspective | Correction aux quatre coins | Les mauvais coins déforment les colonnes |
| Faible contraste | Contraste local sur une copie | La texture du papier devient de faux traits |
| Filigrane/en-tête | Utilisez les régions ignorées ou les règles de post-filtrage | La règle peut supprimer le texte répété légitime |
| Petits personnages | Nouvelle numérisation à une résolution optique plus élevée | La mise à l'échelle ne peut pas récupérer les détails manquants |
| Écriture manuscrite | Utilisez une alternative spécialisée en écriture manuscrite | L'OCR de texte imprimé peut produire des absurdités confiantes |
Reconnaissance multilingue
Installez ou sélectionnez la bibliothèque de langue appropriée pour le document. Un modèle multilingue large peut reconnaître des écritures mixtes mais confondre des caractères visuellement similaires ; un modèle linguistique plus étroit peut améliorer la précision lorsque la langue est connue. Testez les confusions latin/cyrillique, les variantes chinoises/japonaises, la ponctuation, les accents et l'ordre de droite à gauche.
L'OCR n'est pas une traduction. Conservez le texte source reconnu, puis traduisez-le dans une étape distincte avec son propre glossaire et sa propre révision. Si la traduction utilise un modèle cloud, le flux de travail n'est plus entièrement local même si l'OCR était hors ligne.
Mises en page complexes et trieur d'arbres à lacunes
Umi-OCR v2.1 a introduit l'analyse de mise en page réécrite décrite comme un algorithme de tri par arbre vide pour les documents multi-colonnes. Testez les journaux avec des barres latérales, des journaux, des formulaires, des notes de bas de page et des légendes. Une reconnaissance visuellement correcte peut toujours entrelacer les colonnes ou attacher une légende à la mauvaise image.
- Comparez l'ordre du texte brut à un chemin de lecture humain.
- Vérifiez si les en-têtes et les pieds de page sont exclus de manière cohérente sans supprimer le corps du texte.
- Conservez les limites et les coordonnées des pages lorsque la citation en aval nécessite une traçabilité.
- Utilisez des analyseurs de tableaux/documents spécialisés lorsque la structure des cellules doit être préservée.
PDF double couche consultables
Un PDF double couche conserve les images des pages et superpose une couche de texte invisible pour la recherche, la copie et l'indexation. Les notes de version Umi-OCR indiquent que la génération est prise en charge à partir des fichiers PDF originaux ; d'autres formats de documents importés peuvent produire du texte mais pas nécessairement un PDF reconstruit. Confirmez le comportement exact de la version.
| Contrôle qualité | Comment | Conséquence de l'échec |
|---|---|---|
| Fidélité visuelle | Pages rendues par comparaison de pixels | Modifications de la page d'archives |
| Alignement du texte | Sélectionner/copier des lignes sur la page | Mauvais texte à proximité copié |
| Ordre de lecture | Extraire la page entière et comparer | Les lecteurs d’écran/extraits de recherche deviennent incohérents |
| Nombre de pages/rotation | Contrôles automatisés et visuels | Pages manquantes ou inversées |
| Taille du fichier | Comparer l'original/la sortie et la compression | Archive ingérable ou image dégradée |
| Sécurité des PDF | Analyser les pièces jointes/scripts et utiliser la visionneuse isolée | Les entrées malveillantes restent dangereuses |
Les codes QR et les codes-barres sont des données non fiables
Décodez d’abord et affichez la charge utile littérale ; n'ouvrez pas automatiquement une URL, ne rejoignez pas le Wi-Fi, n'envoyez pas d'e-mail ou n'exécutez pas une action d'application. Normalisez les domaines similaires, bloquez les schémas dangereux et analysez les liens de manière indépendante. Pour l'inventaire ou les paiements, vérifiez les chiffres de contrôle et comparez-les avec un enregistrement fiable.
La reconnaissance de formule nécessite une vérification sémantique
Des plugins facultatifs peuvent convertir des images de formule en texte de type LaTeX. Vérifiez les exposants, les indices, les signes moins, les symboles de multiplication, les matrices, les parenthèses, les lettres grecques et l'alignement des équations. Compilez le résultat et comparez-le visuellement, puis demandez à un expert du domaine d'en vérifier la signification. Un personnage visuellement similaire peut inverser un résultat.
Automatisation et sécurité de l'interface HTTP
La capacité HTTP locale de Umi-OCR peut connecter une capture d'écran ou une reconnaissance par lots à une autre application. Liez-vous au bouclage par défaut, authentifiez-vous si exposé, limitez les chemins de fichiers et la taille des requêtes et rejetez les URL distantes sauf si cela est explicitement requis. N’exposez jamais un service OCR permissif directement sur Internet.
Mettez les tâches en file d'attente avec des identifiants uniques, stockez les hachages de source, capturez la version du moteur/plug-in et renvoyez les coordonnées/confiance le cas échéant. Définissez des délais d'attente et mettez en quarantaine les images/PDF corrompus. Utilisez un compte/conteneur distinct pour les documents non fiables, car les décodeurs d'images et de PDF ont leur propre surface d'attaque.
Alternatives
| Options | Meilleur ajustement | Compromis par rapport à Umi-OCR |
|---|---|---|
| Umi-OCR | Capture d'écran du bureau privé, OCR par lots et PDF | Intelligence documentaire collaborative/cloud limitée |
| PaddleOCR directement | Pipeline OCR formé/déployé sur mesure | Plus d'ingénierie, un accès plus large aux modèles actuels |
| Tesseract | CLI/bibliothèque mature et automatisation déterministe | La qualité de la mise en page et de la langue varie |
| OCRmyPDF | Pipeline PDF consultable en ligne de commande | Moins de fonctionnalités de capture de bureau/interface utilisateur |
| IA pour les documents cloud | Formulaires, tableaux, échelles et APIs gérés | Téléchargement, coûts récurrents et gouvernance des fournisseurs |
| LLM multimodal | Questions sémantiques sur quelques pages | Peut halluciner et est plus faible pour les preuves d'extraction exactes |
| Saisie de données humaines | Domaines à enjeux élevés et analyses ambiguës | Coût plus élevé mais vérification responsable |
Questions fréquemment posées
Umi-OCR est-il gratuit ?
Oui. Le référentiel officiel est sous licence MIT. La distribution, le matériel et le support organisationnel peuvent toujours générer des coûts.
Est-il totalement hors ligne ?
La reconnaissance peut être locale. Vérifiez séparément les mises à jour, les plugins, les dossiers synchronisés, les intégrations HTTP et la traduction en aval.
Est-ce que ça marche sur macOS ?
Le projet officiel distribue principalement les versions Windows et Linux. Les utilisateurs de macOS doivent comparer l'OCR natif, une VM ou un autre outil pris en charge.
Quelle version dois-je choisir ?
Benchmark Paddle d'abord sur du matériel moderne compatible et Rapid sur des processeurs Windows à faibles ressources ou incompatibles ; utilisez le temps de correction comme mesure finale.
Peut-il rendre les PDF numérisés consultables ?
Oui, en utilisant un flux de travail PDF double couche à partir de PDF sources. Inspectez l’alignement du texte masqué et l’ordre de lecture avant l’archivage.
Les résultats OCR peuvent-ils être automatiquement fiables ?
Non pour les données conséquentes. Vérifiez les noms, les nombres, les dates, la négation, les cellules du tableau et tous les champs décisionnels.
Est-ce qu'il reconnaît l'écriture manuscrite ?
Les performances dépendent du moteur/plugin et du script ; utiliser des tests représentatifs et préférer un système spécialisé en écriture manuscrite lorsque cela est nécessaire.
Sources primaires
- Dépôt officiel Umi-OCR
- README anglais officiel
- Versions officielles, packages et sommes de contrôle
- Runtime Linux officiel et conseils Docker
- Catalogue de plugins officiel
- Licence de projet
- PaddleOCR documentation officielle
- PaddleOCR 3.0 rapport technique
- Informations sur la préservation au format PDF de la Bibliothèque du Congrès
Dernière révision le 25 juillet 2026. Les moteurs, plugins et packages de plate-forme Umi-OCR évoluent indépendamment. Vérifiez l'actif de version exact, la somme de contrôle, le modèle de langage et le comportement hors ligne de vos documents.