Umi-OCR
Umi-OCR
Active

Umi-OCR

Umi-OCR es una aplicación de escritorio OCR sin conexión con licencia MIT gratuita para Windows y Linux, que cubre capturas de pantalla, imágenes por lotes, archivos PDF, códigos QR/de barras y complementos de fórmulas opcionales. Esta guía compara las compilaciones de Paddle y Rapid, la privacidad, las pruebas de precisión, el control de calidad del diseño/PDF, la automatización y las alternativas.

85

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Umi-OCROCR offlineOCR gratisOCR open sourceOCR capturasOCR PDFOCR local

Product Preview

A quick visual look at Umi-OCR before you visit the official site.

Published 1/21/2026
Umi-OCR screenshot

Editorial Review

About Umi-OCR

Umi-OCR es una aplicación de escritorio gratuita y de código abierto para reconocer texto localmente en Windows y Linux. Admite captura de pantalla, imágenes por lotes, procesamiento de documentos/PDF, archivos PDF de doble capa con capacidad de búsqueda, códigos de barras/QR y complementos de motor opcionales, como el reconocimiento de fórmulas. El repositorio oficial utiliza la licencia MIT y distribuye compilaciones portátiles con sumas de verificación.

Su mayor ventaja es la privacidad operativa: un motor local configurado puede procesar documentos sin enviar sus píxeles a un servicio de OCR alojado. Eso no hace que todas las acciones circundantes estén fuera de línea. Las descargas, las comprobaciones de actualizaciones, los complementos de terceros, las interfaces HTTP configuradas por el usuario, las carpetas sincronizadas o la traducción posterior pueden crear rutas de red o para compartir datos. Verifique la configuración exacta con un monitor de red cuando la confidencialidad sea importante.

Official Umi-OCR logo
Umi-OCR es un banco de trabajo de OCR local en lugar de un servicio de comprensión de documentos en la nube. La salida de reconocimiento aún debe compararse con los píxeles de origen.

¿Qué flujo de trabajo resuelve cada característica?

ModoMejor usoSalida/evidenciaLimitación principal
OCR de captura de pantallaCopiar texto de una aplicación o imagenTexto reconocido inmediatamentePequeño texto de interfaz de usuario y artefactos de escala
OCR de imágenes por lotesEscaneos, recibos y carpetas de páginas.Texto por archivo con configuraciones repetiblesOrden de lectura en diseños complejos
Documento/PDFArchivos y libros escaneados.Exportación de texto o PDF de doble capa con capacidad de búsquedaTablas, notas a pie de página y alineación de texto oculto
QR/código de barrasDecodificar símbolos legibles por máquinaCarga útil mostrada para revisiónLa carga útil puede ser una URL maliciosa
Complemento de fórmulaConvertir regiones matemáticas aisladasRepresentación similar a LaTeXLos símbolos y la estructura necesitan verificación visual.
interfaz HTTPAutomatización/integración localResultado de OCR legible por máquinaPuede exponer documentos si se vinculan más allá del localhost

El proceso de OCR y sus errores independientes

 página/pantalla fuente
         |
   recortar + rotar + alinear
         |
         v
   cuadros de detección de texto
         |
         v
   reconocimiento de linea
         |
         v
 ordenar diseño/ignorar regiones
         |
   .-----+-----------.
   vv
 PDF con capacidad de búsqueda en texto plano
   |                 |
 control humano: nombres, números, negación, orden de lectura

La detección puede pasar por alto una región incluso cuando el reconocimiento es preciso. El reconocimiento puede leer mal un carácter dentro de un cuadro correcto. La clasificación del diseño puede ordenar las líneas correctas en el orden incorrecto. Un PDF con capacidad de búsqueda puede parecer visualmente idéntico mientras su capa de texto invisible contenga errores. Inspeccione cada capa por separado en lugar de tratar la apariencia de la página legible como corrección de OCR.

Construcciones de remo versus rápidas

Las notas de la versión oficial describen el paquete Paddle como más rápido, con mayores recursos y adecuado para máquinas más potentes, mientras que la versión Rapid usa menos memoria y tiene una compatibilidad de CPU más amplia, pero puede ser más lenta. El texto de la versión anterior advertía específicamente que Paddle podría fallar en algunas CPU Pentium, Celeron y Atom. Los artefactos actuales v2.1.5 enumeran un paquete Windows Rapid y un paquete Linux Paddle; Los recursos disponibles pueden variar según la versión, así que consulte la página en vivo.

ElecciónEmpieza aquí cuandoPunto de referenciaseñal de respaldo
construcción de remoCPU moderna compatible y mayor volumen de documentosPáginas/minuto, RAM máxima y precisiónError de inicialización, incompatibilidad o presión de memoria.
Construcción rápidaDispositivo Windows más antiguo o de menores recursosMismo conjunto de pruebas y tiempo de corrección de un extremo a otroRendimiento demasiado lento para el volumen
paquete de linuxEntorno de escritorio x64 compatibleBiblioteca, fuente, portapapeles y comportamiento de capturaFallos de dependencia específicos de la distribución
Docker/tiempo de ejecuciónServidor controlado o implementación repetibleAPI exposición, volúmenes, CPU y arranque en fríoSe necesitan funciones de escritorio o integración de hardware

No elija únicamente por el tamaño del paquete. Ejecute 50 páginas representativas y mida el error de caracteres, las regiones omitidas, el tiempo de procesamiento, la memoria y la corrección manual. El motor más preciso puede ser más lento pero más económico si evita la revisión; El motor más rápido puede ganar con páginas limpias y repetitivas.

Descargue e instale de forma segura

Utilice la página de lanzamiento oficial de GitHub o los espejos nombrados allí. Compare el SHA-256 descargado con el valor publicado para el activo exacto. La versión v2.1.5 revisada enumera los valores SHA-256 para archivos Windows Rapid y Linux Paddle. Un autoextraíble .7z.exe se puede abrir como archivo; inspeccione y escanee según la política organizacional antes de la ejecución.

El software portátil todavía escribe configuraciones y registros. v2.1.5 registros agregados en Datos/registros de UmiOCR, con gravedad guardada configurable. Revise los registros antes de procesar secretos: las rutas de archivos, los errores o los fragmentos reconocidos pueden convertirse en datos retenidos. Proteja todo el directorio de datos UmiOCR, las copias de seguridad y los resultados exportados.

Cree un punto de referencia de OCR específico para documentos

Cree datos reales a partir de páginas verificadas manualmente. Muestra las condiciones más duras que realmente se esperan, no una captura de pantalla limpia. Incluya múltiples scripts, fuentes pequeñas, sesgadas, fotos de teléfono, bajo contraste, sellos, escritura a mano, texto vertical, columnas mixtas, tablas y páginas con encabezados y pies de página.

Métricalo que atrapa¿Por qué es insuficiente por sí solo?
Tasa de error de caracteresInserciones, eliminaciones y sustituciones.Un dígito incorrecto puede importar más que muchos errores de puntuación
Tasa de error de palabraUsabilidad a nivel de palabraDeficiente para guiones sin límites de palabras simples
Recuperación de regiónBloques de texto completamente perdidosNo puntúa contenido reconocido
Precisión del orden de lecturaSecuenciación de columnas y notas al pieNecesita verdad estructural estructural
Precisión del campo críticoNombres, totales, fechas, identificaciones y negaciones.Específico de un dominio, pero esencial para las decisiones.
Corrección minutos/páginaCosto real del flujo de trabajoDepende de la habilidad y la interfaz del revisor

Establecer aceptación por caso de uso. La indexación de búsqueda puede tolerar errores modestos; una cláusula de contrato, un valor médico o el total de una factura pueden requerir una doble entrada o una revisión calificada. Nunca infiera "99% de precisión" a partir de un idioma, modelo o distribución de escaneo diferente.

La preparación de imágenes a menudo supera al cambio de modelo

Gire a la orientación correcta, recorte bordes irrelevantes, use resolución suficiente y perspectiva correcta en las fotos del teléfono. Preservar una fuente intacta. Evite umbrales agresivos que borren caracteres finos, puntos decimales o signos diacríticos. Pruebe la escala de grises, el contraste y la binarización en copias.

problemaExperimento de preprocesamientoRiesgo
Escaneo sesgadoAlinear conservando los bordes de la páginaLa interpolación difumina el texto pequeño
Foto en perspectivaCorrección de cuatro esquinasLas esquinas equivocadas distorsionan las columnas
Bajo contrasteContraste local en una copia.La textura del papel se convierte en trazos falsos.
Marca de agua/encabezadoUtilice ignorar regiones o reglas de posfiltroLa regla puede eliminar texto repetido legítimo
Pequeños personajesVolver a escanear a una resolución óptica más altaLa ampliación no puede recuperar los detalles faltantes
escritura a manoUtilice una alternativa especializada en escritura a manoEl OCR de texto impreso puede generar tonterías seguras

Reconocimiento multilingüe

Instale o seleccione la biblioteca de idioma correcta para el documento. Un modelo multilingüe amplio puede reconocer escrituras mixtas pero confundir caracteres visualmente similares; un modelo de lenguaje más limitado puede mejorar la precisión cuando se conoce el idioma. Pruebe las combinaciones latinas y cirílicas, las variantes chinas y japonesas, la puntuación, los acentos y el orden de derecha a izquierda.

OCR no es traducción. Mantenga el texto fuente reconocido y luego traduzca en un paso separado con su propio glosario y revisión. Si la traducción utiliza un modelo en la nube, el flujo de trabajo ya no es completamente local aunque el OCR esté fuera de línea.

Diseños complejos y clasificador de árbol de espacios

Umi-OCR v2.1 introdujo el análisis de diseño reescrito descrito como un algoritmo de clasificación de árbol de espacios para documentos de varias columnas. Revistas de prueba con barras laterales, periódicos, formularios, notas a pie de página y leyendas. El reconocimiento visualmente correcto aún puede intercalar columnas o adjuntar un título a la imagen incorrecta.

  • Compare el orden del texto sin formato con una ruta de lectura humana.
  • Compruebe si los encabezados y pies de página se excluyen de forma coherente sin eliminar el texto del cuerpo.
  • Mantenga los límites y las coordenadas de las páginas cuando las citas posteriores necesiten trazabilidad.
  • Utilice analizadores de tablas/documentos especializados cuando se deba preservar la estructura de celdas.

PDF de doble capa con capacidad de búsqueda

Un PDF de doble capa mantiene las imágenes de las páginas y superpone una capa de texto invisible para buscar, copiar e indexar. Las notas de la versión Umi-OCR indican que la generación se admite a partir de archivos PDF originales; Otros formatos de documentos importados pueden producir texto, pero no necesariamente un PDF reconstruido. Confirme el comportamiento exacto de la versión.

control de calidadcomoConsecuencia del fracaso
Fidelidad visualPáginas renderizadas de comparación de píxelesCambios en la página de archivo
Alineación de textoSeleccionar/copiar líneas a lo largo de la páginaTexto cercano incorrecto copiado
Orden de lecturaExtraer página completa y compararLos lectores de pantalla/fragmentos de búsqueda se vuelven incoherentes
Recuento/rotación de páginasComprobaciones automatizadas y visuales.Páginas faltantes o invertidas
Tamaño del archivoComparar original/salida y compresiónArchivo inmanejable o imagen degradada
Seguridad en PDFEscanee archivos adjuntos/scripts y use un visor aisladoLas entradas maliciosas siguen siendo peligrosas

Los códigos QR y los códigos de barras son datos que no son confiables

Decodifica primero y muestra la carga útil literal; no abra automáticamente una URL, no se una a una red Wi-Fi, no envíe un correo electrónico ni ejecute una acción de la aplicación. Normalice dominios similares, bloquee esquemas peligrosos y analice enlaces de forma independiente. Para inventario o pagos, verifique los dígitos de control y compárelos con un registro confiable.

El reconocimiento de fórmulas necesita verificación semántica

Los complementos opcionales pueden convertir imágenes de fórmulas en texto similar a LaTeX. Verifique superíndices, subíndices, signos menos, símbolos de multiplicación, matrices, paréntesis, letras griegas y alineación de ecuaciones. Compile el resultado y compárelo visualmente, luego haga que un experto en el dominio verifique el significado. Un carácter visualmente similar puede revertir un resultado.

Automatización y seguridad de la interfaz HTTP

La capacidad HTTP local de Umi-OCR puede conectar capturas de pantalla o reconocimiento por lotes a otra aplicación. Vincule al bucle invertido de forma predeterminada, autentíquese si está expuesto, restrinja las rutas de archivo y el tamaño de la solicitud y rechace las URL remotas a menos que se requiera explícitamente. Nunca exponga un servicio OCR permisivo directamente a Internet.

Ponga en cola trabajos con ID únicos, almacene hashes de origen, capture la versión del motor/complemento y devuelva coordenadas/confianza cuando esté disponible. Defina tiempos de espera y ponga en cuarentena imágenes/PDF corruptos. Utilice una cuenta/contenedor separado para documentos que no sean de confianza porque los decodificadores de imágenes y PDF tienen su propia superficie de ataque.

Alternativas

OpciónMejor ajusteCompensación versus Umi-OCR
Umi-OCRCaptura de pantalla de escritorio privada, OCR por lotes y PDFInteligencia de documentos colaborativa/en la nube limitada
PaddleOCR directamenteCanal de OCR personalizado capacitado/implementadoMás ingeniería, mayor acceso a los modelos actuales
TeseractoCLI/biblioteca madura y automatización deterministaLa calidad del diseño/idioma varía
OCRmyPDFCanalización de PDF con capacidad de búsqueda desde la línea de comandosMenos funcionalidad de captura de escritorio/UI
IA de documentos en la nubeFormularios, tablas, escala y APIs administradosCarga, costos recurrentes y gobierno del proveedor
LLM multimodalPreguntas semánticas en unas pocas páginas.Puede alucinar y es más débil para obtener pruebas de extracción exactas.
Entrada de datos humanosCampos de alto riesgo y análisis ambiguosMayor costo pero verificación responsable

Preguntas frecuentes

¿Es Umi-OCR gratuito?

Sí. El repositorio oficial tiene licencia del MIT. La distribución, el hardware y el soporte organizativo aún pueden generar costos.

¿Está completamente fuera de línea?

El reconocimiento puede ser local. Verifique las actualizaciones, los complementos, las carpetas sincronizadas, las integraciones HTTP y la traducción posterior por separado.

¿Funciona en macOS?

El proyecto oficial distribuye principalmente compilaciones de Windows y Linux. Los usuarios de macOS deben comparar OCR nativo, una VM u otra herramienta compatible.

¿Qué construcción debo elegir?

Benchmark Paddle primero en hardware moderno compatible y Rapid en CPU de Windows incompatibles o de menores recursos; Utilice el tiempo de corrección como medida final.

¿Puede hacer que se puedan buscar archivos PDF escaneados?

Sí, utilizando un flujo de trabajo PDF de doble capa a partir de archivos PDF de origen. Inspeccione la alineación del texto oculto y el orden de lectura antes de archivar.

¿Se puede confiar automáticamente en los resultados del OCR?

No para datos consecuentes. Verifique nombres, números, fechas, negaciones, celdas de tablas y todos los campos que impulsen la toma de decisiones.

¿Reconoce la escritura a mano?

El rendimiento depende del motor/complemento y del script; utilice pruebas representativas y prefiera un sistema especializado en escritura a mano cuando sea necesario.

fuentes primarias

Última revisión el 25 de julio de 2026. Umi-OCR motores, complementos y paquetes de plataforma evolucionan de forma independiente. Verifique el activo de publicación exacto, la suma de verificación, el modelo de idioma y el comportamiento fuera de línea en sus documentos.

Ready to try Umi-OCR?

Visit the official website to get started

Visit Umi-OCR

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool