Umi-OCR es una aplicación de escritorio gratuita y de código abierto para reconocer texto localmente en Windows y Linux. Admite captura de pantalla, imágenes por lotes, procesamiento de documentos/PDF, archivos PDF de doble capa con capacidad de búsqueda, códigos de barras/QR y complementos de motor opcionales, como el reconocimiento de fórmulas. El repositorio oficial utiliza la licencia MIT y distribuye compilaciones portátiles con sumas de verificación.
Su mayor ventaja es la privacidad operativa: un motor local configurado puede procesar documentos sin enviar sus píxeles a un servicio de OCR alojado. Eso no hace que todas las acciones circundantes estén fuera de línea. Las descargas, las comprobaciones de actualizaciones, los complementos de terceros, las interfaces HTTP configuradas por el usuario, las carpetas sincronizadas o la traducción posterior pueden crear rutas de red o para compartir datos. Verifique la configuración exacta con un monitor de red cuando la confidencialidad sea importante.

¿Qué flujo de trabajo resuelve cada característica?
| Modo | Mejor uso | Salida/evidencia | Limitación principal |
|---|---|---|---|
| OCR de captura de pantalla | Copiar texto de una aplicación o imagen | Texto reconocido inmediatamente | Pequeño texto de interfaz de usuario y artefactos de escala |
| OCR de imágenes por lotes | Escaneos, recibos y carpetas de páginas. | Texto por archivo con configuraciones repetibles | Orden de lectura en diseños complejos |
| Documento/PDF | Archivos y libros escaneados. | Exportación de texto o PDF de doble capa con capacidad de búsqueda | Tablas, notas a pie de página y alineación de texto oculto |
| QR/código de barras | Decodificar símbolos legibles por máquina | Carga útil mostrada para revisión | La carga útil puede ser una URL maliciosa |
| Complemento de fórmula | Convertir regiones matemáticas aisladas | Representación similar a LaTeX | Los símbolos y la estructura necesitan verificación visual. |
| interfaz HTTP | Automatización/integración local | Resultado de OCR legible por máquina | Puede exponer documentos si se vinculan más allá del localhost |
El proceso de OCR y sus errores independientes
página/pantalla fuente
|
recortar + rotar + alinear
|
v
cuadros de detección de texto
|
v
reconocimiento de linea
|
v
ordenar diseño/ignorar regiones
|
.-----+-----------.
vv
PDF con capacidad de búsqueda en texto plano
| |
control humano: nombres, números, negación, orden de lectura
La detección puede pasar por alto una región incluso cuando el reconocimiento es preciso. El reconocimiento puede leer mal un carácter dentro de un cuadro correcto. La clasificación del diseño puede ordenar las líneas correctas en el orden incorrecto. Un PDF con capacidad de búsqueda puede parecer visualmente idéntico mientras su capa de texto invisible contenga errores. Inspeccione cada capa por separado en lugar de tratar la apariencia de la página legible como corrección de OCR.
Construcciones de remo versus rápidas
Las notas de la versión oficial describen el paquete Paddle como más rápido, con mayores recursos y adecuado para máquinas más potentes, mientras que la versión Rapid usa menos memoria y tiene una compatibilidad de CPU más amplia, pero puede ser más lenta. El texto de la versión anterior advertía específicamente que Paddle podría fallar en algunas CPU Pentium, Celeron y Atom. Los artefactos actuales v2.1.5 enumeran un paquete Windows Rapid y un paquete Linux Paddle; Los recursos disponibles pueden variar según la versión, así que consulte la página en vivo.
| Elección | Empieza aquí cuando | Punto de referencia | señal de respaldo |
|---|---|---|---|
| construcción de remo | CPU moderna compatible y mayor volumen de documentos | Páginas/minuto, RAM máxima y precisión | Error de inicialización, incompatibilidad o presión de memoria. |
| Construcción rápida | Dispositivo Windows más antiguo o de menores recursos | Mismo conjunto de pruebas y tiempo de corrección de un extremo a otro | Rendimiento demasiado lento para el volumen |
| paquete de linux | Entorno de escritorio x64 compatible | Biblioteca, fuente, portapapeles y comportamiento de captura | Fallos de dependencia específicos de la distribución |
| Docker/tiempo de ejecución | Servidor controlado o implementación repetible | API exposición, volúmenes, CPU y arranque en frío | Se necesitan funciones de escritorio o integración de hardware |
No elija únicamente por el tamaño del paquete. Ejecute 50 páginas representativas y mida el error de caracteres, las regiones omitidas, el tiempo de procesamiento, la memoria y la corrección manual. El motor más preciso puede ser más lento pero más económico si evita la revisión; El motor más rápido puede ganar con páginas limpias y repetitivas.
Descargue e instale de forma segura
Utilice la página de lanzamiento oficial de GitHub o los espejos nombrados allí. Compare el SHA-256 descargado con el valor publicado para el activo exacto. La versión v2.1.5 revisada enumera los valores SHA-256 para archivos Windows Rapid y Linux Paddle. Un autoextraíble .7z.exe se puede abrir como archivo; inspeccione y escanee según la política organizacional antes de la ejecución.
El software portátil todavía escribe configuraciones y registros. v2.1.5 registros agregados en Datos/registros de UmiOCR, con gravedad guardada configurable. Revise los registros antes de procesar secretos: las rutas de archivos, los errores o los fragmentos reconocidos pueden convertirse en datos retenidos. Proteja todo el directorio de datos UmiOCR, las copias de seguridad y los resultados exportados.
Cree un punto de referencia de OCR específico para documentos
Cree datos reales a partir de páginas verificadas manualmente. Muestra las condiciones más duras que realmente se esperan, no una captura de pantalla limpia. Incluya múltiples scripts, fuentes pequeñas, sesgadas, fotos de teléfono, bajo contraste, sellos, escritura a mano, texto vertical, columnas mixtas, tablas y páginas con encabezados y pies de página.
| Métrica | lo que atrapa | ¿Por qué es insuficiente por sí solo? |
|---|---|---|
| Tasa de error de caracteres | Inserciones, eliminaciones y sustituciones. | Un dígito incorrecto puede importar más que muchos errores de puntuación |
| Tasa de error de palabra | Usabilidad a nivel de palabra | Deficiente para guiones sin límites de palabras simples |
| Recuperación de región | Bloques de texto completamente perdidos | No puntúa contenido reconocido |
| Precisión del orden de lectura | Secuenciación de columnas y notas al pie | Necesita verdad estructural estructural |
| Precisión del campo crítico | Nombres, totales, fechas, identificaciones y negaciones. | Específico de un dominio, pero esencial para las decisiones. |
| Corrección minutos/página | Costo real del flujo de trabajo | Depende de la habilidad y la interfaz del revisor |
Establecer aceptación por caso de uso. La indexación de búsqueda puede tolerar errores modestos; una cláusula de contrato, un valor médico o el total de una factura pueden requerir una doble entrada o una revisión calificada. Nunca infiera "99% de precisión" a partir de un idioma, modelo o distribución de escaneo diferente.
La preparación de imágenes a menudo supera al cambio de modelo
Gire a la orientación correcta, recorte bordes irrelevantes, use resolución suficiente y perspectiva correcta en las fotos del teléfono. Preservar una fuente intacta. Evite umbrales agresivos que borren caracteres finos, puntos decimales o signos diacríticos. Pruebe la escala de grises, el contraste y la binarización en copias.
| problema | Experimento de preprocesamiento | Riesgo |
|---|---|---|
| Escaneo sesgado | Alinear conservando los bordes de la página | La interpolación difumina el texto pequeño |
| Foto en perspectiva | Corrección de cuatro esquinas | Las esquinas equivocadas distorsionan las columnas |
| Bajo contraste | Contraste local en una copia. | La textura del papel se convierte en trazos falsos. |
| Marca de agua/encabezado | Utilice ignorar regiones o reglas de posfiltro | La regla puede eliminar texto repetido legítimo |
| Pequeños personajes | Volver a escanear a una resolución óptica más alta | La ampliación no puede recuperar los detalles faltantes |
| escritura a mano | Utilice una alternativa especializada en escritura a mano | El OCR de texto impreso puede generar tonterías seguras |
Reconocimiento multilingüe
Instale o seleccione la biblioteca de idioma correcta para el documento. Un modelo multilingüe amplio puede reconocer escrituras mixtas pero confundir caracteres visualmente similares; un modelo de lenguaje más limitado puede mejorar la precisión cuando se conoce el idioma. Pruebe las combinaciones latinas y cirílicas, las variantes chinas y japonesas, la puntuación, los acentos y el orden de derecha a izquierda.
OCR no es traducción. Mantenga el texto fuente reconocido y luego traduzca en un paso separado con su propio glosario y revisión. Si la traducción utiliza un modelo en la nube, el flujo de trabajo ya no es completamente local aunque el OCR esté fuera de línea.
Diseños complejos y clasificador de árbol de espacios
Umi-OCR v2.1 introdujo el análisis de diseño reescrito descrito como un algoritmo de clasificación de árbol de espacios para documentos de varias columnas. Revistas de prueba con barras laterales, periódicos, formularios, notas a pie de página y leyendas. El reconocimiento visualmente correcto aún puede intercalar columnas o adjuntar un título a la imagen incorrecta.
- Compare el orden del texto sin formato con una ruta de lectura humana.
- Compruebe si los encabezados y pies de página se excluyen de forma coherente sin eliminar el texto del cuerpo.
- Mantenga los límites y las coordenadas de las páginas cuando las citas posteriores necesiten trazabilidad.
- Utilice analizadores de tablas/documentos especializados cuando se deba preservar la estructura de celdas.
PDF de doble capa con capacidad de búsqueda
Un PDF de doble capa mantiene las imágenes de las páginas y superpone una capa de texto invisible para buscar, copiar e indexar. Las notas de la versión Umi-OCR indican que la generación se admite a partir de archivos PDF originales; Otros formatos de documentos importados pueden producir texto, pero no necesariamente un PDF reconstruido. Confirme el comportamiento exacto de la versión.
| control de calidad | como | Consecuencia del fracaso |
|---|---|---|
| Fidelidad visual | Páginas renderizadas de comparación de píxeles | Cambios en la página de archivo |
| Alineación de texto | Seleccionar/copiar líneas a lo largo de la página | Texto cercano incorrecto copiado |
| Orden de lectura | Extraer página completa y comparar | Los lectores de pantalla/fragmentos de búsqueda se vuelven incoherentes |
| Recuento/rotación de páginas | Comprobaciones automatizadas y visuales. | Páginas faltantes o invertidas |
| Tamaño del archivo | Comparar original/salida y compresión | Archivo inmanejable o imagen degradada |
| Seguridad en PDF | Escanee archivos adjuntos/scripts y use un visor aislado | Las entradas maliciosas siguen siendo peligrosas |
Los códigos QR y los códigos de barras son datos que no son confiables
Decodifica primero y muestra la carga útil literal; no abra automáticamente una URL, no se una a una red Wi-Fi, no envíe un correo electrónico ni ejecute una acción de la aplicación. Normalice dominios similares, bloquee esquemas peligrosos y analice enlaces de forma independiente. Para inventario o pagos, verifique los dígitos de control y compárelos con un registro confiable.
El reconocimiento de fórmulas necesita verificación semántica
Los complementos opcionales pueden convertir imágenes de fórmulas en texto similar a LaTeX. Verifique superíndices, subíndices, signos menos, símbolos de multiplicación, matrices, paréntesis, letras griegas y alineación de ecuaciones. Compile el resultado y compárelo visualmente, luego haga que un experto en el dominio verifique el significado. Un carácter visualmente similar puede revertir un resultado.
Automatización y seguridad de la interfaz HTTP
La capacidad HTTP local de Umi-OCR puede conectar capturas de pantalla o reconocimiento por lotes a otra aplicación. Vincule al bucle invertido de forma predeterminada, autentíquese si está expuesto, restrinja las rutas de archivo y el tamaño de la solicitud y rechace las URL remotas a menos que se requiera explícitamente. Nunca exponga un servicio OCR permisivo directamente a Internet.
Ponga en cola trabajos con ID únicos, almacene hashes de origen, capture la versión del motor/complemento y devuelva coordenadas/confianza cuando esté disponible. Defina tiempos de espera y ponga en cuarentena imágenes/PDF corruptos. Utilice una cuenta/contenedor separado para documentos que no sean de confianza porque los decodificadores de imágenes y PDF tienen su propia superficie de ataque.
Alternativas
| Opción | Mejor ajuste | Compensación versus Umi-OCR |
|---|---|---|
| Umi-OCR | Captura de pantalla de escritorio privada, OCR por lotes y PDF | Inteligencia de documentos colaborativa/en la nube limitada |
| PaddleOCR directamente | Canal de OCR personalizado capacitado/implementado | Más ingeniería, mayor acceso a los modelos actuales |
| Teseracto | CLI/biblioteca madura y automatización determinista | La calidad del diseño/idioma varía |
| OCRmyPDF | Canalización de PDF con capacidad de búsqueda desde la línea de comandos | Menos funcionalidad de captura de escritorio/UI |
| IA de documentos en la nube | Formularios, tablas, escala y APIs administrados | Carga, costos recurrentes y gobierno del proveedor |
| LLM multimodal | Preguntas semánticas en unas pocas páginas. | Puede alucinar y es más débil para obtener pruebas de extracción exactas. |
| Entrada de datos humanos | Campos de alto riesgo y análisis ambiguos | Mayor costo pero verificación responsable |
Preguntas frecuentes
¿Es Umi-OCR gratuito?
Sí. El repositorio oficial tiene licencia del MIT. La distribución, el hardware y el soporte organizativo aún pueden generar costos.
¿Está completamente fuera de línea?
El reconocimiento puede ser local. Verifique las actualizaciones, los complementos, las carpetas sincronizadas, las integraciones HTTP y la traducción posterior por separado.
¿Funciona en macOS?
El proyecto oficial distribuye principalmente compilaciones de Windows y Linux. Los usuarios de macOS deben comparar OCR nativo, una VM u otra herramienta compatible.
¿Qué construcción debo elegir?
Benchmark Paddle primero en hardware moderno compatible y Rapid en CPU de Windows incompatibles o de menores recursos; Utilice el tiempo de corrección como medida final.
¿Puede hacer que se puedan buscar archivos PDF escaneados?
Sí, utilizando un flujo de trabajo PDF de doble capa a partir de archivos PDF de origen. Inspeccione la alineación del texto oculto y el orden de lectura antes de archivar.
¿Se puede confiar automáticamente en los resultados del OCR?
No para datos consecuentes. Verifique nombres, números, fechas, negaciones, celdas de tablas y todos los campos que impulsen la toma de decisiones.
¿Reconoce la escritura a mano?
El rendimiento depende del motor/complemento y del script; utilice pruebas representativas y prefiera un sistema especializado en escritura a mano cuando sea necesario.
fuentes primarias
- Repositorio oficial Umi-OCR
- LÉAME oficial en inglés
- Lanzamientos oficiales, paquetes y sumas de verificación.
- Guía oficial de Docker y tiempo de ejecución de Linux
- Catálogo oficial de complementos
- Licencia de proyecto
- PaddleOCR documentación oficial
- PaddleOCR 3.0 informe técnico
- Información de conservación en formato PDF de la Biblioteca del Congreso
Última revisión el 25 de julio de 2026. Umi-OCR motores, complementos y paquetes de plataforma evolucionan de forma independiente. Verifique el activo de publicación exacto, la suma de verificación, el modelo de idioma y el comportamiento fuera de línea en sus documentos.