Whisper
Whisper

Whisper

Whisper es la familia de reconocimiento de voz y referencia Python con licencia MIT de OpenAI para transcripción local multilingüe, subtítulos y traducción de voz al inglés.

106

Views

0

Likes

Jan 2026

Added

github.com

Enlace del proyecto

Tags

Whisperreconocimiento de voztranscripción localASR abiertosubtítulos

Product Preview

A quick visual look at Whisper before you visit the official site.

Published 1/21/2026
Whisper screenshot

Editorial Review

About Whisper

Whisper es la familia de modelos de voz encoder-decoder de OpenAI y también su implementación de referencia en Python con licencia MIT. Puede transcribir en el idioma hablado, detectar el idioma y, con un checkpoint multilingüe compatible, traducir voz al inglés. El repositorio no es un servicio de transcripción listo para contratar: instalación, cómputo, archivos, seguridad, colas, observabilidad y revisión editorial siguen siendo responsabilidad del operador.

Conviene separar tres productos que suelen confundirse. openai-whisper es el paquete Python que ejecuta modelos descargables; whisper-1 es un modelo operado por separado dentro de la Audio API de OpenAI; faster-whisper, whisper.cpp, WhisperX y las interfaces web son implementaciones o flujos independientes basados en pesos Whisper. Toda afirmación de velocidad, coste o privacidad debe indicar a qué capa se refiere.

Arquitectura oficial multilingüe de reconocimiento de voz Whisper
Diagrama oficial de OpenAI: el espectrograma log-Mel pasa por el encoder y tokens especiales indican idioma, tarea, marcas de tiempo, transcripción o traducción.

La decisión en una frase

Elige Whisper si necesitas una referencia upstream inspeccionable, control local y compatibilidad con un ecosistema amplio, y puedes asumir cómputo y control de calidad. Compara una API gestionada si importa más reducir operaciones; compara runtimes especializados si el cuello de botella es CPU/edge, rendimiento por lote, alineación de palabras o diarización.

Su ventaja duradera no es una promesa de liderar todos los benchmarks modernos. Es la opcionalidad de despliegue: una misma familia puede vivir en un notebook, una estación offline, un worker GPU o un runtime de borde. Eso convierte a Whisper en una buena línea base común, pero el rendimiento de un wrapper sobre un equipo concreto no debe atribuirse automáticamente al proyecto upstream.

Qué incluye y qué falta

CapaIncluyeDebes aportar
CheckpointsPesos multilingües y solo inglés en varios tamañosAlmacenamiento, runtime y hardware
Paquete PythonCLI, API, decodificación y TXT/SRT/VTT/JSONFFmpeg, despliegue, colas, reintentos y monitorización
TranscripciónTexto original, tiempos por segmento y opcionalmente por palabraCorrección, diarización y validación sectorial
Traducción de vozModelos compatibles traducen al inglésOtros destinos; turbo no está entrenado para traducir
Licencia MITUso, modificación y distribución bajo sus condicionesDerechos del audio, consentimiento, avisos y cumplimiento

Whisper no es por sí solo un sistema de diarización, un editor de reuniones, un gestor de consentimiento ni un producto de cumplimiento. Tampoco entrega un servicio de streaming de producción. Las funciones que añada un tercero deben describirse como parte de ese tercero, no como capacidades nativas del upstream.

Elegir modelo y despliegue

ModeloParámetrosVRAM aprox.Velocidad relativa*Buen punto de partida
tiny / tiny.en39 M~1 GB~10×Prototipos
base / base.en74 M~1 GB~7×Borradores locales rápidos
small / small.en244 M~2 GB~4×Punto de partida equilibrado
medium / medium.en769 M~5 GB~2×Prioridad a la calidad
large1,55 B~10 GBCalidad multilingüe
turbo809 M~6 GB~8×Transcripción rápida, no traducción

*Cifras del README de OpenAI para inglés en una A100 respecto a large, verificadas el 2026-08-20. Idioma, audio, hardware y runtime cambian el resultado; no son una promesa universal de latencia.

tiny, base, small y medium existen en versión multilingüe y .en. OpenAI indica que la ventaja inglesa es más visible en tiny y base y se reduce en small y medium. Prueba turbo para transcripción rápida en GPU, small como base multilingüe económica y una variante .en si todo el corpus es inglés. Para traducir voz al inglés utiliza medium o large: turbo devuelve el idioma original incluso si se solicita translate.

«98 idiomas» significa cobertura, no precisión uniforme. La model card oficial señala diferencias por volumen de entrenamiento, idioma, acento y dialecto. Si un trabajo es monolingüe y conocido, fijar el idioma puede eliminar una fuente de error. Para grabaciones con cambio de idioma hay que construir casos específicos, no confiar en una sola etiqueta detectada.

Comparación oficial de errores por idioma de Whisper large-v3 y large-v2
El gráfico WER/CER oficial en Common Voice 15 y FLEURS muestra una dispersión real entre idiomas, pero no mide tu corpus privado.

Instalación local y primera ejecución reproducible

La ruta upstream requiere el paquete openai-whisper, FFmpeg disponible en el sistema, un checkpoint y la CLI o API Python. Los metadatos actuales exigen Python 3.8 o posterior y clasifican hasta 3.13, aunque el texto del README es más conservador. En producción fija commit/versión, modelo y dependencias; seguir main sin registro impide reproducir cambios de calidad.

python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
  --output_dir transcripts

La CLI genera TXT, VTT, SRT, TSV y JSON. transcribe() recorre el audio con una ventana deslizante de 30 segundos y devuelve texto, segmentos e idioma detectado. Separa el tiempo de descarga del modelo de la inferencia caliente. Es posible usar CPU, pero los checkpoints grandes pueden ser lentos; la tabla de VRAM es orientativa, no una garantía de capacidad.

Flujo práctico para lotes y subtítulos

  1. Define el entregable.Notas buscables, subtítulos preliminares, una transcripción publicada y evidencia de alto impacto exigen niveles distintos de revisión.
  2. Crea un conjunto privado.Incluye voz limpia, ruido, silencio, música, acentos, cambios de idioma, nombres, cifras y la duración máxima con referencias humanas.
  3. Separa el audio del ASR.Conserva el original y decodifica de forma estable. Incorpora VAD o limpieza solo tras medir palabras recortadas y alucinaciones.
  4. Compara con control.Mantén hardware, runtime, idioma y decodificación; registra dos o tres tamaños, revisión del modelo y factor de tiempo real.
  5. Clasifica los fallos.Puntúa nombres, cifras, negaciones, texto sobre silencio, repeticiones, cambios de idioma y deriva temporal aparte del WER medio.
  6. Prepara la entrega.Exporta SRT/VTT o JSON; aplica longitud, velocidad de lectura, puntuación y etiquetas de hablante en una fase separada.
  7. Revisa cuando haya consecuencias.Medicina, derecho, empleo, citas de investigación y accesibilidad requieren escuchar la fuente.
audio + consentimiento
       ↓
decodificación estable / VAD opcional ── conservar original
       ↓
modelo + idioma + ajustes registrados
       ↓
silencio · repetición · nombres · cifras · deriva temporal
       ↓
revisión humana ── exportación ── retención/borrado

Exactitud, alucinación y evaluación defendible

El artículo de Whisper mostró una sólida generalización zero-shot con 680.000 horas de audio multilingüe y multitarea débilmente supervisado. Esa estrategia también explica límites. La model card oficial advierte de texto no pronunciado, repeticiones y diferencias entre idiomas, acentos y dialectos. Silencio, música, ruido y habla incierta merecen pruebas explícitas porque el decoder puede producir una continuación lingüísticamente plausible sin apoyo acústico suficiente.

MétricaUsoQué oculta
WER/CERComparar con referencia humana; CER si segmentar palabras no es apropiadoGravedad de un nombre, negación o número incorrecto
Entidades y cifrasMedir personas, productos, fechas, dosis, precios y unidadesFluidez general
Segmentos alucinadosEtiquetar texto sobre no-habla o audio sin evidenciaSustituciones dentro de habla real
Deriva temporalComprobar límites al inicio, medio y finalExactitud de palabras
Factor tiempo realsegundos de proceso / segundos de audioDescarga, cola y revisión
Minutos de revisión/horaRegistrar corrección humana por hora de audioCoste de infraestructura

No publicamos un único «WER de Whisper» porque sin checkpoint, idioma, dataset, preprocesamiento y decodificación sería engañoso. Para benchmarks publicados consulta el gráfico oficial y los apéndices del paper. Para adoptar, usa un corpus privado versionado y criterios que reflejen el daño de los errores reales.

Los prompts pueden favorecer la ortografía de términos y nombres, pero no garantizan el resultado y pueden aparecer repetidos. El fallback de temperatura, contexto previo, umbrales, tiempos por palabra y controles de silencio solo deben cambiarse contra el mismo test; de otro modo se intercambian tipos de error a ciegas.

Privacidad, seguridad y límites operativos

LímiteControl práctico
Proceso localControlar descarga y egress, cifrar originales/resultados y definir borrado
ConsentimientoConfirmar permiso para grabar y transcribir; la model card advierte sobre personas sin consentimiento
Decisiones críticasNo basarse solo en texto sin verificar para medicina, derecho o empleo
DiarizaciónEvaluarla como modelo separado; Whisper no demuestra quién habló
Tiempo realUpstream no es un servicio streaming listo; buffer y latencia son del wrapper
MantenimientoFijar paquete/modelo, revisar dependencias y ejecutar regresión antes de actualizar
LicenciaConservar aviso MIT y revisar por separado audio, texto y componentes externos

Whisper frente a opciones cercanas

OpciónElígela cuandoContrapartida
openai-whisperQuieres la referencia Python upstream y ejecución local inspeccionableTú construyes rendimiento, lotes y operaciones
faster-whisperImportan CTranslate2, GPU/CPU, cuantización y batchImplementación distinta; exige regresión contra upstream
whisper.cppNecesitas C/C++, CPU, Apple Silicon, móvil/edge u offlineMás superficie de compilación y conversión
WhisperXBuscas lotes largos, alineación de palabras y diarización opcionalMás modelos, dependencias y licencias
API de OpenAIPrefieres inferencia gestionada y modelos actualesDatos externos, coste por uso y límites API

La guía actual de OpenAI recomienda gpt-transcribe para archivos ordinarios y reserva usos de whisper-1 para tiempos, subtítulos o traducción al inglés. El 2026-08-20, la tabla oficial estimaba $0,0045/min para gpt-transcribe, $0,006 para gpt-4o-transcribe y $0,003 para mini. Modelos y precios cambian: revísalos antes de presupuestar. La guía indica un límite de 25 MB por archivo.

Preguntas frecuentes

¿Whisper es gratis?

El código upstream y los modelos publicados usan MIT; no hay tarifa por minuto al autoalojarlos. Sí existen costes de cómputo, almacenamiento, ingeniería y revisión. La API alojada es un servicio de pago separado.

¿Funciona totalmente offline?

Con dependencias y modelo ya locales, la inferencia puede ejecutarse sin subir audio. Para afirmar air-gap revisa también la aplicación, la telemetría, los logs y el almacenamiento.

¿Qué modelo debo elegir?

Empieza con turbo para GPU rápida, small como equilibrio y .en para audio solo inglés. Compara al menos dos tamaños con tus grabaciones y no uses turbo para traducir voz al inglés.

¿Identifica hablantes?

No de forma nativa. WhisperX y otros flujos agregan modelos de alineación y diarización que requieren evaluación, permisos y operación independientes.

¿Puede transcribir en tiempo real?

El paquete upstream no es un servicio streaming terminado. Los runtimes externos pueden procesar chunks, pero VAD, buffer, contexto y latencia pertenecen a esa implementación.

¿Por qué inventa o repite frases?

La model card reconoce ambos fallos. Incluye silencio y música en las pruebas, no confundas fluidez con fidelidad y escucha el audio en fragmentos importantes.

Fuentes revisadas

Revisión técnica independiente: 2026-08-20. Modelos, documentación, API y precios pueden cambiar. Comprueba las fuentes primarias y tu evaluación privada antes de desplegar.

Revisar Whisper en su fuente oficial

Abre el repositorio, la documentación o los recursos del modelo.

Abrir fuente oficial

Quick Info

Enlace del proyecto
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/5/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper.cpp

Whisper.cpp

Whisper.cpp es una implementación C/C++ sin dependencias de OpenAI Whisper para transcripción, traducción, transmisión, servidores y aplicaciones integradas locales. Esta guía cubre modelos, cuantificación, backends, precisión, privacidad e implementación.

speech-recognitionfree
1280
Buzz

Buzz

Buzz es una aplicación de escritorio gratuita con licencia del MIT para transcripción local de Whisper, subtítulos, subtítulos en vivo, traducción y etiquetado de oradores en macOS, Windows y Linux. Esta guía compara backends, hardware, privacidad, pruebas de precisión, control de calidad de subtítulos, automatización CLI y alternativas en la nube.

BuzzBuzz Captionstranscripción offline
1590
WhisperDesktop

WhisperDesktop

WhisperDesktop es una aplicación de escritorio de Windows y una implementación de DirectCompute para ejecutar OpenAI Whisper localmente en entradas de audio, video y micrófono. Esta guía cubre la configuración, los modelos, las GPU, los subtítulos, la privacidad y las alternativas.

WhisperDesktopOpenAI Whisperspeech recognition
2070
WhisperX

WhisperX

WhisperX es una canalización abierta para audio largo que añade a faster-whisper transcripción por lotes, alineación forzada por idioma y diarización opcional con pyannote.

WhisperXspeech alignmentspeaker diarization
1030