Whisper es la familia de modelos de voz encoder-decoder de OpenAI y también su implementación de referencia en Python con licencia MIT. Puede transcribir en el idioma hablado, detectar el idioma y, con un checkpoint multilingüe compatible, traducir voz al inglés. El repositorio no es un servicio de transcripción listo para contratar: instalación, cómputo, archivos, seguridad, colas, observabilidad y revisión editorial siguen siendo responsabilidad del operador.
Conviene separar tres productos que suelen confundirse. openai-whisper es el paquete Python que ejecuta modelos descargables; whisper-1 es un modelo operado por separado dentro de la Audio API de OpenAI; faster-whisper, whisper.cpp, WhisperX y las interfaces web son implementaciones o flujos independientes basados en pesos Whisper. Toda afirmación de velocidad, coste o privacidad debe indicar a qué capa se refiere.

La decisión en una frase
Elige Whisper si necesitas una referencia upstream inspeccionable, control local y compatibilidad con un ecosistema amplio, y puedes asumir cómputo y control de calidad. Compara una API gestionada si importa más reducir operaciones; compara runtimes especializados si el cuello de botella es CPU/edge, rendimiento por lote, alineación de palabras o diarización.
Su ventaja duradera no es una promesa de liderar todos los benchmarks modernos. Es la opcionalidad de despliegue: una misma familia puede vivir en un notebook, una estación offline, un worker GPU o un runtime de borde. Eso convierte a Whisper en una buena línea base común, pero el rendimiento de un wrapper sobre un equipo concreto no debe atribuirse automáticamente al proyecto upstream.
Qué incluye y qué falta
| Capa | Incluye | Debes aportar |
|---|---|---|
| Checkpoints | Pesos multilingües y solo inglés en varios tamaños | Almacenamiento, runtime y hardware |
| Paquete Python | CLI, API, decodificación y TXT/SRT/VTT/JSON | FFmpeg, despliegue, colas, reintentos y monitorización |
| Transcripción | Texto original, tiempos por segmento y opcionalmente por palabra | Corrección, diarización y validación sectorial |
| Traducción de voz | Modelos compatibles traducen al inglés | Otros destinos; turbo no está entrenado para traducir |
| Licencia MIT | Uso, modificación y distribución bajo sus condiciones | Derechos del audio, consentimiento, avisos y cumplimiento |
Whisper no es por sí solo un sistema de diarización, un editor de reuniones, un gestor de consentimiento ni un producto de cumplimiento. Tampoco entrega un servicio de streaming de producción. Las funciones que añada un tercero deben describirse como parte de ese tercero, no como capacidades nativas del upstream.
Elegir modelo y despliegue
| Modelo | Parámetros | VRAM aprox. | Velocidad relativa* | Buen punto de partida |
|---|---|---|---|---|
| tiny / tiny.en | 39 M | ~1 GB | ~10× | Prototipos |
| base / base.en | 74 M | ~1 GB | ~7× | Borradores locales rápidos |
| small / small.en | 244 M | ~2 GB | ~4× | Punto de partida equilibrado |
| medium / medium.en | 769 M | ~5 GB | ~2× | Prioridad a la calidad |
| large | 1,55 B | ~10 GB | 1× | Calidad multilingüe |
| turbo | 809 M | ~6 GB | ~8× | Transcripción rápida, no traducción |
*Cifras del README de OpenAI para inglés en una A100 respecto a large, verificadas el 2026-08-20. Idioma, audio, hardware y runtime cambian el resultado; no son una promesa universal de latencia.
tiny, base, small y medium existen en versión multilingüe y .en. OpenAI indica que la ventaja inglesa es más visible en tiny y base y se reduce en small y medium. Prueba turbo para transcripción rápida en GPU, small como base multilingüe económica y una variante .en si todo el corpus es inglés. Para traducir voz al inglés utiliza medium o large: turbo devuelve el idioma original incluso si se solicita translate.
«98 idiomas» significa cobertura, no precisión uniforme. La model card oficial señala diferencias por volumen de entrenamiento, idioma, acento y dialecto. Si un trabajo es monolingüe y conocido, fijar el idioma puede eliminar una fuente de error. Para grabaciones con cambio de idioma hay que construir casos específicos, no confiar en una sola etiqueta detectada.
Instalación local y primera ejecución reproducible
La ruta upstream requiere el paquete openai-whisper, FFmpeg disponible en el sistema, un checkpoint y la CLI o API Python. Los metadatos actuales exigen Python 3.8 o posterior y clasifican hasta 3.13, aunque el texto del README es más conservador. En producción fija commit/versión, modelo y dependencias; seguir main sin registro impide reproducir cambios de calidad.
python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
--output_dir transcriptsLa CLI genera TXT, VTT, SRT, TSV y JSON. transcribe() recorre el audio con una ventana deslizante de 30 segundos y devuelve texto, segmentos e idioma detectado. Separa el tiempo de descarga del modelo de la inferencia caliente. Es posible usar CPU, pero los checkpoints grandes pueden ser lentos; la tabla de VRAM es orientativa, no una garantía de capacidad.
Flujo práctico para lotes y subtítulos
- Define el entregable.Notas buscables, subtítulos preliminares, una transcripción publicada y evidencia de alto impacto exigen niveles distintos de revisión.
- Crea un conjunto privado.Incluye voz limpia, ruido, silencio, música, acentos, cambios de idioma, nombres, cifras y la duración máxima con referencias humanas.
- Separa el audio del ASR.Conserva el original y decodifica de forma estable. Incorpora VAD o limpieza solo tras medir palabras recortadas y alucinaciones.
- Compara con control.Mantén hardware, runtime, idioma y decodificación; registra dos o tres tamaños, revisión del modelo y factor de tiempo real.
- Clasifica los fallos.Puntúa nombres, cifras, negaciones, texto sobre silencio, repeticiones, cambios de idioma y deriva temporal aparte del WER medio.
- Prepara la entrega.Exporta SRT/VTT o JSON; aplica longitud, velocidad de lectura, puntuación y etiquetas de hablante en una fase separada.
- Revisa cuando haya consecuencias.Medicina, derecho, empleo, citas de investigación y accesibilidad requieren escuchar la fuente.
audio + consentimiento
↓
decodificación estable / VAD opcional ── conservar original
↓
modelo + idioma + ajustes registrados
↓
silencio · repetición · nombres · cifras · deriva temporal
↓
revisión humana ── exportación ── retención/borrado
Exactitud, alucinación y evaluación defendible
El artículo de Whisper mostró una sólida generalización zero-shot con 680.000 horas de audio multilingüe y multitarea débilmente supervisado. Esa estrategia también explica límites. La model card oficial advierte de texto no pronunciado, repeticiones y diferencias entre idiomas, acentos y dialectos. Silencio, música, ruido y habla incierta merecen pruebas explícitas porque el decoder puede producir una continuación lingüísticamente plausible sin apoyo acústico suficiente.
| Métrica | Uso | Qué oculta |
|---|---|---|
| WER/CER | Comparar con referencia humana; CER si segmentar palabras no es apropiado | Gravedad de un nombre, negación o número incorrecto |
| Entidades y cifras | Medir personas, productos, fechas, dosis, precios y unidades | Fluidez general |
| Segmentos alucinados | Etiquetar texto sobre no-habla o audio sin evidencia | Sustituciones dentro de habla real |
| Deriva temporal | Comprobar límites al inicio, medio y final | Exactitud de palabras |
| Factor tiempo real | segundos de proceso / segundos de audio | Descarga, cola y revisión |
| Minutos de revisión/hora | Registrar corrección humana por hora de audio | Coste de infraestructura |
No publicamos un único «WER de Whisper» porque sin checkpoint, idioma, dataset, preprocesamiento y decodificación sería engañoso. Para benchmarks publicados consulta el gráfico oficial y los apéndices del paper. Para adoptar, usa un corpus privado versionado y criterios que reflejen el daño de los errores reales.
Los prompts pueden favorecer la ortografía de términos y nombres, pero no garantizan el resultado y pueden aparecer repetidos. El fallback de temperatura, contexto previo, umbrales, tiempos por palabra y controles de silencio solo deben cambiarse contra el mismo test; de otro modo se intercambian tipos de error a ciegas.
Privacidad, seguridad y límites operativos
| Límite | Control práctico |
|---|---|
| Proceso local | Controlar descarga y egress, cifrar originales/resultados y definir borrado |
| Consentimiento | Confirmar permiso para grabar y transcribir; la model card advierte sobre personas sin consentimiento |
| Decisiones críticas | No basarse solo en texto sin verificar para medicina, derecho o empleo |
| Diarización | Evaluarla como modelo separado; Whisper no demuestra quién habló |
| Tiempo real | Upstream no es un servicio streaming listo; buffer y latencia son del wrapper |
| Mantenimiento | Fijar paquete/modelo, revisar dependencias y ejecutar regresión antes de actualizar |
| Licencia | Conservar aviso MIT y revisar por separado audio, texto y componentes externos |
Whisper frente a opciones cercanas
| Opción | Elígela cuando | Contrapartida |
|---|---|---|
| openai-whisper | Quieres la referencia Python upstream y ejecución local inspeccionable | Tú construyes rendimiento, lotes y operaciones |
| faster-whisper | Importan CTranslate2, GPU/CPU, cuantización y batch | Implementación distinta; exige regresión contra upstream |
| whisper.cpp | Necesitas C/C++, CPU, Apple Silicon, móvil/edge u offline | Más superficie de compilación y conversión |
| WhisperX | Buscas lotes largos, alineación de palabras y diarización opcional | Más modelos, dependencias y licencias |
| API de OpenAI | Prefieres inferencia gestionada y modelos actuales | Datos externos, coste por uso y límites API |
La guía actual de OpenAI recomienda gpt-transcribe para archivos ordinarios y reserva usos de whisper-1 para tiempos, subtítulos o traducción al inglés. El 2026-08-20, la tabla oficial estimaba $0,0045/min para gpt-transcribe, $0,006 para gpt-4o-transcribe y $0,003 para mini. Modelos y precios cambian: revísalos antes de presupuestar. La guía indica un límite de 25 MB por archivo.
Preguntas frecuentes
¿Whisper es gratis?
El código upstream y los modelos publicados usan MIT; no hay tarifa por minuto al autoalojarlos. Sí existen costes de cómputo, almacenamiento, ingeniería y revisión. La API alojada es un servicio de pago separado.
¿Funciona totalmente offline?
Con dependencias y modelo ya locales, la inferencia puede ejecutarse sin subir audio. Para afirmar air-gap revisa también la aplicación, la telemetría, los logs y el almacenamiento.
¿Qué modelo debo elegir?
Empieza con turbo para GPU rápida, small como equilibrio y .en para audio solo inglés. Compara al menos dos tamaños con tus grabaciones y no uses turbo para traducir voz al inglés.
¿Identifica hablantes?
No de forma nativa. WhisperX y otros flujos agregan modelos de alineación y diarización que requieren evaluación, permisos y operación independientes.
¿Puede transcribir en tiempo real?
El paquete upstream no es un servicio streaming terminado. Los runtimes externos pueden procesar chunks, pero VAD, buffer, contexto y latencia pertenecen a esa implementación.
¿Por qué inventa o repite frases?
La model card reconoce ambos fallos. Incluye silencio y música en las pruebas, no confundas fluidez con fidelidad y escucha el audio en fragmentos importantes.
Fuentes revisadas
- Repositorio oficial de Whisper
- README oficial
- Model card oficial
- Licencia MIT
- Artículo de Whisper
- Guía Audio API de OpenAI
- Precios API de OpenAI
- faster-whisper
- whisper.cpp
- WhisperX
Revisión técnica independiente: 2026-08-20. Modelos, documentación, API y precios pueden cambiar. Comprueba las fuentes primarias y tu evaluación privada antes de desplegar.


