Whisper Web
Whisper Web

Whisper Web

Whisper Web es una demo MIT de reconocimiento de voz en el navegador con Transformers.js, transcripción local, marcas de tiempo y exportación TXT/JSON.

121

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Whisper Webvoz a texto en navegadorTransformers.jstranscripción WhisperASR en clientetranscripción localalternativa a whisper.cppalternativa a Whisper-WebUIreconocimiento de voz abierto

Product Preview

A quick visual look at Whisper Web before you visit the official site.

Published 1/21/2026
Whisper Web screenshot

Editorial Review

About Whisper Web

Whisper Web es una aplicación de reconocimiento de voz para navegador de código abierto de Xenova. Ejecuta modelos de la familia Whisper a través de Transformers.js en un Web Worker, acepta audio de una URL, archivo local o micrófono y devuelve texto con marca de tiempo que se puede exportar como TXT o JSON. El proyecto es útil como una demostración compacta del reconocimiento automático de voz del lado del cliente, no como un servicio de transcripción completo y mantenido.

El estado de mantenimiento importa. La rama principal se comprometió por última vez el 10 de junio de 2024 y los pines @xenova/transformadores 2.7.0. Su README apunta a una rama experimental separada WebGPU; la aplicación principal sigue principalmente la ruta anterior Worker/WASM. La documentación actual de Transformers.js pasó a la generación v3 y admite WebGPU de manera más directa, por lo que los desarrolladores deben tratar este repositorio como una implementación de referencia legible en lugar de un marco de inicio actual.

Whisper Web demostración oficial con archivo URL y entradas de audio de micrófono
Espacio oficial Hugging Face capturado el 20 de agosto de 2026. La interfaz comienza con tres rutas de entrada: URL, archivo local y grabación de micrófono.

¿Quién debería usarlo y quién no?

Usuario o trabajoEncajarRazón
Navegador de aprendizaje para desarrolladores frontend o ML ASRfuerteLa ruta React, Worker y Transformers.js es lo suficientemente compacta como para inspeccionarla de un extremo a otro.
Individuo que transcribe una grabación breve y no confidencial.razonableNo se requiere ninguna cuenta ni trabajo en el servidor, pero la descarga del modelo y la memoria del navegador siguen siendo importantes
Equipo que produce subtítulos revisados.LimitadoNo hay editor de transcripciones, exportación SRT/VTT, etiquetado de oradores o revisión colaborativa
Servicio de transcripción por lotes de formato largopobreLa pestaña del navegador posee memoria y ejecución; colas, reintentos, persistencia y observabilidad están ausentes
Audio médico, legal o reguladoSólo prototipoLa inferencia local puede ayudar a la privacidad, pero el control de acceso, la retención, la auditoría y la verificación humana no se implementan

Whisper Web se considera mejor como una superficie educativa y de creación de prototipos. Demuestra cómo la decodificación de audio, la carga de modelos, las devoluciones de llamadas de fragmentos, las marcas de tiempo y la exportación pueden funcionar sin un backend de transcripción. Esto lo hace útil para experimentos privados, demostraciones en conferencias y una primera prueba de viabilidad en el hardware de destino. No es un reemplazo directo de un producto de transcripción compatible: no tiene cuentas de usuario, recuperación de trabajos, administración de modelos, registros de auditoría, controles de retención, interfaz de corrección ni garantías de nivel de servicio.

Para una herramienta interna, decida quién alojará la página y los pesos del modelo, qué navegadores son compatibles y cómo se recuperarán los usuarios de una caída de pestaña o de un desalojo de caché. Para un producto público, agregue consentimiento sobre el uso del micrófono, expectativas de descarga de modelos, informes de errores y una declaración clara de hacia dónde viajan el audio y la telemetría. Estos detalles operativos importan más que si la demostración puede transcribir una muestra limpia.

Qué hace realmente la aplicación

ÁreaImplementaciónConsecuencia práctica
InferenciaTransformers.js canalización de reconocimiento automático de voz en un Web WorkerLa interfaz de usuario sigue respondiendo mientras el navegador realiza inferencias.
Preparación de audioWeb Audio API, remuestreado a 16 kHz y mezclado en monoLa compatibilidad con el códec del navegador determina qué archivos se decodifican correctamente
audio largotrozos de 30 segundos con zancadas de 5 segundos; Distil-Whisper usa 20/3 segundosLa superposición ayuda a la continuidad pero puede introducir frases repetidas o fusionadas.
DecodificaciónDecodificación codiciosa con marcas de tiempo y devoluciones de llamada parcialesSimple e inspeccionable, pero expone pocos controles de decodificación.
ExportarTexto sin formato o fragmentos de marca de tiempo JSONSin SRT/VTT nativo, diario del hablante o editor de transcripciones

El audio elegido de un archivo o micrófono se decodifica y se pasa al modelo dentro del navegador. La aplicación aún descarga pesos de modelos de Hugging Face en el primer uso y una entrada de URL hace que el navegador busque ese audio remoto. Por lo tanto, “inferencia local” significa que el cálculo de voz a texto se realiza en el lado del cliente; no significa que la página no realice ninguna solicitud de red.

Entradas, modelos y tamaños de descarga.

Elección en la interfaz de usuario actualDescarga mostradaMejor ajuste
diminuto como un susurro, cuantificado41 megasDispositivos de primera prueba y de menor memoria más rápidos
base de susurro, cuantificada77 megasUn paso de precisión modesto sin una gran descarga
susurro pequeño, cuantificado249 megasTranscripción local más capaz cuando la memoria lo permite
medio susurro, cuantificado776 megasExperimentos de mayor capacidad en hardware de escritorio más potente
susurro-tiny.en, no cuantificado152 megasAudio en inglés donde la fidelidad importa más que el tamaño de la descarga
susurro-base.en, no cuantificado291 megasFunciona solo en inglés con memoria de navegador adicional disponible
Distil-Whisper opciones402 o 767MBExperimentos solo en inglés con los puntos de control destilados del repositorio

El modo multilingüe revela un selector de idioma largo y permite al usuario elegir la transcripción en el idioma de origen o la traducción al inglés. La interfaz de usuario no muestra la selección automática de idioma, la búsqueda por rayos, el retroceso de temperatura, las sugerencias de vocabulario ni la diarioización. La cuantificación reduce el tamaño del peso y, a menudo, mejora la viabilidad, pero se deben probar la precisión y la estabilidad en el audio deseado.

Whisper Web configuración para la tarea y el idioma multilingüe de cuantificación del modelo
La configuración de la demostración oficial combina opciones de modelo, cuantificación, idioma multilingüe y transcripción versus traducción al inglés.

Prueba práctica: velocidad versus estabilidad de la transcripción

Ejecutamos la muestra oficial en inglés de 60 segundos incluida en un navegador de escritorio basado en Chromium el 20 de agosto de 2026. Esta es una verificación de entorno único, no una prueba comparativa de modelo estandarizada. La caché de red, la CPU, el navegador, el estado térmico y la descarga del modelo pueden cambiar los tiempos.

ConfiguraciónFinalización observadaResultado observado
Multilingüe cuantificado Xenova/whisper-tiny (41MB)unos 27 segundosRápido, pero la segunda mitad produjo una frase repetida notoria y varios errores de segmentación.
Inglés no cuantificado Xenova/whisper-tiny.en (152MB)Aproximadamente 36 segundosSustancialmente más coherente y mejor segmentado, aunque todavía contenía errores de reconocimiento individuales

La conclusión útil no es que un momento se reproduzca en todas partes. Es que la configuración multilingüe cuantificada más pequeña debe tratarse como una configuración de vista previa. Para el material en inglés, un punto de control solo en inglés puede valer la pena para una descarga más grande. Para grabaciones multilingües, ruidosas o de dominio específico, compare al menos clips pequeños, básicos y pequeños en clips representativos antes de elegir un valor predeterminado.

Whisper Web transcripción con marca de tiempo con botones de exportación TXT y JSON
Fragmentos con marca de tiempo de la muestra oficial de 60 segundos. Whisper Web proporciona exportación TXT y JSON después de la transcripción.

Cómo evaluar Whisper Web correctamente

Métricacomo medirPor qué es importante
Tasa de error de palabras o caracteresComparar con una transcripción de referencia verificada por humanosPrecisión general; Utilice la tasa de error de caracteres para idiomas sin espacios entre palabras.
Entidades y números con nombrePuntuación de nombres, productos, fechas, precios y unidades por separadoPequeños errores pueden invalidar notas de reuniones, legales o de investigación
Tasa de alucinacionesIncluir silencio, música, aplausos y segmentos en voz baja.Los modelos Whisper pueden emitir texto plausible donde el habla es débil
Deriva de la marca de tiempoVerifique los límites al principio, a la mitad y al final.Crítico para subtítulos y transcripciones buscables
factor de tiempo realSegundos de procesamiento divididos por segundos de audioSepara la velocidad del modelo del tiempo de espera subjetivo
Arranque en frío versus arranque en calienteRegistre la descarga/carga del modelo por separado de la inferenciaLos usuarios habituales pueden ver una experiencia muy diferente
Memoria y tasa de fallosPruebe los navegadores de destino y los archivos largosUn modelo que falla no es una mejora de precisión utilizable

Conjunto de prueba recomendado

Limpiar un solo altavoz ── nombres + números.
habitación ruidosa ─────────── voces superpuestas
audio del teléfono ────────── compresión + ancho de banda
música/aplausos ─────── silencio alucinación comprobar
grabación larga ─────── uniones de fragmentos + deriva de marca de tiempo
clip multilingüe ──── corrección de idioma/tarea
  1. Cree referencias verificadas por humanos para entre 20 y 30 clips cortos que coincidan con el caso de uso real.
  2. Ejecute tiny, base y small con el mismo navegador, estado cálido/frío y configuración de cuantificación.
  3. Precisión de registro, tiempo de primera ejecución, tiempo de inferencia cálida, síntomas y fallas de memoria máxima.
  4. Revise los nombres propios, los números, las repeticiones y los segmentos mudos por separado de la tasa de error promedio.
  5. Pruebe las exportaciones TXT y JSON y luego decida si la conversión de subtítulos posteriores es aceptable.

Límites del navegador, la privacidad y la implementación

LímiteQué comprobar antes de la adopción
Compatibilidad del navegadorEl archivo README requiere un indicador de Firefox Worker; El controlador de errores de la aplicación advierte sobre Safari en M1/M2 y recomienda Chrome, Firefox o Edge.
Audio de origen cruzadoLa carga remota de URL depende de que el servidor de origen permita las solicitudes del navegador; la URL de una página web normal no es necesariamente una URL de audio utilizable
Almacenamiento en caché de modelosConfirme cuotas de almacenamiento, desalojo de caché y descargas repetidas en dispositivos de navegación privados o administrados
audio sensibleRevise el alojamiento de páginas, la entrega de modelos, la telemetría y las extensiones del navegador, no solo el código de inferencia.
AutohospedajeFijar dependencias, servir activos de modelo intencionalmente, agregar encabezados de seguridad y probar el comportamiento fuera de línea
LicenciasEl código de la aplicación tiene licencia MIT; Los puntos de control del modelo y el audio enviado aún tienen sus propios términos y derechos.

Los conjuntos de repositorios env.allowLocalModels = falso, por lo que su stock espera la entrega remota del modelo en lugar de pesos agrupados. Una implementación privada o fuera de línea necesita cambios de código y alojamiento. Nunca afirmes que simplemente clonar la interfaz de usuario crea un sistema de transcripción aislado.

Whisper Web frente a herramientas similares de código abierto

OpciónElígelo cuandoPrincipal compensación
Whisper Web por XenovaQuiere una pequeña demostración de React/Transformers.js con exportación de URL, archivos, micrófono y marca de tiempoLa rama principal está anticuada, tiene controles limitados y no tiene subtítulos nativos ni flujo de trabajo de registro
whisper.cpp WebAssembly demostraciónQuiere una ruta de navegador basada en C/C++, carga explícita de modelos locales y compatibilidad con archivos/micrófonos.Su ejemplo documentado WASM está orientado a la CPU, limitado a modelos hasta pequeños y limita el audio a 120 segundos.
Whisper-WebUINecesita una interfaz de subtítulos autohospedada más rica, faster-whisper, modelos más grandes y opciones de backend/APIRequiere Python/configuración del servidor y no es puramente una inferencia del navegador del lado del cliente
Aplicación personalizada Transformers.js actualEstá creando un nuevo producto de navegador y desea WebGPU, ONNX y patrones de integración de marco actuales.Usted es propietario de la interfaz de usuario completa, el canal de audio, el ciclo de vida del modelo, el control de calidad y la matriz de compatibilidad.
Nativo whisper.cpp o faster-whisperLos archivos largos, el procesamiento por lotes, la automatización o el rendimiento controlado del escritorio/servidor son importantesLa instalación y la implementación son más pesadas que abrir una página web

Whisper Web sigue siendo valioso porque la fuente es compacta y fácil de inspeccionar. Es un mejor artefacto de aprendizaje que una opción de producción llave en mano. Para una nueva aplicación, cree un prototipo con la demostración en vivo y luego compare una implementación Transformers.js actual con un motor nativo o del lado del servidor utilizando el mismo conjunto de evaluación privado.

Lista de verificación de producción

audio representativo + texto de referencia
              ↓
navegador/modelo/matriz de cuantificación
              ↓
precisión · alucinación · tiempo · memoria
              ↓
navegador local ── o ── motor nativo/servidor
              ↓
retención · consentimiento · exportación · revisión humana
  1. Confirme si el objetivo es una demostración, una herramienta local privada o un producto compatible.
  2. Fije la confirmación del repositorio, la versión Transformers.js y la revisión exacta del modelo.
  3. Compare los idiomas de destino, los acentos, el ruido, el silencio y la duración de los archivos.
  4. Separe el tiempo de descarga en frío de la velocidad de transcripción en caliente.
  5. Agregue progreso claro, cancelación, errores de memoria y manejo de navegador no compatible.
  6. Decida si TXT/JSON es suficiente o agregue SRT/VTT, edición y diario.
  7. Retención de audio de documentos, alojamiento de modelos, consentimiento y eliminación.
  8. Requerir revisión humana cuando los nombres, números o significados legales o médicos sean importantes.

Preguntas frecuentes

¿Whisper Web carga audio para transcripción?

La canalización de inferencia se ejecuta en el navegador Worker. Sin embargo, la página descarga archivos de modelo y la entrada de URL descarga audio remoto en el navegador. Revise el comportamiento de red y alojamiento del sitio implementado antes de describirlo como completamente fuera de línea.

¿Admite la transcripción de micrófono en vivo?

Puede grabar desde el micrófono y transcribir la grabación completa. La interfaz estándar no es un sistema de subtítulos de transmisión continua de baja latencia.

¿Con qué modelo debería empezar?

Utilice tiny cuantificado solo para una verificación rápida de viabilidad. Compare lo pequeño, lo básico y lo pequeño en audio representativo. Los puntos de control solo en inglés pueden ser más estables para el habla inglesa, mientras que se requieren puntos de control multilingües para otros idiomas y la traducción al inglés.

¿Puede exportar subtítulos?

No directamente. La interfaz de usuario actual exporta TXT y tiene la marca de tiempo JSON. SRT o VTT requiere un paso de conversión y una revisión de la marca de tiempo.

¿La versión WebGPU es la predeterminada?

No. El repositorio README vincula WebGPU como una rama experimental. La documentación actual Transformers.js admite WebGPU, pero esta rama principal permanece en la dependencia 2.7 anterior.

¿Se mantiene activamente?

La última confirmación de la rama principal fue el 10 de junio de 2024 cuando se revisó el 20 de agosto de 2026. La demostración aún se ejecuta, pero la brecha de mantenimiento debe incluirse en las decisiones de adopción técnica.

Fuentes revisadas

Revisión independiente y prueba práctica: 20 de agosto de 2026. El estado del repositorio, la compatibilidad con el navegador, los archivos de modelo y la disponibilidad de la demostración pueden cambiar; Verifique los dispositivos de origen y de destino actuales antes de la implementación.

Ready to try Whisper Web?

Visit the official website to get started

Visit Whisper Web

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper es la familia de reconocimiento de voz y referencia Python con licencia MIT de OpenAI para transcripción local multilingüe, subtítulos y traducción de voz al inglés.

Whisperreconocimiento de voztranscripción local
1060
Whisper.cpp

Whisper.cpp

Whisper.cpp es una implementación C/C++ sin dependencias de OpenAI Whisper para transcripción, traducción, transmisión, servidores y aplicaciones integradas locales. Esta guía cubre modelos, cuantificación, backends, precisión, privacidad e implementación.

speech-recognitionfree
1260
Buzz

Buzz

Buzz es una aplicación de escritorio gratuita con licencia del MIT para transcripción local de Whisper, subtítulos, subtítulos en vivo, traducción y etiquetado de oradores en macOS, Windows y Linux. Esta guía compara backends, hardware, privacidad, pruebas de precisión, control de calidad de subtítulos, automatización CLI y alternativas en la nube.

BuzzBuzz Captionstranscripción offline
1580
WhisperDesktop

WhisperDesktop

WhisperDesktop es una aplicación de escritorio de Windows y una implementación de DirectCompute para ejecutar OpenAI Whisper localmente en entradas de audio, video y micrófono. Esta guía cubre la configuración, los modelos, las GPU, los subtítulos, la privacidad y las alternativas.

WhisperDesktopOpenAI Whisperspeech recognition
2050