Buzz es una aplicación de escritorio gratuita y de código abierto para convertir audio y vídeo en transcripciones, subtítulos y subtítulos en vivo. Incluye varios backends de reconocimiento de voz (Whisper, Whisper.cpp, Faster Whisper, modelos Hugging Face compatibles y API alojados compatibles con OpenAI) en un flujo de trabajo gráfico para macOS, Windows y Linux. El repositorio tiene licencia del MIT.
Buzz es más valioso cuando un usuario desea procesamiento local y exportaciones editables sin ensamblar Python, FFmpeg ni herramientas de modelo. “Sin conexión” es una opción de configuración, no una propiedad absoluta del producto: los servidores locales pueden mantener los medios en la computadora, mientras que la transcripción API, la traducción de IA, las importaciones de URL, las descargas de modelos y las funciones opcionales de carga en vivo crean tráfico de red. Verifique el flujo de trabajo elegido en lugar de confiar en la etiqueta.


Elija la ruta de ejecución antes de elegir un modelo
| backend | Mejor ajuste | Fuerza | compensación primaria |
|---|---|---|---|
| susurro | Línea de base local general | Ecosistema de referencia y amplio soporte lingüístico | Puede consumir muchos recursos |
| Whisper.cpp | Dispositivos compatibles con CPU, Apple Silicon o Vulkan | Tiempo de ejecución nativo portátil y modelos cuantificados | El comportamiento de construcción/aceleración varía según la plataforma |
| Faster Whisper | GPU NVIDIA o trabajo por lotes local optimizado | Implementación y cuantificación eficientes de CTranslate2 | Los controladores, la VRAM y la compatibilidad de paquetes son importantes |
| Hugging Face | Lenguajes especializados o modelos afinados | Amplio catálogo de modelos; Buzz documentos de soporte MMS | La calidad y la licencia difieren según el modelo. |
| OpenAI compatible con API | Hardware local débil o servicio centralizado | Sin configuración de inferencia local y respuesta potencialmente más rápida | Cargar privacidad, costo de uso y dependencia del proveedor |
Compare dos o tres opciones realistas en los mismos clips. El tamaño del modelo por sí solo no predice el mejor resultado de producción. Un modelo más pequeño puede ganar cuando el audio limpio, el lenguaje conocido y la revisión humana rápida son importantes; un modelo más grande puede perder si funciona tan lentamente que los usuarios se saltan los controles de calidad.
El proceso de transcripción, trazado por la evidencia
audio/vídeo
|
+--> separación de voz opcional
|
v
decodificar + remuestrear --> modelo/backend --> segmentos cronometrados
|
.-----------------------+----------------------.
vvv
revisión de texto etiquetas de orador traducción
| | |
'-----------------------+----------------------'
v
TXT/SRT/VTT/CSV
"Exportación completada" no es lo mismo que "títulos listos para publicar"
Cada etapa puede introducir un error diferente. La separación del habla puede eliminar las palabras tranquilas; la detección de idioma puede seleccionar el idioma incorrecto a partir de una breve introducción; el modelo puede alucinar durante el silencio; la diarización puede intercambiar hablantes; la traducción puede cambiar el significado; y la segmentación de subtítulos puede ser precisa en palabras pero difícil de leer.
Construya un conjunto de precisión representativo
No evalúes con un monólogo limpio. Cree entre 20 y 40 clips breves y consentidos que cubran las condiciones importantes: diferentes oradores, acentos, micrófonos, eco de la sala, música, superposición, términos de dominio, números y cambio de código. Produzca una transcripción de referencia humana y manténgala separada de la salida del modelo.
| rebanada de prueba | que medir | Fallo común |
|---|---|---|
| Limpiar un solo altavoz | Línea base de puntuación y error de palabras | Nombres, siglas y términos raros. |
| entrevista ruidosa | Tasa de eliminación y texto falso en silencio | Música interpretada como discurso. |
| Altavoces superpuestos | Atribución de oradores y contenido perdido | Giros fusionados o intercambiados |
| Números/fechas | Precisión semántica, no similitud ortográfica | Cantidad, unidad o hora de cita incorrectas |
| Multilingüe/cambio de código | Selección de idioma y términos no traducidos | Sustitución fonética |
| Grabación larga | Deriva, uso de memoria y rendimiento | Desviación de la marca de tiempo o desaceleración tardía |
La tasa de error de palabras es útil pero insuficiente. Realice un seguimiento de la precisión de los términos críticos, el error de marca de tiempo, la atribución del hablante, las alucinaciones por hora y los minutos de corrección humana. Para los subtítulos de accesibilidad, la legibilidad y la sincronización pueden ser más importantes que una pequeña mejora WER.
Selección de idioma e indicaciones
La documentación de grabación en vivo recomienda seleccionar el idioma cuando lo conozca porque la detección a menudo se basa en el comienzo del audio. Una introducción musical, un saludo en otro idioma o un clip corto pueden inducir a error. Utilice la indicación inicial para nombres, vocabulario técnico y ortografía esperada, no para agregar contenido que la grabación no contiene.
Mantenga un glosario del proyecto y pruebe si cada backend utiliza indicaciones de manera consistente. Verifique los números con el audio. Para trabajos legales, médicos, académicos o periodísticos, conserve la grabación y marque los pasajes inciertos con marcas de tiempo en lugar de adivinar en silencio.
La traducción es un problema de calidad aparte.
La tarea de traducción estándar de Whisper convierte el habla admitida al inglés; La documentación de Buzz señala que Large-v3-turbo no es compatible con esa ruta de traducción estándar. Buzz también admite la traducción a través de un punto final de modelo de lenguaje compatible con OpenAI, incluido un punto final alojado localmente. Esa segunda ruta envía texto reconocido (no necesariamente audio original) al servicio configurado, pero aún necesita una revisión de privacidad y calidad.
| Flujo de trabajo | Usar cuando | Verificación |
|---|---|---|
| Habla en voz baja al inglés | Representación rápida en inglés a partir de voz fuente compatible | Comparar nombres, números y términos culturales omitidos |
| Transcripción y luego traducción de LLM | El idioma de destino no es el inglés o el control de estilo es importante. | Verifique primero la transcripción fuente y luego la revisión bilingüe. |
| Traductor local compatible con OpenAI | Los medios/texto deben permanecer en el hardware controlado. | Confirmar punto final, registros, licencia de modelo y aislamiento de red |
| Traductor profesional | Publicación, significado legal o de alto riesgo | El ser humano firma con audio y contexto |
No permita que un modelo de lenguaje agregue notas, resúmenes o contexto inventado a las líneas de subtítulos. Los documentos oficiales recomiendan instrucciones de traducción explícitas; también valide el recuento de líneas, la asociación de tiempos, las entidades nombradas y la coherencia entre términos repetidos.
Identificación del hablante y separación del habla.
Buzz puede identificar hablantes en transcripciones completas y puede extraer/separar el habla antes del reconocimiento. Estas características son ayudas, no verificación de identidad. La etiqueta emite "Altavoz 1" hasta que un humano asigna la voz a una persona. Nunca infieras identidad, rol, género o intención únicamente a partir de la diarioización.
Compare la separación activada y desactivada. Puede mejorar las grabaciones con música de fondo, pero el procesamiento agresivo puede dañar la respiración, el habla tranquila o la superposición. Almacene la fuente intacta, la pista procesada y la configuración. Si la evidencia o la integridad del archivo son importantes, haga un hash del original y realice ediciones en las copias.
Control de calidad de subtítulos: las palabras son solo la mitad del trabajo
| comprobar | Regla practica | Razón |
|---|---|---|
| Sincronización | El título aparece con voz y deja suficiente tiempo de lectura. | Los subtítulos tardíos reducen la comprensión |
| Saltos de línea | Divida frases naturales, no entre palabras estrechamente vinculadas. | Mejora el escaneo |
| Velocidad de lectura | Utilice el estándar de accesibilidad de plataforma/audiencia | Los subtítulos densos no se pueden leer |
| Señales de sonido | Agregue audio significativo que no sea voz cuando sea necesario | La accesibilidad incluye más que diálogo |
| Cambios de orador | Haga un cambio inequívoco y sin desorden | Importante en entrevistas y paneles. |
| Nombres/números | Verificar manualmente contra el contexto autorizado | Pequeños errores de transcripción pueden cambiar el significado |
Buzz exporta TXT, SRT y VTT, y el proyecto también describe las exportaciones CSV en materiales de productos actuales. Pruebe el formato exacto con el editor o plataforma de destino. Conserve los caracteres UTF-8 e inspeccione las secciones primera, intermedia y final para detectar desviaciones.
La transcripción en vivo tiene un presupuesto de latencia más estricto
Los documentos oficiales advierten que la transcripción del micrófono local consume muchos recursos y puede no realizarse en tiempo real. Mida la latencia de captura a visualización, el audio perdido, la estabilidad de la corrección y la limitación térmica durante toda la duración del evento. Utilice un micrófono con cable y desactive el modo suspensión. Tenga un subtítulo humano o una pantalla alternativa para eventos importantes de accesibilidad.
Buzz ofrece una ventana de presentación y una exportación opcional de transcripción en vivo, que puede alimentar software como OBS. Las preferencias también documentan una URL de carga que puede PUBLICAR la transcripción o el texto traducido a un servidor. Habilitar eso convierte un flujo de trabajo local en una divulgación de red; autenticar el receptor, cifrar el transporte y evitar exponer el punto final públicamente.
Verificación de privacidad y procesamiento local
- Descargue modelos antes de ingresar a un entorno aislado y luego supervise las conexiones salientes durante una prueba.
- Seleccione un backend local y deje las claves API vacías cuando el procesamiento en la nube esté prohibido.
- Deshabilite la carga en vivo y la traducción externa a menos que se apruebe explícitamente.
- Verifique archivos temporales, exporte carpetas, listas de archivos recientes, registros de fallos y copias de seguridad del sistema operativo.
- Cifrar el dispositivo y el almacenamiento de grabaciones; eliminar copias de trabajo de acuerdo con la política de retención.
- Obtener el consentimiento de grabación y transcripción apropiado para la jurisdicción y el entorno.
El código fuente abierto mejora la inspeccionabilidad pero no demuestra que un binario sea seguro. Descargue a través de canales de lanzamiento oficiales, verifique firmas o sumas de verificación cuando se proporcionen, mantenga las dependencias actualizadas y analice los artefactos de instalación según la política de la organización.
Decisiones de hardware y rendimiento
Medir el factor de tiempo real: segundos de procesamiento divididos por segundos de audio. Un valor de 0,5 significa que una hora de audio dura aproximadamente 30 minutos; 2.0 significa aproximadamente dos horas. Modelo de registro, backend, cuantificación, dispositivo, aceleración, formato de archivo, tamaño de lote y memoria máxima. La batería del portátil, el calor y la edición simultánea pueden cambiar sustancialmente los resultados.
La cuantificación reduce la memoria y puede mejorar la velocidad, a veces con un compromiso de precisión. La compatibilidad con Vulkan puede acelerar Whisper.cpp en una gama más amplia de GPU, mientras que las rutas CUDA y Apple Silicon tienen sus propias condiciones de compatibilidad. Un punto de referencia limpio en la máquina real es más confiable que las afirmaciones genéricas de hardware.
CLI y automatización por lotes
La CLI Buzz puede agregar archivos o URL, elegir transcribir o traducir, seleccionar backend/modelo/idioma, proporcionar un mensaje inicial y exportar SRT, VTT o TXT. Puede ocultar la GUI, lo que la hace útil para una carpeta vigilada o un canal de medios. La automatización aún necesita nombres de archivos a prueba de colisiones, verificaciones de códigos de salida, registros y cuarentena en caso de fallas.
buzz add --task transcribe --language es --model-type Whispercpp --model-size pequeño --prompt "Nombres: Ada Lovelace, Babbage" --srt --vtt entrevista.mp4
Confirme las opciones de CLI con la versión instalada. Fijar la versión en producción y ejecutar un dispositivo conocido después de las actualizaciones; la segmentación de subtítulos o los cambios de backend pueden alterar las diferencias posteriores incluso cuando el comando se ejecuta correctamente.
Alternativas
| Opción | Mejor ajuste | Compensación versus Buzz |
|---|---|---|
| Buzz | GUI local multiplataforma más múltiples backends de Whisper | Aún se requieren recursos de escritorio y control de calidad manual |
| Whisper.cpp CLI | Automatización integrada o local eficiente | Flujo de trabajo de edición menos integrado |
| Faster Whisper secuencias de comandos | Canalizaciones por lotes de GPU personalizadas | Más ingeniería y gestión de dependencias |
| OpenAI voz a texto API | Escala administrada y computación local mínima | Carga, precios y términos del proveedor |
| Descript / Herramientas de texto de estreno | Transcripción dentro de una suite de edición | Ecosistema comercial y menor control local |
| Transcripción/subtítulos humanos | Accesibilidad o publicación de alto riesgo | Mayor costo directo pero revisión contextual responsable |
Preguntas frecuentes
¿Es Buzz gratuito?
El repositorio oficial tiene licencia del MIT y el software de escritorio se puede utilizar sin suscripción. Los APIs alojados, el hardware y los modelos de terceros pueden generar costos separados.
¿Buzz funciona completamente sin conexión?
Sí, para flujos de trabajo de modelo local configurados después de que los activos necesarios estén disponibles. API transcripción, traducción externa, importación de URL y carga en vivo utilizan la red.
¿Qué sistemas operativos son compatibles?
El proyecto documenta macOS, Windows y Linux, con opciones de aceleración y distribución específicas de cada plataforma.
¿Puede crear subtítulos?
Sí. Exporta formatos cronometrados, incluidos SRT y VTT. La sincronización humana, la legibilidad y la revisión terminológica siguen siendo necesarias.
¿Puede identificar a los hablantes?
Admite la identificación del hablante en medios transcritos, pero las etiquetas requieren verificación humana y no son prueba de identidad biométrica.
¿Se puede traducir a otros idiomas además del inglés?
Buzz documenta traducción adicional a través de servicios de IA configurables compatibles con OpenAI, incluidos puntos finales locales. Valide la privacidad y la calidad de la traducción por separado.
¿Por qué la transcripción es lenta?
El tamaño del modelo, el backend, la cuantificación, la aceleración, la duración del audio y el hardware son importantes. Compare un modelo más pequeño y un backend optimizado antes de comprar hardware.
fuentes primarias
- Licencia y repositorio oficial Buzz
- Documentación oficial de funciones
- Guía de instalación oficial
- Importación de archivos y configuración del modelo
- Guía de grabación en vivo
- Comportamiento de traducción
- Funciones de visualización y edición
- Referencia CLI
- Historial de lanzamiento oficial
Última revisión el 25 de julio de 2026. Pruebe la versión Buzz exacta y el backend en audio representativo; Los paquetes de soporte, aceleración y distribución de modelos cambian con el tiempo.


