Buzz
Buzz

Buzz

Buzz es una aplicación de escritorio gratuita con licencia del MIT para transcripción local de Whisper, subtítulos, subtítulos en vivo, traducción y etiquetado de oradores en macOS, Windows y Linux. Esta guía compara backends, hardware, privacidad, pruebas de precisión, control de calidad de subtítulos, automatización CLI y alternativas en la nube.

158

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

BuzzBuzz Captionstranscripción offlineWhisper transcripciónsubtítulos open sourcevoz a textosubtítulos SRTsubtítulos VTT

Product Preview

A quick visual look at Buzz before you visit the official site.

Published 1/21/2026
Buzz screenshot

Editorial Review

About Buzz

Buzz es una aplicación de escritorio gratuita y de código abierto para convertir audio y vídeo en transcripciones, subtítulos y subtítulos en vivo. Incluye varios backends de reconocimiento de voz (Whisper, Whisper.cpp, Faster Whisper, modelos Hugging Face compatibles y API alojados compatibles con OpenAI) en un flujo de trabajo gráfico para macOS, Windows y Linux. El repositorio tiene licencia del MIT.

Buzz es más valioso cuando un usuario desea procesamiento local y exportaciones editables sin ensamblar Python, FFmpeg ni herramientas de modelo. “Sin conexión” es una opción de configuración, no una propiedad absoluta del producto: los servidores locales pueden mantener los medios en la computadora, mientras que la transcripción API, la traducción de IA, las importaciones de URL, las descargas de modelos y las funciones opcionales de carga en vivo crean tráfico de red. Verifique el flujo de trabajo elegido en lugar de confiar en la etiqueta.

Official Buzz offline transcription banner
Buzz empaqueta la transcripción basada en Whisper en una aplicación de escritorio multiplataforma. La elección del modelo, el hardware y la calidad del audio determinan la velocidad y la precisión.
Official Buzz file import and transcription interface
El flujo de trabajo de importación expone la configuración de tareas, idioma, backend y modelo. Guarde estas opciones con el resultado para que las correcciones posteriores sean reproducibles.

Elija la ruta de ejecución antes de elegir un modelo

backendMejor ajusteFuerzacompensación primaria
susurroLínea de base local generalEcosistema de referencia y amplio soporte lingüísticoPuede consumir muchos recursos
Whisper.cppDispositivos compatibles con CPU, Apple Silicon o VulkanTiempo de ejecución nativo portátil y modelos cuantificadosEl comportamiento de construcción/aceleración varía según la plataforma
Faster WhisperGPU NVIDIA o trabajo por lotes local optimizadoImplementación y cuantificación eficientes de CTranslate2Los controladores, la VRAM y la compatibilidad de paquetes son importantes
Hugging FaceLenguajes especializados o modelos afinadosAmplio catálogo de modelos; Buzz documentos de soporte MMSLa calidad y la licencia difieren según el modelo.
OpenAI compatible con APIHardware local débil o servicio centralizadoSin configuración de inferencia local y respuesta potencialmente más rápidaCargar privacidad, costo de uso y dependencia del proveedor

Compare dos o tres opciones realistas en los mismos clips. El tamaño del modelo por sí solo no predice el mejor resultado de producción. Un modelo más pequeño puede ganar cuando el audio limpio, el lenguaje conocido y la revisión humana rápida son importantes; un modelo más grande puede perder si funciona tan lentamente que los usuarios se saltan los controles de calidad.

El proceso de transcripción, trazado por la evidencia

 audio/vídeo
    |
    +--> separación de voz opcional
    |
    v
 decodificar + remuestrear --> modelo/backend --> segmentos cronometrados
                                          |
                  .-----------------------+----------------------.
                  vvv
             revisión de texto etiquetas de orador traducción
                  |                       |                      |
                  '-----------------------+----------------------'
                                          v
                                  TXT/SRT/VTT/CSV

 "Exportación completada" no es lo mismo que "títulos listos para publicar"

Cada etapa puede introducir un error diferente. La separación del habla puede eliminar las palabras tranquilas; la detección de idioma puede seleccionar el idioma incorrecto a partir de una breve introducción; el modelo puede alucinar durante el silencio; la diarización puede intercambiar hablantes; la traducción puede cambiar el significado; y la segmentación de subtítulos puede ser precisa en palabras pero difícil de leer.

Construya un conjunto de precisión representativo

No evalúes con un monólogo limpio. Cree entre 20 y 40 clips breves y consentidos que cubran las condiciones importantes: diferentes oradores, acentos, micrófonos, eco de la sala, música, superposición, términos de dominio, números y cambio de código. Produzca una transcripción de referencia humana y manténgala separada de la salida del modelo.

rebanada de pruebaque medirFallo común
Limpiar un solo altavozLínea base de puntuación y error de palabrasNombres, siglas y términos raros.
entrevista ruidosaTasa de eliminación y texto falso en silencioMúsica interpretada como discurso.
Altavoces superpuestosAtribución de oradores y contenido perdidoGiros fusionados o intercambiados
Números/fechasPrecisión semántica, no similitud ortográficaCantidad, unidad o hora de cita incorrectas
Multilingüe/cambio de códigoSelección de idioma y términos no traducidosSustitución fonética
Grabación largaDeriva, uso de memoria y rendimientoDesviación de la marca de tiempo o desaceleración tardía

La tasa de error de palabras es útil pero insuficiente. Realice un seguimiento de la precisión de los términos críticos, el error de marca de tiempo, la atribución del hablante, las alucinaciones por hora y los minutos de corrección humana. Para los subtítulos de accesibilidad, la legibilidad y la sincronización pueden ser más importantes que una pequeña mejora WER.

Selección de idioma e indicaciones

La documentación de grabación en vivo recomienda seleccionar el idioma cuando lo conozca porque la detección a menudo se basa en el comienzo del audio. Una introducción musical, un saludo en otro idioma o un clip corto pueden inducir a error. Utilice la indicación inicial para nombres, vocabulario técnico y ortografía esperada, no para agregar contenido que la grabación no contiene.

Mantenga un glosario del proyecto y pruebe si cada backend utiliza indicaciones de manera consistente. Verifique los números con el audio. Para trabajos legales, médicos, académicos o periodísticos, conserve la grabación y marque los pasajes inciertos con marcas de tiempo en lugar de adivinar en silencio.

La traducción es un problema de calidad aparte.

La tarea de traducción estándar de Whisper convierte el habla admitida al inglés; La documentación de Buzz señala que Large-v3-turbo no es compatible con esa ruta de traducción estándar. Buzz también admite la traducción a través de un punto final de modelo de lenguaje compatible con OpenAI, incluido un punto final alojado localmente. Esa segunda ruta envía texto reconocido (no necesariamente audio original) al servicio configurado, pero aún necesita una revisión de privacidad y calidad.

Flujo de trabajoUsar cuandoVerificación
Habla en voz baja al inglésRepresentación rápida en inglés a partir de voz fuente compatibleComparar nombres, números y términos culturales omitidos
Transcripción y luego traducción de LLMEl idioma de destino no es el inglés o el control de estilo es importante.Verifique primero la transcripción fuente y luego la revisión bilingüe.
Traductor local compatible con OpenAILos medios/texto deben permanecer en el hardware controlado.Confirmar punto final, registros, licencia de modelo y aislamiento de red
Traductor profesionalPublicación, significado legal o de alto riesgoEl ser humano firma con audio y contexto

No permita que un modelo de lenguaje agregue notas, resúmenes o contexto inventado a las líneas de subtítulos. Los documentos oficiales recomiendan instrucciones de traducción explícitas; también valide el recuento de líneas, la asociación de tiempos, las entidades nombradas y la coherencia entre términos repetidos.

Identificación del hablante y separación del habla.

Buzz puede identificar hablantes en transcripciones completas y puede extraer/separar el habla antes del reconocimiento. Estas características son ayudas, no verificación de identidad. La etiqueta emite "Altavoz 1" hasta que un humano asigna la voz a una persona. Nunca infieras identidad, rol, género o intención únicamente a partir de la diarioización.

Compare la separación activada y desactivada. Puede mejorar las grabaciones con música de fondo, pero el procesamiento agresivo puede dañar la respiración, el habla tranquila o la superposición. Almacene la fuente intacta, la pista procesada y la configuración. Si la evidencia o la integridad del archivo son importantes, haga un hash del original y realice ediciones en las copias.

Control de calidad de subtítulos: las palabras son solo la mitad del trabajo

comprobarRegla practicaRazón
SincronizaciónEl título aparece con voz y deja suficiente tiempo de lectura.Los subtítulos tardíos reducen la comprensión
Saltos de líneaDivida frases naturales, no entre palabras estrechamente vinculadas.Mejora el escaneo
Velocidad de lecturaUtilice el estándar de accesibilidad de plataforma/audienciaLos subtítulos densos no se pueden leer
Señales de sonidoAgregue audio significativo que no sea voz cuando sea necesarioLa accesibilidad incluye más que diálogo
Cambios de oradorHaga un cambio inequívoco y sin desordenImportante en entrevistas y paneles.
Nombres/númerosVerificar manualmente contra el contexto autorizadoPequeños errores de transcripción pueden cambiar el significado

Buzz exporta TXT, SRT y VTT, y el proyecto también describe las exportaciones CSV en materiales de productos actuales. Pruebe el formato exacto con el editor o plataforma de destino. Conserve los caracteres UTF-8 e inspeccione las secciones primera, intermedia y final para detectar desviaciones.

La transcripción en vivo tiene un presupuesto de latencia más estricto

Los documentos oficiales advierten que la transcripción del micrófono local consume muchos recursos y puede no realizarse en tiempo real. Mida la latencia de captura a visualización, el audio perdido, la estabilidad de la corrección y la limitación térmica durante toda la duración del evento. Utilice un micrófono con cable y desactive el modo suspensión. Tenga un subtítulo humano o una pantalla alternativa para eventos importantes de accesibilidad.

Buzz ofrece una ventana de presentación y una exportación opcional de transcripción en vivo, que puede alimentar software como OBS. Las preferencias también documentan una URL de carga que puede PUBLICAR la transcripción o el texto traducido a un servidor. Habilitar eso convierte un flujo de trabajo local en una divulgación de red; autenticar el receptor, cifrar el transporte y evitar exponer el punto final públicamente.

Verificación de privacidad y procesamiento local

  • Descargue modelos antes de ingresar a un entorno aislado y luego supervise las conexiones salientes durante una prueba.
  • Seleccione un backend local y deje las claves API vacías cuando el procesamiento en la nube esté prohibido.
  • Deshabilite la carga en vivo y la traducción externa a menos que se apruebe explícitamente.
  • Verifique archivos temporales, exporte carpetas, listas de archivos recientes, registros de fallos y copias de seguridad del sistema operativo.
  • Cifrar el dispositivo y el almacenamiento de grabaciones; eliminar copias de trabajo de acuerdo con la política de retención.
  • Obtener el consentimiento de grabación y transcripción apropiado para la jurisdicción y el entorno.

El código fuente abierto mejora la inspeccionabilidad pero no demuestra que un binario sea seguro. Descargue a través de canales de lanzamiento oficiales, verifique firmas o sumas de verificación cuando se proporcionen, mantenga las dependencias actualizadas y analice los artefactos de instalación según la política de la organización.

Decisiones de hardware y rendimiento

Medir el factor de tiempo real: segundos de procesamiento divididos por segundos de audio. Un valor de 0,5 significa que una hora de audio dura aproximadamente 30 minutos; 2.0 significa aproximadamente dos horas. Modelo de registro, backend, cuantificación, dispositivo, aceleración, formato de archivo, tamaño de lote y memoria máxima. La batería del portátil, el calor y la edición simultánea pueden cambiar sustancialmente los resultados.

La cuantificación reduce la memoria y puede mejorar la velocidad, a veces con un compromiso de precisión. La compatibilidad con Vulkan puede acelerar Whisper.cpp en una gama más amplia de GPU, mientras que las rutas CUDA y Apple Silicon tienen sus propias condiciones de compatibilidad. Un punto de referencia limpio en la máquina real es más confiable que las afirmaciones genéricas de hardware.

CLI y automatización por lotes

La CLI Buzz puede agregar archivos o URL, elegir transcribir o traducir, seleccionar backend/modelo/idioma, proporcionar un mensaje inicial y exportar SRT, VTT o TXT. Puede ocultar la GUI, lo que la hace útil para una carpeta vigilada o un canal de medios. La automatización aún necesita nombres de archivos a prueba de colisiones, verificaciones de códigos de salida, registros y cuarentena en caso de fallas.

buzz add --task transcribe --language es --model-type Whispercpp --model-size pequeño --prompt "Nombres: Ada Lovelace, Babbage" --srt --vtt entrevista.mp4

Confirme las opciones de CLI con la versión instalada. Fijar la versión en producción y ejecutar un dispositivo conocido después de las actualizaciones; la segmentación de subtítulos o los cambios de backend pueden alterar las diferencias posteriores incluso cuando el comando se ejecuta correctamente.

Alternativas

OpciónMejor ajusteCompensación versus Buzz
BuzzGUI local multiplataforma más múltiples backends de WhisperAún se requieren recursos de escritorio y control de calidad manual
Whisper.cpp CLIAutomatización integrada o local eficienteFlujo de trabajo de edición menos integrado
Faster Whisper secuencias de comandosCanalizaciones por lotes de GPU personalizadasMás ingeniería y gestión de dependencias
OpenAI voz a texto APIEscala administrada y computación local mínimaCarga, precios y términos del proveedor
Descript / Herramientas de texto de estrenoTranscripción dentro de una suite de ediciónEcosistema comercial y menor control local
Transcripción/subtítulos humanosAccesibilidad o publicación de alto riesgoMayor costo directo pero revisión contextual responsable

Preguntas frecuentes

¿Es Buzz gratuito?

El repositorio oficial tiene licencia del MIT y el software de escritorio se puede utilizar sin suscripción. Los APIs alojados, el hardware y los modelos de terceros pueden generar costos separados.

¿Buzz funciona completamente sin conexión?

Sí, para flujos de trabajo de modelo local configurados después de que los activos necesarios estén disponibles. API transcripción, traducción externa, importación de URL y carga en vivo utilizan la red.

¿Qué sistemas operativos son compatibles?

El proyecto documenta macOS, Windows y Linux, con opciones de aceleración y distribución específicas de cada plataforma.

¿Puede crear subtítulos?

Sí. Exporta formatos cronometrados, incluidos SRT y VTT. La sincronización humana, la legibilidad y la revisión terminológica siguen siendo necesarias.

¿Puede identificar a los hablantes?

Admite la identificación del hablante en medios transcritos, pero las etiquetas requieren verificación humana y no son prueba de identidad biométrica.

¿Se puede traducir a otros idiomas además del inglés?

Buzz documenta traducción adicional a través de servicios de IA configurables compatibles con OpenAI, incluidos puntos finales locales. Valide la privacidad y la calidad de la traducción por separado.

¿Por qué la transcripción es lenta?

El tamaño del modelo, el backend, la cuantificación, la aceleración, la duración del audio y el hardware son importantes. Compare un modelo más pequeño y un backend optimizado antes de comprar hardware.

fuentes primarias

Última revisión el 25 de julio de 2026. Pruebe la versión Buzz exacta y el backend en audio representativo; Los paquetes de soporte, aceleración y distribución de modelos cambian con el tiempo.

Ready to try Buzz?

Visit the official website to get started

Visit Buzz

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper es la familia de reconocimiento de voz y referencia Python con licencia MIT de OpenAI para transcripción local multilingüe, subtítulos y traducción de voz al inglés.

Whisperreconocimiento de voztranscripción local
1060
Whisper.cpp

Whisper.cpp

Whisper.cpp es una implementación C/C++ sin dependencias de OpenAI Whisper para transcripción, traducción, transmisión, servidores y aplicaciones integradas locales. Esta guía cubre modelos, cuantificación, backends, precisión, privacidad e implementación.

speech-recognitionfree
1280
WhisperDesktop

WhisperDesktop

WhisperDesktop es una aplicación de escritorio de Windows y una implementación de DirectCompute para ejecutar OpenAI Whisper localmente en entradas de audio, video y micrófono. Esta guía cubre la configuración, los modelos, las GPU, los subtítulos, la privacidad y las alternativas.

WhisperDesktopOpenAI Whisperspeech recognition
2050
WhisperX

WhisperX

WhisperX es una canalización abierta para audio largo que añade a faster-whisper transcripción por lotes, alineación forzada por idioma y diarización opcional con pyannote.

WhisperXspeech alignmentspeaker diarization
1030