Buzz est une application de bureau gratuite et open source permettant de transformer l'audio et la vidéo en transcriptions, sous-titres et sous-titres en direct. Il regroupe plusieurs backends de reconnaissance vocale (Whisper, Whisper.cpp, Faster Whisper, modèles Hugging Face compatibles et hébergés OpenAI API compatibles) dans un flux de travail graphique pour macOS, Windows et Linux. Le référentiel est sous licence MIT.
Buzz est particulièrement utile lorsqu'un utilisateur souhaite un traitement local et des exportations modifiables sans assembler Python, FFmpeg et les outils de modèle. « Hors ligne » est un choix de configuration, et non une propriété absolue du produit : les backends locaux peuvent conserver les médias sur l'ordinateur, tandis que la transcription API, la traduction IA, les importations d'URL, les téléchargements de modèles et les fonctionnalités facultatives de téléchargement en direct créent du trafic réseau. Vérifiez le flux de travail choisi plutôt que de vous fier à l'étiquette.


Choisissez le chemin d'exécution avant de choisir un modèle
| Back-end | Meilleur ajustement | Force | Compromis principal |
|---|---|---|---|
| Chuchoter | Base de référence locale générale | Écosystème de référence et large prise en charge linguistique | Peut être gourmand en ressources |
| Whisper.cpp | CPU, appareils compatibles Apple Silicon ou Vulkan | Runtime natif portable et modèles quantifiés | Le comportement de construction/accélération varie selon la plate-forme |
| Faster Whisper | GPU NVIDIA ou travail par lots local optimisé | Implémentation et quantification efficaces de CTranslate2 | Les pilotes, la VRAM et la compatibilité des packages sont importants |
| Hugging Face | Langages spécialisés ou modèles affinés | Catalogue grand modèle; Buzz documente la prise en charge des MMS | La qualité et les licences diffèrent selon le modèle |
| Compatible OpenAI API | Matériel local faible ou service centralisé | Aucune configuration d'inférence locale et délai d'exécution potentiellement plus rapide | Confidentialité du téléchargement, coût d'utilisation et dépendance du fournisseur |
Comparez deux ou trois choix réalistes sur les mêmes clips. La taille du modèle à elle seule ne permet pas de prédire le meilleur résultat de production. Un modèle plus petit peut gagner lorsqu’un son clair, un langage connu et un examen humain rapide sont importants ; un modèle plus grand peut perdre s'il fonctionne si lentement que les utilisateurs ignorent les contrôles de qualité.
Le pipeline de transcription, dessiné par des preuves
audio/vidéo
|
+--> séparation de la parole facultative
|
v
décoder + rééchantillonner --> modèle/backend --> segments chronométrés
|
.-----------------------+----------------------.
v v v
révision du texte locuteur étiquettes traduction
| | |
'-----------------------+----------------------'
v
TXT / SRT / VTT / CSV
« Exportation terminée » n'est pas la même chose que « légendes prêtes à être publiées »
Chaque étape peut introduire une erreur différente. La séparation de la parole peut supprimer les mots calmes ; la détection de langue peut sélectionner la mauvaise langue à partir d'une courte introduction ; le modèle peut halluciner pendant le silence ; la diarisation peut échanger des haut-parleurs ; la traduction peut changer le sens ; et la segmentation des sous-titres peut être précise en mots mais difficile à lire.
Construire un ensemble de précision représentatif
N'évaluez pas avec un seul monologue propre. Créez 20 à 40 clips courts et consentis couvrant les conditions qui comptent : différents haut-parleurs, accents, microphones, écho de la pièce, musique, chevauchement, termes de domaine, nombres et commutation de code. Produisez une transcription de référence humaine et conservez-la séparée de la sortie du modèle.
| Tranche de test | Que mesurer | Échec commun |
|---|---|---|
| Nettoyer un seul haut-parleur | Erreur de mot et référence de ponctuation | Noms, acronymes et termes rares |
| Entretien bruyant | Taux de suppression et faux texte en silence | La musique interprétée comme un discours |
| Haut-parleurs superposés | Attribution du locuteur et contenu perdu | Tours fusionnés ou échangés |
| Numéros/dates | Précision sémantique, pas similitude orthographique | Mauvais montant, unité ou heure de rendez-vous |
| Multilingue/commutateur de code | Sélection de la langue et termes non traduits | Substitution phonétique |
| Enregistrement long | Dérive, utilisation de la mémoire et débit | Dérive de l'horodatage ou ralentissement d'exécution tardif |
Le taux d’erreur sur les mots est utile mais insuffisant. Suivez la précision des termes critiques, les erreurs d’horodatage, l’attribution du locuteur, les hallucinations par heure et les minutes de correction humaine. Pour les sous-titres d’accessibilité, la lisibilité et la synchronisation peuvent avoir plus d’importance qu’une petite amélioration WER.
Sélection de la langue et invite
La documentation d'enregistrement en direct recommande de sélectionner la langue lorsqu'elle est connue, car la détection repose souvent sur le début de l'audio. Une introduction musicale, un message d'accueil dans une autre langue ou un court clip peuvent l'induire en erreur. Utilisez l'invite initiale pour les noms, le vocabulaire technique et l'orthographe attendue, et non pour ajouter du contenu que l'enregistrement ne contient pas.
Conservez un glossaire de projet et testez si chaque backend utilise les invites de manière cohérente. Vérifiez les chiffres par rapport à l’audio. Pour les travaux juridiques, médicaux, universitaires ou journalistiques, conservez l’enregistrement et marquez les passages incertains avec des horodatages plutôt que de deviner silencieusement.
La traduction est un problème de qualité distinct
La tâche de traduction standard de Whisper convertit la parole prise en charge en anglais ; La documentation de Buzz indique que Large-v3-turbo n'est pas compatible avec ce chemin de traduction standard. Buzz prend également en charge la traduction via un point de terminaison de modèle de langage compatible OpenAI, y compris un point de terminaison hébergé localement. Ce deuxième chemin envoie le texte reconnu (pas nécessairement l'audio original) au service configuré, mais il nécessite toujours un examen de confidentialité et de qualité.
| Flux de travail | Utiliser quand | Vérification |
|---|---|---|
| Discours chuchoté en anglais | Rendu rapide en anglais à partir de la parole source prise en charge | Comparez les noms, chiffres et termes culturels omis |
| Transcription puis traduction LLM | La langue cible n'est pas l'anglais ou le contrôle du style est important | Vérifiez d'abord la transcription source, puis la révision bilingue |
| Traducteur local compatible OpenAI | Les médias/textes doivent rester sur du matériel contrôlé | Confirmer le point de terminaison, les journaux, la licence du modèle et l'isolation du réseau |
| Traductrice professionnelle | Publication, signification juridique ou à enjeux élevés | L'humain se déconnecte de l'audio et du contexte |
Ne laissez pas un modèle de langage ajouter des notes, des résumés ou un contexte inventé aux lignes de sous-titres. Les documents officiels recommandent des instructions de traduction explicites ; validez également le nombre de lignes, l’association temporelle, les entités nommées et la cohérence entre les termes répétés.
Identification du locuteur et séparation de la parole
Buzz peut identifier les locuteurs sur les transcriptions terminées et peut extraire/séparer la parole avant la reconnaissance. Ces fonctionnalités sont des aides et non une vérification d’identité. Label émet « Speaker 1 » jusqu'à ce qu'un humain mappe la voix à une personne. Ne déduisez jamais l’identité, le rôle, le sexe ou l’intention uniquement à partir de la diarisation.
Comparez la séparation activée et désactivée. Il peut améliorer les enregistrements avec une musique de fond, mais un traitement agressif peut endommager la respiration, les paroles calmes ou les chevauchements. Stockez la source intacte, la piste traitée et les paramètres. Si les preuves ou l’intégrité archivistique sont importantes, hachez l’original et effectuez des modifications sur les copies.
Contrôle qualité des sous-titres : les mots ne représentent que la moitié du travail
| Vérifier | Règle pratique | Raison |
|---|---|---|
| Calendrier | La légende apparaît avec la parole et laisse suffisamment de temps de lecture | Les sous-titres tardifs réduisent la compréhension |
| Sauts de ligne | Rompre avec des phrases naturelles, pas entre des mots étroitement liés | Améliore la numérisation |
| Vitesse de lecture | Utiliser la norme d’accessibilité plateforme/audience | Les sous-titres denses ne peuvent pas être lus |
| Indices sonores | Ajoutez un son non vocal significatif si nécessaire | L’accessibilité va bien au-delà du dialogue |
| Changements de haut-parleurs | Effectuez un changement sans ambiguïté et sans encombrement | Important dans les interviews et les panels |
| Noms/numéros | Vérifier manuellement par rapport au contexte faisant autorité | De petites erreurs de transcription peuvent changer le sens |
Buzz exporte TXT, SRT et VTT, et le projet décrit également les exportations CSV dans les matériaux de produits actuels. Testez le format exact par rapport à l'éditeur ou à la plate-forme de destination. Conservez les caractères UTF-8 et inspectez les premières sections, le milieu et la fin pour déceler toute dérive.
La transcription en direct a un budget de latence plus strict
Les documents officiels préviennent que la transcription par microphone local nécessite beaucoup de ressources et peut ne pas être effectuée en temps réel. Mesurez la latence de capture à l'affichage, l'audio manqué, la stabilité de correction et la limitation thermique pour toute la durée de l'événement. Utilisez un microphone filaire et désactivez la veille. Ayez un sous-titreur humain ou un affichage de secours pour les événements d’accessibilité importants.
Buzz propose une fenêtre de présentation et une exportation facultative de transcription en direct, qui peut alimenter des logiciels tels qu'OBS. Les préférences documentent également une URL de téléchargement qui peut POSTER une transcription ou une traduction de texte sur un serveur. Cela transforme un flux de travail local en une divulgation réseau ; authentifiez le destinataire, chiffrez le transport et évitez d’exposer publiquement le point de terminaison.
Vérification de la confidentialité et du traitement local
- Téléchargez des modèles avant d'entrer dans un environnement isolé, puis surveillez les connexions sortantes pendant un test.
- Sélectionnez un backend local et laissez les clés API vides lorsque le traitement cloud est interdit.
- Désactivez le téléchargement en direct et la traduction externe, sauf autorisation explicite.
- Vérifiez les fichiers temporaires, les dossiers d'exportation, les listes de fichiers récents, les journaux de crash et les sauvegardes du système d'exploitation.
- Crypter l'appareil et le stockage d'enregistrement ; supprimer les copies de travail conformément à la politique de conservation.
- Obtenez le consentement à l’enregistrement et à la transcription approprié à la juridiction et au contexte.
Le code open source améliore l'inspectabilité mais ne prouve pas qu'un binaire est sûr. Téléchargez via les canaux de version officiels, vérifiez les signatures ou les sommes de contrôle le cas échéant, maintenez les dépendances à jour et analysez les artefacts d'installation conformément à la politique de l'organisation.
Décisions en matière de matériel et de débit
Mesurez le facteur en temps réel : les secondes de traitement divisées par les secondes audio. Une valeur de 0,5 signifie qu’une heure d’audio prend environ 30 minutes ; 2.0 signifie environ deux heures. Enregistrez le modèle, le backend, la quantification, le périphérique, l'accélération, le format de fichier, la taille du lot et la mémoire maximale. La batterie d’un ordinateur portable, la chaleur et le montage simultané peuvent modifier considérablement les résultats.
La quantification réduit la mémoire et peut améliorer la vitesse, parfois avec un compromis en termes de précision. La prise en charge de Vulkan peut accélérer Whisper.cpp sur une gamme plus large de GPU, tandis que les chemins CUDA et Apple Silicon ont leurs propres conditions de compatibilité. Un benchmark propre sur la machine réelle est plus fiable que les affirmations génériques sur le matériel.
CLI et automatisation par lots
La CLI Buzz peut ajouter des fichiers ou des URL, choisir de transcrire ou de traduire, sélectionner le backend/le modèle/la langue, fournir une invite initiale et exporter SRT, VTT ou TXT. Il peut masquer l'interface graphique, ce qui le rend utile pour un dossier surveillé ou un pipeline multimédia. L'automatisation a toujours besoin de noms de fichiers anti-collision, de vérifications de code de sortie, de journaux et d'une quarantaine pour les échecs.
buzz add --task transcribe --langue en --model-type murmurecpp --model-size small --prompt "Noms : Ada Lovelace, Babbage" --srt --vtt interview.mp4
Confirmez les options CLI par rapport à la version installée. Épinglez la version en production et exécutez un appareil connu après les mises à niveau ; la segmentation des sous-titres ou les modifications du backend peuvent modifier les différences en aval même lorsque la commande réussit.
Alternatives
| Options | Meilleur ajustement | Compromis par rapport à Buzz |
|---|---|---|
| Buzz | Interface graphique locale multiplateforme et plusieurs backends Whisper | Des ressources de bureau et un contrôle qualité manuel sont toujours nécessaires |
| Whisper.cpp CLI | Automatisation Lean locale ou embarquée | Flux de travail d'édition moins intégré |
| Faster Whisperscripts | Pipelines par lots GPU personnalisés | Plus d’ingénierie et de gestion des dépendances |
| OpenAI synthèse vocale API | Échelle gérée et calcul local minimal | Conditions de téléchargement, de tarification et du fournisseur |
| Descript / Outils de texte Premiere | Transcription dans une suite d'édition | Écosystème commercial et moins de contrôle local |
| Transcription/sous-titrage humain | Accessibilité ou publication à enjeux élevés | Coût direct plus élevé mais examen contextuel responsable |
Questions fréquemment posées
Buzz est-il gratuit ?
Le référentiel officiel est sous licence MIT et le logiciel de bureau peut être utilisé sans abonnement. Les API hébergés, le matériel et les modèles tiers peuvent créer des coûts distincts.
Buzz fonctionne-t-il entièrement hors ligne ?
Oui pour les workflows de modèle local configurés une fois que les ressources requises sont disponibles. La transcription API, la traduction externe, l'importation d'URL et le téléchargement en direct utilisent le réseau.
Quels systèmes d'exploitation sont pris en charge ?
Le projet documente macOS, Windows et Linux, avec des options de distribution et d'accélération spécifiques à la plate-forme.
Peut-il créer des sous-titres ?
Oui. Il exporte des formats chronométrés dont SRT et VTT. Le timing humain, la lisibilité et la révision de la terminologie restent nécessaires.
Peut-il identifier les locuteurs ?
Il prend en charge l'identification du locuteur sur les supports transcrits, mais les étiquettes nécessitent une vérification humaine et ne constituent pas une preuve d'identité biométrique.
Peut-il être traduit dans des langues autres que l'anglais ?
Buzz documente une traduction supplémentaire via des services d'IA configurables compatibles OpenAI, y compris des points de terminaison locaux. Validez séparément la confidentialité et la qualité de la traduction.
Pourquoi la transcription est-elle lente ?
La taille du modèle, le backend, la quantification, l’accélération, la longueur audio et le matériel comptent tous. Comparez un modèle plus petit et un backend optimisé avant d’acheter du matériel.
Sources primaires
- Dépôt et licence officiels Buzz
- Documentation officielle des fonctionnalités
- Guide d'installation officiel
- Importation de fichiers et paramètres du modèle
- Conseils pour l'enregistrement en direct
- Comportement de traduction
- Fonctionnalités de visualisation et d'édition
- Référence CLI
- Historique des versions officielles
Dernière révision le 25 juillet 2026. Testez la version et le backend exacts de Buzz sur un son représentatif ; le support du modèle, l'accélération et les packages de distribution changent au fil du temps.


