Buzz
Buzz

Buzz

Buzz est une application de bureau gratuite sous licence MIT pour la transcription Whisper locale, les sous-titres, les sous-titres en direct, la traduction et l'étiquetage des locuteurs sur macOS, Windows et Linux. Ce guide compare les backends, le matériel, la confidentialité, les tests de précision, l'assurance qualité des sous-titres, l'automatisation CLI et les alternatives cloud.

156

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

BuzzBuzz Captionstranscription offlineWhisper transcriptionsous-titres open sourcespeech to textSRTVTT

Product Preview

A quick visual look at Buzz before you visit the official site.

Published 1/21/2026
Buzz screenshot

Editorial Review

About Buzz

Buzz est une application de bureau gratuite et open source permettant de transformer l'audio et la vidéo en transcriptions, sous-titres et sous-titres en direct. Il regroupe plusieurs backends de reconnaissance vocale (Whisper, Whisper.cpp, Faster Whisper, modèles Hugging Face compatibles et hébergés OpenAI API compatibles) dans un flux de travail graphique pour macOS, Windows et Linux. Le référentiel est sous licence MIT.

Buzz est particulièrement utile lorsqu'un utilisateur souhaite un traitement local et des exportations modifiables sans assembler Python, FFmpeg et les outils de modèle. « Hors ligne » est un choix de configuration, et non une propriété absolue du produit : les backends locaux peuvent conserver les médias sur l'ordinateur, tandis que la transcription API, la traduction IA, les importations d'URL, les téléchargements de modèles et les fonctionnalités facultatives de téléchargement en direct créent du trafic réseau. Vérifiez le flux de travail choisi plutôt que de vous fier à l'étiquette.

Official Buzz offline transcription banner
Buzz regroupe la transcription basée sur Whisper dans une application de bureau multiplateforme. Le choix du modèle, le matériel et la qualité audio déterminent la vitesse et la précision.
Official Buzz file import and transcription interface
Le flux de travail d'importation expose les paramètres de tâche, de langue, de backend et de modèle. Enregistrez ces choix avec la sortie afin que les corrections ultérieures soient reproductibles.

Choisissez le chemin d'exécution avant de choisir un modèle

Back-endMeilleur ajustementForceCompromis principal
ChuchoterBase de référence locale généraleÉcosystème de référence et large prise en charge linguistiquePeut être gourmand en ressources
Whisper.cppCPU, appareils compatibles Apple Silicon ou VulkanRuntime natif portable et modèles quantifiésLe comportement de construction/accélération varie selon la plate-forme
Faster WhisperGPU NVIDIA ou travail par lots local optimiséImplémentation et quantification efficaces de CTranslate2Les pilotes, la VRAM et la compatibilité des packages sont importants
Hugging FaceLangages spécialisés ou modèles affinésCatalogue grand modèle; Buzz documente la prise en charge des MMSLa qualité et les licences diffèrent selon le modèle
Compatible OpenAI APIMatériel local faible ou service centraliséAucune configuration d'inférence locale et délai d'exécution potentiellement plus rapideConfidentialité du téléchargement, coût d'utilisation et dépendance du fournisseur

Comparez deux ou trois choix réalistes sur les mêmes clips. La taille du modèle à elle seule ne permet pas de prédire le meilleur résultat de production. Un modèle plus petit peut gagner lorsqu’un son clair, un langage connu et un examen humain rapide sont importants ; un modèle plus grand peut perdre s'il fonctionne si lentement que les utilisateurs ignorent les contrôles de qualité.

Le pipeline de transcription, dessiné par des preuves

 audio/vidéo
    |
    +--> séparation de la parole facultative
    |
    v
 décoder + rééchantillonner --> modèle/backend --> segments chronométrés
                                          |
                  .-----------------------+----------------------.
                  v v v
             révision du texte locuteur étiquettes traduction
                  |                       |                      |
                  '-----------------------+----------------------'
                                          v
                                  TXT / SRT / VTT / CSV

 « Exportation terminée » n'est pas la même chose que « légendes prêtes à être publiées »

Chaque étape peut introduire une erreur différente. La séparation de la parole peut supprimer les mots calmes ; la détection de langue peut sélectionner la mauvaise langue à partir d'une courte introduction ; le modèle peut halluciner pendant le silence ; la diarisation peut échanger des haut-parleurs ; la traduction peut changer le sens ; et la segmentation des sous-titres peut être précise en mots mais difficile à lire.

Construire un ensemble de précision représentatif

N'évaluez pas avec un seul monologue propre. Créez 20 à 40 clips courts et consentis couvrant les conditions qui comptent : différents haut-parleurs, accents, microphones, écho de la pièce, musique, chevauchement, termes de domaine, nombres et commutation de code. Produisez une transcription de référence humaine et conservez-la séparée de la sortie du modèle.

Tranche de testQue mesurerÉchec commun
Nettoyer un seul haut-parleurErreur de mot et référence de ponctuationNoms, acronymes et termes rares
Entretien bruyantTaux de suppression et faux texte en silenceLa musique interprétée comme un discours
Haut-parleurs superposésAttribution du locuteur et contenu perduTours fusionnés ou échangés
Numéros/datesPrécision sémantique, pas similitude orthographiqueMauvais montant, unité ou heure de rendez-vous
Multilingue/commutateur de codeSélection de la langue et termes non traduitsSubstitution phonétique
Enregistrement longDérive, utilisation de la mémoire et débitDérive de l'horodatage ou ralentissement d'exécution tardif

Le taux d’erreur sur les mots est utile mais insuffisant. Suivez la précision des termes critiques, les erreurs d’horodatage, l’attribution du locuteur, les hallucinations par heure et les minutes de correction humaine. Pour les sous-titres d’accessibilité, la lisibilité et la synchronisation peuvent avoir plus d’importance qu’une petite amélioration WER.

Sélection de la langue et invite

La documentation d'enregistrement en direct recommande de sélectionner la langue lorsqu'elle est connue, car la détection repose souvent sur le début de l'audio. Une introduction musicale, un message d'accueil dans une autre langue ou un court clip peuvent l'induire en erreur. Utilisez l'invite initiale pour les noms, le vocabulaire technique et l'orthographe attendue, et non pour ajouter du contenu que l'enregistrement ne contient pas.

Conservez un glossaire de projet et testez si chaque backend utilise les invites de manière cohérente. Vérifiez les chiffres par rapport à l’audio. Pour les travaux juridiques, médicaux, universitaires ou journalistiques, conservez l’enregistrement et marquez les passages incertains avec des horodatages plutôt que de deviner silencieusement.

La traduction est un problème de qualité distinct

La tâche de traduction standard de Whisper convertit la parole prise en charge en anglais ; La documentation de Buzz indique que Large-v3-turbo n'est pas compatible avec ce chemin de traduction standard. Buzz prend également en charge la traduction via un point de terminaison de modèle de langage compatible OpenAI, y compris un point de terminaison hébergé localement. Ce deuxième chemin envoie le texte reconnu (pas nécessairement l'audio original) au service configuré, mais il nécessite toujours un examen de confidentialité et de qualité.

Flux de travailUtiliser quandVérification
Discours chuchoté en anglaisRendu rapide en anglais à partir de la parole source prise en chargeComparez les noms, chiffres et termes culturels omis
Transcription puis traduction LLMLa langue cible n'est pas l'anglais ou le contrôle du style est importantVérifiez d'abord la transcription source, puis la révision bilingue
Traducteur local compatible OpenAILes médias/textes doivent rester sur du matériel contrôléConfirmer le point de terminaison, les journaux, la licence du modèle et l'isolation du réseau
Traductrice professionnellePublication, signification juridique ou à enjeux élevésL'humain se déconnecte de l'audio et du contexte

Ne laissez pas un modèle de langage ajouter des notes, des résumés ou un contexte inventé aux lignes de sous-titres. Les documents officiels recommandent des instructions de traduction explicites ; validez également le nombre de lignes, l’association temporelle, les entités nommées et la cohérence entre les termes répétés.

Identification du locuteur et séparation de la parole

Buzz peut identifier les locuteurs sur les transcriptions terminées et peut extraire/séparer la parole avant la reconnaissance. Ces fonctionnalités sont des aides et non une vérification d’identité. Label émet « Speaker 1 » jusqu'à ce qu'un humain mappe la voix à une personne. Ne déduisez jamais l’identité, le rôle, le sexe ou l’intention uniquement à partir de la diarisation.

Comparez la séparation activée et désactivée. Il peut améliorer les enregistrements avec une musique de fond, mais un traitement agressif peut endommager la respiration, les paroles calmes ou les chevauchements. Stockez la source intacte, la piste traitée et les paramètres. Si les preuves ou l’intégrité archivistique sont importantes, hachez l’original et effectuez des modifications sur les copies.

Contrôle qualité des sous-titres : les mots ne représentent que la moitié du travail

VérifierRègle pratiqueRaison
CalendrierLa légende apparaît avec la parole et laisse suffisamment de temps de lectureLes sous-titres tardifs réduisent la compréhension
Sauts de ligneRompre avec des phrases naturelles, pas entre des mots étroitement liésAméliore la numérisation
Vitesse de lectureUtiliser la norme d’accessibilité plateforme/audienceLes sous-titres denses ne peuvent pas être lus
Indices sonoresAjoutez un son non vocal significatif si nécessaireL’accessibilité va bien au-delà du dialogue
Changements de haut-parleursEffectuez un changement sans ambiguïté et sans encombrementImportant dans les interviews et les panels
Noms/numérosVérifier manuellement par rapport au contexte faisant autoritéDe petites erreurs de transcription peuvent changer le sens

Buzz exporte TXT, SRT et VTT, et le projet décrit également les exportations CSV dans les matériaux de produits actuels. Testez le format exact par rapport à l'éditeur ou à la plate-forme de destination. Conservez les caractères UTF-8 et inspectez les premières sections, le milieu et la fin pour déceler toute dérive.

La transcription en direct a un budget de latence plus strict

Les documents officiels préviennent que la transcription par microphone local nécessite beaucoup de ressources et peut ne pas être effectuée en temps réel. Mesurez la latence de capture à l'affichage, l'audio manqué, la stabilité de correction et la limitation thermique pour toute la durée de l'événement. Utilisez un microphone filaire et désactivez la veille. Ayez un sous-titreur humain ou un affichage de secours pour les événements d’accessibilité importants.

Buzz propose une fenêtre de présentation et une exportation facultative de transcription en direct, qui peut alimenter des logiciels tels qu'OBS. Les préférences documentent également une URL de téléchargement qui peut POSTER une transcription ou une traduction de texte sur un serveur. Cela transforme un flux de travail local en une divulgation réseau ; authentifiez le destinataire, chiffrez le transport et évitez d’exposer publiquement le point de terminaison.

Vérification de la confidentialité et du traitement local

  • Téléchargez des modèles avant d'entrer dans un environnement isolé, puis surveillez les connexions sortantes pendant un test.
  • Sélectionnez un backend local et laissez les clés API vides lorsque le traitement cloud est interdit.
  • Désactivez le téléchargement en direct et la traduction externe, sauf autorisation explicite.
  • Vérifiez les fichiers temporaires, les dossiers d'exportation, les listes de fichiers récents, les journaux de crash et les sauvegardes du système d'exploitation.
  • Crypter l'appareil et le stockage d'enregistrement ; supprimer les copies de travail conformément à la politique de conservation.
  • Obtenez le consentement à l’enregistrement et à la transcription approprié à la juridiction et au contexte.

Le code open source améliore l'inspectabilité mais ne prouve pas qu'un binaire est sûr. Téléchargez via les canaux de version officiels, vérifiez les signatures ou les sommes de contrôle le cas échéant, maintenez les dépendances à jour et analysez les artefacts d'installation conformément à la politique de l'organisation.

Décisions en matière de matériel et de débit

Mesurez le facteur en temps réel : les secondes de traitement divisées par les secondes audio. Une valeur de 0,5 signifie qu’une heure d’audio prend environ 30 minutes ; 2.0 signifie environ deux heures. Enregistrez le modèle, le backend, la quantification, le périphérique, l'accélération, le format de fichier, la taille du lot et la mémoire maximale. La batterie d’un ordinateur portable, la chaleur et le montage simultané peuvent modifier considérablement les résultats.

La quantification réduit la mémoire et peut améliorer la vitesse, parfois avec un compromis en termes de précision. La prise en charge de Vulkan peut accélérer Whisper.cpp sur une gamme plus large de GPU, tandis que les chemins CUDA et Apple Silicon ont leurs propres conditions de compatibilité. Un benchmark propre sur la machine réelle est plus fiable que les affirmations génériques sur le matériel.

CLI et automatisation par lots

La CLI Buzz peut ajouter des fichiers ou des URL, choisir de transcrire ou de traduire, sélectionner le backend/le modèle/la langue, fournir une invite initiale et exporter SRT, VTT ou TXT. Il peut masquer l'interface graphique, ce qui le rend utile pour un dossier surveillé ou un pipeline multimédia. L'automatisation a toujours besoin de noms de fichiers anti-collision, de vérifications de code de sortie, de journaux et d'une quarantaine pour les échecs.

buzz add --task transcribe --langue en --model-type murmurecpp --model-size small --prompt "Noms : Ada Lovelace, Babbage" --srt --vtt interview.mp4

Confirmez les options CLI par rapport à la version installée. Épinglez la version en production et exécutez un appareil connu après les mises à niveau ; la segmentation des sous-titres ou les modifications du backend peuvent modifier les différences en aval même lorsque la commande réussit.

Alternatives

OptionsMeilleur ajustementCompromis par rapport à Buzz
BuzzInterface graphique locale multiplateforme et plusieurs backends WhisperDes ressources de bureau et un contrôle qualité manuel sont toujours nécessaires
Whisper.cpp CLIAutomatisation Lean locale ou embarquéeFlux de travail d'édition moins intégré
Faster WhisperscriptsPipelines par lots GPU personnalisésPlus d’ingénierie et de gestion des dépendances
OpenAI synthèse vocale APIÉchelle gérée et calcul local minimalConditions de téléchargement, de tarification et du fournisseur
Descript / Outils de texte PremiereTranscription dans une suite d'éditionÉcosystème commercial et moins de contrôle local
Transcription/sous-titrage humainAccessibilité ou publication à enjeux élevésCoût direct plus élevé mais examen contextuel responsable

Questions fréquemment posées

Buzz est-il gratuit ?

Le référentiel officiel est sous licence MIT et le logiciel de bureau peut être utilisé sans abonnement. Les API hébergés, le matériel et les modèles tiers peuvent créer des coûts distincts.

Buzz fonctionne-t-il entièrement hors ligne ?

Oui pour les workflows de modèle local configurés une fois que les ressources requises sont disponibles. La transcription API, la traduction externe, l'importation d'URL et le téléchargement en direct utilisent le réseau.

Quels systèmes d'exploitation sont pris en charge ?

Le projet documente macOS, Windows et Linux, avec des options de distribution et d'accélération spécifiques à la plate-forme.

Peut-il créer des sous-titres ?

Oui. Il exporte des formats chronométrés dont SRT et VTT. Le timing humain, la lisibilité et la révision de la terminologie restent nécessaires.

Peut-il identifier les locuteurs ?

Il prend en charge l'identification du locuteur sur les supports transcrits, mais les étiquettes nécessitent une vérification humaine et ne constituent pas une preuve d'identité biométrique.

Peut-il être traduit dans des langues autres que l'anglais ?

Buzz documente une traduction supplémentaire via des services d'IA configurables compatibles OpenAI, y compris des points de terminaison locaux. Validez séparément la confidentialité et la qualité de la traduction.

Pourquoi la transcription est-elle lente ?

La taille du modèle, le backend, la quantification, l’accélération, la longueur audio et le matériel comptent tous. Comparez un modèle plus petit et un backend optimisé avant d’acheter du matériel.

Sources primaires

Dernière révision le 25 juillet 2026. Testez la version et le backend exacts de Buzz sur un son représentatif ; le support du modèle, l'accélération et les packages de distribution changent au fil du temps.

Ready to try Buzz?

Visit the official website to get started

Visit Buzz

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/8/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper est la famille de reconnaissance vocale et l’implémentation Python MIT d’OpenAI pour transcription locale multilingue, sous-titres et traduction vers l’anglais.

Whisperreconnaissance vocaletranscription locale
1010
Whisper.cpp

Whisper.cpp

Whisper.cpp est une implémentation C/C++ légère en dépendances de OpenAI Whisper pour la transcription locale, la traduction, le streaming, les serveurs et les applications intégrées. Ce guide couvre les modèles, la quantification, les backends, la précision, la confidentialité et le déploiement.

speech-recognitionfree
1000
WhisperDesktop

WhisperDesktop

WhisperDesktop est une application de bureau Windows et une implémentation de DirectCompute pour exécuter OpenAI Whisper localement sur une entrée audio, vidéo et microphone. Ce guide couvre la configuration, les modèles, les GPU, les sous-titres, la confidentialité et les alternatives.

WhisperDesktopOpenAI Whisperspeech recognition
1110
WhisperX

WhisperX

WhisperX est une chaîne open source pour l’audio long qui ajoute à faster-whisper le batch, l’alignement forcé par langue et la diarisation optionnelle avec pyannote.

WhisperXspeech alignmentspeaker diarization
1270