Buzz ist eine kostenlose Open-Source-Desktopanwendung zur Umwandlung von Audio- und Videoinhalten in Transkripte, Untertitel und Live-Untertitel. Es verpackt mehrere Spracherkennungs-Backends – Whisper, Whisper.cpp, Faster Whisper, kompatible Hugging Face-Modelle und gehostete OpenAI-kompatible APIs – in einen grafischen Workflow für macOS, Windows und Linux. Das Repository ist MIT-lizenziert.
Buzz ist am wertvollsten, wenn ein Benutzer lokale Verarbeitung und bearbeitbare Exporte ohne Assemblierung von Python, FFmpeg und Modellwerkzeugen wünscht. „Offline“ ist eine Konfigurationsauswahl, keine absolute Produkteigenschaft: Lokale Backends können Medien auf dem Computer behalten, während API Transkription, KI-Übersetzung, URL-Importe, Modell-Downloads und optionale Live-Upload-Funktionen Netzwerkverkehr erzeugen. Überprüfen Sie den gewählten Workflow, anstatt sich auf das Etikett zu verlassen.


Wählen Sie den Ausführungspfad, bevor Sie ein Modell auswählen
| Backend | Beste Passform | Stärke | Primärer Kompromiss |
|---|---|---|---|
| Flüstern | Allgemeine lokale Basislinie | Referenz-Ökosystem und umfassende Sprachunterstützung | Kann ressourcenintensiv sein |
| Whisper.cpp | CPU-, Apple Silicon- oder Vulkan-fähige Geräte | Tragbare native Laufzeit- und quantisierte Modelle | Das Build-/Beschleunigungsverhalten variiert je nach Plattform |
| Faster Whisper | NVIDIA-GPU oder optimierte lokale Batch-Arbeit | Effiziente CTranslate2 Implementierung und Quantisierung | Treiber, VRAM und Paketkompatibilität sind wichtig |
| Hugging Face | Spezialisierte Sprachen oder fein abgestimmte Modelle | Großer Modellkatalog; Buzz dokumentiert MMS-Unterstützung | Qualität und Lizenzierung unterscheiden sich je nach Modell |
| OpenAI-kompatibel API | Schwache lokale Hardware oder zentraler Dienst | Keine lokale Inferenzeinrichtung und möglicherweise schnellere Abwicklung | Datenschutz, Nutzungskosten und Anbieterabhängigkeit hochladen |
Vergleichen Sie zwei oder drei realistische Optionen für dieselben Clips. Die Modellgröße allein sagt nicht das beste Produktionsergebnis voraus. Ein kleineres Modell kann gewinnen, wenn es auf saubere Audioqualität, bekannte Sprache und eine schnelle menschliche Überprüfung ankommt; Ein größeres Modell kann verlieren, wenn es so langsam läuft, dass Benutzer Qualitätsprüfungen überspringen.
Die Transkriptionspipeline, gezeichnet durch Beweise
Audio/Video
|
+--> optionale Sprachtrennung
|
v
dekodieren + neu abtasten -> Modell/Backend -> zeitgesteuerte Segmente
|
.---------+----------------------.
v v v
Textüberprüfung, Sprecherbeschriftung, Übersetzung
| | |
'---------+----------------------'
v
TXT / SRT / VTT / CSV
„Export abgeschlossen“ ist nicht dasselbe wie „Untertitel zur Veröffentlichung bereit“
Jede Stufe kann einen anderen Fehler verursachen. Durch die Sprachtrennung können leise Wörter entfernt werden. Die Spracherkennung kann aus einer kurzen Einführung die falsche Sprache auswählen. das Modell kann während der Stille halluzinieren; Diarisierung kann Sprecher tauschen; Übersetzung kann die Bedeutung verändern; und die Untertitelsegmentierung kann wortgenau, aber schwer lesbar sein.
Erstellen Sie einen repräsentativen Genauigkeitssatz
Bewerten Sie nicht mit einem klaren Monolog. Erstellen Sie 20–40 kurze, genehmigte Clips, die die Bedingungen abdecken, auf die es ankommt: verschiedene Lautsprecher, Akzente, Mikrofone, Raumecho, Musik, Überschneidungen, Domänenbegriffe, Zahlen und Code-Umschaltung. Erstellen Sie ein menschliches Referenztranskript und bewahren Sie es getrennt von der Modellausgabe auf.
| Testscheibe | Was zu messen ist | Häufiger Fehler |
|---|---|---|
| Reinigen Sie einen einzelnen Lautsprecher | Wortfehler- und Interpunktionsgrundlinie | Namen, Akronyme und seltene Begriffe |
| Lautes Interview | Löschquote und Falschtext im Stillen | Musik als Sprache interpretiert |
| Überlappende Lautsprecher | Namensnennung des Sprechers und verlorener Inhalt | Zusammengelegte oder vertauschte Züge |
| Zahlen/Daten | Semantische Genauigkeit, keine Rechtschreibähnlichkeit | Falscher Betrag, falsche Einheit oder falsche Terminzeit |
| Mehrsprachigkeit/Code-Umschaltung | Sprachauswahl und nicht übersetzte Begriffe | Phonetische Substitution |
| Lange Aufnahme | Drift, Speichernutzung und Durchsatz | Zeitstempeldrift oder späte Verlangsamung |
Die Wortfehlerrate ist nützlich, aber unzureichend. Verfolgen Sie die Genauigkeit kritischer Begriffe, Zeitstempelfehler, Sprecherzuordnung, Halluzinationen pro Stunde und menschliche Korrekturminuten. Bei Untertiteln zur Barrierefreiheit können Lesbarkeit und Synchronisierung wichtiger sein als eine kleine WER Verbesserung.
Sprachauswahl und Eingabeaufforderung
In der Live-Aufzeichnungsdokumentation wird empfohlen, die Sprache auszuwählen, wenn diese bekannt ist, da die Erkennung häufig auf dem Anfang des Tons beruht. Eine Musikeinleitung, eine Begrüßung in einer anderen Sprache oder ein kurzer Clip können irreführend sein. Verwenden Sie die anfängliche Aufforderung zur Eingabe von Namen, technischem Vokabular und erwarteter Schreibweise, nicht zum Hinzufügen von Inhalten, die in der Aufzeichnung nicht enthalten sind.
Führen Sie ein Projektglossar und testen Sie, ob jedes Backend Eingabeaufforderungen konsistent verwendet. Vergleichen Sie die Zahlen mit dem Audio. Bewahren Sie bei juristischen, medizinischen, akademischen oder journalistischen Arbeiten die Aufzeichnung auf und markieren Sie unsichere Passagen mit Zeitstempeln, anstatt stillschweigend zu raten.
Die Übersetzung ist ein separates Qualitätsproblem
Die Standardübersetzungsaufgabe von Whisper wandelt unterstützte Sprache in Englisch um. In der Dokumentation von Buzz wird darauf hingewiesen, dass Large-v3-turbo nicht mit diesem Standardübersetzungspfad kompatibel ist. Buzz unterstützt auch die Übersetzung über einen OpenAI-kompatiblen Sprachmodell-Endpunkt, einschließlich eines lokal gehosteten Endpunkts. Dieser zweite Pfad sendet erkannten Text – nicht unbedingt Originalton – an den konfigurierten Dienst, erfordert jedoch noch eine Datenschutz- und Qualitätsprüfung.
| Arbeitsablauf | Verwenden Sie wann | Überprüfung |
|---|---|---|
| Flüstersprache-zu-Englisch | Schnelle englische Wiedergabe aus unterstützter Quellsprache | Vergleichen Sie ausgelassene Namen, Nummern und kulturelle Begriffe |
| Transkript, dann LLM-Übersetzung | Die Zielsprache ist nicht Englisch und es kommt auch nicht auf die Stilkontrolle an | Überprüfen Sie zuerst das Originaltranskript und dann die zweisprachige Überprüfung |
| Lokaler OpenAI-kompatibler Übersetzer | Medien/Text müssen auf kontrollierter Hardware verbleiben | Bestätigen Sie Endpunkt, Protokolle, Modelllizenz und Netzwerkisolation |
| Professioneller Übersetzer | Veröffentlichung, rechtliche oder hochriskante Bedeutung | Der Mensch trennt sich von Audio und Kontext |
Lassen Sie nicht zu, dass ein Sprachmodell den Untertitelzeilen Notizen, Zusammenfassungen oder erfundenen Kontext hinzufügt. Die offiziellen Dokumente empfehlen explizite Übersetzungsanweisungen; Validieren Sie außerdem die Zeilenanzahl, die Zeitzuordnung, benannte Entitäten und die Konsistenz über wiederholte Begriffe hinweg.
Sprecheridentifikation und Sprachtrennung
Buzz kann Sprecher anhand abgeschlossener Transkriptionen identifizieren und Sprache vor der Erkennung extrahieren/trennen. Bei diesen Funktionen handelt es sich um Hilfsmittel, nicht um eine Identitätsprüfung. Das Etikett gibt „Lautsprecher 1“ aus, bis ein Mensch die Stimme einer Person zuordnet. Schließen Sie niemals allein aus der Tagebuchführung auf Identität, Rolle, Geschlecht oder Absicht.
Vergleichen Sie die Trennung ein- und ausgeschaltet. Es kann Aufnahmen mit Hintergrundmusik verbessern, eine aggressive Verarbeitung kann jedoch Atemgeräusche, leise Sprache oder Überlappungen beeinträchtigen. Speichern Sie die unberührte Quelle, den verarbeiteten Titel und die Einstellungen. Wenn Beweise oder Archivintegrität wichtig sind, hashen Sie das Original und nehmen Sie Bearbeitungen an Kopien vor.
Untertitel-QA: Worte sind nur die halbe Miete
| Überprüfen | Praktische Regel | Grund |
|---|---|---|
| Timing | Die Bildunterschrift erscheint mit der Sprache und lässt genügend Lesezeit | Zu späte Untertitel beeinträchtigen das Verständnis |
| Zeilenumbrüche | Brechen Sie bei natürlichen Phrasen, nicht zwischen eng verbundenen Wörtern | Verbessert das Scannen |
| Lesegeschwindigkeit | Verwenden Sie den Plattform-/Publikumszugänglichkeitsstandard | Dichte Untertitel können nicht gelesen werden |
| Klanghinweise | Fügen Sie bei Bedarf aussagekräftiges Nicht-Sprach-Audio hinzu | Barrierefreiheit umfasst mehr als Dialog |
| Sprecherwechsel | Machen Sie eine Änderung eindeutig und ohne Unordnung | Wichtig in Interviews und Panels |
| Namen/Nummern | Überprüfen Sie manuell anhand des maßgeblichen Kontexts | Kleine Übertragungsfehler können die Bedeutung ändern |
Buzz exportiert TXT, SRT und VTT, und das Projekt beschreibt auch CSV-Exporte in aktuellen Produktmaterialien. Testen Sie das genaue Format mit dem Zieleditor oder der Zielplattform. Behalten Sie UTF-8-Zeichen bei und prüfen Sie den ersten, mittleren und letzten Abschnitt auf Drift.
Für die Live-Transkription gilt ein strengeres Latenzbudget
Die offiziellen Dokumente warnen davor, dass die lokale Mikrofontranskription ressourcenintensiv ist und möglicherweise nicht in Echtzeit erfolgt. Messen Sie die Latenz zwischen Aufnahme und Anzeige, verpasstes Audio, Korrekturstabilität und thermische Drosselung über die gesamte Ereignisdauer. Verwenden Sie ein kabelgebundenes Mikrofon und deaktivieren Sie den Ruhezustand. Nutzen Sie einen menschlichen Untertitel oder eine Ersatzanzeige für wichtige Barrierefreiheitsereignisse.
Buzz bietet ein Präsentationsfenster und einen optionalen Live-Transkript-Export, der Software wie OBS füttern kann. Die Einstellungen dokumentieren auch eine Upload-URL, über die Transkript- oder Übersetzungstext an einen Server gesendet werden kann. Durch die Aktivierung wird aus einem lokalen Workflow eine Netzwerkoffenlegung; Authentifizieren Sie den Empfänger, verschlüsseln Sie den Transport und vermeiden Sie die öffentliche Offenlegung des Endpunkts.
Überprüfung des Datenschutzes und der lokalen Verarbeitung
- Laden Sie Modelle herunter, bevor Sie eine isolierte Umgebung betreten, und überwachen Sie dann ausgehende Verbindungen während eines Tests.
- Wählen Sie ein lokales Backend aus und lassen Sie die Schlüssel API leer, wenn die Cloud-Verarbeitung verboten ist.
- Deaktivieren Sie den Live-Upload und die externe Übersetzung, sofern dies nicht ausdrücklich genehmigt wurde.
- Überprüfen Sie temporäre Dateien, Exportordner, Listen der zuletzt verwendeten Dateien, Absturzprotokolle und Betriebssystemsicherungen.
- Verschlüsseln Sie das Gerät und den Aufnahmespeicher. Arbeitskopien gemäß Aufbewahrungsrichtlinie löschen.
- Holen Sie die Einwilligung zur Aufnahme und Transkription entsprechend der Gerichtsbarkeit und Umgebung ein.
Open-Source-Code verbessert die Prüfbarkeit, beweist jedoch nicht, dass eine Binärdatei sicher ist. Laden Sie über offizielle Veröffentlichungskanäle herunter, überprüfen Sie Signaturen oder Prüfsummen, sofern vorhanden, halten Sie Abhängigkeiten auf dem neuesten Stand und scannen Sie Installationsartefakte gemäß den Unternehmensrichtlinien.
Hardware- und Durchsatzentscheidungen
Echtzeitfaktor messen: Verarbeitungssekunden geteilt durch Audiosekunden. Ein Wert von 0,5 bedeutet, dass eine Stunde Audio etwa 30 Minuten dauert; 2,0 bedeutet etwa zwei Stunden. Aufnahmemodell, Backend, Quantisierung, Gerät, Beschleunigung, Dateiformat, Stapelgröße und Spitzenspeicher. Laptop-Akku, Hitze und gleichzeitige Bearbeitung können die Ergebnisse erheblich verändern.
Die Quantisierung reduziert den Speicher und kann die Geschwindigkeit verbessern, manchmal mit einem Kompromiss bei der Genauigkeit. Die Unterstützung von Vulkan kann Whisper.cpp auf einer breiteren Palette von GPUs beschleunigen, während die Pfade CUDA und Apple Silicon ihre eigenen Kompatibilitätsbedingungen haben. Ein sauberer Benchmark auf der tatsächlichen Maschine ist vertrauenswürdiger als generische Hardware-Behauptungen.
CLI und Batch-Automatisierung
Die Buzz CLI kann Dateien oder URLs hinzufügen, Transkribieren oder Übersetzen auswählen, Backend/Modell/Sprache auswählen, eine erste Eingabeaufforderung bereitstellen und SRT, VTT oder TXT exportieren. Es kann die GUI verbergen, was es für einen überwachten Ordner oder eine Medienpipeline nützlich macht. Die Automatisierung benötigt weiterhin kollisionssichere Dateinamen, Exit-Code-Prüfungen, Protokolle und Quarantäne für Fehler.
Buzz Add --Task Transcribe --Language de --Model-Type Whispercpp --Model-Size Small --Prompt "Namen: Ada Lovelace, Babbage" --srt --vtt Interview.mp4
Bestätigen Sie die CLI-Optionen anhand der installierten Version. Fixieren Sie die Version in der Produktion und führen Sie nach Upgrades ein bekanntes Fixture aus. Untertitelsegmentierung oder Backend-Änderungen können Downstream-Diffs ändern, selbst wenn der Befehl erfolgreich ist.
Alternativen
| Option | Beste Passform | Kompromiss versus Buzz |
|---|---|---|
| Buzz | Plattformübergreifende lokale GUI plus mehrere Whisper-Backends | Desktop-Ressourcen und manuelle Qualitätssicherung sind weiterhin erforderlich |
| Whisper.cpp CLI | Schlanke lokale oder eingebettete Automatisierung | Weniger integrierter Bearbeitungsworkflow |
| Faster Whisper Skripte | Benutzerdefinierte GPU-Batch-Pipelines | Mehr Engineering und Abhängigkeitsmanagement |
| OpenAI Speech-to-Text API | Verwaltete Skalierung und minimale lokale Rechenleistung | Upload-, Preis- und Anbieterbedingungen |
| Descript / Premiere-Textwerkzeuge | Transkription in einem Bearbeitungsraum | Kommerzielles Ökosystem und weniger lokale Kontrolle |
| Menschliche Transkription/Untertitelung | Zugänglichkeit oder Veröffentlichung steht auf dem Spiel | Höhere direkte Kosten, aber rechenschaftspflichtige kontextbezogene Überprüfung |
Häufig gestellte Fragen
Ist Buzz kostenlos?
Das offizielle Repository ist MIT-lizenziert und die Desktop-Software kann ohne Abonnement genutzt werden. Gehostete APIs, Hardware und Modelle von Drittanbietern können separate Kosten verursachen.
Funktioniert Buzz vollständig offline?
Ja für konfigurierte lokale Modell-Workflows, nachdem die erforderlichen Assets verfügbar sind. API Transkription, externe Übersetzung, URL-Import und Live-Upload nutzen das Netzwerk.
Welche Betriebssysteme werden unterstützt?
Das Projekt dokumentiert macOS, Windows und Linux mit plattformspezifischen Verteilungs- und Beschleunigungsoptionen.
Kann es Untertitel erstellen?
Ja. Es exportiert zeitgesteuerte Formate, einschließlich SRT und VTT. Menschliches Timing, Lesbarkeit und Überprüfung der Terminologie bleiben weiterhin erforderlich.
Kann es Sprecher identifizieren?
Es unterstützt die Sprecheridentifizierung auf transkribierten Medien, Etiketten erfordern jedoch eine menschliche Überprüfung und sind kein biometrischer Identitätsnachweis.
Kann es in andere Sprachen als Englisch übersetzt werden?
Buzz dokumentiert zusätzliche Übersetzung durch konfigurierbare OpenAI-kompatible KI-Dienste, einschließlich lokaler Endpunkte. Validieren Sie Datenschutz und Übersetzungsqualität separat.
Warum ist die Transkription langsam?
Modellgröße, Backend, Quantisierung, Beschleunigung, Audiolänge und Hardware spielen alle eine Rolle. Vergleichen Sie ein kleineres Modell und ein optimiertes Backend, bevor Sie Hardware kaufen.
Primärquellen
- Offizielles Buzz-Repository und Lizenz
- Offizielle Funktionsdokumentation
- Offizielle Installationsanleitung
- Dateiimport und Modelleinstellungen
- Anleitung zur Live-Aufnahme
- Übersetzungsverhalten
- Viewer- und Bearbeitungsfunktionen
- CLI-Referenz
- Offizielle Veröffentlichungshistorie
Zuletzt überprüft am 25. Juli 2026. Testen Sie die genaue Buzz-Version und das Backend auf repräsentativem Audio; Modellunterstützung, Beschleunigung und Vertriebspakete ändern sich im Laufe der Zeit.


