Buzz
Buzz

Buzz

Buzz ist eine kostenlose, vom MIT lizenzierte Desktop-App für lokale Whisper-Transkription, Untertitel, Live-Untertitel, Übersetzung und Sprecherkennzeichnung auf macOS, Windows und Linux. In diesem Leitfaden werden Backends, Hardware, Datenschutz, Genauigkeitstests, Untertitel-Qualitätssicherung, CLI-Automatisierung und Cloud-Alternativen verglichen.

139

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

BuzzBuzz CaptionsOffline TranskriptionWhisper TranskriptionOpen Source UntertitelSpeech to TextSRT Untertitel

Product Preview

A quick visual look at Buzz before you visit the official site.

Published 1/21/2026
Buzz screenshot

Editorial Review

About Buzz

Buzz ist eine kostenlose Open-Source-Desktopanwendung zur Umwandlung von Audio- und Videoinhalten in Transkripte, Untertitel und Live-Untertitel. Es verpackt mehrere Spracherkennungs-Backends – Whisper, Whisper.cpp, Faster Whisper, kompatible Hugging Face-Modelle und gehostete OpenAI-kompatible APIs – in einen grafischen Workflow für macOS, Windows und Linux. Das Repository ist MIT-lizenziert.

Buzz ist am wertvollsten, wenn ein Benutzer lokale Verarbeitung und bearbeitbare Exporte ohne Assemblierung von Python, FFmpeg und Modellwerkzeugen wünscht. „Offline“ ist eine Konfigurationsauswahl, keine absolute Produkteigenschaft: Lokale Backends können Medien auf dem Computer behalten, während API Transkription, KI-Übersetzung, URL-Importe, Modell-Downloads und optionale Live-Upload-Funktionen Netzwerkverkehr erzeugen. Überprüfen Sie den gewählten Workflow, anstatt sich auf das Etikett zu verlassen.

Official Buzz offline transcription banner
Buzz bündelt Whisper-basierte Transkription in einer plattformübergreifenden Desktop-App. Modellauswahl, Hardware und Audioqualität bestimmen Geschwindigkeit und Genauigkeit.
Official Buzz file import and transcription interface
Der Import-Workflow macht Aufgaben-, Sprach-, Backend- und Modelleinstellungen verfügbar. Speichern Sie diese Auswahl mit der Ausgabe, damit spätere Korrekturen reproduzierbar sind.

Wählen Sie den Ausführungspfad, bevor Sie ein Modell auswählen

BackendBeste PassformStärkePrimärer Kompromiss
FlüsternAllgemeine lokale BasislinieReferenz-Ökosystem und umfassende SprachunterstützungKann ressourcenintensiv sein
Whisper.cppCPU-, Apple Silicon- oder Vulkan-fähige GeräteTragbare native Laufzeit- und quantisierte ModelleDas Build-/Beschleunigungsverhalten variiert je nach Plattform
Faster WhisperNVIDIA-GPU oder optimierte lokale Batch-ArbeitEffiziente CTranslate2 Implementierung und QuantisierungTreiber, VRAM und Paketkompatibilität sind wichtig
Hugging FaceSpezialisierte Sprachen oder fein abgestimmte ModelleGroßer Modellkatalog; Buzz dokumentiert MMS-UnterstützungQualität und Lizenzierung unterscheiden sich je nach Modell
OpenAI-kompatibel APISchwache lokale Hardware oder zentraler DienstKeine lokale Inferenzeinrichtung und möglicherweise schnellere AbwicklungDatenschutz, Nutzungskosten und Anbieterabhängigkeit hochladen

Vergleichen Sie zwei oder drei realistische Optionen für dieselben Clips. Die Modellgröße allein sagt nicht das beste Produktionsergebnis voraus. Ein kleineres Modell kann gewinnen, wenn es auf saubere Audioqualität, bekannte Sprache und eine schnelle menschliche Überprüfung ankommt; Ein größeres Modell kann verlieren, wenn es so langsam läuft, dass Benutzer Qualitätsprüfungen überspringen.

Die Transkriptionspipeline, gezeichnet durch Beweise

 Audio/Video
    |
    +--> optionale Sprachtrennung
    |
    v
 dekodieren + neu abtasten -> Modell/Backend -> zeitgesteuerte Segmente
                                          |
                  .---------+----------------------.
                  v v v
             Textüberprüfung, Sprecherbeschriftung, Übersetzung
                  |                       |                      |
                  '---------+----------------------'
                                          v
                                  TXT / SRT / VTT / CSV

 „Export abgeschlossen“ ist nicht dasselbe wie „Untertitel zur Veröffentlichung bereit“

Jede Stufe kann einen anderen Fehler verursachen. Durch die Sprachtrennung können leise Wörter entfernt werden. Die Spracherkennung kann aus einer kurzen Einführung die falsche Sprache auswählen. das Modell kann während der Stille halluzinieren; Diarisierung kann Sprecher tauschen; Übersetzung kann die Bedeutung verändern; und die Untertitelsegmentierung kann wortgenau, aber schwer lesbar sein.

Erstellen Sie einen repräsentativen Genauigkeitssatz

Bewerten Sie nicht mit einem klaren Monolog. Erstellen Sie 20–40 kurze, genehmigte Clips, die die Bedingungen abdecken, auf die es ankommt: verschiedene Lautsprecher, Akzente, Mikrofone, Raumecho, Musik, Überschneidungen, Domänenbegriffe, Zahlen und Code-Umschaltung. Erstellen Sie ein menschliches Referenztranskript und bewahren Sie es getrennt von der Modellausgabe auf.

TestscheibeWas zu messen istHäufiger Fehler
Reinigen Sie einen einzelnen LautsprecherWortfehler- und InterpunktionsgrundlinieNamen, Akronyme und seltene Begriffe
Lautes InterviewLöschquote und Falschtext im StillenMusik als Sprache interpretiert
Überlappende LautsprecherNamensnennung des Sprechers und verlorener InhaltZusammengelegte oder vertauschte Züge
Zahlen/DatenSemantische Genauigkeit, keine RechtschreibähnlichkeitFalscher Betrag, falsche Einheit oder falsche Terminzeit
Mehrsprachigkeit/Code-UmschaltungSprachauswahl und nicht übersetzte BegriffePhonetische Substitution
Lange AufnahmeDrift, Speichernutzung und DurchsatzZeitstempeldrift oder späte Verlangsamung

Die Wortfehlerrate ist nützlich, aber unzureichend. Verfolgen Sie die Genauigkeit kritischer Begriffe, Zeitstempelfehler, Sprecherzuordnung, Halluzinationen pro Stunde und menschliche Korrekturminuten. Bei Untertiteln zur Barrierefreiheit können Lesbarkeit und Synchronisierung wichtiger sein als eine kleine WER Verbesserung.

Sprachauswahl und Eingabeaufforderung

In der Live-Aufzeichnungsdokumentation wird empfohlen, die Sprache auszuwählen, wenn diese bekannt ist, da die Erkennung häufig auf dem Anfang des Tons beruht. Eine Musikeinleitung, eine Begrüßung in einer anderen Sprache oder ein kurzer Clip können irreführend sein. Verwenden Sie die anfängliche Aufforderung zur Eingabe von Namen, technischem Vokabular und erwarteter Schreibweise, nicht zum Hinzufügen von Inhalten, die in der Aufzeichnung nicht enthalten sind.

Führen Sie ein Projektglossar und testen Sie, ob jedes Backend Eingabeaufforderungen konsistent verwendet. Vergleichen Sie die Zahlen mit dem Audio. Bewahren Sie bei juristischen, medizinischen, akademischen oder journalistischen Arbeiten die Aufzeichnung auf und markieren Sie unsichere Passagen mit Zeitstempeln, anstatt stillschweigend zu raten.

Die Übersetzung ist ein separates Qualitätsproblem

Die Standardübersetzungsaufgabe von Whisper wandelt unterstützte Sprache in Englisch um. In der Dokumentation von Buzz wird darauf hingewiesen, dass Large-v3-turbo nicht mit diesem Standardübersetzungspfad kompatibel ist. Buzz unterstützt auch die Übersetzung über einen OpenAI-kompatiblen Sprachmodell-Endpunkt, einschließlich eines lokal gehosteten Endpunkts. Dieser zweite Pfad sendet erkannten Text – nicht unbedingt Originalton – an den konfigurierten Dienst, erfordert jedoch noch eine Datenschutz- und Qualitätsprüfung.

ArbeitsablaufVerwenden Sie wannÜberprüfung
Flüstersprache-zu-EnglischSchnelle englische Wiedergabe aus unterstützter QuellspracheVergleichen Sie ausgelassene Namen, Nummern und kulturelle Begriffe
Transkript, dann LLM-ÜbersetzungDie Zielsprache ist nicht Englisch und es kommt auch nicht auf die Stilkontrolle anÜberprüfen Sie zuerst das Originaltranskript und dann die zweisprachige Überprüfung
Lokaler OpenAI-kompatibler ÜbersetzerMedien/Text müssen auf kontrollierter Hardware verbleibenBestätigen Sie Endpunkt, Protokolle, Modelllizenz und Netzwerkisolation
Professioneller ÜbersetzerVeröffentlichung, rechtliche oder hochriskante BedeutungDer Mensch trennt sich von Audio und Kontext

Lassen Sie nicht zu, dass ein Sprachmodell den Untertitelzeilen Notizen, Zusammenfassungen oder erfundenen Kontext hinzufügt. Die offiziellen Dokumente empfehlen explizite Übersetzungsanweisungen; Validieren Sie außerdem die Zeilenanzahl, die Zeitzuordnung, benannte Entitäten und die Konsistenz über wiederholte Begriffe hinweg.

Sprecheridentifikation und Sprachtrennung

Buzz kann Sprecher anhand abgeschlossener Transkriptionen identifizieren und Sprache vor der Erkennung extrahieren/trennen. Bei diesen Funktionen handelt es sich um Hilfsmittel, nicht um eine Identitätsprüfung. Das Etikett gibt „Lautsprecher 1“ aus, bis ein Mensch die Stimme einer Person zuordnet. Schließen Sie niemals allein aus der Tagebuchführung auf Identität, Rolle, Geschlecht oder Absicht.

Vergleichen Sie die Trennung ein- und ausgeschaltet. Es kann Aufnahmen mit Hintergrundmusik verbessern, eine aggressive Verarbeitung kann jedoch Atemgeräusche, leise Sprache oder Überlappungen beeinträchtigen. Speichern Sie die unberührte Quelle, den verarbeiteten Titel und die Einstellungen. Wenn Beweise oder Archivintegrität wichtig sind, hashen Sie das Original und nehmen Sie Bearbeitungen an Kopien vor.

Untertitel-QA: Worte sind nur die halbe Miete

ÜberprüfenPraktische RegelGrund
TimingDie Bildunterschrift erscheint mit der Sprache und lässt genügend LesezeitZu späte Untertitel beeinträchtigen das Verständnis
ZeilenumbrücheBrechen Sie bei natürlichen Phrasen, nicht zwischen eng verbundenen WörternVerbessert das Scannen
LesegeschwindigkeitVerwenden Sie den Plattform-/PublikumszugänglichkeitsstandardDichte Untertitel können nicht gelesen werden
KlanghinweiseFügen Sie bei Bedarf aussagekräftiges Nicht-Sprach-Audio hinzuBarrierefreiheit umfasst mehr als Dialog
SprecherwechselMachen Sie eine Änderung eindeutig und ohne UnordnungWichtig in Interviews und Panels
Namen/NummernÜberprüfen Sie manuell anhand des maßgeblichen KontextsKleine Übertragungsfehler können die Bedeutung ändern

Buzz exportiert TXT, SRT und VTT, und das Projekt beschreibt auch CSV-Exporte in aktuellen Produktmaterialien. Testen Sie das genaue Format mit dem Zieleditor oder der Zielplattform. Behalten Sie UTF-8-Zeichen bei und prüfen Sie den ersten, mittleren und letzten Abschnitt auf Drift.

Für die Live-Transkription gilt ein strengeres Latenzbudget

Die offiziellen Dokumente warnen davor, dass die lokale Mikrofontranskription ressourcenintensiv ist und möglicherweise nicht in Echtzeit erfolgt. Messen Sie die Latenz zwischen Aufnahme und Anzeige, verpasstes Audio, Korrekturstabilität und thermische Drosselung über die gesamte Ereignisdauer. Verwenden Sie ein kabelgebundenes Mikrofon und deaktivieren Sie den Ruhezustand. Nutzen Sie einen menschlichen Untertitel oder eine Ersatzanzeige für wichtige Barrierefreiheitsereignisse.

Buzz bietet ein Präsentationsfenster und einen optionalen Live-Transkript-Export, der Software wie OBS füttern kann. Die Einstellungen dokumentieren auch eine Upload-URL, über die Transkript- oder Übersetzungstext an einen Server gesendet werden kann. Durch die Aktivierung wird aus einem lokalen Workflow eine Netzwerkoffenlegung; Authentifizieren Sie den Empfänger, verschlüsseln Sie den Transport und vermeiden Sie die öffentliche Offenlegung des Endpunkts.

Überprüfung des Datenschutzes und der lokalen Verarbeitung

  • Laden Sie Modelle herunter, bevor Sie eine isolierte Umgebung betreten, und überwachen Sie dann ausgehende Verbindungen während eines Tests.
  • Wählen Sie ein lokales Backend aus und lassen Sie die Schlüssel API leer, wenn die Cloud-Verarbeitung verboten ist.
  • Deaktivieren Sie den Live-Upload und die externe Übersetzung, sofern dies nicht ausdrücklich genehmigt wurde.
  • Überprüfen Sie temporäre Dateien, Exportordner, Listen der zuletzt verwendeten Dateien, Absturzprotokolle und Betriebssystemsicherungen.
  • Verschlüsseln Sie das Gerät und den Aufnahmespeicher. Arbeitskopien gemäß Aufbewahrungsrichtlinie löschen.
  • Holen Sie die Einwilligung zur Aufnahme und Transkription entsprechend der Gerichtsbarkeit und Umgebung ein.

Open-Source-Code verbessert die Prüfbarkeit, beweist jedoch nicht, dass eine Binärdatei sicher ist. Laden Sie über offizielle Veröffentlichungskanäle herunter, überprüfen Sie Signaturen oder Prüfsummen, sofern vorhanden, halten Sie Abhängigkeiten auf dem neuesten Stand und scannen Sie Installationsartefakte gemäß den Unternehmensrichtlinien.

Hardware- und Durchsatzentscheidungen

Echtzeitfaktor messen: Verarbeitungssekunden geteilt durch Audiosekunden. Ein Wert von 0,5 bedeutet, dass eine Stunde Audio etwa 30 Minuten dauert; 2,0 bedeutet etwa zwei Stunden. Aufnahmemodell, Backend, Quantisierung, Gerät, Beschleunigung, Dateiformat, Stapelgröße und Spitzenspeicher. Laptop-Akku, Hitze und gleichzeitige Bearbeitung können die Ergebnisse erheblich verändern.

Die Quantisierung reduziert den Speicher und kann die Geschwindigkeit verbessern, manchmal mit einem Kompromiss bei der Genauigkeit. Die Unterstützung von Vulkan kann Whisper.cpp auf einer breiteren Palette von GPUs beschleunigen, während die Pfade CUDA und Apple Silicon ihre eigenen Kompatibilitätsbedingungen haben. Ein sauberer Benchmark auf der tatsächlichen Maschine ist vertrauenswürdiger als generische Hardware-Behauptungen.

CLI und Batch-Automatisierung

Die Buzz CLI kann Dateien oder URLs hinzufügen, Transkribieren oder Übersetzen auswählen, Backend/Modell/Sprache auswählen, eine erste Eingabeaufforderung bereitstellen und SRT, VTT oder TXT exportieren. Es kann die GUI verbergen, was es für einen überwachten Ordner oder eine Medienpipeline nützlich macht. Die Automatisierung benötigt weiterhin kollisionssichere Dateinamen, Exit-Code-Prüfungen, Protokolle und Quarantäne für Fehler.

Buzz Add --Task Transcribe --Language de --Model-Type Whispercpp --Model-Size Small --Prompt "Namen: Ada Lovelace, Babbage" --srt --vtt Interview.mp4

Bestätigen Sie die CLI-Optionen anhand der installierten Version. Fixieren Sie die Version in der Produktion und führen Sie nach Upgrades ein bekanntes Fixture aus. Untertitelsegmentierung oder Backend-Änderungen können Downstream-Diffs ändern, selbst wenn der Befehl erfolgreich ist.

Alternativen

OptionBeste PassformKompromiss versus Buzz
BuzzPlattformübergreifende lokale GUI plus mehrere Whisper-BackendsDesktop-Ressourcen und manuelle Qualitätssicherung sind weiterhin erforderlich
Whisper.cpp CLISchlanke lokale oder eingebettete AutomatisierungWeniger integrierter Bearbeitungsworkflow
Faster Whisper SkripteBenutzerdefinierte GPU-Batch-PipelinesMehr Engineering und Abhängigkeitsmanagement
OpenAI Speech-to-Text APIVerwaltete Skalierung und minimale lokale RechenleistungUpload-, Preis- und Anbieterbedingungen
Descript / Premiere-TextwerkzeugeTranskription in einem BearbeitungsraumKommerzielles Ökosystem und weniger lokale Kontrolle
Menschliche Transkription/UntertitelungZugänglichkeit oder Veröffentlichung steht auf dem SpielHöhere direkte Kosten, aber rechenschaftspflichtige kontextbezogene Überprüfung

Häufig gestellte Fragen

Ist Buzz kostenlos?

Das offizielle Repository ist MIT-lizenziert und die Desktop-Software kann ohne Abonnement genutzt werden. Gehostete APIs, Hardware und Modelle von Drittanbietern können separate Kosten verursachen.

Funktioniert Buzz vollständig offline?

Ja für konfigurierte lokale Modell-Workflows, nachdem die erforderlichen Assets verfügbar sind. API Transkription, externe Übersetzung, URL-Import und Live-Upload nutzen das Netzwerk.

Welche Betriebssysteme werden unterstützt?

Das Projekt dokumentiert macOS, Windows und Linux mit plattformspezifischen Verteilungs- und Beschleunigungsoptionen.

Kann es Untertitel erstellen?

Ja. Es exportiert zeitgesteuerte Formate, einschließlich SRT und VTT. Menschliches Timing, Lesbarkeit und Überprüfung der Terminologie bleiben weiterhin erforderlich.

Kann es Sprecher identifizieren?

Es unterstützt die Sprecheridentifizierung auf transkribierten Medien, Etiketten erfordern jedoch eine menschliche Überprüfung und sind kein biometrischer Identitätsnachweis.

Kann es in andere Sprachen als Englisch übersetzt werden?

Buzz dokumentiert zusätzliche Übersetzung durch konfigurierbare OpenAI-kompatible KI-Dienste, einschließlich lokaler Endpunkte. Validieren Sie Datenschutz und Übersetzungsqualität separat.

Warum ist die Transkription langsam?

Modellgröße, Backend, Quantisierung, Beschleunigung, Audiolänge und Hardware spielen alle eine Rolle. Vergleichen Sie ein kleineres Modell und ein optimiertes Backend, bevor Sie Hardware kaufen.

Primärquellen

Zuletzt überprüft am 25. Juli 2026. Testen Sie die genaue Buzz-Version und das Backend auf repräsentativem Audio; Modellunterstützung, Beschleunigung und Vertriebspakete ändern sich im Laufe der Zeit.

Ready to try Buzz?

Visit the official website to get started

Visit Buzz

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/9/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper ist OpenAIs MIT-lizenzierte Modellfamilie und Python-Referenz für lokale mehrsprachige Spracherkennung, Untertitel und Sprachübersetzung ins Englische.

WhisperSpracherkennunglokale Transkription
960
Whisper.cpp

Whisper.cpp

Whisper.cpp ist eine abhängigkeitsarme C/C++-Implementierung von OpenAI Whisper für lokale Transkription, Übersetzung, Streaming, Server und eingebettete Apps. Dieser Leitfaden behandelt Modelle, Quantisierung, Backends, Genauigkeit, Datenschutz und Bereitstellung.

speech-recognitionfree
1080
WhisperDesktop

WhisperDesktop

WhisperDesktop ist eine Windows-Desktop-App und DirectCompute-Implementierung zum lokalen Ausführen von OpenAI Whisper auf Audio-, Video- und Mikrofoneingaben. In diesem Handbuch werden Einrichtung, Modelle, GPUs, Untertitel, Datenschutz und Alternativen behandelt.

WhisperDesktopOpenAI Whisperspeech recognition
1000
WhisperX

WhisperX

WhisperX ist eine Open-Source-Pipeline für lange Audiodateien, die faster-whisper-Batches um sprachspezifisches Wort-Alignment und optionale pyannote-Sprecherdiarisierung ergänzt.

WhisperXspeech alignmentspeaker diarization
1240