WhisperX
WhisperX

WhisperX

WhisperX ist eine Open-Source-Pipeline für lange Audiodateien, die faster-whisper-Batches um sprachspezifisches Wort-Alignment und optionale pyannote-Sprecherdiarisierung ergänzt.

119

Views

0

Likes

Jan 2026

Added

github.com

Projektlink

Tags

WhisperXspeech alignmentspeaker diarizationlong-form ASR

Product Preview

A quick visual look at WhisperX before you visit the official site.

Published 1/21/2026
WhisperX screenshot

Editorial Review

About WhisperX

WhisperX ist eine von Max Bain und der Community gepflegte Open-Source-Pipeline für lange Audioaufnahmen. Sie verbindet Sprachaktivitätserkennung, Batch-Transkription über faster-whisper/CTranslate2, sprachspezifische erzwungene Ausrichtung und optionale Sprecherdiarisierung mit pyannote. Das Ergebnis ist nicht nur „Whisper schneller“, sondern Text mit feineren Wortzeiten und anonymen Sprecherlabels. Jede Stufe verwendet ein eigenes Modell und besitzt eine eigene Fehlerklasse.

WhisperX ersetzt den zugrunde liegenden Spracherkenner nicht durch ein neues universelles ASR-Modell. Es segmentiert anders, transkribiert gebündelt, richtet den erkannten Text mit einem Phonemmodell am Audio aus und kann die Wortzeiten mit Sprecherintervallen zusammenführen. Falscher Text wird durch präziser aussehende Zeitstempel nicht wahr. Fehlt ein Zeichen, eine Zahl oder ein Schriftsystem im Alignermodell, ist die Zeit eventuell interpoliert. Bei gleichzeitigem Sprechen kann ein sauber wirkendes SPEAKER_00-Label trotzdem falsch sein.

WhisperX-Produktionspipeline von VAD und Batch-Transkription über Forced Alignment und Diarisierung bis zur Qualitätskontrolle
Nachvollziehbare Darstellung auf Grundlage von offiziellem README, Paper und aktuellem Code. Transkript, Wortzeiten und Sprecherzuordnung werden getrennt geprüft.

Was WhisperX zu Whisper hinzufügt

StufeImplementierungNutzenFehlergrenze
Sprachsegmentepyannote- oder Silero-VAD, Cut & MergeSprachzentrierte Chunks für BatchLeise Sprache kann fehlen; Turns können verschmelzen
Transkriptionfaster-whisper/CTranslate2Batch und QuantisierungsoptionenAnderes Decoding als Upstream Whisper
Forced AlignmentSprachspezifisches wav2vec2/Phonem-ASROrdnet erkannte Wörter feineren Zeiten zuZeichen, Zahlen, Symbole, Sprache können scheitern
Diarisierungpyannote Community-1Anonyme Sprecherlabels für Wörter/SegmenteÜberlappung, kurze Turns, ähnliche Stimmen; keine Namen
AusgabeSRT, VTT, TSV, TXT, JSONUntertitel und WeiterverarbeitungLesetempo, Umbruch und Inhalt benötigen Review

Das ursprüngliche Paper behandelt drei Langformprobleme: Whisper mit Puffer-/Fensterverarbeitung kann driften, wiederholen oder halluzinieren; sequenzielles Decoding erschwert einfaches Batching; Äußerungszeiten sind für Wortediting zu grob. VAD Cut & Merge ermöglicht Batch-Inferenz, das Phonem-Alignment ergänzt Wortzeiten nach der Erkennung. Die gemeldeten Geschwindigkeiten und Fehlermaße gehören zu den dokumentierten Modellen, Daten und GPUs. Wir machen daraus keine universelle Geschwindigkeits- oder WER-Zusage für heutige Releases.

Aktueller Projekt- und Abhängigkeitsstand

WhisperX wird weiter gepflegt. Bei der Prüfung war v3.8.6 der neueste stabile GitHub-Release; die Metadaten auf main nannten bereits 3.8.7rc1. Neuere Releases reparierten Wortzeiten für nicht alignierbare Zeichen, ergänzten Fortschritts-Callbacks und passten Torch/TorchCodec-Kompatibilität an. Das belegt Aktivität, zeigt aber auch, warum Produktion einen geprüften Release pinnen sollte, statt bei jedem Build main zu installieren.

AbhängigkeitsgrenzeAktuelle AnforderungBetriebliche Folge
Python3.10 bis unter 3.14Isolierte Umgebung; Systemupgrade kann brechen
ASR-Laufzeitfaster-whisper≥1.2, CTranslate2≥4.5CUDA, Modelle und Decoding regressionsprüfen
PyTorch-FamilieTorch/Torchaudio um 2.8Wheel, Treiber und CUDA müssen passen
Diarisierungpyannote.audio≥4TorchCodec, Modellgating und zweiter Modelllebenszyklus
LizenzenWhisperX BSD-2; Modelle/Abhängigkeiten separatNotices und Modellbedingungen einzeln verwalten

Installation und kontrollierter Erstlauf

python -m venv .venv
source .venv/bin/activate
pip install whisperx
whisperx meeting.wav --model large-v2 --batch_size 4 --output_format json
whisperx meeting.wav --diarize --hf_token "$HF_TOKEN"

Das README empfiehlt PyPI für normale Nutzung und warnt vor experimentellen Änderungen der Entwicklungsversion. Die GPU-Anleitung nennt aktuell CUDA 12.8. CPU-Betrieb ist mit --device cpu --compute_type int8 möglich, doch Tempo und Qualität müssen gemessen werden. Bei GPU-Speichermangel zuerst Batchgröße reduzieren, dann ein kleineres ASR-Modell oder int8 prüfen; beide letzteren können die Erkennung ändern. Der Hugging-Face-Token dient nur dem Download gegateter Modelle und gehört weder in Shell-Historie noch Quellcode oder Metadaten.

Produktionsablauf für lange Aufnahmen

  1. Einwilligung einholen.Zweck, Quelle, Aufbewahrung und Zugriffsberechtigte der Aufnahme dokumentieren.
  2. Original bewahren.Arbeitskopie konsistent decodieren und Kanalinformation vor Mono-Konvertierung erhalten.
  3. Privates Testset bauen.Stille, Lärm, Musik, Überlappung, Unterbrechungen, Namen, Zahlen, Sprachwechsel und Maximallänge aufnehmen.
  4. Gesamten Stack pinnen.WhisperX, faster-whisper, ASR-Checkpoint, Alignermodell, VAD, pyannote, Torch/CUDA und Compute-Type notieren.
  5. VAD und Batch kalibrieren.Abgeschnittene Sprache, falsche Sprachsegmente, GPU-Speicher und Echtzeitfaktor gemeinsam messen.
  6. Rohtranskript erhalten.Segmente vor Alignment speichern, damit eine Alignmentstörung die ASR-Hypothese nicht verdeckt.
  7. Ausnahmen markieren.Echt alignierte, interpolierte und nicht alignierte Wörter unterscheiden und Zeitdrift über die gesamte Datei testen.
  8. Nur bei Bedarf diarisierren.Token geheim halten, bekannte Sprecherzahl begrenzen und Überlappung/kurze Turns inspizieren.
  9. Freigabegates anwenden.Namen, Zahlen, Negation, Halluzination, Wortzeit, Sprecherwechsel und Untertitellesbarkeit prüfen.
  10. Mit Manifest exportieren.JSON und SRT/VTT, Modellkonfiguration, Reviewstatus und Löschdatum zusammen speichern.

Alignment-Sprachen und transparente Fehler

Forced Alignment ist sprachspezifisch. Das README nennt Standard-Torchaudio-Pipelines für Englisch, Französisch, Deutsch, Spanisch und Italienisch sowie weitere Mappings in DEFAULT_ALIGN_MODELS_HF. Fehlt die erkannte Sprache, ist ein geeignetes Phonem-ASR über --align_model zu liefern und an repräsentativer Sprache zu testen. Dass Whisper eine Sprache transkribiert, beweist nicht, dass WhisperX jedes Wort ausrichten kann.

Zahlen, Währungen, Symbole, gemischte Schriften, Code-Switching und ungewöhnliche Schreibweisen können außerhalb des Zeichensatzes liegen. Neuere Releases verbesserten die Zeitbehandlung, doch nearest/linear-Interpolation ist nur eine nützliche Schätzung, kein akustischer Nachweis. ignore lässt die Lücke sichtbar. Downstream-Daten sollten aligned/interpolated erhalten und nicht alle Zeiten gleich sicher darstellen.

FallRisikoKontrolle
Zahlen/WährungSchreibform fehlt im WörterbuchJahre, Preise, Daten, Einheiten separat
SprachwechselEin Modell deckt beide Schriften nicht abSprachregionen teilen oder validierten Aligner nutzen
EigennamenASR-Schreibung passt nicht zum PhonemlexikonText und Zeit gegen Menschenreferenz
Musik/StilleVAD und ASR widersprechen sichFalsche Sprache und Halluzination labeln
ÜberlappungAlle drei Stufen werden schlechterÜberlappungsset und unsichere Sprecher erlauben
Kurze TurnsZu wenig Überdeckung von Wort und SprecherintervallUnterbrechungsgrenzen prüfen

pyannote: Zugriff, Lizenz und Bedeutung

Die aktuelle CLI verwendet standardmäßig pyannote/speaker-diarization-community-1. Nutzer müssen die gegateten Bedingungen akzeptieren und einen Hugging-Face-Access-Token erstellen. Die Model Card bezeichnet Community-1 als CC-BY-4.0 und beschreibt lokalen Offline-Betrieb nach dem Download. Diese Modellbedingungen sind getrennt von WhisperX BSD-2 und den Bedingungen der Whisper/faster-whisper-Modelle.

Diarisierung beantwortet, welcher anonyme Cluster wann spricht; sie identifiziert keine Person. SPEAKER_00 kann zwischen Dateien wechseln, einen Menschen teilen oder ähnliche Stimmen zusammenführen. min/max_speakers begrenzt das Problem, garantiert aber keine richtige Zuordnung. Überlappende Sprache ist eine ausdrücklich genannte Einschränkung. Für Recht, Forschung, Callcenter oder Klinik bleibt das Audio erhalten, und Sprecherzuordnung wird als prüfbare Metadaten behandelt.

Vergleich mit angrenzenden Optionen

OptionWählen wennHaupt-Trade-off
WhisperXLange Dateien brauchen Batch, Wortzeiten und lokale anonyme SprecherMehrere Modelle und zusammengesetzte Fehler
OpenAI WhisperUpstream-Python und einfacheres ModellverhaltenGröbere Zeiten, keine native Diarisierung/Langform-Batchpipeline
faster-whisperCTranslate2-Durchsatz ohne Alignment genügtAlignment/Diarisierung und QA selbst ergänzen
whisper.cppC/C++, CPU, Apple Silicon, Mobil/Edge/OfflineAnderes Deployment; Pipeline nicht enthalten
Managed APIBetrieb, Skalierung und aktuelle Hosted-Modelle delegierenDaten verlassen Grenze, Kosten und Funktionsunterschiede

Unabhängiges Urteil:WhisperX ist eine Produktionspipeline nach dem ASR, kein Schalter, der Text automatisch genauer macht. Es lohnt sich, wenn Wortzeiten und anonyme Sprecher erheblich Redaktionszeit sparen. Reicht einfacher Text, fehlt ein validierter Aligner, dominiert überlappende Sprache oder kann das Team die Python/Torch/CUDA/Modellmatrix nicht pflegen, sind faster-whisper, Upstream Whisper, whisper.cpp oder ein verwalteter Dienst betrieblich oft verlässlicher.

Häufige Fragen

Ist WhisperX ein neues ASR-Modell?

Nicht im üblichen Sinn. Es nutzt Whisper-Familien über faster-whisper und ergänzt VAD, Forced Alignment und optional pyannote.

Garantiert es wortgenaue Zeiten?

Nein. Nicht unterstützte Zeichen, Zahlen, Symbole, gemischte Schrift oder falsches Sprachmodell können scheitern; Interpolation ist eine Schätzung.

Erkennt es Menschen beim Namen?

Nein. Die Ausgabe sind anonyme Cluster wie SPEAKER_00. Eine reale Identität benötigt separate Belege.

Brauche ich einen HF-Token?

Für Kerntranskription nein. Der Standardweg zur pyannote-Diarisierung verlangt Zustimmung und Token für den Modelldownload.

Läuft es offline?

Nach lokalem Download aller ASR-, Alignment- und Sprecherressourcen ja. Anwendungsegress, Logs, Cache und Speicherung sind trotzdem zu prüfen.

Warum ist der GPU-Speicher voll?

Batch, ASR-Modell, Compute-Type, Alignment und Diarisierung verbrauchen Ressourcen. Zuerst Batch reduzieren, Qualitätsänderungen messen.

Ist es bei überlappenden Sprechern zuverlässig?

Nicht als Ground Truth. Projekt und Model Card weisen auf Überlappung und unvollkommene Diarisierung hin.

Welche Sprachen lassen sich alignieren?

Es gibt Torchaudio-Defaults und HF-Mappings in alignment.py. Fehlt eine Sprache, einen geprüften Phonem-Aliner liefern oder transparent überspringen.

Geprüfte Quellen

Unabhängige technische Prüfung: 2026-08-20. Versionen, Abhängigkeiten, Modellzugriff und Sprachmappings ändern sich. Primärquellen pinnen und privat evaluieren.

WhisperX an der offiziellen Quelle prüfen

Öffnet Repository, Dokumentation oder Modellressourcen.

Offizielle Quelle öffnen

Quick Info

Projektlink
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/6/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper ist OpenAIs MIT-lizenzierte Modellfamilie und Python-Referenz für lokale mehrsprachige Spracherkennung, Untertitel und Sprachübersetzung ins Englische.

WhisperSpracherkennunglokale Transkription
920
Whisper.cpp

Whisper.cpp

Whisper.cpp ist eine abhängigkeitsarme C/C++-Implementierung von OpenAI Whisper für lokale Transkription, Übersetzung, Streaming, Server und eingebettete Apps. Dieser Leitfaden behandelt Modelle, Quantisierung, Backends, Genauigkeit, Datenschutz und Bereitstellung.

speech-recognitionfree
1040
Buzz

Buzz

Buzz ist eine kostenlose, vom MIT lizenzierte Desktop-App für lokale Whisper-Transkription, Untertitel, Live-Untertitel, Übersetzung und Sprecherkennzeichnung auf macOS, Windows und Linux. In diesem Leitfaden werden Backends, Hardware, Datenschutz, Genauigkeitstests, Untertitel-Qualitätssicherung, CLI-Automatisierung und Cloud-Alternativen verglichen.

BuzzBuzz CaptionsOffline Transkription
1320
WhisperDesktop

WhisperDesktop

WhisperDesktop ist eine Windows-Desktop-App und DirectCompute-Implementierung zum lokalen Ausführen von OpenAI Whisper auf Audio-, Video- und Mikrofoneingaben. In diesem Handbuch werden Einrichtung, Modelle, GPUs, Untertitel, Datenschutz und Alternativen behandelt.

WhisperDesktopOpenAI Whisperspeech recognition
940