Whisper bezeichnet sowohl OpenAIs Familie frei verfügbarer Encoder-Decoder-Sprachmodelle als auch die MIT-lizenzierte Python-Referenzimplementierung. Das System transkribiert Sprache in der gesprochenen Sprache, erkennt die Sprache und kann mit geeigneten mehrsprachigen Checkpoints Sprache ins Englische übersetzen. Das GitHub-Projekt ist jedoch kein fertiger Transkriptionsdienst: Installation, Rechenleistung, Dateiverarbeitung, Datenschutz, Warteschlangen, Überwachung und redaktionelle Prüfung bleiben Aufgabe des Betreibers.
Drei ähnlich benannte Ebenen werden oft verwechselt. openai-whisper ist das Python-Paket für herunterladbare Modelle. whisper-1 ist ein separat betriebener Modellname in OpenAIs Audio API. faster-whisper, whisper.cpp, WhisperX und Weboberflächen sind unabhängige Laufzeiten oder Pipelines rund um Whisper-Gewichte. Aussagen zu Tempo, Kosten und Datenfluss sind nur sinnvoll, wenn die gemeinte Ebene genannt wird.

Die Entscheidung in einem Satz
Whisper passt, wenn ein nachvollziehbarer Upstream-Baseline, lokale Kontrolle und breite Ökosystem-Kompatibilität wichtiger sind als ein vollständig verwalteter Dienst und das Team Rechenleistung sowie Qualitätssicherung selbst betreiben kann. Für weniger Betriebsaufwand ist eine API zu prüfen; für CPU/Edge, hohen Durchsatz, Wortausrichtung oder Sprechertrennung sind spezialisierte Laufzeiten oft geeigneter.
Der bleibende Vorteil ist nicht die Behauptung, jedes aktuelle Speech-Benchmark zu gewinnen. Entscheidend ist die Wahlfreiheit: dieselbe Modellfamilie lässt sich im Forschungsnotebook, auf einer Offline-Workstation, in einem GPU-Batch-Worker oder in einer Edge-Laufzeit verwenden. Daher eignet sich Whisper als gemeinsamer Vergleichspunkt. Die Leistung eines Wrappers auf einer bestimmten Maschine ist aber keine automatische Zusage des Upstream-Projekts.
Was enthalten ist – und was nicht
| Ebene | Enthalten | Zusätzlich erforderlich |
|---|---|---|
| Checkpoints | Englische und mehrsprachige Gewichte in mehreren Größen | Speicher, Laufzeit und Inferenzhardware |
| Python-Paket | CLI, API, Decodierung sowie TXT/SRT/VTT/JSON-Ausgabe | FFmpeg, Deployment, Queue, Wiederholung und Monitoring |
| Transkription | Text in Originalsprache, Segment- und optionale Wortzeiten | Korrektur, Diarisierung und Fachevaluation |
| Sprachübersetzung | Geeignete Modelle übersetzen gesprochene Sprache ins Englische | Andere Zielsprachen; turbo ist nicht für Übersetzung trainiert |
| MIT-Lizenz | Nutzung, Änderung und Verteilung unter Lizenzbedingungen | Rechte an Aufnahmen, Einwilligung, Hinweise und Compliance |
Whisper ist weder Sprecherdiarisierung noch Meeting-Editor, Einwilligungsverwaltung, Audit-Log oder Compliance-Produkt. Die Upstream-Software liefert auch keinen produktionsfertigen Echtzeitdienst. Zusatzfunktionen eines Drittprojekts dürfen nicht als native Whisper-Funktionen dargestellt werden.
Modelle und Deployment auswählen
| Modell | Parameter | VRAM ungefähr | Relatives Tempo* | Sinnvoller Start |
|---|---|---|---|---|
| tiny / tiny.en | 39 Mio. | ca. 1 GB | ca. 10× | Prototyping |
| base / base.en | 74 Mio. | ca. 1 GB | ca. 7× | Schnelle lokale Entwürfe |
| small / small.en | 244 Mio. | ca. 2 GB | ca. 4× | Ausgewogener Einstieg |
| medium / medium.en | 769 Mio. | ca. 5 GB | ca. 2× | Qualitätsorientiert |
| large | 1,55 Mrd. | ca. 10 GB | 1× | Mehrsprachige Qualität |
| turbo | 809 Mio. | ca. 6 GB | ca. 8× | Schnelle Transkription, keine Übersetzung |
*Werte aus OpenAIs README für englische Transkription auf einer A100 relativ zu large, geprüft am 2026-08-20. Sprache, Audio, Hardware und Laufzeit verändern die reale Geschwindigkeit; dies ist keine allgemeine Latenzzusage.
tiny, base, small und medium gibt es mehrsprachig sowie als .en-Variante. OpenAI beschreibt den Vorteil der Englischmodelle besonders bei tiny und base; bei small und medium wird der Abstand kleiner. Für schnelle GPU-Transkription ist turbo ein plausibler erster Test, small ist eine sparsamere mehrsprachige Baseline und bei ausschließlich englischem Material gehört die passende .en-Variante in den Vergleich. Für Übersetzung gesprochener Sprache ins Englische sollte medium oder large statt turbo verwendet werden.
„98 unterstützte Sprachen“ bezeichnet Abdeckung, nicht gleiche Genauigkeit. Die offizielle Model Card nennt Unterschiede nach Trainingsmenge, Sprache, Akzent und Dialekt. Bei bekannten einsprachigen Jobs kann eine Sprachvorgabe einen Fehlerfaktor entfernen. Aufnahmen mit Sprachwechseln benötigen eigene Testfälle; ein einziges automatisch erkanntes Sprachlabel reicht nicht als Qualitätsnachweis.
Lokale Installation und reproduzierbarer Erstlauf
Der Upstream-Weg besteht aus openai-whisper, systemweit verfügbarem FFmpeg, einem gewählten Checkpoint und der CLI oder Python-API. Die aktuellen Paketmetadaten verlangen Python 3.8 oder neuer und führen Klassifizierer bis 3.13, während der README-Text konservativer ist. In Produktion sollten Paket-Commit, Modellname und Abhängigkeiten festgehalten werden; ein unbemerktes Mitlaufen mit main verhindert reproduzierbare Fehleranalysen.
python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
--output_dir transcriptsDie CLI schreibt TXT, VTT, SRT, TSV und JSON. transcribe() verarbeitet Dateien mit einem gleitenden 30-Sekunden-Fenster und liefert Gesamttext, Segmente und erkannte Sprache. Ein Erstlauf enthält den Modelldownload; messen Sie Kaltstart und warme Inferenz getrennt. CPU-Betrieb ist möglich, kann bei größeren Checkpoints jedoch langsam sein. Auch die VRAM-Angaben sind Planungshilfen, keine Garantie.
Praxisablauf für Batch und Untertitel
- Ausgabeziel definieren.Suchnotizen, Rohuntertitel, veröffentlichter Text und Beweismaterial benötigen unterschiedliche Prüftiefen.
- Privates Testset bauen.Saubere Sprache, Lärm, Stille, Musik, Akzente, Sprachwechsel, Eigennamen, Zahlen und Maximallänge mit geprüfter Referenz abdecken.
- Audioverarbeitung trennen.Original bewahren und konsistent decodieren. VAD oder Entrauschung erst nach Messung abgeschnittener Wörter und Halluzinationen übernehmen.
- Kontrolliert vergleichen.Hardware, Laufzeit, Sprachhinweis und Decodierung konstant halten; zwei bis drei Modelle und den Echtzeitfaktor protokollieren.
- Fehlerklassen prüfen.Namen, Zahlen, Verneinungen, Text über Stille, Wiederholungen, Sprachwechsel und Zeitdrift getrennt vom mittleren WER bewerten.
- Lieferformat erzeugen.SRT/VTT oder JSON ausgeben; Zeilenlänge, Lesegeschwindigkeit, Interpunktion und Sprecherregeln separat anwenden.
- Bei Folgen menschlich prüfen.Medizin, Recht, Personal, Forschungszitate und Barrierefreiheit erfordern Rückhören im Original.
Audio + Einwilligung
↓
konsistente Decodierung / optionale VAD ── Original bewahren
↓
Modell + Sprache + protokollierte Einstellungen
↓
Stille · Wiederholung · Namen · Zahlen · Zeitdrift prüfen
↓
Menschliche Prüfung ── Export ── Aufbewahrung/Löschung
Genauigkeit, Halluzination und belastbare Evaluation
Das Whisper-Paper zeigte mit 680.000 Stunden schwach überwachtem, mehrsprachigem und multitaskigem Audio eine starke Zero-Shot-Robustheit. Dieselbe Trainingsart gehört zu den Grenzen. Die offizielle Model Card warnt vor nicht gesprochenem, aber plausibel klingendem Text, Wiederholungen und ungleicher Leistung zwischen Sprachen, Akzenten und Dialekten. Stille, Musik, Rauschen und undeutliche Sprache müssen deshalb ausdrücklich getestet werden.
| Messgröße | Anwendung | Blinder Fleck |
|---|---|---|
| WER/CER | Mit menschlicher Referenz vergleichen; CER bei ungeeigneter Wortsegmentierung | Schwere eines falschen Namens, einer Negation oder Zahl |
| Entitäten/Zahlen | Personen, Produkte, Daten, Dosen, Preise und Einheiten separat bewerten | Allgemeine Flüssigkeit |
| Halluzinierte Segmente | Text in Nicht-Sprach- oder unbelegten Bereichen markieren | Normale Ersetzungen in echter Sprache |
| Zeitdrift | Grenzen am Anfang, in der Mitte und am Ende langer Dateien prüfen | Wortgenauigkeit |
| Echtzeitfaktor | Verarbeitungszeit durch Audiodauer | Download, Warteschlange und Redaktion |
| Prüfminuten je Audiostunde | Menschliche Korrekturzeit erfassen | Infrastrukturkosten |
Diese Seite nennt keinen einzelnen „Whisper-WER“, weil ein Wert ohne Checkpoint, Sprache, Datensatz, Vorverarbeitung und Decodierung irreführend wäre. Für publizierte Benchmarks sind die offizielle Sprachgrafik und die Paper-Anhänge maßgeblich. Eine Betriebsentscheidung sollte auf einem versionierten privaten Korpus beruhen.
Prompts können Fachbegriffe und Eigennamen begünstigen, sind aber keine Garantie und können selbst in der Ausgabe erscheinen. Temperaturrückfall, Kontext vom vorherigen Segment, Schwellenwerte, Wortzeiten und Halluzinationsoptionen sollten nur gegen ein festes Testset verändert werden. Sonst tauscht man Fehlerarten, ohne die Wirkung zu kennen.
Datenschutz, Sicherheit und Betriebsgrenzen
| Grenze | Praktische Kontrolle |
|---|---|
| Lokale Verarbeitung | Gewichtsquelle und Egress kontrollieren, Originale/Ergebnisse verschlüsseln, Löschung definieren |
| Einwilligung | Berechtigung für Aufnahme und Transkription klären; die Model Card warnt vor Aufnahmen ohne Zustimmung |
| Folgenreiche Nutzung | Ungeprüfte Transkripte nicht allein für Medizin, Recht oder Personalentscheidungen nutzen |
| Diarisierung | Als eigenes Modell evaluieren; Whisper belegt nicht, wer etwas gesagt hat |
| Echtzeit | Upstream ist kein fertiges Streamingprodukt; Puffer und Latenz gehören zum Wrapper |
| Wartung | Pakete/Modelle pinnen, Abhängigkeiten prüfen, Regressionstest vor Updates |
| Lizenz | MIT-Hinweis erhalten und Rechte an Audio, Text und Drittkomponenten separat prüfen |
Whisper im Vergleich zu angrenzenden Optionen
| Option | Sinnvoll wenn | Wichtigster Trade-off |
|---|---|---|
| openai-whisper | Upstream-Python-Baseline und einsehbare lokale Ausführung | Performance, Batch und Betrieb selbst bauen |
| faster-whisper | CTranslate2-Durchsatz auf GPU/CPU, Quantisierung und Batch | Eigene Implementierung; Regression zum Upstream nötig |
| whisper.cpp | C/C++, CPU, Apple Silicon, Mobil/Edge und Offline | Build-Varianten und Modellkonvertierung verwalten |
| WhisperX | Langform-Batch, Wortausrichtung, optionale Sprechertrennung | Weitere Modelle, Abhängigkeiten und Lizenzen |
| OpenAI Transcription API | Verwaltete Inferenz und aktuelle Sprachmodelle | Externer Datenfluss, nutzungsbasierte Kosten, API-Limits |
OpenAIs aktueller Leitfaden empfiehlt gpt-transcribe für gewöhnliche Dateitranskription und nennt whisper-1 für Wort-/Segmentzeiten, Untertitelformate oder Übersetzung ins Englische. Am 2026-08-20 listete die offizielle Preistabelle geschätzte $0,0045/Minute für gpt-transcribe, $0,006 für gpt-4o-transcribe und $0,003 für die Mini-Variante. Preise und Modelle sind dynamisch und müssen vor der Budgetierung erneut geprüft werden. Das Uploadlimit ist mit 25 MB angegeben.
Häufige Fragen
Ist Whisper kostenlos?
Upstream-Code und veröffentlichte Modelle stehen unter MIT, daher fällt für Self-Hosting keine Minutenlizenz an. Rechenleistung, Speicher, Entwicklung und Prüfung kosten trotzdem Geld. Die OpenAI-API ist ein separater kostenpflichtiger Dienst.
Kann Whisper vollständig offline laufen?
Wenn Abhängigkeiten und Modell vorab lokal vorliegen, kann die Inferenz ohne Audio-Upload arbeiten. Für ein Air-Gap-Versprechen müssen zusätzlich Anwendung, Telemetrie, Logs und Speicherung geprüft werden.
Welches Modell sollte ich wählen?
Für schnelle GPU-Transkription mit turbo beginnen, small als ausgewogene Baseline und .en bei rein englischem Material vergleichen. Mindestens zwei Größen am eigenen Audio testen; turbo nicht für Übersetzung ins Englische verwenden.
Erkennt Whisper Sprecher?
Nein. Sprecherdiarisierung ist keine native Whisper-Funktion. WhisperX und ähnliche Pipelines fügen separate Modelle hinzu, deren Qualität, Rechte und Betrieb ebenfalls bewertet werden müssen.
Kann Whisper live transkribieren?
Das Upstream-Paket ist kein fertiger Streamingdienst. Drittimplementierungen können Chunks nahezu in Echtzeit verarbeiten; VAD, Puffer, Kontext und Latenz sind dann Eigenschaften dieser Implementierung.
Warum entstehen Wiederholungen oder erfundene Sätze?
Die offizielle Model Card nennt beides als bekannte Fehler. Stille und Musik gehören ins Testset; flüssige Sprache darf nicht mit treuer Wiedergabe verwechselt werden. Wichtige Passagen müssen zurückgehört werden.
Geprüfte Quellen
- Offizielles OpenAI-Whisper-Repository
- Offizielles README
- Offizielle Model Card
- MIT-Lizenz
- Whisper-Paper
- OpenAI Audio API Leitfaden
- OpenAI API Preise
- faster-whisper
- whisper.cpp
- WhisperX
Unabhängige technische Prüfung: 2026-08-20. Modelle, Dokumentation, API und Preise können sich ändern. Vor dem Einsatz Primärquellen und private Evaluation erneut prüfen.


