Whisper
Whisper

Whisper

Whisper ist OpenAIs MIT-lizenzierte Modellfamilie und Python-Referenz für lokale mehrsprachige Spracherkennung, Untertitel und Sprachübersetzung ins Englische.

92

Views

0

Likes

Jan 2026

Added

github.com

Projektlink

Tags

WhisperSpracherkennunglokale TranskriptionOpen-Source ASRUntertitel

Product Preview

A quick visual look at Whisper before you visit the official site.

Published 1/21/2026
Whisper screenshot

Editorial Review

About Whisper

Whisper bezeichnet sowohl OpenAIs Familie frei verfügbarer Encoder-Decoder-Sprachmodelle als auch die MIT-lizenzierte Python-Referenzimplementierung. Das System transkribiert Sprache in der gesprochenen Sprache, erkennt die Sprache und kann mit geeigneten mehrsprachigen Checkpoints Sprache ins Englische übersetzen. Das GitHub-Projekt ist jedoch kein fertiger Transkriptionsdienst: Installation, Rechenleistung, Dateiverarbeitung, Datenschutz, Warteschlangen, Überwachung und redaktionelle Prüfung bleiben Aufgabe des Betreibers.

Drei ähnlich benannte Ebenen werden oft verwechselt. openai-whisper ist das Python-Paket für herunterladbare Modelle. whisper-1 ist ein separat betriebener Modellname in OpenAIs Audio API. faster-whisper, whisper.cpp, WhisperX und Weboberflächen sind unabhängige Laufzeiten oder Pipelines rund um Whisper-Gewichte. Aussagen zu Tempo, Kosten und Datenfluss sind nur sinnvoll, wenn die gemeinte Ebene genannt wird.

Offizielle OpenAI-Architektur von Whisper für mehrsprachige Spracherkennung
OpenAIs offizielle Darstellung: Ein log-Mel-Spektrogramm wird codiert; spezielle Tokens steuern Sprache, Aufgabe, Zeitstempel, Transkription und Übersetzung.

Die Entscheidung in einem Satz

Whisper passt, wenn ein nachvollziehbarer Upstream-Baseline, lokale Kontrolle und breite Ökosystem-Kompatibilität wichtiger sind als ein vollständig verwalteter Dienst und das Team Rechenleistung sowie Qualitätssicherung selbst betreiben kann. Für weniger Betriebsaufwand ist eine API zu prüfen; für CPU/Edge, hohen Durchsatz, Wortausrichtung oder Sprechertrennung sind spezialisierte Laufzeiten oft geeigneter.

Der bleibende Vorteil ist nicht die Behauptung, jedes aktuelle Speech-Benchmark zu gewinnen. Entscheidend ist die Wahlfreiheit: dieselbe Modellfamilie lässt sich im Forschungsnotebook, auf einer Offline-Workstation, in einem GPU-Batch-Worker oder in einer Edge-Laufzeit verwenden. Daher eignet sich Whisper als gemeinsamer Vergleichspunkt. Die Leistung eines Wrappers auf einer bestimmten Maschine ist aber keine automatische Zusage des Upstream-Projekts.

Was enthalten ist – und was nicht

EbeneEnthaltenZusätzlich erforderlich
CheckpointsEnglische und mehrsprachige Gewichte in mehreren GrößenSpeicher, Laufzeit und Inferenzhardware
Python-PaketCLI, API, Decodierung sowie TXT/SRT/VTT/JSON-AusgabeFFmpeg, Deployment, Queue, Wiederholung und Monitoring
TranskriptionText in Originalsprache, Segment- und optionale WortzeitenKorrektur, Diarisierung und Fachevaluation
SprachübersetzungGeeignete Modelle übersetzen gesprochene Sprache ins EnglischeAndere Zielsprachen; turbo ist nicht für Übersetzung trainiert
MIT-LizenzNutzung, Änderung und Verteilung unter LizenzbedingungenRechte an Aufnahmen, Einwilligung, Hinweise und Compliance

Whisper ist weder Sprecherdiarisierung noch Meeting-Editor, Einwilligungsverwaltung, Audit-Log oder Compliance-Produkt. Die Upstream-Software liefert auch keinen produktionsfertigen Echtzeitdienst. Zusatzfunktionen eines Drittprojekts dürfen nicht als native Whisper-Funktionen dargestellt werden.

Modelle und Deployment auswählen

ModellParameterVRAM ungefährRelatives Tempo*Sinnvoller Start
tiny / tiny.en39 Mio.ca. 1 GBca. 10×Prototyping
base / base.en74 Mio.ca. 1 GBca. 7×Schnelle lokale Entwürfe
small / small.en244 Mio.ca. 2 GBca. 4×Ausgewogener Einstieg
medium / medium.en769 Mio.ca. 5 GBca. 2×Qualitätsorientiert
large1,55 Mrd.ca. 10 GBMehrsprachige Qualität
turbo809 Mio.ca. 6 GBca. 8×Schnelle Transkription, keine Übersetzung

*Werte aus OpenAIs README für englische Transkription auf einer A100 relativ zu large, geprüft am 2026-08-20. Sprache, Audio, Hardware und Laufzeit verändern die reale Geschwindigkeit; dies ist keine allgemeine Latenzzusage.

tiny, base, small und medium gibt es mehrsprachig sowie als .en-Variante. OpenAI beschreibt den Vorteil der Englischmodelle besonders bei tiny und base; bei small und medium wird der Abstand kleiner. Für schnelle GPU-Transkription ist turbo ein plausibler erster Test, small ist eine sparsamere mehrsprachige Baseline und bei ausschließlich englischem Material gehört die passende .en-Variante in den Vergleich. Für Übersetzung gesprochener Sprache ins Englische sollte medium oder large statt turbo verwendet werden.

„98 unterstützte Sprachen“ bezeichnet Abdeckung, nicht gleiche Genauigkeit. Die offizielle Model Card nennt Unterschiede nach Trainingsmenge, Sprache, Akzent und Dialekt. Bei bekannten einsprachigen Jobs kann eine Sprachvorgabe einen Fehlerfaktor entfernen. Aufnahmen mit Sprachwechseln benötigen eigene Testfälle; ein einziges automatisch erkanntes Sprachlabel reicht nicht als Qualitätsnachweis.

Offizieller Fehlervergleich von Whisper large-v3 und large-v2 nach Sprache
Die OpenAI-Grafik für Common Voice 15 und FLEURS zeigt die Streuung von WER/CER. Sie ist kein Ergebnis für das eigene Audiomaterial.

Lokale Installation und reproduzierbarer Erstlauf

Der Upstream-Weg besteht aus openai-whisper, systemweit verfügbarem FFmpeg, einem gewählten Checkpoint und der CLI oder Python-API. Die aktuellen Paketmetadaten verlangen Python 3.8 oder neuer und führen Klassifizierer bis 3.13, während der README-Text konservativer ist. In Produktion sollten Paket-Commit, Modellname und Abhängigkeiten festgehalten werden; ein unbemerktes Mitlaufen mit main verhindert reproduzierbare Fehleranalysen.

python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
  --output_dir transcripts

Die CLI schreibt TXT, VTT, SRT, TSV und JSON. transcribe() verarbeitet Dateien mit einem gleitenden 30-Sekunden-Fenster und liefert Gesamttext, Segmente und erkannte Sprache. Ein Erstlauf enthält den Modelldownload; messen Sie Kaltstart und warme Inferenz getrennt. CPU-Betrieb ist möglich, kann bei größeren Checkpoints jedoch langsam sein. Auch die VRAM-Angaben sind Planungshilfen, keine Garantie.

Praxisablauf für Batch und Untertitel

  1. Ausgabeziel definieren.Suchnotizen, Rohuntertitel, veröffentlichter Text und Beweismaterial benötigen unterschiedliche Prüftiefen.
  2. Privates Testset bauen.Saubere Sprache, Lärm, Stille, Musik, Akzente, Sprachwechsel, Eigennamen, Zahlen und Maximallänge mit geprüfter Referenz abdecken.
  3. Audioverarbeitung trennen.Original bewahren und konsistent decodieren. VAD oder Entrauschung erst nach Messung abgeschnittener Wörter und Halluzinationen übernehmen.
  4. Kontrolliert vergleichen.Hardware, Laufzeit, Sprachhinweis und Decodierung konstant halten; zwei bis drei Modelle und den Echtzeitfaktor protokollieren.
  5. Fehlerklassen prüfen.Namen, Zahlen, Verneinungen, Text über Stille, Wiederholungen, Sprachwechsel und Zeitdrift getrennt vom mittleren WER bewerten.
  6. Lieferformat erzeugen.SRT/VTT oder JSON ausgeben; Zeilenlänge, Lesegeschwindigkeit, Interpunktion und Sprecherregeln separat anwenden.
  7. Bei Folgen menschlich prüfen.Medizin, Recht, Personal, Forschungszitate und Barrierefreiheit erfordern Rückhören im Original.
Audio + Einwilligung
       ↓
konsistente Decodierung / optionale VAD ── Original bewahren
       ↓
Modell + Sprache + protokollierte Einstellungen
       ↓
Stille · Wiederholung · Namen · Zahlen · Zeitdrift prüfen
       ↓
Menschliche Prüfung ── Export ── Aufbewahrung/Löschung

Genauigkeit, Halluzination und belastbare Evaluation

Das Whisper-Paper zeigte mit 680.000 Stunden schwach überwachtem, mehrsprachigem und multitaskigem Audio eine starke Zero-Shot-Robustheit. Dieselbe Trainingsart gehört zu den Grenzen. Die offizielle Model Card warnt vor nicht gesprochenem, aber plausibel klingendem Text, Wiederholungen und ungleicher Leistung zwischen Sprachen, Akzenten und Dialekten. Stille, Musik, Rauschen und undeutliche Sprache müssen deshalb ausdrücklich getestet werden.

MessgrößeAnwendungBlinder Fleck
WER/CERMit menschlicher Referenz vergleichen; CER bei ungeeigneter WortsegmentierungSchwere eines falschen Namens, einer Negation oder Zahl
Entitäten/ZahlenPersonen, Produkte, Daten, Dosen, Preise und Einheiten separat bewertenAllgemeine Flüssigkeit
Halluzinierte SegmenteText in Nicht-Sprach- oder unbelegten Bereichen markierenNormale Ersetzungen in echter Sprache
ZeitdriftGrenzen am Anfang, in der Mitte und am Ende langer Dateien prüfenWortgenauigkeit
EchtzeitfaktorVerarbeitungszeit durch AudiodauerDownload, Warteschlange und Redaktion
Prüfminuten je AudiostundeMenschliche Korrekturzeit erfassenInfrastrukturkosten

Diese Seite nennt keinen einzelnen „Whisper-WER“, weil ein Wert ohne Checkpoint, Sprache, Datensatz, Vorverarbeitung und Decodierung irreführend wäre. Für publizierte Benchmarks sind die offizielle Sprachgrafik und die Paper-Anhänge maßgeblich. Eine Betriebsentscheidung sollte auf einem versionierten privaten Korpus beruhen.

Prompts können Fachbegriffe und Eigennamen begünstigen, sind aber keine Garantie und können selbst in der Ausgabe erscheinen. Temperaturrückfall, Kontext vom vorherigen Segment, Schwellenwerte, Wortzeiten und Halluzinationsoptionen sollten nur gegen ein festes Testset verändert werden. Sonst tauscht man Fehlerarten, ohne die Wirkung zu kennen.

Datenschutz, Sicherheit und Betriebsgrenzen

GrenzePraktische Kontrolle
Lokale VerarbeitungGewichtsquelle und Egress kontrollieren, Originale/Ergebnisse verschlüsseln, Löschung definieren
EinwilligungBerechtigung für Aufnahme und Transkription klären; die Model Card warnt vor Aufnahmen ohne Zustimmung
Folgenreiche NutzungUngeprüfte Transkripte nicht allein für Medizin, Recht oder Personalentscheidungen nutzen
DiarisierungAls eigenes Modell evaluieren; Whisper belegt nicht, wer etwas gesagt hat
EchtzeitUpstream ist kein fertiges Streamingprodukt; Puffer und Latenz gehören zum Wrapper
WartungPakete/Modelle pinnen, Abhängigkeiten prüfen, Regressionstest vor Updates
LizenzMIT-Hinweis erhalten und Rechte an Audio, Text und Drittkomponenten separat prüfen

Whisper im Vergleich zu angrenzenden Optionen

OptionSinnvoll wennWichtigster Trade-off
openai-whisperUpstream-Python-Baseline und einsehbare lokale AusführungPerformance, Batch und Betrieb selbst bauen
faster-whisperCTranslate2-Durchsatz auf GPU/CPU, Quantisierung und BatchEigene Implementierung; Regression zum Upstream nötig
whisper.cppC/C++, CPU, Apple Silicon, Mobil/Edge und OfflineBuild-Varianten und Modellkonvertierung verwalten
WhisperXLangform-Batch, Wortausrichtung, optionale SprechertrennungWeitere Modelle, Abhängigkeiten und Lizenzen
OpenAI Transcription APIVerwaltete Inferenz und aktuelle SprachmodelleExterner Datenfluss, nutzungsbasierte Kosten, API-Limits

OpenAIs aktueller Leitfaden empfiehlt gpt-transcribe für gewöhnliche Dateitranskription und nennt whisper-1 für Wort-/Segmentzeiten, Untertitelformate oder Übersetzung ins Englische. Am 2026-08-20 listete die offizielle Preistabelle geschätzte $0,0045/Minute für gpt-transcribe, $0,006 für gpt-4o-transcribe und $0,003 für die Mini-Variante. Preise und Modelle sind dynamisch und müssen vor der Budgetierung erneut geprüft werden. Das Uploadlimit ist mit 25 MB angegeben.

Häufige Fragen

Ist Whisper kostenlos?

Upstream-Code und veröffentlichte Modelle stehen unter MIT, daher fällt für Self-Hosting keine Minutenlizenz an. Rechenleistung, Speicher, Entwicklung und Prüfung kosten trotzdem Geld. Die OpenAI-API ist ein separater kostenpflichtiger Dienst.

Kann Whisper vollständig offline laufen?

Wenn Abhängigkeiten und Modell vorab lokal vorliegen, kann die Inferenz ohne Audio-Upload arbeiten. Für ein Air-Gap-Versprechen müssen zusätzlich Anwendung, Telemetrie, Logs und Speicherung geprüft werden.

Welches Modell sollte ich wählen?

Für schnelle GPU-Transkription mit turbo beginnen, small als ausgewogene Baseline und .en bei rein englischem Material vergleichen. Mindestens zwei Größen am eigenen Audio testen; turbo nicht für Übersetzung ins Englische verwenden.

Erkennt Whisper Sprecher?

Nein. Sprecherdiarisierung ist keine native Whisper-Funktion. WhisperX und ähnliche Pipelines fügen separate Modelle hinzu, deren Qualität, Rechte und Betrieb ebenfalls bewertet werden müssen.

Kann Whisper live transkribieren?

Das Upstream-Paket ist kein fertiger Streamingdienst. Drittimplementierungen können Chunks nahezu in Echtzeit verarbeiten; VAD, Puffer, Kontext und Latenz sind dann Eigenschaften dieser Implementierung.

Warum entstehen Wiederholungen oder erfundene Sätze?

Die offizielle Model Card nennt beides als bekannte Fehler. Stille und Musik gehören ins Testset; flüssige Sprache darf nicht mit treuer Wiedergabe verwechselt werden. Wichtige Passagen müssen zurückgehört werden.

Geprüfte Quellen

Unabhängige technische Prüfung: 2026-08-20. Modelle, Dokumentation, API und Preise können sich ändern. Vor dem Einsatz Primärquellen und private Evaluation erneut prüfen.

Whisper an der offiziellen Quelle prüfen

Öffnet Repository, Dokumentation oder Modellressourcen.

Offizielle Quelle öffnen

Quick Info

Projektlink
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/6/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper.cpp

Whisper.cpp

Whisper.cpp ist eine abhängigkeitsarme C/C++-Implementierung von OpenAI Whisper für lokale Transkription, Übersetzung, Streaming, Server und eingebettete Apps. Dieser Leitfaden behandelt Modelle, Quantisierung, Backends, Genauigkeit, Datenschutz und Bereitstellung.

speech-recognitionfree
1050
Buzz

Buzz

Buzz ist eine kostenlose, vom MIT lizenzierte Desktop-App für lokale Whisper-Transkription, Untertitel, Live-Untertitel, Übersetzung und Sprecherkennzeichnung auf macOS, Windows und Linux. In diesem Leitfaden werden Backends, Hardware, Datenschutz, Genauigkeitstests, Untertitel-Qualitätssicherung, CLI-Automatisierung und Cloud-Alternativen verglichen.

BuzzBuzz CaptionsOffline Transkription
1330
WhisperDesktop

WhisperDesktop

WhisperDesktop ist eine Windows-Desktop-App und DirectCompute-Implementierung zum lokalen Ausführen von OpenAI Whisper auf Audio-, Video- und Mikrofoneingaben. In diesem Handbuch werden Einrichtung, Modelle, GPUs, Untertitel, Datenschutz und Alternativen behandelt.

WhisperDesktopOpenAI Whisperspeech recognition
960
WhisperX

WhisperX

WhisperX ist eine Open-Source-Pipeline für lange Audiodateien, die faster-whisper-Batches um sprachspezifisches Wort-Alignment und optionale pyannote-Sprecherdiarisierung ergänzt.

WhisperXspeech alignmentspeaker diarization
1210