Whisper Web ist eine Open-Source-Browser-Spracherkennungsanwendung von Xenova. Es führt Modelle der Whisper-Familie bis Transformers.js in einem Web Worker aus, akzeptiert Audio von einer URL, einer lokalen Datei oder einem Mikrofon und gibt zeitgestempelten Text zurück, der als TXT oder JSON exportiert werden kann. Das Projekt eignet sich als kompakte Demonstration der clientseitigen automatischen Spracherkennung und nicht als gepflegter Transkriptionsdienst mit vollem Funktionsumfang.
Der Wartungsstatus ist wichtig. Der Hauptzweig wurde zuletzt am 10. Juni 2024 festgeschrieben und angeheftet @xenova/transformers 2.7.0. Seine README-Datei verweist auf einen separaten experimentellen Zweig WebGPU; Die Hauptanwendung folgt hauptsächlich dem älteren Worker/WASM-Pfad. Die aktuelle Transformers.js-Dokumentation ist auf die v3-Generation übergegangen und unterstützt WebGPU direkter, daher sollten Entwickler dieses Repository als lesbare Referenzimplementierung und nicht als aktuellen Framework-Starter behandeln.

Wer sollte es nutzen – und wer nicht
| Benutzer oder Job | Passt | Grund |
|---|---|---|
| Frontend- oder ML-Entwickler-Lernbrowser ASR | Stark | Der Pfad React, Worker und Transformers.js ist kompakt genug, um eine durchgehende Prüfung durchzuführen |
| Einzelperson transkribiert eine kurze, unempfindliche Aufnahme | Vernünftig | Es ist kein Konto oder Serverauftrag erforderlich, aber der Modell-Download und der Browserspeicher sind trotzdem wichtig |
| Team, das überprüfte Untertitel erstellt | Begrenzt | Es gibt keinen Transkript-Editor, keinen SRT/VTT-Export, keine Sprecherkennzeichnung oder eine gemeinsame Überprüfung |
| Langform-Batch-Transkriptionsdienst | Arm | Der Browser-Tab besitzt Speicher und Ausführung; Warteschlangen, Wiederholungsversuche, Persistenz und Beobachtbarkeit fehlen |
| Medizinisches, rechtliches oder reguliertes Audio | Nur Prototyp | Lokale Schlussfolgerungen können den Datenschutz unterstützen, Zugriffskontrolle, Aufbewahrung, Prüfung und menschliche Überprüfung sind jedoch nicht implementiert |
Whisper Web eignet sich am besten als Lern- und Prototyping-Oberfläche. Es zeigt, wie Audiodekodierung, Modellladen, Chunk-Callbacks, Zeitstempel und Export ohne Transkriptions-Backend funktionieren können. Das macht es nützlich für private Experimente, Konferenzdemos und einen ersten Machbarkeitstest auf der Zielhardware. Es handelt sich nicht um einen direkten Ersatz für ein unterstütztes Transkriptionsprodukt: Es verfügt über keine Benutzerkonten, Auftragswiederherstellung, Modellverwaltung, Prüfprotokoll, Aufbewahrungskontrollen, Korrekturschnittstelle oder Service-Level-Garantien.
Entscheiden Sie bei einem internen Tool, wer die Seite hostet und Gewichtungen modelliert, welche Browser unterstützt werden und wie Benutzer nach einem Tab-Absturz oder einer Cache-Entfernung wiederhergestellt werden. Fügen Sie für ein öffentliches Produkt eine Einwilligung zur Mikrofonnutzung, zu den Modell-Download-Erwartungen, zur Fehlerberichterstattung und eine klare Aussage darüber hinzu, wohin Audio und Telemetrie übertragen werden. Diese Betriebsdetails sind wichtiger als die Frage, ob die Demo ein sauberes Sample transkribieren kann.
Was die Anwendung tatsächlich macht
| Bereich | Umsetzung | Praktische Konsequenz |
|---|---|---|
| Schlussfolgerung | Transformers.js Pipeline zur automatischen Spracherkennung in einem Web Worker | Die Benutzeroberfläche reagiert weiterhin, während der Browser Rückschlüsse ausführt |
| Audiovorbereitung | Web Audio API, neu abgetastet auf 16 kHz und zu Mono gemischt | Die Browser-Codec-Unterstützung bestimmt, welche Dateien erfolgreich dekodiert werden |
| Langes Audio | 30-Sekunden-Blöcke mit 5-Sekunden-Schritten; Distil-Whisper benötigt 20/3 Sekunden | Überlappungen tragen zur Kontinuität bei, können jedoch zu wiederholten oder zusammengeführten Phrasen führen |
| Dekodierung | Gierige Dekodierung mit Zeitstempeln und teilweisen Rückrufen | Einfach und überprüfbar, aber es sind nur wenige Dekodierungskontrollen verfügbar |
| Exportieren | Nur-Text oder JSON Zeitstempelblöcke | Kein muttersprachlicher SRT/VTT, Sprechertagebuch oder Transkripteditor |
Aus einer Datei oder einem Mikrofon ausgewähltes Audio wird dekodiert und an das Modell im Browser weitergeleitet. Die App lädt bei der ersten Verwendung weiterhin Modellgewichte von Hugging Face herunter und eine URL-Eingabe veranlasst den Browser, dieses Remote-Audio abzurufen. „Lokale Inferenz“ bedeutet daher, dass die Speech-to-Text-Berechnung clientseitig erfolgt; Dies bedeutet nicht, dass die Seite keine Netzwerkanfragen stellt.
Eingaben, Modelle und Downloadgrößen
| Auswahl in der aktuellen Benutzeroberfläche | Angezeigter Download | Beste Passform |
|---|---|---|
| flüsternd, quantisiert | 41 MB | Schnellster erster Test und Geräte mit geringerem Speicherbedarf |
| Flüsterbasis, quantisiert | 77 MB | Ein bescheidener Genauigkeitsschritt ohne großen Download |
| flüsterklein, quantisiert | 249 MB | Leistungsfähigere lokale Transkription, wenn der Speicher es zulässt |
| Flüstermedium, quantisiert | 776 MB | Experimente mit höherer Kapazität auf stärkerer Desktop-Hardware |
| whisper-tiny.en, nicht quantisiert | 152 MB | Englisches Audio, bei dem die Wiedergabetreue wichtiger ist als die Downloadgröße |
| whisper-base.en, nicht quantisiert | 291 MB | Nur auf Englisch verfügbar, zusätzlicher Browserspeicher verfügbar |
| Distil-Whisper Optionen | 402 oder 767 MB | Nur auf Englisch verfügbare Experimente mit den destillierten Prüfpunkten des Repositorys |
Der mehrsprachige Modus zeigt eine lange Sprachauswahl an und lässt den Benutzer zwischen der Transkription in der Ausgangssprache oder der Übersetzung ins Englische wählen. Die Benutzeroberfläche bietet keine automatische Sprachauswahl, Strahlensuche, Temperatur-Fallback, Vokabelhinweise oder Tagebuchführung. Die Quantisierung reduziert die Gewichtsgröße und verbessert oft die Durchführbarkeit, aber Genauigkeit und Stabilität müssen am beabsichtigten Audio getestet werden.

Praktischer Test: Geschwindigkeit versus Transkriptstabilität
Wir haben das offizielle gebündelte 60-Sekunden-Englischbeispiel am 20. August 2026 in einem Chromium-basierten Desktop-Browser ausgeführt. Dabei handelt es sich um eine einzelne Umgebungsprüfung, nicht um einen standardisierten Modell-Benchmark. Netzwerkcache, CPU, Browser, thermischer Zustand und Modelldownload können die Zeiten ändern.
| Konfiguration | Beobachtete Fertigstellung | Beobachtetes Ergebnis |
|---|---|---|
Quantisierte mehrsprachige Xenova/whisper-tiny (41 MB) | Ungefähr 27 Sekunden | Schnell, aber die zweite Hälfte erzeugte eine auffällige wiederholte Phrase und mehrere Segmentierungsfehler |
Nicht quantisiertes Englisch Xenova/whisper-tiny.en (152 MB) | Ungefähr 36 Sekunden | Wesentlich kohärenter und besser segmentiert, obwohl es immer noch einzelne Erkennungsfehler enthielt |
Die nützliche Schlussfolgerung ist nicht, dass sich ein Timing überall reproduzieren lässt. Es bedeutet, dass die kleinste quantisierte mehrsprachige Einstellung als Vorschaukonfiguration behandelt werden sollte. Für englischsprachiges Material kann ein nur auf Englisch verfügbarer Checkpoint den größeren Download wert sein. Vergleichen Sie bei mehrsprachigen, verrauschten oder domänenspezifischen Aufnahmen mindestens Tiny, Base und Small anhand repräsentativer Clips, bevor Sie eine Standardeinstellung auswählen.

So bewerten Sie Whisper Web richtig
| Metrisch | So messen Sie | Warum es wichtig ist |
|---|---|---|
| Wort- oder Zeichenfehlerrate | Vergleichen Sie es mit einem von Menschen verifizierten Referenztranskript | Gesamtgenauigkeit; Verwenden Sie die Zeichenfehlerrate für Sprachen ohne Worträume |
| Benannte Entitäten und Zahlen | Bewerten Sie Namen, Produkte, Daten, Preise und Einheiten separat | Kleine Fehler können Besprechungs-, Rechts- oder Forschungsnotizen ungültig machen |
| Halluzinationsrate | Fügen Sie Stille, Musik, Applaus und leise Abschnitte hinzu | Whisper-Modelle können plausiblen Text ausgeben, wenn die Sprache schwach ist |
| Zeitstempeldrift | Überprüfen Sie die Grenzen am Anfang, in der Mitte und am Ende | Entscheidend für Untertitel und suchbare Transkripte |
| Echtzeitfaktor | Verarbeitungssekunden geteilt durch Audiosekunden | Trennt die Modellgeschwindigkeit von der subjektiven Wartezeit |
| Kalt- oder Warmstart | Zeichnen Sie das Herunterladen/Laden des Modells getrennt von der Inferenz auf | Wiederholte Benutzer sehen möglicherweise ein ganz anderes Erlebnis |
| Speicher und Ausfallrate | Testen Sie Zielbrowser und lange Dateien | Ein Modell, das abstürzt, stellt keine brauchbare Genauigkeitsverbesserung dar |
Empfohlenes Testset
sauberer einzelner Sprecher ── Namen + Nummern lauter Raum ─────────── überlappende Stimmen Telefon-Audio ────────── Komprimierung + Bandbreite Musik/Applaus ─────── Stille Halluzination prüfen Lange Aufzeichnung ─────── Chunk-Joins + Zeitstempeldrift mehrsprachiger Clip ──── Sprach-/Aufgabenkorrektheit
- Erstellen Sie von Menschen verifizierte Referenzen für 20–30 kurze Clips, die zum tatsächlichen Anwendungsfall passen.
- Führen Sie Tiny, Base und Small mit demselben Browser, demselben Warm-/Kaltzustand und derselben Quantisierungseinstellung aus.
- Zeichnen Sie Genauigkeit, Erstlaufzeit, Warmschlusszeit, Peak-Memory-Symptome und Fehler auf.
- Überprüfen Sie Eigennamen, Zahlen, Wiederholungen und stille Segmente getrennt von der durchschnittlichen Fehlerquote.
- Testen Sie die Exporte TXT und JSON und entscheiden Sie dann, ob die nachgelagerte Untertitelkonvertierung akzeptabel ist.
Browser-, Datenschutz- und Bereitstellungsgrenzen
| Grenze | Was Sie vor der Adoption überprüfen sollten |
|---|---|
| Browserkompatibilität | Für die README-Datei ist ein Firefox-Worker-Flag erforderlich. Der Fehlerhandler der App warnt vor Safari auf M1/M2 und empfiehlt Chrome, Firefox oder Edge |
| Ursprungsübergreifendes Audio | Das Laden von Remote-URLs hängt davon ab, dass der Quellserver Browseranfragen zulässt. Eine normale Webseiten-URL ist nicht unbedingt eine verwendbare Audio-URL |
| Modell-Caching | Bestätigen Sie Speicherkontingente, Cache-Räumung und wiederholte Downloads auf verwalteten oder privaten Browsergeräten |
| Empfindlicher Ton | Überprüfen Sie Seitenhosting, Modellbereitstellung, Telemetrie und Browsererweiterungen – nicht nur den Inferenzcode |
| Selbsthosting | Pinnen Sie Abhängigkeiten, stellen Sie Modellressourcen gezielt bereit, fügen Sie Sicherheitsheader hinzu und testen Sie das Offline-Verhalten |
| Lizenzierung | Der Anwendungscode ist MIT-lizenziert; Für Modellkontrollpunkte und eingereichte Audiodaten gelten weiterhin ihre eigenen Bedingungen und Rechte |
Die Repository-Sets env.allowLocalModels = falseDaher wird bei der Serienkonstruktion eher eine Fernlieferung des Modells als gebündelte Gewichte erwartet. Für eine private oder Offline-Bereitstellung sind Code- und Hosting-Änderungen erforderlich. Behaupten Sie niemals, dass durch einfaches Klonen der Benutzeroberfläche ein Air-Gap-Transkriptionssystem entsteht.
Whisper Web im Vergleich zu ähnlichen Open-Source-Tools
| Option | Wählen Sie es wann | Hauptkompromiss |
|---|---|---|
| Whisper Web von Xenova | Sie möchten eine kleine React/Transformers.js-Demonstration mit URL-, Datei-, Mikrofon- und Zeitstempelexport | Der Hauptzweig ist veraltet, verfügt über begrenzte Steuerelemente und keinen nativen Untertitel- oder Diarisierungs-Workflow |
| whisper.cpp WebAssembly Demo | Sie möchten einen C/C++-basierten Browserpfad, explizites Laden lokaler Modelle und Datei-/Mikrofonunterstützung | Das dokumentierte Beispiel WASM ist CPU-orientiert, auf Modelle bis Small beschränkt und begrenzt den Ton auf 120 Sekunden |
| Whisper-WebUI | Sie benötigen eine umfangreichere, selbst gehostete Untertitelschnittstelle, faster-whisper, größere Modelle und Backend-/API-Optionen | Erfordert die Einrichtung von Python/server und ist keine rein clientseitige Browser-Inferenz |
| Aktuelle Transformers.js benutzerdefinierte App | Sie erstellen ein neues Browserprodukt und möchten aktuelle WebGPU-, ONNX- und Framework-Integrationsmuster | Sie besitzen die vollständige Benutzeroberfläche, die Audio-Pipeline, den Modelllebenszyklus, die Qualitätssicherung und die Kompatibilitätsmatrix |
| Native whisper.cpp oder faster-whisper | Lange Dateien, Batchverarbeitung, Automatisierung oder kontrollierte Desktop-/Serverleistung sind wichtig | Installation und Bereitstellung sind aufwändiger als das Öffnen einer Webseite |
Whisper Web bleibt wertvoll, da die Quelle kompakt und leicht zu überprüfen ist. Es ist ein besseres Lernartefakt als eine schlüsselfertige Produktionslösung. Erstellen Sie für eine neue Anwendung einen Prototyp mit der Live-Demo und vergleichen Sie dann eine aktuelle Transformers.js-Implementierung mit einer nativen oder serverseitigen Engine, die denselben privaten Evaluierungssatz verwendet.
Checkliste für die Produktion
repräsentatives Audio + Referenztext
↓
Browser/Modell/Quantisierungsmatrix
↓
Genauigkeit · Halluzination · Zeit · Erinnerung
↓
Lokaler Browser ── oder ── native/Server-Engine
↓
Aufbewahrung · Zustimmung · Export · menschliche Überprüfung
- Bestätigen Sie, ob es sich bei dem Ziel um eine Demo, ein privates lokales Tool oder ein unterstütztes Produkt handelt.
- Fixieren Sie den Repository-Commit, die Version Transformers.js und die genaue Modellrevision.
- Vergleichen Sie Zielsprachen, Akzente, Lärm, Stille und Dateidauer.
- Trennen Sie die Kalt-Download-Zeit von der Warm-Transkriptionsgeschwindigkeit.
- Fügen Sie klare Fortschritte, Abbrüche, Speicherfehler und die Behandlung nicht unterstützter Browser hinzu.
- Entscheiden Sie, ob TXT/JSON ausreicht, oder fügen Sie SRT/VTT hinzu, bearbeiten und protokollieren.
- Dokumentieren Sie die Aufbewahrung von Audiodaten, das Hosting des Models, die Einwilligung und die Löschung.
- Erfordern eine menschliche Überprüfung, wenn Namen, Nummern, rechtliche oder medizinische Bedeutungen von Bedeutung sind.
FAQ
Lädt Whisper Web Audio zur Transkription hoch?
Die Inferenzpipeline wird im Browser-Worker ausgeführt. Die Seite lädt jedoch Modelldateien herunter und die URL-Eingabe lädt Remote-Audio in den Browser herunter. Überprüfen Sie das Hosting- und Netzwerkverhalten der bereitgestellten Site, bevor Sie sie als vollständig offline bezeichnen.
Unterstützt es Live-Mikrofontranskription?
Es kann vom Mikrofon aufnehmen und die fertige Aufnahme transkribieren. Bei der Stock-Schnittstelle handelt es sich nicht um ein kontinuierliches Streaming-Untertitelsystem mit geringer Latenz.
Mit welchem Modell soll ich beginnen?
Verwenden Sie Quantized Tiny nur für eine schnelle Machbarkeitsprüfung. Vergleichen Sie Tiny, Base und Small anhand repräsentativer Audiodaten. Nur englischsprachige Kontrollpunkte können für die englische Sprache stabiler sein, während für andere Sprachen und die englische Übersetzung mehrsprachige Kontrollpunkte erforderlich sind.
Kann es Untertitel exportieren?
Nicht direkt. Die aktuelle Benutzeroberfläche exportiert TXT und trägt den Zeitstempel JSON. SRT oder VTT erfordert einen Konvertierungsschritt und eine Überprüfung des Zeitstempels.
Ist die Version WebGPU die Standardversion?
Nein. Die README-Datei des Repositorys verlinkt WebGPU als experimentellen Zweig. Die aktuelle Transformers.js-Dokumentation unterstützt WebGPU, aber dieser Hauptzweig bleibt bei der älteren 2.7-Abhängigkeit.
Wird es aktiv gepflegt?
Der letzte Commit des Hauptzweigs war der 10. Juni 2024, als er am 20. August 2026 überprüft wurde. Die Demo läuft noch, aber die Wartungslücke sollte bei technischen Einführungsentscheidungen berücksichtigt werden.
Quellen überprüft
- Whisper Web GitHub Repository
- Whisper Web README und WebGPU Zweignotiz
- Audioeingänge, Modelle, Größen, Sprachen und Aufgaben
- Implementierung von Worker-Inferenz, Chunking und Decodierung
- Zeitstempelanzeige und TXT/JSON-Exporte
- Offizieller Live-Hugging Face Space
- Aktueller Leitfaden Transformers.js WebGPU
- whisper.cpp WebAssembly Beispiel
- Whisper-WebUI-Repository
Unabhängige Überprüfung und praktischer Test: 20. August 2026. Repository-Status, Browserunterstützung, Modelldateien und Demo-Verfügbarkeit können sich ändern; Überprüfen Sie vor der Bereitstellung die aktuellen Quell- und Zielgeräte.



