Whisper Web
Whisper Web

Whisper Web

Whisper Web ist eine MIT-lizenzierte Browser-Spracherkennungsdemo mit Transformers.js für lokale Transkription, Zeitstempel und TXT/JSON-Export.

107

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Whisper WebSpracherkennung im BrowserTransformers.jsWhisper Transkriptionclientseitige ASRlokale Transkriptionwhisper.cpp AlternativeWhisper-WebUI AlternativeOpen-Source-Spracherkennung

Product Preview

A quick visual look at Whisper Web before you visit the official site.

Published 1/21/2026
Whisper Web screenshot

Editorial Review

About Whisper Web

Whisper Web ist eine Open-Source-Browser-Spracherkennungsanwendung von Xenova. Es führt Modelle der Whisper-Familie bis Transformers.js in einem Web Worker aus, akzeptiert Audio von einer URL, einer lokalen Datei oder einem Mikrofon und gibt zeitgestempelten Text zurück, der als TXT oder JSON exportiert werden kann. Das Projekt eignet sich als kompakte Demonstration der clientseitigen automatischen Spracherkennung und nicht als gepflegter Transkriptionsdienst mit vollem Funktionsumfang.

Der Wartungsstatus ist wichtig. Der Hauptzweig wurde zuletzt am 10. Juni 2024 festgeschrieben und angeheftet @xenova/transformers 2.7.0. Seine README-Datei verweist auf einen separaten experimentellen Zweig WebGPU; Die Hauptanwendung folgt hauptsächlich dem älteren Worker/WASM-Pfad. Die aktuelle Transformers.js-Dokumentation ist auf die v3-Generation übergegangen und unterstützt WebGPU direkter, daher sollten Entwickler dieses Repository als lesbare Referenzimplementierung und nicht als aktuellen Framework-Starter behandeln.

Whisper Web offizielle Demo mit URL-Datei und Mikrofon-Audioeingängen
Offizieller Hugging Face Raum erfasst am 20. August 2026. Die Schnittstelle beginnt mit drei Eingabepfaden: URL, lokale Datei und Mikrofonaufzeichnung.

Wer sollte es nutzen – und wer nicht

Benutzer oder JobPasstGrund
Frontend- oder ML-Entwickler-Lernbrowser ASRStarkDer Pfad React, Worker und Transformers.js ist kompakt genug, um eine durchgehende Prüfung durchzuführen
Einzelperson transkribiert eine kurze, unempfindliche AufnahmeVernünftigEs ist kein Konto oder Serverauftrag erforderlich, aber der Modell-Download und der Browserspeicher sind trotzdem wichtig
Team, das überprüfte Untertitel erstelltBegrenztEs gibt keinen Transkript-Editor, keinen SRT/VTT-Export, keine Sprecherkennzeichnung oder eine gemeinsame Überprüfung
Langform-Batch-TranskriptionsdienstArmDer Browser-Tab besitzt Speicher und Ausführung; Warteschlangen, Wiederholungsversuche, Persistenz und Beobachtbarkeit fehlen
Medizinisches, rechtliches oder reguliertes AudioNur PrototypLokale Schlussfolgerungen können den Datenschutz unterstützen, Zugriffskontrolle, Aufbewahrung, Prüfung und menschliche Überprüfung sind jedoch nicht implementiert

Whisper Web eignet sich am besten als Lern- und Prototyping-Oberfläche. Es zeigt, wie Audiodekodierung, Modellladen, Chunk-Callbacks, Zeitstempel und Export ohne Transkriptions-Backend funktionieren können. Das macht es nützlich für private Experimente, Konferenzdemos und einen ersten Machbarkeitstest auf der Zielhardware. Es handelt sich nicht um einen direkten Ersatz für ein unterstütztes Transkriptionsprodukt: Es verfügt über keine Benutzerkonten, Auftragswiederherstellung, Modellverwaltung, Prüfprotokoll, Aufbewahrungskontrollen, Korrekturschnittstelle oder Service-Level-Garantien.

Entscheiden Sie bei einem internen Tool, wer die Seite hostet und Gewichtungen modelliert, welche Browser unterstützt werden und wie Benutzer nach einem Tab-Absturz oder einer Cache-Entfernung wiederhergestellt werden. Fügen Sie für ein öffentliches Produkt eine Einwilligung zur Mikrofonnutzung, zu den Modell-Download-Erwartungen, zur Fehlerberichterstattung und eine klare Aussage darüber hinzu, wohin Audio und Telemetrie übertragen werden. Diese Betriebsdetails sind wichtiger als die Frage, ob die Demo ein sauberes Sample transkribieren kann.

Was die Anwendung tatsächlich macht

BereichUmsetzungPraktische Konsequenz
SchlussfolgerungTransformers.js Pipeline zur automatischen Spracherkennung in einem Web WorkerDie Benutzeroberfläche reagiert weiterhin, während der Browser Rückschlüsse ausführt
AudiovorbereitungWeb Audio API, neu abgetastet auf 16 kHz und zu Mono gemischtDie Browser-Codec-Unterstützung bestimmt, welche Dateien erfolgreich dekodiert werden
Langes Audio30-Sekunden-Blöcke mit 5-Sekunden-Schritten; Distil-Whisper benötigt 20/3 SekundenÜberlappungen tragen zur Kontinuität bei, können jedoch zu wiederholten oder zusammengeführten Phrasen führen
DekodierungGierige Dekodierung mit Zeitstempeln und teilweisen RückrufenEinfach und überprüfbar, aber es sind nur wenige Dekodierungskontrollen verfügbar
ExportierenNur-Text oder JSON ZeitstempelblöckeKein muttersprachlicher SRT/VTT, Sprechertagebuch oder Transkripteditor

Aus einer Datei oder einem Mikrofon ausgewähltes Audio wird dekodiert und an das Modell im Browser weitergeleitet. Die App lädt bei der ersten Verwendung weiterhin Modellgewichte von Hugging Face herunter und eine URL-Eingabe veranlasst den Browser, dieses Remote-Audio abzurufen. „Lokale Inferenz“ bedeutet daher, dass die Speech-to-Text-Berechnung clientseitig erfolgt; Dies bedeutet nicht, dass die Seite keine Netzwerkanfragen stellt.

Eingaben, Modelle und Downloadgrößen

Auswahl in der aktuellen BenutzeroberflächeAngezeigter DownloadBeste Passform
flüsternd, quantisiert41 MBSchnellster erster Test und Geräte mit geringerem Speicherbedarf
Flüsterbasis, quantisiert77 MBEin bescheidener Genauigkeitsschritt ohne großen Download
flüsterklein, quantisiert249 MBLeistungsfähigere lokale Transkription, wenn der Speicher es zulässt
Flüstermedium, quantisiert776 MBExperimente mit höherer Kapazität auf stärkerer Desktop-Hardware
whisper-tiny.en, nicht quantisiert152 MBEnglisches Audio, bei dem die Wiedergabetreue wichtiger ist als die Downloadgröße
whisper-base.en, nicht quantisiert291 MBNur auf Englisch verfügbar, zusätzlicher Browserspeicher verfügbar
Distil-Whisper Optionen402 oder 767 MBNur auf Englisch verfügbare Experimente mit den destillierten Prüfpunkten des Repositorys

Der mehrsprachige Modus zeigt eine lange Sprachauswahl an und lässt den Benutzer zwischen der Transkription in der Ausgangssprache oder der Übersetzung ins Englische wählen. Die Benutzeroberfläche bietet keine automatische Sprachauswahl, Strahlensuche, Temperatur-Fallback, Vokabelhinweise oder Tagebuchführung. Die Quantisierung reduziert die Gewichtsgröße und verbessert oft die Durchführbarkeit, aber Genauigkeit und Stabilität müssen am beabsichtigten Audio getestet werden.

Whisper Web Einstellungen für die mehrsprachige Sprache und Aufgabe der Modellquantisierung
Die Einstellungen der offiziellen Demo kombinieren Modell-, Quantisierungs-, mehrsprachige Sprache- und Transkribierungs-versus-Englisch-Übersetzungsoptionen.

Praktischer Test: Geschwindigkeit versus Transkriptstabilität

Wir haben das offizielle gebündelte 60-Sekunden-Englischbeispiel am 20. August 2026 in einem Chromium-basierten Desktop-Browser ausgeführt. Dabei handelt es sich um eine einzelne Umgebungsprüfung, nicht um einen standardisierten Modell-Benchmark. Netzwerkcache, CPU, Browser, thermischer Zustand und Modelldownload können die Zeiten ändern.

KonfigurationBeobachtete FertigstellungBeobachtetes Ergebnis
Quantisierte mehrsprachige Xenova/whisper-tiny (41 MB)Ungefähr 27 SekundenSchnell, aber die zweite Hälfte erzeugte eine auffällige wiederholte Phrase und mehrere Segmentierungsfehler
Nicht quantisiertes Englisch Xenova/whisper-tiny.en (152 MB)Ungefähr 36 SekundenWesentlich kohärenter und besser segmentiert, obwohl es immer noch einzelne Erkennungsfehler enthielt

Die nützliche Schlussfolgerung ist nicht, dass sich ein Timing überall reproduzieren lässt. Es bedeutet, dass die kleinste quantisierte mehrsprachige Einstellung als Vorschaukonfiguration behandelt werden sollte. Für englischsprachiges Material kann ein nur auf Englisch verfügbarer Checkpoint den größeren Download wert sein. Vergleichen Sie bei mehrsprachigen, verrauschten oder domänenspezifischen Aufnahmen mindestens Tiny, Base und Small anhand repräsentativer Clips, bevor Sie eine Standardeinstellung auswählen.

Whisper Web zeitgestempeltes Transkript mit den Exportschaltflächen TXT und JSON
Mit Zeitstempel versehene Teile des offiziellen 60-Sekunden-Beispiels. Whisper Web ermöglicht den Export von TXT und JSON nach der Transkription.

So bewerten Sie Whisper Web richtig

MetrischSo messen SieWarum es wichtig ist
Wort- oder ZeichenfehlerrateVergleichen Sie es mit einem von Menschen verifizierten ReferenztranskriptGesamtgenauigkeit; Verwenden Sie die Zeichenfehlerrate für Sprachen ohne Worträume
Benannte Entitäten und ZahlenBewerten Sie Namen, Produkte, Daten, Preise und Einheiten separatKleine Fehler können Besprechungs-, Rechts- oder Forschungsnotizen ungültig machen
HalluzinationsrateFügen Sie Stille, Musik, Applaus und leise Abschnitte hinzuWhisper-Modelle können plausiblen Text ausgeben, wenn die Sprache schwach ist
ZeitstempeldriftÜberprüfen Sie die Grenzen am Anfang, in der Mitte und am EndeEntscheidend für Untertitel und suchbare Transkripte
EchtzeitfaktorVerarbeitungssekunden geteilt durch AudiosekundenTrennt die Modellgeschwindigkeit von der subjektiven Wartezeit
Kalt- oder WarmstartZeichnen Sie das Herunterladen/Laden des Modells getrennt von der Inferenz aufWiederholte Benutzer sehen möglicherweise ein ganz anderes Erlebnis
Speicher und AusfallrateTesten Sie Zielbrowser und lange DateienEin Modell, das abstürzt, stellt keine brauchbare Genauigkeitsverbesserung dar

Empfohlenes Testset

sauberer einzelner Sprecher ── Namen + Nummern
lauter Raum ─────────── überlappende Stimmen
Telefon-Audio ────────── Komprimierung + Bandbreite
Musik/Applaus ─────── Stille Halluzination prüfen
Lange Aufzeichnung ─────── Chunk-Joins + Zeitstempeldrift
mehrsprachiger Clip ──── Sprach-/Aufgabenkorrektheit
  1. Erstellen Sie von Menschen verifizierte Referenzen für 20–30 kurze Clips, die zum tatsächlichen Anwendungsfall passen.
  2. Führen Sie Tiny, Base und Small mit demselben Browser, demselben Warm-/Kaltzustand und derselben Quantisierungseinstellung aus.
  3. Zeichnen Sie Genauigkeit, Erstlaufzeit, Warmschlusszeit, Peak-Memory-Symptome und Fehler auf.
  4. Überprüfen Sie Eigennamen, Zahlen, Wiederholungen und stille Segmente getrennt von der durchschnittlichen Fehlerquote.
  5. Testen Sie die Exporte TXT und JSON und entscheiden Sie dann, ob die nachgelagerte Untertitelkonvertierung akzeptabel ist.

Browser-, Datenschutz- und Bereitstellungsgrenzen

GrenzeWas Sie vor der Adoption überprüfen sollten
BrowserkompatibilitätFür die README-Datei ist ein Firefox-Worker-Flag erforderlich. Der Fehlerhandler der App warnt vor Safari auf M1/M2 und empfiehlt Chrome, Firefox oder Edge
Ursprungsübergreifendes AudioDas Laden von Remote-URLs hängt davon ab, dass der Quellserver Browseranfragen zulässt. Eine normale Webseiten-URL ist nicht unbedingt eine verwendbare Audio-URL
Modell-CachingBestätigen Sie Speicherkontingente, Cache-Räumung und wiederholte Downloads auf verwalteten oder privaten Browsergeräten
Empfindlicher TonÜberprüfen Sie Seitenhosting, Modellbereitstellung, Telemetrie und Browsererweiterungen – nicht nur den Inferenzcode
SelbsthostingPinnen Sie Abhängigkeiten, stellen Sie Modellressourcen gezielt bereit, fügen Sie Sicherheitsheader hinzu und testen Sie das Offline-Verhalten
LizenzierungDer Anwendungscode ist MIT-lizenziert; Für Modellkontrollpunkte und eingereichte Audiodaten gelten weiterhin ihre eigenen Bedingungen und Rechte

Die Repository-Sets env.allowLocalModels = falseDaher wird bei der Serienkonstruktion eher eine Fernlieferung des Modells als gebündelte Gewichte erwartet. Für eine private oder Offline-Bereitstellung sind Code- und Hosting-Änderungen erforderlich. Behaupten Sie niemals, dass durch einfaches Klonen der Benutzeroberfläche ein Air-Gap-Transkriptionssystem entsteht.

Whisper Web im Vergleich zu ähnlichen Open-Source-Tools

OptionWählen Sie es wannHauptkompromiss
Whisper Web von XenovaSie möchten eine kleine React/Transformers.js-Demonstration mit URL-, Datei-, Mikrofon- und ZeitstempelexportDer Hauptzweig ist veraltet, verfügt über begrenzte Steuerelemente und keinen nativen Untertitel- oder Diarisierungs-Workflow
whisper.cpp WebAssembly DemoSie möchten einen C/C++-basierten Browserpfad, explizites Laden lokaler Modelle und Datei-/MikrofonunterstützungDas dokumentierte Beispiel WASM ist CPU-orientiert, auf Modelle bis Small beschränkt und begrenzt den Ton auf 120 Sekunden
Whisper-WebUISie benötigen eine umfangreichere, selbst gehostete Untertitelschnittstelle, faster-whisper, größere Modelle und Backend-/API-OptionenErfordert die Einrichtung von Python/server und ist keine rein clientseitige Browser-Inferenz
Aktuelle Transformers.js benutzerdefinierte AppSie erstellen ein neues Browserprodukt und möchten aktuelle WebGPU-, ONNX- und Framework-IntegrationsmusterSie besitzen die vollständige Benutzeroberfläche, die Audio-Pipeline, den Modelllebenszyklus, die Qualitätssicherung und die Kompatibilitätsmatrix
Native whisper.cpp oder faster-whisperLange Dateien, Batchverarbeitung, Automatisierung oder kontrollierte Desktop-/Serverleistung sind wichtigInstallation und Bereitstellung sind aufwändiger als das Öffnen einer Webseite

Whisper Web bleibt wertvoll, da die Quelle kompakt und leicht zu überprüfen ist. Es ist ein besseres Lernartefakt als eine schlüsselfertige Produktionslösung. Erstellen Sie für eine neue Anwendung einen Prototyp mit der Live-Demo und vergleichen Sie dann eine aktuelle Transformers.js-Implementierung mit einer nativen oder serverseitigen Engine, die denselben privaten Evaluierungssatz verwendet.

Checkliste für die Produktion

repräsentatives Audio + Referenztext
              ↓
Browser/Modell/Quantisierungsmatrix
              ↓
Genauigkeit · Halluzination · Zeit · Erinnerung
              ↓
Lokaler Browser ── oder ── native/Server-Engine
              ↓
Aufbewahrung · Zustimmung · Export · menschliche Überprüfung
  1. Bestätigen Sie, ob es sich bei dem Ziel um eine Demo, ein privates lokales Tool oder ein unterstütztes Produkt handelt.
  2. Fixieren Sie den Repository-Commit, die Version Transformers.js und die genaue Modellrevision.
  3. Vergleichen Sie Zielsprachen, Akzente, Lärm, Stille und Dateidauer.
  4. Trennen Sie die Kalt-Download-Zeit von der Warm-Transkriptionsgeschwindigkeit.
  5. Fügen Sie klare Fortschritte, Abbrüche, Speicherfehler und die Behandlung nicht unterstützter Browser hinzu.
  6. Entscheiden Sie, ob TXT/JSON ausreicht, oder fügen Sie SRT/VTT hinzu, bearbeiten und protokollieren.
  7. Dokumentieren Sie die Aufbewahrung von Audiodaten, das Hosting des Models, die Einwilligung und die Löschung.
  8. Erfordern eine menschliche Überprüfung, wenn Namen, Nummern, rechtliche oder medizinische Bedeutungen von Bedeutung sind.

FAQ

Lädt Whisper Web Audio zur Transkription hoch?

Die Inferenzpipeline wird im Browser-Worker ausgeführt. Die Seite lädt jedoch Modelldateien herunter und die URL-Eingabe lädt Remote-Audio in den Browser herunter. Überprüfen Sie das Hosting- und Netzwerkverhalten der bereitgestellten Site, bevor Sie sie als vollständig offline bezeichnen.

Unterstützt es Live-Mikrofontranskription?

Es kann vom Mikrofon aufnehmen und die fertige Aufnahme transkribieren. Bei der Stock-Schnittstelle handelt es sich nicht um ein kontinuierliches Streaming-Untertitelsystem mit geringer Latenz.

Mit welchem Modell soll ich beginnen?

Verwenden Sie Quantized Tiny nur für eine schnelle Machbarkeitsprüfung. Vergleichen Sie Tiny, Base und Small anhand repräsentativer Audiodaten. Nur englischsprachige Kontrollpunkte können für die englische Sprache stabiler sein, während für andere Sprachen und die englische Übersetzung mehrsprachige Kontrollpunkte erforderlich sind.

Kann es Untertitel exportieren?

Nicht direkt. Die aktuelle Benutzeroberfläche exportiert TXT und trägt den Zeitstempel JSON. SRT oder VTT erfordert einen Konvertierungsschritt und eine Überprüfung des Zeitstempels.

Ist die Version WebGPU die Standardversion?

Nein. Die README-Datei des Repositorys verlinkt WebGPU als experimentellen Zweig. Die aktuelle Transformers.js-Dokumentation unterstützt WebGPU, aber dieser Hauptzweig bleibt bei der älteren 2.7-Abhängigkeit.

Wird es aktiv gepflegt?

Der letzte Commit des Hauptzweigs war der 10. Juni 2024, als er am 20. August 2026 überprüft wurde. Die Demo läuft noch, aber die Wartungslücke sollte bei technischen Einführungsentscheidungen berücksichtigt werden.

Quellen überprüft

Unabhängige Überprüfung und praktischer Test: 20. August 2026. Repository-Status, Browserunterstützung, Modelldateien und Demo-Verfügbarkeit können sich ändern; Überprüfen Sie vor der Bereitstellung die aktuellen Quell- und Zielgeräte.

Ready to try Whisper Web?

Visit the official website to get started

Visit Whisper Web

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/6/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper ist OpenAIs MIT-lizenzierte Modellfamilie und Python-Referenz für lokale mehrsprachige Spracherkennung, Untertitel und Sprachübersetzung ins Englische.

WhisperSpracherkennunglokale Transkription
920
Whisper.cpp

Whisper.cpp

Whisper.cpp ist eine abhängigkeitsarme C/C++-Implementierung von OpenAI Whisper für lokale Transkription, Übersetzung, Streaming, Server und eingebettete Apps. Dieser Leitfaden behandelt Modelle, Quantisierung, Backends, Genauigkeit, Datenschutz und Bereitstellung.

speech-recognitionfree
1050
Buzz

Buzz

Buzz ist eine kostenlose, vom MIT lizenzierte Desktop-App für lokale Whisper-Transkription, Untertitel, Live-Untertitel, Übersetzung und Sprecherkennzeichnung auf macOS, Windows und Linux. In diesem Leitfaden werden Backends, Hardware, Datenschutz, Genauigkeitstests, Untertitel-Qualitätssicherung, CLI-Automatisierung und Cloud-Alternativen verglichen.

BuzzBuzz CaptionsOffline Transkription
1330
WhisperDesktop

WhisperDesktop

WhisperDesktop ist eine Windows-Desktop-App und DirectCompute-Implementierung zum lokalen Ausführen von OpenAI Whisper auf Audio-, Video- und Mikrofoneingaben. In diesem Handbuch werden Einrichtung, Modelle, GPUs, Untertitel, Datenschutz und Alternativen behandelt.

WhisperDesktopOpenAI Whisperspeech recognition
960