Whisper Web
Whisper Web

Whisper Web

Whisper Web est une démo MIT de reconnaissance vocale dans le navigateur avec Transformers.js, transcription locale, horodatage et export TXT/JSON.

85

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

Whisper Webreconnaissance vocale navigateurTransformers.jstranscription WhisperASR côté clienttranscription localealternative whisper.cppalternative Whisper-WebUIreconnaissance vocale open source

Product Preview

A quick visual look at Whisper Web before you visit the official site.

Published 1/21/2026
Whisper Web screenshot

Editorial Review

About Whisper Web

Whisper Web est une application de reconnaissance vocale pour navigateur open source de Xenova. Il exécute les modèles de la famille Whisper via Transformers.js dans un Web Worker, accepte l'audio d'une URL, d'un fichier local ou d'un microphone et renvoie un texte horodaté qui peut être exporté sous TXT ou JSON. Le projet est utile en tant que démonstration compacte de la reconnaissance vocale automatique côté client, et non en tant que service de transcription complet et maintenu.

Le statut de maintenance est important. La branche principale a été validée pour la dernière fois le 10 juin 2024 et les épingles @xenova/transformateurs 2.7.0. Son README pointe vers une branche expérimentale distincte WebGPU ; l'application principale suit principalement l'ancien chemin Worker/WASM. La documentation actuelle de Transformers.js est passée à la génération v3 et prend en charge WebGPU plus directement, les développeurs doivent donc traiter ce référentiel comme une implémentation de référence lisible plutôt que comme un démarreur de framework actuel.

Whisper Web démo officielle avec fichier URL et entrées audio microphone
Espace officiel Hugging Face capturé le 20 août 2026. L'interface commence par trois chemins d'entrée : URL, fichier local et enregistrement par microphone.

Qui devrait l'utiliser et qui ne devrait pas l'utiliser

Utilisateur ou travailAjustementRaison
Navigateur d'apprentissage pour développeurs frontend ou ML ASRFortLe chemin React, Worker et Transformers.js est suffisamment compact pour inspecter de bout en bout
Transcription individuelle d'un enregistrement court et non sensibleRaisonnableAucune tâche de compte ou de serveur n'est requise, mais le téléchargement du modèle et la mémoire du navigateur sont toujours importants
Équipe produisant des sous-titres révisésLimitéIl n'y a pas d'éditeur de transcription, d'exportation SRT/VTT, d'étiquetage des locuteurs ou de révision collaborative.
Service de transcription par lots de longue duréePauvreL'onglet du navigateur possède la mémoire et l'exécution ; les files d'attente, les tentatives, la persistance et l'observabilité sont absentes
Audio médical, légal ou réglementéPrototype uniquementL'inférence locale peut contribuer à la confidentialité, mais le contrôle d'accès, la conservation, l'audit et la vérification humaine ne sont pas mis en œuvre

Whisper Web est mieux jugé comme une surface éducative et de prototypage. Il montre comment le décodage audio, le chargement de modèles, les rappels de blocs, les horodatages et l'exportation peuvent fonctionner sans backend de transcription. Cela le rend utile pour les expériences privées, les démonstrations en conférence et un premier test de faisabilité sur le matériel cible. Il ne s'agit pas d'un remplacement immédiat d'un produit de transcription pris en charge : il n'a pas de comptes d'utilisateurs, de récupération de tâches, d'administration de modèles, de journal d'audit, de contrôles de rétention, d'interface de correction ou de garanties de niveau de service.

Pour un outil interne, décidez qui hébergera la page et les pondérations du modèle, quels navigateurs sont pris en charge et comment les utilisateurs se remettront d'un crash d'onglet ou d'une expulsion du cache. Pour un produit public, ajoutez le consentement concernant l'utilisation du microphone, les attentes en matière de téléchargement de modèles, le rapport d'erreurs et une déclaration claire sur la destination de l'audio et de la télémétrie. Ces détails opérationnels comptent plus que la capacité de la démo à transcrire un échantillon propre.

Ce que fait réellement l’application

ZoneMise en œuvreConséquence pratique
InférenceTransformers.js pipeline de reconnaissance vocale automatique dans un Web WorkerL'interface utilisateur reste réactive pendant que le navigateur effectue une inférence
Préparation audioWeb Audio API, rééchantillonné à 16 kHz et mixé en monoLa prise en charge du codec du navigateur détermine quels fichiers sont décodés avec succès
Audio longMorceaux de 30 secondes avec une foulée de 5 secondes ; Distil-Whisper utilise 20/3 secondesLe chevauchement favorise la continuité mais peut introduire des phrases répétées ou fusionnées
DécodageDécodage gourmand avec horodatages et rappels partielsSimple et inspectable, mais il expose peu de contrôles de décodage
ExporterTexte brut ou morceaux d'horodatage JSONPas de SRT/VTT natif, de diarisation du locuteur ou d'éditeur de transcription

L'audio choisi à partir d'un fichier ou d'un microphone est décodé et transmis au modèle dans le navigateur. L'application télécharge toujours les poids des modèles à partir de Hugging Face lors de la première utilisation, et une entrée URL amène le navigateur à récupérer cet audio distant. « Inférence locale » signifie donc que le calcul de la parole en texte est côté client ; cela ne signifie pas que la page ne fait aucune requête réseau.

Entrées, modèles et tailles de téléchargement

Choix dans l'interface utilisateur actuelleTéléchargement affichéMeilleur ajustement
murmure-minuscule, quantifié41 MoPremier test le plus rapide et appareils avec moins de mémoire
base murmurée, quantifiée77 MoUne étape de précision modeste sans un téléchargement important
murmure-petit, quantifié249 MoTranscription locale plus performante lorsque la mémoire le permet
médium, quantifié776 MoExpériences de plus grande capacité sur du matériel de bureau plus puissant
murmure-tiny.en, non quantifié152 MoAudio en anglais où la fidélité compte plus que la taille du téléchargement
murmur-base.en, non quantifié291 MoTravail en anglais uniquement avec mémoire de navigateur supplémentaire disponible
Options Distil-Whisper402 ou 767 MoExpériences en anglais uniquement avec les points de contrôle distillés du référentiel

Le mode multilingue révèle un long sélecteur de langue et permet à l'utilisateur de choisir soit la transcription dans la langue source, soit la traduction en anglais. L'interface utilisateur n'expose pas la sélection automatique de la langue, la recherche de faisceaux, le repli de température, les astuces de vocabulaire ou la diarisation. La quantification réduit le poids et améliore souvent la faisabilité, mais la précision et la stabilité doivent être testées sur l'audio prévu.

Paramètres Whisper Web pour la langue et la tâche multilingues de quantification de modèle
Les paramètres de la démo officielle combinent les choix de modèle, de quantification, de langue multilingue et de transcription par rapport à l'anglais.

Test pratique : vitesse versus stabilité de la transcription

Nous avons exécuté l'échantillon officiel en anglais de 60 secondes dans un navigateur de bureau basé sur Chromium le 20 août 2026. Il s'agit d'une vérification d'environnement unique et non d'un modèle de référence standardisé. Le cache réseau, le processeur, le navigateur, l'état thermique et le téléchargement du modèle peuvent modifier les horaires.

ConfigurationAchèvement observéRésultat observé
Multilingue quantifié Xenova/whisper-tiny (41 Mo)Environ 27 secondesRapide, mais la seconde moitié a produit une phrase répétée visible et plusieurs erreurs de segmentation
Anglais non quantifié Xenova/whisper-tiny.en (152 Mo)Environ 36 secondesNettement plus cohérent et mieux segmenté, même s'il contenait toujours des erreurs de reconnaissance individuelles

La conclusion utile n’est pas qu’un timing unique se reproduise partout. Le plus petit paramètre multilingue quantifié doit être traité comme une configuration d'aperçu. Pour le matériel en anglais, un point de contrôle en anglais uniquement peut valoir le téléchargement le plus important. Pour les enregistrements multilingues, bruyants ou spécifiques à un domaine, comparez au moins les clips minuscules, de base et petits sur des clips représentatifs avant de choisir une valeur par défaut.

Transcription horodatée Whisper Web avec boutons d'exportation TXT et JSON
Morceaux horodatés de l'échantillon officiel de 60 secondes. Whisper Web fournit l'exportation TXT et JSON après transcription.

Comment évaluer correctement Whisper Web

MétriqueComment mesurerPourquoi c'est important
Taux d'erreur de mot ou de caractèreComparez avec une transcription de référence vérifiée par un humainPrécision globale ; utiliser le taux d'erreur de caractère pour les langues sans espaces de mots
Entités et numéros nommésNotez les noms, les produits, les dates, les prix et les unités séparémentDe petites erreurs peuvent invalider les notes de réunion, juridiques ou de recherche
Taux d'hallucinationsIncluez des segments de silence, de musique, d'applaudissements et de voix basseLes modèles Whisper peuvent émettre un texte plausible là où la parole est faible
Dérive de l'horodatageVérifiez les limites au début, au milieu et à la finCritique pour les sous-titres et les transcriptions consultables
Facteur temps réelSecondes de traitement divisées par secondes audioSépare la vitesse du modèle du temps d'attente subjectif
Démarrage à froid ou à chaudEnregistrer le téléchargement/chargement du modèle séparément de l'inférenceLes utilisateurs réguliers peuvent voir une expérience très différente
Mémoire et taux d'échecTestez les navigateurs cibles et les fichiers longsUn modèle qui plante n'est pas une amélioration de précision utilisable

Ensemble de test recommandé

nettoyer un seul locuteur ── noms + numéros
pièce bruyante ─────────── voix qui se chevauchent
audio du téléphone ────────── compression + bande passante
musique/applaudissements ─────── contrôle des hallucinations en silence
enregistrement long ─────── jointures de morceaux + dérive d'horodatage
clip multilingue ──── exactitude de la langue/tâche
  1. Créez des références vérifiées par l'homme pour 20 à 30 courts clips qui correspondent au cas d'utilisation réel.
  2. Exécutez tiny, base et small avec le même navigateur, le même état chaud/froid et le même paramètre de quantification.
  3. Enregistrez la précision, le temps de première exécution, le temps d'inférence à chaud, les symptômes et les pannes de mémoire maximale.
  4. Examinez les noms propres, les nombres, les répétitions et les segments muets séparément du taux d'erreur moyen.
  5. Testez les exportations TXT et JSON, puis décidez si la conversion des sous-titres en aval est acceptable.

Limites du navigateur, de la confidentialité et du déploiement

LimiteQue vérifier avant l'adoption
Compatibilité du navigateurLe README nécessite un indicateur Firefox Worker ; le gestionnaire d'erreurs de l'application met en garde contre Safari sur M1/M2 et recommande Chrome, Firefox ou Edge
Audio d'origine croiséeLe chargement d'URL à distance dépend du serveur source autorisant les requêtes du navigateur ; une URL de page Web normale n'est pas nécessairement une URL audio utilisable
Mise en cache du modèleConfirmez les quotas de stockage, l'expulsion du cache et les téléchargements répétés sur les appareils de navigation gérés ou privés
Audio sensibleExaminez l'hébergement des pages, la livraison du modèle, la télémétrie et les extensions de navigateur, et pas seulement le code d'inférence.
Auto-hébergementÉpinglez les dépendances, servez intentionnellement les actifs du modèle, ajoutez des en-têtes de sécurité et testez le comportement hors ligne
LicenceLe code de l'application est sous licence MIT ; les points de contrôle des modèles et l'audio soumis ont toujours leurs propres conditions et droits

Le référentiel définit env.allowLocalModels = faux, donc sa constitution de stock s'attend à une livraison de modèles à distance plutôt qu'à des poids groupés. Un déploiement privé ou hors ligne nécessite des modifications de code et d’hébergement. Ne prétendez jamais que le simple clonage de l’interface utilisateur crée un système de transcription isolé.

Whisper Web par rapport à des outils open source similaires

OptionsChoisissez-le quandPrincipal compromis
Whisper Web par XenovaVous souhaitez une petite démonstration React/Transformers.js avec export d'URL, de fichier, de micro et d'horodatageLa branche principale est datée, a des contrôles limités et aucun flux de sous-titres ou de diarisation natif
whisper.cpp WebAssembly démoVous souhaitez un chemin de navigateur basé sur C/C++, un chargement de modèle local explicite et une prise en charge des fichiers/microphonesSon exemple documenté WASM est orienté CPU, limité aux modèles via small et plafonne l'audio à 120 secondes.
Whisper-WebUIVous avez besoin d'une interface de sous-titres auto-hébergée plus riche, faster-whisper, de modèles plus grands et d'options backend/APINécessite la configuration de Python/server et n'est pas une inférence purement côté client du navigateur
Application personnalisée Transformers.js actuelleVous créez un nouveau produit de navigateur et souhaitez les modèles d'intégration WebGPU, ONNX et framework actuels.Vous possédez l'interface utilisateur complète, le pipeline audio, le cycle de vie du modèle, l'assurance qualité et la matrice de compatibilité.
Natif whisper.cpp ou faster-whisperLes fichiers longs, le traitement par lots, l'automatisation ou le contrôle des performances des postes de travail/serveurs sont importantsL'installation et le déploiement sont plus lourds que l'ouverture d'une page Web

Whisper Web reste précieux car la source est compacte et facile à inspecter. Il s’agit d’un meilleur artefact d’apprentissage qu’un choix de production clé en main. Pour une nouvelle application, réalisez un prototype par rapport à la démo en direct, puis comparez une implémentation actuelle de Transformers.js avec un moteur natif ou côté serveur utilisant le même ensemble d'évaluation privé.

Liste de contrôle de production

audio représentatif + texte de référence
              ↓
navigateur/modèle/matrice de quantification
              ↓
précision · hallucination · temps · mémoire
              ↓
navigateur local ── ou ── moteur natif/serveur
              ↓
conservation · consentement · exportation · examen humain
  1. Confirmez si l'objectif est une démo, un outil local privé ou un produit pris en charge.
  2. Épinglez le commit du référentiel, la version Transformers.js et la révision exacte du modèle.
  3. Comparez les langues cibles, les accents, le bruit, le silence et la durée des fichiers.
  4. Séparez le temps de téléchargement à froid de la vitesse de transcription à chaud.
  5. Ajoutez une progression claire, une annulation, des erreurs de mémoire et une gestion des navigateurs non pris en charge.
  6. Décidez si TXT/JSON est suffisant ou ajoutez SRT/VTT, édition et diarisation.
  7. Conservation audio des documents, hébergement du modèle, consentement et suppression.
  8. Exiger un examen humain lorsque les noms, les numéros, la signification juridique ou médicale sont importants.

FAQ

Whisper Web télécharge-t-il l'audio pour la transcription ?

Le pipeline d'inférence s'exécute dans le navigateur Worker. Cependant, la page télécharge les fichiers de modèle et l'entrée URL télécharge l'audio distant dans le navigateur. Examinez le comportement d'hébergement et du réseau du site déployé avant de le décrire comme étant entièrement hors ligne.

Est-ce qu'il prend en charge la transcription par microphone en direct ?

Il peut enregistrer depuis le microphone et transcrire l’enregistrement terminé. L’interface stock n’est pas un système de sous-titres en streaming continu à faible latence.

Par quel modèle dois-je commencer ?

Utilisez le minuscule quantifié uniquement pour une vérification rapide de la faisabilité. Comparez les formats minuscule, basique et petit sur un son représentatif. Les points de contrôle en anglais uniquement peuvent être plus stables pour la parole en anglais, tandis que des points de contrôle multilingues sont requis pour les autres langues et la traduction en anglais.

Peut-il exporter des sous-titres ?

Pas directement. L'interface utilisateur actuelle exporte TXT et est horodatée JSON. SRT ou VTT nécessite une étape de conversion et un examen de l'horodatage.

La version WebGPU est-elle la version par défaut ?

Non. Le référentiel README relie WebGPU en tant que branche expérimentale. La documentation actuelle de Transformers.js prend en charge WebGPU, mais cette branche principale reste sur l'ancienne dépendance 2.7.

Est-il activement entretenu ?

Le dernier engagement de la branche principale date du 10 juin 2024, lors de sa révision le 20 août 2026. La démo est toujours en cours d'exécution, mais l'écart de maintenance devrait être inclus dans les décisions d'adoption technique.

Sources examinées

Examen indépendant et test pratique : 20 août 2026. L'état du référentiel, la prise en charge du navigateur, les fichiers de modèle et la disponibilité de la démo peuvent changer ; Vérifiez les appareils source et cible actuels avant le déploiement.

Ready to try Whisper Web?

Visit the official website to get started

Visit Whisper Web

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/6/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper est la famille de reconnaissance vocale et l’implémentation Python MIT d’OpenAI pour transcription locale multilingue, sous-titres et traduction vers l’anglais.

Whisperreconnaissance vocaletranscription locale
960
Whisper.cpp

Whisper.cpp

Whisper.cpp est une implémentation C/C++ légère en dépendances de OpenAI Whisper pour la transcription locale, la traduction, le streaming, les serveurs et les applications intégrées. Ce guide couvre les modèles, la quantification, les backends, la précision, la confidentialité et le déploiement.

speech-recognitionfree
980
Buzz

Buzz

Buzz est une application de bureau gratuite sous licence MIT pour la transcription Whisper locale, les sous-titres, les sous-titres en direct, la traduction et l'étiquetage des locuteurs sur macOS, Windows et Linux. Ce guide compare les backends, le matériel, la confidentialité, les tests de précision, l'assurance qualité des sous-titres, l'automatisation CLI et les alternatives cloud.

BuzzBuzz Captionstranscription offline
1510
WhisperDesktop

WhisperDesktop

WhisperDesktop est une application de bureau Windows et une implémentation de DirectCompute pour exécuter OpenAI Whisper localement sur une entrée audio, vidéo et microphone. Ce guide couvre la configuration, les modèles, les GPU, les sous-titres, la confidentialité et les alternatives.

WhisperDesktopOpenAI Whisperspeech recognition
1070