Whisper
Whisper

Whisper

Whisper est la famille de reconnaissance vocale et l’implémentation Python MIT d’OpenAI pour transcription locale multilingue, sous-titres et traduction vers l’anglais.

99

Views

0

Likes

Jan 2026

Added

github.com

Lien du projet

Tags

Whisperreconnaissance vocaletranscription localeASR open sourcesous-titres

Product Preview

A quick visual look at Whisper before you visit the official site.

Published 1/21/2026
Whisper screenshot

Editorial Review

About Whisper

Whisper désigne la famille de modèles audio encodeur-décodeur publiée par OpenAI ainsi que son implémentation Python de référence sous licence MIT. Elle transcrit dans la langue parlée, détecte la langue et, avec un checkpoint multilingue compatible, traduit la parole vers l’anglais. Le dépôt GitHub n’est pas un service de transcription clé en main : installation, calcul, fichiers, sécurité, files d’attente, supervision et relecture restent à la charge de l’exploitant.

Trois objets proches sont souvent confondus. openai-whisper est le paquet Python qui exécute des modèles téléchargeables ; whisper-1 est un modèle hébergé séparément dans l’Audio API d’OpenAI ; faster-whisper, whisper.cpp, WhisperX et les interfaces web sont des implémentations ou pipelines tiers construits autour des poids Whisper. Toute comparaison de vitesse, de coût ou de confidentialité doit préciser la couche concernée.

Architecture officielle multilingue de reconnaissance vocale Whisper
Schéma officiel d’OpenAI : un spectrogramme log-Mel est encodé, puis des jetons spéciaux pilotent langue, tâche, horodatage, transcription et traduction.

La décision en une phrase

Choisissez Whisper si vous voulez une référence amont inspectable, un contrôle local et une large compatibilité d’écosystème, et si vous pouvez gérer le calcul et l’assurance qualité. Comparez une API managée si l’exploitation prime ; comparez des runtimes spécialisés si la contrainte principale est le CPU/edge, le débit, l’alignement des mots ou la diarisation.

Son avantage durable n’est pas la promesse de gagner tous les benchmarks récents. C’est la liberté de déploiement : la même famille peut vivre dans un notebook, une station hors ligne, un worker GPU ou un environnement embarqué. Whisper constitue donc une bonne base commune d’évaluation, mais les performances d’un wrapper sur une machine précise ne sont pas automatiquement celles garanties par le projet amont.

Ce qui est inclus — et ce qui ne l’est pas

CoucheFourniÀ ajouter
CheckpointsPoids anglophones et multilingues de plusieurs taillesStockage, runtime et matériel d’inférence
Paquet PythonCLI, API, décodage et sorties TXT/SRT/VTT/JSONFFmpeg, déploiement, files, reprises et monitoring
TranscriptionTexte source, temps par segment et mots en optionCorrection, diarisation et validation métier
Traduction vocaleLes modèles compatibles traduisent vers l’anglaisAutres langues cibles ; turbo n’est pas entraîné pour traduire
Licence MITUtiliser, modifier et distribuer selon ses conditionsDroits audio, consentement, notices et conformité

Whisper n’est ni un système natif de diarisation, ni un éditeur de réunions, ni un gestionnaire de consentement, ni un produit de conformité. Il ne fournit pas non plus un service temps réel de production. Les fonctions ajoutées par un projet tiers doivent être attribuées à ce projet, pas à Whisper amont.

Choisir le modèle et le déploiement

ModèleParamètresVRAM approx.Vitesse relative*Bon point de départ
tiny / tiny.en39 M~1 Go~10×Prototype
base / base.en74 M~1 Go~7×Brouillons locaux rapides
small / small.en244 M~2 Go~4×Point de départ équilibré
medium / medium.en769 M~5 Go~2×Priorité à la qualité
large1,55 Md~10 GoQualité multilingue
turbo809 M~6 Go~8×Transcription rapide, pas de traduction

*Chiffres du README OpenAI pour l’anglais sur A100, relativement à large, vérifiés le 2026-08-20. Langue, audio, matériel et runtime changent la vitesse réelle ; ce n’est pas une garantie générale de latence.

tiny, base, small et medium existent en version multilingue et .en. OpenAI indique que l’avantage anglophone est surtout visible pour tiny et base et diminue pour small et medium. Testez turbo pour une transcription GPU rapide, small comme base multilingue économique, et la variante .en si tout le corpus est anglais. Pour traduire la parole vers l’anglais, utilisez medium ou large : turbo renvoie la langue source même avec la tâche translate.

« 98 langues » décrit la couverture, pas une précision uniforme. La model card officielle signale des écarts selon la quantité de données, la langue, l’accent et le dialecte. Pour un lot monolingue connu, fournir la langue peut éliminer une source d’erreur. Les enregistrements avec changement de langue exigent des cas d’essai dédiés plutôt qu’une seule étiquette détectée.

Comparaison officielle des erreurs par langue pour Whisper large-v3 et large-v2
Le graphique officiel WER/CER sur Common Voice 15 et FLEURS montre l’écart entre langues, mais ne mesure pas vos enregistrements privés.

Installation locale et premier test reproductible

La voie amont consiste à installer openai-whisper, rendre FFmpeg disponible dans le système, choisir un checkpoint puis utiliser la CLI ou l’API Python. Les métadonnées actuelles exigent Python 3.8 ou plus et classent jusqu’à 3.13, tandis que le README reste plus prudent. En production, épinglez commit/version, modèle et dépendances ; suivre main sans trace empêche d’expliquer une régression.

python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
  --output_dir transcripts

La CLI produit TXT, VTT, SRT, TSV et JSON. transcribe() parcourt l’audio avec une fenêtre glissante de 30 secondes et retourne texte, segments et langue détectée. Séparez le téléchargement initial de l’inférence chaude. Le CPU est possible mais les grands modèles peuvent être lents ; la VRAM indiquée est une aide de planification, pas une garantie.

Flux recommandé pour lots et sous-titres

  1. Définir le livrable.Notes indexables, brouillon de sous-titres, texte publié et preuve à fort impact n’exigent pas la même relecture.
  2. Créer un corpus privé.Inclure voix propre, bruit, silence, musique, accents, alternance de langues, noms, nombres et durée maximale avec références humaines.
  3. Séparer l’audio de l’ASR.Conserver l’original et décoder de façon stable. Ajouter VAD ou nettoyage seulement après mesure des mots coupés et hallucinations.
  4. Comparer sous contrôle.Fixer matériel, runtime, langue et décodage ; journaliser deux ou trois tailles, révision du modèle et facteur temps réel.
  5. Classer les erreurs.Noter noms, chiffres, négations, texte sur silence, répétitions, changements de langue et dérive temporelle séparément du WER moyen.
  6. Préparer la livraison.Exporter SRT/VTT ou JSON ; appliquer longueur de ligne, vitesse de lecture, ponctuation et règles de locuteur après coup.
  7. Faire écouter quand l’enjeu est élevé.Médical, juridique, emploi, citation scientifique et accessibilité imposent une vérification de la source.
audio + consentement
       ↓
décodage stable / VAD optionnelle ── conserver l’original
       ↓
modèle + langue + paramètres journalisés
       ↓
silence · répétition · noms · nombres · dérive temporelle
       ↓
relecture humaine ── export ── conservation/suppression

Précision, hallucination et évaluation défendable

L’article Whisper a montré une forte robustesse zero-shot grâce à 680 000 heures d’audio multilingue et multitâche faiblement supervisé. Cette stratégie explique aussi certaines limites. La model card officielle avertit que le système peut produire du texte non prononcé, répéter des passages et varier selon langues, accents et dialectes. Silence, musique, bruit et parole incertaine doivent être testés : le décodeur peut générer une suite linguistiquement crédible sans preuve acoustique suffisante.

MesureUtilisationAngle mort
WER/CERComparer à une référence humaine ; CER si les mots se segmentent malGravité d’un nom, d’une négation ou d’un nombre faux
Entités/nombresNoter personnes, produits, dates, doses, prix et unitésFluidité générale
Segments hallucinésÉtiqueter le texte sur non-parole ou audio sans preuveSubstitutions dans une vraie parole
Dérive temporelleVérifier les limites au début, milieu et boutExactitude des mots
Facteur temps réeltemps de calcul / durée audioTéléchargement, attente et relecture
Minutes de relecture/heureMesurer la correction humaine par heure audioCoût d’infrastructure

Nous ne publions pas un unique « WER de Whisper » : sans checkpoint, langue, jeu, prétraitement et décodage, ce serait trompeur. Pour les benchmarks publiés, consultez le graphique officiel et les annexes du papier. Pour adopter, utilisez un corpus privé versionné et pondérez les erreurs selon leur conséquence réelle.

Les prompts peuvent favoriser l’orthographe des termes métier et noms propres, sans garantie, et peuvent eux-mêmes se retrouver dans la sortie. Temperature fallback, contexte précédent, seuils, temps par mot et option anti-hallucination doivent être modifiés contre le même test, faute de quoi on échange des erreurs à l’aveugle.

Confidentialité, sécurité et limites d’exploitation

LimiteContrôle pratique
Traitement localContrôler téléchargement/egress, chiffrer originaux/résultats et définir la suppression
ConsentementVérifier l’autorisation d’enregistrer et transcrire ; la model card alerte sur l’absence de consentement
Décisions sensiblesNe pas utiliser seul un texte non vérifié pour médecine, droit ou emploi
DiarisationL’évaluer séparément ; Whisper ne prouve pas qui a parlé
Temps réelL’amont n’est pas un produit streaming fini ; tampon et latence relèvent du wrapper
MaintenanceÉpingler paquet/modèle, auditer dépendances et lancer une régression avant mise à jour
LicenceConserver la notice MIT et vérifier séparément audio, texte et composants tiers

Whisper face aux options voisines

OptionÀ choisir siCompromis principal
openai-whisperRéférence Python amont et exécution locale inspectablePerformance, lots et exploitation à construire
faster-whisperDébit CTranslate2 GPU/CPU, quantification et batchImplémentation distincte ; régression contre l’amont
whisper.cppC/C++, CPU, Apple Silicon, mobile/edge ou hors ligneBuild et conversion de modèle à gérer
WhisperXLongs lots, alignement mot à mot et diarisation optionnelleModèles, dépendances et licences supplémentaires
API de transcription OpenAIInférence managée et modèles audio actuelsFlux externe, coût à l’usage et limites API

Le guide OpenAI actuel recommande gpt-transcribe pour les fichiers ordinaires et conserve des usages de whisper-1 pour horodatages, sous-titres ou traduction vers l’anglais. Le 2026-08-20, le tarif officiel estimait gpt-transcribe à 0,0045 $/min, gpt-4o-transcribe à 0,006 $ et mini à 0,003 $. Modèles et tarifs sont dynamiques : revérifiez avant budget. La limite d’upload annoncée est 25 Mo.

Questions fréquentes

Whisper est-il gratuit ?

Le code amont et les modèles publiés sont sous MIT : pas de licence à la minute en auto-hébergement. Calcul, stockage, ingénierie et relecture ont toutefois un coût. L’API hébergée est un service payant séparé.

Peut-il fonctionner entièrement hors ligne ?

Si dépendances et modèle sont déjà locaux, l’inférence peut s’exécuter sans envoyer l’audio à une API. Pour promettre un air-gap, vérifiez aussi application, télémétrie, logs et stockage.

Quel modèle choisir ?

Commencez par turbo pour un GPU rapide, small comme équilibre et .en pour un corpus anglais. Comparez au moins deux tailles sur vos fichiers et n’utilisez pas turbo pour traduire la parole vers l’anglais.

Identifie-t-il les locuteurs ?

Non nativement. WhisperX et d’autres pipelines ajoutent alignement et diarisation avec des modèles distincts, à évaluer pour qualité, droits et exploitation.

Peut-il transcrire en direct ?

Le paquet amont n’est pas un service streaming fini. Des runtimes tiers traitent des chunks, mais VAD, tampon, contexte et latence sont propres à leur implémentation.

Pourquoi invente-t-il ou répète-t-il ?

La model card reconnaît ces échecs. Ajoutez silence et musique aux tests, ne confondez pas fluidité et fidélité et réécoutez les passages importants.

Sources vérifiées

Revue technique indépendante : 2026-08-20. Modèles, documentation, API et tarifs peuvent changer. Vérifiez les sources primaires et votre évaluation privée avant déploiement.

Vérifier Whisper à la source officielle

Ouvre le dépôt, la documentation ou les ressources du modèle.

Ouvrir la source officielle

Quick Info

Lien du projet
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/8/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper.cpp

Whisper.cpp

Whisper.cpp est une implémentation C/C++ légère en dépendances de OpenAI Whisper pour la transcription locale, la traduction, le streaming, les serveurs et les applications intégrées. Ce guide couvre les modèles, la quantification, les backends, la précision, la confidentialité et le déploiement.

speech-recognitionfree
1000
Buzz

Buzz

Buzz est une application de bureau gratuite sous licence MIT pour la transcription Whisper locale, les sous-titres, les sous-titres en direct, la traduction et l'étiquetage des locuteurs sur macOS, Windows et Linux. Ce guide compare les backends, le matériel, la confidentialité, les tests de précision, l'assurance qualité des sous-titres, l'automatisation CLI et les alternatives cloud.

BuzzBuzz Captionstranscription offline
1540
WhisperDesktop

WhisperDesktop

WhisperDesktop est une application de bureau Windows et une implémentation de DirectCompute pour exécuter OpenAI Whisper localement sur une entrée audio, vidéo et microphone. Ce guide couvre la configuration, les modèles, les GPU, les sous-titres, la confidentialité et les alternatives.

WhisperDesktopOpenAI Whisperspeech recognition
1100
WhisperX

WhisperX

WhisperX est une chaîne open source pour l’audio long qui ajoute à faster-whisper le batch, l’alignement forcé par langue et la diarisation optionnelle avec pyannote.

WhisperXspeech alignmentspeaker diarization
1270