Whisper désigne la famille de modèles audio encodeur-décodeur publiée par OpenAI ainsi que son implémentation Python de référence sous licence MIT. Elle transcrit dans la langue parlée, détecte la langue et, avec un checkpoint multilingue compatible, traduit la parole vers l’anglais. Le dépôt GitHub n’est pas un service de transcription clé en main : installation, calcul, fichiers, sécurité, files d’attente, supervision et relecture restent à la charge de l’exploitant.
Trois objets proches sont souvent confondus. openai-whisper est le paquet Python qui exécute des modèles téléchargeables ; whisper-1 est un modèle hébergé séparément dans l’Audio API d’OpenAI ; faster-whisper, whisper.cpp, WhisperX et les interfaces web sont des implémentations ou pipelines tiers construits autour des poids Whisper. Toute comparaison de vitesse, de coût ou de confidentialité doit préciser la couche concernée.

La décision en une phrase
Choisissez Whisper si vous voulez une référence amont inspectable, un contrôle local et une large compatibilité d’écosystème, et si vous pouvez gérer le calcul et l’assurance qualité. Comparez une API managée si l’exploitation prime ; comparez des runtimes spécialisés si la contrainte principale est le CPU/edge, le débit, l’alignement des mots ou la diarisation.
Son avantage durable n’est pas la promesse de gagner tous les benchmarks récents. C’est la liberté de déploiement : la même famille peut vivre dans un notebook, une station hors ligne, un worker GPU ou un environnement embarqué. Whisper constitue donc une bonne base commune d’évaluation, mais les performances d’un wrapper sur une machine précise ne sont pas automatiquement celles garanties par le projet amont.
Ce qui est inclus — et ce qui ne l’est pas
| Couche | Fourni | À ajouter |
|---|---|---|
| Checkpoints | Poids anglophones et multilingues de plusieurs tailles | Stockage, runtime et matériel d’inférence |
| Paquet Python | CLI, API, décodage et sorties TXT/SRT/VTT/JSON | FFmpeg, déploiement, files, reprises et monitoring |
| Transcription | Texte source, temps par segment et mots en option | Correction, diarisation et validation métier |
| Traduction vocale | Les modèles compatibles traduisent vers l’anglais | Autres langues cibles ; turbo n’est pas entraîné pour traduire |
| Licence MIT | Utiliser, modifier et distribuer selon ses conditions | Droits audio, consentement, notices et conformité |
Whisper n’est ni un système natif de diarisation, ni un éditeur de réunions, ni un gestionnaire de consentement, ni un produit de conformité. Il ne fournit pas non plus un service temps réel de production. Les fonctions ajoutées par un projet tiers doivent être attribuées à ce projet, pas à Whisper amont.
Choisir le modèle et le déploiement
| Modèle | Paramètres | VRAM approx. | Vitesse relative* | Bon point de départ |
|---|---|---|---|---|
| tiny / tiny.en | 39 M | ~1 Go | ~10× | Prototype |
| base / base.en | 74 M | ~1 Go | ~7× | Brouillons locaux rapides |
| small / small.en | 244 M | ~2 Go | ~4× | Point de départ équilibré |
| medium / medium.en | 769 M | ~5 Go | ~2× | Priorité à la qualité |
| large | 1,55 Md | ~10 Go | 1× | Qualité multilingue |
| turbo | 809 M | ~6 Go | ~8× | Transcription rapide, pas de traduction |
*Chiffres du README OpenAI pour l’anglais sur A100, relativement à large, vérifiés le 2026-08-20. Langue, audio, matériel et runtime changent la vitesse réelle ; ce n’est pas une garantie générale de latence.
tiny, base, small et medium existent en version multilingue et .en. OpenAI indique que l’avantage anglophone est surtout visible pour tiny et base et diminue pour small et medium. Testez turbo pour une transcription GPU rapide, small comme base multilingue économique, et la variante .en si tout le corpus est anglais. Pour traduire la parole vers l’anglais, utilisez medium ou large : turbo renvoie la langue source même avec la tâche translate.
« 98 langues » décrit la couverture, pas une précision uniforme. La model card officielle signale des écarts selon la quantité de données, la langue, l’accent et le dialecte. Pour un lot monolingue connu, fournir la langue peut éliminer une source d’erreur. Les enregistrements avec changement de langue exigent des cas d’essai dédiés plutôt qu’une seule étiquette détectée.
Installation locale et premier test reproductible
La voie amont consiste à installer openai-whisper, rendre FFmpeg disponible dans le système, choisir un checkpoint puis utiliser la CLI ou l’API Python. Les métadonnées actuelles exigent Python 3.8 ou plus et classent jusqu’à 3.13, tandis que le README reste plus prudent. En production, épinglez commit/version, modèle et dépendances ; suivre main sans trace empêche d’expliquer une régression.
python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
--output_dir transcriptsLa CLI produit TXT, VTT, SRT, TSV et JSON. transcribe() parcourt l’audio avec une fenêtre glissante de 30 secondes et retourne texte, segments et langue détectée. Séparez le téléchargement initial de l’inférence chaude. Le CPU est possible mais les grands modèles peuvent être lents ; la VRAM indiquée est une aide de planification, pas une garantie.
Flux recommandé pour lots et sous-titres
- Définir le livrable.Notes indexables, brouillon de sous-titres, texte publié et preuve à fort impact n’exigent pas la même relecture.
- Créer un corpus privé.Inclure voix propre, bruit, silence, musique, accents, alternance de langues, noms, nombres et durée maximale avec références humaines.
- Séparer l’audio de l’ASR.Conserver l’original et décoder de façon stable. Ajouter VAD ou nettoyage seulement après mesure des mots coupés et hallucinations.
- Comparer sous contrôle.Fixer matériel, runtime, langue et décodage ; journaliser deux ou trois tailles, révision du modèle et facteur temps réel.
- Classer les erreurs.Noter noms, chiffres, négations, texte sur silence, répétitions, changements de langue et dérive temporelle séparément du WER moyen.
- Préparer la livraison.Exporter SRT/VTT ou JSON ; appliquer longueur de ligne, vitesse de lecture, ponctuation et règles de locuteur après coup.
- Faire écouter quand l’enjeu est élevé.Médical, juridique, emploi, citation scientifique et accessibilité imposent une vérification de la source.
audio + consentement
↓
décodage stable / VAD optionnelle ── conserver l’original
↓
modèle + langue + paramètres journalisés
↓
silence · répétition · noms · nombres · dérive temporelle
↓
relecture humaine ── export ── conservation/suppression
Précision, hallucination et évaluation défendable
L’article Whisper a montré une forte robustesse zero-shot grâce à 680 000 heures d’audio multilingue et multitâche faiblement supervisé. Cette stratégie explique aussi certaines limites. La model card officielle avertit que le système peut produire du texte non prononcé, répéter des passages et varier selon langues, accents et dialectes. Silence, musique, bruit et parole incertaine doivent être testés : le décodeur peut générer une suite linguistiquement crédible sans preuve acoustique suffisante.
| Mesure | Utilisation | Angle mort |
|---|---|---|
| WER/CER | Comparer à une référence humaine ; CER si les mots se segmentent mal | Gravité d’un nom, d’une négation ou d’un nombre faux |
| Entités/nombres | Noter personnes, produits, dates, doses, prix et unités | Fluidité générale |
| Segments hallucinés | Étiqueter le texte sur non-parole ou audio sans preuve | Substitutions dans une vraie parole |
| Dérive temporelle | Vérifier les limites au début, milieu et bout | Exactitude des mots |
| Facteur temps réel | temps de calcul / durée audio | Téléchargement, attente et relecture |
| Minutes de relecture/heure | Mesurer la correction humaine par heure audio | Coût d’infrastructure |
Nous ne publions pas un unique « WER de Whisper » : sans checkpoint, langue, jeu, prétraitement et décodage, ce serait trompeur. Pour les benchmarks publiés, consultez le graphique officiel et les annexes du papier. Pour adopter, utilisez un corpus privé versionné et pondérez les erreurs selon leur conséquence réelle.
Les prompts peuvent favoriser l’orthographe des termes métier et noms propres, sans garantie, et peuvent eux-mêmes se retrouver dans la sortie. Temperature fallback, contexte précédent, seuils, temps par mot et option anti-hallucination doivent être modifiés contre le même test, faute de quoi on échange des erreurs à l’aveugle.
Confidentialité, sécurité et limites d’exploitation
| Limite | Contrôle pratique |
|---|---|
| Traitement local | Contrôler téléchargement/egress, chiffrer originaux/résultats et définir la suppression |
| Consentement | Vérifier l’autorisation d’enregistrer et transcrire ; la model card alerte sur l’absence de consentement |
| Décisions sensibles | Ne pas utiliser seul un texte non vérifié pour médecine, droit ou emploi |
| Diarisation | L’évaluer séparément ; Whisper ne prouve pas qui a parlé |
| Temps réel | L’amont n’est pas un produit streaming fini ; tampon et latence relèvent du wrapper |
| Maintenance | Épingler paquet/modèle, auditer dépendances et lancer une régression avant mise à jour |
| Licence | Conserver la notice MIT et vérifier séparément audio, texte et composants tiers |
Whisper face aux options voisines
| Option | À choisir si | Compromis principal |
|---|---|---|
| openai-whisper | Référence Python amont et exécution locale inspectable | Performance, lots et exploitation à construire |
| faster-whisper | Débit CTranslate2 GPU/CPU, quantification et batch | Implémentation distincte ; régression contre l’amont |
| whisper.cpp | C/C++, CPU, Apple Silicon, mobile/edge ou hors ligne | Build et conversion de modèle à gérer |
| WhisperX | Longs lots, alignement mot à mot et diarisation optionnelle | Modèles, dépendances et licences supplémentaires |
| API de transcription OpenAI | Inférence managée et modèles audio actuels | Flux externe, coût à l’usage et limites API |
Le guide OpenAI actuel recommande gpt-transcribe pour les fichiers ordinaires et conserve des usages de whisper-1 pour horodatages, sous-titres ou traduction vers l’anglais. Le 2026-08-20, le tarif officiel estimait gpt-transcribe à 0,0045 $/min, gpt-4o-transcribe à 0,006 $ et mini à 0,003 $. Modèles et tarifs sont dynamiques : revérifiez avant budget. La limite d’upload annoncée est 25 Mo.
Questions fréquentes
Whisper est-il gratuit ?
Le code amont et les modèles publiés sont sous MIT : pas de licence à la minute en auto-hébergement. Calcul, stockage, ingénierie et relecture ont toutefois un coût. L’API hébergée est un service payant séparé.
Peut-il fonctionner entièrement hors ligne ?
Si dépendances et modèle sont déjà locaux, l’inférence peut s’exécuter sans envoyer l’audio à une API. Pour promettre un air-gap, vérifiez aussi application, télémétrie, logs et stockage.
Quel modèle choisir ?
Commencez par turbo pour un GPU rapide, small comme équilibre et .en pour un corpus anglais. Comparez au moins deux tailles sur vos fichiers et n’utilisez pas turbo pour traduire la parole vers l’anglais.
Identifie-t-il les locuteurs ?
Non nativement. WhisperX et d’autres pipelines ajoutent alignement et diarisation avec des modèles distincts, à évaluer pour qualité, droits et exploitation.
Peut-il transcrire en direct ?
Le paquet amont n’est pas un service streaming fini. Des runtimes tiers traitent des chunks, mais VAD, tampon, contexte et latence sont propres à leur implémentation.
Pourquoi invente-t-il ou répète-t-il ?
La model card reconnaît ces échecs. Ajoutez silence et musique aux tests, ne confondez pas fluidité et fidélité et réécoutez les passages importants.
Sources vérifiées
- Dépôt officiel OpenAI Whisper
- README officiel
- Model card officielle
- Licence MIT
- Article Whisper
- Guide Audio API OpenAI
- Tarifs API OpenAI
- faster-whisper
- whisper.cpp
- WhisperX
Revue technique indépendante : 2026-08-20. Modèles, documentation, API et tarifs peuvent changer. Vérifiez les sources primaires et votre évaluation privée avant déploiement.


