Whisper Large-v3 expliqué : architecture, WER et limites (2026)
whisperopenaireconnaissance vocale

Whisper Large-v3 expliqué : architecture, WER et limites (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

Whisper Large-v3 est le transformer encodeur-décodeur d'OpenAI avec 1,55 milliard de paramètres, entraîné sur 5 millions d'heures d'audio et prenant en charge 99 langues sous une licence ouverte permissive. Il atteint 2,7 % de WER sur LibriSpeech test-clean et réduit les erreurs de 10 à 20 % par rapport à Large-v2. Ses principales faiblesses sont les hallucinations pendant les silences, l'absence de diarisation native des locuteurs et une mauvaise adaptation au streaming en temps réel. La variante Turbo d'octobre 2024 réduit le décodeur de 32 couches à 4, passant à 809 millions de paramètres et tournant 2 à 5 fois plus vite avec une perte de précision minime.

Whisper Large-v3 est le modèle de reconnaissance vocale à poids ouverts d'OpenAI, publié en novembre 2023. Il compte 1,55 milliard de paramètres, prend en charge 99 langues, et se trouve au cœur d'une grande partie des outils de transcription développés en 2024 et 2025. Cet article couvre l'architecture, l'histoire des données d'entraînement, les chiffres de référence vérifiés, et les vrais modes de défaillance que vous rencontrerez en production.

Architecture : Transformer encodeur-décodeur

Whisper est un transformer séquence-à-séquence avec deux moitiés reliées par attention croisée.

L'encodeur convertit l'audio brut en une représentation compacte. L'audio est d'abord transformé en spectrogramme log-Mel utilisant 128 bins de fréquence (Large-v3 a augmenté ce nombre par rapport aux 80 bins des versions précédentes). Le spectrogramme alimente une pile de blocs transformer qui produisent un encodage haute dimension du contenu audio dans le temps. L'encodeur traite l'audio par fenêtres de 30 secondes.

Le décodeur est autorégressif : il génère les jetons de sortie un par un, en s'appuyant sur la sortie de l'encodeur et sur ses propres jetons précédents. Ce processus génératif unique gère la transcription, la traduction, l'identification de la langue et la détection d'activité vocale via un routage par jetons spéciaux. Le même modèle produit du texte français à partir d'audio français, du texte anglais à partir d'audio anglais, et du texte anglais à partir d'audio étranger en mode traduction.

Pour Large-v3 spécifiquement, l'architecture compte 32 couches d'encodeur et 32 couches de décodeur, une largeur de modèle de 1 280, et 20 têtes d'attention. Ces chiffres sont inchangés par rapport à Large-v2 ; ce qui a changé dans v3, c'est les données d'entraînement et le nombre de bins Mel.

Les données d'entraînement derrière v3

Le Whisper original (2022) a été entraîné sur 680 000 heures d'audio web faiblement étiqueté. Large-v3 a considérablement élargi cela.

Le mélange d'entraînement de v3 est :

  • 1 million d'heures d'audio faiblement étiqueté (transcrit par des humains ou apparié depuis le web)
  • 4 millions d'heures d'audio pseudo-étiqueté généré en exécutant Large-v2 sur des données non étiquetées

Cela représente 5 millions d'heures au total, entraînées sur 2 époques. L'approche par pseudo-étiquetage, qui consiste à utiliser un modèle existant pour annoter de nouvelles données, est la principale raison pour laquelle la v3 affiche une réduction de 10 à 20 % du taux d'erreur par rapport à la v2, et ce sur un large éventail de langues. La qualité des pseudo-étiquettes est bornée par Large-v2 lui-même, ce qui constitue à la fois la force et le plafond de cette approche.

La répartition des 680 000 heures d'origine, issue de l'article de 2022, donne une idée de la distribution linguistique : environ 438 000 heures d'anglais associées à des transcriptions en anglais, 117 000 heures d'audio non anglophone associées à des transcriptions dans la langue d'origine, et 125 000 heures d'audio non anglophone associées à des traductions en anglais. Cette dernière catégorie est ce qui confère à Whisper sa capacité de traduction dès la sortie de boîte.

Interface de téléversement audio utilisée pour la transcription par lots avec Whisper Large-v3
Interface de téléversement audio utilisée pour la transcription par lots avec Whisper Large-v3

Benchmarks WER vérifiés

Chiffres tirés de la fiche officielle du modèle et du classement Open ASR de Hugging Face, évalués sur Common Voice 15 et Fleurs.

BenchmarkWER
LibriSpeech test-clean (anglais lu)2,7 %
LibriSpeech test-other (anglais varié)5,2 %
Moyenne du classement Open ASR7,44 %
Corpus AMI (audio de réunion)15,95 %
Hindi (ARTPARK-IISc Vaani)26,8 %

L'audio du monde réel, réunions, podcasts, appels téléphoniques, entretiens, se situe généralement dans une fourchette de 8 à 12 % de WER. LibriSpeech test-clean est de l'audio de livres lus, enregistré dans des conditions quasi idéales, donc le chiffre de 2,7 % représente le plafond, pas la moyenne.

Pour donner un ordre de comparaison, des modèles open source plus récents comme Parakeet et Canary de NVIDIA surpassent désormais Whisper sur LibriSpeech test-clean (environ 1,6 à 1,7 % de WER). La position dominante de Whisper dans les outils déployés tient à la maturité de son écosystème, à sa couverture linguistique et à la gamme de runtimes optimisés qui l'entourent, pas à une précision en tête de classement.

Couverture linguistique : 99, mais inégale

Whisper Large-v3 prend officiellement en charge 99 langues, avec le cantonais ajouté comme nouveau jeton de langue dans la v3. Les performances sont fortement concentrées sur les langues disposant du plus de données d'entraînement.

Les langues les mieux prises en charge incluent l'anglais, l'espagnol, le français, l'allemand, l'italien, le japonais, le coréen, le portugais et le russe. Les performances sur les langues à faibles ressources, de nombreuses langues africaines, les langues régionales d'Asie du Sud, peuvent atteindre 25 à 35 % de WER, voire pire. Le benchmark hindi ci-dessus (26,8 %) donne un point de données concret sur où se situe même une langue à ressources modérément élevées sur un audio difficile.

Pour les cas d'usage avec des langues à faibles ressources, consultez notre analyse de pourquoi l'IA a du mal avec les langues à faibles ressources.

Ce que Large-v3 a amélioré par rapport à Large-v2

L'architecture est essentiellement la même entre la v2 et la v3. Les gains proviennent de :

  • L'augmentation des bacs de fréquence Mel (128 contre 80), offrant à l'encodeur une résolution fréquentielle plus fine.
  • Un ensemble d'entraînement de 5 millions d'heures contre les 680 000 heures d'origine, avec un pseudo-étiquetage issu de Large-v2.
  • Une réduction de 10 à 20 % des erreurs dans toutes les langues, surtout sur celles à faibles ressources.
  • Une meilleure précision des horodatages.
  • Une meilleure gestion de l'alternance codique, où les locuteurs mélangent deux langues en pleine phrase.

L'affirmation sur la réduction des hallucinations qui a circulé après la sortie de la v3 est partiellement exacte : la v3 hallucine moins que la v2 dans certaines conditions, mais le problème n'est pas résolu. Cela reste une faiblesse connue en production.

La variante Turbo (octobre 2024)

OpenAI a publié Whisper Large-v3-Turbo en octobre 2024. Le changement clé est l'élagage du décodeur : 32 couches de décodeur réduites à 4, faisant passer le nombre de paramètres de 1,55B à 809M. L'encodeur reste inchangé.

Le résultat est une inférence 2 à 5 fois plus rapide, avec ce qu'OpenAI décrit comme une « dégradation mineure de la qualité ». Sur les GPU NVIDIA, les mesures du facteur temps réel montrent que Turbo traite l'audio nettement plus vite que le temps réel. La contrepartie, c'est que Turbo exclut les tâches de traduction de son fine-tuning, donc il ne gère que la transcription.

Pour la plupart des cas de transcription par lots en production, Turbo est désormais le choix par défaut quand vous contrôlez l'infrastructure. La différence de précision est assez faible pour que le gain de débit la compense généralement.

Points faibles connus en production

Hallucination pendant le silence. Le décodeur de Whisper continue de générer des tokens même quand aucune parole n'est présente, surtout à température 0. La sortie est souvent un texte qui semble plausible mais qui n'a jamais été prononcé. Le correctif standard est un prétraitement par VAD (détection d'activité vocale) pour retirer les segments silencieux avant qu'ils n'atteignent le modèle. Un plan de repli sur la température, qui fournit un tuple de valeurs croissantes plutôt qu'un flottant fixe, réduit aussi les boucles. Notre article sur le fonctionnement de la VAD couvre cette technique.

Pas de diarisation native des locuteurs. Whisper produit une transcription continue sans étiquettes de locuteur. La solution standard est WhisperX, qui enchaîne Whisper (via le backend faster-whisper), un alignement forcé au niveau des phonèmes avec wav2vec2, et la diarisation de pyannote.audio dans un seul pipeline. Chaque étape peut aussi être exécutée indépendamment. Pour en savoir plus sur la diarisation, voir la diarisation des locuteurs expliquée.

Mauvais choix pour le streaming en temps réel. La fenêtre de traitement de 30 secondes et le décodeur autorégressif rendent le streaming à faible latence difficile. Les modèles conçus pour le streaming utilisent une architecture différente, typiquement du CTC en streaming ou de l'attention par blocs avec sortie d'hypothèses partielles. La série Nova de Deepgram est l'alternative la plus courante pour les cas d'usage en temps réel. L'article sur Deepgram Nova-3 couvre la comparaison.

Absence de contexte entre les segments. Un fichier audio de 60 minutes est traité comme 120 segments séquentiels de 30 secondes. Le modèle n'a aucun souvenir du segment 1 lorsqu'il traite le segment 5. Un nom, un acronyme ou un terme introduit au début peut être transcrit de manière incohérente plus loin dans le même fichier.

Vocabulaire spécialisé. Whisper ne dispose d'aucun mécanisme de biais de vocabulaire. La terminologie médicale, juridique ou financière qui n'apparaît pas fréquemment dans les données d'entraînement produira des erreurs même sur un audio propre. Un affinage sur des données spécifiques au domaine est la solution adaptée pour les cas d'usage spécialisés à fort enjeu.

Exécuter Whisper soi-même

Trois pistes pratiques pour un déploiement local :

L'implémentation de référence d'OpenAI (Python). Le code canonique, avec l'inférence la plus lente. Utile pour tester ou déboguer le comportement du modèle, mais pas pour un débit en production.

Whisper.cpp (C++). Fonctionne sur CPU, Apple Silicon (Metal), CUDA et Vulkan. La meilleure option pour les déploiements sur Mac ou les systèmes embarqués. Aucune dépendance à Python.

Faster-Whisper (Python, via CTranslate2). Tourne 4 fois plus vite que l'implémentation de référence sur les GPU NVIDIA, avec une quantification INT8 qui réduit l'utilisation de la VRAM d'environ 40 %. C'est le choix standard pour les serveurs Linux équipés de GPU.

Les trois produisent des résultats équivalents à partir des mêmes poids de modèle. La différence réside dans la vitesse d'inférence et la consommation de ressources.

Licence

Le code et les poids de Whisper sont publiés sous licence MIT, selon le dépôt GitHub officiel d'OpenAI. La fiche du modèle sur Hugging Face mentionne Apache 2.0. Les deux sont des licences permissives qui autorisent un usage commercial sans redevance. Si votre cas d'usage exige une licence spécifique, vérifiez directement le dépôt GitHub plutôt que de vous fier à la fiche Hugging Face.

Quand Whisper convient, et quand il ne convient pas

Whisper Large-v3 est un choix solide par défaut pour :

  • La transcription par lots d'audio pré-enregistré.
  • Le contenu multilingue ou avec une langue source inconnue.
  • Les tâches de traduction (audio non anglais vers texte anglais).
  • Les cas d'usage qui nécessitent un modèle à poids ouverts que vous pouvez exécuter sur votre propre infrastructure.

C'est le mauvais choix pour :

  • Le streaming en temps réel ou à faible latence, privilégiez plutôt un modèle optimisé pour le streaming.
  • La transcription de réunions avec attribution des locuteurs, ajoutez une couche de diarisation ou optez pour un service qui l'inclut.
  • Le vocabulaire très spécialisé sans fine-tuning, une adaptation au domaine est nécessaire.

Pour une comparaison plus large des approches de transcription et de leurs coûts, consultez la comparaison des tarifs de transcription et la vue d'ensemble des meilleures API de reconnaissance vocale.

Si vous souhaitez évaluer Whisper sur votre propre audio sans mettre en place d'infrastructure, le niveau gratuit de ConvertAudioToText exécute un pipeline Whisper Large-v3 sur l'audio téléchargé. Téléversez un fichier d'exemple et comparez le résultat avec votre référence avant de vous engager dans une solution.

Questions fréquentes

Combien de paramètres Whisper Large-v3 possède-t-il ?

Whisper Large-v3 compte 1 550 millions de paramètres (1,55B). La variante Turbo d'octobre 2024 réduit ce nombre à 809M en diminuant le décodeur de 32 à 4 couches, offrant une inférence 2 à 5 fois plus rapide avec un léger compromis sur la précision.

Quel taux d'erreur de mots Whisper Large-v3 atteint-il ?

Sur LibriSpeech test-clean (audio de livres audio anglais lus), Whisper Large-v3 atteint 2,7 % de WER. Sur la partition test-other, plus difficile, il atteint 5,2 %. Le WER moyen sur l'ensemble de référence du classement Open ASR Leaderboard est de 7,44. L'audio du monde réel avec bruit, accents ou qualité téléphonique se situe généralement dans la plage de 8 à 12 %.

Whisper Large-v3 prend-il en charge la diarisation des locuteurs ?

Non. Whisper n'identifie pas nativement qui parle. L'approche standard consiste à exécuter Whisper pour la transcription, puis pyannote.audio séparément pour les segments de locuteurs, et à aligner les deux sorties à l'aide des horodatages au niveau du mot. La bibliothèque WhisperX regroupe ce pipeline en trois étapes dans un outil unique.

Pourquoi Whisper hallucine-t-il du texte pendant les silences ?

Le décodeur autorégressif de Whisper continue de générer des tokens même en l'absence de parole, surtout avec un décodage déterministe (température 0). Le correctif le plus fiable consiste à appliquer un prétraitement de détection d'activité vocale (VAD) pour supprimer les segments silencieux avant qu'ils n'atteignent le modèle. Utiliser un plan de repli sur la température plutôt qu'une valeur fixe unique aide également en déclenchant un ré-échantillonnage lorsque le modèle boucle.

Quelle est la différence entre Whisper Large-v3 et Large-v3-Turbo ?

Les deux partagent le même encodeur. Turbo réduit le décodeur de 32 couches à 4 et affine le résultat, faisant passer le nombre total de paramètres de 1,55B à 809M. Le gain de vitesse est de 2 à 5 fois selon le matériel. OpenAI décrit la différence de précision comme une "dégradation mineure de la qualité". Turbo ne prend pas en charge les tâches de traduction, car cet affinage a exclu les données de traduction.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles