
Pourquoi la transcription fait des erreurs, les modes de défaillance expliqués
Summarize this article with:
Les erreurs de transcription se répartissent en cinq catégories avec des correctifs différents: acoustique (le modèle a mal entendu, corrigez l'enregistrement), linguistique (homophones et noms inconnus, ajoutez du vocabulaire ou éditez), attribution du locuteur (limites de la diarisation), erreurs de bornage (bons mots, mauvais horodatages) et hallucination (texte inventé comme «merci d'avoir regardé» pendant le silence, coupez le silence). Diagnostiquez la catégorie avant de blâmer le moteur, car les erreurs sont rarement aléatoires.
La réponse courte
Les erreurs de transcription IA se répartissent en cinq catégories distinctes, chacune avec une cause racine différente. Savoir à quelle catégorie appartient une erreur vous indique où concentrer la correction. Les erreurs qui semblent aléatoires ne le sont généralement pas du tout.

Erreurs acoustiques : le modèle a mal entendu
La cause sous-jacente est un signal audio dégradé. Lorsque le son qui parvient au modèle est ambigu, le modèle devine, et il se trompe parfois.
Les coupables acoustiques les plus courants :
Audio téléphonique à bande étroite. La téléphonie standard encode la parole à 8 kHz, coupant la majeure partie du contenu fréquentiel au-dessus de 4 kHz. Un benchmark de 2025 sur de véritables enregistrements de centres d'appels a montré que même le meilleur système n'atteignait que 87,7 % de précision sur cet audio, contre les 95 à 99 % couramment observés sur les enregistrements à large bande. Les hautes fréquences manquantes sont précisément ce qui distingue certaines fricatives et occlusives les unes des autres.
Bruit de fond. Le bruit masque le signal de parole et réduit le rapport signal sur bruit. Ce que reçoit le modèle, c'est un mélange de voix et d'environnement, pas une voix propre. Consultez gérer le bruit de fond en transcription pour les options techniques.
Distance et réverbération. Un microphone placé à l'autre bout de la pièce capte un étalement réverbéré du son original. Au moment où la forme d'onde atteint le modèle, les contours des consonnes sont flous et les mots courts disparaissent dans les réflexions de la pièce.
Artefacts de microphone. Les pops d'explosives, le bruit du vent, l'écrêtage et les pertes de signal retirent chacun des informations dont le modèle a besoin pour distinguer les phonèmes. Une forme d'onde écrêtée est irrécupérable ; le modèle voit une ligne plate là où devrait se trouver une consonne.
Mon avis : les erreurs acoustiques sont presque toujours corrigeables à la source. Un micro directionnel à courte distance dans une pièce calme apporte un meilleur gain de précision que de changer de fournisseur de transcription.
Erreurs linguistiques : le modèle a bien entendu, mais a mal choisi
Le modèle a reçu l'audio correctement, mais a sélectionné le mauvais mot parmi des options acoustiquement similaires. C'est une défaillance du modèle de langage, pas un problème de signal.
Homophones
« Leur », « là » et « l'heure » sonnent de façon identique. Le modèle s'appuie sur le contexte environnant pour en choisir un, et avec des phrases courtes ou des prises de parole rapides, ce contexte est mince. Il en va de même pour « affect » versus « effect », « principal » versus « principle », et des centaines de paires similaires. Le choix est probabiliste, et le modèle se trompe parfois avec assurance.
Mots hors vocabulaire (OOV)
C'est l'un des modes de défaillance les plus constants. Chaque modèle de transcription possède un vocabulaire entraîné. Les mots qui en sortent, le plus souvent des noms propres, des marques, des patronymes rares et des termes spécialisés, sont mal reconnus et remplacés par l'équivalent le plus proche dans le vocabulaire. Le modèle ne peut pas produire ce qu'il n'a jamais été entraîné à générer.
Une entreprise nommée « Atrion » revient comme « Adrian ». Un nom de médicament comme « Dupixent » devient « duplex aunt ». Le nom d'un fondateur est rendu par le mot courant le plus proche. Les erreurs OOV frappent précisément là où la précision compte le plus, car les noms et les termes de marque portent un sens qu'une substitution générique détruit.
Atténuation pratique : les systèmes basés sur Deepgram et Whisper prennent en charge le biais de vocabulaire ou les invites initiales. Fournir une liste de noms propres attendus avant la transcription réduit considérablement les erreurs OOV.
Nombres et formats
« Trois cinquante », « trois cent cinquante », « 350 » et « 3:50 » sont autant d'interprétations plausibles d'une même énonciation selon le contexte. Le modèle n'en retient qu'une, et choisit souvent le mauvais registre. Les contextes techniques où les nombres abondent, comme les documents juridiques, les appels financiers ou les cours scientifiques, tendent à produire un taux d'erreur numérique plus élevé.
Vocabulaire de domaine
Les domaines médical, juridique, scientifique et technique ont tous un jargon sous-représenté dans les données d'entraînement générales. « Dysarthrie » devient « disarthrie ». « Fiduciaire » ressort parfois comme « théorie des champs ». Le modèle se rabat sur le mot le plus courant qui occupe une place acoustique similaire.
Pour en savoir plus sur la mécanique du choix entre candidats concurrents, voir explication de la précision de transcription.
Erreurs de locuteur : les bons mots, la mauvaise personne
La diarisation attribue les mots aux locuteurs. Quand elle échoue, la transcription est correcte mais l'attribution est fausse. Les taux d'erreur de diarisation monocanal en conditions réelles se situent entre 10 et 18 % sur de l'audio non segmenté, selon des recherches publiées en 2025.
Pourquoi les voix se confondent
La diarisation des locuteurs fonctionne en extrayant une empreinte vocale pour chaque segment de locuteur, puis en les regroupant. Deux locuteurs avec une hauteur, un débit et un accent similaires se retrouvent proches dans cet espace d'empreintes, et l'algorithme de regroupement attribue mal les segments.
Les interventions courtes aggravent le problème. Quand quelqu'un dit seulement « oui » ou « mm-hmm » avant de rendre la parole, le modèle n'a presque aucun signal pour ancrer l'identité de ce locuteur. Ces petits mots de retour sont fréquemment mal attribués.
Chevauchements de parole : le cas le plus difficile
Lorsque deux personnes parlent en même temps sur un seul microphone, leurs caractéristiques acoustiques fusionnent en une seule forme d'onde, et l'algorithme de diarisation ne peut pas les séparer mathématiquement. Le résultat est soit un locuteur perdu, soit un locuteur fantôme qui n'existe pas en réalité. Les systèmes de diarisation sensibles aux chevauchements détectent explicitement ces zones et les signalent, ce qui vaut mieux qu'une mauvaise attribution silencieuse, mais le contenu sous-jacent reste ambigu.
L'enregistrement multicanal, un microphone par locuteur, résout ce problème proprement. La séparation des canaux donne au modèle un signal que la diarisation sur micro unique ne peut pas reproduire.
Voir explication de la diarisation des locuteurs pour une analyse plus complète du fonctionnement du clustering.
Erreurs de Frontière : Mots Corrects, Mauvaises Positions
Les mots aux bords des segments audio sont systématiquement les plus exposés aux erreurs. Deux mécanismes en sont responsables.
Écrêtage par Détection d'Activité Vocale
La plupart des pipelines de transcription utilisent la détection d'activité vocale (VAD) pour identifier les zones de parole et ignorer le silence. Une VAD agressive se déclenche légèrement trop tôt ou trop tard, écrêtant le premier phonème d'un énoncé ou la dernière consonne d'une phrase. Les mots courts, "oui," "non," "et," disparaissent entièrement. L'erreur est invisible car il n'y a pas de mauvais mot dans la transcription ; le mot correct est simplement absent.
Artefacts de Frontière de Segment dans Whisper
Whisper traite l'audio long en fenêtres de 30 secondes, avançant en fonction des horodatages prédits. Les mots qui chevauchent une frontière de segment sont traités deux fois, une fois à la fin d'une fenêtre et une fois au début de la suivante. Le résultat est une duplication de mots, une omission de mots, ou une jonction qui fusionne deux mots distincts. C'est un comportement documenté dans le pipeline de transcription de longs formats de Whisper, pas un cas marginal.
Des outils comme WhisperX ajoutent une étape d'alignement dédiée qui ré-ancre les horodatages des mots sur le signal audio après le décodage, ce qui réduit, sans toutefois les éliminer, ces artefacts de frontière.
En relisant une transcription, les positions des frontières de segments, environ toutes les 30 secondes, sont les emplacements les plus susceptibles de contenir ce type d'erreur.
Hallucination : des mots que personne n'a prononcés
Le modèle a produit du texte sans aucun audio correspondant. C'est qualitativement différent des autres catégories, car il n'y a pas de véritable entrée mal interprétée ; le modèle a inventé une sortie à partir de rien.
Longs silences et audio non verbal
Il est largement documenté que Whisper génère du texte pendant les silences, la musique de fond ou le bruit non verbal. Les hallucinations spécifiques ne sont pas aléatoires : comme Whisper a été entraîné sur environ 680 000 heures d'audio web incluant une grande quantité de contenu YouTube, il a appris à associer le silence près de la fin d'un enregistrement à des phrases de conclusion de vidéos. Des sorties comme « Merci d'avoir regardé » ou « Abonnez-vous à ma chaîne » apparaissant dans la transcription d'une déposition judiciaire sont Whisper qui insère du texte appris à partir de scripts de fin YouTube, et non du texte réellement prononcé par quelqu'un.
Boucles de répétition
Un autre mode de défaillance reconnu est la boucle de répétition : le décodeur se bloque et génère la même phrase en boucle jusqu'à ce qu'un élément de l'audio fournisse une nouvelle ancre. Des recherches ont documenté ce comportement dans 14 des 19 langues auditées. Le schéma est visuellement évident, une phrase se répétant cinq ou dix fois de suite, et doit être traité comme un signal pour tronquer cette section.
Fuite des données d'entraînement
Au-delà des phrases YouTube, il a été démontré que Whisper produit des phrases qui semblent provenir de ses données d'entraînement plutôt que de l'audio d'entrée. Ces phrases sont difficiles à détecter automatiquement, car elles sont grammaticalement plausibles. Des vérifications manuelles ponctuelles des transcriptions provenant de régions audio silencieuses ou très calmes sont le moyen le plus fiable de les repérer.
Une atténuation : un VAD avant le modèle, pour que le modèle ne voie jamais les zones de silence qui déclenchent l'hallucination. La plupart des pipelines de transcription bien configurés font cela par défaut.
Comment les catégories se combinent
Un enregistrement réel échoue rarement dans une seule catégorie. Un podcast avec deux animateurs qui se coupent parfois la parole, enregistré avec des micros d'ordinateur portable dans une pièce avec du bruit de CVC, produira des erreurs acoustiques, des échecs de diarisation pendant les chevauchements, des erreurs hors-vocabulaire quand les invités mentionnent des noms obscurs, et de l'hallucination pendant le silence d'avant l'épisode. Le profil d'erreur est additif.
Le diagnostic le plus efficace consiste à prélever dix erreurs dans votre transcription, à classer chacune par catégorie, et à voir laquelle domine. Cela vous indique où investir l'effort de correction.
| Condition audio | Plage de précision typique |
|---|---|
| Enregistrement en studio, locuteur unique, vocabulaire courant | 95 à 99 pour cent |
| Bureau à domicile, locuteur unique, micro correct | 90 à 96 pour cent |
| Visioconférence, installation professionnelle, plusieurs locuteurs | 85 à 92 pour cent |
| Appel téléphonique ou VoIP, audio à bande étroite | 80 à 88 pour cent |
| Enregistrement sur le terrain, plusieurs locuteurs, bruit ambiant | 70 à 85 pour cent |
| Accent prononcé sur audio dégradé | Sous 70 pour cent dans les pires cas |
Les plages de précision proviennent du benchmark 2026 d'AssemblyAI et de l'étude 2025 des centres d'appels de Voicegain. Les résultats individuels varient selon le moteur et l'audio.
Où trouver des solutions
Ce billet explique les mécanismes. Pour les atténuations pratiques :
- Qualité audio et choix du microphone : conseils micro pour une transcription claire et améliorer la qualité audio avant la transcription
- Techniques de réduction du bruit : gérer le bruit de fond en transcription
- Obtenir des résultats plus précis à partir de fichiers bruités : transcrire avec une mauvaise qualité audio
- Pourquoi les taux de précision varient selon les services : la précision de la transcription expliquée
Si vous voulez tester votre propre audio avant d'investir du temps dans des correctifs, le niveau gratuit de ConvertAudioToText vous permet d'uploader jusqu'à 10 minutes sans compte. Le résultat vous montrera quelle catégorie d'erreur domine pour votre fichier spécifique.
Questions fréquentes
Pourquoi ma transcription dit « merci d'avoir regardé » alors que personne ne l'a dit ?
C'est une hallucination documentée de Whisper, liée à ses données d'entraînement. Whisper a appris à partir d'environ 680 000 heures d'audio web, dont une grande partie provenait de vidéos YouTube sous-titrées. Le modèle associe le silence ou le bruit non vocal aux fins typiques des vidéos YouTube et génère ces phrases en sortie. Il ne transcrit pas quelque chose de faible en arrière-plan ; il fait du pattern-matching sur l'absence de parole.
Pourquoi les noms propres sont-ils presque toujours faux dans mes transcriptions ?
Les noms propres, les noms de famille, les marques et les prénoms inhabituels sont sous-représentés dans les données d'entraînement générales. Quand le modèle rencontre un nom qu'il a rarement ou jamais vu, il substitue le mot le plus proche de son vocabulaire qui correspond au schéma acoustique. C'est le problème du hors-vocabulaire (OOV), et c'est l'un des modes de défaillance les plus constants sur tous les moteurs de transcription. Le biais de vocabulaire ou un prompt initial listant les noms attendus est le correctif direct.
Pourquoi un même locuteur est-il parfois identifié comme deux personnes différentes ?
La diarisation des locuteurs fonctionne en regroupant des embeddings vocaux. Les énoncés courts, les mots isolés ou les backchannels ne portent pas assez de signal acoustique pour ancrer une identité de manière fiable. Le modèle les attribue au cluster le plus proche à ce moment-là, ce qui peut ne pas être le bon locuteur. C'est particulièrement fréquent lors d'échanges rapides où les réponses brèves s'enchaînent vite.
L'IA de transcription peut-elle halluciner sur un audio clairement parlé ?
Oui, mais c'est rare. Le scénario le plus courant reste l'hallucination pendant les silences, la musique ou les bruits non vocaux. Sur un audio clairement parlé, les erreurs les plus probables sont des substitutions (mauvais mot choisi) plutôt que des insertions (mot inventé). Une véritable hallucination sur une parole propre existe, notamment avec les boucles de répétition où le décodeur se bloque, mais le mécanisme diffère de celui déclenché par le silence.
Puis-je faire quelque chose contre les erreurs de transcription causées par des locuteurs qui se chevauchent ?
La solution la plus efficace est d'enregistrer avec des micros séparés, un par locuteur. L'audio multicanal élimine le mélange des formes d'onde qui rend le chevauchement impossible à diariser correctement. Si ce n'est pas envisageable, la plupart des systèmes de diarisation modernes disposent d'un mode de détection des chevauchements qui signale au moins les segments ambigus au lieu de faire une attribution erronée en silence. Corrigez manuellement ces segments signalés.
Sources
- AssemblyAI, « Quelle est la précision de la reconnaissance vocale en 2026 ? » https://www.assemblyai.com/blog/how-accurate-speech-to-text
- Voicegain, « Benchmark de précision de la reconnaissance vocale 2025 pour les fichiers audio de centre d'appels en 8 kHz » https://www.voicegain.ai/post/2025-speech-to-text-accuracy-benchmark-for-8-khz-call-center-audio-files
- TechCrunch, « L'outil de transcription Whisper d'OpenAI présente des problèmes d'hallucination, selon des chercheurs » https://techcrunch.com/2024/10/26/openais-whisper-transcription-tool-has-hallucination-issues-researchers-say/
- Gladia, « Biais des modèles d'IA : qu'est-ce qui a cloché avec Whisper d'OpenAI ? » https://www.gladia.io/blog/ai-model-biases-what-went-wrong-with-whisper-by-openai
- AssemblyAI, « Qu'est-ce que la diarisation des locuteurs et comment fonctionne-t-elle ? » https://www.assemblyai.com/blog/what-is-speaker-diarization-and-how-does-it-work
- arxiv.org, « Étude des hallucinations de l'ASR Whisper induites par l'audio non vocal » https://arxiv.org/html/2501.11378v1
- Kerson AI Solutions, « Biais d'accent dans la reconnaissance vocale : défis, impacts et solutions » https://kerson.ai/research/accent-bias-in-speech-recognition-challenges-impacts-and-solutions/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.