Précision de transcription expliquée : ce que 99 % signifie vraiment
transcriptionprécisionfondamentaux

Précision de transcription expliquée : ce que 99 % signifie vraiment

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Le taux d'erreur de mots (WER) est la métrique standard de précision : les erreurs divisées par le nombre total de mots de référence, exprimées en pourcentage soustrait de 100. Une annonce de « précision de 99 % » impressionne jusqu'à ce qu'on apprenne qu'elle vient typiquement d'enregistrements de livres audio propres, pas de réunions ou d'appels téléphoniques. Le même modèle qui atteint 98 % sur un fichier studio peut chuter à 75-85 % sur de l'audio bruité ou avec accent. Cet article explique les maths, les astuces de benchmark et ce que les niveaux de précision ressentent concrètement.

La précision de transcription est la métrique que chaque fournisseur met en avant et que presque aucun n'explique. Pour faire court : la « précision » n'est que le taux d'erreur sur les mots (WER) converti en pourcentage, la référence utilisée pour le benchmark compte autant que le chiffre lui-même, et le fichier que vous téléversez correspond rarement aux conditions qui ont produit cette promesse marketing.

Ce que mesure réellement le taux d'erreur sur les mots

La formule est la suivante :

WER = (Substitutions + Suppressions + Insertions) / Nombre total de mots de référence

Trois types d'erreurs comptent chacun pour un point :

  • Substitution. « Il a dit oui » transcrit en « elle a dit oui ».
  • Suppression. « Envoyez le rapport » transcrit en « envoyez rapport ».
  • Insertion. « On s'est vus » transcrit en « on s'est bien vus ».

Une transcription de référence de 1 000 mots avec 50 erreurs donne un WER de 5 %, ce qui devient « 95 % de précision » sur la page produit. Le calcul est correct. Ce que le chiffre masque, c'est que le WER traite chaque mot de la même façon : omettre « pas » dans « n'approuvez pas le transfert » coûte un point, tout comme omettre « euh ». L'impact sur votre flux de travail n'est pas équivalent.

Le WER ne pénalise pas non plus le mauvais contexte. Un modèle qui transcrit systématiquement « deux » en « de » affichera presque aucune pénalité sur la plupart des audios, mais il cassera tout script qui analyse les chiffres.

Ce que les paliers de précision donnent en pratique

Les chiffres isolés sont faciles à mal interpréter. Pour un entretien d'une heure (environ 9 000 mots) :

PrécisionErreursErreurs par minuteCe que vous obtenez
99 %901,5Transcription quasi propre, simple vérification rapide
97 %2704,5Lisible, 15 à 20 minutes de relecture avant publication
95 %4507,5Erreurs visibles, surtout sur les noms propres, 30 à 45 minutes de relecture
90 %90015Utilisable comme référence approximative, mais nécessite une lourde correction
80 %1 80030Souvent plus rapide de tout retaper à partir de zéro

Pour la plupart des workflows d'édition, 95% est le plancher et 97% et plus est ce que vous devriez attendre d'un bon outil d'IA sur un audio propre. Si un outil descend sous les 90% sur vos fichiers, le problème vient presque toujours de l'entrée audio, pas du modèle. L'article complémentaire sur comment améliorer la précision de transcription couvre les correctifs spécifiques ; l'article sur gérer le bruit de fond approfondit la préparation audio.

Pourquoi les chiffres de référence induisent en erreur

Les fournisseurs choisissent leurs benchmarks. Voici ce que les plus courants testent réellement :

LibriSpeech. Des livres audio lus par des bénévoles dans des pièces calmes. Les modèles atteignent régulièrement 97-99% ici. Whisper Large-v3 obtient environ 2,7% de WER sur le jeu de test propre. C'est le scénario idéal pour tout enregistrement.

TED-LIUM. Des conférences avec des accents et une certaine variation entre locuteurs. Plus difficile, mais il s'agit toujours de discours répétés. GPT-4o-transcribe atteint environ 2,5% de WER ici ; AssemblyAI Universal-3 Pro tourne autour de 6,8% de WER.

CallHome / Earnings-22 / AMI. Conversations téléphoniques, appels de résultats, réunions multi-locuteurs. Whisper Large-v3 obtient 26,4% de WER sur CallHome et 15,9% de WER sur l'audio de réunion AMI. Ce sont ces chiffres qui reflètent ce à quoi ressemble l'audio professionnel réel.

Le chiffre sur la page d'accueil provient presque toujours de LibriSpeech ou d'un jeu de données propre similaire. Le chiffre que vous obtenez sur un appel Zoom est plus proche de celui de CallHome ou d'AMI, parfois pire.

Mon avis : quand un fournisseur cite « 99% de précision », la première question à poser est « sur quel jeu de données ? ». S'il ne peut pas répondre, considérez le chiffre comme décoratif.

Les benchmarks tiers indépendants produisent systématiquement des taux d'erreur plus élevés que les benchmarks internes des fournisseurs. Les benchmarks internes de Deepgram placent Nova-3 à environ 5-7% de WER sur leurs jeux de test curatés ; les benchmarks tiers sur de l'audio mixte du monde réel placent le même modèle autour de 18% de WER. Aucun des deux n'est faux. Ils mesurent des choses différentes.

Pour une analyse détaillée comparant les différents fournisseurs d'API, consultez l'article meilleures API de reconnaissance vocale 2026.

Ce qui fait vraiment bouger votre WER

Le choix du modèle n'est qu'une variable. Ces facteurs influencent davantage la précision sur la plupart des fichiers :

Qualité audio

Un enregistrement propre en 16 kHz mono, avec le locuteur près d'un microphone USB, peut atteindre moins de 3 % de WER. Le même locuteur sur un haut-parleur dans une pièce bruyante atteint 15 à 25 % de WER avec le même modèle. Des données réelles vérifiées confirment la fourchette : un audio studio propre donne 3 à 5 % de WER pour les meilleurs modèles ; un audio capté en champ lointain dans une pièce donne 18 à 28 % de WER.

Les coupables précis : un bruit de fond supérieur à -40 dB par rapport à la parole, une compression MP3 agressive (64 kbps fait perdre les consonnes fricatives dont dépendent les modèles), la réverbération de la pièce sur des murs durs, et la distance par rapport au microphone.

Accent et dialecte

Un modèle entraîné principalement sur l'anglais américain obtiendra 96 % sur l'anglais américain et environ 85 % sur une parole fortement accentuée. Whisper Large-v3 sur l'anglais accentué se situe dans la plage de 8 à 15 % de WER. L'écart s'est réduit avec les modèles multilingues, mais il n'a pas disparu.

Pour un audio non anglophone, choisir un fournisseur qui prend en charge nativement votre langue importe plus que de sélectionner le modèle anglais le mieux noté.

Vocabulaire spécialisé

Les modèles généralistes trébuchent sur les termes médicaux, juridiques, scientifiques et techniques de niche. « Encephalitis » peut revenir comme « in cephalitis ». Les noms de marques et les noms propres sont particulièrement fragiles, car ils apparaissent rarement dans les données d'entraînement.

Trois solutions pratiques : l'augmentation de vocabulaire (la plupart des API permettent de passer une liste de termes), des modèles personnalisés pour un travail de domaine à fort volume, ou une passe ciblée de recherche et remplacement sur les termes récurrents connus.

Nombre de locuteurs et chevauchements

Le monologue à un seul locuteur est la condition la plus simple. Deux locuteurs dans un entretien structuré restent gérables. Trois personnes ou plus, surtout avec des chevauchements de parole, multiplient rapidement les erreurs. Les erreurs de diarisation et les erreurs de reconnaissance s'accumulent les unes sur les autres.

Pour les réunions avec plusieurs intervenants, attendez-vous à un taux d'erreur de 10 à 15 % même avec un modèle haut de gamme, sauf si l'audio est bien séparé. L'article explication du diarisation des locuteurs détaille comment la diarisation interagit avec la précision.

Longueur du fichier

La plupart des pipelines modernes découpent l'audio en fenêtres de 30 secondes avec chevauchement pour gérer les fichiers longs. Whisper en particulier peut halluciner aux limites des segments lorsque le découpage est naïf, produisant un texte fluide qui n'a rien à voir avec l'audio. Des recherches publiées en 2024-2025 ont confirmé qu'un petit sous-ensemble des têtes d'attention du décodeur de Whisper est responsable de la majorité de ces hallucinations sur les segments sans parole. La solution pratique consiste à utiliser la détection d'activité vocale avant le découpage pour supprimer les silences.

Scores de confiance : ce qu'ils vous disent et ce qu'ils ne vous disent pas

La plupart des API vocales modernes renvoient un score de confiance par mot ou par segment. Une confiance de 0,92 signifie que le modèle attribue une probabilité de 92 % à ce mot d'être correct.

La confiance est utile pour :

  • Signaler les passages à relire. Un éditeur peut directement accéder aux mots à faible confiance au lieu de lire l'intégralité de la transcription.
  • Contrôle qualité automatisé. Rejeter les segments sous un seuil donné et les relancer avec un autre modèle ou une relecture humaine.
  • Estimer le temps de correction. Une transcription de 90 minutes avec 30 mots à faible confiance se révise plus vite qu'une autre où les erreurs sont réparties uniformément.

La confiance n'est pas utile pour :

  • Prouver l'exactitude. Un modèle peut attribuer une confiance élevée à un mot halluciné. Whisper est l'exemple le plus cité, produisant un texte fluide sur une entrée silencieuse ou bruitée avec des scores de confiance élevés.
  • Comparer entre modèles. Un 0,90 de Deepgram et un 0,90 de Whisper utilisent des échelles internes différentes. Ce ne sont pas les mêmes chiffres.

Utilisez la confiance pour savoir où regarder, pas comme substitut au fait de regarder.

La transcription humaine comme point de référence

Transcriptionnistes humains formés obtiennent 98-99 % sur de l'audio propre et 95-97 % sur de l'audio difficile. L'écart entre l'IA et l'humain sur l'audio propre est désormais assez faible pour que la différence justifie rarement le coût dans la plupart des cas d'usage.

L'écart sur l'audio difficile reste significatif. Les tribunaux, les chercheurs qualitatifs et les flux de travail de documentation médicale utilisent encore la transcription humaine pour des contenus où les erreurs ont de vraies conséquences.

À noter : deux humains qui transcrivent le même fichier ne produiront pas des transcriptions identiques. L'accord inter-annotateurs sur de l'audio difficile se situe autour de 95 %, ce qui fixe un plafond pratique pour ce que tout système, IA ou humain, peut atteindre sur ce type de contenu.

Mesurer votre propre WER

Si vous voulez savoir quelle précision vous obtenez réellement sur votre audio :

  1. Prenez un échantillon de 5 minutes de votre audio typique, quelque chose de représentatif de votre charge de travail réelle.
  2. Transcrivez-le soigneusement à la main (c'est votre transcription de référence).
  3. Passez le même extrait dans votre outil IA (c'est votre transcription hypothèse).
  4. Calculez le WER avec la bibliothèque Python jiwer ou l'outil NIST sclite.

Cinq minutes de votre audio réel vous donnent un chiffre plus exploitable que n'importe quel benchmark de fournisseur. La comparaison à viser n'est pas la page marketing, c'est votre propre référence contre votre propre audio.

Si vous voulez un contrôle rapide avant de vous engager dans un plan payant, l'outil audio-vers-texte de ConvertAudioToText vous permet de téléverser un échantillon et d'inspecter le résultat directement. Si votre type d'audio spécifique produit de mauvais résultats, vous le verrez avant de payer.

Quand le WER n'est pas la bonne question

Trois règles pour les cas d'usage :

  • Publication verbatim (notes d’épisode, citations presse) : visez 97% et plus, et prévoyez 15 à 20 minutes de relecture. Une seule erreur de chiffre ou de nom dans une transcription publiée, c’est le genre de détail qui saute aux yeux.
  • Indexation de recherche ou prise de notes : 90 à 92% suffisent souvent. Les erreurs sur les mots de remplissage et les variantes mineures ne cassent pas une requête de recherche.
  • Citation de passages précis dans un texte écrit : vérifiez toujours la citation exacte contre l’audio, peu importe la précision globale. Le WER global peut être excellent alors qu’une phrase est fausse.

Le bon seuil de précision est défini par l’usage prévu de la transcription, pas par ce qui impressionne dans un comparatif produit.

FAQ

Qu’est-ce que le taux d’erreur de mots (WER) ?

Le WER est la métrique standard pour mesurer la précision d’une transcription. Il se calcule comme (substitutions + suppressions + insertions) divisé par le nombre total de mots dans la transcription de référence. Un WER de 5% correspond à une précision annoncée de 95%. Il compte trois types d’erreurs de manière égale : un mot substitué, un mot omis et un mot ajouté coûtent chacun un point, quel que soit leur impact sur le sens.

Pourquoi les fournisseurs annoncent-ils 99% de précision alors que mes fichiers sortent moins bons ?

Parce que le choix du benchmark compte énormément. La plupart des fournisseurs citent la précision obtenue sur LibriSpeech, un jeu de données d’audiobooks propres où même les modèles de milieu de gamme dépassent 97%. L’audio réel, surtout les réunions, les appels téléphoniques ou les environnements bruyants, produit des taux d’erreur nettement plus élevés. Les chercheurs de Gladia ont documenté le même modèle affichant 5% de WER sur un benchmark et plus de 25% en production sur de l’audio réel équivalent. Le chiffre du benchmark n’est pas un mensonge, mais ce n’est pas le vôtre.

À quoi ressemble concrètement une précision de 95% sur un enregistrement d’une heure ?

Fragment 7 :

Un entretien d'une heure représente environ 9 000 mots. À 95 % de précision, cela fait 450 erreurs, soit environ 7 fautes par minute. Le texte reste lisible, mais les noms propres et les termes techniques cassent souvent, et il vous faudra passer 30 à 45 minutes de relecture avant publication. À 99 % de précision (90 erreurs), le résultat se rapproche d'une transcription humaine propre et ne nécessite qu'une simple vérification ponctuelle.

Puis-je me fier aux scores de confiance pour repérer les erreurs ?

Les scores de confiance sont utiles pour signaler les mots à vérifier, mais pas comme preuve d'exactitude. Un modèle peut attribuer une confiance élevée à un mot halluciné, surtout sur des segments bruités ou silencieux. Whisper est particulièrement connu pour générer un texte fluide sur de l'audio non verbal. De plus, une confiance de 0,9 chez un modèle ne vaut pas 0,9 chez un autre : les échelles ne sont pas calibrées entre les fournisseurs.

Comment mesurer mon vrai WER ?

Prenez un échantillon de 5 minutes de votre audio habituel, transcrivez-le manuellement, faites-le passer dans votre outil IA, puis comparez les deux avec la bibliothèque Python jiwer ou l'outil NIST sclite. Les deux calculent le WER à partir d'une transcription de référence et d'une hypothèse. Cinq minutes de votre propre audio vous donnent un chiffre bien plus utile que n'importe quel benchmark de fournisseur.

Testez la précision sur votre propre audio, pas sur un benchmark de fournisseur
Testez la précision sur votre propre audio, pas sur un benchmark de fournisseur

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles