Scores de confiance en transcription, expliqués et comment les utiliser
scores de confiancequalité de transcriptiontechnique

Scores de confiance en transcription, expliqués et comment les utiliser

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

Ce que le score signifie réellement

Un score de confiance est l'estimation du moteur, exprimée par un nombre entre 0 et 1, indiquant qu'un mot précis dans la transcription est correct. Un score de 0,95 signifie que le modèle pense avoir environ 95 % de chances d'avoir bien retranscrit ce mot. Un score de 0,42 signifie qu'il était bien moins certain.

Le score se situe au niveau du mot dans la plupart des API de production. Deepgram, par exemple, renvoie un champ confidence par mot sur chaque objet mot dans la réponse de l'API, défini dans leur documentation comme « un nombre flottant entre 0 et 1 représentant la probabilité estimée par le modèle que le mot ait été transcrit correctement ». En pratique, vous verrez des valeurs regroupées près de 1,0 sur un audio propre, car sur une parole claire, le modèle est réellement confiant pour la plupart des mots. Le signal se trouve dans les valeurs aberrantes.

La sortie de référence de Whisper fonctionne différemment. Elle n'expose pas de score de confiance par mot nativement. À la place, chaque segment porte avg_logprob (probabilité logarithmique moyenne sur le segment, où une valeur plus négative signifie moins de certitude) et no_speech_prob (l'estimation du modèle qu'aucune personne ne parlait pendant cette fenêtre). Il n'existe pas d'équivalent direct au score par mot de Deepgram sans post-traitement supplémentaire des probabilités de tokens. Les outils qui enveloppent Whisper peuvent dériver des estimations au niveau du mot à partir de passes d'alignement, mais celles-ci ne sont pas identiques à une sortie native par mot.

Pourquoi les chiffres sont plus difficiles à utiliser qu'ils n'en ont l'air

Une confiance élevée n'est pas une garantie

Une confiance de 0,99 signifie qu’environ un mot sur cent à ce score sera faux. Sur une transcription d’une heure à 8 000 mots, même 1 % d’erreurs à « très haute confiance » produit environ 80 fautes. Le risque plus grand, c’est que les modèles neuronaux modernes peuvent être systématiquement trop confiants, surtout dans des conditions bruyantes. Des recherches publiées en 2024 et 2025 ont montré que certains modèles ASR prédisent incorrectement 10 à 20 % des tokens avec une confiance supérieure à 0,70 à de faibles rapports signal sur bruit. Ce n’est pas un défaut propre à un produit donné ; cela reflète la façon dont les probabilités softmax se comportent dans les décodeurs neuronaux quand le modèle n’a pas été calibré.

La conséquence pratique : traitez la haute confiance comme un filtre, pas comme une preuve. Elle vous indique où passer votre temps de relecture en dernier, pas où les erreurs ne peuvent pas exister.

La faible confiance n’est pas un verdict d’erreur

L’inverse est tout aussi vrai. Un mot avec 0,45 de confiance peut être parfaitement correct. Une faible confiance signifie généralement que le modèle a envisagé plusieurs candidats plausibles et en a choisi un avec une marge minime. Les noms propres que le moteur a rarement vus, les nombres où le contexte soutient plusieurs valeurs, et les homophones qui ne se désambiguïsent qu’à la phrase suivante sont les mots à faible confiance les plus courants. La bonne réaction est de vérifier ces mots contre l’audio, pas de supposer qu’ils sont faux.

Les scores ne sont pas comparables entre moteurs

C’est la mise en garde la plus importante, et elle est facile à manquer. Un 0,85 de Deepgram et un 0,85 d’un autre moteur ne disent pas la même chose. La documentation de Deepgram le dit directement : « Les définitions et la calibration des scores de confiance varient entre les fournisseurs de STT. Vous ne pouvez pas comparer directement les distributions brutes de confiance entre fournisseurs. » Différents moteurs utilisent des échelles de probabilité différentes, des ajustements de calibration différents, et parfois des définitions différentes de ce que le score représente même. Si vous choisissez entre des moteurs sur la base de la confiance moyenne en sortie, vous comparez des nombres incompatibles.

Comparer sérieusement deux moteurs exige de les faire tourner sur le même audio, de vérifier manuellement les sorties et de mesurer le taux d'erreur réel. Voir explication de la précision de transcription pour savoir comment procéder correctement.

Niveau mot vs. niveau segment

La confiance au niveau mot attribue un nombre à chaque mot individuel. C'est le format le plus exploitable pour relire des transcriptions, car vous pouvez aller directement au mot précis qui posait problème.

La confiance au niveau segment attribue un seul nombre à une phrase ou un bloc de phrases. Le score au niveau transcription de Deepgram est la médiane des valeurs au niveau mot dans ce bloc. Le avg_logprob de Whisper est une probabilité logarithmique au niveau segment. Les deux sont utiles pour survoler une longue transcription et repérer les grandes sections, mais aucun ne vous dit quel mot, à l'intérieur d'un segment signalé, est le problème.

Pour un travail de relecture pratique, le niveau mot est le meilleur outil. Pour des décisions d'acheminement (envoyer ce segment à un relecteur humain), le niveau segment suffit souvent.

Calibration : ce que c'est et pourquoi c'est important

Un score de confiance calibré est un score dont le nombre reflète honnêtement la précision. Si vous collectez chaque mot que le moteur a noté à 0,90 et que vous les vérifiez tous, exactement 90% devraient être corrects. Voilà la calibration. Deepgram décrit sa confiance au niveau mot comme une « probabilité calibrée » avec cette propriété comme objectif.

La plupart des modèles neuronaux ne sont pas parfaitement calibrés dès la sortie de boîte. Ils tendent vers l'excès de confiance dans le haut de l'échelle : ils annoncent 0,95 alors que la précision réelle est plus proche de 0,88. La mise à l'échelle par température et d'autres techniques post-hoc peuvent améliorer cela, mais peu de produits publient s'ils les appliquent et comment.

La réponse pratique : ne partez pas du principe que le score de confiance est une probabilité parfaitement honnête. Utilisez-le comme un signal relatif, pas absolu. Vérifiez sur vos propres données en examinant un échantillon de mots à différents niveaux de confiance et en voyant quelle proportion est réellement correcte. La courbe de calibration qui en résulte vous indique ce que chaque niveau de confiance signifie réellement pour votre type d'audio spécifique. Un entretien avec un fort accent produira une courbe de calibration différente de celle d'un podcast enregistré en studio, même avec le même moteur.

Utiliser les scores de confiance en pratique

Organisez votre relecture en triant du plus bas au plus haut

Pour les transcriptions longues, triez ou filtrez les mots par confiance et examinez d'abord ceux avec la confiance la plus faible. La plupart des erreurs réelles dans une transcription de 90 minutes se concentrent dans quelques centaines de mots sous le seuil de 0,70. Relire ces mots précis par rapport à l'audio permet de rattraper la majorité des fautes en une fraction du temps qu'il faudrait pour tout lire de haut en bas.

La plupart des outils de transcription grand public affichent cela sous forme de surlignage coloré : les mots à faible confiance apparaissent dans une couleur différente et vous cliquez dessus pour les parcourir. Si vous travaillez avec la sortie brute d'une API, filtrez la liste de mots par le champ confidence et mettez en file les horodatages de ces mots dans votre lecteur audio.

Outil de téléchargement audio dans ConvertAudioToText où la transcription et la relecture commencent
Outil de téléchargement audio dans ConvertAudioToText où la transcription et la relecture commencent

Définissez un seuil pour le contrôle qualité automatisé

Pour les flux de travail à volume élevé ou sensibles à la conformité, définissez un seuil et signalez automatiquement les transcriptions ou les mots qui tombent en dessous pour une relecture humaine. Un point de départ courant est 0,80 ou 0,85, mais le bon chiffre dépend de ce que votre contrôle de calibration révèle pour votre type d'audio.

Le signal d'incertitude du modèle devient un contrôle qualité intégré. Cela fonctionne bien dans tout pipeline où la qualité de la transcription doit atteindre un seuil défini avant que le texte ne soit transmis aux systèmes en aval. Pour en savoir plus sur ce qui rend une transcription moins coûteuse à produire à qualité, les articles sur les tarifs expliquent ce que vous payez réellement lorsque la relecture sensible à la confiance est intégrée.

Pondérer les correspondances à faible confiance dans les systèmes en aval

Si vous construisez une recherche ou des analyses à partir de transcriptions, traitez le texte comme un signal bruité plutôt que comme une vérité absolue. Une correspondance de mot-clé sur un mot noté à 0,45 devrait peser moins lourd qu'une correspondance à 0,98. Un tableau de bord analytique qui compte les occurrences de termes devrait prendre en compte la pondération par confiance. Sinon, un seul nom propre confus se propage et fausse les données en aval.

Ce que la confiance ne détecte pas

Connaître les limites importe autant que connaître les cas d'usage.

La confiance ne détecte pas les mots erronés mais sémantiquement plausibles. "Affect" versus "effect", "principal" versus "principle", "your" versus "you're" sont souvent transcrits avec une confiance élevée, car le moteur s'est engagé sur une option avant que le contexte ne permette de les distinguer. Ce sont de vraies erreurs que le score ne signalera pas.

La confiance ne détecte pas les hallucinations pendant les silences. Si le modèle génère du texte fantôme pendant une pause silencieuse, la confiance sur ces mots fantômes peut être modérée, mais les mots sont entièrement inventés. C'est un mode de défaillance distinct, avec ses propres signaux de détection, sans rapport avec le champ de confiance par mot.

La confiance ne couvre pas la précision de l'attribution des locuteurs. Le score de confiance de transcription concerne les mots. Deepgram renvoie aussi un champ speaker_confidence sur l'audio pré-enregistré pour les résultats de diarisation, mais c'est un chiffre distinct, issu d'un modèle séparé. Les deux signaux sont indépendants. Un mot peut être transcrit correctement mais attribué au mauvais locuteur, et aucun des deux champs de confiance ne le signalera. Voir explication de la diarisation des locuteurs pour comprendre comment fonctionne la confiance des locuteurs.

La confiance ne détecte pas les mots manquants. Si le modèle n'a pas transcrit un mot du tout, il n'y a aucun score de confiance pour le signaler. Les mots absents sont les erreurs les plus difficiles à repérer après coup, et cela dépasse le cadre de ce que le score de confiance peut traiter.

La confiance selon les moteurs : Deepgram et Whisper côte à côte

SignalDeepgramWhisper (référence)
Confiance par motOui, champ confidence (0-1)Pas exposée nativement dans l'API
Signal au niveau du segmentConfiance de transcription = médiane des scores des motsavg_logprob (flottant négatif, plus négatif = moins certain)
Détection du silenceno_speech_prob absent de la sortie standardno_speech_prob par segment
Confiance des locuteursspeaker_confidence (pré-enregistré uniquement)Non disponible
Prêt pour les flux de travail basés sur des seuilsOui, aucun post-traitement nécessaireNécessite des outils d'alignement supplémentaires pour le niveau mot

Pour ceux qui veulent construire une relecture sensible à la confiance ou une pondération en aval, le format de Deepgram est plus immédiatement pratique. L'avg_logprob de Whisper est utile pour les décisions de routage (marquer un segment entier) mais demande des outils supplémentaires pour produire des valeurs par mot. Voir explication de Deepgram Nova-3 pour en savoir plus sur le fonctionnement interne du moteur de Deepgram.

Mon avis : la chose la plus utile que vous puissiez faire avec les scores de confiance, c'est de lancer une vérification de calibration sur un échantillon de votre propre audio avant de construire un quelconque flux automatisé autour de seuils. Ce qu'un 0,80 signifie sur votre matériel n'est pas ce qu'il signifie sur celui de quelqu'un d'autre, et la courbe se déplace à mesure que les conditions audio changent.

FAQ

Quel est un bon score de confiance pour la transcription ?

Il n'existe pas de seuil universel, car les échelles de confiance diffèrent selon les moteurs. Au sein d'un même moteur, les mots en dessous de 0,80 méritent un second regard. Les mots en dessous de 0,60 méritent presque toujours une relecture. Mais ces seuils sont des points de départ, pas des garanties : un mot à 0,99 peut encore être faux, et un mot à 0,55 peut être correct.

Les scores de confiance sont-ils comparables entre Deepgram, Whisper et d'autres moteurs ?

Non. La documentation de Deepgram indique explicitement que les définitions de confiance et la calibration varient selon les fournisseurs, et que les scores bruts ne peuvent pas être directement comparés. Un 0,85 de Deepgram et un 0,85 d'un autre moteur ne représentent pas la même affirmation sur la précision.

Pourquoi un mot à haute confiance s'avère-t-il parfois faux ?

Le modèle s'engage sur chaque mot, token par token, avant que le contexte complet ne soit disponible. Des mots acoustiquement similaires (« affect » vs « effect », « principal » vs « principle ») peuvent obtenir un score de confiance élevé parce que le modèle ne les a jamais considérés comme ambigus, même lorsque le mauvais a été choisi. La surconfiance sous bruit est également bien documentée dans la recherche en reconnaissance vocale.

Un score de confiance faible signifie-t-il que le mot est faux ?

Pas nécessairement. Une faible confiance indique que le modèle a envisagé plusieurs candidats plausibles et que celui retenu a gagné d'une marge étroite. Le gagnant peut tout à fait être correct. Les mots les plus souvent associés à une faible confiance sont les noms propres, les nombres et les homophones, lorsque le contexte environnant ne suffisait pas à verrouiller un vainqueur clair.

Si vous souhaitez expérimenter la transcription avec indicateurs de confiance sans créer de compte, l'outil audio-texte de ConvertAudioToText traite les fichiers immédiatement et renvoie une sortie structurée lorsque le moteur sous-jacent prend en charge les valeurs par mot.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles