Corriger la transcription des nombres : un guide systématique (2026)
nombrestranscriptionformatagecorrection

Corriger la transcription des nombres : un guide systématique (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202611 min read

Summarize this article with:

TL;DR

Les erreurs de nombres dans la transcription par IA relèvent d'un petit ensemble de schémas récurrents : formes orales confondues (« quinze » contre « cinquante »), incohérences de format (chiffres contre mots) et attribution d'unité erronée. La correction procède par couches : activez d'abord le formatage intelligent dans votre outil, puis appliquez le rechercher-remplacer pour les erreurs propres à votre domaine, puis effectuez une passe manuelle ciblée uniquement pour les nombres à réel enjeu. Le post-traitement par LLM prend en charge les incohérences de format restantes que le formatage intelligent laisse passer.

Les erreurs de nombres dans la transcription sont corrigeables, mais la correction dépend de laquelle des trois causes racines est en jeu. Le modèle a entendu le mauvais nombre (une erreur d'écoute). Le modèle a bien entendu mais l'a mal restitué (une erreur de formatage). Ou bien le formatage est incohérent sur l'ensemble de la transcription (une erreur de style). Chacune appelle une solution différente, et les confondre fait perdre du temps.

Ce guide passe en revue chaque cause et sa correction, dans l'ordre de ce qu'il faut essayer en premier.

Pourquoi les nombres échouent différemment des autres mots

Les nombres sont la catégorie où la transcription par IA commet ses erreurs les plus coûteuses. Ces erreurs sont spécifiques et répétables.

« Quinze » contre « cinquante » est l'erreur d'écoute de nombre la plus courante. Le même schéma se répète pour toute la série : treize/trente, quatorze/quarante, seize/soixante, dix-sept/soixante-dix. En débit rapide ou avec n'importe quel accent, ces paires partagent suffisamment de caractéristiques acoustiques pour que le modèle tranche entre elles d'après le contexte, et pas seulement d'après le son. Si la phrase environnante ne favorise pas nettement l'un des deux nombres, le modèle devine, et il devine parfois faux.

Les séquences de nombres créent un deuxième mode de défaillance. « Deux cinq sept neuf » dicté comme numéro de référence devient « 2 579 » comme quantité. « Cent cinquante-deux » peut devenir « 152 » ou « cent, 52 ». Le modèle essaie de regrouper les chiffres en un nombre qui a du sens, et il ne sait pas toujours si vous voulez un fragment de numéro de téléphone, une quantité ou un identifiant.

L'attribution d'unité échoue d'une troisième manière spécifique. « Cinq dollars cinquante » peut devenir « 5,50 $ », « cinq cinquante » ou « 5 dollars, 50 cents » selon l'outil et selon que le formatage intelligent est activé ou non. Le nombre garde les bons chiffres mais le format est mauvais, ou la virgule se décale.

L'analyse des dates et des décimales forme le dernier grand groupe. « Quinze mai vingt vingt-six » peut devenir « 15 mai 2026 », « 15/05/26 » ou « le 15 mai » selon le format par défaut du modèle. « Zéro virgule cinq » peut devenir « ,5 », « 0,5 » ou « cinq dixièmes ».

Correction 1 : activer le formatage intelligent

La plupart des erreurs de restitution des nombres disparaissent dès que vous activez le formatage intelligent. C'est la première correction à essayer et, pour beaucoup d'utilisateurs, elle règle 80 % du problème.

Voici ce que fournit réellement chaque grand outil, d'après la documentation actuelle des éditeurs (vérifiée en juillet 2026) :

OutilParamètrePar défautCe qu'il gère
Deepgramsmart_format=trueDésactivéNombres, devises, dates, heures, numéros de téléphone, e-mails (anglais ; certaines autres langues)
AWS TranscribeAutomatique (aucun paramètre nécessaire)Activé pour les langues prises en chargeNombres, devises, dates, heures, adresses
AssemblyAIformat_text=trueActivéFormatage du texte, y compris la restitution des nombres
OpenAI Whisper APIAucun paramètre dédiéMixteAucun formateur de nombres intégré ; utilisez un prompt ou un post-traitement

smart_format=true de Deepgram est le plus explicite : passer ce paramètre dans une requête batch ou streaming convertit les nombres dictés en leur forme chiffrée pour l'anglais, y compris les symboles monétaires, les heures AM/PM et les dates ordinales. AWS Transcribe l'applique automatiquement pour les langues prises en charge, sans aucune configuration. format_text d'AssemblyAI est activé par défaut : si vous recevez une sortie brute d'AssemblyAI, vérifiez qu'il n'a pas été désactivé.

OpenAI Whisper fait exception. Il n'existe pas de paramètre smart_format. Sa sortie mélange par défaut chiffres et mots écrits en toutes lettres selon le contexte, et la documentation recommande d'utiliser le paramètre prompt pour orienter le style, ou un post-traitement pour corriger la cohérence. Si vous avez besoin d'une restitution cohérente des nombres avec Whisper, gérez cela séparément.

Outil de téléversement audio affichant la sortie du formatage intelligent pour les nombres
Outil de téléversement audio affichant la sortie du formatage intelligent pour les nombres

Une nuance à connaître : le formatage intelligent résout la restitution, pas les erreurs d'écoute. Si le modèle a entendu « quinze » alors que l'orateur a dit « cinquante », smart_format=true restituera proprement le mauvais nombre sous la forme « 15 ». L'erreur d'écoute, elle, demeure.

Correction 2 : rechercher-remplacer pour les erreurs propres à un domaine

Si vous transcrivez régulièrement du contenu issu du même domaine, vous verrez les mêmes erreurs de nombres se répéter. Un podcast financier dont l'animateur dit toujours « cinquante points de base » produira la même erreur « quinze points de base » d'un épisode à l'autre. Constituez une liste de substitutions.

Schémas courants qui méritent une liste :

fifteen basis points → 50 basis points  [verify against audio first]
thirteen percent → 13%
two zero two five → 2025
seventy-five thousand → 75,000

La limite est réelle : le rechercher-remplacer ne distingue pas le contexte. « Vingt » est la bonne restitution pour « vingt personnes », et « 20 » est souvent correct pour « 20 dollars » dans un contexte financier. Une substitution aveugle de toutes les occurrences de « vingt » par « 20 » cassera des occurrences valides. Réservez cette correction aux erreurs suffisamment liées à un terme de domaine pour que les faux positifs soient peu probables.

Correction 3 : post-traitement LLM pour la cohérence du format

Pour une incohérence de format sur une longue transcription (des dates sous trois formats différents, des nombres tantôt en toutes lettres tantôt en chiffres sans logique constante), une passe de post-traitement LLM remet de l'ordre sans vous obliger à vérifier l'audio.

Un prompt qui fonctionne :

Read this transcript and fix number formatting for consistency.
Convert quantities to digits ($50, 25%, 1,500, 8:30 AM).
Write out numbers that start a sentence.
Fix obvious impossible numbers if context makes the correction clear.
Do not change any number you are uncertain about.

Transcript:
[paste here]

GPT-4o et Claude gèrent cela de manière fiable pour les tâches de formatage. La limite importante : le LLM ne voit que le texte. Si la transcription contient une erreur d'écoute, le LLM corrigera le formatage autour du mauvais nombre sans corriger l'erreur elle-même. Utilisez-le pour le style, pas pour la vérification des faits.

Correction 4 : vérification manuelle ciblée pour le contenu à fort enjeu

Pour les contenus où un nombre erroné a de vraies conséquences, une passe d'écoute et de vérification ciblée est la seule correction fiable.

Le processus :

  1. Lancez la transcription avec le formatage intelligent activé.
  2. Recherchez tous les nombres dans la transcription : scannez chiffres, symboles monétaires, pourcentages et dates.
  3. Pour chaque nombre qui compte, sautez au timestamp correspondant dans l'audio et vérifiez.
  4. Corrigez ceux qui sont faux.

Pour une réunion de 30 minutes comptant 10 à 15 mentions numériques, cela prend 5 à 10 minutes. C'est la seule approche qui détecte les erreurs d'écoute que le formatage intelligent ne peut pas corriger.

Pour les contenus aux enjeux les plus élevés — contrats juridiques, dosages médicaux, données financières publiées —, faire réaliser la même passe en toute indépendance par une seconde personne vaut le temps investi.

Catégories de nombres et leurs modes de défaillance spécifiques

Chaque catégorie échoue à sa façon. Savoir à laquelle vous avez affaire vous oriente vers la bonne correction.

Argent et devises

Erreurs courantes : mauvaise magnitude (15 contre 50), symbole monétaire manquant, virgule décalée (« cinq cinquante » interprété comme 5,50 au lieu de 550).

Correction : le formatage intelligent d'abord. Pour tout contenu financier dont les chiffres seront cités ou publiés, vérification manuelle.

Pourcentages

Erreurs courantes : mauvais ordre de grandeur (3 % contre 30 %, ce qui inverse le sens d'une tendance). Une hausse de 30 % restituée comme 3 % n'est pas une simple imprécision.

Correction : formatage intelligent. Scannez manuellement tout pourcentage décrivant un changement ou un taux, car ce sont eux qui présentent le plus grand risque de changer le sens.

Dates

Erreurs courantes : mauvaise année (2025 contre 2026), format incohérent au sein d'une même transcription (« 15 mai » dans un paragraphe, « 15/05 » dans un autre), ordinal contre cardinal (« le quinze mai » contre « le 15 mai »).

Correction : le formatage intelligent couvre la plupart des cas. Pour toute date dans un contexte juridique ou contractuel, vérifiez manuellement.

Numéros de téléphone et identifiants

Erreurs courantes : chiffres permutés, chiffres manquants, regroupement erroné (555-12-34 au lieu de 555-1234).

Correction : vérification manuelle obligatoire. Les numéros de téléphone et les identifiants sont trop spécifiques pour qu'une correction automatique mérite confiance. Ils ne sont pas non plus vérifiables par le contexte.

Quantités et mesures

Erreurs courantes : mauvaise magnitude (« 2 grammes » contre « 20 grammes »), mauvaise unité accolée au bon nombre (« 50 mètres » alors que l'orateur a dit « 50 millimètres »).

Correction : le formatage intelligent aide pour la restitution. Pour le contenu technique (médical, scientifique, ingénierie), traitez toutes les mesures comme des données financières à fort enjeu : écoutez et vérifiez.

Ratios et plages

Erreurs courantes : bornes de plage permutées, sens du ratio inversé (« deux contre un » au lieu de « un contre deux »).

Correction : confrontez chaque ratio et chaque plage à l'audio. Ces valeurs sont sémantiquement réversibles et le contexte ne lève pas toujours l'ambiguïté.

Heures

Erreurs courantes : format 12 heures contre 24 heures, AM/PM manquant, « heures » omis.

Correction : le formatage intelligent couvre la plupart. Pour les transcriptions de réunions où les heures exactes correspondent à des points de l'ordre du jour, vérifiez celles qui comptent.

Un flux de travail pour le contenu riche en nombres

Pour quiconque transcrit régulièrement des rapports financiers, des exposés techniques, des appels de résultats ou des enregistrements cliniques :

  1. Utilisez un outil dont le formatage intelligent est activé par défaut, ou qui propose un paramètre explicite pour l'activer.
  2. Après la transcription, faites une passe consacrée aux nombres : recherchez les chiffres et vérifiez ceux qui portent du sens.
  3. Tenez à jour une liste de substitutions propre à votre domaine pour les erreurs qui reviennent dans vos contenus.
  4. Pour le contenu publié ou juridique, prévoyez une étape de vérification par une seconde personne pour tout chiffre destiné à être cité.

Cela attrape ce que l'automatisation pure laisse passer, sans vous contraindre à revérifier chaque mot.

Quand passer à la transcription humaine

Certains contenus renferment des nombres qui ne peuvent tout simplement pas être faux : dépôts réglementaires, données d'essais cliniques, dépositions judiciaires, contrats immobiliers.

Pour ceux-là, la combinaison pratique consiste en une transcription IA en première passe, une relecture manuelle minutieuse de tous les nombres par rapport à l'audio et, en option, une transcription humaine via un service spécialisé pour les passages les plus critiques. L'article IA contre transcription humaine détaille quand cette escalade se justifie économiquement.

Si vous rencontrez aussi des problèmes de précision plus généraux au-delà des nombres, l'article corriger une faible précision de transcription donne une vue d'ensemble. Les nombres constituent un sous-problème spécifique ; les corrections générales de précision sont un sujet à part.

Si vous avez simplement besoin d'une transcription propre en première passe, sans bot de réunion ni création de compte, ConvertAudioToText applique le formatage intelligent par défaut et fonctionne directement depuis un fichier téléversé ou une URL, ce qui est pratique pour des vérifications ponctuelles.

FAQ

Pourquoi ma transcription indique-t-elle « quinze » alors que l'orateur a dit « cinquante » ?

Ces deux mots partagent des caractéristiques acoustiques, surtout en débit rapide ou avec un accent : la syllabe accentuée ne tombe pas au même endroit, mais les deux commencent par une consonne suivie de la même voyelle nasale. Les modèles d'IA tranchent entre eux selon la probabilité acoustique et le contexte environnant. Si le contexte ne favorise pas nettement l'un des deux nombres, le modèle se trompera dans une certaine proportion des cas. Activer le formatage intelligent et effectuer une passe d'écoute-vérification ciblée sur tout nombre qui compte sont les solutions pratiques.

L'activation du formatage intelligent corrige-t-elle toutes les erreurs de nombres ?

Non. Le formatage intelligent gère la cohérence de restitution : il convertit « cinquante mille dollars » en « 50 000 $ » de façon fiable une fois que le modèle a entendu les bons mots. Il ne peut pas corriger une erreur d'écoute. Si le modèle a entendu « quinze » alors que l'orateur a dit « cinquante », le formatage intelligent restituera proprement le mauvais nombre. Une vérification manuelle reste nécessaire pour les chiffres à fort enjeu.

Quand faut-il utiliser un post-traitement LLM plutôt qu'une correction manuelle pour les nombres ?

Utilisez le post-tr

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles