
Corriger les noms mal transcrits dans vos transcriptions (guide 2026)
Summarize this article with:
Les modèles de transcription par IA remplacent les noms propres inconnus par des mots phonétiquement proches qu'ils connaissent déjà. La correction s'effectue en deux étapes : une passe de recherche-remplacement sur une transcription existante (en moins de cinq minutes) et la configuration d'un vocabulaire personnalisé qui empêche les mêmes erreurs de réapparaître dans les transcriptions futures. Choisir un outil avec une prise en charge native du vocabulaire personnalisé compte surtout si des noms propres figurent dans chacun de vos enregistrements.
Les noms, les marques et les toponymes se déforment dans les transcriptions par IA pour une seule raison : le modèle ne les a jamais vus et les remplace par le mot le plus proche qu'il connaît. Votre collègue Sam devient « Sahm ». Votre PDG Aoife devient « Eva ». Votre produit Convo devient « Convoy ». La correction s'opère en deux étapes : une passe de recherche-remplacement sur une transcription existante, puis la configuration d'un vocabulaire personnalisé qui empêche les mêmes erreurs de réapparaître.
Pourquoi les noms propres se déforment différemment des autres mots
Les modèles de transcription par IA apprennent la distribution des mots présents dans leurs données d'entraînement. Les mots courants et les prénoms fréquents sont bien représentés. Les prénoms rares, les prénoms non anglais, les noms de produits techniques et les noms de marque inventés sont sous-représentés ou totalement absents.
Lorsque le modèle entend un nom qui lui est inconnu, il choisit le son familier le plus proche. « Aoife » (un prénom irlandais prononcé EE-fa) devient « Eva ». « Sahm » devient « Sam ». « Convo » devient « Convoy ». C'est une propriété du fonctionnement des modèles de langage : la sortie est toujours un mot que le modèle a appris, jamais un token inédit.
Deux caractéristiques distinguent ces erreurs des erreurs de transcription ordinaires :
- La substitution est constante. Le modèle commet la même erreur chaque fois qu'il entend ce son, si bien qu'un long enregistrement produit la même orthographe erronée des dizaines de fois.
- L'erreur est de type hors-vocabulaire (OOV). Le modèle ne peut pas améliorer la substitution par le contexte seul, car il n'a aucune représentation du mot correct.
Ces deux propriétés déterminent la façon dont vous allez la corriger.
La solution rapide : le recherche-remplacement
Pour une transcription que vous avez déjà reçue, le recherche-remplacement règle le problème en moins de cinq minutes. Constituez une liste en lisant les quelques centaines de premiers mots :
Sahm → Sam
Eva → Aoife
Convoy → Convo
Appliquez chaque substitution. Quelques mises en garde pratiques :
- Utilisez une correspondance sensible à la casse pour les noms courts qui apparaissent à l'intérieur de mots courants. Remplacer « sam » sans tenir compte de la casse casserait « same », « sample » et « Samsung ».
- Vérifiez les variantes d'écriture avant de fermer le fichier. Le modèle peut avoir orthographié le même nom de deux façons différentes dans deux paragraphes différents (voir le cas du « rendu incohérent » ci-dessous).
Pour les sessions récurrentes avec les mêmes personnes, conservez un script de substitutions à appliquer à chaque nouvelle transcription :
substitutions = {
"Sahm": "Sam",
"Eva": "Aoife",
"Convoy": "Convo",
}
def fix_names(transcript: str) -> str:
for wrong, right in substitutions.items():
transcript = transcript.replace(wrong, right)
return transcript
Cela transforme une corvée répétée à chaque transcription en coût de configuration unique. Le script s'exécute en quelques secondes, quelle que soit la taille des fichiers.

Si vous avez simplement besoin d'une transcription propre sur laquelle lancer cette passe sans créer de compte au préalable, ConvertAudioToText commence la transcription immédiatement, sans connexion requise, et exporte en texte brut ou DOCX afin que vos substitutions puissent s'appliquer à une chaîne propre.
Quand le recherche-remplacement ne suffit pas
Trois cas précis font échouer l'approche par recherche-remplacement :
Les homophones en contexte. Un collègue prénommé Pat ne peut pas être distingué du mot courant « pat » sans casser toutes les autres occurrences de ce mot dans la transcription. Le vocabulaire personnalisé apprend au modèle à lire le contexte et à reconnaître « Pat » comme un prénom plutôt que comme une action.
Le rendu incohérent. Certains noms déroutent suffisamment les modèles pour que la sortie varie d'un paragraphe à l'autre. « Aoife » peut apparaître tantôt « Eva », tantôt « Effie », tantôt « Eve » dans un même enregistrement. Une seule règle de substitution en rate deux sur trois. Le vocabulaire personnalisé ancre le modèle sur une sortie cohérente.
Les jetons à casse mixte et alphanumériques. « Web3 », « iOS », « gRPC », « GPT-4o ». Le recherche-remplacement fonctionne, mais exige plusieurs règles car le modèle produit plusieurs variantes de capitalisation. Le vocabulaire personnalisé verrouille le format de sortie attendu dès l'inférence.
Pour aller plus loin sur les problèmes de précision, l'article la précision de transcription expliquée détaille comment le taux d'erreur par mot est calculé et où les erreurs se concentrent.
La solution durable : le vocabulaire personnalisé
Le vocabulaire personnalisé est préventif plutôt que réactif. Vous fournissez au modèle une liste de termes qu'il doit reconnaître, et ces termes sont correctement transcrits lors des exécutions suivantes. L'implémentation varie selon les plateformes :
| Outil | Nom de la fonctionnalité | Limite de termes | Où la configurer |
|---|---|---|---|
| Deepgram Nova-3 / Flux | Keyterm prompting | 100 termes, plafond de 500 tokens | Paramètre par requête |
| AssemblyAI (batch) | keyterms_prompt | Jusqu'à 1 000 termes (6 mots par expression) | Paramètre par requête |
| AssemblyAI word_boost | word_boost + boost_param | Variable ; intensité basse/défaut/haute | Paramètre par requête |
| Otter Pro | Vocabulaire personnalisé | 100 noms + 100 termes par utilisateur | Téléversement dans les paramètres |
| Google Cloud STT | Indices de phrases (Chirp 3) | Jusqu'à 5 000 par requête | SpeechContext dans la requête |
| AWS Transcribe | Vocabulaire personnalisé (format tableau) | Jusqu'à 50 Ko par fichier, 100 fichiers par compte | Ressource nommée précréée |
| Azure Speech | Modèles Custom Speech | Fine-tuning complet du modèle | Portail Azure, coût supplémentaire |
D'après la documentation de chaque fournisseur, vérifiée en juillet 2026.
Une remarque sur Whisper : l'API OpenAI Whisper accepte un paramètre initial_prompt qui oriente le modèle vers le vocabulaire attendu, mais l'invite est plafonnée à 224 tokens et la documentation de Whisper elle-même qualifie cette technique de « pas particulièrement fiable ». Si les noms propres posent problème de façon récurrente dans votre travail, une plateforme offrant une prise en charge native du vocabulaire personnalisé vous servira mieux que du prompt engineering sur Whisper.
Mon avis : pour la plupart des utilisateurs individuels, le keyterm prompting de Deepgram est le plus simple à utiliser parce qu'il ne nécessite aucune ressource précréée. Vous transmettez une liste de termes avec votre requête audio et le modèle les intègre immédiatement. Pour les équipes qui lancent des centaines de transcriptions sur le même vocabulaire métier, l'approche par fichier de vocabulaire personnalisé nommé d'AWS Transcribe centralise la liste et la rend réutilisable sur toutes les requêtes.
Ce qu'il faut mettre dans une bonne liste de vocabulaire
Les listes efficaces partagent quelques caractéristiques :
- 20 à 100 entrées, c'est la fourchette pratique. Trop peu, et vous laissez passer des noms propres récurrents ; trop nombreuses, et le modèle se met à imposer les termes listés dans des contextes où ils n'ont rien à faire.
- Des termes précis, pas génériques. « Convo » est une bonne entrée. « Entreprise » est une mauvaise entrée car le modèle la gère déjà très bien.
- Incluez l'inhabituel, écartez l'évident. Les prénoms d'invités qui sont des mots anglais courants (« Mark », « Kate ») ont rarement besoin d'aide du vocabulaire. Les prénoms non anglais, les noms de marque inventés et les sigles techniques, oui.
- Mettez à jour au fil de l'évolution de votre contenu. Un podcast qui aborde un nouveau domaine ou accueille des invités d'un nouveau secteur rencontrera de nouveaux termes hors-vocabulaire. Ajoutez-les avant l'enregistrement.
Appliquer tout cela à des workflows concrets
Émissions d'interviews en podcast
Ajoutez le nom complet de chaque invité ainsi que les personnes qu'il est susceptible de mentionner (collègues, références, cofondateurs). Pour les sujets techniques, ajoutez les noms de produits, les noms d'entreprises et le jargon propres à cet épisode. Passez votre liste de substitutions sur la transcription brute avant l'édition. L'article meilleure transcription pour podcasts couvre des considérations supplémentaires de précision pour l'audio enregistré.
Appels commerciaux et service client
Ajoutez vos noms de produits, les noms de vos clients, ceux des concurrents dont vous parlez, et les termes techniques propres à votre domaine. Ces listes restent généralement assez stables d'un trimestre à l'autre. Pour la transcription de réunions, les étiquettes de locuteurs combinées aux noms corrects réduisent considérablement le temps de post-traitement. Pour comment transcrire une réunion Zoom en particulier, la même liste de vocabulaire s'applique quelle que soit la plateforme sur laquelle vous enregistrez.
Entretiens de recherche
Ajoutez tous les noms des participants, leurs affiliations institutionnelles et la terminologie spécialisée de votre domaine de recherche. Pour un contenu destiné à être cité, les erreurs sur les noms et les noms propres ont des enjeux bien plus élevés que dans des notes informelles.
Contenu multilingue
Le vocabulaire personnalisé aide pour les noms qu'un modèle transcrirait sinon phonétiquement selon le système sonore d'une mauvaise langue. L'article corriger l'alternance codique multilingue approfondit ce schéma d'échec particulier.
Un workflow pratique de mise en place progressive
Le schéma que suivent la plupart des utilisateurs réguliers :
- Partez d'une liste de substitutions vide et d'une liste de vocabulaire vide.
- Pour les trois à cinq premières transcriptions, repérez les noms mal transcrits et ajoutez-les aux deux listes.
- Après cette passe initiale, la plupart des noms propres récurrents sont couverts.
- Ajoutez les nouveaux noms lorsque de nouvelles personnes, de nouveaux produits ou de nouveaux sujets entrent dans votre travail.
- Si vous avez accès à une API, transférez la liste dans la fonctionnalité de vocabulaire personnalisé de votre outil pour qu'elle s'applique dès l'inférence plutôt qu'en étape de post-traitement.
L'investissement de configuration est minime — moins d'une heure pour constituer une liste initiale utile — et le retour est permanent. Associez-y la correction du jargon technique si vos transcriptions contiennent aussi des sigles métier et des termes spécialisés.
FAQ
Pourquoi l'IA de transcription écrit-elle toujours le même nom de travers ?
Le modèle remplace le nom inconnu par le mot le plus proche de sa distribution d'entraînement chaque fois qu'il entend ce son. Ce n'est pas aléatoire : c'est une substitution constante, car le modèle a appris un mot phonétiquement similaire et pas l'autre. Le vocabulaire personnalisé brise cette habitude en indiquant au modèle quel mot attendre.
Le vocabulaire personnalisé fonctionne-t-il avec tous les moteurs de transcription ?
La plupart des outils professionnels et des API le prennent en charge sous une forme ou une autre, mais l'implémentation varie. Deepgram Nova-3 et Flux prennent en charge le keyterm prompting (jusqu'à 100 termes par requête, plafond de 500 tokens). AssemblyAI prend en charge keyterms_prompt pour le traitement par lots (jusqu'à 1 000 termes) et word_boost avec intensité réglable. Google Cloud Speech-to-Text accepte jusqu'à 5 000 indices de phrases par requête. AWS Transcribe utilise des fichiers de vocabulaire personnalisé nommés (format tableau, jusqu'à 50 Ko). Otter Pro offre 100 noms plus 100 autres termes par utilisateur. L'API OpenAI Whisper accepte un paramètre initial_prompt de 224 tokens maximum, mais sa propre documentation décrit cette technique comme n'étant pas particulièrement fiable pour les noms propres.
Quand le recherche-remplacement atteint-il ses limites et faut-il passer au vocabulaire personnalisé ?
Trois cas. D'abord, les homophones : si une personne prénommée Pat ne peut être distinguée du mot courant « pat » par sa position seule, un remplacement global abîmera le mot courant. Ensuite, le rendu incohérent : si le modèle produit « Eva », « Effie » et « Eve » pour le même prénom dans un même fichier, il vous faut plusieurs règles de substitution plutôt qu'une seule. Enfin, les jetons à casse mixte comme « gRPC » ou « GPT-4o » : le recherche-remplacement est fragile car le modèle produit plusieurs variantes de capitalisation et vous devez toutes les intercepter.
Combien de termes dois-je mettre dans une liste de vocabulaire personnalisé ?
La plupart des praticiens se stabilisent entre 20 et 100 entrées. Trop peu, et les noms propres récurrents passent au travers ; trop nombreuses, et le modèle peut se mettre à halluciner les termes listés dans des contextes où ils n'ont rien à faire. Incluez des termes précis et inhabituels, des noms que le modèle ne rencontre pas souvent dans ses données d'entraînement générales. Écartez les mots courants que le modèle gère déjà bien.
Sources
- Documentation Keyterm Prompting de Deepgram : https://developers.deepgram.com/docs/keyterm (vérifié en juillet 2026)
- AssemblyAI Streaming Keyterms Prompting : https://www.assemblyai.com/blog/streaming-keyterms-prompting (vérifié en juillet 2026)
- Page tarifaire d'Otter.ai, vocabulaire personnalisé par offre : https://otter.ai/pricing (vérifié en juillet 2026)
- Indices de phrases Google Cloud Speech-to-Text : https://cloud.google.com/speech-to-text/docs/speech-adaptation (vérifié en juillet 2026)
- Vocabulaires personnalisés AWS Transcribe : https://docs.aws.amazon.com/transcribe/latest/dg/custom-vocabulary.html (vérifié en juillet 2026)
- Vue d'ensemble d'Azure Custom Speech : https://learn.microsoft.com/en-us/azure/ai-services/speech-service/custom-speech-overview (vérifié en juillet 2026)
- Guide de prompting OpenAI Whisper : https://developers.openai.com/cookbook/examples/whisper_prompting_guide (vérifié en juillet 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.