
Corriger les mots étrangers dans votre transcription (guide 2026)
Summarize this article with:
Lorsqu'un modèle de transcription est réglé sur l'anglais, il restitue les emprunts étrangers phonétiquement, comme des sons anglais. La correction dépend du caractère prévisible de ces mots : utilisez un outil basé sur Whisper pour une précision en une seule passe sur les emprunts courants, le keyterm prompting (Deepgram Nova-3) ou l'amorçage par prompt (OpenAI Whisper API, AssemblyAI Universal-3 Pro) pour les termes propres à un domaine, et une liste de recherche-remplacement pour les expressions récurrentes que votre outil écrit encore mal. Pour les contenus où plus de 10 % du discours est dans une autre langue, traitez-les comme de l'alternance codique plutôt que comme des emprunts étrangers.
Le problème tient en un diagnostic d'une seule phrase : votre outil de transcription a été réglé pour écouter l'anglais, si bien qu'il a rendu « schadenfreude » par « shadow in frood » et « croissant » par « crossant ». La correction dont vous avez besoin dépend du caractère prévisible ou non de ces mots étrangers.
Pourquoi les outils en mode anglais déforment les mots étrangers
Lorsqu'un modèle de transcription est configuré pour une seule langue, il associe chaque son entrant au candidat le plus proche dans l'inventaire phonémique de cette langue. Les mots étrangers tombent hors de cet inventaire. Le modèle choisit la chaîne anglaise qui sonne le plus proche et passe à la suite.
C'est différent de l'alternance codique complète, où les locuteurs alternent entre les langues sur des phrases entières. Les mots étrangers dans une transcription par ailleurs en anglais sont des emprunts isolés : une expression française, un nom composé allemand, un terme culinaire japonais. Le modèle est réglé sur l'anglais et restitue les phonèmes étrangers en graphie anglaise.
La bonne nouvelle, c'est que Whisper Large-v3, entraîné sur environ 680 000 heures d'audio multilingue couvrant 99 langues, reconnaît les emprunts courants dès la première passe sans aucune configuration supplémentaire. « Bonjour », « schadenfreude », « croissant », « anime » et « karaoké » sortent généralement corrects. Les échecs se concentrent sur les termes moins courants, les noms propres et les noms de lieux régionaux.
Correction 1 : choisir un outil entraîné en multilingue
Le changement au meilleur rapport effort/résultat est de passer à un outil construit sur Whisper Large-v3. Comme le modèle a vu des mots étrangers dans ses données d'entraînement multilingues, il connaît les orthographes correctes plutôt que des devinettes phonétiques.
- Les outils basés sur Whisper (dont l'outil audio-vers-texte de ConvertAudioToText, l'API OpenAI Whisper et Whisper auto-hébergé) : les emprunts étrangers courants dans un audio en anglais survivent généralement intacts. « Düsseldorf » arrive avec son tréma ; « je ne sais quoi » ressort en français plutôt qu'en anglais phonétique.
- Deepgram Nova-3 en mode anglais uniquement : applique une modélisation monolingue plus stricte, donc les emprunts étrangers s'en sortent moins bien sans configuration supplémentaire (voir la correction 3 ci-dessous).
- Les outils Web Speech API du navigateur : une seule langue par session par conception. Les mots étrangers sont sévèrement déformés et aucun contournement n'existe, hormis changer entièrement la langue de la session.
- L'ancien Google Cloud STT v1 : sensibilisation multilingue limitée ; remplacé par la v2 avec ses ensembles d'expressions.

L'outil de téléversement audio exécute un pipeline basé sur Whisper qui gère les emprunts étrangers courants dans les transcriptions en anglais sans configuration supplémentaire.
Correction 2 : recherche-remplacement pour les mots étrangers récurrents
Pour les mots étrangers qui reviennent régulièrement dans votre travail, une liste de substitution est la correction la plus fiable, quel que soit l'outil utilisé.
Constituez la liste après votre première transcription d'un nouveau sujet :
bone jure → bonjour
say la vee → c'est la vie
jaw da veever → joie de vivre
shadow in frood → schadenfreude
doosseldorf → Düsseldorf
moon ick → Munich
La liste prend de la valeur avec le temps. Après avoir transcrit une douzaine d'épisodes d'un podcast culinaire, vous avez couvert les termes gastronomiques français, les noms de préparations italiennes et les noms de plats japonais qui reviennent. Appliquez la liste en une étape de recherche-remplacement global à la fin de chaque transcription de cette série.
C'est l'outil adapté pour :
- Les podcasts qui référencent régulièrement des cuisines, lieux ou expressions étrangères précis
- Les réunions professionnelles qui citent des bureaux internationaux ou des partenaires par leur nom
- Les contenus académiques qui puisent dans le latin (médecine, droit), l'allemand (philosophie) ou l'italien (musique)
Correction 3 : keyterm prompting et listes de vocabulaire
Plusieurs API de transcription permettent de fournir les termes attendus avant le traitement de l'audio. C'est plus puissant que le post-traitement, car le modèle est amorcé pour produire des orthographes précises, et non des approximations phonétiques aléatoires.
Keyterm prompting de Deepgram Nova-3 (vérifié via la documentation Deepgram, consultée en juillet 2026) : jusqu'à 500 jetons par requête, soit environ 100 mots. La fonctionnalité fonctionne pour les modèles Nova-3 monolingues comme multilingues. Une liste de vocabulaire pour un podcast en anglais avec des invités internationaux pourrait ressembler à ceci :
bonjour, croissant, déjà vu, faux pas, je ne sais quoi,
schadenfreude, zeitgeist, wanderlust, kindergarten,
karaoke, ramen, sayonara, piñata, tortilla
Deepgram indique que le keyterm prompting peut améliorer le taux de rappel des mots-clés jusqu'à 90 % pour les termes listés.
Paramètre prompt de l'API OpenAI Whisper : fournissez les mots étrangers et noms propres attendus dans le champ facultatif prompt. Le modèle prend en compte les 224 derniers jetons de ce prompt, ce qui suffit pour 30 à 50 termes étrangers. Pour des listes plus longues, la documentation OpenAI recommande plutôt une passe de post-traitement GPT-4 sur la transcription terminée.
AssemblyAI Universal-3 Pro : par défaut, le modèle transcrit dans la langue dominante de l'audio. Si votre audio en anglais contient des phrases françaises, le modèle sans consigne peut les traduire en anglais. Fournissez l'instruction explicite : « Preserve the original language(s) and script as spoken, including code-switching and mixed-language phrases. » Selon la documentation d'ingénierie de prompts d'AssemblyAI, la précision compte. Plus l'instruction est explicite, moins le modèle interprète de lui-même.
Google Cloud STT v2 : les ensembles d'expressions (phrase sets) permettent de fournir une liste pondérée de mots attendus avec un score de boost. Un boost plus élevé augmente la probabilité de correspondre à l'expression listée ; la documentation note que des valeurs de boost très élevées peuvent augmenter les faux positifs, donc des valeurs modérées fonctionnent mieux pour les noms propres étrangers.
Correction 4 : correction manuelle avec une référence
Pour les mots étrangers imprévisibles (un invité qui mentionne des noms de lieux obscurs, des plats régionaux ou des expressions propres à un dialecte), la passe de correction manuelle est le choix pratique.
Le processus : écoutez le mot étranger dans son contexte, cherchez l'orthographe correcte dans Wikipédia, Google Traduction ou un dictionnaire propre à la langue, puis remplacez le texte déformé. Environ 30 secondes par mot pour les cas courants. Pour un audio chargé de références étrangères imprévisibles, c'est lent mais précis. Pour le terme occasionnel mal restitué dans une transcription majoritairement en anglais, c'est le bon choix.
Comment cela se décompose par famille de langues
Le schéma des défaillances est suffisamment prévisible pour que vous puissiez vous y préparer à l'avance.
Langues romanes (français, espagnol, italien, portugais)
La déformation est systématique sur le plan phonétique. « Bonjour » devient « bone jure », « gracias » devient « graceous », « pasta carbonara » devient « pasta carbon era ». Les sons existent en anglais ; le modèle choisit simplement le mauvais mot anglais. Le recherche-remplacement couvre bien ces cas, car les erreurs sont cohérentes d'un enregistrement à l'autre.
Allemand
Les umlauts (ä, ö, ü) sont le principal point de défaillance. « Düsseldorf » perd son tréma ou devient « doosseldorf ». Les noms composés peuvent être scindés en mots séparés. Ajoutez les orthographes Unicode correctes à votre vocabulaire personnalisé ou à votre liste de recherche-remplacement.
Japonais
Les emprunts à haute fréquence en anglais (sushi, ramen, anime, manga, karaoké, sayonara) apparaissent abondamment dans les données d'entraînement de Whisper et sortent généralement corrects. Les termes japonais moins courants, les noms de lieux régionaux précis et les noms de plats au-delà du répertoire familier se déforment davantage. Le vocabulaire personnalisé gère ce niveau.
Chinois
Les multiples systèmes de romanisation (pinyin et Wade-Giles) font qu'un même mot possède plusieurs orthographes correctes. « Beijing » et « Shanghai » fonctionnent parce qu'ils sont omniprésents. « Chongqing », « Xiao long bao » et les termes similaires se déforment davantage. Les orthographes pinyin sont plus sûres à utiliser dans les listes de vocabulaire que le Wade-Giles, car elles sont plus fréquentes dans les données d'entraînement modernes.
Hindi et langues d'Asie du Sud
Les emprunts courants (curry, masala, naan, samosa, biryani, dharma, karma) sont traités de façon fiable par les outils basés sur Whisper. Les termes techniques sanskrits et les particularités régionales nécessitent un vocabulaire personnalisé.
Arabe
Les emprunts à haute fréquence (falafel, houmous, baklava) passent très bien. Les noms de lieux romanisés de différentes manières (Al Jazeera contre Aljazeera) peuvent produire un résultat incohérent. Ajouter l'orthographe romanisée préférée à votre liste de vocabulaire fige le résultat.
Un flux de travail pratique pour les contenus majoritairement en anglais
Si votre contenu est principalement en anglais avec quelques références étrangères occasionnelles :
- Transcrivez avec un outil basé sur Whisper. Les emprunts courants sortent correctement dès la première passe.
- Parcourez la transcription à la recherche de chaînes déformées. Elles ont tendance à se concentrer autour de sources en langues étrangères précises.
- Effectuez un recherche-remplacement pour tout terme déformé récurrent.
- Ajoutez les orthographes correctes à votre liste de keyterms/de vocabulaire pour cet outil. La liste s'appliquera à toutes les transcriptions futures du même projet.
- Traitez manuellement les termes imprévisibles ponctuels à l'aide d'une référence.
Mon avis : la liste de vocabulaire est l'investissement au meilleur rendement ici. La première transcription demande le plus de nettoyage ; dès la cinquième, l'outil produit automatiquement les orthographes correctes des termes étrangers de votre domaine.
Pour les contenus où les mots étrangers sont denses ou imprévisibles, demandez-vous si l'audio est en réalité multilingue plutôt qu'en anglais avec emprunts. Si plus d'environ 10 % du discours est dans une autre langue, la correction de l'alternance codique applique des techniques différentes : détection de langue par segment, mode multilingue et étiquetage linguistique tenant compte de la diarisation.
Les outils qui aggravent le problème
Certains outils gèrent particulièrement mal les mots étrangers :
- Les implémentations de l'API Web Speech des navigateurs : une seule langue par session, strictement. Les mots étrangers sont gravement déformés, sans correction possible hormis changer la langue de la session.
- Les outils à détection de langue agressive : si l'outil détecte trop de mots étrangers, il peut basculer toute la transcription dans la langue étrangère, cassant les passages en anglais. C'est rare avec les pipelines basés sur Whisper, mais courant avec certaines implémentations STT cloud.
- Les outils de sous-titrage en temps réel optimisés pour la fluidité de l'anglais : les outils par lots gèrent mieux les emprunts étrangers que les outils de sous-titrage en direct, car ils traitent l'énoncé complet plutôt que des fragments.
Pour un travail en langues mixtes, la transcription par lots avec un pipeline basé sur Whisper est le bon point de départ. Associez cet article à la correction des noms mal transcrits lorsque les mots étrangers en question sont spécifiquement des noms propres.
Questions fréquentes
Pourquoi mon outil de transcription écrit-il les mots français phonétiquement au lieu de les écrire correctement ?
Lorsqu'un outil est configuré pour une seule langue (l'anglais), il associe chaque son au correspondant le plus proche dans le vocabulaire de cette langue. Les phonèmes français n'ont pas d'équivalent anglais direct, donc le modèle produit la chaîne anglaise qui sonne le plus proche. Passer à un modèle entraîné en multilingue comme Whisper Large-v3, ou utiliser le keyterm prompting sur Deepgram Nova-3, fournit au modèle l'orthographe qu'il doit produire.
Deepgram Nova-3 gère-t-il les mots étrangers dans un audio par ailleurs en anglais ?
En mode anglais standard, Deepgram Nova-3 ne reconnaît pas automatiquement les emprunts étrangers. La solution est la fonctionnalité de keyterm prompting de Nova-3 : vous fournissez jusqu'à 500 jetons (environ 100 mots) de termes attendus par requête, et le modèle renforce la reconnaissance de ces orthographes exactes. Pour l'alternance codique en temps réel entre l'anglais, l'espagnol, le français, l'allemand, l'hindi, le russe, le portugais, le japonais, l'italien et le néerlandais, utilisez plutôt le mode Nova-3 Multilingual.
Puis-je utiliser le paramètre prompt de l'API OpenAI Whisper pour des listes de mots étrangers ?
Oui. Le paramètre prompt accepte une liste des mots étrangers ou noms propres attendus dans l'audio, et le modèle tente de correspondre à ces orthographes. La limite pratique est de 224 jetons par requête, ce qui suffit pour 30 à 50 termes étrangers. Pour des vocabulaires plus vastes, la documentation Whisper recommande plutôt une passe de post-traitement avec GPT-4 sur la transcription.
À partir de quand un vocabulaire étranger occasionnel bascule-t-il dans le territoire de l'alternance codique ?
Un seuil utile : si plus de 10 % de l'audio est dans une langue autre que la langue principale, traitez le fichier comme multilingue plutôt que comme de l'anglais avec emprunts. Les corrections pour mots étrangers de cet article (recherche-remplacement, vocabulaire personnalisé, amorçage par prompt) fonctionnent bien pour les emprunts isolés et les expressions figées. Un contenu durablement multilingue nécessite une approche différente, traitée dans l'article sur la correction de l'alternance codique.
Sources
- Documentation du keyterm prompting de Deepgram Nova-3 (consultée en juillet 2026)
- Extension multilingue de Deepgram Nova-3 (consultée en juillet 2026)
- Guide speech-to-text de l'API OpenAI Whisper (consulté en juillet 2026)
- Ingénierie de prompts d'AssemblyAI Universal-3 Pro (consultée en juillet 2026)
- Documentation d'AssemblyAI sur l'alternance codique (consultée en juillet 2026)
- Ensembles d'expressions et adaptation de modèle Google Cloud STT (consultée en juillet 2026)
- Dépôt GitHub d'OpenAI Whisper, discussion multilingue (consulté en juillet 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.