
Corriger les erreurs de jargon dans la transcription : la passe glossaire
Summarize this article with:
Pourquoi le jargon pose problème
La réponse courte : le mot n'a jamais fait partie de la distribution d'entraînement du modèle. Les modèles de transcription par IA apprennent à partir de millions d'heures d'audio, mais ces données penchent fortement vers la conversation quotidienne. « Kubernetes » apparaît dans une infime fraction d'un pour cent des énoncés d'entraînement. « Électrocardiogramme » apparaît encore moins. Ainsi, lorsque le signal acoustique arrive, le modèle substitue des mots phonétiquement proches qu'il connaît. « Kubernetes » devient « cuban itties ». « PostgreSQL » devient « postgrass quill ». « gRPC » s'écrit « g-rpc », avec un tiret parasite.
Ces substitutions sont prévisibles, pas aléatoires. Le modèle fait exactement ce pour quoi il a été entraîné : choisir la séquence de mots de probabilité maximale compte tenu des sons. Le problème est que cette probabilité reflète l'anglais général, pas votre domaine. C'est l'écart de distribution d'entraînement, et il explique pourquoi la déformation est constante, pas dispersée. Chaque fois qu'un locuteur dit « Kubernetes » dans cet enregistrement, la transcription affiche « cuban itties ».
La bonne nouvelle : la solution est structurelle. Résolvez l'écart de distribution une fois, et le problème disparaît en grande partie pour toutes les transcriptions suivantes dans ce domaine.
Trois voies de correction, classées par coût de mise en place
Voie 1 : Rechercher-remplacer (rapide, par transcription)
Pour une seule transcription avec quelques termes déformés, le rechercher-remplacer prend moins de 10 minutes et fonctionne avec n'importe quel outil. Constituez une liste de substitutions en lisant le résultat :
cuban itties → Kubernetes
postgrass quill → PostgreSQL
g-rpc → gRPC
docker compose → Docker Compose
postgres equal → PostgreSQL
Exécutez le rechercher-remplacer pour chaque paire. Enregistrez la liste. Sur la prochaine transcription traitant du même sujet, appliquez la liste avant de commencer votre lecture. Vous obtenez l'essentiel de la valeur avec les 20 premières substitutions.
La limite est claire : c'est réactif et propre à chaque transcription. C'est le bon choix pour un enregistrement ponctuel. C'est la mauvaise architecture pour une équipe produisant 50 transcriptions par semaine.
Voie 2 : Vocabulaire personnalisé et prompting de termes clés (solution permanente)
Le vocabulaire personnalisé indique au moteur quels termes prioriser avant même d'entendre un seul mot. La plupart des API de qualité production le prennent désormais en charge nativement, et la configuration est un coût unique.
Les implémentations diffèrent selon la plateforme :
| Plateforme | Fonctionnalité | Paramètre API | Limite |
|---|---|---|---|
| Deepgram Nova-3 | Prompting de termes clés | keyterm=TERM (répétable) | 500 tokens par requête (~100 termes) |
| AssemblyAI (streaming) | Prompting de termes clés | keyterms_prompt | 100 termes, 50 caractères chacun |
| AWS Transcribe | Vocabulaire personnalisé | Fichier de vocabulaire S3 (format tableau) | 50 Ko par fichier, 100 fichiers par compte |
| Google Cloud STT (Chirp 3) | Adaptation vocale | Objet SpeechAdaptation avec phrases | Liste de phrases par requête |
| Azure Custom Speech | Entraînement Custom Speech | Téléversement d'un jeu de données d'entraînement | Fine-tuning complet du modèle, coût de configuration supérieur |
| OpenAI Whisper API | Paramètre prompt | Chaîne prompt | 224 tokens max |
Quelques détails vérifiés à connaître :
Le prompting de termes clés de Deepgram Nova-3 (vérifié en juillet 2026) : passez keyterm=TERM comme paramètre de requête, en le répétant pour chaque terme. Selon la documentation de Deepgram, les termes sont limités à 500 tokens au total par requête ; la recommandation pratique est de 20 à 50 termes à forte valeur. Le prompting de termes clés est spécifique aux modèles Nova-3 et à Flux ; l'ancien Nova-2 utilise un paramètre keywords distinct.
Le prompting de termes clés d'AssemblyAI est actuellement documenté pour la transcription en streaming, avec jusqu'à 100 termes de 50 caractères chacun. Le paramètre est keyterms_prompt dans la configuration du streaming. Pour la transcription par lot, le paramètre historique word_boost d'AssemblyAI avec des valeurs boost_param de low, default ou high reste applicable.
Le paramètre prompt de l'API OpenAI Whisper : le champ prompt accepte jusqu'à 224 tokens et fonctionne en faisant émuler au modèle les schémas d'orthographe de ce que vous incluez. Selon le cookbook d'OpenAI (vérifié en juillet 2026), les prompts sous forme de phrases naturelles surpassent les simples listes. Écrivez « L'ingénieur a parlé des clusters Kubernetes et de la réplication PostgreSQL » plutôt que « Kubernetes, PostgreSQL ». Le modèle copie vos orthographes. Il ne peut pas ajouter d'informations absentes de l'audio, mais il privilégiera fortement les orthographes que vous lui avez fournies.
Le vocabulaire personnalisé d'AWS Transcribe : utilise un format de tableau à quatre colonnes (Phrase, IPA, SoundsLike, DisplayAs) téléversé vers S3. Jusqu'à 100 fichiers de vocabulaire par compte, 50 Ko par fichier, 256 caractères par entrée. La variante médicale (Amazon Transcribe Medical) prend en charge un vocabulaire distinct pour les termes cliniques, en anglais américain uniquement.
Le flux de travail pour une solution permanente sur n'importe laquelle de ces plateformes :
- Constituez une liste de 30 à 100 termes récurrents dans votre domaine.
- Téléversez ou transmettez la liste à la fonctionnalité de vocabulaire de votre moteur.
- À partir de ce moment, chaque transcription dans ce domaine en profite.
- Révisez et étendez la liste chaque trimestre à mesure que votre vocabulaire évolue.

Pour les flux de travail basés sur une API, consultez la comparaison des meilleures API speech-to-text pour 2026 pour savoir quels moteurs gèrent le vocabulaire personnalisé avec le moins de friction.
Voie 3 : Entraînement de modèle spécifique au domaine (configuration lourde, meilleur plafond)
Pour une transcription à très haut volume dans un domaine unique, un modèle affiné surpasse les indices de vocabulaire sur les termes les plus difficiles. C'est ce que représente Deepgram Nova-3 Medical : un modèle pré-entraîné sur de l'audio clinique, et non un modèle de base accompagné d'une liste de vocabulaire. AWS Transcribe Medical suit une approche similaire. Azure Custom Speech vous permet de vous entraîner sur vos propres données audio annotées.
Le point d'inflexion coûts-bénéfices est approximatif : en dessous d'environ 50 000 minutes par mois d'audio spécifique au domaine, le vocabulaire personnalisé sur un modèle de base performant est plus pratique que l'entraînement d'un modèle. Au-delà, les compromis entre précision et maintenance commencent à favoriser un modèle affiné.
Pour la plupart des équipes lisant ces lignes, la voie 2 est la réponse.
Construire une bonne liste de vocabulaire
Une liste bien construite présente des caractéristiques communes quel que soit le domaine, indépendamment de l'outil de transcription.
Noms de produits et de technologies
Tous les produits mentionnés dans vos conversations, y compris les vôtres, ceux de vos concurrents et ceux de vos fournisseurs. « Kubernetes » et « K8s » peuvent nécessiter chacun une entrée séparée, car le modèle les rencontre phonétiquement différemment. « PostgreSQL » et « Postgres » méritent des entrées séparées pour la même raison.
Acronymes tels que vous voulez les voir écrits
Les acronymes techniques que le modèle développerait sinon ou déformerait. Écrivez-les exactement comme ils doivent apparaître dans la transcription : « gRPC » et non « g-r-p-c », « SaaS » et non « sass », « DDoS » et non « duh-dos », « LLM » et non « elm ». La colonne DisplayAs d'AWS Transcribe et le format de chaîne des termes clés de Deepgram permettent tous deux de spécifier précisément la forme de sortie.
Termes composés et expressions multi-mots
Les expressions que le modèle pourrait découper incorrectement. « Développement piloté par les tests » transmis comme terme clé produit cette expression exacte plutôt que trois mots déconnectés. « Infarctus du myocarde » traité comme une unité se transcrit plus fiablement que chaque mot pris individuellement.
Jargon spécialisé
Les termes que seuls les praticiens de votre domaine utilisent régulièrement. Pour la sécurité : motifs CVE spécifiques, frameworks d'exploitation, noms de protocoles. Pour la médecine : noms de médicaments selon leur désignation clinique (pas seulement les noms de marque), noms de procédures, termes anatomiques. Pour le droit : locutions latines, doctrines spécifiques, types de requêtes procédurales.
Noms qui ressemblent à des mots courants
Certains noms de personnes, d'entreprises ou de technologies entrent en collision phonétique avec des mots anglais courants. « Apache », le projet serveur, face au mot du quotidien. « Vue », le framework JavaScript. « Rust », le langage de programmation. « Swift », le langage. Le modèle a besoin d'un a priori fort pour éviter de les interpréter selon leur sens du dictionnaire.
Listes de référence par domaine
Ce sont des points de départ, pas des solutions complètes. Lisez votre première transcription et ajoutez tout ce que le modèle a mal transcrit.
Génie logiciel
Kubernetes, k8s, PostgreSQL, Postgres, gRPC, GraphQL, Docker,
TypeScript, async/await, monorepo, microservices, OAuth, JWT,
SQLite, MongoDB, Cassandra, Kafka, Redis, Elasticsearch,
LangChain, OpenAI, Anthropic, Claude, GPT-4o,
WebAssembly, WASM, RAG, vector database, embedding
Médecine
electrocardiogram, ECG, EKG, echocardiogram, defibrillator,
endotracheal intubation, laparoscopic, cholecystectomy,
metformin, lisinopril, atorvastatin, amoxicillin, ondansetron,
hypertension, hyperlipidemia, hypothyroidism, diabetes mellitus,
osteoarthritis, atrial fibrillation, myocardial infarction
Droit
voir dire, habeas corpus, prima facie, mens rea, res ipsa loquitur,
amicus curiae, certiorari, en banc, stare decisis, sub judice,
deposition, interrogatory, subpoena, discovery, motion in limine,
summary judgment, demurrer, appellate, statute of limitations
Finance
EBITDA, ARR, MRR, churn, LTV, CAC, IRR, NPV, IPO, SPAC,
revenue recognition, accrual basis, deferred revenue, GAAP, IFRS,
preferred stock, common stock, dilution, cap table, term sheet,
liquidation preference, anti-dilution, mezzanine
Pour les noms propres liés à une personne spécifique plutôt qu'à un domaine, l'article sur la correction des noms mal transcrits couvre le même mécanisme avec des exemples de noms de personnes.
Le choix de l'outil compte pour les travaux riches en jargon
Tous les outils de transcription n'exposent pas les contrôles de vocabulaire aux utilisateurs ordinaires. Les outils qui valent la peine d'être utilisés pour les domaines spécialisés :
Deepgram Nova-3 via API : le prompting de termes clés est bien documenté et prend effet immédiatement à chaque requête. Pas d'étape de téléversement, pas de délai d'attente.
AssemblyAI via API : word_boost pour le traitement par lot, keyterms_prompt pour le streaming. Ce sont tous deux des paramètres au niveau de la requête.
AWS Transcribe : les fichiers de vocabulaire personnalisé nécessitent un téléversement vers S3 et une étape de création avant d'être utilisables, mais ils persistent et peuvent être réutilisés entre les tâches.
AWS Transcribe Medical : un produit distinct avec un vocabulaire clinique préchargé et la prise en charge de l'anglais américain. La fonctionnalité de vocabulaire personnalisé médical vient compléter cette base.
Google Cloud STT (Chirp 3) : les phrases d'adaptation vocale sont transmises à chaque requête, à la manière de Deepgram. Chirp 3 est la génération actuelle depuis mi-2026.
API OpenAI Whisper via le paramètre prompt : moins puissant que les fonctionnalités de vocabulaire personnalisé dédiées, mais sans aucune configuration. Utile lorsque la liste de jargon est courte (moins de 30 termes) et que le prompt tient dans 224 tokens.
Les outils qui auront du mal quel que soit votre travail sur le vocabulaire : les outils basés sur navigateur utilisant l'API Web Speech, et tout service gratuit qui n'expose aucun paramètre de vocabulaire.
Mon avis : pour une équipe disposant d'un vocabulaire de domaine stable, le prompting de termes clés de Deepgram Nova-3 est la voie la plus fluide pour passer d'un texte déformé par le jargon à un texte propre. Le vocabulaire prend effet immédiatement, ne nécessite aucune étape de téléversement et ne coûte rien de plus que le tarif à la minute. Pour le médical spécifiquement, Nova-3 Medical est suffisamment spécialisé pour qu'il gère souvent la terminologie clinique sans aucun terme personnalisé.
Si vous avez simplement besoin d'une transcription propre sans gérer d'intégration API, l'outil audio-vers-texte de ConvertAudioToText prend en charge le téléversement de fichiers pour un résultat direct. Utilisez le résultat corrigé pour constituer votre liste de substitutions, puis passez aux contrôles de vocabulaire au niveau API une fois votre liste de termes stabilisée.
Quand l'IA perd encore face à un humain
Certains jargons restent véritablement hors de portée de la transcription par IA, même avec des contrôles de vocabulaire :
- Les noms de médicaments issus d'essais cliniques postérieurs à la date limite d'entraînement de tout modèle.
- Les sous-domaines étroits de l'ingénierie dont le vocabulaire n'est jamais apparu dans aucun corpus audio public (la chimie des procédés des semi-conducteurs, par exemple).
- La terminologie juridique archaïque qui n'apparaît que dans quelques enregistrements modernes.
Dans ces cas-là, un transcripteur humain expert du domaine est la réponse honnête. L'article IA contre transcription humaine explique quand cette escalade se justifie financièrement. Pour tout le reste en 2026, le vocabulaire personnalisé sur un modèle de base performant, complété d'une légère relecture manuelle, produit des résultats prêts à publier.
Questions fréquentes
Pourquoi le modèle transcrit-il correctement les mots courants mais échoue-t-il sur les termes spécialisés ?
Les estimations de probabilité du modèle proviennent de ses données d'entraînement. Les mots anglais courants apparaissent des millions de fois ; les termes spécialisés apparaissent rarement ou jamais. Lorsque le modèle entend « Kubernetes », le signal phonétique correspond plus fortement à « cuban itties » dans la distribution d'entraînement qu'au terme correct, donc la mauvaise sortie l'emporte. Les contrôles de vocabulaire neutralisent cet a priori en boostant explicitement les termes cibles.
L'API Whisper prend-elle en charge un vocabulaire personnalisé ?
Pas avec une fonctionnalité de vocabulaire dédiée. Le paramètre prompt (224 tokens maximum) accepte du texte d'exemple, et le modèle essaiera de reproduire les orthographes présentes dans votre prompt. Rédiger une phrase naturelle qui utilise vos termes techniques tels qu'ils doivent apparaître (« L'équipe a migré le cluster PostgreSQL vers Kubernetes ») est plus efficace que d'énumérer des termes isolés. Pour les problèmes de jargon sérieux, Deepgram ou AssemblyAI avec de véritables API de vocabulaire sont plus fiables.
Combien de termes dois-je mettre dans ma liste de vocabulaire ?
Commencez par les 20 à 30 termes qui ont causé le plus d'erreurs dans votre première transcription. Deepgram Nova-3 prend en charge jusqu'à 500 tokens (~100 termes) par requête. Le streaming d'AssemblyAI autorise jusqu'à 100 termes de 50 caractères chacun. Les fichiers d'AWS Transcribe peuvent en contenir davantage, mais les listes de vocabulaire volumineuses nuisent parfois à la précision sur les termes qui ne figurent pas réellement dans l'audio ; les listes ciblées et compactes surpassent donc souvent les listes fourre-tout.
Le vocabulaire personnalisé aide-t-il pour les acronymes ou seulement pour les mots entiers ?
Les deux. Les acronymes sont souvent les entrées les plus précieuses, car le modèle les développe fréquemment (« SaaS » en « sass », « gRPC » en « g rpc »). Passez l'acronyme dans le format de sortie exact souhaité : gRPC, DDoS, LLM. Sur les plateformes comme AWS Transcribe où vous spécifiez un champ DisplayAs, vous contrôlez précisément la casse et la ponctuation de la sortie.
Sources
- Documentation du prompting de termes clés de Deepgram (consultée en juillet 2026) : https://developers.deepgram.com/docs/keyterm
- Annonce de Deepgram Nova-3 Medical : https://deepgram.com/learn/introducing-nova-3-medical-speech-to-text-api
- Article de blog sur le prompting de termes clés en streaming d'AssemblyAI : https://www.assemblyai.com/blog/streaming-keyterms-prompting
- Documentation des vocabulaires personnalisés d'AWS Transcribe (consultée en juillet 2026) : https://docs.aws.amazon.com/transcribe/latest/dg/custom-vocabulary.html
- Vocabulaires personnalisés d'AWS Transcribe Medical : https://docs.aws.amazon.com/transcribe/latest/dg/vocabulary-med.html
- Adaptation vocale de Google Cloud Speech-to-Text : https://docs.cloud.google.com/speech-to-text/docs/adaptation-model
- Guide de prompting Whisper d'OpenAI : https://developers.openai.com/cookbook/examples/whisper_prompting_guide
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.