Transcription vietnamienne : six tons, une précision réelle
transcriptionvietnamienlangues

Transcription vietnamienne : six tons, une précision réelle

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

La transcription du vietnamien est plus difficile que celle de la plupart des langues à écriture latine, car l'orthographe encode six tons distincts sous forme de diacritiques superposés, et un signe omis change entièrement le sens du mot. Le vietnamien du Nord (standard de Hanoï) bénéficie de la meilleure couverture par l'IA ; le vietnamien du Centre (Hué, Da Nang) est le dialecte le plus difficile pour les modèles actuels. Deepgram Nova-2 et Nova-3, OpenAI Whisper et AssemblyAI Universal annoncent tous la prise en charge du vietnamien, mais la précision sur les enregistrements non septentrionaux se situe dans une catégorie inférieure à celle du français ou de l'espagnol. Si vous avez besoin de transcriptions vietnamiennes propres et diacritées, choisissez un outil qui liste explicitement la prise en charge du vietnamien, définissez manuellement le code langue et prévoyez davantage de post-édition sur l'audio en dialecte central que sur les enregistrements au standard de Hanoï.

Obtenir une transcription vietnamienne propre, c'est obtenir les marques tonales. Omettez un seul diacritique et vous changez le mot : « ma » (fantôme), « má » (mère), « mà » (mais), « mả » (tombe), « mã » (cheval), « mạ » (plant de riz) sont six mots vietnamiens différents, distingués entièrement par la marque tonale portée par la même syllabe. Ce n'est pas un problème de mise en forme, c'est un problème de sens, et c'est pourquoi la transcription du vietnamien est plus difficile qu'elle n'y paraît au premier abord pour les systèmes d'IA.

La sortie vietnamienne comporte tous les diacritiques tonaux
La sortie vietnamienne comporte tous les diacritiques tonaux

Ce guide aborde l'orthographe, le fossé entre dialectes régionaux, les moteurs qui prennent réellement en charge le vietnamien en 2026 et ce qu'il faut attendre de chacun.

Le système à six tons et pourquoi les diacritiques sont porteurs de sens

Le vietnamien s'écrit en chữ Quốc Ngữ, une écriture latine finalisée au début du XXe siècle. Elle encode six tons phonémiques grâce à un système de diacritiques superposés : la syllabe sans marque porte le ton plat (ngang), et chacun des cinq autres tons reçoit un signe dédié.

Les six tons :

  • ngang (plat, sans marque) : « a » comme dans ma (fantôme)
  • sắc (montant haut) : « á » comme dans má (mère)
  • huyền (descendant bas) : « à » comme dans mà (mais)
  • hỏi (descendant puis montant) : « ả » comme dans mả (tombe)
  • ngã (descendant-montant avec rupture glottale) : « ã » comme dans mã (cheval)
  • nặng (descendant grave, point souscrit) : « ạ » comme dans mạ (plant de riz)

L'orthographe se densifie lorsque les diacritiques de qualité vocalique se superposent aux marques tonales. Le vietnamien compte sept voyelles modifiées : ă, â, ê, ô, ơ, ư et đ. Une voyelle comme « ă » peut porter n'importe lequel des six tons, produisant des formes telles que ắ, ằ, ẳ, ẵ, ặ. Unicode représente ces caractères sous forme précomposée selon la forme de normalisation C (NFC), ce qui importe pour la sortie de transcription : un outil qui renvoie des caractères combinants décomposés plutôt que des points de code précomposés peut produire un texte correct à l'écran mais qui casse dans les traitements de texte en aval.

Pour la transcription, le point essentiel est que les marques tonales ne sont pas une ponctuation facultative. Une transcription qui renvoie des lettres latines sans accents n'est pas un brouillon, c'est le mauvais texte.

Prise en charge par les moteurs : plus limitée que pour les langues de premier plan

Le vietnamien figure parmi les langues prises en charge par les principaux moteurs :

  • OpenAI Whisper (y compris le modèle large-v3) : liste le vietnamien (vi) dans son ensemble de langues prises en charge.
  • Deepgram Nova-2 et Nova-3 : tous deux listent vi avec prise en charge des points de terminaison par lot et en flux continu.
  • AssemblyAI Universal : inclut le vietnamien, avec la diarisation des locuteurs disponible.

Ce que « pris en charge » signifie varie. La documentation d'AssemblyAI classe le vietnamien dans la bande « Bonne précision », définie comme des taux d'erreur par mot (WER) supérieurs à 10 % et pouvant aller jusqu'à 25 %. À titre de comparaison, l'anglais se situe sous la barre des 10 % de WER. Le vietnamien est une langue moins dotée en ressources en termes de données d'entraînement, et l'attente honnête est que la précision sur le vietnamien soit nettement inférieure à celle obtenue sur le français, l'espagnol ou l'allemand, surtout pour l'audio non standard.

Otter.ai ne prend pas en charge le vietnamien. Ses langues prises en charge, en 2026, sont l'anglais, l'espagnol, le français, l'allemand, le japonais et le chinois (simplifié). Tout outil affichant la précision d'Otter pour le vietnamien invente des chiffres.

Pour un aperçu plus large de la façon dont la prise en charge par les moteurs varie selon les langues, consultez pourquoi l'IA peine avec les langues peu dotées en ressources.

Nord contre Sud contre Centre : le fossé des données d'entraînement

Le Vietnam compte trois grands groupes de dialectes régionaux, et la couverture par l'IA est inégale entre eux.

Vietnamien du Nord (standard de Hanoï)

C'est le dialecte qui domine les médias d'information, l'enseignement formel et les contenus gouvernementaux, et il représente la plus grande part des données d'entraînement pour la transcription du vietnamien. Les six tons sont acoustiquement bien distincts en vietnamien du Nord. La précision de l'IA est maximale sur l'audio au standard de Hanoï. Si vous transcrivez des contenus de diffusion formels de VTV ou du discours professionnel formel de locuteurs hanoïens, vous travaillez avec le dialecte pour lequel l'IA a été conçue.

Vietnamien du Sud (Hô Chi Minh-Ville, delta du Mékong)

La différence majeure du vietnamien méridional est la fusion hỏi/ngã. Dans le Sud, les deux tons se réalisent comme un simple ton descendant bas, sans l'interruption glottale qui distingue ngã dans le Nord. La langue écrite exige toujours les deux marques tonales à leurs positions respectives, mais la distinction acoustique qui aide une IA à les attribuer a disparu. La précision sur le vietnamien du Sud est généralement inférieure à celle du vietnamien du Nord, en particulier pour distinguer ả et ã. Les recherches sur les jeux de données ASR vietnamiens ont aussi documenté que le vietnamien méridional est sous-représenté dans les corpus d'entraînement par rapport au vietnamien septentrional, voire central, ce qui aggrave le problème.

Vietnamien du Centre (Hué, Da Nang, Quang Tri)

Le vietnamien du Centre est le dialecte le plus difficile pour les systèmes d'IA actuels. Il conserve des distinctions consonantiques que le vietnamien septentrional a fusionnées, notamment tr/ch, s/x et d/gi/r. Ses réalisations tonales diffèrent des formes standards du Nord comme du Sud, avec des chutes de hauteur spectaculaires et une qualité de voix soufflée absentes du dialecte que l'IA a principalement appris. Le dialecte de Hué conserve également du vocabulaire absent de la plupart des données d'entraînement : « mô » pour « đâu » (où), « răng » pour « sao » (pourquoi). Prévoyez davantage de post-édition sur l'audio en vietnamien central que sur toute autre variété régionale.

Diacritiques et encodage orthographique : ce qui peut mal tourner

Parce que les caractères vietnamiens impliquent une superposition, la représentation Unicode compte en pratique. Un caractère comme « ộ » (la voyelle ô avec le point souscrit de nặng) est un unique point de code précomposé (U+1ED9) sous normalisation NFC. Les moteurs qui renvoient la séquence décomposée (o + accent circonflexe combinant + point souscrit combinant) peuvent causer des problèmes dans les éditeurs, les bases de données et les pipelines d'exportation qui attendent du NFC. Lorsque vous évaluez un moteur, testez-le sur un passage vietnamien connu et inspectez la sortie brute pour vérifier la forme de normalisation, pas seulement le rendu à l'écran.

Un second problème pratique : certains outils plus anciens suppriment entièrement les diacritiques pour éviter les problèmes d'encodage et renvoient une sortie ASCII simple. Ce n'est pas une transcription, c'est un indice phonétique. Tout moteur utilisé pour du contenu vietnamien doit renvoyer une sortie diacritée par défaut.

Alternance codique : le vietnamien-anglais dans les affaires et la tech

L'alternance codique vietnamien-anglais est omniprésente dans le discours tech et commercial vietnamien. Des phrases comme « Tôi đang work on a project mới » sont monnaie courante dans les environnements de startup, et ce schéma est bien documenté dans les recherches sociolinguistiques sur la communication de bureau vietnamienne et les communautés de la diaspora. L'alternance se produit parce que le vocabulaire technique anglais (email, deadline, meeting, server) n'a pas d'équivalent vietnamien naturel ou est simplement plus rapide dans le contexte.

Pour la transcription, cela crée un problème bilingue : le moteur doit gérer les diacritiques vietnamiens pour les portions vietnamiennes et l'anglais standard pour les insertions, au sein d'un même énoncé. Les moteurs modernes qui prennent explicitement en charge le vietnamien gèrent généralement mieux cette situation que les outils dominés par l'anglais qui tentent de détecter automatiquement le vietnamien, car la détection de langue au niveau de l'énoncé se trompe fréquemment sur la parole mixte.

Pour des conseils sur le traitement de l'audio en langues mixtes, consultez corriger l'alternance codique multilingue dans les transcriptions.

Chez les Vietnamiens plus âgés scolarisés avant 1975, il existe aussi une alternance codique vietnamien-français, particulièrement au sein de la communauté de la diaspora en France et chez les résidents âgés des milieux professionnels de l'époque de Saigon. Le volume de ces contenus est moindre, et la prise en charge du mélange vietnamien-français par les moteurs est moins éprouvée.

Conseils pratiques pour une meilleure transcription du vietnamien

  1. Définissez explicitement le code langue sur vi. Sur les canaux à contenu mixte, la détection automatique retombe parfois sur le chinois ou d'autres langues d'Asie du Sud-Est, surtout sur les clips audio courts.
  2. Enregistrez sans bruit de fond. Les tons vietnamiens se réalisent sous forme de contours mélodiques couvrant toute la syllabe. Le bruit dégrade directement la détection de la hauteur, donc la récupération des tons. Cela compte davantage pour le vietnamien que pour les langues non tonales.
  3. Fournissez une liste de vocabulaire pour les noms propres et les lieux avant le téléversement, si votre outil prend en charge le vocabulaire personnalisé. Les noms de personnes et de lieux vietnamiens (Hà Nội, TP HCM, Đà Nẵng, Nguyễn Văn An) avec leurs diacritiques corrects donnent au moteur un ancrage pour les décisions de transcription localement ambiguës.
  4. Vérifiez immédiatement la sortie diacritique. Contrôlez le premier paragraphe de toute transcription vietnamienne pour détecter des marques tonales manquantes ou incorrectes avant de vous fier au reste.
  5. Attendez-vous à plus de corrections sur l'audio en vietnamien central. Prévoyez 3 à 5 passes d'édition supplémentaires sur les enregistrements de locuteurs de Hué ou de Da Nang par rapport aux contenus au standard de Hanoï.

Pour un guide plus large sur la précision de l'IA selon les langues et les dialectes, consultez la précision de transcription expliquée.

Comparer les outils de transcription vietnamienne

Le tableau ci-dessous repose sur des tarifs vérifiés auprès des sites des fournisseurs en juillet 2026. La précision est décrite qualitativement, et non sous forme de pourcentages inventés, car aucun fournisseur ne publie de benchmarks WER spécifiques au vietnamien pour ces produits.

OutilPrise en charge du vietnamienOffre gratuiteTarif de départ
Outils basés sur Whisper (ex. CATT)Oui, vi pris en charge10 min gratuites, une seule foisÀ partir de 9,99 $/mois (illimité)
Deepgram (API)Oui, Nova-2 et Nova-3Paiement à l'usageFacturation à l'usage, paliers de volume
AssemblyAI (API)Oui, avec diarisationPaiement à l'usageFacturé à l'usage
Happy ScribeOui, transcription IAEssai de 10 minutesÀ partir de 17 €/mois, 120 min
SonixOui, listé parmi 54 languesEssai de 30 minutes10 $/heure (paiement à l'usage) ou 22 $/siège/mois + 5 $/heure
Otter.aiNon, non pris en charge300 min/mois16,99 $/mois (anglais/espagnol/français uniquement)

Pour une analyse détaillée des coûts de transcription à la minute et par abonnement, consultez la comparaison des prix de transcription 2026. Si votre contenu vietnamien est destiné à un podcast ou à une série en cours, la meilleure transcription pour podcasts 2026 aborde les considérations de flux de travail.

Qui utilise réellement la transcription vietnamienne

Les créateurs de contenu de la diaspora vietnamienne aux États-Unis (en particulier la communauté de Little Saigon en Californie, la plus grande communauté vietnamienne hors d'Asie du Sud-Est) produisent des podcasts en vietnamien, des contenus d'interview et des enregistrements d'archives familiales. Pour le public de la diaspora, la fidélité des diacritiques compte à double titre : la sortie écrite doit être lisible en vietnamien standard, et omettre les marques tonales change le sens du texte, pas seulement son apparence.

Les rédactions vietnamiennes utilisent la transcription pour accélérer le traitement des interviews destinés aux supports imprimés et numériques. Les enseignants vietnamiens transcrivent des cours pour des supports pédagogiques publiés. Le dénominateur commun : tous ces cas d'usage exigent une sortie diacritée, pas des approximations ASCII.

Pour une vue d'ensemble du fonctionnement de la diarisation dans les contenus vietnamiens à plusieurs locuteurs, consultez la diarisation des locuteurs expliquée.

Si vous avez besoin d'une transcription vietnamienne propre et que vous n'avez pas besoin de fonctions de robot de réunion, ConvertAudioToText prend en charge le vietnamien avec une sortie correctement diacritée et une offre gratuite pour tester sur votre propre audio.

Questions fréquentes

La transcription par IA préserve-t-elle les marques tonales vietnamiennes ?

Cela dépend du moteur. Les moteurs entraînés sur du texte vietnamien correctement diacrité, comme Whisper et Deepgram Nova-2/3, renvoient les marques tonales dans leur sortie. Les moteurs qui ne prennent en charge qu'une courte liste de langues (Otter, par exemple, qui ne prend pas du tout en charge le vietnamien) ne sauront pas le gérer. Vérifiez toujours que l'outil liste le vietnamien parmi ses langues prises en charge avant de téléverser votre fichier.

Quel dialecte régional vietnamien est le plus difficile à transcrire pour l'IA ?

Le vietnamien du Centre, en particulier le dialecte de Hué, est le plus difficile. Ses réalisations tonales diffèrent du standard septentrional qui domine les données d'entraînement de l'IA, il conserve des distinctions consonantiques fusionnées dans le nord (tr/ch, s/x, d/gi/r), et il emploie du vocabulaire (mô, răng) absent de la plupart des corpus d'entraînement. Attendez-vous à nettement plus d'erreurs sur le vietnamien du Centre que sur des enregistrements au standard de Hanoï ou de Hô Chi Minh-Ville.

La fusion hỏi-ngã du vietnamien méridional provoque-t-elle des erreurs de transcription ?

Elle peut le faire. Dans le vietnamien du Sud, les tons hỏi (descendant-montant lisse) et ngã (descendant-montant avec rupture glottale) sont prononcés de façon quasi identique. Un moteur qui traite l'audio phonétiquement peut écrire la mauvaise marque tonale, car le signal acoustique ne les distingue plus. La forme écrite correcte utilise les deux tons ; un moteur bien entraîné devrait donc les appliquer selon le contexte lexical, mais c'est un point faible connu.

Comment l'alternance codique vietnamien-anglais affecte-t-elle la qualité de transcription ?

Les moteurs modernes la gèrent généralement raisonnablement bien : les mots vietnamiens reviennent diacrités en vietnamien, les insertions anglaises reviennent en anglais. Le problème est que l'alternance codique est extrêmement courante dans le discours tech et commercial vietnamien ; si le modèle vietnamien d'un moteur est faible, les énoncés alternés aggravent le taux d'erreur. Utilisez un moteur qui prend explicitement en charge le vietnamien, et non une simple détection multilingue dominée par l'anglais.

Quels formats de fichiers et quelle qualité audio comptent le plus pour la transcription du vietnamien ?

Pour une langue tonale, le format compte moins que la qualité audio. Les marques tonales vietnamiennes dépendent de contours mélodiques subtils, précisément des formes montantes, descendantes et glottalisées qui couvrent toute la syllabe. Le bruit de fond et la qualité du micro dégradent directement la récupération des tons. Enregistrez dans un environnement silencieux, utilisez si possible un micro dédié et exportez l'audio à 44,1 kHz ou plus. Les formats courants (MP3, M4A, WAV, FLAC) fonctionnent tous avec les principaux moteurs.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles