Guide de transcription du thaï : écriture, tons et réalité de l'ASR (2026)
transcriptionthaïlangues

Guide de transcription du thaï : écriture, tons et réalité de l'ASR (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202615 min read

Summarize this article with:

TL;DR

La transcription du thaï fonctionne bien pour le thaï central (standard de Bangkok) sur les moteurs commerciaux modernes, mais la mécanique de l'écriture, l'ambiguïté tonale et la segmentation des mots sans espaces créent des défis que les outils génériques gèrent de manière inégale. Les moteurs spécialisés pour le thaï comme iApp Technology surpassent le Whisper de base sur les contenus dialectaux. Les variétés régionales (lanna, isan, thaï du Sud) sont sensiblement plus difficiles et la plupart des grandes plateformes occidentales reconnaissent une précision moindre pour elles. Ce guide couvre la mécanique de la langue, des benchmarks honnêtes des moteurs et des flux de travail pratiques pour les contenus en thaï en 2026.

La transcription du thaï fonctionne pour la plupart des audios en thaï central sur les moteurs commerciaux modernes. Le résultat obtenu avec un outil bien pris en charge est une véritable écriture thaïe avec les signes tonaux intacts. Pour y parvenir, il faut comprendre trois propriétés propres à la langue qu'aucune autre grande langue d'Asie du Sud-Est ne combine tout à fait de cette manière : une écriture sans espaces, un système à cinq tons encodé à la fois dans des signes explicites et la classe consonantique, et un système de registre où les particules de politesse changent le caractère de chaque énoncé.

L'écriture thaïe : ce que le moteur doit gérer

L'écriture thaïe (อักษรไทย) est un abugida s'écrivant de gauche à droite avec 44 consonnes, 15 symboles vocaliques de base, quatre signes tonaux et aucun espace entre les mots. Les symboles vocaliques se placent au-dessus, en dessous, avant, après ou autour de la base consonantique. Les signes tonaux se situent au-dessus de l'empilement consonantique. Cela diffère des alphabets latins sur des points qui comptent pour l'ASR :

Une phrase comme « je veux manger du riz » s'écrit « ผมอยากกินข้าว » sous forme d'une chaîne continue de caractères. Le moteur doit produire des caractères Unicode thaï dans le bon ordre, avec la bonne position des voyelles et les bons signes tonaux. Un outil qui romanise la sortie (« phom yak gin khao ») produit un texte phonétiquement évocateur mais inutilisable pour les lecteurs thaïs. La sortie en écriture native est l'exigence minimale pour tout flux de travail sérieux en thaï.

En thaï, les consonnes appartiennent à l'une des trois classes (haute, moyenne, basse), et la classe détermine le ton par défaut d'une syllabe avant l'application de tout signe tonal explicite. Les signes tonaux explicites (mai ek ่, mai tho ้, mai tri ๊, mai chattawa ๋) modifient davantage le ton selon la règle de cette classe. Ce système à couches signifie que le ton est en partie structurel et en partie explicite, ce qui diffère d'une langue tonale comme le mandarin où les signes tonaux sont toujours des diacritiques sur les voyelles.

Le système des cinq tons et l'ASR

Le thaï compte cinq tons : moyen, bas, descendant, haut, montant. Le ton d'une syllabe n'est pas un simple diacritique : il est déterminé par l'interaction de la classe consonantique, de la longueur de la voyelle, de la structure syllabique et de tout signe tonal explicite. Le mot « ข้าว » (khâo, riz) et « เข้า » (khâo, entrer) sonnent à l'identique ; le sens vient du contexte environnant et de la composition des caractères.

Pour l'ASR, cela crée un problème de discrimination. Le moteur entend un contour de hauteur et doit l'associer à la séquence de caractères porteuse du bon ton. Sur un audio propre en studio, les moteurs modernes gèrent bien cela pour le thaï central standard. Sur un audio bruité, des locuteurs qui se chevauchent ou une parole informelle où les tons sont réduits, les erreurs dans le choix des caractères porteurs de ton sont plus probables.

La bonne nouvelle : lorsque les moteurs commerciaux produisent l'écriture thaïe native, les signes tonaux apparaissent correctement pour les caractères qu'ils produisent. La question est de savoir si les caractères eux-mêmes sont corrects, pas si les signes sont bien attachés.

La segmentation des mots : le problème qui se cumule

L'absence d'espaces entre les mots est le défi structurel qui rend le thaï plus difficile à post-traiter que toute langue délimitée par des espaces. Un système ASR doit simultanément reconnaître les phonèmes, les associer aux caractères thaïs et décider où tombent les frontières entre les mots.

Les erreurs se cumulent dans deux directions. Si le moteur entend mal une syllabe, il peut sélectionner une séquence de caractères qui modifie l'endroit où se termine un mot valide. Si la segmentation est erronée, les outils en aval (vérification orthographique, extraction de mots-clés, indexation de recherche) opèrent sur des unités de token incorrectes.

L'écriture thaï standard utilise bel et bien des espaces, mais ils marquent les frontières de phrases, pas celles des mots. Au sein d'une phrase, les mots s'enchaînent. Les lecteurs s'appuient sur le contexte et leurs connaissances lexicales pour analyser correctement. Les moteurs reproduisent ce processus grâce à une combinaison de modélisation acoustique et de priors de modèles de langage entraînés sur de vastes corpus thaïs.

Pour la lecture et la publication, vous obtenez un résultat qui ressemble à du texte thaï normal : la convention sans espaces est celle que les lecteurs thaïs attendent. Pour les tâches NLP en aval (indexation de recherche, analyse de sentiment, chaînes de traitement linguistique), vous avez besoin de marqueurs explicites de frontières de mots, ce qui nécessite un outil séparé de segmentation des mots thaïs comme PyThaiNLP appliqué à la sortie de la transcription.

Registre et particules de politesse

Le thaï possède un système de registre formel exprimé en partie par des particules de politesse en fin de phrase. Les hommes utilisent ครับ (khráp) en fin de phrase ; les femmes utilisent ค่ะ (khâ, ton descendant) dans les affirmations et คะ (khá, ton haut) dans les questions. Omettre ces particules fait passer la parole à un registre familier, voire grossier selon le contexte. Les contenus thaïs formels et destinés au public les incluent presque toujours.

Pour la transcription, ces particules importent parce qu'elles apparaissent fréquemment, souvent plusieurs fois par minute dans la parole polie, et portent leurs propres distinctions tonales. ค่ะ et คะ ne diffèrent que par le ton et le contexte ; la mauvaise constitue une erreur de registre. Les moteurs entraînés sur des corpus thaïs formels les gèrent bien. Les moteurs dotés de données d'entraînement thaïes plus minces peuvent les confondre ou les omettre.

Le thaï technique et commercial contient également de grandes quantités d'emprunts anglais adaptés phonologiquement à la prononciation thaïe. « Schedule » devient une adaptation à la phonologie thaïe ; les noms de marques apparaissent en caractères thaïs ou restent en anglais selon le locuteur. Les moteurs modernes gèrent généralement raisonnablement bien l'alternance codique : les mots thaïs reviennent en écriture thaïe, les insertions anglaises reviennent en anglais. Vérifiez cela sur votre audio spécifique avant de vous engager dans un flux de travail.

Enregistrement prêt pour la transcription audio en thaï
Enregistrement prêt pour la transcription audio en thaï

La réalité des dialectes

Le thaï central (standard de Bangkok, utilisé dans les médias, l'éducation et le gouvernement) est la variété sur laquelle la plupart des moteurs ont été entraînés et sur laquelle ils performent le mieux. Trois grandes variétés régionales sont sensiblement différentes :

Thaï du Nord (lanna / kham mueang) : Parfois classé comme une langue distincte. Il possède un inventaire tonal différent et un vocabulaire distinct. Les données d'entraînement pour l'ASR spécifique au lanna sont limitées. Une recherche publiée début 2026 (MDPI Applied Sciences) a développé un système de reconnaissance vocale du dialecte thaï du Nord précisément parce que les moteurs généralistes entraînés sur le thaï central y performent mal.

Thaï du Nord-Est (isan) : Étroitement apparenté au lao. Les résultats de benchmark de Typhoon ASR (un modèle spécialisé pour le thaï) montrent environ 10-11 % de taux d'erreur de caractères sur les contenus isan même avec un modèle dédié. Les moteurs commerciaux occidentaux généralistes sont probablement pires. La similitude isan-lao signifie également que la détection automatique de langue peut classer à tort des enregistrements isan comme du lao.

Thaï du Sud (pak tai) : Des contours tonals distincts de ceux du thaï central. La population de locuteurs plus réduite signifie moins de données d'entraînement dans la plupart des modèles.

Pour les contenus en dialectes régionaux, la référence honnête est : thaï central, bien. Variétés régionales, variable, et vous devriez tester avec un court échantillon avant de vous engager dans un flux de travail. Ce n'est pas un problème de rareté de données d'entraînement à l'échelle des langues africaines peu dotées en ressources (voir pourquoi l'IA peine avec les langues peu dotées en ressources pour cette comparaison), c'est un problème de divergence dialectale avec une majorité sous-représentée.

Comment les grands moteurs gèrent le thaï en 2026

Le tableau ci-dessous reflète des informations actuelles vérifiées issues de la documentation des fournisseurs et de benchmarks indépendants. Les pourcentages de précision par outil pour votre audio spécifique ne sont pas listés car aucun benchmark unique ne couvre toutes les variations (qualité audio, dialecte, domaine, nombre de locuteurs) qui déterminent la précision réelle.

OutilSortie en écriture thaïeModèle de prise en charge du thaïOffre gratuiteModèle tarifaire
Deepgram Nova-3OuiNova-3 (réduction de 69 % du WER vs Nova-2 selon Deepgram)Offre gratuite limitéePaiement à la minute, paliers de volume
AssemblyAI Universal-2OuiUniversal-2 (« bonne précision », tranche de 10-25 % de WER selon leur documentation)LimitéePaiement à la minute
iApp Technology (spécialisé thaï)OuiiApp ASR Pro (précision de mots de 91,23 % sur Common Voice 17)60 crédits gratuitsBasé sur des crédits : 1-2 IC/minute
NottaOuiNon divulgué (modèle 58 langues)120 min/mois, enregistrement max 3 min13,99 $/mois Pro ; 0 $ gratuit
Otter.aiNonNon pris en charge600 min/mois (anglais uniquement)8,33 $/mois Pro (annuel)
Whisper large-v3 de baseOui18-26 % de CER (Tier-3 selon des benchmarks indépendants)Auto-hébergé uniquementCoût de calcul

Quelques remarques sur ce que montre le tableau :

Otter ne prend pas en charge le thaï. Si un flux de travail dépend d'Otter, les contenus en thaï nécessitent un outil séparé.

iApp Technology est un fournisseur spécialisé dans le thaï avec un benchmark de précision publié sur un jeu de données standard. Sa tarification basée sur des crédits (1 IC/minute en base, 2 IC/minute en Pro ; environ 53-107 THB par heure aux tarifs de gros, plus 7 % de TVA) est le modèle pertinent pour un usage professionnel thaï à haut volume en Thaïlande. Les nouveaux comptes reçoivent 60 crédits gratuits.

L'extension de Nova-3 de Deepgram au thaï est leur amélioration la plus récente, revendiquant une réduction relative du WER de 69 % par rapport à Nova-2 en mode streaming. Le streaming est le benchmark le plus exigeant, donc l'amélioration est réelle même si le point de départ absolu était élevé.

Whisper large-v3 de base affiche indépendamment 18-26 % de CER pour le thaï, ce qui représente une dégradation significative par rapport à l'anglais. Les variantes Whisper thaï affinées (comme Typhoon Whisper large-v3) peuvent atteindre 4-6 % de CER sur des benchmarks standards avec une bonne curation des données, mais il vous faut un modèle affiné, pas le modèle de base.

Pour un aperçu plus large de la comparaison des moteurs sur les prix, voir la comparaison des tarifs des API speech-to-text.

Flux de travail pratiques pour les contenus en thaï

Définir explicitement la langue : Spécifiez toujours le thaï (th ou th-TH selon l'API). La détection automatique rend la confusion isan/lao plus probable et ajoute une étape de traitement avec son propre taux d'erreur.

Fournir le contexte des noms propres là où l'outil le permet : Les noms de personnes thaïs, les noms de quartiers de Bangkok, les noms d'entreprises thaïes et les noms de provinces sont transcrits en écriture thaïe par la plupart des moteurs. Si votre plateforme prend en charge un glossaire ou une invite de mots-clés, alimentez-le avec les noms qui apparaissent fréquemment. Les noms thaïs dans un contexte romanisé (p. ex. dans des e-mails que vous citez) peuvent nécessiter une passe de relecture.

Pour le thaï technique et scientifique : De nombreux termes sont des emprunts anglais que les locuteurs thaïs prononcent avec la phonologie thaïe. Le moteur peut les renvoyer en écriture thaïe phonologisée à la thaïe, en anglais, ou de manière incohérente. Une passe de relecture terminologique est une pratique standard.

Pour les entretiens avec plusieurs locuteurs thaïs : La précision de la diarisation des locuteurs pour un thaï formel à deux locuteurs est raisonnable sur les moteurs commerciaux. Une conversation informelle avec chevauchement de parole et des locuteurs isan ou thaï du Sud est plus difficile. Envisagez d'enregistrer avec des micros séparés si la qualité de la diarisation compte. Pour en savoir plus sur les flux de travail d'entretien, voir comment transcrire un enregistrement d'entretien.

Pour les sous-titres SRT : L'Unicode thaï s'affiche correctement sur YouTube, Vimeo et la plupart des plateformes vidéo modernes. Exportez le SRT depuis votre outil de transcription et téléversez-le directement. Le générateur de sous-titres gère l'écriture thaïe dans le fichier de sortie. Le placement des sauts de ligne est automatique et suit la structure des phrases thaïes.

Pour les notes de podcast : La sortie de résumé IA en thaï varie considérablement selon l'outil. Les outils qui exécutent leur résumé sur une transcription thaïe peuvent renvoyer des marqueurs de chapitres et des citations en thaï si leur modèle de résumé prend en charge le thaï. Cela vaut la peine d'être testé spécifiquement parce que certains outils qui transcrivent le thaï résument uniquement en anglais. Pour les flux de travail spécifiques aux podcasts, voir la meilleure transcription pour les podcasts.

Mon avis : pour la plupart des travaux de production de contenu en thaï, le choix se fait entre un fournisseur spécialisé dans le thaï (iApp pour le thaï professionnel à haut volume en Thaïlande, tarification par crédits, benchmarks connus) et une API commerciale multilingue (Deepgram Nova-3 ou AssemblyAI Universal-2, meilleure pour les flux de travail multilingues ou lorsque vous avez aussi besoin de l'anglais et d'autres langues dans le même pipeline). Whisper de base seul n'est pas le bon outil pour la transcription professionnelle du thaï vu les benchmarks de 18-26 % de CER.

Si vous avez besoin d'une transcription thaï propre sans intégration d'API ni configuration de bot de réunion, ConvertAudioToText traite directement les fichiers audio thaïs avec une sortie en écriture native.

FAQ

Otter.ai prend-il en charge la transcription du thaï ?

Non. Otter transcrit uniquement en anglais, espagnol, français, allemand, japonais et chinois. Le thaï n'est pas une langue prise en charge sur aucun forfait Otter à mi-2026.

Pourquoi la sortie ASR du thaï omet-elle parfois les frontières entre les mots ?

Le thaï s'écrit sans espaces entre les mots. Les moteurs ASR doivent appliquer une étape de segmentation des mots par-dessus la reconnaissance vocale. Les erreurs se cumulent : une syllabe mal entendue déplace l'endroit où le tokenizer place les frontières, et des frontières erronées changent le sens des mots. Les moteurs bien entraînés gèrent bien le thaï standard ; les moins entraînés produisent des chaînes continues qui exigent un nettoyage manuel.

Les moteurs d'IA préservent-ils les signes tonaux du thaï dans la sortie de transcription ?

Les moteurs commerciaux qui produisent l'écriture thaïe native préservent généralement les signes tonaux car ils génèrent directement des caractères Unicode thaï plutôt que des représentations phonétiques. Le risque survient lorsqu'un outil produit une translittération romanisée au lieu de l'écriture thaïe : cette représentation perd entièrement l'information tonale et n'est pas utile aux lecteurs thaïs.

Quelle est la précision de la transcription du thaï pour les dialectes régionaux comme le thaï du Nord ou l'isan ?

Nettement moins précise que pour le thaï central. Les benchmarks de recherche montrent que l'ASR isan affiche environ 10-11 % de taux d'erreur de caractères même sur des modèles spécialisés, et le thaï du Nord (lanna) dispose d'un pool limité de données d'entraînement, ce qui signifie que la plupart des moteurs ont été entraînés principalement sur le thaï central. Attendez-vous à une précision inférieure de 5 à 15 points de pourcentage sur les variétés régionales par rapport à la parole standard de Bangkok.

Quelles langues les moteurs de transcription IA confondent-ils couramment avec le thaï ?

Le lao est la confusion la plus fréquente. Le thaï et le lao partagent d'importantes similitudes d'écriture et un chevauchement phonologique. La détection automatique peut étiqueter à tort le thaï du Nord-Est (isan), étroitement apparenté au lao, comme de l'audio lao. Définissez toujours explicitement la langue sur le thaï plutôt que d'utiliser la détection automatique pour les contenus en thaï.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles