Meilleure transcription pour les langues asiatiques en 2026
langues-asiatiquestranscriptionmandarinjaponaiscoréen

Meilleure transcription pour les langues asiatiques en 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

Pour le mandarin et le cantonais, SenseVoice (le modèle ouvert d'Alibaba) bat Whisper sur le CER; pour le japonais et le coréen, Whisper Large-v3 et Naver CLOVA Speech mènent la danse; pour les langues indiennes, Azure Speech est l'option spécialisée la plus solide. Aucun moteur ne gagne sur toutes les langues asiatiques. Les outils basés sur Whisper offrent la meilleure couverture multilingue à faible coût, tandis que les fournisseurs spécialisés par langue excellent en profondeur pour leur cible.

Aucun moteur de transcription ne domine sur toutes les langues asiatiques. Le bon choix dépend de la langue dont vous avez besoin, du niveau de précision requis, et de si vous construisez un produit ou traitez des fichiers manuellement. Cet article associe chaque grande langue asiatique au moteur qui donne les meilleurs résultats, avec des chiffres CER/WER issus de benchmarks vérifiables.

Pourquoi la précision en langues asiatiques est un problème à part

Les benchmarks de précision pour les langues asiatiques utilisent des métriques différentes de celles de l'anglais. Pour le chinois, le japonais et le coréen, le CER (taux d'erreur sur les caractères) est la mesure appropriée, car ces écritures n'utilisent pas d'espaces entre les mots. Le WER (taux d'erreur sur les mots) exigerait de définir des « mots » d'une manière qui ne correspond pas proprement au fonctionnement de ces écritures.

Gardez cette distinction à l'esprit quand vous comparez les affirmations des fournisseurs. Un fournisseur qui annonce « 95 % de précision » pour le japonais sans préciser s'il s'agit de WER ou de CER utilise probablement une définition plus laxiste. L'article sur la précision de transcription expliquée approfondit ce sujet.

Mandarin et cantonais : SenseVoice en tête

Pour le mandarin, SenseVoice (le modèle open source de l'équipe FunAudioLLM d'Alibaba) atteint un CER de 10,78 % contre 12,55 % pour Whisper Large-v3 sur les benchmarks standard. En cantonais, l'écart se creuse : SenseVoice obtient 7,09 % de CER, tandis que Whisper Large-v3 atteint 10,41 %. Côté vitesse, SenseVoice tourne 52 à 118 fois plus vite que le temps réel sur Apple Silicon, contre 13 à 14 fois pour Whisper sur du matériel équivalent.

La distinction importante : SenseVoice est un modèle open source, pas un produit SaaS. L'API vocale commerciale d'Alibaba est disponible via Alibaba Cloud Model Studio (Fun-ASR 1.5, lancé en avril 2026) et constitue le bon choix pour les flux de production en mandarin au sein de l'écosystème chinois. La documentation est disponible en anglais sur alibabacloud.com.

iFlytek est une société distincte qui sert des domaines spécialisés du mandarin (médical, juridique, finance) depuis plus d'une décennie, avec des modèles de vocabulaire adaptés à chaque secteur. La tarification est opaque et exige un contact direct ; pour les développeurs non chinois, la friction liée à la documentation est bien réelle.

Pour les flux de travail en mandarin hors de Chine, OpenAI Whisper ou Google Cloud STT Chirp constituent des solutions de repli plus accessibles, avec des niveaux de précision similaires.

Japonais et coréen : Whisper tient la route, CLOVA excelle en coréen

Whisper Large-v3 atteint un CER de 8 à 12 % sur le japonais et le coréen, et bat SenseVoice sur ces deux langues (la force de SenseVoice réside spécifiquement dans le mandarin et le cantonais). Pour le japonais, le point faible de Whisper, c'est la conversation spontanée avec de fortes variations dialectales ; le discours formel, lui, est transcrit proprement.

Pour le coréen, Naver CLOVA Speech est l'option dédiée, adossée aux données de recherche de NAVER. Il prend en charge le coréen, l'anglais, le japonais et le chinois simplifié, avec un streaming en temps réel pour le coréen, l'anglais et le japonais ajouté en 2024. La gestion des honorifiques propres au coréen et des registres formel/informel est meilleure dans CLOVA que dans Whisper. L'accès se fait via NAVER Cloud Platform, avec une documentation en anglais disponible.

Mon avis : pour la transcription du japonais, Whisper Large-v3 via l'API OpenAI ou un service basé sur Whisper est le point de départ le plus simple. Pour le coréen, Whisper convient pour un usage général ; CLOVA vaut la peine d'être évalué si vous avez besoin d'un vocabulaire spécialisé ou d'une intégration native avec des produits coréens.

Interface de l'outil de transcription speech-to-text ConvertAudioToText
Interface de l'outil de transcription speech-to-text ConvertAudioToText

Langues indiennes : Azure Speech couvre l'ensemble

Microsoft Azure Speech a investi spécifiquement dans des données d'entraînement pour les langues indiennes et prend en charge l'hindi (hi-IN), le tamoul (ta-IN), le télougou (te-IN), le bengali (bn-IN/bn-BD), le marathi (mr-IN), le gujarati (gu-IN), le pendjabi, l'assamais et l'odia, couvrant plus de 90 % du marché des langues indiennes en nombre de locuteurs. Whisper gère l'hindi avec un WER de 9 à 14 % et s'en sort sur les autres grandes langues indiennes, mais l'entraînement spécialisé d'Azure sur la phonologie et les variations d'accent indiennes lui donne un avantage pour un usage en production.

La STT en temps réel d'Azure Speech coûte 1,00 $/heure en standard, 0,36 $/heure pour la transcription rapide et 0,18 $/heure pour le traitement par lots (selon la documentation du fournisseur à la mi-2026). Le niveau gratuit inclut 5 heures d'audio par mois.

Google Cloud STT Chirp couvre aussi l'hindi, le tamoul, le télougou et le bengali (Chirp 2 uniquement pour le bengali), avec un tarif de 0,016 $/minute en temps réel ou 0,004 $/minute en lots. Consultez la répartition des tarifs Google Cloud Speech-to-Text pour la comparaison complète.

Langues d'Asie du Sud-Est : Google Cloud Chirp et Whisper

Pour le vietnamien, le thaï, l'indonésien, le tagalog/filipino et le malais, le paysage est plus mince. Google Cloud STT Chirp (V2) les couvre tous : le thaï (th-TH), le vietnamien (vi-VN) et l'indonésien (id-ID) sont entièrement pris en charge ; le tagalog et le malais sont aussi disponibles via V2.

La précision de Whisper baisse nettement sur les langues tonales avec moins de données d'entraînement. Le thaï affiche un WER de 18 à 26 % et le vietnamien de 15 à 22 %, ce qui reflète à la fois la complexité tonale et un volume de données plus faible qu'en mandarin ou en japonais. Ces chiffres restent utilisables pour bien des cas, mais l'écart avec l'anglais est bien réel.

Le modèle Universal d'AssemblyAI (confirmé dans la documentation : le japonais, le coréen, le mandarin, l'hindi, le thaï, le vietnamien et l'indonésien sont tous pris en charge) est facturé à 0,15 $/heure pour Universal-2 et 0,21 $/heure pour Universal-3.5 Pro. L'avantage, c'est que vous obtenez la diarisation des locuteurs, le sentiment et les sujets via le même appel API ; l'inconvénient, c'est que la précision par langue pour les langues d'Asie du Sud-Est n'a pas fait l'objet de benchmarks publics spécifiques.

Référence rapide langue par langue

LangueMeilleure option généraleMeilleure option spécialiséePrécision Whisper Large-v3
MandarinGoogle Cloud STT Chirp, OpenAI WhisperAlibaba Cloud Model Studio (Fun-ASR)12,55 % CER
CantonaisOpenAI WhisperSenseVoice (auto-hébergé)10,41 % CER
JaponaisOpenAI WhisperOpenAI Whisper8 à 12 % CER
CoréenOpenAI WhisperNaver CLOVA Speech8 à 12 % CER
HindiAzure SpeechAzure Speech9 à 14 % WER
ThaïGoogle Cloud STT ChirpGoogle Cloud STT Chirp18 à 26 % WER
VietnamienGoogle Cloud STT ChirpGoogle Cloud STT Chirp15 à 22 % WER
IndonésienOpenAI WhisperGoogle Cloud STT ChirpNon publié
TamoulAzure SpeechAzure SpeechNon publié
BengaliAzure SpeechAzure SpeechNon publié
Tagalog/FilipinoGoogle Cloud STT ChirpGoogle Cloud STT ChirpNon publié

Les chiffres CER proviennent des benchmarks VexaScribe (vérifiés en juin 2026). Les chiffres WER proviennent de la même source. « Non publié » signifie qu'aucun benchmark indépendant n'a été trouvé à la date de rédaction.

Ce qui fonctionne vraiment pour l'alternance codique

L'alternance codique est la norme dans de nombreuses conversations asiatiques : l'hinglish (hindi-anglais), le singlish (anglais singapourien avec du malais et du mandarin), le taglish (tagalog-anglais) et le manglish (anglais malaisien avec du malais) impliquent tous des changements en milieu de phrase.

Les outils qui gèrent l'alternance codique sans configuration manuelle :

  • OpenAI Whisper : définissez la langue dominante ; le modèle gère les changements automatiquement, sans avoir à déclarer les deux codes de langue. C'est l'approche la plus fiable pour l'hinglish et le taglish.
  • Google Cloud STT v2 : propose des options explicites de configuration du code-switching dans l'API, utiles quand on connaît les deux langues à l'avance.
  • AssemblyAI Universal : la détection automatique de la langue couvre le contenu mixte dans une certaine mesure.

Les outils qui peinent : les moteurs qui exigent une déclaration stricte d'une seule langue et l'imposent via un filtrage de confiance vont halluciner ou supprimer les segments alternés.

Flux de travail pratique pour la transcription des langues asiatiques

  1. Identifiez votre langue et consultez le tableau ci-dessus pour fixer des attentes réalistes en matière de précision avant de vous engager sur un outil ou un flux.
  2. Pour le mandarin : Alibaba Cloud Model Studio ou OpenAI Whisper ; pour le japonais/coréen : OpenAI Whisper ; pour les langues indiennes : Azure Speech ; pour l'Asie du Sud-Est : Google Cloud STT Chirp.
  3. Après la transcription, vérifiez d'abord les noms propres, les marques et les noms de lieux. C'est la catégorie d'erreurs la plus élevée sur tous les moteurs de langues asiatiques, quel que soit le CER global.
  4. Pour le contenu avec alternance de langues, laissez le modèle détecter automatiquement plutôt que de diviser les fichiers. La division crée souvent des erreurs de frontière où un segment se termine au milieu d'un mot.
  5. Pour du contenu publié, faites relire par un locuteur natif. L'IA fait l'essentiel du travail ; la relecture humaine comble l'écart jusqu'à la qualité de publication.

Voir aussi le guide explication de la diarisation des locuteurs si vous avez besoin de séparer plusieurs locuteurs dans ces langues. La diarisation est une capacité indépendante du support linguistique et varie selon l'outil.

API versus outils grand public pour les langues asiatiques

Pour les développeurs qui créent des produits, le choix se résume à OpenAI Whisper (0,003 à 0,006 $/min), Google Cloud STT Chirp (0,004 à 0,016 $/min selon que c'est en batch ou en temps réel), AssemblyAI Universal (0,15 $/h) et Azure Speech (0,18 à 1,00 $/h selon le mode). Consultez la comparaison des tarifs des API de transcription pour le détail complet côté développeur.

Pour les utilisateurs finaux qui veulent transcrire des fichiers sans rien construire, les principales options sont les outils avec interface web qui prennent en charge ces langues nativement. Si vous voulez traiter un fichier sans créer de compte, ConvertAudioToText accepte les principales langues asiatiques avec un téléversement instantané. Le niveau gratuit offre 10 minutes de transcription, accordées une seule fois à l'inscription plutôt que chaque mois ; le plan Pro coûte 9,99 $/mois pour une transcription illimitée.

Outils à éviter pour les langues asiatiques

Plusieurs outils par ailleurs performants ont un support des langues asiatiques faible, ce qui en fait un mauvais choix pour ce cas d'usage.

  • Otter, Rev, Trint : des outils pensés d'abord pour l'anglais. Leur support des langues asiatiques existe, mais ce n'est pas leur priorité selon la documentation des fournisseurs ; la précision est généralement inférieure à celle des alternatives basées sur Whisper.
  • Deepgram Nova-3 : excellent pour l'anglais et les langues européennes ; d'après la documentation publique de Deepgram, la couverture des langues asiatiques est limitée par rapport aux options ci-dessus. Consultez Deepgram vs AWS Transcribe pour la comparaison des API.
  • AWS Transcribe : prend en charge un nombre limité de langues asiatiques ; les benchmarks communautaires placent sa précision en dessous des outils basés sur Whisper pour la plupart des langues asiatiques, même si AWS n'a pas publié de comparaisons CER.

Pour un contexte parallèle sur une autre famille de langues, l'article sur la meilleure transcription pour les langues africaines aborde les mêmes compromis moteur contre langue pour un autre ensemble de langues peu desservies.

FAQ

Quel moteur de transcription fonctionne le mieux pour le mandarin ?

SenseVoice (le modèle open source d'Alibaba FunAudioLLM, disponible via Alibaba Cloud Model Studio) atteint un CER de 10,78 % en mandarin, contre 12,55 % pour Whisper Large-v3, et traite l'audio 52 à 118 fois plus vite que le temps réel. Pour les développeurs hors de Chine, OpenAI Whisper ou Google Cloud STT Chirp sont de bonnes solutions de repli, avec un accès API simple.

Whisper gère-t-il bien les langues asiatiques ?

Oui, pour les principales. Whisper Large-v3 obtient un CER de 8 à 12 % en japonais et en coréen, un WER de 9 à 14 % en hindi, et un CER de 12,55 % en mandarin. Le CER (taux d'erreur sur les caractères) est la métrique adaptée aux langues CJK, car les frontières de mots ne sont pas marquées par des espaces, ce qui rend le WER trompeur. Les performances chutent pour le thaï (WER de 18 à 26 %) et le vietnamien (WER de 15 à 22 %).

Quelle est l'option API la moins chère pour la transcription en langues asiatiques ?

Le modèle gpt-4o-mini-transcribe d'OpenAI coûte 0,003 $/min (environ 0,18 $/heure) et prend en charge les principales langues asiatiques. Whisper-1 et gpt-4o-transcribe sont facturés 0,006 $/min. Google Cloud STT Chirp coûte 0,016 $/min en temps réel, ou 0,004 $/min en traitement par lots (livraison sous 24 heures). AssemblyAI démarre à 0,15 $/heure pour Universal-2, mais les coûts de production réels, avec diarisation et autres options, dépassent généralement ce tarif.

Pourquoi ma transcription échoue-t-elle sur de l'audio avec alternance codique, comme l'hinglish ou le taglish ?

La plupart des moteurs s'attendent à une langue unique déclarée et échouent quand les locuteurs changent de langue en pleine phrase. Whisper Large-v3 gère l'alternance codique automatiquement, sans qu'il soit nécessaire de déclarer les deux codes de langue ; définissez la langue dominante et il s'occupe du reste. Google Cloud STT v2 propose des options de configuration explicites pour l'alternance codique. Si votre outil exige une déclaration de langue unique, définir la langue dominante et laisser le modèle gérer le reste donne de meilleurs résultats que de découper les fichiers audio.

Les deux disposent d'API internationales, mais l'accès pratique diffère. Naver CLOVA Speech est disponible via NAVER Cloud Platform avec une documentation en anglais et prend en charge le coréen, l'anglais, le japonais et le chinois simplifié. La plateforme mondiale d'iFlytek (global.xfyun.cn) répertorie des API pour plus de 15 langues, dont l'anglais, mais la tarification est opaque et nécessite généralement un compte développeur pour démarrer. Pour une utilisation en production hors de Corée ou de Chine, les outils basés sur Whisper ou Google Cloud STT sont plus simples.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles