
La transcription en hindi et le problème du hinglish (2026)
Summarize this article with:
Le vrai problème : votre audio en hindi est probablement du hinglish
La plupart des audios modernes en hindi ne sont pas du hindi pur. Une phrase d'un podcast business peut ressembler à : « Aaj meeting mein hum decide kiya ki next quarter mein hum launch karenge, but pricing strategy abhi finalize nahi hui hai. » C'est une seule phrase, sept mots hindi et sept mots anglais, prononcée d'un seul souffle. Le moteur d'IA doit déterminer, mot par mot, s'il faut produire du devanagari ou des caractères latins.

Voici la difficulté centrale de la transcription en hindi en 2026. Ce n'est pas un problème de précision au sens classique. C'est un problème de basculement d'écriture qui se superpose à un problème de basculement de langue. Les moteurs qui gèrent bien cela produisent une sortie lisible et naturelle. Ceux qui n'y arrivent pas produisent soit du tout-devanagari (avec des mots anglais maladroitement translittérés), soit une transcription qui abandonne complètement l'hindi et traite tout comme de l'anglais.
Ce guide couvre la façon dont les principaux moteurs gèrent concrètement ce cas, vérifiée à partir de la documentation et de retours de développeurs, et non de benchmarks menés en laboratoire.
Devanagari : ce que l'écriture exige
L'hindi s'écrit en devanagari, un abugida de 47 caractères principaux (14 voyelles et 33 consonnes). Les caractères s'écrivent de gauche à droite. Sa particularité est le shirorekha, une barre horizontale qui court le long du haut de chaque caractère et relie visuellement les lettres en mots.
Plusieurs mécanismes importent pour la transcription :
Matras (signes vocaliques) : les voyelles sont souvent écrites sous forme de diacritiques attachés à la consonne précédente, et non comme des caractères autonomes. Un modèle qui gère correctement les consonnes mais place mal les matras produit du devanagari illisible.
Consonnes conjointes (samyukta vyanjan) : lorsque deux consonnes se rencontrent sans voyelle entre elles, elles fusionnent en une seule ligature. « ज्ञान » (savoir) est une consonne conjointe. Se tromper sur ces cas signale que le modèle n'a pas été entraîné sur suffisamment de données en devanagari.
Points nukta : un point sous une consonne indique un son étranger, absent de l'hindi d'origine sanskrite. « ज़ » (za), « क़ » (qa) et « फ़ » (fa) utilisent tous des nuktas et apparaissent fréquemment dans l'hindi influencé par l'ourdou ainsi que dans les emprunts anglais translittérés.
Suppression du schwa : en hindi parlé, la voyelle brève « a » (schwa) en fin de syllabe est souvent supprimée. « राम » se prononce « Raam », et non « Raama ». Les moteurs de transcription qui ne modélisent pas la suppression du schwa produisent une sortie phonétiquement incorrecte.
Pour un transcript hindi correct, tout cela doit tomber juste. Si votre outil renvoie « main aapka shukriya ada karta hoon » en hindi romanisé au lieu de « मैं आपका शुक्रिया अदा करता हूँ », c'est que votre outil ne gère pas réellement l'hindi.
Hinglish : ampleur et mécanismes d'alternance codique
Selon le New York Times, plus de 350 millions d'Indiens urbains utilisent régulièrement le hinglish. Des recherches de l'IIT Delhi ont montré que l'usage du hinglish a progressé de 2 % par an entre 2022 et 2024. Environ 83 % des locuteurs de l'hindi mélangent des mots anglais dans leur discours, dans une certaine mesure.
L'alternance codique dans le hinglish n'est pas aléatoire. Il existe des schémas constants :
- Les noms et les termes techniques passent d'abord à l'anglais. « Budget », « deadline », « meeting », « strategy » restent en anglais même dans un discours très dominé par l'hindi.
- Les verbes restent plus souvent en hindi, mais les verbes anglais sont « hindisés » : « launch karna », « finalize karna », « decide kiya ».
- L'alternance au niveau de la phrase est courante dans les registres formels, où un locuteur peut commencer une idée en hindi et la terminer en anglais.
- Le mélange au niveau du mot domine dans la conversation informelle, les réseaux sociaux et les dialogues de Bollywood.
Résultat : aucun code de langue unique ne décrit pleinement ce que fait le locuteur. Définir language=hi vous donne une sortie en devanagari mais peut mal gérer les passages anglais. Définir language=en supprime totalement l'hindi. Définir language=multi est le bon choix sur les moteurs qui le prennent en charge, mais le comportement varie.
Consultez comment l'alternance codique affecte les pipelines de transcription pour un traitement plus large des problèmes techniques.
Comment chaque moteur gère le hinglish
OpenAI Whisper (large-v3)
Whisper large-v3 est le modèle multilingue le plus connu et gère bien l'hindi pur quand on définit explicitement language=hi. Sur du contenu en hinglish, le comportement est constant mais pas idéal pour la plupart des usages : le modèle transcrit les emprunts anglais et les passages anglais en alternance codique en écriture devanagari. Ainsi, « next quarter mein launch karenge » peut revenir sous la forme « नेक्स्ट क्वार्टर में लॉन्च करेंगे », avec « next quarter » translittéré en devanagari plutôt que conservé en alphabet latin.
Il n'existe aucun paramètre officiel pour obtenir de Whisper une sortie hinglish en écriture mixte. La solution communautaire est le modèle Whisper-Hinglish affiné par Trelis Research, qui introduit un jeton |mixedcode| déclenchant le mélange devanagari-latin, mais il ne fait pas partie de l'API standard.
Un danger supplémentaire : avec la détection automatique, les modèles Whisper de base confondent parfois l'hindi avec l'ourdou (les deux langues sont proches et partagent une forme parlée). L'ourdou utilise l'écriture nastaliq, ce qui rendrait votre transcript illisible pour un public hindi. Définissez toujours explicitement language=hi avec Whisper.
Deepgram Nova-3
Nova-3 prend en charge l'hindi (hi) nativement. Pour l'audio en hindi pur, c'est l'offre la plus solide de Deepgram pour cette langue.
Pour le hinglish, Nova-3 propose un mode multilingue distinct (language=multi) qui prend en charge l'alternance codique hindi-anglais parmi 10 langues. Dans ce mode, Nova-3 reproduit naturellement le choix d'écriture du locuteur : les mots hindi en devanagari, les mots anglais en latin. Le modèle a été entraîné sur de véritables données en alternance codique plutôt que sur des mélanges synthétiques. C'est architecturalement la bonne approche.
En pratique, des développeurs ont signalé que Nova-3 multi identifiait parfois l'hindi comme de l'espagnol sur certains enregistrements en hinglish, ce qui provoque un échec de transcription majeur. Il semble s'agir d'un problème de fiabilité de la détection de langue dans le modèle multilingue, et non d'un défaut d'architecture fondamental. La parade trouvée par certains développeurs consiste à revenir à Nova-2 ou Nova-1 avec le code de langue hi, en acceptant la limite de la sortie tout-devanagari.
Deepgram a aussi publié le cadre BRIDGE, qui analyse précisément pourquoi les métriques WER standard échouent sur les langues indiennes — signe qu'ils prennent ce problème au sérieux. Consultez Deepgram Nova-3 expliqué pour en savoir plus sur l'architecture du modèle.
AssemblyAI Universal-3
Le modèle Universal-3 d'AssemblyAI prend en charge 99 langues avec alternance codique automatique et diarisation des locuteurs. L'hindi figure parmi les langues prises en charge. AssemblyAI a étendu l'hindi pour inclure spécifiquement la diarisation des locuteurs (aux côtés du chinois, du japonais, du coréen et du vietnamien), ce qui signifie que le contenu multi-locuteurs en hindi et en hinglish est correctement étiqueté.
Pour Universal-3 Pro, l'hindi se situe dans le palier « Bonne précision », qu'AssemblyAI définit comme un WER de 10-25 %. Ce n'est pas le meilleur de sa catégorie, mais c'est fonctionnel. La diarisation d'AssemblyAI préserve l'identité du locuteur à travers les changements de langue : un podcast où un hôte parle davantage hindi et l'autre davantage anglais reste donc correctement étiqueté.
Google Cloud STT (Chirp)
Le modèle Chirp de Google Cloud prend en charge plus de 125 langues et fonctionne avec une tarification à la minute. L'hindi est pris en charge. Pour l'alternance codique, la recommandation historique de Google est de définir language_codes afin d'inclure à la fois hi-IN et en-IN, ce qui permet au modèle de traiter l'audio mixte, même si la cohérence de la sortie sur le hinglish varie.
Cas d'usage API pure (Deepgram, AssemblyAI)
Si vous construisez un pipeline, Deepgram comme AssemblyAI proposent des API REST avec prise en charge de l'hindi. La tarification de l'API Deepgram et le modèle à la consommation d'AssemblyAI sont comparés en détail dans l'aperçu des tarifs des API speech-to-text.
Tableau comparatif des moteurs
| Moteur | Hindi pur | Mode hinglish | Écriture de sortie sur hinglish | Diarisation |
|---|---|---|---|---|
| Whisper large-v3 | Solide | Pas de mode dédié | Tout-devanagari (mots anglais translittérés) | Non natif |
Deepgram Nova-3 (hi) | Solide | Non | Tout-devanagari | Oui |
Deepgram Nova-3 (multi) | N/A | Oui | Mixte (devanagari + latin) | Oui |
| AssemblyAI Universal-3 | Bon (10-25 % de WER) | Alternance codique auto | Mixte | Oui (améliorée en 2026) |
| Google Cloud Chirp | Bon | Paramètre multilingue | Mixte | Oui |
Mon avis : pour du contenu en hinglish où vous voulez une sortie mixte lisible, Deepgram Nova-3 multi est architecturalement le meilleur choix lorsque la détection de langue fonctionne correctement. Pour l'audio en hindi pur avec des exigences strictes de devanagari, Whisper large-v3 avec language=hi explicite est fiable. AssemblyAI est le meilleur choix quand la priorité est la diarisation à travers les changements de langue.
Accents régionaux de l'hindi et précision
L'Inde compte des dizaines d'accents régionaux de l'hindi, chacun avec des schémas phonétiques distincts que les moteurs d'IA gèrent différemment :
Hindi de Delhi/NCR (urbain, fort mélange d'anglais) : le mieux représenté dans les données d'entraînement. Le plus proche de ce qui est testé dans les benchmarks.
Hindi de Mumbai (Bambaiya) : la phonologie marathe influence les consonnes rétroflexes et la longueur des voyelles. « Bhai » devient un marqueur social distinct. La précision est inférieure à celle du hindi de Delhi, mais reste raisonnable sur les grands moteurs.
Hindi influencé par Lucknow/Awadhi : phonologie plus formelle, traitement distinct du « l » et du « r », vocabulaire de registre soutenu. Généralement bien géré.
Hindi influencé par le bhojpuri (Bihar, est de l'UP) : le hindi influencé par le bhojpuri est phonologiquement très différent. Les schémas de conservation du schwa diffèrent de l'hindi standard. La précision chute nettement.
Hindi sud-indien (fort accent tamoul, télougou, kannada) : le transfert phonologique depuis les langues dravidiennes est significatif. Les oppositions rétroflexes/dentales sont affectées. C'est la catégorie qui nécessite le plus de relecture, quel que soit le moteur.
Pour le contenu spécifiquement bhojpuri, magahi, maithili, marwari ou awadhi en tant que langues (et non accents) : ce sont des langues distinctes, pas des accents régionaux de l'hindi. Les transcrire avec un modèle hindi donnera une sortie dégradée, et ce n'est pas un cas d'usage pris en charge par aucun grand moteur.
Registres de formalité et leurs effets
L'hindi possède deux niveaux honorifiques qui affectent la conjugaison des verbes, les pronoms et le vocabulaire :
- Aap (आप) : « vous » formel de troisième personne, utilisé avec les aînés et les inconnus
- Tum (तुम) : intermédiaire, utilisé avec ses pairs
- Tu (तू) : intime, utilisé avec les amis proches et les enfants (ou comme insulte envers des inconnus)
Ces distinctions affectent le vocabulaire autour des verbes (करते हैं vs करते हो vs करता/करती है) et produisent des textes de transcript différents. Un moteur de transcription qui normalise ces distinctions en une forme unique perd du sens social.
Plus concrètement : la parole formelle (actualités, cours magistraux, discours) et la parole informelle (notes vocales WhatsApp, podcasts décontractés) ont des proportions de hinglish très différentes. La parole formelle penche vers l'hindi pur ou des phrases entièrement en anglais. La parole informelle est celle où le hinglish est le plus dense.
Cas d'usage réels de la transcription en hindi
Les créateurs de podcasts et YouTube indiens constituent le cas d'usage au plus fort volume. La scène podcast indienne est l'une des plus dynamiques au monde. Les hôtes passent de l'hindi à l'anglais au sein d'un épisode et parfois au sein d'une même phrase. Le besoin pratique est des notes d'émission et des marqueurs de chapitres lisibles, correspondant à la façon dont le public lit réellement, c'est-à-dire du hinglish en écriture mixte.
Les rédactions en hindi transcrivant des discours politiques et des interviews de panel ont besoin d'une sortie en devanagari directement intégrable dans des articles en hindi. La diarisation des locuteurs compte ici, car les émissions de panel comptent 3 à 6 locuteurs.
Le support client et les centres d'appels traitant des appels clients en hindi ou en hinglish ont besoin d'une sortie en alphabet latin (ou en devanagari, selon le système CRM) et d'étiquettes de locuteurs distinguant l'agent du client. C'est un cas d'usage d'apprentissage automatique en pleine croissance, avec des entreprises qui affinent spécifiquement des modèles sur le hinglish des centres d'appels.
La transcription juridique et académique en hindi formel exige un devanagari exact avec une gestion correcte des matras et des consonnes conjointes, car la sortie finit souvent dans des documents officiels.
Le contenu éducatif (cours, vidéos de formation) couvre tout l'éventail, de l'hindi pur au hinglish, selon l'institution et la matière.
Si vous avez simplement besoin d'un transcript propre sans construire de pipeline personnalisé, l'outil audio-vers-texte de ConvertAudioToText gère l'hindi avec sortie en devanagari et mélange hinglish. L'offre gratuite couvre 10 minutes de transcription, accordées une seule fois à l'inscription plutôt que chaque mois, ce qui suffit pour tester votre audio spécifique avant de vous engager.
Astuces qui comptent vraiment pour l'audio en hindi
Définissez la langue explicitement. Ne comptez pas sur la détection automatique pour l'hindi. La langue est phonologiquement proche de l'ourdou, et certains détecteurs automatiques orientent à tort l'audio hindi vers l'ourdou, produisant une sortie en écriture nastaliq illisible pour les lecteurs de l'écriture hindi.
Choisissez votre mode selon le besoin de sortie. Si votre système aval n'exige que du devanagari, utilisez language=hi et acceptez la translittération tout-devanagari du hinglish. Si vous avez besoin d'une sortie mixte lisible, utilisez un mode multilingue.
Utilisez un vocabulaire personnalisé pour les noms propres indiens. Les noms personnels indiens présentent d'énormes variations orthographiques : « Priya » vs « Priyaa », « Suresh » vs « Suresh Kumar ». Les noms de lieux diffèrent de leurs versions romanisées. Un glossaire aide considérablement.
Le bruit de fond est un vrai problème dans l'audio indien, en particulier le contenu enregistré sur les marchés en plein air, dans des bureaux animés ou dans la rue. Cela affecte tous les moteurs de la même façon et constitue le principal levier de précision en dehors du choix du moteur.
N'utilisez pas de modèles hindi pour du contenu bhojpuri ou marwari. Le modèle fera de son mieux et échouera. Ce sont des langues séparées.
Comparer les outils pour les flux de travail en hindi
| Outil | Offre gratuite | Tarifs payants | Gestion du hinglish | Résumé IA en hindi |
|---|---|---|---|---|
| ConvertAudioToText | 10 min gratuites, une fois | 9,99 $/mois illimité | Écriture mixte | Oui (hinglish) |
| Otter.ai | 300 min/mois | 8,33 $/mois (annuel, 1 200 min) | Latin uniquement | Anglais uniquement |
| Sonix | Aucune (essai) | 10 $/h ou 5 $/h + 22 $/utilisateur/mois | Natif | Non |
| Google Cloud STT | 60 min/mois (Chirp) | Facturation à la minute | Paramètre multilingue | Non |
Remarque sur Otter : l'offre gratuite de 300 minutes est généreuse, mais Otter transcrit l'audio hindi uniquement en écriture latine et génère des résumés en anglais quelle que soit la langue de l'audio. Pour les créateurs indiens publiant du contenu destiné à un public hindiophone, c'est un décalage de flux de travail, pas une limitation mineure.
Les coûts cachés des services de transcription passe en revue ce qu'il faut surveiller au-delà des prix affichés, notamment les frais par siège et les limitations d'exportation.
Questions fréquentes
Whisper transcrit-il le hinglish en écriture mixte ?
Pas par défaut. Lorsque vous définissez language=hi, Whisper transcrit tout en devanagari, y compris les mots anglais et les emprunts. Des mots anglais comme « meeting » ressortent sous la forme « मीटिंग ». Il n'existe aucun paramètre d'API standard pour changer cela. Un modèle affiné par la communauté (Whisper-Hinglish de Trelis Research) ajoute un mode d'alternance codique, mais il ne fait pas partie de l'API Whisper officielle.
Quelle est la différence entre l'hindi et le hinglish pour la transcription ?
L'hindi est la langue standard, écrite en devanagari, avec un vocabulaire dérivé du sanskrit pour les registres formels. Le hinglish est de l'hindi parlé qui mélange des mots et des expressions anglaises au sein des phrases, ce qui oblige le moteur à décider mot par mot quelle écriture produire. La difficulté, c'est qu'il n'existe aucune règle fixe : « meeting » peut légitimement apparaître sous la forme « मीटिंग » ou « meeting » dans un document en hindi, selon le style de la publication. Cette ambiguïté explique pourquoi la transcription du hinglish varie autant d'un moteur à l'autre.
Les moteurs d'IA gèrent-ils les accents sud-indiens en hindi ?
Oui, mais la précision chute par rapport au hindi de Delhi ou de Mumbai. Le transfert phonologique depuis les langues dravidiennes (tamoul, télougou, kannada, malayalam) vers l'hindi produit des schémas de consonnes rétroflexes et des longueurs vocaliques différents de la distribution d'entraînement de la plupart des modèles hindi. Attendez-vous à plus de relecture sur ce contenu, quel que soit le moteur utilisé.
La diarisation des locuteurs est-elle disponible pour le contenu en hindi ?
Oui, sur Deepgram Nova-3, AssemblyAI Universal-3 et Google Cloud STT. AssemblyAI a étendu la diarisation des locuteurs en hindi spécifiquement en 2025-2026. Les interviews formelles à deux locuteurs donnent généralement une meilleure diarisation que les tables rondes multi-locuteurs avec chevauchements de parole, ce qui vaut pour toutes les langues, pas seulement l'hindi.
Comment transcrire un audio en bhojpuri ou en marwari ?
Vous ne pouvez pas utiliser de manière fiable un modèle de transcription hindi pour du contenu bhojpuri, marwari, magahi ou maithili. Ce sont des langues séparées, dotées d'une phonologie distincte. À mi-2026, aucun grand moteur commercial ne liste le bhojpuri parmi les langues prises en charge. Si vous avez besoin d'une transcription en bhojpuri, la transcription humaine par un spécialiste est la voie pratique. Utiliser un modèle hindi produira au mieux une sortie partielle et truffée d'erreurs.
Sources
- Vue d'ensemble des modèles et langues Deepgram : https://developers.deepgram.com/docs/models-languages-overview
- Documentation Deepgram sur l'alternance codique multilingue : https://developers.deepgram.com/docs/multilingual-code-switching
- Article de blog Deepgram Nova-3 Multilingual : https://deepgram.com/learn/nova-3-multilingual-major-wer-improvements-across-languages
- Discussion GitHub Deepgram Nova-3 hindi-anglais : https://github.com/orgs/deepgram/discussions/1208
- Documentation AssemblyAI des langues prises en charge : https://www.assemblyai.com/docs/supported-languages
- Annonce AssemblyAI Universal-3 Pro : https://www.assemblyai.com/blog/introducing-universal-3-pro
- Tarification Otter.ai : https://otter.ai/pricing
- Tarification Sonix : https://sonix.ai/pricing
- Tarification ConvertAudioToText : https://convertaudiototext.com/pricing
- Discussion GitHub sur l'écriture hindi de Whisper : https://github.com/openai/whisper/discussions/1662
- Modèle Whisper-Hinglish affiné : https://trelis.substack.com/p/whisper-hinglish
- Données sur la prévalence du hinglish : https://www.gan.studio/blog/posts/the-prevalence-of-hinglish-in-urban-india-a-data-driven-exploration
- OriserveAI Whisper-Hindi2Hinglish : https://github.com/OriserveAI/Whisper-Hindi2Hinglish
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.