
Transcription de l'indonésien : registre formel vs parler familier de Jakarta
Summarize this article with:
L'indonésien (bahasa Indonesia) est l'une des langues asiatiques les mieux prises en charge pour la transcription par IA en 2026, notamment parce qu'il utilise l'alphabet latin et présente une phonologie formelle relativement cohérente. Les principaux risques pour la précision ne viennent pas des accents régionaux, mais de l'écart de registre entre l'indonésien écrit formel (bahasa baku) et la variété urbaine familière (bahasa gaul) employée dans la plupart des podcasts, vlogs et interviews informelles. Un second piège est la détection automatique : les modèles confondent parfois l'indonésien avec le malais, les deux langues partageant une orthographe unifiée depuis 1972. Définissez explicitement le code de langue pour éviter cela. Deepgram Nova-3 a ajouté la prise en charge de l'indonésien en janvier 2026 ; Whisper le prend en charge dans toutes les tailles de modèles.
La transcription par IA gère-t-elle bien le bahasa Indonesia ?
Oui, l'indonésien est l'une des langues non européennes les mieux prises en charge pour la transcription par IA en 2026, et la raison est structurelle : le bahasa Indonesia utilise l'alphabet latin sans diacritiques, possède un inventaire phonémique relativement restreint pour une langue asiatique et bénéficie d'une orthographe formelle cohérente depuis la réforme EYD de 1972. Tous les grands moteurs ASR le prennent désormais en charge.
Cela dit, « pris en charge » et « précis sur votre audio » ne sont pas la même chose. L'écart entre les deux dépend presque entièrement du registre, pas du choix du moteur.
L'écart formel-familier est le vrai enjeu de précision
La question de précision que posent la plupart des gens est « quel pourcentage ? ». La question plus utile est « quel indonésien ? »
Le bahasa baku, la norme écrite formelle, est ce qui apparaît dans les journaux télévisés, les débats gouvernementaux, les cours universitaires et les rapports d'entreprise. Les modèles sont entraînés principalement sur ce registre. Il est lu, propre et phonologiquement prévisible.
Le bahasa gaul, la variété urbaine familière originaire de Jakarta qui s'est diffusée via les médias nationaux et les plateformes sociales, est une autre histoire. La même phrase se présente complètement différemment :
| Formel (baku) | Familier (gaul) |
|---|---|
| Saya (moi) | Gua / Gue / Gw |
| Anda (vous) | Lu / Lo |
| Sudah (déjà) | Udah |
| Habis (fini) | Abis |
| Terima kasih (merci) | Makasih |
| Menanyakan (demander, suffixe formel) | Nanyain (-in remplace -kan) |
| Mengambil (prendre, préfixe formel) | Ngambil (raccourcissement nge-) |
Au-delà du vocabulaire, le bahasa gaul ajoute des particules modales qui ajustent le ton émotionnel d'une phrase sans en changer le sens : dong (certitude), sih (insistance décontractée), deh (caractère définitif), lah (adoucissement), kok (persuasion face à un auditeur sceptique). Un modèle qui ne les a jamais vues en quantité les supprimera ou les interprétera à tort comme des mots de contenu.
Les recherches sur l'ASR indonésien ont confirmé que la variabilité du style de parole affecte la précision davantage que le bruit ou l'accent, la parole familière spontanée produisant des taux d'erreur par mot mesurablement plus élevés que la parole formelle lue. Si votre contenu est constitué de podcasts, vlogs, interviews informelles ou enregistrements d'équipe de startup, considérez les chiffres de référence en registre formel que vous voyez vantés comme un plafond, pas comme un résultat typique.

Le problème de confusion indonésien-malais
Définir explicitement la langue sur l'indonésien n'est pas optionnel si la précision compte. Voici pourquoi.
L'indonésien et le malais sont mutuellement intelligibles et partagent le même système d'écriture. La réforme orthographique indo-malaisienne de 1972, connue sous le nom d'EYD (Ejaan yang Disempurnakan) en Indonésie et d'ERB (Ejaan Rumi Bersama) en Malaisie, a unifié l'orthographe des deux langues. Avant 1972, elles utilisaient même des représentations latines légèrement différentes des mêmes sons : l'indonésien avait tj et dj là où l'orthographe moderne utilise c et j.
Résultat : les modèles de détection automatique voient un audio qui sonne très semblable dans les deux langues, transcrit avec une graphie quasi identique, et ont une réelle probabilité d'aboutir au malais (ms) plutôt qu'à l'indonésien (id). Quand cela arrive, la transcription peut utiliser des schémas de vocabulaire malais plutôt qu'indonésiens, ce qui change sensiblement le résultat.
La divergence qui aide réellement un modèle bien entraîné à les distinguer vient des emprunts. L'indonésien a beaucoup absorbé du néerlandais pendant la période coloniale : kantor (bureau, du néerlandais kantoor), televisi (télévision, du néerlandais televisie), polisi (police, du néerlandais politie). Le malais malaisien a emprunté les mêmes concepts à l'anglais : pejabat (bureau), televisyen (télévision), polis (police). La phonologie de l'indonésien conserve aussi le /a/ final là où le malais péninsulaire le réduit à un schwa.
En pratique : définissez le code de langue sur id dans tout outil de transcription que vous utilisez. Pour une paire de langues aussi proche, la détection automatique est une fonctionnalité de confort, pas un outil de précision.
Prise en charge par les moteurs : ce qui est vérifié pour l'indonésien en 2026
Trois grands fournisseurs ASR ont confirmé la prise en charge de l'indonésien avec leurs modèles de production actuels :
Whisper (OpenAI) : l'indonésien (id) figure dans la liste des langues prises en charge par Whisper pour toutes les tailles de modèles, y compris Large-v3. L'entraînement multilingue de Whisper incluait l'indonésien. Le modèle gère bien l'indonésien formel. Des recherches ont montré que le fine-tuning de Whisper Medium sur des jeux de données indonésiens réduit significativement les taux d'erreur, ce qui indique que le modèle de base dispose d'une vraie marge de progression sur la parole familière et spontanée.
Deepgram Nova-3 : Deepgram a ajouté l'indonésien (id) à Nova-3 en janvier 2026, le décrivant comme « une langue hybride mêlant racines malaises, emprunts anglais et inflexions régionales, souvent utilisée dans des environnements multilingues ». Une version mise à jour de Nova-3 Multilingual sortie en mars 2026 a rapporté une réduction relative d'environ 34 % du taux d'erreur par mot en traitement par lots sur les langues prises en charge. Nova-3 inclut le keyterm prompting pour jusqu'à 100 termes spécifiques à un domaine par requête, directement utile pour injecter des noms de marques indonésiennes, des toponymes et des termes techniques qui seraient autrement mal transcrits.
AssemblyAI : l'indonésien fait partie des 99 langues prises en charge par le modèle Universal d'AssemblyAI.
Pour un aperçu plus large de la façon dont ces moteurs se comparent sur d'autres langues et paliers tarifaires, consultez le détail des tarifs des API speech-to-text pour 2026.
L'alternance codique indonésien-anglais
Le contenu tech, startup et business indonésien mélange couramment l'anglais dans des phrases indonésiennes, et les moteurs ASR modernes gèrent cela raisonnablement bien. Des phrases comme « Kita perlu push ke production sebelum meeting » ou « Dia bikin konten untuk social media » reviennent avec les parties indonésiennes en indonésien et les emprunts anglais en anglais. Deepgram Nova-3 cite spécifiquement l'alternance codique multilingue comme fonctionnalité pour l'indonésien.
Le cas plus difficile est l'indonésien mélangé au javanais ou au soundanais, courant dans l'audio informel de Java central, Java oriental et Java occidental. Ni le javanais ni le soundanais n'est une langue prise en charge en production dans les grands moteurs ASR en 2026, donc quand ces mots apparaissent dans une conversation sinon indonésienne, le modèle les devinera phonétiquement plutôt que de les reconnaître comme une autre langue. Pour ce type de contenu multilingue, une post-édition humaine sera probablement nécessaire.
Pour du contexte de précision spécifique aux langues sur des langues d'Asie du Sud-Est étroitement apparentées, consultez le guide de transcription tagalog et filipino.
Comparer les outils de transcription prenant en charge l'indonésien
Le tableau ci-dessous reflète les fonctionnalités et tarifs vérifiés à mi-2026. Les chiffres de précision sont auto-déclarés par les fournisseurs sauf mention contraire et doivent être traités comme des affirmations optimistes.
| Outil | Prise en charge de l'indonésien | Modèle tarifaire | Alternance codique | Résumé en indonésien |
|---|---|---|---|---|
| Sonix | Oui (tous les plans) | 10 $/h à l'usage ; Core dès 25 $/mois | Oui | Non (anglais uniquement) |
| Happy Scribe | Oui (IA + humain) | IA dès 17 EUR/mois (120 min) ; humain dès 1,75 EUR/min | Non précisé | Non |
| Otter.ai | Non | Gratuit (300 min) ; Pro dès 8,33 $/mois | Non | Non |
| AssemblyAI | Oui (modèle Universal) | Facturation à la minute, paliers de volume | Oui (modèle multilingue) | Non |
Sonix propose un essai gratuit de 30 minutes. Happy Scribe propose un essai gratuit de 10 minutes et annonce environ 85 % de précision IA pour l'indonésien, avec une option relue par un humain revendiquant 99 % de précision pour le contenu critique. Otter ne prend pas du tout en charge l'indonésien, un fait à noter puisque c'est une recommandation fréquente pour la transcription de réunions.
Si vous avez besoin d'une transcription illimitée à tarif forfaitaire plutôt qu'une facturation à l'heure, ConvertAudioToText inclut l'indonésien à 9,99 $ par mois (10 minutes gratuites sur le plan gratuit, accordées une seule fois à l'inscription).
Pour une comparaison tarifaire complète entre ces services et d'autres, consultez la comparaison des prix de transcription 2026.
Accents régionaux : ce qui compte vraiment
L'indonésien influencé par le javanais (Java central et oriental), l'indonésien influencé par le soundanais (Bandung et Java occidental), l'indonésien influencé par le balinais et l'indonésien oriental (Maluku, Papouasie) introduisent tous des schémas phonologiques différents de l'indonésien formel de Jakarta. Traitement des voyelles, groupes de consonnes, contours intonatifs et débit varient.
L'impact pratique est moindre que ne le suggère la liste, car ces locuteurs utilisent généralement le bahasa Indonesia comme langue véhiculaire, pas comme leur langue maternelle régionale. Le registre est souvent plus proche du baku que du gaul, ce qui joue en faveur du modèle. Les variétés indonésiennes orientales (Maluku, Papouasie) divergent le plus de la distribution d'entraînement et afficheront les taux d'erreur les plus élevés. Aucun sous-modèle régional n'est nécessaire ; le modèle standard id les gère tous, avec une précision réduite en périphérie.
La variable la plus importante, pour revenir au point précédent, est de savoir si votre locuteur emploie un indonésien formel ou familier, pas d'où il vient.
La reduplication : un défi d'analyse spécifique
L'indonésien utilise la reduplication morphologique pour former les pluriels et les intensificateurs. Rumah signifie maison ; rumah-rumah signifie maisons. Sapi signifie vache ; sapi-sapi signifie vaches. C'est de l'indonésien écrit standard et c'est bien géré au niveau de l'affichage puisque le trait d'union est explicite dans le texte.
Le défi ASR survient quand la reduplication à l'oral ressemble à un bégaiement. L'article sur l'ASR indonésien note que « sa-sa-sapi » (une forme bégayée) et « sapi-sapi » (un mot redupliqué valide) exigent une conscience prosodique pour être distingués. Les modèles actuels ne font pas toujours juste sur ce point.
Pour approfondir pourquoi certaines caractéristiques phonologiques posent problème aux moteurs de reconnaissance vocale, consultez pourquoi l'IA peine avec les langues à faibles ressources et la précision de transcription expliquée.
La diarisation des locuteurs pour l'audio indonésien
Les interviews indonésiennes formelles à deux locuteurs donnent généralement une diarisation propre. Les normes conversationnelles indonésiennes en contexte formel impliquent une alternance claire des tours de parole, ce qui aide nettement la séparation des locuteurs. Les podcasts décontractés et les discussions de groupe avec fort chevauchement de parole sont plus difficiles, et ce n'est pas spécifique à l'indonésien.
Pour en savoir plus sur le fonctionnement de la diarisation des locuteurs selon les types d'audio, consultez la diarisation des locuteurs expliquée.
Conseils pratiques pour une meilleure transcription de l'indonésien
- Définissez explicitement la langue sur
id. Ne vous fiez pas à la détection automatique quand l'indonésien et le malais sont tous deux plausibles. - Pour un contenu riche en bahasa gaul, attendez-vous à des taux d'erreur plus élevés et prévoyez une passe de post-édition. Un audio clair dans un espace calme aide plus que tout autre facteur isolé.
- Utilisez le keyterm prompting (là où il est disponible) pour les noms de marques indonésiennes, les noms de personnes et les termes produits. Gojek, Tokopedia, Traveloka, ainsi que les noms de provinces et de villes indonésiennes sont souvent hors distribution pour des modèles entraînés sur de la parole formelle.
- Pour les mots javanais ou soundanais qui apparaissent dans une transcription sinon indonésienne, signalez-les pour relecture manuelle. Le modèle devinera phonétiquement.
- Pour les show notes de podcast ou les marqueurs de chapitres, vérifiez que votre outil génère la sortie en indonésien plutôt que de traduire d'abord en anglais. Certains outils font le résumé en anglais quelle que soit la langue source.
Questions fréquentes
La transcription par IA gère-t-elle bien le bahasa gaul (l'indonésien familier de Jakarta) ?
Pas aussi fiablement que l'indonésien formel. Le bahasa gaul utilise d'autres pronoms (gua/lu au lieu de saya/Anda), élide ou contracte des syllabes (udah pour sudah, abis pour habis, makasih pour terima kasih), ajoute le suffixe -in à la place de -kan/-i et superpose des particules comme sih, dong, deh et lah qui n'ont pas d'équivalent formel direct. La plupart des modèles sont entraînés principalement sur de la parole formelle lue, donc l'audio familier spontané affichera un taux d'erreur plus élevé. La solution pratique : un audio clair et une sélection explicite de la langue.
Les modèles d'IA confondent-ils l'indonésien avec le malais ?
Oui, cela arrive, et la cause est structurelle : les deux langues partagent le même alphabet latin, la même orthographe unifiée EYD de 1972 et un vocabulaire qui se recoupe. Elles diffèrent par la source des emprunts (l'indonésien a absorbé des mots néerlandais comme kantor et televisi ; le malais de Malaisie leurs équivalents anglais) et par la prononciation de la voyelle finale (l'indonésien conserve le /a/ plein ; le malais péninsulaire le réduit à un schwa). Si vous soumettez un audio sans préciser la langue, la détection automatique peut aboutir à ms (malais) au lieu de id (indonésien). Définissez toujours explicitement la langue sur l'indonésien.
L'IA peut-elle gérer l'alternance codique indonésien-anglais ?
Les grands modèles s'en sortent raisonnablement bien. Le discours tech et business indonésien mélange couramment des termes anglais dans des phrases indonésiennes, par exemple « Kami perlu deploy ke production sebelum meeting » ou « Dia bikin konten untuk social media ». Deepgram Nova-3 prend explicitement en charge l'alternance codique multilingue, et l'entraînement multilingue de Whisper couvre ce schéma. Les mots indonésiens reviennent en indonésien ; les termes anglais reviennent en anglais. L'alternance avec des langues locales comme le javanais ou le soundanais est plus difficile, car celles-ci ne sont pas des langues prises en charge en production à part entière.
Quelle est la différence entre bahasa baku et bahasa gaul pour la transcription ?
Le bahasa baku est l'indonésien standard formel utilisé dans les actualités, l'administration et l'éducation, le registre sur lequel la plupart des modèles ASR sont entraînés. Le bahasa gaul est le registre urbain familier qui domine les conversations informelles, les réseaux sociaux, les podcasts et une grande partie du contenu YouTube. Les deux diffèrent par les pronoms (saya vs gua), les suffixes morphologiques (-kan vs -in), les contractions (sudah vs udah) et les particules modales (dong/sih/deh/lah/kok) qui ajustent le ton d'une phrase sans en changer le contenu propositionnel. Pour la transcription, cela signifie qu'un extrait d'actualité donnera généralement un résultat plus propre qu'un vlog décontracté filmé dans le même studio.
Sources
- Deepgram : Nova-3 s'étend à l'indonésien (janvier 2026)
- Deepgram : améliorations WER de Nova-3 Multilingual (mars 2026)
- Vue d'ensemble des modèles et langues Deepgram
- Wikipédia : Réforme orthographique indo-malaisienne de 1972
- Wikipédia : Comparaison de l'indonésien et du malais standard
- Wikipédia : Bahasa gaul
- Arxiv : Améliorer l'ASR indonésien – Évaluation de modèles multilingues avec diverses variabilités de parole (2024)
- Tarifs Sonix
- Tarifs Happy Scribe
- Page de transcription indonésienne de Happy Scribe
- Tarifs Otter.ai
- Langues prises en charge par AssemblyAI
- Liste des langues d'OpenAI Whisper
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.