
Guide de transcription du coréen : Hangul, honorifiques et Konglish
Summarize this article with:
L'essentiel en bref
Pour le coréen standard de Séoul, Deepgram Nova-3 et Whisper Large-v3 produisent tous deux des transcriptions Hangul précises avec des terminaisons verbales respectant les niveaux de parole. Pour le dialecte de Jeju ou les contenus riches en dialecte, seuls des moteurs spécialisés natifs coréens comblent bien cet écart. Si vous avez besoin d'une transcription propre sans bot de réunion ni création de compte, ConvertAudioToText prend en charge le coréen avec étiquettes de locuteurs ; un compte gratuit inclut 10 minutes de transcription offertes une seule fois à l'inscription, et l'export SRT est inclus dans l'offre payante ou l'essai de 7 jours.

Pourquoi la transcription du coréen soulève sa propre catégorie de problèmes
Le coréen n'est pas difficile pour l'IA à cause de son alphabet. Le Hangul est l'un des systèmes d'écriture les plus réguliers phonémiquement au monde : chaque bloc syllabique encode consonnes et voyelles selon un schéma fixe, et il n'existe aucune ambiguïté de caractères du type qui fait de la transcription du chinois un problème entièrement différent.
La vraie difficulté est structurelle et sociale :
L'espacement coréen est facultatif et contesté. Le terme formel est 띄어쓰기 (tteui-eo-sseu-gi), et les règles sont réellement ambiguës, y compris chez les locuteurs natifs. Les verbes auxiliaires peuvent s'écrire soudés ou détachés ; les noms dépendants s'écrivent officiellement séparément mais sont couramment soudés. À l'oral, aucune pause ne marque ces frontières : un moteur IA doit donc décider où scinder les chaînes verbales agglutinantes. Deepgram a documenté l'espacement des noms composés coréens comme l'un des « défis majeurs » traités dans Nova-3. Les articles d'évaluation de Whisper utilisent pour le coréen le taux d'erreur sur les caractères (CER) plutôt que le taux d'erreur sur les mots (WER), précisément parce que la segmentation en mots est variable. Un moteur qui fusionne « 받아도 돼요 » en « 받아도돼요 » produit une structure grammaticale différente, pas seulement une préférence de mise en forme.
Les verbes coréens encodent la hiérarchie sociale. Trouver les bons mots ne suffit pas. Une transcription qui normalise tout le monde en 해요체 alors qu'un locuteur a employé le 하십시오체 et un autre le 해체 a perdu une information qu'un lecteur coréen utiliserait pour reconstituer la relation entre les participants. Voir la section sur les honorifiques ci-dessous.
Les mots empruntés coexistent dans deux écritures simultanément. Une conversation professionnelle coréenne mêle l'anglais rendu en Hangul (핸드폰, 카페, 아파트) aux acronymes latins et noms de marque (PM, OKR, KPI, ChatGPT). Une transcription correcte doit placer chaque élément dans la bonne écriture, et cette correspondance ne se déduit pas de la phonétique seule : 컴퓨터 (computer) ressort en Hangul, tandis que « IT » reste en caractères latins, car c'est ainsi que les Coréens les écrivent.
Le problème des honorifiques et pourquoi il importe pour les transcriptions
Le coréen possède un système de niveaux de parole appelé 존댓말 (jondaemal), distinct du vocabulaire honorifique. Les niveaux de parole s'encodent dans les terminaisons verbales et signalent la relation du locuteur à l'interlocuteur, non au sujet. Une transcription coréenne doit reproduire les terminaisons verbales réellement employées par le locuteur.
Les trois niveaux encore courants dans la parole moderne :
- 하십시오체 (hasipsio-che) : poli formel. Standard dans les journaux télévisés, les entretiens d'embauche, l'armée, les présentations professionnelles, le secteur des services et les premières rencontres avec des personnes nettement supérieures. Terminaison verbale : -(으)십시오, -(으)ㅂ니다.
- 해요체 (haeyo-che) : poli courant. Le registre par défaut de la conversation quotidienne adulte, de la plupart des interactions avec la clientèle et des créateurs de contenu s'adressant à leur audience.
- 해체 (hae-che) : familier. Employé avec les amis proches, les pairs du même âge, et par les adultes s'adressant à des enfants.
Les autres formes, 하소서체 (formel élevé archaïque), 하게체 (semi-formel, désormais rare chez les jeunes locuteurs) et 해라체 (neutre/narratif, courant dans la narration écrite), apparaissent moins souvent à l'oral mais conservent leur sens.
Pourquoi cela compte pour l'exactitude de la transcription : une transcription de réunion d'affaires qui restitue systématiquement les terminaisons 하십시오체 indique au lecteur coréen qui parlait à qui, en quelle qualité et à quel niveau de formalité. Une transcription aplatie sur un seul niveau perd cette information. Whisper Large-v3 préserve les niveaux de parole parce qu'il transcrit ce qui a été dit plutôt que de normaliser le registre. Deepgram Nova-3, entraîné spécifiquement sur des données coréennes de diffusion et d'affaires, reflète de même les terminaisons réelles du locuteur.
Niveaux de prise en charge par les moteurs : ce qui est vérifié
Ces niveaux reflètent ce que les fournisseurs ont documenté ou ce que des évaluations indépendantes ont publié. Je n'ai inventé aucun pourcentage de précision.
Niveau 1 : forte prise en charge du coréen, améliorations documentées
- Deepgram Nova-3 (ko / ko-KR) : Deepgram a publié un article de blog documentant une « réduction du WER allant jusqu'à 27 % » par rapport à Nova-2 pour le coréen, citant l'ambiguïté de l'espacement Hangul, la conjugaison rapide et les blocs syllabiques comme défis spécifiques traités. Keyterm Prompting est disponible pour le coréen, ce qui est utile pour les noms de marque et le vocabulaire technique. Nova-3 et Nova-2 prennent tous deux en charge les codes de langue
koetko-KR. - OpenAI Whisper Large-v3 : le coréen figure parmi les langues les mieux représentées dans les données d'entraînement de Whisper, et OpenAI utilise le CER (et non le WER) pour ses benchmarks coréens. La sortie de large-v3 a montré une réduction d'erreur de 10 à 20 % par rapport à large-v2 sur l'ensemble des langues prises en charge. Consultez le décryptage des tarifs de l'API Whisper si vous hésitez entre l'API hébergée et l'auto-hébergement.
Niveau 2 : bonne précision, documentation propre au coréen limitée
- AssemblyAI Universal-2 : la documentation d'AssemblyAI classe le coréen dans la bande « Bonne précision », définie comme un WER supérieur à 10 % et allant jusqu'à 25 %. La diarisation et les chapitres automatiques fonctionnent pour le coréen ; le résumé via LeMUR en coréen dépend du LLM sous-jacent, pas de la couche STT. Le streaming temps réel pour le coréen n'est pas pris en charge actuellement.
- Google Cloud Speech-to-Text (modèle Chirp) : le coréen figure parmi les plus de 125 langues prises en charge. La tarification de Chirp est à la seconde, facturée par tranches de 15 secondes, avec un quota mensuel gratuit de 60 minutes. Aucun WER publié pour le coréen sur Chirp. Lisez l'analyse complète des tarifs de Google Cloud STT avant de vous engager sur de gros volumes.
Niveau 3 : moteurs natifs coréens, infrastructure coréenne
- Naver Clova Speech : le modèle de Naver s'entraîne exclusivement sur des données coréennes, ce qui lui donne un avantage sur les dialectes régionaux et la langue parlée familière. La tarification est à la seconde, libellée en wons (consultable sur le calculateur de prix de Naver Cloud Platform). Le service est disponible dans les régions Corée, États-Unis, Singapour, Japon et Allemagne. Pour du contenu multilingue coréen-anglais, Clova est un choix moins solide que les moteurs de niveau 1.
Indisponible pour le coréen :
- Otter.ai : prend officiellement en charge l'anglais, l'espagnol, le français, l'allemand, le japonais et le chinois. Le coréen n'y figure pas. Les chiffres de précision des anciens tableaux comparatifs attribuant à Otter un score WER en coréen sont invérifiables et doivent être ignorés.
Sortie exclusivement en Hangul et l'exception Hanja
L'écriture coréenne moderne est presque entièrement en Hangul. Les Hanja (caractères chinois historiquement utilisés pour le vocabulaire coréen) apparaissent occasionnellement dans les textes juridiques formels, les titres de presse d'anciennes publications et les citations académiques, mais presque jamais à l'oral. Une transcription coréenne correcte produit une sortie en Hangul.
Si un locuteur mentionne un mot d'origine Hanja (ce qui concerne presque tout le vocabulaire sino-coréen), la transcription l'écrit sous sa forme phonétique Hangul. Cela correspond à ce qu'un lecteur coréen natif s'attend à voir : 대학교 (université), et non 大學校, sauf si le contexte est un document historique.
La ponctuation coréenne moderne suit les conventions occidentales : un point est un point (.), une virgule est une virgule (,). Les styles éditoriaux anciens utilisaient une ponctuation pleine chasse d'origine japonaise (。、), mais celle-ci n'apparaît pas dans les transcriptions contemporaines produites par les moteurs IA.
Konglish et alternance codique : comment les moteurs devraient la gérer
Le discours professionnel et technologique coréen est abondamment entrecoupé d'anglais. Ce n'est pas de l'argot informel, mais le registre standard de la vie professionnelle coréenne. Une réunion dans une entreprise logicielle coréenne produit régulièrement des phrases comme « 저는 PM이에요, OKR 설정해야 돼요 » ou « 이 API 문서 업데이트해줘요. »
La règle déterminant l'écriture de chaque élément :
| Type | Exemple (oral) | Transcription attendue |
|---|---|---|
| Emprunt pleinement intégré | haendeupon | 핸드폰 |
| Emprunt intégré mais raccourci | kape (café) | 카페 |
| Acronyme anglais, reste en latin | O-K-R | OKR |
| Nom de marque anglaise | ChatGPT | ChatGPT |
| Terme technique anglais, souvent en Hangul | seobeo | 서버 |
| Mot composé mixte | UI/UX | UI/UX ou 유아이/유엑스 (selon le moteur) |
Whisper Large-v3 et Deepgram Nova-3 gèrent tous deux correctement cette alternance codique pour les emprunts courants. Les cas limites sont les mots Konglish qui ne sont pas de l'anglais standard : 아이쇼핑 (lèche-vitrine, de « eye shopping »), 핸드폰 (téléphone portable, de « hand phone »), 아파트 (appartement, forme raccourcie). Une liste de termes clés bien tenue couvre les cas inhabituels.
Pour un examen approfondi de la façon dont l'alternance codique met à mal la précision des moteurs, consultez comment corriger l'alternance codique multilingue dans les transcriptions.
Dialectes régionaux : Séoul comme référence, Jeju comme cas à part
Tous les grands moteurs IA évaluent la précision du coréen par rapport au coréen standard de Séoul (서울말), dialecte des médias audiovisuels, de l'éducation nationale et de la plupart des contenus en ligne.
Les dialectes régionaux introduisent des degrés de divergence variables :
- Gyeongsang (경상도, inclut Busan et Daegu) : accent mélodique distinctif, terminaisons verbales différentes. Mesurablement plus difficile que le coréen de Séoul pour les moteurs standards.
- Jeolla (전라도, inclut Gwangju) : schémas d'intonation différents et vocabulaire partiellement distinct. Reconnu par la plupart des moteurs, avec une certaine baisse de précision.
- Jeju (제주) : linguistiquement assez distinct pour que l'UNESCO l'ait classé comme langue menacée séparée du coréen proprement dit. Il conserve des traits du coréen médiéval absents du coréen standard et reste mutuellement incompréhensible pour de nombreux Coréens du continent. Les moteurs IA généralistes échouent largement sur le jeju. Seuls les systèmes spécialisés dotés de données d'entraînement dédiées au jeju, comme PersonaAI (qui a consacré environ un quart de son corpus d'entraînement coréen de 50 000 heures aux données dialectales), traitent le jeju avec une précision significative.
Si votre contenu inclut des locuteurs de Jeju, ajustez vos attentes en conséquence et demandez-vous si un post-éditeur humain est nécessaire.
Diarisation des locuteurs pour le contenu coréen
Le discours formel coréen est structuré en tours de parole. Le coréen décontracté (panels d'émissions de divertissement, podcasts collectifs) présente de nombreux chevauchements et dialogues croisés.
Pour la diarisation des locuteurs, les conditions comptent plus que la langue :
- Entretien formel à deux locuteurs enregistré sur micros séparés : la diarisation fonctionne de manière fiable.
- Réunion d'affaires de 4 à 6 personnes, enregistrement en salle unique : plus difficile, surtout quand les participants se renvoient la parole avec de brèves marques d'accord (네, 맞아요, 그렇죠).
- Format émission de divertissement ou panel : les dialogues croisés et les réactions superposées réduisent la précision sur n'importe quel moteur.
L'enregistrement par canal (chaque locuteur sur sa propre piste) est l'amélioration la plus efficace pour la qualité de la diarisation, quel que soit le moteur choisi.
Flux de travail pratique pour le contenu coréen
Podcasts et YouTube : importez le fichier audio ou vidéo, réglez explicitement la langue sur le coréen plutôt que de vous fier à la détection automatique (la détection auto est légèrement plus lente et peut confondre un contenu très chargé en Konglish avec de l'anglais). Activez les étiquettes de locuteurs pour les émissions à plusieurs animateurs. Exportez un SRT coréen pour vos fichiers de sous-titres. Pour la mécanique de génération de sous-titres, voir l'outil générateur de sous-titres.
Réunions d'affaires : si votre plateforme exporte un fichier audio ou vidéo, chacun des moteurs de niveau 1 produit une transcription coréenne exploitable. Notez que les outils de bot de réunion (Otter, Fireflies) ne prennent pas en charge le coréen à mi-2026 ; la transcription à partir de fichiers reste donc la voie fiable.
Entretiens de recherche : la recherche qualitative coréenne produit des transcriptions où la précision des niveaux de parole doit être préservée. Un glossaire des noms propres (les noms coréens admettent plusieurs orthographes Hangul possibles ; 이 peut correspondre à 이, 리 ou 리 selon les noms) permet d'éviter les erreurs de reconnaissance les plus fréquentes.
Contenus YouTube : le générateur de transcriptions YouTube accepte directement les vidéos en coréen.
Mon avis : pour la plupart des contenus coréens, le choix entre Whisper Large-v3 et Deepgram Nova-3 est marginal en pratique. Les améliorations coréennes documentées de Deepgram et son keyterm prompting ont du sens pour les contenus très spécialisés (juridique, médical, technique). Whisper est le meilleur choix quand vous avez besoin d'une option auto-hébergée ou maîtrisée en coûts. Naver Clova s'impose quand vous construisez un produit destiné au marché coréen sur du contenu exclusivement coréen et voulez la couverture dialectale la plus fine.
Si vous avez simplement besoin d'une transcription coréenne propre sans configurer d'API ni déployer d'infrastructure, ConvertAudioToText traite le coréen avec étiquettes de locuteurs et export SRT/VTT sur les offres payantes, avec 10 minutes de transcription gratuites, offertes une seule fois à l'inscription, pour démarrer. L'offre Pro payante coûte 9,99 $ par mois pour une transcription illimitée dans toutes les langues prises en charge.
Conseils pour de meilleurs résultats de transcription coréenne
- Définissez explicitement le code de langue.
koouko-KRévite aux moteurs de consacrer du temps d'inférence à la détection de langue. - Fournissez une liste de termes clés pour les noms propres coréens. Des noms comme 이준호, 박민서 et 김지원 admettent chacun des orthographes Hangul alternatives plausibles ; les ancrer évite les erreurs de substitution.
- Pour les noms de marques et de produits, incluez à la fois la forme Hangul coréenne et toute version en alphabet latin que le locuteur pourrait employer indifféremment.
- Enregistrez dans des environnements peu bruités. Les sifflantes coréennes (ㅅ, ㅆ, ㅈ, ㅊ) perdent leur netteté dans le bruit ambiant, ce qui génère les erreurs de reconnaissance les plus fréquentes.
- Pour les locuteurs de Jeju, calibrez les attentes avant la transcription. Trouvez soit un moteur spécialisé, soit budgétez une post-édition humaine.
- Ne supposez pas qu'une transcription dont les segments anglais (emprunts) se lisent correctement est exacte dans son ensemble. Vérifiez séparément les segments Hangul.
Pour comparer le coréen aux langues de difficulté similaire, consultez pourquoi l'IA peine avec les langues à faibles ressources et le guide de transcription du japonais pour un parallèle CJK.
FAQ
Whisper gère-t-il bien le coréen ?
Oui. Le coréen figure parmi les langues les mieux représentées dans les données d'entraînement de Whisper Large-v3. OpenAI évalue le coréen à l'aide du taux d'erreur sur les caractères (CER) plutôt que du taux d'erreur sur les mots (WER), car l'espacement des mots est facultatif en coréen, ce qui rend le WER peu fiable comme métrique. Le modèle large-v3 affiche une réduction d'erreur de 10 à 20 % par rapport à large-v2 sur l'ensemble des langues prises en charge. Pour un coréen standard de Séoul dans des conditions audio claires, Whisper est fiable. Les dialectes régionaux, en particulier le jeju, sont nettement plus difficiles.
Otter.ai prend-il en charge la transcription du coréen ?
Non. À mi-2026, Otter prend officiellement en charge l'anglais, l'espagnol, le français, l'allemand, le japonais et le chinois. Le coréen ne figure pas sur cette liste. L'architecture de bot de réunion d'Otter ne propose pas non plus de génération de résumés IA en coréen. Si vos réunions se déroulent en coréen, la transcription à partir de fichiers avec Deepgram ou Whisper constitue la voie actuelle.
Comment une transcription IA coréenne doit-elle gérer les niveaux de parole honorifiques ?
Une transcription correcte reproduit les terminaisons verbales réellement employées par le locuteur au lieu de tout normaliser vers un registre unique. Les terminaisons 하십시오체 (-(으)ㅂ니다, -(으)십시오) présentes dans l'audio doivent apparaître telles quelles dans le texte. C'est important parce que les lecteurs coréens s'appuient sur ces terminaisons pour déduire la relation entre les interlocuteurs. Whisper comme Deepgram préservent correctement les niveaux de parole, car ils transcrivent ce qui a été dit, et non une forme normalisée.
Que deviennent les emprunts à l'anglais dans une transcription coréenne ?
Tout dépend si le mot est un emprunt pleinement intégré au coréen ou un terme anglais vivant. Des emprunts intégrés comme 핸드폰 (haendeupon, téléphone portable) et 카페 (kape, café) ressortent en Hangul, car c'est ainsi que les Coréens les écrivent. Les acronymes en alphabet latin comme OKR, PM et KPI restent en caractères latins, conformément à l'usage coréen. Les noms de marques anglaises (ChatGPT, Google) restent en latin. La frontière entre ces catégories peut dépendre du moteur pour les termes peu courants, et c'est là qu'une liste de termes clés aide.
Le dialecte de Jeju n'est-il qu'un fort accent coréen ?
Non. Le jeju (제주어) est une variété coréenne divergente classée par l'UNESCO comme langue en danger critique d'extinction, et non comme un dialecte. Il conserve des traits du coréen médiéval absents du coréen moderne standard et reste partiellement ou totalement incompréhensible pour les Coréens du continent qui ne le connaissent pas. Les moteurs de reconnaissance vocale généralistes entraînés sur le coréen standard échouent largement sur le jeju. Seuls les moteurs disposant de données d'entraînement dédiées au jeju (comme le modèle natif coréen de PersonaAI, qui a consacré une part importante de son corpus de 50 000 heures aux parlers régionaux) produisent des transcriptions fiables. Prévoyez une relecture humaine si le contenu en jeju fait partie de votre flux de travail.
Sources
- Deepgram : « Deepgram élargit Nova-3 avec 11 nouvelles langues en Europe et en Asie », https://deepgram.com/learn/deepgram-expands-nova-3-with-11-new-languages-across-europe-and-asia
- Deepgram : Vue d'ensemble des modèles et des langues, https://developers.deepgram.com/docs/models-languages-overview
- Discussion de sortie d'OpenAI Whisper Large-v3, https://github.com/openai/whisper/discussions/1762
- AssemblyAI : Documentation des langues prises en charge, https://www.assemblyai.com/docs/supported-languages
- Page tarifaire d'Otter.ai, https://otter.ai/pricing
- Page tarifaire de Sonix, https://sonix.ai/pricing
- Naver Cloud Platform : Page produit CLOVA Speech, https://www.ncloud.com/product/aiService/clovaSpeech
- Google Cloud : Tarification Speech-to-Text, https://cloud.google.com/speech-to-text/pricing
- Modèle de reconnaissance du discours dialectal coréen de PersonaAI (The Asia Business Daily, 2026-01-15), https://www.asiae.co.kr/en/article/2026011515473523659
- Language Log : « L'importance problématique de l'espacement en coréen », https://languagelog.ldc.upenn.edu/nll/?p=44437
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.