
Leitfaden zur koreanischen Transkription: Hangul, Höflichkeitsstufen, Konglish
Summarize this article with:
Die Kurzfassung
Für Standard-Seoul-Koreanisch liefern sowohl Deepgram Nova-3 als auch Whisper Large-v3 präzise Hangul-Transkripte mit korrekten Verbendungen auf den jeweiligen Sprachstufen. Bei Jeju-Dialekt oder dialektlastigen Inhalten bewältigen nur spezialisierte koreanisch-nativen Engines diese Lücke gut. Wenn Sie ein sauberes Transkript ohne Meeting-Bot oder Konto-Einrichtung benötigen, deckt ConvertAudioToText Koreanisch mit Sprecher-Labels ab; ein kostenloses Konto enthält 10 Transkriptionsminuten, die einmalig bei der Registrierung vergeben werden, und den SRT-Export gibt es mit einem bezahlten Plan oder der 7-tägigen Testphase.

Warum die koreanische Transkription eine eigene Klasse von Problemen hat
Koreanisch ist für KI nicht wegen seines Alphabets schwierig. Hangul ist eines der phonemisch regelmäßigsten Schriftsysteme der Welt: Jeder Silbenblock kodiert Konsonanten und Vokale in einem festen Muster, und es gibt keine Zeichenmehrdeutigkeit der Art, die die chinesische Transkription zu einem völlig anderen Problem macht.
Die eigentliche Schwierigkeit ist struktureller und sozialer Natur:
Die koreanische Leerzeichen-Setzung ist optional und umstritten. Der Fachbegriff lautet 띄어쓰기 (tteui-eo-sseu-gi), und die Regeln sind selbst unter Muttersprachlern wirklich mehrdeutig. Hilfsverben können zusammen oder getrennt geschrieben werden; gebundene Substantive werden offiziell getrennt geschrieben, aber häufig zusammengeschrieben. In der gesprochenen Sprache gibt es keine Pausen, die diese Grenzen markieren, sodass eine KI-Engine entscheiden muss, wo sie agglutinierende Verbketten trennt. Deepgram hat die Leerzeichen-Setzung bei koreanischen Komposita als eine der „Kernherausforderungen“ dokumentiert, die in Nova-3 adressiert wurden. Whispers Evaluationspapieren verwenden für Koreanisch die Zeichenerkennungsfehlerrate (CER) statt der Worterkennungsfehlerrate (WER), gerade weil die Wortsegmentierung variabel ist. Eine Engine, die „받아도 돼요“ zu „받아도돼요“ zusammenzieht, erzeugt eine andere grammatische Struktur – nicht bloß eine Formatierungsvorliebe.
Koreanische Verben kodieren soziale Hierarchie. Nur die richtigen Wörter zu treffen reicht nicht aus. Ein Transkript, das alle auf 해요체 normalisiert, obwohl ein Sprecher 하십시오체 verwendete und ein anderer 해체, hat Informationen verloren, anhand derer ein koreanischer Leser die Beziehung zwischen den Teilnehmern rekonstruieren würde. Siehe den Abschnitt zu Höflichkeitsstufen unten.
Lehnwörter existieren gleichzeitig in zwei Schriften. Ein koreanisches Geschäftsgespräch mischt im Hangul wiedergegebenes Englisch (핸드폰, 카페, 아파트) mit lateinischen Akronymen und Markennamen (PM, OKR, KPI, ChatGPT). Ein korrektes Transkript muss jedes Element in die richtige Schrift setzen, und die Zuordnung lässt sich nicht allein aus der Phonetik vorhersagen: 컴퓨터 (Computer) kommt im Hangul zurück, während „IT“ in lateinischer Schrift bleibt – weil Koreaner sie genau so schreiben.
Das Höflichkeitsproblem und warum es für Transkripte wichtig ist
Koreanisch hat ein System von Sprachstufen namens 존댓말 (jondaemal), das sich vom höflichen Vokabular unterscheidet. Sprachstufen sind in Verbendungen kodiert und signalisieren die Beziehung des Sprechers zum Zuhörer, nicht zum Subjekt. Ein koreanisches Transkript muss die tatsächlichen Verbendungen des Sprechers wiedergeben.
Die drei Stufen, die in der modernen gesprochenen Sprache noch verbreitet sind:
- 하십시오체 (hasipsio-che): Formell-höflich. Standard in Nachrichtensendungen, Vorstellungsgesprächen, beim Militär, in Geschäftspräsentationen, im Dienstleistungssektor und bei ersten Treffen mit deutlich ranghöheren Personen. Verbendung: -(으)십시오, -(으)ㅂ니다.
- 해요체 (haeyo-che): Umgangssprachlich-höflich. Der Standard für alltägliche Gespräche unter Erwachsenen, die meisten Kundeninteraktionen und Content-Creator, die ihr Publikum ansprechen.
- 해체 (hae-che): Informell. Verwendet mit engen Freunden, Gleichaltrigen und von Erwachsenen gegenüber Kindern.
Die übrigen Formen – 하소서체 (archaisch-hochformell), 하게체 (halbformell, heute selten bei jüngeren Sprechern) und 해라체 (schlicht/erzählend, häufig in schriftlicher Erzählung) – kommen seltener in der Sprache vor, tragen aber weiterhin Bedeutung.
Warum das für die Transkriptionsgenauigkeit zählt: Ein Transkript einer Geschäftssitzung, das 하십시오체-Endungen durchgängig korrekt wiedergibt, verrät einem koreanischen Leser, wer mit wem sprach, in welcher Funktion und auf welcher Formalitätsebene. Ein Transkript, das alles auf eine einzige Stufe glättet, verliert genau das. Whisper Large-v3 bewahrt die Sprachstufen, weil es transkribiert, was gesagt wurde, statt das Register zu normalisieren. Deepgram Nova-3, speziell auf koreanischen Broadcast- und Geschäftsdaten trainiert, spiegelt ebenso die tatsächlichen Endungen des Sprechers wider.
Engine-Support-Stufen: Was verifiziert ist
Diese Stufen spiegeln wider, was Anbieter dokumentiert haben bzw. was unabhängige Bewertungen veröffentlicht haben. Ich habe keine Genauigkeitsprozentsätze erfunden.
Stufe 1: Starke Koreanisch-Unterstützung, dokumentierte Verbesserungen
- Deepgram Nova-3 (ko / ko-KR): Deepgram hat einen Blogbeitrag veröffentlicht, der eine „bis zu 27 % geringere WER“ gegenüber Nova-2 für Koreanisch belegt und dabei die Mehrdeutigkeit der Hangul-Leerzeichen-Setzung, die schnelle Konjugation und die Silbenblöcke als die konkret adressierten Herausforderungen nennt. Keyterm Prompting ist für Koreanisch verfügbar, was bei Markennamen und Fachvokabular nützlich ist. Nova-3 und Nova-2 unterstützen beide die Sprachcodes
koundko-KR. - OpenAI Whisper Large-v3: Koreanisch gehört zu den besser vertretenen Sprachen in Whispers Trainingsdaten, und OpenAI nutzt für das Benchmarking von Koreanisch CER (nicht WER). Das large-v3-Release zeigte über alle unterstützten Sprachen hinweg eine Fehlerreduktion von 10–20 % gegenüber large-v2. Wenn Sie zwischen der gehosteten API und dem Self-Hosting abwägen, sehen Sie sich die Aufschlüsselung der Whisper-API-Preise an.
Stufe 2: Gute Genauigkeit, begrenzte koreaspezifische Dokumentation
- AssemblyAI Universal-2: AssemblyAI listet Koreanisch in seiner Dokumentation unter der Kategorie „Gute Genauigkeit“, definiert als WER von mehr als 10 % bis 25 %. Diarisierung und automatische Kapitel funktionieren für Koreanisch; die auf LeMUR basierende Zusammenfassung hängt bei Koreanisch vom zugrunde liegenden LLM ab, nicht von der STT-Schicht. Echtzeit-Streaming für Koreanisch wird derzeit nicht unterstützt.
- Google Cloud Speech-to-Text (Chirp-Modell): Koreanisch gehört zu den über 125 unterstützten Sprachen. Chirp wird pro Sekunde abgerechnet, in 15-Sekunden-Schritten, mit einem kostenlosen monatlichen Kontingent von 60 Minuten. Für Koreanisch auf Chirp liegt kein veröffentlichter WER vor. Lesen Sie die vollständige Aufschlüsselung der Google-Cloud-STT-Preise, bevor Sie sich auf Volumen festlegen.
Stufe 3: Koreanisch-nativ, Korea-Infrastruktur
- Naver Clova Speech: Navers Modell wird ausschließlich auf koreanischen Daten trainiert, was ihm bei regionalen Dialekten und umgangssprachlicher Rede einen Vorteil verschafft. Die Abrechnung erfolgt pro Sekunde und ist in Won ausgewiesen (im Preiskalkulator der Naver Cloud Platform verfügbar). Der Dienst ist in den Regionen Korea, USA, Singapur, Japan und Deutschland verfügbar. Für mehrsprachige koreanisch-englische Inhalte ist Clova eine schwächere Wahl als die Engines der Stufe 1.
Für Koreanisch nicht verfügbar:
- Otter.ai: Unterstützt offiziell Englisch, Spanisch, Französisch, Deutsch, Japanisch und Chinesisch. Koreanisch ist nicht gelistet. Die Genauigkeitswerte älterer Vergleichstabellen, die Otter einen koreanischen WER-Wert zuweisen, sind nicht überprüfbar und sollten ignoriert werden.
Reine Hangul-Ausgabe und die Hanja-Ausnahme
Das moderne koreanische Schriftbild besteht fast vollständig aus Hangul. Hanja (chinesische Schriftzeichen, die historisch für koreanischen Wortschatz verwendet wurden) tauchen gelegentlich in formellen Rechtstexten, Schlagzeilen älterer Zeitungen und akademischen Zitaten auf, aber fast nie in der gesprochenen Sprache. Ein korrektes koreanisches Transkript liefert eine reine Hangul-Ausgabe.
Bezieht sich ein Sprecher auf ein Wort hanja-Ursprungs (fast der gesamte sino-koreanische Wortschatz), schreibt das Transkript es in phonetischer Hangul-Form. Das entspricht der Erwartung eines koreanischen Muttersprachlers: 대학교 (Universität), nicht 大學校 – es sei denn, der Kontext ist ein historisches Dokument.
Die moderne koreanische Interpunktion folgt westlichen Konventionen: Ein Punkt ist ein Punkt (.), ein Komma ein Komma (,). Ältere redaktionelle Stile verwendeten japanisch-stämmige Zeichen in voller Breite (。、), doch diese erscheinen in zeitgenössischen Transkripten von KI-Engines nicht.
Konglish und Code-Switching: Wie Engines damit umgehen sollten
Koreanische Geschäfts- und Tech-Sprache ist stark mit Englisch durchsetzt. Das ist kein informeller Slang, sondern das Standardregister des koreanischen Berufslebens. Ein Meeting bei einem koreanischen Softwareunternehmen ergibt routinemäßig Sätze wie „저는 PM이에요, OKR 설정해야 돼요“ oder „이 API 문서 업데이트해줘요.“
Die Regel dafür, welche Schrift jedes Element erhält:
| Typ | Beispiel (gesprochen) | Erwartetes Transkript |
|---|---|---|
| Vollständig integriertes Lehnwort | haendeupon | 핸드폰 |
| Integriert, aber gekürzt | kape (Café) | 카페 |
| Englisches Akronym, bleibt lateinisch | O-K-R | OKR |
| Englischer Markenname | ChatGPT | ChatGPT |
| Englischer Fachbegriff, oft Hangul | seobeo | 서버 |
| Gemischtes Kompositum | UI/UX | UI/UX oder 유아이/유엑스 (engine-abhängig) |
Whisper Large-v3 und Deepgram Nova-3 beherrschen dieses Code-Switching bei gängigen Lehnwörtern beide korrekt. Die Grenzfälle sind Konglish-Wörter, die kein Standardenglisch sind: 아이쇼핑 (Schaufensterbummel, von „eye shopping“), 핸드폰 (Handy, von „hand phone“), 아파트 (Wohnung, gekürzt). Eine gepflegte Keyterm-Liste deckt die ungewöhnlichen Fälle ab.
Einen tieferen Blick darauf, wie Code-Switching die Engine-Genauigkeit belastet, bietet wie man mehrsprachiges Code-Switching in Transkripten behebt.
Regionale Dialekte: Seoul als Referenzpunkt, Jeju als Ausreißer
Alle großen KI-Engines messen die koreanische Genauigkeit am Standardkoreanisch von Seoul (서울말) – dem Dialekt der Rundfunkmedien, der nationalen Bildung und der meisten Online-Inhalte.
Regionale Dialekte bringen unterschiedlich starke Abweichungen mit sich:
- Gyeongsang (경상도, einschließlich Busan, Daegu): Ausgeprägter Tonhöhenakzent, andere Verbendungen. Für Standard-Engines messbar schwieriger als Seoul-Koreanisch.
- Jeolla (전라도, einschließlich Gwangju): Andere Intonationsmuster und teils eigener Wortschatz. Von den meisten Engines erkannt, mit gewissem Genauigkeitsverlust.
- Jeju (제주): Sprachlich eigenständig genug, dass die UNESCO es als bedrohte Sprache getrennt vom eigentlichen Koreanischen klassifiziert hat. Es bewahrt mittelkoreanische Merkmale, die dem Standardkoreanischen fehlen, und ist für viele Festland-Koreaner gegenseitig unverständlich. Allgemeine KI-Engines scheitern bei Jeju erheblich. Nur spezialisierte Systeme mit eigenen Jeju-Trainingsdaten, wie PersonaAI (das rund ein Viertel seines 50.000-Stunden-Koreanisch-Trainingskorpus auf Dialektdaten verwendete), bewältigen Jeju mit relevanter Genauigkeit.
Wenn Ihre Inhalte Jeju-Sprecher enthalten, stimmen Sie die Erwartungen entsprechend ab und prüfen Sie, ob ein menschlicher Nachbearbeiter erforderlich ist.
Sprecherdiarisierung für koreanische Inhalte
Formelle koreanische Rede ist klar in Sprecherwechseln strukturiert. Entspanntes Koreanisch (Panels in Variety-Shows, Gruppen-Podcasts) weist erhebliche Überlappungen und Durcheinandersprechen auf.
Bei der Sprecherdiarisierung zählen die Bedingungen mehr als die Sprache:
- Formelles Interview mit zwei Sprechern, aufgenommen über getrennte Mikrofone: Diarisierung funktioniert zuverlässig.
- Geschäftstreffen mit vier bis sechs Personen, Aufnahme in einem einzigen Raum: anspruchsvoller, besonders wenn sich Sprecher gegenseitig mit kurzen Bestätigungen das Wort überlassen (네, 맞아요, 그렇죠).
- Variety-Show- oder Panel-Format: Simultansprechen und überlappende Reaktionen senken die Genauigkeit bei jeder Engine.
Die Aufnahme pro Kanal (jeder Sprecher auf einer eigenen Spur) ist die mit Abstand wirksamste Einzelmaßnahme für die Diarisierungsqualität – unabhängig von der Engine-Wahl.
Praktischer Workflow für koreanische Inhalte
Podcasts und YouTube: Laden Sie die Audio- oder Videodatei hoch, und stellen Sie die Sprache explizit auf Koreanisch ein, statt sich auf die automatische Erkennung zu verlassen (Auto-Erkennung ist etwas langsamer und kann stark konglisch geprägtes Englisch mit reinem Englisch verwechseln). Aktivieren Sie Sprecher-Labels für Shows mit mehreren Moderatoren. Exportieren Sie koreanisches SRT für Untertiteldateien. Zur Funktionsweise der Untertitelgenerierung siehe das Untertitel-Generator-Tool.
Geschäftstreffen: Wenn Ihre Plattform eine Audio- oder Videodatei exportiert, liefert jede der Stufe-1-Engines ein brauchbares koreanisches Transkript. Beachten Sie, dass Meeting-Bot-Tools (Otter, Fireflies) Koreanisch seit Mitte 2026 nicht unterstützen – die dateibasierte Transkription ist daher der verlässliche Weg.
Forschungsinterviews: Koreanische qualitative Forschung erzeugt Transkripte, bei denen die Genauigkeit der Sprachstufen erhalten bleiben muss. Ein Glossar mit Eigennamen (koreanische Namen haben mehrere mögliche Hangul-Schreibweisen; 이 kann je nach Name 이, 리 oder 리 sein) verhindert die häufigsten Fehl erkennungen.
YouTube-Inhalte: Der YouTube-Transkript-Generator akzeptiert koreanischsprachige Videos direkt.
Meine Einschätzung: Bei den meisten koreanischen Inhalten ist die Wahl zwischen Whisper Large-v3 und Deepgram Nova-3 in der Praxis marginal. Deepgrams dokumentierte koreanische Verbesserungen und sein Keyterm Prompting sind bei fachdomänenschweren Inhalten (Recht, Medizin, Technik) relevant. Whisper ist die bessere Wahl, wenn Sie eine selbst gehostete oder kostenkontrollierte Option benötigen. Naver Clova ist die richtige Entscheidung, wenn Sie ein Produkt für den koreanischen Markt ausschließlich auf koreanischen Inhalten aufbauen und die engste Dialektabdeckung wollen.
Wenn Sie einfach nur ein sauberes koreanisches Transkript brauchen, ohne eine API zu konfigurieren oder Infrastruktur bereitzustellen, verarbeitet ConvertAudioToText Koreanisch mit Sprecher-Labels sowie SRT/VTT-Export in bezahlten Plänen – dazu gibt es 10 kostenlose Transkriptionsminuten, einmalig bei der Registrierung vergeben, für den Einstieg. Der bezahlte Pro-Plan kostet 9,99 $ pro Monat für unbegrenzte Transkription in allen unterstützten Sprachen.
Tipps für bessere Ergebnisse bei der koreanischen Transkription
- Legen Sie den Sprachcode explizit fest.
kooderko-KRerspart den Engines die Inferenzzeit für die Spracherkennung. - Stellen Sie eine Keyterm-Liste für koreanische Eigennamen bereit. Koreanische Namen wie 이준호, 박민서 und 김지원 haben jeweils plausible alternative Hangul-Schreibweisen; ihre Verankerung verhindert Vertauschungsfehler.
- Nehmen Sie bei Marken- und Produktnamen sowohl die koreanische Hangul-Form als auch jede lateinschriftliche Variante auf, die der Sprecher austauschbar verwenden könnte.
- Nehmen Sie in Umgebungen mit wenig Hintergrundgeräusch auf. Koreanische Zischlaute (ㅅ, ㅆ, ㅈ, ㅊ) verlieren in Umgebungsgeräuschen an Kontur und verursachen die häufigsten Fehl erkennungsfehler.
- Stimmen Sie bei Jeju-Sprechern die Erwartungen vor der Transkription ab. Beschaffen Sie entweder eine spezialisierte Engine oder planen Sie Budget für menschliche Nachbearbeitung ein.
- Gehen Sie nicht davon aus, dass ein Transkript, dessen englische Segmente (bei den Lehnwörtern) korrekt gelesen werden, insgesamt korrekt ist. Prüfen Sie die Hangul-Segmente separat nach.
Einen Vergleich, wie Koreanisch im Vergleich zu ähnlich schweren Sprachen abschneidet, finden Sie unter warum KI bei ressourcenarmen Sprachen Schwierigkeiten hat; für eine CJK-Parallele siehe den japanischen Transkriptionsleitfaden.
FAQ
Unterstützt Whisper Koreanisch gut?
Ja. Koreanisch gehört zu den besser vertretenen Sprachen in den Trainingsdaten von Whisper Large-v3. OpenAI benchmarkt Koreanisch mit der Zeichenerkennungsfehlerrate (CER) statt der Worterkennungsfehlerrate (WER), weil die Worttrennung durch Leerzeichen im Koreanischen optional ist, wodurch WER ein unzuverlässiger Messwert ist. Das large-v3-Modell zeigt über alle unterstützten Sprachen hinweg eine Fehlerreduktion von 10–20 % gegenüber large-v2. Für Standard-Seoul-Koreanisch unter klaren Audiobedingungen arbeitet Whisper zuverlässig. Regionale Dialekte, insbesondere Jeju, sind deutlich schwieriger.
Unterstützt Otter.ai die koreanische Transkription?
Nein. Seit Mitte 2026 unterstützt Otter offiziell Englisch, Spanisch, Französisch, Deutsch, Japanisch und Chinesisch. Koreanisch steht nicht auf dieser Liste. Otters Meeting-Bot-Architektur bietet zudem keine koreanische KI-Zusammenfassung. Wenn Ihre Meetings auf Koreanisch stattfinden, ist die dateibasierte Transkription mit Deepgram oder Whisper derzeit der gangbare Weg.
Wie sollte ein koreanisches KI-Transkript mit Höflichkeitsstufen umgehen?
Ein korrektes Transkript gibt die tatsächlichen Verbendungen des Sprechers wieder, statt auf ein einzelnes Register zu normalisieren. 하십시오체-Endungen (-(으)ㅂ니다, -(으)십시오) im Audio müssen auch als 하십시오체 im Text erscheinen. Das ist wichtig, weil koreanische Leser anhand dieser Endungen auf die Beziehung zwischen den Sprechern schließen. Sowohl Whisper als auch Deepgram bewahren die Sprachstufen korrekt, weil sie transkribieren, was gesagt wurde – nicht eine normalisierte Form davon.
Was passiert mit englischen Lehnwörtern in einem koreanischen Transkript?
Das hängt davon ab, ob es sich um ein vollständig integriertes koreanisches Lehnwort oder einen lebendigen englischen Begriff handelt. Integrierte Lehnwörter wie 핸드폰 (haendeupon, Handy) und 카페 (kape, Café) kehren im Hangul zurück, weil Koreaner sie genau so schreiben. Lateinische Akronyme wie OKR, PM und KPI bleiben in
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.