Vietnamesische Transkription: Sechs Töne, echte Genauigkeit
transkriptionvietnamesischsprachen

Vietnamesische Transkription: Sechs Töne, echte Genauigkeit

BMMamane B. MoussaMay 26, 2026Updated July 2, 20269 min read

Summarize this article with:

TL;DR

Die Transkription von Vietnamesisch ist schwieriger als bei den meisten lateinschriftlichen Sprachen, weil die Orthografie sechs unterschiedliche Töne als gestapelte Diakritika kodiert und ein fehlendes Zeichen die Bedeutung eines Wortes vollständig verändert. Nordvietnamesisch (Hanoi-Standard) erhält die beste KI-Abdeckung; Zentralvietnamesisch (Hue, Da Nang) ist der schwierigste Dialekt für aktuelle Modelle. Deepgram Nova-2 und Nova-3, OpenAI Whisper und AssemblyAI Universal weisen alle Vietnamesisch-Unterstützung aus, doch die Genauigkeit bei Nicht-Nord-Audio liegt in einer niedrigeren Klasse als bei Französisch oder Spanisch. Wenn Sie saubere, diakritisierte vietnamesische Transkripte benötigen, wählen Sie ein Tool, das Vietnamesisch-Unterstützung explizit ausweist, setzen Sie den Sprachcode manuell und planen Sie bei Zentraldialekt-Audio mehr Nachbearbeitung ein als bei Hanoi-Standard-Aufnahmen.

Ein sauberes vietnamesisches Transkript steht und fällt mit den Tonzeichen. Lässt man auch nur ein Diakritikum weg, ändert sich das Wort: „ma" (Geist), „má" (Mutter), „mà" (aber), „mả" (Grab), „mã" (Pferd) und „mạ" (Reissetzling) sind sechs verschiedene vietnamesische Wörter, die allein durch das Tonzeichen auf derselben Silbe unterschieden werden. Das ist kein Formatierungsproblem, sondern ein Bedeutungsproblem – und genau deshalb ist die vietnamesische Transkription für KI-Systeme schwieriger, als sie auf den ersten Blick erscheint.

Vietnamesische Ausgabe mit vollständigen Ton-Diakritika
Vietnamesische Ausgabe mit vollständigen Ton-Diakritika

Dieser Leitfaden behandelt die Orthografie, die regionale Dialektlücke, welche Engines Vietnamesisch 2026 tatsächlich unterstützen und was Sie von jeder einzelnen erwarten können.

Das Sechs-Töne-System und warum Diakritika entscheidend sind

Vietnamesisch wird in chữ Quốc Ngữ geschrieben, einer auf dem Lateinischen basierenden Schrift, die Anfang des 20. Jahrhunderts finalisiert wurde. Sie bildet sechs phonemische Töne über ein System gestapelter Diakritika ab: Die unbezeichnete Silbe trägt den ebenen Ton (ngang), die anderen fünf Töne erhalten jeweils ein eigenes Zeichen.

Die sechs Töne:

  • ngang (eben, ohne Zeichen): „a" wie in ma (Geist)
  • sắc (hoch-steigend): „á" wie in má (Mutter)
  • huyền (tief-fallend): „à" wie in mà (aber)
  • hỏi (tauchend-steigend): „ả" wie in mả (Grab)
  • ngã (tauchend mit Glottisschlag): „ã" wie in mã (Pferd)
  • nặng (tief-fallend-schwer, Punkt darunter): „ạ" wie in mạ (Reissetzling)

Die Orthografie wird dichter, wenn Vokalqualitäts-Diakritika zusätzlich zu den Tonzeichen auftreten. Das Vietnamesische besitzt sieben modifizierte Vokale: ă, â, ê, ô, ơ, ư und đ. Ein Vokal wie „ă" kann jeden der sechs Töne tragen, was Formen wie ắ, ằ, ẳ, ẵ, ặ hervorbringt. Unicode speichert diese Zeichen in vorkomponierter Form gemäß Normalisierungsform C, was für die Transkriptionsausgabe relevant ist: Ein Tool, das zerlegte kombinierende Zeichen statt vorkomponierter Codepunkte liefert, erzeugt zwar optisch korrekt wirkenden Text, der jedoch in der weiteren Textverarbeitung Probleme bereiten kann.

Für die Transkription zählt vor allem eines: Tonzeichen sind keine optionale Interpunktion. Ein Transkript, das lateinische Buchstaben ohne Akzentzeichen zurückgibt, ist kein Entwurf – es ist der falsche Text.

Engine-Unterstützung: Dünner als bei Tier-1-Sprachen

Vietnamesisch wird von den großen Engines als unterstützte Sprache geführt:

  • OpenAI Whisper (einschließlich des Modells large-v3): führt Vietnamesisch (vi) in seiner Liste unterstützter Sprachen.
  • Deepgram Nova-2 und Nova-3: beide führen vi mit Unterstützung über Batch- und Streaming-Endpunkte hinweg.
  • AssemblyAI Universal: enthält Vietnamesisch, mit verfügbarer Sprecherdiarisierung.

Was „unterstützt" konkret bedeutet, variiert. Die Dokumentation von AssemblyAI stuft Vietnamesisch in die Bandbreite „Gute Genauigkeit" ein, definiert als Wortfehlerraten von über 10 % bis 25 %. Zum Vergleich: Englisch liegt bei unter 10 % WER. Vietnamesisch ist in puncto Trainingsdaten eine ressourcenärmere Sprache, und die ehrliche Erwartung lautet, dass die Genauigkeit bei Vietnamesisch deutlich niedriger ausfällt als bei Französisch, Spanisch oder Deutsch – insbesondere bei nicht standardkonformem Audio.

Otter.ai unterstützt kein Vietnamesisch. Die unterstützten Sprachen sind Stand 2026 Englisch, Spanisch, Französisch, Deutsch, Japanisch und Chinesisch (vereinfacht). Jedes Tool, das Otter-Genauigkeitswerte für Vietnamesisch angibt, erfindet schlicht Zahlen.

Für einen breiteren Blick darauf, wie die Engine-Unterstützung je nach Sprache variiert, lesen Sie warum KI bei ressourcenarmen Sprachen Schwierigkeiten hat.

Nord- vs. Süd- vs. Zentralvietnamesisch: Die Trainingsdatenlücke

Vietnam hat drei große regionale Dialektgruppen, und die KI-Abdeckung ist über diese hinweg uneinheitlich.

Nordvietnamesisch (Hanoi-Standard)

Dies ist der Dialekt, der Nachrichtenmedien, formale Bildung und staatliche Inhalte dominiert, und er macht den größten Teil der Trainingsdaten für die vietnamesische Transkription aus. Die sechs Töne sind im Nordvietnamesischen akustisch klar voneinander unterscheidbar. Die KI-Genauigkeit ist bei Audio im Hanoi-Standard am höchsten. Wenn Sie formale Broadcast-Inhalte von VTV oder formale Geschäftskommunikation von Sprechern aus Hanoi transkribieren, arbeiten Sie mit genau dem Dialekt, für den KI gemacht wurde.

Südvietnamesisch (Ho-Chi-Minh-Stadt, Mekong-Delta)

Der größte Unterschied des Südvietnamesischen ist die Verschmelzung von hỏi und ngã. Im Süden werden beide Töne als einfacher tief-tauchender Ton realisiert, ohne die glottale Unterbrechung, die ngã im Norden auszeichnet. Die Schriftsprache verlangt weiterhin beide Tonzeichen an ihren jeweiligen Positionen, doch die akustische Unterscheidung, die einer KI bei deren Zuordnung hilft, ist entfallen. Die Genauigkeit bei Südvietnamesisch fällt generell niedriger aus als bei Nordvietnamesisch, insbesondere bei der Unterscheidung von ả und ã. Untersuchungen zu vietnamesischen ASR-Datensätzen haben zudem dokumentiert, dass Südvietnamesisch in Trainingskorpora im Vergleich zu Nord- und sogar Zentralvietnamesisch unterrepräsentiert ist, was das Problem zusätzlich verschärft.

Zentralvietnamesisch (Hue, Da Nang, Quang Tri)

Zentralvietnamesisch ist der anspruchsvollste Dialekt für die heutigen KI-Systeme. Es bewahrt Konsonantenunterscheidungen, die das Nordvietnamesische verschmolzen hat, darunter tr/ch, s/x und d/gi/r. Seine Tonrealisierungen unterscheiden sich sowohl von den nord- als auch von den südlichen Standardformen, mit drastischen Tonhöhenabstürzen und behauchtem Stimmklang, die in dem Dialekt, aus dem KI primär gelernt hat, nicht vorkommen. Der Hue-Dialekt bewahrt darüber hinaus Begriffe, die in den meisten Trainingsdaten fehlen: „mô" für „đâu" (wo), „răng" für „sao" (warum). Planen Sie bei zentralvietnamesischem Audio mehr Nachbearbeitung ein als bei jeder anderen regionalen Variante.

Diakritika und orthografische Kodierung: Was schiefgehen kann

Da vietnamesische Zeichen aufeinander gestapelt werden, kommt es in der Praxis auf die Unicode-Darstellung an. Ein Zeichen wie „ộ" (der Vokal ô mit dem nặng-Punkt darunter) ist unter NFC-Normalisierung ein einzelner vorkomponierter Codepunkt (U+1ED9). Engines, die die zerlegte Sequenz zurückgeben (o + kombinierendes Zirkumflex + kombinierender Punkt darunter), können in Editoren, Datenbanken und Export-Pipelines Probleme verursachen, die NFC erwarten. Testen Sie eine Engine bei der Evaluierung mit einem bekannten vietnamesischen Abschnitt und prüfen Sie die Rohausgabe auf ihre Normalisierungsform – nicht nur das gerenderte Ergebnis auf dem Bildschirm.

Ein zweites praktisches Problem: Manche ältere Tools streichen Diakritika komplett, um Kodierungsprobleme zu vermeiden, und liefern reines ASCII zurück. Das ist kein Transkript, sondern höchstens ein phonetischer Hinweis. Jede Engine, die Sie für vietnamesische Inhalte einsetzen, muss standardmäßig diakritisierte Ausgabe liefern.

Code-Switching: Vietnamesisch-Englisch in Wirtschaft und Tech

Vietnamesisch-englisches Code-Switching ist in der vietnamesischen Tech- und Geschäftssprache allgegenwärtig. Sätze wie „Tôi đang work on a project mới" sind in Startup-Umgebungen an der Tagesordnung, und das Muster ist in der soziallinguistischen Forschung zu vietnamesischer Bürokommunikation und Diaspora-Gemeinschaften gut dokumentiert. Gewechselt wird, weil englische Fachbegriffe (E-Mail, Deadline, Meeting, Server) keine natürliche vietnamesische Entsprechung haben oder im Kontext einfach schneller sind.

Für die Transkription entsteht daraus ein Zweisprachigkeits-Problem: Die Engine muss innerhalb derselben Äußerung die vietnamesischen Teile mit Diakritika und die Einschübe in Standardenglisch verarbeiten. Moderne Engines mit expliziter Vietnamesisch-Unterstützung schaffen das in der Regel besser als englischdominante Tools, die Vietnamesisch automatisch zu erkennen versuchen, denn Spracherkennung auf Äußerungsebene geht bei gemischter Sprache häufig daneben.

Tipps zum Umgang mit gemischtsprachigem Audio finden Sie in Mehrsprachiges Code-Switching in Transkripten beheben.

Bei älteren vietnamesischen Sprechern, die vor 1975 ausgebildet wurden, gibt es außerdem vietnamesisch-französisches Code-Switching, besonders in der Diasporagemeinschaft in Frankreich und bei älteren Bewohnern in beruflichen Kontexten der Saigon-Ära. Das Volumen solcher Inhalte ist geringer, und die Engine-Unterstützung für vietnamesisch-französische Mischformen ist weniger erprobt.

Praktische Tipps für bessere vietnamesische Transkription

  1. Setzen Sie den Sprachcode explizit auf vi. Die automatische Erkennung fällt bei Kanälen mit gemischten Inhalten manchmal auf Chinesisch oder andere südostasiatische Sprachen zurück, besonders bei kurzen Audioclips.
  2. Nehmen Sie ohne Hintergrundgeräusche auf. Vietnamesische Töne werden als Tonhöhenkonturen realisiert, die die gesamte Silbe umspannen. Rauschen beeinträchtigt die Tonhöhen-Erkennung direkt, was die Tonwiedererkennung verschlechtert. Das ist beim Vietnamesischen wichtiger als bei nicht-tonalen Sprachen.
  3. Stellen Sie eine Vokabelliste für Namen und Orte bereit, bevor Sie hochladen, sofern Ihr Tool benutzerdefiniertes Vokabular unterstützt. Vietnamesische Personen- und Ortsnamen (Hà Nội, TP HCM, Đà Nẵng, Nguyễn Văn An) mit korrekten Diakritika geben der Engine einen Anker für lokal mehrdeutige Transkriptionsentscheidungen.
  4. Prüfen Sie die Diakritika-Ausgabe sofort. Kontrollieren Sie den ersten Absatz jedes vietnamesischen Transkripts auf fehlende oder falsche Tonzeichen, bevor Sie sich auf den Rest verlassen.
  5. Rechnen Sie mit mehr Korrekturaufwand bei Zentralvietnamesisch. Planen Sie bei Aufnahmen von Hue- oder Da-Nang-Sprechern 3 bis 5 zusätzliche Bearbeitungsdurchläufe ein verglichen mit Hanoi-Standard-Inhalten.

Einen breiter angelegten Leitfaden zur KI-Genauigkeit über Sprachen und Dialekte hinweg finden Sie in Transkriptionsgenauigkeit erklärt.

Vergleich von Tools zur vietnamesischen Transkription

Die folgende Tabelle beruht auf überprüften Preisen der Anbieterseiten Stand Juli 2026. Die Genauigkeit wird qualitativ beschrieben, nicht als erfundene Prozentsätze, da kein Anbieter vietnamesischspezifische WER-Benchmarks für diese Produkte veröffentlicht.

ToolVietnamesisch-UnterstützungKostenlose StufeEinstiegspreis
Whisper-basierte Tools (z. B. CATT)Ja, vi unterstützt10 Gratis-Minuten, einmaligAb 9,99 $/Monat (unbegrenzt)
Deepgram (API)Ja, Nova-2 und Nova-3NutzungsbasiertVerbrauchsabhängig, Volumenstaffeln
AssemblyAI (API)Ja, mit DiarisierungNutzungsbasiertVerbrauchsabhängig
Happy ScribeJa, KI-Transkription10-minütiger TestAb 17 €/Monat, 120 Min.
SonixJa, in 54 Sprachen gelistet30-minütiger Test10 $/Std. (PAYG) oder 22 $/Sitzplatz/Monat + 5 $/Std.
Otter.aiNein, nicht unterstützt300 Min./Monat16,99 $/Monat (nur Englisch/Spanisch/Französisch)

Eine vollständige Aufschlüsselung der Kosten pro Minute und der Abopreise für Transkription finden Sie in Transkriptionspreise im Vergleich 2026. Sind Ihre vietnamesischen Inhalte für einen Podcast oder eine laufende Reihe gedacht, behandelt Beste Transkription für Podcasts 2026 die Workflow-Fragen.

Wer vietnamesische Transkription tatsächlich nutzt

Vietnamesische Content-Creator in der US-Diaspora (insbesondere die Little-Saigon-Gemeinschaft in Kalifornien, die größte vietnamesische Gemeinde außerhalb Südostasiens) produzieren vietnamesischsprachige Podcasts, Interviewinhalte und Familienarchivaufnahmen. Für Diaspora-Publikum zählt die Treue zu den Diakritika gleich doppelt: Die schriftliche Ausgabe muss im Standard-Vietnamesischen lesbar sein, und fehlende Tonzeichen verändern die Bedeutung des Textes, nicht nur sein Aussehen.

Vietnamesische Redaktionen nutzen Transkription, um die Vorlaufzeit von Interviews für Print- und digitale Angebote zu verkürzen. Vietnamesische Lehrende transkribieren Vorlesungen für veröffentlichtes Kursmaterial. Der gemeinsame Nenner: Alle diese Anwendungsfälle verlangen diakritisierte Ausgabe, keine ASCII-Annäherungen.

Einen breiteren Blick darauf, wie Diarisierung bei vietnamesischen Inhalten mit mehreren Sprechern funktioniert, bietet Sprecher-Diarisierung erklärt.

Wenn Sie ein sauberes vietnamesisches Transkript brauchen und keine Meeting-Bot-Funktionen benötigen, unterstützt ConvertAudioToText Vietnamesisch mit korrekter diakitisierter Ausgabe sowie einer kostenlosen Stufe zum Testen mit Ihrem eigenen Audio.

Häufig gestellte Fragen

Erhält KI-Transkription vietnamesische Tonzeichen?

Es hängt von der Engine ab. Engines, die auf korrekt diakritisiertem vietnamesischem Text trainiert wurden – etwa Whisper und Deepgram Nova-2/3 –, geben Tonzeichen in ihrer Ausgabe zurück. Engines, die nur eine kurze Liste von Sprachen unterstützen (Otter zum Beispiel, das Vietnamesisch gar nicht unterstützt), kommen damit nicht klar. Prüfen Sie stets, ob das Tool Vietnamesisch als unterstützte Sprache ausweist, bevor Sie etwas hochladen.

Welcher regionale vietnamesische Dialekt ist für KI am schwersten zu transkribieren?

Zentralvietnamesisch, insbesondere der Hue-Dialekt, ist am schwierigsten. Seine Tonrealisierungen weichen vom Nordstandard ab, der die KI-Trainingsdaten dominiert; es bewahrt Konsonantenunterscheidungen, die im Norden verschmolzen sind (tr/ch, s/x, d/gi/r); und es verwendet Begriffe (mô, răng), die in den meisten Trainingskorpora fehlen. Rechnen Sie bei Zentralvietnamesisch mit deutlich mehr Fehlern als bei Aufnahmen im Hanoi-Standard oder aus Ho-Chi-Minh-Stadt.

Verursacht die h

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles