
Mandarin-Transkription: vereinfacht, traditionell und Töne
Summarize this article with:
Mandarin-Transkription funktioniert 2026 für sauberes Studio-Audio gut, aber du musst vorher drei Entscheidungen treffen: vereinfachte oder traditionelle Ausgabe, welchen Sprachcode du übergibst und ob dein Audio tatsächlich Kantonesisch ist (für ASR eine andere Sprache). Töne übernimmt die Engine automatisch und sie sollten nicht im Transkript auftauchen. Homophon-Disambiguierung und gemischter Mandarin-Englisch-Code-Switch sind die größten Genauigkeitsrisiken. Wenn du ein sauberes Transkript ohne Meeting-Bot willst, verarbeitet ConvertAudioToText sowohl vereinfachte als auch traditionelle Ausgabe unter /tools/audio-to-text.
Fragment 1:
Mandarin-Transkription erzeugt im Jahr 2026 sauberen, lesbaren Text, wenn du den richtigen Sprachcode setzt und verstehst, was die Engine selbst auflösen kann und was nicht. Die zwei Entscheidungen, die zählen, bevor du loslegst, sind: welchen Zeichensatz brauchst du, und ist das Audio wirklich Mandarin und nicht Kantonesisch.

Simplified vs. Traditional: Es geht um dein Publikum, nicht um das Audio
Die gesprochene Sprache in deiner Aufnahme ist dieselbe, egal ob der Sprecher aus Shanghai, Taipeh oder Singapur kommt. Die geschriebene Ausgabe ist es nicht. Vereinfachtes Chinesisch (Jiantizi) ist Standard in Festlandchina und Singapur. Traditionelles Chinesisch (Fantizi) ist Standard in Taiwan, Hongkong, Macau und in der Diaspora-Publizistik.
Jede große ASR-Engine leitet Mandarin-Audio basierend auf dem Sprachcode, den du angibst, an einen Zeichensatz weiter:
zhoderzh-CNoderzh-Hans: Simplified-Ausgabezh-TWoderzh-Hant: Traditional-Ausgabezh-HK: bei Deepgram Nova-3 adressiert das speziell Kantonesisch in Traditional
Den Sprachcode explizit zu setzen, ist wichtig. Die automatische Spracherkennung bei kurzen oder verrauschten Mandarin-Clips hat einen bekannten Fehlermodus: Deepgrams eigenes Issue-Tracker dokumentiert Fälle, in denen Mandarin auf Nova-2 und Nova-3 als Englisch fehlidentifiziert wird. Gib immer den expliziten Code an.
Wenn dein Workflow beide Regionen abdeckt, ist der sicherere Weg, in Simplified zu transkribieren und dann mit einem kontextbewussten Tool wie OpenCC in Traditional zu konvertieren. Eine naive Zeichenersetzungstabelle funktioniert nicht sauber, weil viele vereinfachte Zeichen auf mehr als ein traditionelles Zeichen abbilden, und die richtige Wahl erfordert Kontext. Eine Eins-zu-viele-Zuordnung, wie 發/髮 (beide vereinfacht als 发), erfordert zu wissen, ob das Wort „senden“ oder „Haar“ bedeutet.
Warum Töne nicht in deinem Transkript auftauchen
Die vier Töne des Mandarin (plus ein neutraler Ton) sind das Problem der Engine, nicht deins zum Markieren. Die Transkriptionsausgabe besteht aus standardmäßigen chinesischen Schriftzeichen ohne Tonmarkierungen. Was die Engine tatsächlich tut, ist, tonale Informationen akustisch zu nutzen, um aus einer Gruppe von Homophonen das richtige Zeichen auszuwählen und dieses dann still auszugeben.
Homophone sind das größte Genauigkeitsrisiko bei der Mandarin-Transkription. Das Phoneminventar des Mandarin ist klein im Verhältnis zur Anzahl der Morpheme, die es kodiert, was bedeutet, dass viele Silben identisch klingen: shì kann richtig (是), Sache (事), Zimmer (室), Markt (市), Macht (势) und Dutzende mehr bedeuten. Die Engine muss dies über Kontext und Sprachmodellierung auflösen, nicht allein über Phonetik.
Fachspezifische Begriffe verschärfen dieses Problem. Eine medizinische Aufnahme, die 心 (Herz) versus 新 (neu) in zusammengesetzten Wörtern verwendet, oder ein juristischer Kontext mit 法 (Gesetz) versus 发 (aussenden), erfordert Fachwissen, das ein allgemeines Modell möglicherweise nicht hat. Die Bereitstellung eines Glossars mit Schlüsselbegriffen, wenn verfügbar, reduziert diese Fehler. Chinesische Namen sind besonders anfällig, da Vornamen einen kleinen Pool an Zeichen mit vielen homophonen Optionen und ohne feste Konvention nutzen.
Pinyin-Ausgabe mit Tonmarkierungen (nǐ hǎo statt 你好) ist ein sekundäres Format, das nur in Sprachlernkontexten nützlich ist. Standardtranskripte für jeden anderen Zweck verwenden Schriftzeichen.
Mandarin vs. Kantonesisch: Zwei verschiedene ASR-Probleme
Diese Unterscheidung ist praktisch wichtig und wird oft missverstanden. Kantonesisch (Yue-Chinesisch) ist für ASR-Zwecke eine eigene Sprache, kein regionaler Akzent des Mandarin.
Kantonesisch hat sechs Töne gegenüber den vier plus neutralem Ton des Mandarin, eine andere Phonologie und eine große Kluft zwischen der gesprochenen Umgangssprache und ihrer schriftlichen Darstellung. Ein Sprecher aus Hongkong wechselt zwischen kantonesischer Rede und geschriebenen chinesischen Zeichen, die möglicherweise die grammatische Struktur des Mandarin repräsentieren. Das macht kantonesische ASR selbst auf technischer Ebene zu einem schwierigeren Problem.
Ein mit Mandarin trainiertes Modell, das mit kantonesischem Audio gefüttert wird, transkribiert die phonetisch ähnlichsten Mandarin-Wörter. Das Ergebnis klingt verwandt, ist aber auf Wortebene häufig falsch. Der Genauigkeitsabfall ist keine kleine Verschlechterung.
Deepgram Nova-3 listet zh-HK jetzt als Kantonesisch (Traditionell), getrennt von den Varianten Mandarin (Vereinfacht) und Mandarin (Traditionell). Diese Trennung ist die richtige architektonische Entscheidung. Bei Tools, die nicht unterscheiden, prüfe, ob Kantonesisch explizit als unterstützte Sprache aufgeführt ist, bevor du Inhalte aus Hongkong oder Guangdong transkribierst.
Für gemischte Mandarin-Kantonesisch-Besprechungen (häufig in Hongkonger Firmenumgebungen) ist der praktische Workflow: mit dem Mandarin-Modell transkribieren und für die code-switching-Abschnitte eine Korrekturlesung durch einen kantonesischkundigen Redakteur einplanen.
Siehe warum KI mit ressourcenarmen Sprachen kämpft für die Trainingsdaten-Mechanik hinter diesen Genauigkeitslücken.
Taiwanesisches Mandarin (Guoyu) vs. Festland-Mandarin (Putonghua)
Guoyu und Putonghua teilen einen gemeinsamen schriftlichen Standard und gegenseitige Verständlichkeit, aber sie weichen in Punkten ab, die ASR beeinflussen.
Die akustischen Unterschiede: Taiwanesisches Mandarin kennt kein Erhua (das 儿化-Suffix, das in der Pekinger Sprache üblich ist, z. B. nǎr statt nǎlǐ für „wo"). Sprecher in Taiwan verschmelzen außerdem häufig die retroflexen Konsonanten zh/ch/sh zu z/c/s, sodass „zhōngwén" eher wie „zōngwén" klingt. Auch die Tonhöhenspanne unterscheidet sich: Taiwanesische Mandarin-Sprecher nutzen oft eine schmalere Tonhöhenspanne, und der steigende Ton kann akustisch dem fallend-steigenden Ton ähneln.
Die Wortschatzunterschiede: Eine Studie der 7.000 am häufigsten verwendeten Schriftzeichen fand etwa 18 % Abweichung zwischen dem Standardgebrauch in Taiwan und auf dem Festland, die bei den 3.500 häufigsten Zeichen auf 13 % sinkt. Dazu gehören taiwanesische Begriffe mit Hokkien- oder japanischem Ursprung, die ein auf dem Festland trainiertes Modell möglicherweise als phonetische Annäherungen mit anderen Schriftzeichen wiedergibt.
Festlegen von zh-TW richtet die Engine auf Erwartungen aus, die zu taiwanesischen Sprechmustern passen, und stellt die Ausgabe in traditionellen Schriftzeichen sicher. Der Code zh-TW betrifft nicht nur den Zeichensatz; bei gut konfigurierten Modellen passt er auch die akustische Gewichtung an die Guoyu-Phonologie an.
Chinesisch-Englischer Code-Switching in der Praxis
Tech- und Geschäftsmandarin enthält fast immer Englisch. Ein Satz wie „我們需要review一下這個PR“ (Wir müssen diesen PR reviewen) oder „這個KPI很重要“ (Dieser KPI ist wichtig) ist in chinesischen Technologieunternehmen die übliche gesprochene Form.
Gut trainierte mehrsprachige Modelle handhaben das, indem sie englische Wörter in lateinischer Schrift belassen, statt sie zu phonetisieren. Die Ausgabe, die du willst, ist: review bleibt review, Akronyme wie KPI und OKR bleiben lateinisch, und Eigennamen wie Apple und Google bleiben auf Englisch.
Die Fehlerquelle liegt an den Code-Switching-Grenzen, wo die Engine eine Silbe fallen lassen oder ein kurzes englisches Wort als mandarinisches Morphem fehlinterpretieren kann. Wechsel mitten im Satz („因為這個API...“) sind schwieriger als das Einfügen ganzer Wörter. Wenn dein Audio dicht mit englischen Einschüben mitten im Satz ist, teste an einer echten Stichprobe, bevor du eine Pipeline festlegst.
Siehe wie man mehrsprachige Code-Switching-Probleme behebt für praktische Korrekturmaßnahmen.
Vollbreite Interpunktion ist nicht optional
Ein korrekt formatiertes Mandarin-Transkript verwendet vollbreite Interpunktion, wie in GB/T 15834-2011 standardisiert:
- 。für einen Satzabschluss (nicht
.) - ,für ein Komma (nicht
,) - 、für einen Aufzählungstrenner in Listen
- :für einen Doppelpunkt
- 「」oder 《》für Zitatkontexte
Wenn deine Transkriptionsausgabe Mandarin-Text mit halbbreiter ASCII-Interpunktion (., ,) zurückgibt, ist das Transkript nicht standardkonform. Für die Veröffentlichung an Festlandchinesen, taiwanesisches Publikum oder jedes chinesischsprachige Dokument muss das vor der Nutzung korrigiert werden. Manche Tools erzeugen standardmäßig korrekte vollbreite Interpunktion; andere erfordern Nachbearbeitung.
Engine-Unterstützung für Mandarin im Jahr 2026
Deepgram Nova-3 ist die herausragende Neuerung für 2026 im Bereich Mandarin. Nova-3 unterstützt vereinfachtes Chinesisch (zh, zh-CN, zh-Hans), traditionelles Chinesisch (zh-TW, zh-Hant) und Kantonesisch (zh-HK) als explizite Varianten. Deepgram meldet eine relative WER-Reduktion von 65,21 % bei der Batch-Transkription von vereinfachtem Mandarin im Vergleich zu Nova-2 und 44,87 % für traditionelles Chinesisch. Das sind relative Verbesserungen, keine absoluten Genauigkeitswerte, aber die Richtung der Verbesserung ist erheblich. Mehr zur Engine finden Sie unter Deepgram Nova-3 erklärt.
AssemblyAI Universal-2 unterstützt Mandarin-Chinesisch und liegt laut Dokumentation im Genauigkeitsband „>10 % bis kleiner oder gleich 25 % WER“. Das heißt, es funktioniert, aber Mandarin gehört nicht zur obersten Genauigkeitsstufe. Die Dokumentation des Universal-3-Pro-Modells listet Mandarin Stand Mitte 2026 nicht in den detaillierten Sprachsupport-Tabellen, daher ist Universal-2 der bestätigte Weg für Chinesisch bei AssemblyAI.
OpenAI Whisper Large-v3 verarbeitet Mandarin mit ordentlicher Leistung. Feingetunte, chinesischspezifische Varianten (wie Belle-whisper-large-v3-zh) zeigen 24 bis 65 % relative Verbesserung bei chinesischen ASR-Benchmarks gegenüber dem Basismodell, was ein Indikator dafür ist, wo die Mandarin-Obergrenze des Basismodells liegt. Bei technischen oder domänenspezifischen chinesischen Inhalten lohnt sich die Evaluierung einer feingetunten Variante.
Regionales Mandarin mit stark nicht-standardgemäßer Phonologie (Sichuan, Shanghaier Akzent, Hokkien-beeinflusstes Mandarin) bleibt bei allen großen Engines unter der Genauigkeit des Standard-Putonghua. Die Trainingsdaten, die stark auf formelles Rundfunk-Mandarin ausgerichtet sind, stellen eine strukturelle Einschränkung dar.
Ein Vergleich, wie verschiedene Engines bei Sprachen mit geringeren Ressourcen abschneiden, findet sich unter Transkriptionsgenauigkeit erklärt.
Vergleich der Tools für chinesische Transkription
| Funktion | Otter.ai | Notta | Deepgram Nova-3 API | CATT |
|---|---|---|---|---|
| Mandarin (vereinfacht) | Ja (Beta) | Ja | Ja (zh-CN) | Ja |
| Mandarin (traditionell) | Nein (nur vereinfacht) | Ja | Ja (zh-TW) | Ja (zh-TW) |
| Kantonesisch | Nein | Ja | Ja (zh-HK, separat) | Eingeschränkt |
| Chinesische KI-Zusammenfassung | Nur Englisch | Chinesisch | Erfordert eigene LLM | Chinesisch |
| Kostenlose Stufe | 300 Min./Monat | 120 Min./Monat | 200 $ API-Guthaben | Kostenlose Stufe verfügbar |
| Bezahlter Preis | 8,33 $/Monat (jährlich) | 9,99 $/Monat (jährlich) | 0,0043 $/Min. (Batch) | 9,99 $/Monat, unbegrenzt |
| Code-Switching | Eingeschränkt | Angemessen | Hängt vom Modell ab | Ja |
Otters Chinesisch-Unterstützung ist auf vereinfachtes Mandarin beschränkt und in der eigenen Dokumentation als Beta markiert, was es für Inhalte mit Taiwan-Bezug oder Anforderungen an traditionelle Schriftzeichen zu einer schlechten Wahl macht. Notta unterstützt sowohl vereinfachtes als auch traditionelles Chinesisch und hat eine eigene Seite für chinesische Audio-zu-Text-Umwandlung, was auf echtes Engagement für Mandarin hindeutet. Der API-Weg von Deepgram gibt Ihnen die präziseste Kontrolle über Sprachcodes und Varianten, allerdings auf Kosten einer eigenen Integration.
Meine Einschätzung: Für eigenständige Audiodateien, bei denen Sie saubere Ausgabe in vereinfachtem oder traditionellem Chinesisch ohne Meeting-Bot-Abhängigkeit benötigen, ist ConvertAudioToText der unkomplizierte Weg. Für mehrsprachige API-Pipelines, bei denen Sie Ihr eigenes Produkt entwickeln, würde ich 2026 mit Deepgram Nova-3 starten, angesichts der dokumentierten WER-Verbesserungen bei Mandarin.
Sprecher-Diarisierung für Chinesisch
Chinesische Geschäftsaudios neigen in formellen Kontexten zu strukturiertem Sprecherwechsel. Zwei-Personen-Interviews mit klaren Pausen erzeugen sauberere Diarisierung als lockere Podcasts, in denen sich die Sprecher gegenseitig ins Wort fallen.
Die besondere Herausforderung bei der Diarisierung von Mandarin liegt darin, dass chinesische Konversationsnormen bestätigendes Backchanneling (嗯, 对, 好) mit leiser Stimme beinhalten, während der Hauptsprecher weiterspricht. Das führt bei weniger ausgefeilten Diarisierungssystemen zu falschen Sprecherwechsel-Ereignissen.
Aufnahme pro Mikrofon, wo verfügbar, eliminiert die meisten dieser Fehler. Bei Podcast-ähnlichem Audio mit einem Mikrofon solltest du einen leichten Prüfdurchlauf für die Diarisierung in überlappenden Segmenten einplanen.
Siehe Sprecher-Diarisierung erklärt für Details, wie der zugrunde liegende Algorithmus diese Fälle behandelt.
Tipps für bessere Mandarin-Transkription
- Setze den exakten Sprachcode:
zh-CNfür vereinfachtes Chinesisch,zh-TWfür traditionelles Chinesisch,zh-HKfür Kantonesisch. Die automatische Erkennung ist bei kurzen Clips unzuverlässig. - Stelle vor der Verarbeitung ein Glossar mit Eigennamen bereit (Personennamen, Markennamen, interne Produktnamen). Chinesische Vornamen sind besonders anfällig für falsche Homophon-Auswahl.
- Bei technischen Inhalten solltest du Fachbegriffe mitliefern. Ein Modell, das 机器学习 (maschinelles Lernen) nicht als zusammengesetzten Begriff kennt, kann es falsch trennen.
- Nimm unter geräuscharmen Bedingungen auf. Tonale Unterscheidungen sind das wichtigste Disambiguierungssignal und sie komprimieren sich unter Hintergrundgeräuschen.
- Behandle kantonesisches Audio als etwas, das ein separates Tool oder einen separaten Sprachcode erfordert, nicht als Variante einer Mandarin-Einstellung.
- Bei KI-Zusammenfassungen auf Chinesisch solltest du prüfen, ob das Tool die Zusammenfassung tatsächlich auf Chinesisch erstellt, statt auf Englisch zusammenzufassen und es als erledigt zu betrachten. Die meisten westlich ausgerichteten Meeting-Tools liefern nur englische Zusammenfassungen.
FAQ
Sollte ich für mein Transkript vereinfachtes oder traditionelles Chinesisch verwenden?
Richte dich nach deinem Publikum: Vereinfachtes Chinesisch (zh-CN) für Inhalte aus Festlandchina und Singapur, traditionelles Chinesisch (zh-TW) für Taiwan und zh-HK für Hongkong. Dasselbe gesprochene Mandarin erzeugt je nach Sprachcode, den du an die Engine übergibst, unterschiedliche Zeichenausgaben. Wenn dein Publikum über Regionen hinweggeht, transkribiere in vereinfachtem Chinesisch und konvertiere mit einer kontextbewussten Bibliothek wie OpenCC, die die vielen vereinfachten Zeichen behandelt, die auf mehr als ein traditionelles Zeichen abbilden.
Erscheinen Töne in Mandarin-Transkripten?
Nein. Standard-Mandarin-Transkriptionen geben chinesische Schriftzeichen aus, nicht Pinyin mit Tonmarkierungen. Die Engine nutzt die Tonunterschiede, um Homophone zu unterscheiden und das richtige Zeichen zu wählen, aber diese Unterschiede fließen in den Zeichenauswahlprozess ein und werden nie gedruckt. Das Ergebnis ist sauberer Text in der Form, die Ihre Leser erwarten, etwa 你好 statt nǐ hǎo.
Warum sinkt die Genauigkeit bei Kantonesisch, selbst wenn ich Chinesisch auswähle?
Kantonesisch (Yue-Chinesisch) ist eine eigenständige Sprache und kein Dialekt des Mandarin. Es hat sechs Töne im Vergleich zu Mandarins vier plus neutralem Ton, eine andere Phonologie und eine begrenzte standardisierte Schriftform. ASR-Engines, die mit Mandarin-Daten trainiert wurden, schneiden bei kantonesischem Audio schlecht ab. Deepgram Nova-3 bietet zh-HK als separate Variante an, und das ist der richtige Code für kantonesisches Audio. Bei anderen Tools sollten Sie prüfen, ob Kantonesisch als eigene Sprachoption gelistet ist, bevor Sie Hongkong-Kantonesisch unter einer allgemeinen Chinesisch-Einstellung transkribieren.
Wie wirkt sich Mandarin-Englisch Code-Switching auf die Transkription aus?
In Tech- und Geschäftskontexten mischt Mandarin häufig englische Begriffe mitten im Satz ein. Gut trainierte mehrsprachige Modelle behalten englische Wörter in lateinischer Schrift bei, statt sie in Zeichen zu phonetisieren. Akronyme wie KPI, OKR und API bleiben in lateinischer Schrift. Produktnamen wie Apple und Microsoft ebenfalls. Die Herausforderung entsteht, wenn ein Sprecher mitten im Satzglied wechselt statt mitten im Wort: Manche Engines lassen an der Wechselgrenze eine Silbe weg. Es lohnt sich, vor der Festlegung auf eine Pipeline eine echte Stichprobe Ihres Audios zu testen.
Welche Sprachcodes sollte ich für Mandarin-Transkription verwenden?
Für vereinfachtes Mandarin verwenden Sie zh, zh-CN oder zh-Hans. Für traditionelles Chinesisch verwenden Sie zh-TW oder zh-Hant. Bei Deepgram Nova-3 ist zh-HK kantonesisches traditionelles Chinesisch. Bei AssemblyAI Universal-2 wird Mandarin-Chinesisch unterstützt. Setzen Sie die Variante immer explizit, statt sich auf automatische Spracherkennung zu verlassen, denn Mandarin kann bei kurzen oder verrauschten Clips mit anderen Sprachen verwechselt werden.
Wird taiwanesisches Mandarin (Guoyu) anders behandelt als Festland-Putonghua?
Die beiden Varianten sind sich ähnlich genug, dass die meisten Engines beide mit einem einzigen Mandarin-Modell abdecken, aber sie unterscheiden sich in messbarer Weise. Taiwanesisches Mandarin verzichtet auf das im Peking-Dialekt übliche erhua-Suffix (儿化), und Sprecher verschmelzen häufig die retroflexen Konsonanten zh/ch/sh zu z/c/s. Auch der Wortschatz weicht ab: Rund 13 bis 18 Prozent der häufig verwendeten Schriftzeichen unterscheiden sich im Standardgebrauch zwischen Taiwan und dem Festland. Die Einstellung zh-TW signalisiert der Engine diese Erwartungen und leitet die Ausgabe zudem auf traditionelle Schriftzeichen um, das in Taiwan übliche Schriftsystem.
Quellen
- Deepgram Nova-3 Expands to Asia-Pacific (Deepgram)
- Deepgram Models and Languages Overview
- AssemblyAI Supported Languages
- Otter.ai Supported Languages (Help Center)
- Otter.ai Pricing
- Notta Pricing
- Notta Chinese Audio to Text
- Taiwanese Mandarin (Wikipedia)
- Chinese Punctuation (Wikipedia)
- Deepgram Nova-3 Mandarin changelog (March 31, 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription for Asian Languages in 2026
Verified guide to transcribing Mandarin, Japanese, Korean, Hindi, Thai, and Vietnamese audio in 2026. Covers CER benchmarks, engine strengths, and pricing by language.

How to Get a Spotify Podcast Transcript Free (2026): Every Method, Honestly Compared
Spotify already shows free transcripts for many episodes, so start there. When it doesn't, here is every real way to get a Spotify podcast transcript free, including the limits of each, and when a paid tool is honestly the answer.