
Fehler beim Code-Switching in der Transkription beheben
Summarize this article with:
Warum gemischtsprachiges Audio scheitert
Der Fix für die meisten Code-Switching-Fehler besteht darin, eine Engine mit einem nativen mehrsprachigen Modell zu wählen und ihr zu sagen, dass sie sich nicht auf eine einzelne Sprache festlegen soll. Wenn Sie AssemblyAI verwenden, übergeben Sie speech_model: "universal" und setzen Ihre beiden Sprachcodes. Wenn Sie Deepgram verwenden, setzen Sie language=multi mit Nova-3 oder Flux. Wenn Sie Whisper verwenden, setzen Sie language=None, um eine Erkennung pro Segment zu ermöglichen. Der Rest dieses Beitrags erklärt, warum diese Entscheidungen wichtig sind und was zu tun ist, wenn es trotzdem fehlschlägt.
Die meisten Transkriptions-Engines bauen auf der Annahme einer einzigen Sprache auf. Sie empfangen Audio, wählen eine primäre Sprache und ordnen jedes Phonem dem Wortschatz dieser Sprache zu. Wechselt ein Sprecher mitten im Satz die Sprache, hat das Modell drei schlechte Optionen: die Sekundärsprache als phonetische Annäherungen an die Primärsprache wiedergeben („para crear“ wird zu „para crayer“), sich auf die neue Sprache festlegen und dort bleiben, selbst nachdem der Sprecher zurückgewechselt ist, oder die nicht passenden Segmente komplett verwerfen. Jede dieser Optionen erzeugt ein kaputtes Transkript.
Das tieferliegende Problem liegt speziell an den Sprachgrenzen. Forschung zu mehrsprachigen Sprachmodellen zeigt, dass die Switch-Point-WER (die Fehlerrate, gemessen im 2-3-Wörter-Fenster um jeden Sprachwechsel) 30-50 Punkte höher liegen kann als die insgesamt gemittelte WER. Ein Modell, das insgesamt 10 % WER erreicht, kann trotzdem jeden einzelnen Code-Wechsel verhunzen. Gemittelte Genauigkeitszahlen verbergen das.
Die drei Fehlermodi, namentlich benannt
Zu verstehen, welcher Fehlermodus vorliegt, verrät Ihnen, welcher Fix anzuwenden ist.
Phonetische Substitution: Die Engine bleibt in der Primärsprache und gibt Wörter der Sekundärsprache als Nahe-Homophone wieder. Dies ist der häufigste Fehler und am leichtesten zu erkennen. Aus „Finalizando“ wird „finally sando.“ Fix: Zu einer mehrsprachigen Engine wechseln.
Sprach-Lock: Die Engine erkennt den Wechsel und legt sich auf die neue Sprache fest, schafft dann aber nicht zurückzuwechseln. Der Rest des Transkripts steht in der falschen Sprache. Fix: Erkennung pro Segment statt pro Job verwenden.
Grenz-Halluzination: Das Modell verliert an einem Übergangspunkt den Kontext und generiert plausibel klingenden Text, der nie gesprochen wurde. Das ist der am schwersten zu entdeckende Fehler, weil die Ausgabe sauber aussieht, aber falsch ist. Er tritt besonders bei Whisper bei kurzen Audiosegmenten auf, wo Stille oder Rauschen an einer Sprachgrenze liegt. Fix: Vorverarbeitung mit VAD (Voice Activity Detection) verwenden, um stille Segmente zu entfernen, bevor sie das Modell erreichen, und bei wechselintensiven Inhalten dedizierte Code-Switch-Engines gegenüber allgemeinen mehrsprachigen Modellen bevorzugen.
Fix 1: Eine dedizierte Code-Switch-Engine verwenden
Der klarste Fortschritt in diesem Bereich seit 2024 besteht darin, dass mehrere große APIs jetzt eigene Code-Switch-Modi anbieten, nicht nur „mehrsprachige Unterstützung.“
Deepgram Nova-3 mit language=multi unterstützt Code-Switching über 10 Sprachen: Englisch, Spanisch, Französisch, Deutsch, Hindi, Russisch, Portugiesisch, Japanisch, Italienisch und Niederländisch. Setzen Sie language=multi im Query-String, wenn Sie /listen aufrufen. Für Streaming empfiehlt Deepgram endpointing=100 (100ms Endpunkterkennung) speziell für Audio mit Sprachwechseln. Nova-3 Multilingual erzielte in seinem Update vom März 2026 eine relative Reduzierung der Batch-WER um rund 34 %, mit den größten Gewinnen an Code-Switch-Grenzen.
Deepgram Flux Multilingual (flux-general-multi), im April 2026 in allgemeiner Verfügbarkeit veröffentlicht, unterstützt dieselben 10 Sprachen mit nativem Code-Switching, das in die Modellarchitektur integriert ist statt als Erkennungsschicht auf einem einsprachigen Modell. Sie können optionale language_hint-Parameter übergeben, um die Erkennung zu beeinflussen, wenn Sie wissen, welche Sprachen vorhanden sind.
AssemblyAI Universal-3 Pro bewältigt Code-Switching für vorab aufgezeichnetes Audio über Englisch, Spanisch, Portugiesisch, Französisch, Deutsch und Italienisch. Die Einschränkung, die Sie kennen sollten: Sie können maximal zwei Sprachcodes pro Transkriptionsanfrage angeben, und einer davon muss Englisch sein. Die Nicht-Englisch-Sprache sollte für die besten Ergebnisse die dominante im Audio sein.
Speziell für Echtzeit-Streaming verarbeitet AssemblyAIs Universal-Streaming-Modell sechs Sprachen in einem einzigen Forward Pass (Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch), ohne dass eine manuelle Sprachangabe erforderlich ist.
Für Sprachpaare außerhalb dieser Sets bleiben Whisper-basierte Tools der breiteste Fallback. Siehe Fix 2.
Siehe auch: Deepgram Nova-3 erklärt für einen tieferen Blick auf die mehrsprachige Modellarchitektur.
Fix 2: Whisper mit automatischer Erkennung für nicht unterstützte Paare verwenden
Für Sprachpaare, die von den obigen Spezial-Engines nicht abgedeckt werden (Wolof + Französisch, Kantonesisch + Englisch, Taglish, Singlish, Portunhol und andere), ist Whisper Large-v3 die praktischste Option, weil seine Trainingsdaten ein breiteres Spektrum an Sprachkombinationen abdeckten.
Die entscheidende Einstellung: Setzen Sie language=None, um eine Erkennung pro Segment zu ermöglichen, statt einen einzelnen Sprachcode zu erzwingen.
result = model.transcribe(
audio_file,
language=None, # auto-detect per segment
task="transcribe"
)
Einen bestimmten Sprachcode zu setzen zwingt das Modell, das gesamte Audio als diese Sprache zu interpretieren. Setzt man ihn auf None, lässt man Whisper die Sprache pro 30-Sekunden-Fenster schätzen.
Das ehrliche Aber: Whispers Code-Switch-Genauigkeit verschlechtert sich an Sprachgrenzen, und es ist an diesen Punkten anfälliger für Halluzinationen als die Spezial-Engines. Speziell für Hinglish gibt es 2026 kein kommerzielles Transkriptionstool, das es zuverlässig verarbeitet. Whisper ist die beste verfügbare Option für Hindi-Englisch-Code-Switching, aber rechnen Sie mit mehr manueller Korrektur als bei Spanglish oder französisch-englischen Inhalten, wo die Trainingsdaten umfangreicher sind.

Fix 3: Sprachen explizit angeben, wo unterstützt
Bei Engines, die eine Sprachliste statt eines einzelnen Codes unterstützen, hilft es dem Modell, seine Erkennung zu fokussieren, wenn man die im Audio vorhandenen Sprachen explizit benennt.
# Google Cloud Speech-to-Text (Chirp 3, V2 API)
config = {
"model": "chirp_3",
"language_codes": ["es-US", "en-US"] # up to 3 languages; fewer = more accurate
}
Googles Dokumentation weist darauf hin, dass die Angabe weniger Sprachen die Erkennungsgenauigkeit erhöht. Die V2-API unterstützt auch language_codes: ["auto"] auf Chirp 3 für vollautomatische Erkennung, wobei explizite Codes die Auto-Erkennung übertreffen, wenn Sie das Sprachpaar kennen.
Für Google Cloud STT ist die Funktion nur in der Region global sowie in den Multi-Regionen us und eu verfügbar.
Code-Switching-Muster und Engine-Wahl
Die richtige Engine hängt davon ab, welche Sprachen wechseln. Hier eine praktische Aufschlüsselung nach häufigen Paaren.
| Sprachpaar | Beste Engine | Hinweise |
|---|---|---|
| Spanglish (Spanisch + Englisch) | Deepgram Nova-3 language=multi, AssemblyAI U3-Pro, Whisper | Drei solide Optionen; alle haben umfangreiche Trainingsdaten für beide Sprachen |
| Hinglish (Hindi + Englisch) | Deepgram Nova-3 language=multi, Whisper (auto) | Hindi ist in Deepgrams 10-Sprachen-Set enthalten; Whisper als Fallback für Randfälle |
| Französisch + Arabisch | Whisper (auto) | Weder Deepgram multi noch AssemblyAI U3-Pro deckt Arabisch im Code-Switch-Modus ab |
| Taglish (Tagalog + Englisch) | Whisper (auto), Google Cloud STT | Kein spezieller Code-Switch-Modus für Tagalog |
| Wolof + Französisch | Whisper (auto) | Whisper ist die einzige realistische Option; rechnen Sie mit mehr Korrekturaufwand |
| Mandarin/Kantonesisch + Englisch | Whisper (auto) | Kantonesisch hat weniger Trainingsdaten als Mandarin; rechnen Sie mit einer höheren Fehlerrate |
| Portunhol (Portugiesisch + Spanisch) | Deepgram Nova-3 language=multi, Whisper | Beide Sprachen in Deepgrams Set |
| Deutsch + Englisch | Deepgram Nova-3, AssemblyAI U3-Pro, Flux | Alle drei Engines decken dieses Paar ab |
Für mehrsprachige Besprechungsaufnahmen, bei denen Sie Sprechertrennung neben der Spracherkennung benötigen, siehe Speaker-Diarization erklärt und mehrsprachige Besprechungstranskription.
AWS Transcribe: Multi-Language-Erkennung vs. Code-Switching
AWS Transcribe hat eine Multi-Language-Erkennung sowohl für Batch- als auch für Streaming-Jobs hinzugefügt. Die Funktion erkennt dominante Sprachen pro Segment und kennzeichnet sie in der Transkriptausgabe. Sie kann „zweisprachige Sprecher, die zwischen Sprachen wechseln, wie US-Englisch und Hindi-IN, identifizieren, indem sie jede Sprache separat erkennt und transkribiert.“
Die wichtige Unterscheidung: Das ist Spracherkennung und Transkription pro Segment, kein Code-Switching mitten im Satz. Bei strukturiertem Wechsel (Sprecher A antwortet auf Englisch, Sprecher B reagiert auf Spanisch) funktioniert es gut. Bei satzinternem Mischen („I was finalizando the deal“) ist es weniger zuverlässig, weil der Wechsel innerhalb eines einzelnen Erkennungsfensters passiert.
Schwärzung (Redaction) und benutzerdefinierte Sprachmodelle werden derzeit nicht zusammen mit der Multi-Language-Erkennung unterstützt.
Fix 4: Audio bei vorhersehbaren Wechseln aufteilen
Bei Aufnahmen mit strukturiertem Sprachwechsel statt Mischen auf Satzebene liefert das Aufteilen nach Sprachsegment und die separate Transkription jedes Teils die sauberste Ausgabe.
Die zusätzlichen Schritte lohnen sich, wenn: der Inhalt vorhersehbare Sprachgrenzen hat (ein Interview, bei dem die Fragen auf Englisch und die Antworten auf Mandarin sind), die Tragweite hoch genug ist, um den Mehraufwand zu rechtfertigen, oder das Sprachpaar von keiner Spezial-Engine unterstützt wird.
Der Workflow: Sprachgrenzen identifizieren (manuell oder mit einem Spracherkennungstool), in Segmente schneiden, jedes Segment mit der passenden Spracheinstellung transkribieren, der Reihe nach zusammenführen. Bei regelmäßigen Inhalten mit vorhersagbarer Struktur lässt sich das skripten.
Manuelle Nachbearbeitung von Transkripten mit Sprachwechseln
Auch bei den besten Engine-Entscheidungen profitieren Transkripte mit Sprachwechseln von einer gezielten Durchsicht.
Zuerst die Wörter an den Wechselstellen prüfen. Die Wörter unmittelbar vor und nach jeder Sprachgrenze sind der Ort, an dem sich die meisten Fehler konzentrieren. Prüfen Sie diese Positionen, bevor Sie das gesamte Transkript lesen.
Phonetische Substitutionen korrigieren. Wo das Modell eine Sprache als annähernd phonetische Entsprechung in der anderen Sprache wiedergegeben hat, ist der Fehler meist erkennbar, wenn Sie beide Sprachen kennen. „Para crayer“ statt „para crear“, „I told my mom acha“ statt „I told my mom accha.“
Eigennamen überprüfen. Namen von Personen, Orten und Marken, die Sprachgrenzen überschreiten, werden oft inkonsistent oder phonetisch wiedergegeben. Eine Überprüfung durch zweisprachige Muttersprachler ist die effizienteste Kontrolle für kritische Inhalte.
Nicht zugunsten des Leseflusses auf Kosten der Genauigkeit bearbeiten. Sprache mit Sprachwechseln kann sich in Transkriptform holprig lesen, aber die Aufgabe des Transkripts ist es festzuhalten, was gesagt wurde, nicht flüssig zu lesen. Markieren Sie holprige Passagen zur menschlichen Überprüfung, statt sie stillschweigend zu glätten.
Für Genauigkeits-Benchmarks über Engines hinweg siehe Transkriptionsgenauigkeit erklärt.
Wenn das Problem nicht das Code-Switching ist
Manches Audio wird fälschlich als Code-Switching-Problem diagnostiziert, obwohl es eigentlich etwas anderes ist.
Akzentbelastete Rede in einer Sprache: Ein Sprecher mit starkem regionalem Akzent kann die Spracherkennung des Modells irritieren. Das ist kein Code-Switching, und der Fix ist ein anderer: Verwenden Sie ein Modell mit starker Akzent-Robustheit statt eines mehrsprachigen Code-Switch-Modus.
Lehnwörter und Entlehnungen: Ein Sprecher, der sagt „I ordered sushi at the izakaya“, hat nicht den Code gewechselt. Einzelne Lehnwörter, eingebettet in sonst einsprachige Sätze, werden von jeder modernen Engine gut verarbeitet. Zum Transkriptionsproblem wird das erst, wenn die Lehnwörter selten sind und das Modell sie phonetisch wiedergibt.
Strukturierte zweisprachige Inhalte: Wenn jede Äußerung sauber eine Sprache ist (Sprecher A auf Englisch, Sprecher B auf Französisch), haben Sie zweisprachige Inhalte statt Code-Switching. Verwenden Sie Multi-Language-Erkennung (AWS Transcribe, Google Cloud STT) oder eine Sprachzuweisung pro Sprecher statt eines Code-Switch-Modells.
Die Faustregel: Findet der Wechsel mitten im Satz statt (gemischte grammatische Struktur innerhalb einer Äußerung), ist es Code-Switching. Findet der Wechsel an Äußerungsgrenzen statt, sind es zweisprachige Inhalte. Der Fix unterscheidet sich.
Für aufgezeichnete mehrsprachige Besprechungen behandelt Besprechungsprotokolle aus Audio erstellen den End-to-End-Workflow inklusive Sprachbehandlung.
Meine Einschätzung: 2025 lautete der praktische Rat „Whisper verwenden und die Einschränkungen akzeptieren“. Mitte 2026 ist das Bild differenzierter. Für die 10 Sprachen, die Deepgrams language=multi abdeckt, und die 6 Sprachen im U3-Pro-Code-Switch-Modus von AssemblyAI sind Spezial-Engines an Wechselgrenzen inzwischen messbar besser als Whisper. Whisper bleibt die richtige Wahl für Sprachpaare, die diese Engines nicht abdecken, aber es ist nicht mehr die Standardempfehlung für alles. Passen Sie die Engine an das Sprachpaar an, nicht an den Workflow.
Wenn Sie ein schnelles Transkript aus mehrsprachigem Audio benötigen, ohne eine API zu konfigurieren, übernimmt ConvertAudioToText die automatische Spracherkennung – ganz ohne Konto für den ersten Durchlauf.
FAQ
Welche Transkriptions-Engine ist 2026 die beste für Hinglish?
Deepgram Nova-3 mit language=multi ist die stärkste Option, da Hindi im 10-Sprachen-Code-Switching-Set enthalten ist. Whisper Large-v3 mit language=None ist ein vernünftiger Fallback. Keine aktuelle Engine verarbeitet Hinglish über alle regionalen Akzente hinweg mit hoher Genauigkeit; rechnen Sie bei Hinglish mit mehr manueller Korrektur als bei Spanglish oder französisch-englischen Inhalten. Angaben von 80-90 % Genauigkeit für Hinglish lassen sich anhand unabhängiger Benchmarks nicht überprüfen.
Wie unterscheidet sich das Code-Switching von AssemblyAI von dem von Deepgram?
Für vorab aufgezeichnetes Audio unterstützt AssemblyAI Universal-3 Pro zwei Sprachcodes pro Anfrage, von denen einer Englisch sein muss; die besten Ergebnisse erzielen Sie, wenn die Nicht-Englisch-Sprache dominiert. Deepgram Nova-3 mit language=multi deckt 10 Sprachen ab, ohne dass Englisch eine davon sein muss, und legt keine Zwei-Sprachen-Grenze fest. Für Echtzeit-Streaming bieten beide dedizierte mehrsprachige Streaming-Modelle (AssemblyAI Universal-Streaming für 6 Sprachen, Deepgram Flux für 10 Sprachen), und der Abstand verringert sich. Wählen Sie anhand der Sprachpaare, die Sie benötigen.
Unterstützt AWS Transcribe Code-Switching mitten im Satz?
Die Multi-Language-Erkennung von AWS Transcribe funktioniert gut bei strukturierten zweisprachigen Inhalten, bei denen jede Äußerung in einer Sprache gehalten ist, ist aber bei satzinternem Code-Switching (Mischen innerhalb eines einzelnen Satzes) weniger zuverlässig. Die Funktion erkennt die dominante Sprache pro Audiosegment und transkribiert jedes Segment separat. Für Wechsel mitten im Satz sind Deepgram Nova-3 oder AssemblyAI Universal-3 Pro die bessere Wahl, wenn sich Ihre Sprachpaare überschneiden.
Warum halluziniert Whisper an Sprachgrenzen?
Whispers Decoder erzeugt Text auf Grundlage gelernter Muster aus Trainingsaudio. Wenn der Audioinhalt an einem Sprachwechsel-Punkt mehrdeutig ist (besonders in der Nähe von Stille oder Hintergrundgeräuschen), greift das Modell auf statistisch wahrscheinliche Fortsetzungen zurück statt auf die tatsächlich gesprochene Sprache und produziert plausibel klingenden, erfundenen Text. Vorverarbeitung mit Voice Activity Detection (VAD) entfernt die Stille-Segmente, die dies am ehesten auslösen. Bei wechselintensiven Inhalten sind dedizierte Code-Switch-Modelle weniger anfällig für Grenz-Halluzinationen, weil ihre Architektur das Wechselsignal explizit verarbeitet statt über Musterfortsetzung.
Quellen
- AssemblyAI-Code-Switching-Dokumentation: https://www.assemblyai.com/docs/pre-recorded-audio/code-switching
- AssemblyAI Universal-Streaming Mehrsprachigkeits-Blog: https://www.assemblyai.com/blog/real-time-transcription-code-switches-multilingual-speakers
- Deepgram-Dokumentation zu mehrsprachigem Code-Switching: https://developers.deepgram.com/docs/multilingual-code-switching
- Launch von Deepgram Flux Multilingual (April 2026): https://deepgram.com/learn/deepgram-launches-flux-multilingual-press-release
- Deepgram Nova-3 Multilingual WER-Update (März 2026): https://deepgram.com/learn/nova-3-multilingual-major-wer-improvements-across-languages
- Google Cloud Speech-to-Text Dokumentation zu mehreren Sprachen: https://docs.cloud.google.com/speech-to-text/docs/multiple-languages
- AWS Transcribe Dokumentation zur Spracherkennung: https://docs.aws.amazon.com/transcribe/latest/dg/lang-id.html
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.