
Fremdwörter in Ihrer Transkription korrigieren (Guide 2026)
Summarize this article with:
Ist ein Transkriptionsmodell auf Englisch eingestellt, gibt es fremde Entlehnungen phonetisch als englische Laute wieder. Die Lösung hängt davon ab, wie vorhersehbar diese Wörter sind: Nutzen Sie ein Whisper-basiertes Tool für Treffsicherheit im ersten Durchlauf bei gängigen Lehnwörtern, Keyterm Prompting (Deepgram Nova-3) oder Prompt-Priming (OpenAI Whisper API, AssemblyAI Universal-3 Pro) für fachspezifische Begriffe sowie eine Such-und-Ersetzen-Liste für wiederkehrende Wendungen, die Ihr Tool weiterhin falsch trifft. Enthält ein Inhalt mehr als 10 % Sprache in einer anderen Sprache, behandeln Sie ihn als Code-Switching statt als fremde Entlehnungen.
Die Diagnose lässt sich in einem Satz zusammenfassen: Ihr Transkriptions-Tool wurde angewiesen, auf Englisch zu achten, und schrieb daher „Schadenfreude" als „Shadow in Frood" und „Croissant" als „Crossant". Welche Lösung Sie brauchen, hängt davon ab, ob diese Fremdwörter vorhersehbar sind oder nicht.
Warum Tools im Englischmodus Fremdwörter verhunzen
Wenn ein Transkriptionsmodell für eine einzelne Sprache konfiguriert ist, ordnet es jeden eingehenden Laut dem nächstliegenden Kandidaten aus dem Phoneminventar dieser Sprache zu. Fremdwörter liegen außerhalb dieses Inventars. Das Modell wählt die am ähnlichsten klingende englische Zeichenfolge und macht weiter.
Das ist etwas anderes als vollständiges Code-Switching, bei dem Sprecher über ganze Sätze hinweg zwischen Sprachen wechseln. Fremdwörter in einem ansonsten englischen Transkript sind isolierte Entlehnungen: eine französische Redewendung, ein deutsches Kompositum, ein japanischer Speisebegriff. Das Modell ist auf Englisch eingestellt und gibt die fremden Phoneme in englischer Schrift wieder.
Die gute Nachricht: Whisper Large-v3, trainiert auf rund 680.000 Stunden mehrsprachiger Audiodaten aus 99 Sprachen, erkennt gängige Lehnwörter bereits beim ersten Durchlauf ohne zusätzliche Konfiguration. „Bonjour", „Schadenfreude", „Croissant", „Anime" und „Karaoke" kommen typischerweise korrekt heraus. Die Fehler häufen sich bei selteneren Begriffen, Eigennamen und regionalen Ortsnamen.
Lösung 1: Wählen Sie ein mehrsprachig trainiertes Tool
Die wirksamste einzelne Änderung ist der Wechsel zu einem Tool auf Basis von Whisper Large-v3. Da das Modell Fremdwörter in mehrsprachigen Trainingsdaten gesehen hat, kennt es korrekte Schreibweisen statt bloß phonetischer Schätzungen.
- Whisper-basierte Tools (darunter ConvertAudioToTexts Audio-zu-Text-Tool, die OpenAI Whisper API und selbst gehostetes Whisper): Gängige fremde Entlehnungen in englischen Audios überstehen den Prozess typischerweise unversehrt. „Düsseldorf" kommt mit Umlaut durch; „je ne sais quoi" landet als Französisch statt als phonetisches Englisch.
- Deepgram Nova-3 im Nur-Englisch-Modus: setzt strengere einsprachige Modellierung ein, sodass fremde Lehnwörter ohne zusätzliche Konfiguration schlechter abschneiden (siehe Lösung 3 unten).
- Tools auf Basis der Web Speech API des Browsers: pro Sitzung bewusst auf eine Sprache beschränkt. Fremdwörter werden stark verhunzt, und Abhilfe gibt es nur über einen vollständigen Wechsel der Sitzungssprache.
- Ältere Version Google Cloud STT v1: nur eingeschränkt mehrsprachig; von v2 mit Phrase Sets abgelöst.

Das Audio-Upload-Tool nutzt eine Whisper-basierte Pipeline, die gängige fremde Lehnwörter in englischen Transkripten ohne zusätzliche Konfiguration verarbeitet.
Lösung 2: Suchen und Ersetzen für wiederkehrende Fremdwörter
Für Fremdwörter, die in Ihrer Arbeit immer wieder auftauchen, ist eine Ersetzungsliste die zuverlässigste Lösung – ganz gleich, welches Tool Sie verwenden.
Legen Sie die Liste nach Ihrem ersten Transkript zu einem neuen Thema an:
bone jure → bonjour
say la vee → c'est la vie
jaw da veever → joie de vivre
shadow in frood → schadenfreude
doosseldorf → Düsseldorf
moon ick → Munich
Der Wert der Liste wächst mit jeder Verwendung. Nach einem Dutzend Episoden eines Food-Podcasts haben Sie die französischen Küchenbegriffe, die italienischen Zubereitungsbezeichnungen und die japanischen Gerichtnamen abgedeckt, die immer wiederkehren. Wenden Sie die Liste am Ende jedes Transkripts dieser Reihe als gebündelten Such-und-Ersetzen-Schritt an.
Am besten geeignet ist diese Methode für:
- Podcasts, die regelmäßig bestimmte fremde Küchen, Orte oder Ausdrücke erwähnen
- Business-Meetings, in denen internationale Standorte oder Partner namentlich genannt werden
- Akademische Inhalte, die auf Latein (Medizin, Jura), Deutsch (Philosophie) oder Italienisch (Musik) zurückgreifen
Lösung 3: Keyterm Prompting und Vokabularlisten
Mehrere Transkriptions-APIs erlauben es Ihnen, erwartete Begriffe anzugeben, bevor das Audio verarbeitet wird. Das ist leistungsfähiger als Nachbearbeitung, weil das Modell darauf eingespielt ist, bestimmte Schreibweisen zu erzeugen – keine zufälligen phonetischen Näherungen.
Deepgram Nova-3 Keyterm Prompting (verifiziert über die Deepgram-Dokumentation, geprüft im Juli 2026): Übergeben Sie bis zu 500 Tokens pro Anfrage, rund 100 Wörter. Die Funktion funktioniert sowohl mit einsprachigen als auch mit mehrsprachigen Nova-3-Modellen. Eine Vokabularliste für einen englischen Podcast mit internationalen Gästen könnte so aussehen:
bonjour, croissant, déjà vu, faux pas, je ne sais quoi,
schadenfreude, zeitgeist, wanderlust, kindergarten,
karaoke, ramen, sayonara, piñata, tortilla
Deepgram berichtet, dass Keyterm Prompting die Keyword-Recall-Rate für gelistete Begriffe um bis zu 90 % verbessern kann.
OpenAI Whisper API Prompt-Parameter: Übergeben Sie die erwarteten Fremdwörter und Eigennamen im optionalen Feld prompt. Das Modell berücksichtigt die letzten 224 Tokens dieses Prompts – genug für 30 bis 50 Fremdbegriffe. Bei größeren Listen empfiehlt die OpenAI-Dokumentation stattdessen einen GPT-4-Nachbearbeitungsdurchlauf über das fertige Transkript.
AssemblyAI Universal-3 Pro: Das Modell transkribiert standardmäßig in der dominanten Sprache des Audios. Enthält Ihr englisches Audio französische Phrasen, übersetzt das Modell sie ohne Anweisung möglicherweise ins Englische. Übergeben Sie die explizite Anweisung: „Preserve the original language(s) and script as spoken, including code-switching and mixed-language phrases." Laut AssemblyAIs Dokumentation zum Prompt Engineering zählt Spezifität. Je expliziter die Anweisung, desto weniger interpretiert das Modell eigenmächtig.
Google Cloud STT v2: Mit Phrase Sets geben Sie eine gewichtete Liste erwarteter Wörter mit Boost-Score an. Ein höherer Boost erhöht die Wahrscheinlichkeit einer Übereinstimmung mit der gelisteten Phrase; die Dokumentation weist darauf hin, dass sehr hohe Boost-Werte falsch positive Treffer vermehren können – moderate Werte funktionieren daher bei fremden Eigennamen am besten.
Lösung 4: Manuelle Korrektur mit einer Referenz
Bei unvorhersehbaren Fremdwörtern (ein Gast, der obskure Ortsnamen, regionale Gerichte oder dialektspezifische Ausdrücke erwähnt) ist der manuelle Korrekturdurchlauf die praktikable Wahl.
Der Ablauf: Hören Sie sich das Fremdwort im Kontext an, schlagen Sie die korrekte Schreibweise in Wikipedia, Google Translate oder einem sprachspezifischen Wörterbuch nach und ersetzen Sie den verhunzten Text. Etwa 30 Sekunden pro Wort in üblichen Fällen. Bei Audio voller unvorhersehbarer fremder Bezüge ist das langsam, aber genau. Für den gelegentlich falsch wiedergegebenen Begriff in einem überwiegend englischen Transkript ist es die richtige Entscheidung.
Aufschlüsselung nach Sprachfamilien
Das Fehlermuster ist vorhersehbar genug, dass Sie sich im Voraus darauf einstellen können.
Romanische Sprachen (Französisch, Spanisch, Italienisch, Portugiesisch)
Die Verhunzung folgt phonetisch einem System. Aus „Bonjour" wird „Bone Jure", aus „gracias" wird „graceous", aus „pasta carbonara" wird „pasta carbon era". Die Laute existieren im Englischen; das Modell wählt nur das falsche englische Wort. Suchen-und-Ersetzen deckt diese Fälle gut ab, weil die Fehler über Aufnahmen hinweg konsistent sind.
Deutsch
Umlaute (ä, ö, ü) sind die Hauptfehlerquelle. „Düsseldorf" verliert den Umlaut oder wird zu „Doosseldorf". Komposita können in Einzelwörter zerlegt werden. Ergänzen Sie die korrekten Unicode-Schreibweisen in Ihrem benutzerdefinierten Vokabular oder Ihrer Such-und-Ersetzen-Liste.
Japanisch
Häufige Lehnwörter im Englischen (Sushi, Ramen, Anime, Manga, Karaoke, Sayonara) kommen in Whispers Trainingsdaten ausgiebig vor und werden meist korrekt wiedergegeben. Selteneren japanischen Begriffen, bestimmten regionalen Ortsnamen und Gerichtnamen jenseits des bekannten Kanons geht es schlechter. Diese Stufe meistert benutzerdefiniertes Vokabular.
Chinesisch
Mehrere Romanisierungssysteme (Pinyin und Wade-Giles) bedeuten, dass dasselbe Wort mehrere korrekte Schreibweisen hat. „Beijing" und „Shanghai" funktionieren, weil sie allgegenwärtig sind. „Chongqing", „Xiao long bao" und ähnliche Begriffe werden häufiger verhunzt. Pinyin-Schreibweisen sind in Vokabularlisten sicherer als Wade-Giles, weil sie in modernen Trainingsdaten häufiger vorkommen.
Hindi und südasiatische Sprachen
Gängige Entlehnungen (Curry, Masala, Naan, Samosa, Biryani, Dharma, Karma) werden von Whisper-basierten Tools zuverlässig verarbeitet. Technische Sanskrit-Begriffe und regionale Besonderheiten brauchen benutzerdefiniertes Vokabular.
Arabisch
Häufige Entlehnungen (Falafel, Hummus, Baklava) kommen problemlos durch. Auf unterschiedliche Weise romanisierte Ortsnamen (Al Jazeera vs. Aljazeera) können inkonsistente Ergebnisse liefern. Wenn Sie die bevorzugte romanisierte Schreibweise in Ihre Vokabularliste aufnehmen, wird die Ausgabe verlässlich festgelegt.
Ein praxisnaher Workflow für überwiegend englische Inhalte
Wenn Ihre Inhalte überwiegend englisch sind und nur gelegentlich fremdsprachige Bezüge enthalten:
- Transkribieren Sie mit einem Whisper-basierten Tool. Gängige Lehnwörter kommen beim ersten Durchlauf korrekt heraus.
- Überfliegen Sie das Transkript nach verhunzten Zeichenfolgen. Sie treten gehäuft bei bestimmten fremdsprachigen Quellen auf.
- Führen Sie Suchen-und-Ersetzen für alle wiederkehrenden verhunzten Begriffe aus.
- Nehmen Sie die korrekten Schreibweisen in Ihre Keyterm-/Vokabularliste für dieses Tool auf. Die Liste gilt auch für jedes künftige Transkript im selben Projekt weiter.
- Behandeln Sie unvorhersehbare Einzelfälle manuell mithilfe einer Referenz.
Meine Einschätzung: Die Vokabularliste ist hier die Investition mit dem größten Hebel. Das erste Transkript braucht die meiste Nacharbeit; spätestens beim fünften gibt das Tool die korrekten Schreibweisen der Fremdbegriffe Ihres Fachgebiets automatisch aus.
Bei Inhalten, in denen Fremdwörter dicht stehen oder unvorhersehbar sind, fragen Sie sich, ob das Audio tatsächlich mehrsprachig ist statt Englisch-mit-Entlehnungen. Liegen mehr als etwa 10 % der Sprache in einer anderen Sprache vor, kommen beim Code-Switching-Fix andere Techniken zum Einsatz: Sprachenerkennung pro Segment, Mehrsprachigkeitsmodus und diarisierungsbewusstes Sprach-Tagging.
Tools, die das Problem verschlimmern
Manche Tools kommen mit Fremdwörtern besonders schlecht zurecht:
- Implementierungen der Browser-Web-Speech-API: strikt eine Sprache pro Sitzung. Fremdwörter werden massiv verhunzt, und Abhilfe gibt es nur über einen Wechsel der Sitzungssprache.
- Tools mit aggressiver Sprachenerkennung: Erkennt das Tool zu viele Fremdwörter, kippt es unter Umständen das gesamte Transkript in die Fremdsprache und zerstört damit die englischen Abschnitte. Bei Whisper-basierten Pipelines selten, bei manchen Cloud-STT-Implementierungen aber verbreitet.
- Echtzeit-Untertitelungs-Tools, optimiert auf flüssiges Englisch: Batch-Tools kommen mit fremden Entlehnungen besser zurecht als Live-Untertitelungs-Tools, weil sie die gesamte Äußerung statt Fragmente verarbeiten.
Für gemischtsprachige Arbeit ist Batch-Transkription mit einer Whisper-basierten Pipeline der richtige Ausgangspunkt. Kombinieren Sie diesen Beitrag mit dem Fix für falsch transkribierte Namen, wenn es bei den Fremdwörtern speziell um Eigennamen geht.
Häufige Fragen
Warum schreibt mein Transkriptions-Tool französische Wörter phonetisch statt korrekt?
Ist ein Tool für eine einzige Sprache (Englisch) konfiguriert, ordnet es jeden Laut der nächstliegenden Entsprechung im Vokabular dieser Sprache zu. Französische Phoneme haben kein direktes englisches Äquivalent, also erzeugt das Modell die am ähnlichsten klingende englische Zeichenfolge. Der Wechsel zu einem mehrsprachig trainierten Modell wie Whisper Large-v3 oder Keyterm Prompting bei Deepgram Nova-3 liefert dem Modell stattdessen die Schreibweise, die es ausgeben soll.
Verarbeitet Deepgram Nova-3 Fremdwörter in ansonsten englischem Audio?
Deepgram Nova-3 im Standard-Englisch-Modus erkennt fremde Lehnwörter nicht automatisch. Die Lösung ist Nova-3s Keyterm-Prompting-Funktion: Sie übergeben bis zu 500 Tokens (rund 100 Wörter) erwarteter Begriffe pro Anfrage, und das Modell verstärkt die Erkennung genau dieser Schreibweisen. Für Echtzeit-Code-Switching zwischen Englisch, Spanisch, Französisch, Deutsch, Hindi, Russisch, Portugiesisch, Japanisch, Italienisch und Niederländisch verwenden Sie stattdessen den Nova-3-Multilingual-Modus.
Kann ich den Prompt-Parameter der OpenAI Whisper API für Fremdwortlisten nutzen?
Ja. Der Prompt-Parameter akzeptiert eine Liste der Fremdwörter oder Eigennamen, die Sie im Audio erwarten, und das Modell versucht, diese Schreibweisen zu treffen. Das praktische Limit liegt bei 224 Tokens pro Anfrage – genug für 30 bis 50 Fremdbegriffe. Bei größeren Vokabularen empfiehlt die Whisper-Dokumentation stattdessen einen GPT-4-Nachbearbeitungsdurchlauf über das Transkript.
Wann geht gelegentlicher fremdsprachiger Wortschatz ins Gebiet des Code-Switching über?
Eine brauchbare Schwelle: Liegen mehr als 10 % des Audios in einer anderen Sprache als der Hauptsprache vor, behandeln Sie die Datei als mehrsprachig statt als Englisch-mit-Entlehnungen. Die Fremdwort-Lösungen in diesem Beitrag (Suchen-und-Ersetzen, benutzerdefiniertes Vokabular, Prompt-Priming) funktionieren gut für isolierte Lehnwörter und feste Wendungen. Dauerhaft mehrsprachige Inhalte brauchen einen anderen Ansatz, der im Beitrag zum Code-Switching-Fix behandelt wird.
Quellen
- Deepgram Nova-3 Keyterm-Prompting-Dokumentation (geprüft im Juli 2026)
- Deepgram Nova-3 Erweiterung um zehn neue Sprachen und multilinguales Keyterm Prompting (geprüft im Juli 2026)
- OpenAI Whisper API Speech-to-Text-Leitfaden (geprüft im Juli 2026)
- AssemblyAI Universal-3 Pro Prompt Engineering (geprüft im Juli 2026)
- AssemblyAI Code-Switching-Dokumentation (geprüft im Juli 2026)
- Google Cloud STT Phrase Sets und Modellanpassung (geprüft im Juli 2026)
- OpenAI Whisper GitHub-Repository, Diskussion zur Mehrsprachigkeit (geprüft im Juli 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.