Spanische Transkription: Dialekte, Engines, Genauigkeit 2026
transkriptionspanischsprachen

Spanische Transkription: Dialekte, Engines, Genauigkeit 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202610 min read

Summarize this article with:

TL;DR

Spanisch ist eine Tier-1-Sprache für jede große Transkriptions-Engine, wobei Whisper Large-v3 auf sauberem Audio eine Wortfehlerrate von etwa 3–6 % erreicht und Deepgram Nova-3 eine relative Verbesserung von 21 % gegenüber dem Vorgängermodell verzeichnet. Die Genauigkeitsprobleme, die dennoch bestehen, sind dialektspezifisch: Die karibische S-Aspirierung unterläuft die Wortgrenzen-Erkennung, das rioplatensische Yeísmo rehilado verwirrt Modelle, die auf mexikanischem Spanisch trainiert wurden, und chilenischer Slang liegt weitgehend außerhalb der meisten Trainingskorpora. Die richtige Sprachcode-Einstellung (es, es-419 oder ein lokaler Code wie es-MX) und die Übergabe eines eigenen Vokabulars für Eigennamen lösen die meisten verbleibenden Fehler.

Funktioniert Spanisch gut mit KI-Transkription?

Spanisch ist eine Tier-1-Sprache für jede große Spracherkennungs-Engine, und für die meisten Anwender ist die Frage nicht, ob KI-Transkription funktioniert, sondern welche Dialektmerkmale Fehler verursachen und was anzupassen ist. Whisper Large-v3 erreicht auf sauberem spanischen Audio eine Wortfehlerrate von etwa 3–6 %, nahezu auf Augenhöhe mit Englisch. Deepgram Nova-3 hat seine Spanisch-Unterstützung ausgebaut und eine relative WER-Verbesserung von 21 % gegenüber Nova-2 im Streaming erzielt. AssemblyAIs Universal-3 Pro erkennt alle wichtigen spanischen Dialektgruppen unter einem einzigen es-Code, einschließlich Spanglish. Google Cloud Speech-to-Text führt Spanisch neben Englisch und Mandarin als eine seiner genauesten Sprachen.

Sprache explizit festlegen für beste Genauigkeit bei Spanisch
Sprache explizit festlegen für beste Genauigkeit bei Spanisch

Die Dialektlandschaft: Warum eine einzige „Spanisch“-Einstellung nicht reicht

Spanisch hat über 500 Millionen Muttersprachler in 21 Ländern. Die phonologischen Unterschiede zwischen diesen Regionen erzeugen tatsächlich unterschiedliche Transkriptions-Herausforderungen. Die eigene Dialektfamilie zu bestimmen, bevor Sie einen Workflow einrichten, ist der praktischste erste Schritt.

Kastilisches (iberisches) Spanisch

Kastilisches Spanisch verwendet die Distinción: Die Buchstaben c (vor e/i) und z werden als /th/-Laut realisiert statt als /s/. Madrilenen sagen /thapatería/ für „zapatería“, während jeder lateinamerikanische Sprecher /sapatería/ sagt. Ein überwiegend auf lateinamerikanischen Daten trainiertes Modell kann kastilische Phoneme als Laute mit geringer Konfidenz misslesen und Fehler produzieren, die bei mexikanischem oder kolumbianischem Audio überhaupt nicht auftreten.

Kastilisch verwendet außerdem vosotros für die vertrauliche zweite Person Plural, eine Konjugationsform, die in keiner lateinamerikanischen Variante vorkommt. Manche Engines transkribieren vosotros-Verbformen schnell sprechender junger Sprecher gelegentlich falsch, da diese Formen in gemischten Trainingskorpora seltener auftreten.

Mexikanisches und US-Spanisch

Standardmexikanisches Spanisch ist die dominante Korpus-Sprache in den meisten kommerziellen Trainingssätzen, was es zur zuverlässigsten transkribierbaren lateinamerikanischen Variante macht. Silben sind klar artikuliert, Seseo ist durchgängig (keine Distinción, überall /s/), und tú ist die Standardform der zweiten Person Singular.

US-Spanisch, besonders in bilingualen Communities in Texas, Kalifornien und Florida, beinhaltet häufig Spanglish-Code-Switching: Wechsel mitten im Satz zwischen Spanisch und Englisch („Voy a la store después del meeting“). AssemblyAIs Universal-3 Pro führt Spanglish ausdrücklich als unterstützten Dialekt auf. Mehr dazu, wie moderne Engines mit Sprachwechseln mitten im Satz umgehen, erfahren Sie in Mehrsprachiges Code-Switching in der Transkription beheben.

Karibisches Spanisch

Kubanisches, dominikanisches, puertoricanisches sowie venezolanisches und kolumbianisches Küstenspanisch teilen ein charakteristisches Muster der S-Aspirierung bzw. S-Eliminierung: „estos“ wird in lockerer Sprache etwa zu [ehtoh] oder [etoh]. Dies ist das mit Abstand störendste Merkmal für die Wortgrenzen-Erkennung. Ein Modell, das ein wortanfängliches /s/ erwartet, kann falsch segmentieren, wenn es stattdessen ein aspiriertes [h] hört, und Tokens trennen oder verschmelzen, die getrennte Wörter sein sollten.

Karibisches Spanisch neigt zudem zu schnellerem Sprechtempo und stärkerer Silbenreduktion. Planen Sie bei karibischem Audio, insbesondere bei Gesprächsaufnahmen mit mehreren Sprechern, einen Review-Durchgang ein.

Rioplatensisches Spanisch

Argentinisches und uruguayisches Spanisch bringt zwei ASR-relevante Merkmale mit, die es von allen anderen Varianten abheben.

Erstens das Yeísmo rehilado: Die Buchstaben ll und y werden als /sh/- oder /zh/-Laut realisiert (wie das französische „j“), statt als der anderswo übliche /y/-Laut. „Yo“ klingt wie „sho“, „ella“ wie „esha“. Ein auf mexikanischem Spanisch trainiertes Modell kann diese Laute als gering konfident markieren oder falsch transkribieren.

Zweitens das Voseo: Das Pronomen lautet „vos“ statt „tú“, mit eigenen Verbkonjugationen. „Vos tenés“ statt „tú tienes“, „vos sos“ statt „tú eres“. Voseo kommt auch in Teilen Kolumbiens, Paraguays und Mittelamerikas vor, wobei die Konjugationsmuster je nach Region variieren. ASR-Engines transkribieren Voseo korrekt, wenn die Konjugation in ihren Trainingsdaten vorkommt; das Risiko liegt bei nachgelagerten NLP-Systemen, die Voseo-Verbformen nicht erkennen.

Wenn Sie argentinische Inhalte in großem Volumen produzieren, lohnt es sich, ein finetuntes Whisper-Modell gegen das allgemeine Modell zu evaluieren (der Checkpoint adriszmar/whisper-large-v3-turbo-es auf HuggingFace wurde speziell für argentinisches Spanisch trainiert und senkte die WER im Test von 6,91 % auf 5,34 %).

Andines und chilenisches Spanisch

Das kolumbianische „Paisa“-Spanisch aus Medellín wird weithin als eine der klar gesprochenen Varianten genannt, mit präziser Artikulation und moderatem Tempo. Andines Spanisch lässt sich auf Standardmodellen allgemein gut transkribieren.

Chilenisches Spanisch ist das Gegenteil: hohe Slang-Dichte (po, cachai, weon), schnelles Sprechen, häufige Wortelision und lokale Begriffe, die in den meisten Trainingskorpora nicht vorkommen. Chilenisches Audio profitiert am meisten von einer eigenen Vokabularliste, die Sie Ihrer Engine übergeben. Deepgram Nova-3 unterstützt zu diesem Zweck Keyterm-Prompting mit bis zu 500 Tokens.

Schrift, Zeichen und Interpunktion

Ein korrektes spanisches Transkript bewahrt mehr als die Buchstaben selbst. Der vollständige Zeichensatz umfasst:

  • Akzentuierte Vokale: á, é, í, ó, ú. Diese ändern in vielen Fällen die Bedeutung: „continúo“ (ich fahre fort), „continuo“ (fortlaufend) und „continuó“ (er/sie fuhr fort) sind drei grammatikalisch verschiedene Formen, die ohne Akzent identisch geschrieben werden.
  • Ñ: ein eigenständiger Buchstabe, kein stilisiertes n. „Año“ (Jahr) und „ano“ (Anus) sind nicht das gleiche Wort.
  • Ü: kommt in Wörtern wie „pingüino“ und „bilingüe“ vor, wo die Diärese signalisiert, dass das u nach g ausgesprochen und nicht stumm ist.
  • Umgedrehte Satzzeichen: ¿ leitet eine Frage ein, ¡ einen Ausruf. Ihr Fehlen behindert zwar nicht das Verständnis, kennzeichnet die Ausgabe aber als typografisch nicht standardkonformes Spanisch.

Whisper Large-v3 wurde auf korrekt interpunktiertem spanischem Text trainiert und stellt Akzente und umgedrehte Satzzeichen bei sauberem Audio automatisch wieder her. Wenn Ihre Ausgabe „como estas“ statt „¿cómo estás?“ liefert, ist die Engine entweder von älterer Generation oder die Audioqualität ist zu niedrig für eine sichere Platzierung der Diakritika. Ein Schritt zur Rauschunterdrückung oder Normalisierung vor der Transkription hilft bei verrauschten Quelldateien.

Sprachcodes: Was Sie Ihrer Engine übergeben

Die Sprache explizit festzulegen, statt auf die automatische Erkennung zu setzen, spart einen Verarbeitungsdurchlauf und verbessert die Genauigkeit bei Dialekten mit starkem Akzent.

EngineSpanisch (Spanien)Lateinamerikanisches Spanisch
Whisper / OpenAI APIeses (Dialekt intern behandelt)
Deepgram Nova-3eses-419 (BCP 47 für Lateinamerika)
AssemblyAI Universal-3 Proeses (Dialekt intern behandelt)
Google Cloud STTes-ESes-MX, es-AR, es-CO und 10+ Locale-Codes
Rev.ai (Reverb)eses

Googles länderspezifische Codes bieten die größte Kontrolle, wenn Ihr Audio eindeutig aus einem Land stammt. Deepgrams es-419 (der ISO-Standardcode für lateinamerikanisches Spanisch) ist ein sinnvoller Mittelweg, wenn Inhalte lateinamerikanische Varianten mischen. Whisper und AssemblyAI behandeln Dialektvariation intern, ohne dass ein Sub-Code nötig ist, was die Pipeline-Einrichtung vereinfacht.

Welche Engines die umfassendste Spanisch-Unterstützung bieten

Jede große Engine unterstützt Spanisch auf Tier-1-Niveau. Die Unterschiede zeigen sich in der dialektspezifischen Tiefe, der Code-Switching-Unterstützung und den Tools für Eigennamen.

EngineSpanisch-TierDialekt-CodesCode-SwitchingUnterstützung für Eigennamen
Deepgram Nova-3Tier 1 (21 % WER-Verbesserung ggü. Nova-2)es, es-419Echtzeit, Mix aus 10 SprachenKeyterm-Prompting, bis zu 500 Tokens
AssemblyAI Universal-3 ProTier 1es (Auto-Dialekt)Spanglish ausdrücklich aufgeführtEigenes Vokabular
Whisper Large-v3Tier 1 (ca. 3–6 % WER bei sauberem Audio)esErkennung an SatzgrenzenEigener Initial-Prompt
Google Cloud STTTier 110+ länderspezifische CodesMehrsprachiges ModellPhrasenhinweise
Rev.ai (Reverb)Tier 1esNicht nativ dokumentiertVokabular-Boosting

Bei detaillierten Vergleichen der Transkriptionsgenauigkeit auf API-Ebene sind alle fünf Engines bei sauberem Spanisch mit einem Sprecher konkurrenzfähig. Die Lücken zeigen sich bei verrauschtem Audio, sich überschneidenden Sprechern und schnellem karibischem oder chilenischem Sprechen. Für einen tieferen Blick auf Deepgrams Architektur und was die Nova-3-Verbesserungen in der Praxis bedeuten, siehe Deepgram Nova-3 erklärt.

Höflichkeitsregister und die Usted/Tú/Vos-Frage

Geschriebenes und gesprochenes Spanisch pflegt in verschiedenen Gemeinschaften drei aktive Pronomen der zweiten Person Singular: (informell, panhispanisch), usted (formell, panhispanisch) und vos (rioplatensisch, mittelamerikanisch, Teile Kolumbiens). Jedes davon verwendet eigene Verbkonjugationen.

ASR-Engines transkribieren das Gesprochene, sodass das Register korrekt in der Ausgabe erscheint, wenn der Sprecher es verwendet. Das Risiko liegt nachgelagert: Wenn Sie Transkripte in ein LLM zur Zusammenfassung oder in einen Suchindex einspeisen, können Voseo-Konjugationen („vos tenés“, „vos fuiste“) inkonsistente Ergebnisse erzeugen, wenn das nachgelagerte Modell nicht auf rioplatensischen Mustern trainiert wurde.

Bei kolumbianischem und peruanischem Geschäftsaudio wird usted deutlich häufiger verwendet als in Spanien oder Mexiko, sogar in Gesprächen unter Gleichrangigen. Das beeinträchtigt die Transkriptionsqualität nicht, spielt aber eine Rolle, wenn Sie Formalität oder Tonalität aus dem Transkript analysieren.

Umgang mit Spanglish und Code-Switching

Bilinguale Sprecher von US-Spanisch wechseln oft auf Phrase- oder Wortebene innerhalb eines einzelnen Satzes zwischen Spanisch und Englisch. „Voy a la store después del meeting“ akkurat zu transkribieren erfordert Spracherkennung unterhalb der Satzebene.

Whisper bewältigt Code-Switching an Satzgrenzen standardmäßig. Bei aggressivem Wechseln innerhalb des Satzes ergibt das Festlegen der Sprache auf Spanisch ein Best-Effort-Transkript, bei dem englische Wörter manchmal phonetisch wiedergegeben werden. AssemblyAI Universal-3 Pro unterstützt Spanglish ausdrücklich als anerkannten Dialekt. Deepgram Nova-3 unterstützt Echtzeit-Code-Switching zwischen Spanisch und Englisch innerhalb seines 10-Sprachen-Sets.

Eine kurze Überprüfung in der Nachbearbeitung löst die meisten verbleibenden Probleme. Mehrsprachiges Code-Switching in der Transkription beheben behandelt praktische Ansätze zur Bereinigung gemischtsprachiger Ausgaben ausführlicher.

Sprecher-Labels in spanischen Gesprächen

Die Sprecherdiarisierung läuft unabhängig von der Sprache auf demselben zugrunde liegenden Modell, doch Sprechmuster beeinflussen die Ergebnisse. Spanische Sprecher überlappen sich in formellen Interviews tendenziell weniger, doch informelle rioplatensische und karibische Gespräche bringen mehr Unterbrechungen und gleichzeitiges Sprechen mit sich.

Bei einem spanischen Zweisprecher-Interview mit minimaler Überlappung ist die Diarisierungsgenauigkeit hoch. Bei einer Diskussionsrunde mit vier Personen, in der mehrere karibische Sprecher sich gegenseitig die Sätze zu Ende führen, planen Sie einen Review-Durchgang zur Sprecherzuordnung ein. Die Kernmechanik der Sprecherdiarisierung funktioniert in allen Sprachen identisch.

Häufige spanischspezifische Genauigkeitsprobleme und Lösungen

S-Aspirierung im karibischen Spanisch: „estos libros“ kann falsch segmentiert werden, wenn das Modell ein wortanfängliches /s/ erwartet, aber ein aspiriertes [h] hört. Lösung: Testen Sie ein Modell mit expliziter Unterstützung karibischer Dialekte (AssemblyAI Universal-3 Pro führt karibisches Spanisch auf) oder führen Sie einen Normalisierungsschritt in der Nachbearbeitung durch.

Akzente fehlen in der Ausgabe: Die Engine ist entweder von älterer Generation oder die Audioqualität reicht für eine sichere Platzierung der Diakritika nicht aus. Ein Schritt zur Rauschunterdrückung vor der Transkription hilft bei verrauschten Quelldateien.

Verwirrung durch Yeísmo rehilado im Rioplatensischen: Der /sh/-Laut für ll/y ist in den meisten allgemeinen spanischen Trainingskorpora unterrepräsentiert. Für argentinische Inhalte in großem Volumen zeigt der finetunte Checkpoint adriszmar/whisper-large-v3-turbo-es eine messbare WER-Verbesserung bei dieser Variante.

Eigennamen und Markennamen: Spanische Eigennamen (García Márquez, Iñárritu, Añejo) kombinieren Akzentzeichen mit ungewöhnlichen Buchstabenfolgen. Die Übergabe eines eigenen Vokabulars oder einer Keyterm-Liste an Ihre Engine reduziert Schreibfehler erheblich.

Was kostet die spanische Transkription?

Spanisch wird bei keiner großen API anders bepreist als Englisch. Sie zahlen denselben Modelltarif, unabhängig von der Sprache.

Otter.ais Pro-Plan kostet 16,99 US-Dollar pro Monat (bzw. 8,33 US-Dollar pro Monat bei jährlicher Abrechnung) und umfasst 1.200 Minuten pro Monat. Trint startet bei einem Abo-Tarif für 7 Dateien pro Monat. Rev.ais Reverb-Modell kostet 0,20 US-Dollar pro Stunde für vorab aufgezeichnetes Audio. Für eine vollständige Gegenüberstellung, wie nutzungsbasierte und Pauschalpreise bei unterschiedlichen Nutzungsvolumina abschneiden, siehe Transkriptions-Preisvergleich 2026.

Wenn Sie lediglich ein sauberes spanisches Transkript ohne Meeting-Bot oder Sitzplatzlizenz brauchen, verarbeitet ConvertAudioToText jeden Dialekt mit Sprecher-Labels, Ausgabe der akzentuierten Zeichen und allen gängigen Exportformaten. Kostenlos für die ersten 10 Minuten ohne Anmeldung; ein kostenloses Konto erhält zusätzlich einmalig bei der Registrierung 10 Transkriptionsminuten, unbegrenzt ab 9,99 US-Dollar pro Monat.

FAQ

Funktioniert KI-Transkription gut für Spanisch?

Ja. Spanisch ist eine Tier-1-Sprache für Whisper, Deepgram Nova-3, AssemblyAI und Google Cloud Speech-to-Text. Whisper Large-v3 erreicht auf sauberem spanischen Audio eine Wortfehlerrate von etwa 3–6 %. Die Herausforderungen sind dialektspezifisch: karibische S-Aspirierung, rioplatensisches Yeísmo rehilado und chilenischer Slang verursachen bei allgemeinen Modellen mehr Fehler als standardmäßiges mexikanisches oder kastilisches Spanisch.

Was ist der Unterschied zwischen Seseo und Distinción bei der Transkription?

Seseo (ganz Lateinamerika, Teile Südspaniens): /s/ ist der einzige Zischlaut, daher klingen „caza“ und „casa“ identisch. Distinción (Zentral- und Nordspanien): /s/ und der /th/-Laut sind unterschiedliche Phoneme. Hauptsächlich auf lateinamerikanischen Korpora trainierte Engines können kastilische /th/-Laute missdeuten, was die Confidence-Werte für iberisches Spanisch senkt.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles