
Tagalog- und Filipino-Transkription 2026: Das Taglish-Problem
Summarize this article with:
Reines Tagalog wird in der Produktion inzwischen gut unterstützt: Deepgram Nova-3 hat Tagalog im Januar 2026 ergänzt, AssemblyAI deckt es ab, und Google Cloud unterstützt fil-PH seit Chirp. Das verbleibende Problem ist Taglish: das allgegenwärtige Code-Switching zwischen Tagalog und Englisch bringt Engines immer noch ins Straucheln, die sich pro Segment auf eine Sprache festlegen. Bei gemischtem Audio solltest du eine Engine mit Code-Switching-Unterstützung nutzen und damit rechnen, Fehler an Sprachgrenzen zu korrigieren. Callcenter-Teams sollten mit ihrem eigenen Taglish-Audio testen.
Kurzantwort
Die großen KI-Transkriptions-Engines unterstützen Tagalog inzwischen produktiv. Deepgram Nova-3 hat Tagalog (tl) im Januar 2026 ergänzt, AssemblyAIs Universal-2 deckt es ab, und Google Cloud Speech-to-Text unterstützt fil-PH seit dem Rollout von Chirp. Die reine Tagalog-Genauigkeit ist nicht mehr das Hauptproblem. Was bleibt, ist Taglish, das allgegenwärtige Code-Switching zwischen Tagalog und Englisch, das die Sprechweise der meisten urbanen Filipinos prägt und bei dem KI-Engines immer noch auf vorhersehbare Weise ins Straucheln geraten.
Filipino vs. Tagalog: Erst mal den Namen richtig machen
Tagalog ist die Muttersprache von rund 28 bis 33 Millionen Filipinos, vor allem in Metro Manila, Batangas, Bulacan, Laguna und Cavite. Filipino, die standardisierte Nationalsprache, die in der Verfassung von 1987 festgeschrieben wurde, basiert auf Tagalog, zieht aber offiziell Vokabular aus allen philippinischen Sprachen sowie aus spanischen und englischen Lehnwörtern.
Für die praktische Transkription spielt der Unterschied kaum eine Rolle: Filipino und Tagalog sind gegenseitig verständlich, Grammatik und Phonologie sind identisch, und das KI-Modell, das du verwendest, bedient beides. Die Namensinkonsistenz wird eher auf API-Ebene zum Thema. Google Cloud nutzt fil-PH (Filipino, Philippinen). Deepgram verwendet tl (Tagalog, ISO 639-1). AssemblyAI dokumentiert die Sprache als „Tagalog". Je nach Engine musst du vielleicht mit beiden Codes experimentieren.
Noch eine Namensklärung: Cebuano (Bisaya), Ilocano und Hiligaynon sind eigenständige philippinische Sprachen, keine Dialekte des Tagalog. Tagalog-Dialekte im engeren Sinne sind regionale Varianten des Tagalog selbst: Manila, Batangas, Bulacan und Marinduque. Das ist relevant, weil KI-Modelle, die auf Manila-Tagalog trainiert sind, bei Sprechern aus Batangas (bekannt für eine charakteristische Intonationsweise) abdriften und bei Cebuano oder Ilocano, die komplett andere Sprachen sind, schlicht scheitern.
Die Schrift: Nur Latein, mit einer Fußnote zu Baybayin
Moderne Filipino- und Tagalog-Sprachversionen verwenden das lateinische Alphabet. Wörter spanischen Ursprungs behalten ihre spanische Schreibweise (Niño, mañana). Englische Entlehnungen behalten ihre englische Schreibweise. Jede große KI-Transkriptions-Engine gibt Tagalog in lateinischer Schrift aus, was dem standardmäßig geschriebenen Filipino entspricht.
Baybayin, die vorkoloniale Silbenschrift, taucht in kulturellen Kontexten auf: bei Uni-Abschlussfeiern an der UP Diliman, in Tattoo-Kunst und gelegentlich in zeitgenössischer Poesie. Das National Writing System Act von 2018 förderte ihre Erhaltung. All das ergibt keinen praktischen Anwendungsfall für Transkription. Keine Produktions-ASR-Engine verarbeitet Baybayin-Audioeingaben, und fast keine Audioinhalte verwenden sie als Hauptschrift.
Wo die Engines im Jahr 2026 stehen
Deepgram Nova-3 hat Tagalog (tl) im Januar 2026 als produktionsunterstützte einsprachige Sprache hinzugefügt. Das Angebot umfasst Sprecher-Diarisierung, Echtzeit-Streaming mit unter 300 ms Latenz, Keyterm-Prompting für Markennamen und Fachbegriffe, intelligente Zeichensetzung und Segmentierung auf Äußerungsebene. Das Preismodell ist nutzungsbasiert ohne Tagalog-spezifischen Aufschlag: vorab aufgezeichnetes Audio kostet etwa $0.0048/min und Streaming etwa $0.0077/min zu Standardtarifen, mit einem $200-Guthaben für neue Konten.
AssemblyAI Universal-2 deckt Tagalog in der von der Firma dokumentierten Stufe „Good accuracy" ab, was eine Wortfehlerrate zwischen 10% und 25% bei typischem Audio bedeutet. Der Basistarif liegt bei $0.15/Stunde für vorab aufgezeichnete Transkription, mit Zusatzoptionen für Sprecher-Diarisierung, Stimmungsanalyse und Zusammenfassung. Tagalog fällt unter AssemblyAIs Mehrsprachigkeits-Support zum gleichen Basistarif.
Google Cloud Speech-to-Text unterstützt Filipino über den Sprachcode fil-PH sowohl auf den Modellen Chirp als auch Chirp_2. Der Standardpreis startet bei $0.016/Minute (etwa $0.96/Stunde), mit einer Dynamic-Batch-Option für etwa ein Viertel davon bei nicht zeitkritischen Workloads. Neue GCP-Konten erhalten $300 an kostenlosem Guthaben.
Speechmatics gibt für Tagalog eine Wortgenauigkeit von bis zu 96 % an, trainiert auf Dialekten und Akzenten und räumt explizit ein, dass in der Modellschulung „häufiges Code-Switching mit Englisch“ berücksichtigt wird. Konkrete WER-Benchmarks für Taglish werden allerdings nicht veröffentlicht.
| Engine | Sprachcode | Funktionen | Ungefährer Preis |
|---|---|---|---|
| Deepgram Nova-3 | tl | Streaming, Diarisierung, Schlüsselbegriffe | 0,0048 $/Minute (vorab aufgezeichnet) |
| AssemblyAI Universal-2 | tl | Diarisierung, Sentiment, Zusammenfassungen | 0,15 $/Stunde (Basis) |
| Google Cloud (Chirp) | fil-PH | Streaming, Diarisierung | 0,016 $/Minute (Standard) |
| Speechmatics | Tagalog | Diarisierung, Akzente | Preis auf Anfrage |
| OpenAI Whisper Large-v3 | tl | Lokal/Self-Hosted | Nur Rechenkosten |
Für einen breiteren Überblick über die Kosten dieser Engines siehe Sprach-zu-Text-API-Preise 2026 und Deepgram Nova-3 erklärt.
Das eigentliche Problem: Taglish
Die Engine-Unterstützung für Tagalog ist inzwischen solide. Das Problem ist, dass die meisten philippinischen Sprachaufnahmen kein reines Tagalog sind. Es ist Taglish.
Taglish (manchmal auch Englog) ist intrasententielles Code-Switching zwischen Tagalog und Englisch. Für urbane, gebildete Filipinos ist es keine Stilfrage oder ein Zeichen unvollständiger Sprachbeherrschung, sondern der normale Sprachgebrauch. Eine Journalistin schreibt vielleicht: „Sa GMA 'yung objectivity has become part na of the culture.“ Ein Meeting-Teilnehmer sagt: „Yung deliverable natin ngayon, can we move it to Friday?“ Ein Elternteil sagt zum Kind: „Mommy, I don't want to. It's so hirap eh.“
Die tiefere Herausforderung ist morphologischer Natur. Tagalog ist agglutinierend: Das Verbalsystem beruht auf einem dichten System aus Präfixen, Suffixen, Infixen und Zirkumfixen (mag-, nag-, -in-, -an, pag-...-an, -um-), um Fokus, Aspekt und Diathese zu kodieren. Wenn englische Verben in dieses System eintreten, werden sie flektiert:
- „Nag-meeting kami“ (Wir hatten ein Meeting)
- „I-submit mo na“ (Reich es schon ein)
- „Magda-drive siya bukas“ (Sie fährt morgen)
- „Nagse-sweat na ako“ (Ich habe schon geschwitzt)
- „The meeting will start na“ (ein Tagalog-Partikel, der an einen englischen Satz angehängt wird)
Für eine ASR-Engine ist jede dieser hybriden Formen ein neues Token, das im Trainingsvokabular auftauchen kann oder auch nicht. Ein Modell, das mit einem reinen Tagalog-Korpus trainiert wurde, behandelt „mag-meeting“ vielleicht als zwei getrennte Token oder transkribiert die englische Wurzel falsch. Ein Modell, das hauptsächlich mit Englisch trainiert wurde, lässt das Tagalog-Präfix womöglich ganz weg. Beides ist nicht korrekt.

Das ist vor allem in der Branche wichtig, die die meisten Filipinos mit Audioarbeit beschäftigt: der BPO- und Callcenter-Sektor.
Der Callcenter-Winkel
Die philippinische BPO-Branche hat 2025 rund 38 Milliarden Dollar Umsatz erzielt und beschäftigt über 1,5 Millionen Menschen, ein erheblicher Teil davon in der sprachbasierten Kundenbetreuung für US-, australische und britische Kunden. Diese Agenten sprechen am Telefon das, was man als „professionelles philippinisches Englisch“ bezeichnen könnte, aber ihre internen Schulungen, Team-Besprechungen, Qualitätssicherungsaufnahmen und Eskalations-Nachbesprechungen laufen auf Taglish.
Das schafft eine erhebliche Transkriptionslücke. Die eingehenden englischsprachigen Anrufe transkribiert jede moderne Engine genau. Die interne operative Audioaufnahme, in der das eigentliche institutionelle Wissen steckt, ist Taglish und viel schwerer korrekt zu transkribieren. Menschliche Transkriptionsdienste auf den Philippinen verlangen für diese Arbeit 0,50 bis 1,20 Dollar pro Audiominute, wobei Operatoren, die selbst Muttersprachler in Taglish sind, die KI-Ausgabe gegenprüfen.
Für QA im Callcenter und Besprechungsdokumentation in großem Umfang siehe Meeting-Transkriptionstools und So erstellen Sie Besprechungsnotizen aus Audio. Der Beitrag Sprecher-Diarisierung erklärt behandelt, warum die Sprecherkennzeichnung bei Mehrteilnehmer-Anrufaufnahmen besonders wertvoll ist.
Was funktioniert und was nicht
Basierend auf den strukturellen Herausforderungen oben, hier ist, was Sie von aktuellen Engines bei verschiedenen Tagalog-Inhaltstypen erwarten können:
Formales Tagalog (Nachrichtensprechweise, politische Reden, akademische Vorlesungen): Aktuelle Engines schneiden hier am besten ab. Der Wortschatz ist standardisierter, das Sprechtempo kontrolliert und Code-Switching minimal. Erwarten Sie genaue Ergebnisse mit leichter Nachbearbeitung.
Lässiges urbanes Tagalog/Taglish (YouTube-Vlogs, Podcasts, Social-Media-Inhalte): Höhere Code-Switching-Dichte bedeutet mehr hybride Token. Die englischen Abschnitte werden gut transkribiert; die tagalog-affigierten englischen Konstruktionen sind die Stellen, an denen sich Fehler häufen. Planen Sie mehr Bearbeitungsaufwand ein.
Regionales akzentuiertes Tagalog (Batangas, Bulacan, Cavite): Das sind Tagalog-Dialekte mit eigenen Intonationsmustern. Die Trainingsdaten der Engines neigen stark zu Manila-Tagalog (Medien aus Metro Manila dominieren). Bei starken regionalen Akzenten sinkt die Genauigkeit etwas.
Interne Audioaufnahmen aus Callcentern (Team-Besprechungen, QA-Reviews, Schulungen): Dichtes Taglish, schnelles Sprechtempo, überlappende Sprecher, Branchenjargon. Das ist die schwierigste Kategorie. Die Genauigkeit aktueller Engines ist durch keine veröffentlichten Benchmarks belegt; menschliche Überprüfung bleibt der Standard für alles, was Konsequenzen hat.
Für einen Vergleich mit einer anderen südostasiatischen Sprache mit ähnlicher Code-Switching-Dynamik siehe Indonesische Bahasa-Transkription, wo gemischt-registriges Jakartan-Sprechen ähnliche Herausforderungen bietet.
Meine Einschätzung
Die Geschichte änderte sich 2026. Vor einem Jahr war die praktische Antwort auf „Kann ich Tagalog transkribieren?“ noch „mit erheblichen Einschränkungen“. Heute unterstützen Engines wie Deepgram Nova-3 und AssemblyAI Universal-2 Tagalog in Produktionsumgebungen, inklusive Diarisierung und Echtzeit-Streaming. Die Verbesserung bei reiner Tagalog-Unterstützung ist real.
Was sich nicht geändert hat: Taglish bleibt wirklich schwierig, aus strukturellen linguistischen Gründen, die nicht gelöst werden, indem man Tagalog einfach zur Sprachliste eines Modells hinzufügt. Die morphologische Integration von Englisch in die tagalogische Grammatik erzeugt Token-Ebene-Mehrdeutigkeiten, die ASR-Systeme, die separat für jede Sprache trainiert wurden, aus dem Tritt bringen. Jeder Inhalt, der überwiegend Taglish ist, sollte unabhängig von der verwendeten Engine als Fall behandelt werden, der eine leichte menschliche Überprüfung erfordert.
Wenn Sie ein sauberes Transkript für Tagalog- oder Taglish-Audio benötigen, ohne eine eigene API-Pipeline aufzubauen, übernimmt ConvertAudioToText Audio-Uploads mit Sprecherkennzeichnung und liefert ein korrigiertes, formatiertes Transkript, das Sie direkt herunterladen können.
Für Taglish-lastige Inhalte, bei denen Genauigkeit entscheidend ist (rechtliche, medizinische oder öffentliche Aufzeichnungen), kombinieren Sie die KI-Ausgabe mit einem muttersprachlichen Taglish-Korrekturleser.
FAQ
Was ist der Unterschied zwischen Filipino und Tagalog für Transkriptionszwecke?
Filipino ist die standardisierte Nationalsprache der Philippinen, offiziell auf Tagalog basierend, mit Vokabular aus anderen philippinischen Sprachen, Spanisch und Englisch. In der Praxis sind die beiden für die Transkription funktional gleich. Der Hauptunterschied liegt auf API-Ebene: Google Cloud verwendet den Code fil-PH, während Deepgram und OpenAI Whisper tl verwenden. Testen Sie beide Codes mit Ihrer Engine; die Ergebnisse sind typischerweise identisch.
Welche KI-Engine ist 2026 am besten für Tagalog-Transkription geeignet?
Deepgram Nova-3 (Code tl) hat im Januar 2026 Tagalog mit Streaming-Unterstützung und Keyterm-Prompting ergänzt. AssemblyAI Universal-2 deckt ebenfalls Tagalog ab und bietet Zusammenfassungsfunktionen. Google Cloud Speech-to-Text unterstützt fil-PH auf Chirp und Chirp_2. Alle drei sind produktionsreif für sauberes, klares Tagalog-Audio. Bei stark gemischtem Taglish-Inhalt hat kein Anbieter direkte Vergleichstests veröffentlicht, also plane, mit deinem eigenen Audiomaterial zu evaluieren.
Warum bringt Taglish KI-Transkription ins Straucheln?
Taglish kombiniert Tagalogs agglutinierende Morphologie mit englischem Wortschatz. Filipino-Sprecher hängen tagalogische Verbpräfixe und Infixe an englische Wurzeln: „nag-meeting", „i-submit", „magda-drive". Jede dieser Hybridformen ist ein neues Token. Ein Modell, das hauptsächlich mit Tagalog trainiert wurde, kann die englische Wurzel falsch segmentieren; ein Modell, das hauptsächlich mit Englisch trainiert wurde, kann das Tagalog-Präfix weglassen. Das Ergebnis sind Substitutionsfehler, die sich genau auf die informationsreichen Taglish-Konstruktionen konzentrieren.
Sind Cebuano, Ilocano und andere philippinische Sprachen für die Transkription dasselbe wie Tagalog?
Nein. Cebuano (Bisaya), Ilocano, Hiligaynon und die anderen Regionalsprachen der Philippinen sind eigenständige Sprachen, keine Dialekte von Tagalog. Die Auswahl von tl oder fil-PH in einem Anbieter liefert für Cebuano-Audio keine brauchbaren Ergebnisse. Diese Sprachen haben eine deutlich eingeschränktere KI-Transkriptionsunterstützung als Tagalog und fallen in die Kategorie der wirklich ressourcenarmen Sprachen. Siehe warum KI mit ressourcenarmen Sprachen kämpft für die strukturellen Gründe hinter dieser Lücke.
Quellen
- Deepgram: Tagalog-Spracherkennung
- Deepgram: Nova-3 fügt 12 neue Sprachen hinzu
- Deepgram: Preise
- AssemblyAI: Unterstützte Sprachen
- AssemblyAI: Preise
- Google Cloud: Speech-to-Text unterstützte Sprachen (V2)
- Google Cloud: Speech-to-Text Preise
- Speechmatics: Tagalog Speech to Text
- Otter.ai: Preise
- Wikipedia: Taglish
- Wikipedia: Tagalog-Sprache
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.