
Transcripción de tagalo y filipino en 2026: el problema del taglish
Summarize this article with:
El tagalo puro ya tiene buen soporte en producción: Deepgram Nova-3 añadió tagalo en enero de 2026, AssemblyAI lo cubre y Google Cloud soporta fil-PH desde Chirp. El problema restante es el taglish: el cambio de código generalizado entre tagalo e inglés sigue haciendo tropezar a los motores que se fijan en un solo idioma por segmento. Para audio mixto, usa un motor con soporte de cambio de código y prepárate para corregir errores de límite de idioma; los equipos de centros de llamadas deberían hacer pruebas con su propio audio taglish.
Quick Answer
Los principales motores de transcripción por IA ya admiten tagalo en producción. Deepgram Nova-3 añadió el tagalo (tl) en enero de 2026, el Universal-2 de AssemblyAI lo cubre, y Google Cloud Speech-to-Text lo soporta con fil-PH desde el despliegue de Chirp. La precisión con tagalo puro ya no es el problema principal. El reto que queda es el taglish, el cambio de código omnipresente entre tagalo e inglés que define cómo hablan de verdad la mayoría de los filipinos urbanos, y que todavía hace tropezar a los motores de IA de maneras predecibles.
Filipino vs. Tagalo: acierta con el nombre primero
El tagalo es la primera lengua de unos 28-33 millones de filipinos, sobre todo en Metro Manila, Batangas, Bulacan, Laguna y Cavite. El filipino, la lengua nacional estandarizada recogida en la Constitución de 1987, se basa en el tagalo pero oficialmente toma vocabulario de todas las lenguas de Filipinas y de préstamos del español y del inglés.
Para la transcripción práctica, la distinción casi nunca importa: el filipino y el tagalo son mutuamente inteligibles, la gramática y la fonología son las mismas, y el modelo de IA que uses sirve para ambos. La inconsistencia en el nombre importa más a nivel de API. Google Cloud usa fil-PH (filipino, Filipinas). Deepgram usa tl (tagalo, ISO 639-1). AssemblyAI documenta el idioma como "Tagalog". Puede que necesites probar con ambos códigos según el motor.
Una aclaración más sobre nombres: el cebuano (bisaya), el ilocano y el hiligaynon son lenguas filipinas independientes, no dialectos del tagalo. Los dialectos del tagalo, en sentido estricto, son variantes regionales del propio tagalo: Manila, Batangas, Bulacan y Marinduque. Esto importa porque los modelos de IA entrenados con tagalo de Manila se desvían con hablantes de Batangas (conocidos por un patrón de entonación distintivo), y fallan por completo con el cebuano o el ilocano, que son lenguas totalmente diferentes.
La escritura: solo latina, con una nota al pie sobre el baybayin
El filipino y el tagalo modernos usan el alfabeto latino. Las palabras de origen español conservan su ortografía española (Niño, mañana). Los préstamos del inglés mantienen la ortografía inglesa. Todos los grandes motores de transcripción por IA generan escritura latina para el tagalo, lo que coincide con el filipino escrito estándar.
El baybayin, la escritura silábica precolonial, aparece en contextos culturales: bandas de graduación universitaria en UP Diliman, arte de tatuajes y poesía contemporánea ocasional. La Ley del Sistema Nacional de Escritura de 2018 impulsó su preservación. Nada de esto crea un caso práctico de transcripción. Ningún motor ASR de producción maneja entrada de audio en baybayin, y casi ningún contenido de audio lo usa como escritura principal.
Dónde están los motores en 2026
Deepgram Nova-3 añadió el tagalo (tl) como idioma monolingüe con soporte de producción en enero de 2026. La oferta incluye diarización de hablantes, streaming en tiempo real con menos de 300 ms de latencia, prompting de términos clave para nombres de marca y términos de dominio, puntuación inteligente y segmentación a nivel de enunciado. El modelo de precios es de pago por uso sin recargo específico para tagalo: el audio pregrabado ronda los $0.0048/min y el streaming unos $0.0077/min a tarifas estándar, con un crédito gratuito de $200 para cuentas nuevas.
AssemblyAI Universal-2 cubre el tagalo en lo que la empresa documenta como su nivel de "buena precisión", lo que implica una tasa de error de palabra entre el 10% y el 25% en audio típico. Su tarifa base es de $0.15/hora para transcripción pregrabada, con complementos para diarización de hablantes, análisis de sentimiento y resúmenes. El tagalo califica para el soporte multilingüe de AssemblyAI a la misma tarifa base.
Google Cloud Speech-to-Text admite el filipino mediante el código de idioma fil-PH tanto en los modelos Chirp como Chirp_2. El precio estándar empieza en $0.016/minuto (unos $0.96/hora), con una opción de lote dinámico a aproximadamente una cuarta parte de esa cifra para cargas de trabajo que no dependen del tiempo. Las cuentas nuevas de GCP reciben $300 en créditos gratuitos.
Speechmatics claims up to 96% word accuracy for Tagalog, trains on dialects and accents, and explicitly acknowledges "frequent code-switching with English" in its model training, though specific Taglish WER benchmarks are not published.
| Engine | Language Code | Features | Approx. Price |
|---|---|---|---|
| Deepgram Nova-3 | tl | Streaming, diarization, keyterms | $0.0048/min pre-recorded |
| AssemblyAI Universal-2 | tl | Diarization, sentiment, summaries | $0.15/hr base |
| Google Cloud (Chirp) | fil-PH | Streaming, diarization | $0.016/min standard |
| Speechmatics | Tagalog | Diarization, accents | Contact for pricing |
| OpenAI Whisper Large-v3 | tl | Local/self-hosted | Compute cost only |
For a broader view of how these engine costs compare, see speech-to-text API pricing in 2026 and Deepgram Nova-3 explained.
The Real Problem: Taglish
Engine support for Tagalog is now solid. The problem is that most Filipino speech isn't pure Tagalog. It's Taglish.
Taglish (sometimes Englog) is intrasentential code-switching between Tagalog and English, and among urban educated Filipinos it's not a style choice or a sign of incomplete fluency. It's the normal register. A journalist might write: "Sa GMA 'yung objectivity has become part na of the culture." A meeting participant says: "Yung deliverable natin ngayon, can we move it to Friday?" A parent tells a child: "Mommy, I don't want to. It's so hirap eh."
The deeper challenge is morphological. Tagalog is agglutinative: its verb system relies on a dense system of prefixes, suffixes, infixes, and circumfixes (mag-, nag-, -in-, -an, pag-...-an, -um-) to encode focus, aspect, and voice. When English verbs enter that system, they get inflected:
- "Nag-meeting kami" (tuvimos una reunión)
- "I-submit mo na" (entrégalo ya)
- "Magda-drive siya bukas" (ella conducirá mañana)
- "Nagse-sweat na ako" (ya estaba sudando)
- "The meeting will start na" (una partícula tagala añadida a una frase en inglés)
Para un motor de ASR, cada una de estas formas híbridas es un token novedoso que puede o no aparecer en su vocabulario de entrenamiento. Un modelo entrenado con un corpus monolingüe de tagalo puede tratar "mag-meeting" como dos tokens separados, o transcribir mal la raíz inglesa. Un modelo entrenado principalmente con inglés puede eliminar por completo el prefijo tagalo. Ninguno de los dos es correcto.

Esto importa sobre todo en la industria que emplea a más filipinos en trabajos de audio: el sector de BPO y call centers.
El ángulo del call center
La industria de BPO en Filipinas generó aproximadamente 38 mil millones de dólares en ingresos en 2025 y emplea a más de 1,5 millones de personas, una parte significativa de ellas en soporte al cliente por voz para clientes de Estados Unidos, Australia y el Reino Unido. Estos agentes hablan lo que podría describirse como "inglés filipino profesional" cuando están en una llamada, pero sus sesiones de formación internas, reuniones de equipo, grabaciones de control de calidad y sesiones informativas sobre escalados se realizan en taglish.
Esto crea una brecha de transcripción significativa. Las llamadas entrantes en inglés se transcriben con precisión en cualquier motor moderno. El audio operativo interno, donde reside el conocimiento institucional real, está en taglish y es mucho más difícil de transcribir correctamente. Los servicios de transcripción humana en Filipinas cobran entre 0,50 y 1,20 dólares por minuto de audio por este trabajo, con operadores nativos de taglish que revisan la salida de la IA.
Para el control de calidad en centros de llamadas y la documentación de reuniones a gran escala, consulta herramientas de transcripción de reuniones y cómo crear actas de reuniones a partir de audio. La publicación sobre diarización de hablantes explicada cubre por qué el etiquetado de hablantes es especialmente valioso para grabaciones de llamadas con múltiples agentes.
Qué falla y qué se sostiene
Basándonos en los desafíos estructurales anteriores, esto es lo que puedes esperar de los motores actuales con diferentes tipos de contenido en tagalo:
Tagalo formal (presentación de noticias, discursos políticos, conferencias académicas): Los motores actuales rinden mejor aquí. El vocabulario está más estandarizado, el ritmo es controlado y el cambio de código es mínimo. Espera una salida precisa con una edición ligera.
Tagalo urbano informal/Taglish (vlogs de YouTube, podcasts, contenido en redes sociales): Una mayor densidad de cambio de código implica más tokens híbridos. Los segmentos en inglés se transcriben bien; las construcciones en inglés con afijos en tagalo son donde se concentran los errores. Prevé más edición.
Tagalo con acento regional (Batangas, Bulacan, Cavite): Son dialectos del tagalo con patrones de entonación distintivos. Los datos de entrenamiento de los motores se inclinan hacia el tagalo de Manila (los medios del área metropolitana de Manila dominan). La precisión disminuye algo con acentos regionales marcados.
Audio interno de centros de llamadas (reuniones de equipo, revisiones de control de calidad, formación): Taglish denso, ritmo rápido, hablantes que se solapan, jerga del sector. Esta es la categoría más difícil. La precisión actual de los motores no está verificada por ningún punto de referencia publicado; la revisión humana sigue siendo el estándar para cualquier cosa de relevancia.
Para una comparación con otra lengua del sudeste asiático que enfrenta dinámicas de cambio de código similares, consulta transcripción de bahasa indonesio, donde el habla de registro mixto de Yakarta presenta desafíos paralelos.
Mi opinión
The story changed in 2026. A year ago, the practical answer to "can I transcribe Tagalog?" was "with significant caveats." Today, engines like Deepgram Nova-3 and AssemblyAI Universal-2 support Tagalog in production, with diarization and real-time streaming. The upgrade in pure-Tagalog support is real.
What did not change: Taglish remains genuinely difficult, for structural linguistic reasons that are not solved by adding Tagalog to a model's language list. The morphological integration of English into Tagalog grammar creates token-level ambiguity that breaks ASR systems trained separately on each language. Any content that's predominantly Taglish should be treated as requiring light human review regardless of which engine you use.
If you need a clean transcript for Tagalog or Taglish audio without building your own API pipeline, ConvertAudioToText handles audio uploads with speaker labeling and outputs a corrected, formatted transcript you can download directly.
For Taglish-heavy content where accuracy is critical (legal, medical, or public record), pair AI output with a native Taglish-speaking proofreader.
FAQ
What is the difference between Filipino and Tagalog for transcription purposes?
Filipino is the standardized national language of the Philippines, officially based on Tagalog with vocabulary drawn from other Philippine languages, Spanish, and English. In practice, the two are functionally the same for transcription. The main difference is at the API level: Google Cloud uses the code fil-PH, while Deepgram and OpenAI Whisper use tl. Test both codes with your engine; results are typically identical.
Which AI engine is best for Tagalog transcription in 2026?
Deepgram Nova-3 (código tl) añadió tagalo en enero de 2026 con soporte de streaming y keyterm prompting. AssemblyAI Universal-2 también cubre el tagalo e incluye funciones de resumen. Google Cloud Speech-to-Text admite fil-PH en Chirp y Chirp_2. Los tres están listos para producción con audio en tagalo limpio y claro. Para contenido muy taglish, ningún motor ha publicado comparativas directas, así que planifica evaluar con tu propio audio.
¿Por qué el taglish confunde a la transcripción con IA?
El taglish combina la morfología aglutinante del tagalo con vocabulario inglés. Los hablantes filipinos añaden prefijos e infijos verbales del tagalo a raíces inglesas: "nag-meeting," "i-submit," "magda-drive." Cada una de estas formas híbridas es un token nuevo. Un modelo entrenado principalmente con tagalo puede segmentar mal la raíz inglesa; un modelo entrenado principalmente con inglés puede omitir el prefijo tagalo. El resultado son errores de sustitución concentrados justo en las construcciones taglish de alta información.
¿El cebuano, el ilocano y otras lenguas filipinas son lo mismo que el tagalo para la transcripción?
No. El cebuano (bisaya), el ilocano, el hiligaynon y las demás lenguas regionales de Filipinas son lenguas distintas, no dialectos del tagalo. Seleccionar tl o fil-PH en un motor no dará resultados utilizables para audio en cebuano. Estas lenguas tienen un soporte de transcripción con IA mucho más limitado que el tagalo, y entran en la categoría de lenguas realmente de bajos recursos. Consulta por qué la IA tiene dificultades con las lenguas de bajos recursos para conocer las razones estructurales de esa brecha.
Fuentes
- Deepgram: Transcripción de voz a texto en tagalo
- Deepgram: Nova-3 añade 12 nuevos idiomas
- Deepgram: Precios
- AssemblyAI: Idiomas compatibles
- AssemblyAI: Precios
- Google Cloud: Idiomas compatibles con Speech-to-Text (V2)
- Google Cloud: Precios de Speech-to-Text
- Speechmatics: Voz a texto en tagalo
- Otter.ai: Precios
- Wikipedia: Taglish
- Wikipedia: Idioma tagalo
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.