
Transcrição de tagalo e filipino em 2026: o problema do taglish
Summarize this article with:
O tagalo puro já tem bom suporte em produção: a Deepgram Nova-3 adicionou tagalo em janeiro de 2026, a AssemblyAI cobre o idioma e o Google Cloud suporta fil-PH desde o Chirp. O problema que sobra é o taglish: a alternância generalizada entre tagalo e inglês ainda atrapalha mecanismos que travam num idioma por segmento. Para áudio misto, use um mecanismo com suporte a alternância de código e espere corrigir erros de fronteira entre idiomas; times de call center devem testar com o próprio áudio taglish.
Resposta Rápida
Os principais mecanismos de transcrição por IA agora suportam tagalo em produção. O Deepgram Nova-3 adicionou tagalo (tl) em janeiro de 2026, o Universal-2 da AssemblyAI cobre o idioma, e o Google Cloud Speech-to-Text suporta fil-PH desde o lançamento do Chirp. A precisão em tagalo puro não é mais o problema central. O desafio que permanece é o taglish, a troca de código onipresente entre tagalo e inglês que define como a maioria dos filipinos urbanos realmente fala, e que ainda faz os mecanismos de IA tropeçarem de maneiras previsíveis.
Filipino vs. Tagalo: Acertando o Nome Primeiro
O tagalo é a primeira língua de cerca de 28 a 33 milhões de filipinos, principalmente em Metro Manila, Batangas, Bulacan, Laguna e Cavite. O filipino, a língua nacional padronizada codificada na Constituição de 1987, é baseado no tagalo, mas oficialmente incorpora vocabulário de todas as línguas filipinas e de empréstimos do espanhol e do inglês.
Para transcrição prática, a distinção raramente importa: filipino e tagalo são mutuamente inteligíveis, a gramática e a fonologia são as mesmas, e o modelo de IA que você usa atende aos dois. A inconsistência de nomenclatura pesa mais no nível da API. O Google Cloud usa fil-PH (filipino, Filipinas). O Deepgram usa tl (tagalo, ISO 639-1). A AssemblyAI documenta o idioma como "Tagalog". Talvez seja preciso testar os dois códigos dependendo do mecanismo.
Mais uma correção de nome: cebuano (bisaya), ilocano e hiligaynon são línguas filipinas separadas, não dialetos do tagalo. Os dialetos do tagalo, no sentido estrito, são variantes regionais do próprio tagalo: Manila, Batangas, Bulacan e Marinduque. Isso importa porque modelos de IA treinados em tagalo de Manila vão se perder com falantes de Batangas (conhecidos por um padrão de entonação distinto), e vão falhar completamente em cebuano ou ilocano, que são línguas totalmente diferentes.
A Escrita: Somente Latim, Com Uma Nota Sobre o Baybayin
Filipino e Tagalog modernos usam o alfabeto latino. Palavras de origem espanhola mantêm a grafia espanhola (Niño, mañana). Empréstimos do inglês mantêm a grafia inglesa. Todo grande mecanismo de transcrição por IA gera texto em alfabeto latino para o Tagalog, o que corresponde ao filipino escrito padrão.
O Baybayin, o silabário pré-colonial, aparece em contextos culturais: faixas de formatura na UP Diliman, arte de tatuagem e poesia contemporânea ocasional. A Lei do Sistema Nacional de Escrita de 2018 promoveu sua preservação. Nada disso cria um caso de uso prático para transcrição. Nenhum mecanismo de ASR em produção lida com entrada de áudio em Baybayin, e quase nenhum conteúdo de áudio o usa como escrita principal.
Onde os Mecanismos Estão em 2026
Deepgram Nova-3 adicionou o Tagalog (tl) como idioma monolíngue com suporte de produção em janeiro de 2026. A oferta inclui diarização de falantes, streaming em tempo real com latência abaixo de 300ms, prompt de termos-chave para nomes de marcas e termos de domínio, pontuação inteligente e segmentação por enunciado. O modelo de preço é pague conforme o uso, sem sobretaxa específica para Tagalog: áudio pré-gravado custa cerca de $0.0048/min e streaming cerca de $0.0077/min nas tarifas padrão, com crédito gratuito de $200 para contas novas.
AssemblyAI Universal-2 cobre o Tagalog no que a empresa documenta como nível de "boa precisão", ou seja, uma taxa de erro por palavra entre 10% e 25% em áudio típico. A tarifa base é de $0.15/hora para transcrição pré-gravada, com complementos para diarização de falantes, análise de sentimento e resumo. O Tagalog se qualifica para o suporte multilíngue da AssemblyAI na mesma tarifa base.
Google Cloud Speech-to-Text suporta filipino pelo código de idioma fil-PH tanto no modelo Chirp quanto no Chirp_2. O preço padrão começa em $0.016/minuto (cerca de $0.96/hora), com a opção Dynamic Batch por aproximadamente um quarto disso para cargas de trabalho sem urgência de tempo. Contas novas do GCP recebem $300 em créditos gratuitos.
Speechmatics afirma até 96% de precisão de palavras para tagalo, treina em dialetos e sotaques, e reconhece explicitamente a "troca frequente de código com o inglês" no treinamento de seus modelos, embora não publique métricas específicas de WER para taglish.
| Engine | Código do idioma | Recursos | Preço aproximado |
|---|---|---|---|
| Deepgram Nova-3 | tl | Streaming, diarização, termos-chave | US$ 0,0048/min pré-gravado |
| AssemblyAI Universal-2 | tl | Diarização, sentimentos, resumos | US$ 0,15/hora base |
| Google Cloud (Chirp) | fil-PH | Streaming, diarização | US$ 0,016/min padrão |
| Speechmatics | Tagalo | Diarização, sotaques | Sob consulta |
| OpenAI Whisper Large-v3 | tl | Local/autohospedado | Somente custo de computação |
Para uma visão mais ampla de como os custos desses engines se comparam, veja preços de APIs de fala para texto em 2026 e Deepgram Nova-3 explicado.
O Problema Real: Taglish
O suporte dos engines para tagalo agora é sólido. O problema é que a maior parte da fala filipina não é tagalo puro. É taglish.
Taglish (às vezes englog) é a troca de código intrafrasal entre tagalo e inglês, e entre filipinos urbanos e educados não é uma escolha de estilo nem sinal de fluência incompleta. É o registro normal. Um jornalista pode escrever: "Sa GMA 'yung objectivity has become part na of the culture." Um participante de reunião diz: "Yung deliverable natin ngayon, can we move it to Friday?" Um pai diz a um filho: "Mommy, I don't want to. It's so hirap eh."
O desafio mais profundo é morfológico. O tagalo é aglutinante: seu sistema verbal depende de uma rede densa de prefixos, sufixos, infixos e circunfixos (mag-, nag-, -in-, -an, pag-...-an, -um-) para codificar foco, aspecto e voz. Quando verbos em inglês entram nesse sistema, eles são flexionados:
- "Nag-meeting kami" (tivemos uma reunião)
- "I-submit mo na" (já submete isso)
- "Magda-drive siya bukas" (ela vai dirigir amanhã)
- "Nagse-sweat na ako" (eu já estava suando)
- "The meeting will start na" (uma partícula tagalo anexada a uma frase em inglês)
Para um mecanismo de ASR, cada uma dessas formas híbridas é um token novo que pode ou não aparecer no vocabulário de treinamento. Um modelo treinado em um corpus monolíngue de tagalo pode tratar "mag-meeting" como dois tokens separados, ou transcrever errado a raiz em inglês. Um modelo treinado principalmente em inglês pode descartar o prefixo em tagalo por completo. Nenhum dos dois está certo.

Isso importa mais na indústria que emprega o maior número de filipinos em trabalho com áudio: o setor de BPO e call center.
O Ângulo do Call Center
A indústria de BPO das Filipinas gerou cerca de US$ 38 bilhões em receita em 2025 e emprega mais de 1,5 milhão de pessoas, uma parcela significativa delas em suporte ao cliente por voz para clientes dos EUA, Austrália e Reino Unido. Esses agentes falam o que se poderia descrever como "inglês filipino profissional" durante as ligações, mas suas sessões internas de treinamento, reuniões rápidas de equipe, gravações de garantia de qualidade e debriefings de escalonamento são conduzidos em taglish.
Isso cria uma lacuna significativa de transcrição. As ligações recebidas em inglês são transcritas com precisão em qualquer mecanismo moderno. O áudio operacional interno, onde mora o conhecimento institucional de verdade, é em taglish e muito mais difícil de transcrever corretamente. Serviços de transcrição humana nas Filipinas cobram de US$ 0,50 a US$ 1,20 por minuto de áudio para esse trabalho, com operadores que são falantes nativos de taglish revisando a saída da IA.
Para QA de call center e documentação de reuniões em escala, veja ferramentas de transcrição de reuniões e como criar atas de reunião a partir de áudio. O post diarização de locutor explicada cobre por que a rotulagem de locutores é especialmente valiosa para gravações de call center com múltiplos agentes.
O Que Quebra e O Que Segura
Com base nos desafios estruturais acima, aqui está o que você pode esperar dos mecanismos atuais em diferentes tipos de conteúdo em tagalo:
Tagalo formal (telejornalismo, discursos políticos, palestras acadêmicas): Os mecanismos atuais performam melhor aqui. O vocabulário é mais padronizado, o ritmo é controlado e o code-switching é mínimo. Espere uma saída precisa com edição leve.
Tagalo urbano casual/Taglish (vlogs no YouTube, podcasts, conteúdo de redes sociais): A maior densidade de code-switching gera mais tokens híbridos. Os segmentos em inglês transcrevem bem; as construções em inglês com afixos em tagalo são onde os erros se concentram. Planeje mais edição.
Tagalo com sotaque regional (Batangas, Bulacan, Cavite): São dialetos do tagalo com padrões de entonação distintos. Os dados de treinamento dos mecanismos tendem ao tagalo de Manila (a mídia da região metropolitana de Manila domina). A precisão cai um pouco com sotaques regionais fortes.
Áudio interno de call center (reuniões de equipe, revisões de QA, treinamento): Taglish denso, ritmo acelerado, locutores sobrepostos, jargão do setor. Esta é a categoria mais difícil. A precisão atual dos mecanismos não é verificada por benchmarks publicados; a revisão humana continua sendo o padrão para qualquer coisa de impacto.
Para uma comparação com outro idioma do Sudeste Asiático que enfrenta dinâmicas de code-switching semelhantes, veja transcrição em indonésio, onde a fala de registro misto de Jacarta apresenta desafios paralelos.
Minha Opinião
A história mudou em 2026. Há um ano, a resposta prática para "consigo transcrever tagalo?" era "com ressalvas significativas". Hoje, motores como Deepgram Nova-3 e AssemblyAI Universal-2 suportam tagalo em produção, com diarização e streaming em tempo real. A melhoria no suporte a tagalo puro é real.
O que não mudou: taglish continua genuinamente difícil, por razões estruturais da linguística que não se resolvem apenas adicionando tagalo à lista de idiomas de um modelo. A integração morfológica do inglês na gramática do tagalo cria ambiguidade no nível dos tokens, o que quebra sistemas de ASR treinados separadamente em cada idioma. Qualquer conteúdo predominantemente em taglish deve ser tratado como algo que exige revisão humana leve, independentemente do motor que você usar.
Se você precisa de uma transcrição limpa para áudio em tagalo ou taglish sem montar sua própria pipeline de API, o ConvertAudioToText cuida do upload de áudio com identificação de falantes e gera uma transcrição corrigida e formatada que você pode baixar direto.
Para conteúdo com muito taglish onde a precisão é crítica (jurídico, médico ou registro público), combine a saída da IA com um revisor nativo de taglish.
FAQ
Qual é a diferença entre filipino e tagalo para fins de transcrição?
Filipino é a língua nacional padronizada das Filipinas, oficialmente baseada no tagalo, com vocabulário de outras línguas filipinas, espanhol e inglês. Na prática, os dois são funcionalmente iguais para transcrição. A principal diferença está no nível da API: o Google Cloud usa o código fil-PH, enquanto Deepgram e OpenAI Whisper usam tl. Teste os dois códigos com seu motor; os resultados costumam ser idênticos.
Qual motor de IA é o melhor para transcrição em tagalo em 2026?
Deepgram Nova-3 (código tl) adicionou tagalo em janeiro de 2026, com suporte a streaming e keyterm prompting. O AssemblyAI Universal-2 também cobre tagalo e inclui recursos de sumarização. O Google Cloud Speech-to-Text suporta fil-PH no Chirp e no Chirp_2. Os três estão prontos para produção em áudio de tagalo limpo e claro. Para conteúdo fortemente taglish, nenhum motor publicou benchmarks comparativos diretos, então planeje avaliar com seu próprio áudio.
Por que o taglish atrapalha a transcrição por IA?
O taglish combina a morfologia aglutinante do tagalo com o vocabulário do inglês. Falantes filipinos anexam prefixos e infixos verbais do tagalo a raízes inglesas: "nag-meeting", "i-submit", "magda-drive". Cada uma dessas formas híbridas é um token novo. Um modelo treinado principalmente em tagalo pode segmentar errado a raiz inglesa; um modelo treinado principalmente em inglês pode descartar o prefixo tagalo. O resultado são erros de substituição concentrados justamente nas construções taglish de alta densidade informacional.
Cebuano, ilocano e outras línguas filipinas são iguais ao tagalo para transcrição?
Não. Cebuano (Bisaya), ilocano, hiligaynon e as demais línguas regionais das Filipinas são línguas distintas, não dialetos do tagalo. Selecionar tl ou fil-PH em um motor não produzirá resultados utilizáveis para áudio em cebuano. Essas línguas têm suporte de transcrição por IA muito mais limitado que o tagalo e se enquadram na categoria genuinamente de baixos recursos. Veja por que a IA tem dificuldade com línguas de baixos recursos para entender as razões estruturais por trás dessa lacuna.
Fontes
- Deepgram: Transcrição de fala em tagalo
- Deepgram: Nova-3 adiciona 12 novos idiomas
- Deepgram: Preços
- AssemblyAI: Idiomas suportados
- AssemblyAI: Preços
- Google Cloud: Idiomas suportados pelo Speech-to-Text (V2)
- Google Cloud: Preços do Speech-to-Text
- Speechmatics: Fala para texto em tagalo
- Otter.ai: Preços
- Wikipedia: Taglish
- Wikipedia: Língua tagalo
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.