
Transcrição em hausa: suporte dos motores, escrita e precisão em 2026
Summarize this article with:
A resposta curta
O hausa tem suporte de transcrição por IA em nível de produção em 2026, mas apenas de um punhado de motores. O Whisper Large-v3 e os modelos Chirp do Google Cloud dão conta do recado. A AssemblyAI lista o idioma, mas sinaliza a precisão como "razoável" (taxa de erro de palavras acima de 50% em áudio típico). As demais ferramentas populares de consumo — Otter, Trint, Descript — simplesmente não suportam o hausa. Se o seu áudio está em hausa, a escolha do motor é a primeira decisão.
Por que a transcrição em hausa importa agora
O hausa tem cerca de 50 milhões de falantes nativos e mais 30 milhões que o usam como segunda língua, concentrados no norte da Nigéria e no Níger, com comunidades expressivas em Gana, Camarões, Chade e Sudão. É a língua franca do comércio no Sahel. Em março de 2025, o Níger tornou o hausa sua língua oficial, substituindo o francês. Essa mudança amplia a demanda por ferramentas digitais em hausa nos governos, na mídia e na educação.
Kannywood, a indústria cinematográfica em língua hausa sediada em Kano, produz cerca de 50 filmes por mês nas temporadas de pico e emprega mais de 30 mil pessoas. Emissoras internacionais como BBC Hausa, Deutsche Welle Hausa e Voice of America Hausa mantêm serviços dedicados em hausa. O volume de conteúdo é real. As ferramentas, até pouco tempo atrás, não eram.
Boko vs. Ajami: a questão da escrita
Antes de transcrever, ajuda saber qual sistema de escrita se aplica ao seu conteúdo.
Boko é a escrita baseada no alfabeto latino e o padrão moderno. Jornais nigerianos, conteúdo digital, transcrições de transmissões e a maior parte do material educacional usam boko. Ele inclui quatro caracteres que não existem no latim padrão:
- ɓ: implosiva bilabial (distinta do "b" simples do inglês)
- ɗ: implosiva alveolar (distinta do "d" simples do inglês)
- ƙ: oclusiva velar ejetiva surda (distinta do "k" simples do inglês)
- ʼy: aproximante palatal glotalizada
Não são detalhes decorativos. Trocar o "b" simples pelo "ɓ" muda o significado da palavra. Um motor que gera letras latinas simples para esses sons está produzindo uma transcrição com perda de informação.
Ajami é a tradição em escrita árabe, usada historicamente para textos religiosos, erudição islâmica e literatura clássica em hausa. O ajami não tem ortografia padronizada entre os escribas, o que torna a modelagem muito mais difícil. Os motores de transcrição por IA são treinados predominantemente em boko, então áudio com forte presença de ajami (recitações devocionais sufis, manuscritos islâmicos antigos lidos em voz alta) vai gerar resultados pouco confiáveis independentemente do motor escolhido. Se o seu conteúdo está em ajami, trate a IA apenas como uma primeira passada aproximada.
O Whisper Large-v3, que alimenta o ConvertAudioToText, gera boko padrão incluindo ɓ, ɗ e ƙ. O Google Cloud STT via Chirp também mira o locale ha-NG. Teste a saída de qualquer outra ferramenta em um clipe curto com esses caracteres antes de fechar o seu fluxo de trabalho.

Fonologia do hausa: o que dificulta o trabalho dos sistemas de ASR
O hausa é uma língua tonal com três contrastes de altura: alto, baixo e decrescente. O tom marca função gramatical e significado lexical, mas o hausa escrito padrão não usa diacríticos de tom. Isso, na verdade, é ótimo para transcrição: os falantes não escrevem marcas de tom, e os motores de transcrição também não. O resultado será texto sem tons, exatamente o que um leitor de hausa espera.
O problema mais difícil é o inventário consonantal. O hausa tem 32 consoantes, incluindo contrastes entre oclusivas simples, palatalizadas e labializadas, além das séries implosivas e ejetivas. São fonemas que distinguem palavras. A escassez de dados de treinamento amplifica o risco: o Mozilla Common Voice tem cerca de 10 horas validadas de hausa, e conjuntos curados maiores, como o NaijaVoices, incluem cerca de 600 horas. Compare com milhares de horas de inglês ou francês, e a lacuna de precisão é estrutural, não um bug de software.
Além disso, a duração das vogais do hausa é contrastiva: vogais breves e longas carregam significados diferentes. Motores treinados com poucos dados de hausa podem perder distinções de duração, especialmente em fala informal ou rápida.
Quais motores suportam o hausa (com honestidade)
| Motor | Suporte a hausa | Faixa de precisão | Observações |
|---|---|---|---|
| Whisper Large-v3 | Sim | Intermediária para línguas africanas | Saída em boko, incl. ɓ ɗ ƙ |
| Google Cloud STT (Chirp 3) | Sim, ha-NG | Não publicada | API, exige configuração de desenvolvedor |
| AssemblyAI Universal-2 | Sim | "Razoável" (WER acima de 50% sinalizado) | Precisão esperada menor |
| Deepgram Nova-3 | Sem confirmação de hausa | N/A | Não consta na lista de idiomas suportados |
| Otter.ai | Não | N/A | Apenas 6 idiomas |
| Trint | Não confirmado | N/A | Hausa ausente da lista verificada de idiomas |
| Descript | Não | N/A | Ferramentas centradas no inglês |
| Rev | Não | N/A | Revisores humanos podem atender; a IA não |
Minha avaliação: a faixa de "precisão razoável" autorreportada pela AssemblyAI é honesta, mas desanimadora. Para conteúdo em hausa em que você precisa de saída limpa em boko com as consoantes com gancho intactas, o Whisper Large-v3 é a escolha prática diante do que é publicamente verificável. O Chirp 3 do Google Cloud vale um teste se você tiver acesso à API, mas exige mais configuração do que uma ferramenta de transcrição para consumidor final.
Para uma visão mais ampla de como os motores se comparam em idiomas menos comuns, veja por que a IA sofre com línguas de baixos recursos.
Precisão por tipo de áudio
A precisão do Whisper Large-v3 em hausa é menor do que em inglês, francês ou até árabe, porque o corpus de treinamento é menor. Expectativas aproximadas conforme as condições do áudio:
- Noticiário ou rádio em hausa gravado em estúdio (NTA Hausa, serviço DW Hausa): 85 a 90 por cento.
- Discurso político formal ou sermão de sexta-feira com áudio limpo: 82 a 88 por cento.
- Podcast em hausa, dois falantes, ruído mínimo: 78 a 85 por cento.
- Hausa urbano nigeriano com alternância para o inglês: próximo da faixa acima; o Whisper lida razoavelmente bem com a mistura.
- Gravações de campo com ruído ambiente (feiras, eventos ao ar livre): 65 a 78 por cento. O ruído de fundo prejudica a precisão do hausa mais do que a do inglês, porque há menos capacidade do modelo para se recuperar dele.
- Hausa do Níger (dialeto nigerino, próximo do Kananci, mas com vocabulário distinto): 78 a 85 por cento, sem configurações especiais.
São estimativas baseadas nos fatores acústicos e de dados de treinamento mencionados acima, não benchmarks publicados. Nenhum ranking público de ASR para hausa acompanha essas condições específicas. Trate-as como faixas de planejamento, não garantias, e sempre rode um clipe de teste no seu conteúdo real antes de assumir um fluxo de trabalho de grande volume.
Dialetos: Kano, Sokoto, Zaria, Níger
O hausa padrão para fins de transcrição é o Kananci, o dialeto de Kano. É o padrão de radiodifusão, o padrão educacional e o que a maior parte do conteúdo digital em hausa usa.
O Sakkwatanci (dialeto de Sokoto) é a variedade ocidental, considerada clássica na tradição literária do hausa. Tem traços conservadores que divergem do Kananci em vocabulário e em algumas formas fonológicas.
O Zazzaganci (dialeto de Zaria) é uma variedade meridional, com diferenças na marcação de gênero e no tratamento das vogais.
O hausa do Níger é vizinho do Kananci, mas compartilha alguma sobreposição com o Sakkwatanci. Depois que o Níger adotou o hausa como língua oficial em 2025, cresce a demanda por transcrição de conteúdo governamental e de mídia produzido em Niamey. As diferenças dialetais são reais, mas não impedem a inteligibilidade mútua, e um modelo treinado principalmente com dados de hausa nigeriano vai lidar com o hausa do Níger com redução modesta de precisão.
Nenhum motor de consumo atual oferece ajuste específico por dialeto do hausa. Se o seu áudio vem de uma região determinada e a precisão em um clipe de teste não atende às suas necessidades, fornecer um glossário de vocabulário localmente distintivo é a solução mais prática.
Alternância de código com o inglês
O hausa urbano nigeriano em Kano, Kaduna e Abuja mistura inglês à vontade, sobretudo em conteúdo de negócios, tecnologia e jovem:
"Ina son kawo wani idea, but kafin in fara, mu yi short break."
O Whisper gera os trechos em hausa em boko e os trechos em inglês em inglês padrão. A mistura reflete como esses falantes realmente escrevem, que é exatamente o que você quer para notas de podcast, descrições de YouTube ou legendas de redes sociais. Nenhuma configuração especial é necessária.
O hausa rural e o hausa do Níger têm muito menos inglês. Esse áudio permanece em boko do começo ao fim, o que também funciona corretamente.
Fluxo de trabalho prático para conteúdo em hausa
Para produtores de Kannywood, editores de rádio e jornalistas, esta é a sequência que funciona:
- Grave no ambiente mais silencioso disponível. O ruído ambiente externo degrada a precisão do hausa mais do que a de línguas com muitos recursos, porque o modelo tem menos margem para compensar.
- Defina explicitamente o idioma de transcrição como hausa. A detecção automática pode confundir o hausa com o árabe (por causa de empréstimos compartilhados e padrões de entonação) ou com outras línguas da África Ocidental em gravações ruidosas.
- Envie pela ferramenta de áudio para texto. Para conteúdo em vídeo, incluindo clipes de Kannywood e entrevistas do YouTube, a ferramenta de vídeo para texto faz a extração automaticamente.
- Ative rótulos de falante se houver mais de uma pessoa falando. Espere uma diarização confiável em áudio limpo com dois falantes e menos confiável em programas de rádio com várias vozes sobrepostas.
- Adicione um glossário de nomes próprios antes da revisão: nomes pessoais em hausa (que têm muitas variantes de grafia), topônimos da Nigéria e do Níger e quaisquer marcas ou organizações que apareçam no seu conteúdo.
- Revise especificamente as consoantes com gancho. Uma divergência como "barka" vs. "ɓarka" muda o significado. É aqui que o teto de precisão das línguas de baixos recursos aparece na prática.
- Exporte para SRT para legendas do YouTube ou TXT para redação de artigos.
Especificamente para distribuição de Kannywood, legendas SRT em hausa ampliam o alcance para públicos da diáspora e para falantes de hausa em Gana e Camarões que podem não captar todo o vocabulário do dialeto de Kano na velocidade do filme.
Uso no setor de ONGs e desenvolvimento
Organizações que atuam no norte da Nigéria, no Níger, no Chade e no Sahel em sentido amplo frequentemente realizam entrevistas de campo em hausa. Uma agente comunitária de saúde explicando a resistência à vacinação, um agricultor descrevendo perdas de safra, um comerciante de feira falando do impacto do preço do combustível: é nesse tipo de conteúdo que a transcrição em hausa tem mais valor institucional — e onde a qualidade do áudio costuma ser o maior desafio.
Para gravações de campo de ONGs, aceite que a precisão será menor do que a de áudio com qualidade de transmissão e reserve tempo para revisão posterior. Ainda assim, revisar a transcrição é dramaticamente mais rápido do que revisar o arquivo de áudio bruto, mesmo com 75% de precisão. Fluxos multilíngues que incluem hausa junto com inglês, francês e árabe são totalmente suportados no mesmo plano.
Onde o CATT se encaixa
Se você só precisa de uma transcrição limpa em hausa sem configuração de API nem infraestrutura em nuvem, o ConvertAudioToText roda o Whisper Large-v3 com saída em boko e rótulos de falante. O plano gratuito cobre 10 minutos de transcrição, concedidos uma única vez no cadastro, e não mensalmente. O plano Pro, US$ 9,99/mês, é ilimitado e cobre o hausa junto com todos os outros idiomas suportados. Para jornalistas e produtores de podcast que trabalham com hausa e inglês, isso significa um único plano para tudo.
Para entender como o preço por minuto das APIs se compara às ferramentas de taxa fixa, veja comparação de preços de transcrição 2026.
Perguntas frequentes
Quais motores de transcrição por IA suportam o hausa em 2026?
O Whisper Large-v3 (usado pelo ConvertAudioToText) e o Google Cloud Speech-to-Text por meio dos modelos Chirp suportam o hausa. A AssemblyAI também lista o hausa no seu modelo Universal-2, mas o coloca na faixa de "precisão razoável", ou seja, taxas de erro de palavras acima de 50% em áudio típico. Otter.ai, Trint e Descript não suportam o hausa.
A transcrição em hausa gera a escrita boko com as consoantes com gancho corretas?
Depende do motor. O Whisper Large-v3 gera a escrita boko padrão (baseada no alfabeto latino) e lida com os marcadores implosivos e ejetivos ɓ, ɗ e ƙ. Se uma ferramenta devolve "b", "d" e "k" simples em vez das formas com gancho, ela está apagando distinções fonologicamente relevantes que mudam o significado das palavras em hausa.
Como a alternância de códigos entre hausa e inglês afeta a transcrição?
Falantes urbanos de hausa na Nigéria, em Kano, Kaduna e Abuja, misturam inglês com frequência na conversa. Na prática, o Whisper lida bem com isso: as palavras em hausa voltam em escrita boko e as palavras em inglês em inglês. O resultado reflete como esses falantes realmente escrevem, o que é útil para conteúdo de podcast e redes sociais. Áudio rural ou do Níger, com pouco inglês, apresenta alternância de códigos desprezível e permanece em boko do início ao fim.
O hausa é uma língua tonal e isso afeta a transcrição por IA?
Sim. O hausa tem três contrastes de tom: alto, baixo e decrescente. O tom muda significado e categoria gramatical. O hausa escrito padrão não marca tom com diacríticos (fora de textos linguísticos especializados), então a saída da transcrição também virá sem marcação tonal, o que é normal e esperado. O maior risco de precisão vem das consoantes implosivas e ejetivas, não do tom, já que essas são marcadas na escrita e podem ser descartadas por um motor mal calibrado.
Fontes
- Carta do modelo OpenAI Whisper Large-v3: huggingface.co/openai/whisper-large-v3
- Idiomas suportados pela AssemblyAI (níveis de precisão do Universal-2): assemblyai.com/docs/supported-languages
- Idiomas suportados do Google Cloud Speech-to-Text V2 (ha-NG, modelos Chirp): cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Idiomas suportados do Otter.ai: help.otter.ai
- Níger adota o hausa como língua oficial (março de 2025): globalvoices.org
- HausaNLP: Current Status, Challenges and Future Directions (2025): arxiv.org/abs/2505.14311
- Visão geral da língua hausa: en.wikipedia.org/wiki/Hausa_language
- Dados da indústria de Kannywood: wifitalents.com/kannywood-industry-statistics
- Levantamento de recursos de fala para o hausa (horas do NaijaVoices e CommonVoice): arxiv.org/pdf/2605.22828
- Notas sobre a ortografia boko do hausa: r12a.github.io/scripts/latn/ha.html
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription for African Languages in 2026: Honest Rankings
Which engines actually support Swahili, Hausa, Yoruba, Amharic, Wolof, and Zulu in 2026? Verified support matrices, honest WER context, and the tools that genuinely work.
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.