Transcrição em wolof: onde está o suporte em 2026
transcriçãowoloflínguas africanas

Transcrição em wolof: onde está o suporte em 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

Onde está o suporte ao wolof

A maioria das ferramentas convencionais de transcrição por IA não oferece suporte ao wolof em 2026, e as que afirmam oferecer produzem taxas de erro altas. O Whisper Large-v3, que alimenta a maioria dos serviços que anunciam ampla cobertura de idiomas, simplesmente não inclui o wolof em sua lista de 99 idiomas. O Deepgram Nova-3 e o AssemblyAI Universal também não listam o wolof. Para a maior parte do conteúdo em wolof, o caminho prático em 2026 não é esperar pelo suporte nativo, mas entender por que essa lacuna existe e usar a solução alternativa pela trilha do francês, que funciona para áudio urbano de Dacar.

Isso não é uma deficiência das ferramentas nos idiomas para os quais elas foram construídas. É um problema de dados de treinamento: os maiores corpora públicos de fala em wolof, incluindo o conjunto de dados do projeto ALFFA e a coleção Wolof do OpenSLR, vão de cerca de 5 a 55 horas de áudio transcrito. O Common Voice não tem corpus algum em wolof. Os dados de treinamento em inglês do Whisper chegam às centenas de milhares de horas. A lacuna explica a lacuna de WER.

O que a pesquisa realmente mostra

Um artigo de 2025 sobre ASR em wolof ("Speech Language Models for Under-Represented Languages: Insights from Wolof," arXiv:2509.15362) é o benchmark publicado mais claro sobre o estado atual. O estudo curou 860 horas de áudio espontâneo de alta qualidade em wolof, deu continuidade ao pré-treinamento do HuBERT com esses dados e integrou o codificador de fala resultante a um modelo de linguagem do wolof. Mesmo com esse esforço dedicado, os resultados do ASR em wolof ficaram na faixa de aproximadamente 68-72% de WER sob condições de treinamento multilíngue. Isso é uma taxa de erro por palavra, ou seja, em média cerca de 1 palavra em cada 3 sai errada.

Para comparação, o Whisper Large-v3 alcança menos de 5% de WER em benchmarks de inglês e francês. O wolof não está no mesmo patamar.

Minha opinião: qualquer serviço que anuncie menos de 15% de WER para o wolof em 2026 sem citar um benchmark verificado deve ser encarado com ceticismo. A evidência acadêmica aponta para a faixa de 30-70% de WER, dependendo do conjunto de dados e do método.

As duas ferramentas que realmente listam o wolof

O Google Cloud Speech-to-Text V2 oferece suporte ao wolof (wo-SN) em sua lista documentada de idiomas. Esse é um suporte real e verificado no nível da API. A qualidade é outra questão. O Google não publica benchmarks de WER por idioma, e o wolof não está entre os idiomas que o Google destaca pela qualidade. Ele usa um modelo padrão do V2 com cobrança medida por minuto (gratuito nos primeiros 60 minutos, depois US$ 0,004 por cada 15 segundos na escala padrão). Isso dá aproximadamente US$ 0,016 por minuto, ou cerca de US$ 0,96 por hora nas tarifas-base, com queda em volume. O suporte a recursos para o wolof no V2 é básico: transcrição, sem diarização nem pontuação de confiança avançada.

O ElevenLabs Scribe lista o wolof entre seus 99 idiomas com suporte. A própria página de benchmarks por idioma deles coloca o wolof na faixa "Moderado" de WER, com aproximadamente 40,7% de WER para o Scribe v1. Isso é significativamente melhor do que a linha de base acadêmica atual, mas ainda significa 4 erros a cada 10 palavras, em média. Com o preço do Scribe de US$ 0,22 por hora via API (US$ 0,40 por hora no pagamento conforme o uso), transcrever wolof é acessível, mas a saída vai exigir edição considerável para qualquer uso formal. O Scribe com 40% de WER supera o HuBERT com 68-72% de WER, o que reflete o benefício de escala do corpus de treinamento mais amplo da ElevenLabs.

Nenhuma das duas ferramentas produz transcrições em wolof prontas para publicação sem uma passada de revisão.

A realidade do wolof urbano: metade do sinal é francês

Linguistas que estudam a fala de Dacar descrevem o wolof urbano como uma variedade de contato tão profundamente misturada com o francês que encontrar wolof puro ou francês puro numa conversa casual em Dacar é incomum a ponto de chamar atenção. Não é alternância de código no sentido tradicional de alternar entre dois códigos. Pesquisadores caracterizaram a fala urbana de Dacar como um terceiro código, às vezes chamado "Dakarois", em que gramática do wolof e vocabulário do francês convivem numa mesma frase.

Uma frase representativa poderia ser: "Damay dem au bureau, mais avant ñu warna passer chez le marabout." Cerca de metade do conteúdo lexical ali é francês.

Para gravações desse tipo, transcrever na trilha do francês captura corretamente a maior parte do conteúdo. As partículas gramaticais, os pronomes e os verbos do wolof saem errados ou em branco, mas os substantivos, verbos e expressões franceses que carregam a maior parte do conteúdo proposicional são transcritos com precisão. O resultado é uma transcrição híbrida que precisa de edição feita por alguém com domínio do wolof no andaime gramatical, mas que traz certas as palavras de conteúdo.

Não é uma solução perfeita. É a honesta. Se o seu áudio é de rádio de Dacar, entrevistas urbanas ou conteúdo de podcasts senegaleses em que os falantes são escolarizados e bilíngues, a transcrição na trilha do francês vai lhe dar um primeiro rascunho utilizável mais rápido do que daria a transcrição nativa em wolof a 40-70% de WER.

Se você precisa de uma transcrição limpa, com o francês como idioma principal, de áudio senegalês, a ferramenta de áudio para texto da ConvertAudioToText lida com o francês com precisão e captura a fala com alternância de código entre wolof e francês sem a confusão de motor que vem de forçar um código de idioma no qual o modelo não foi treinado.

Wolof gambiano: um problema dialetal separado

O wolof gambiano e o senegalês têm códigos ISO 639-3 distintos (wof e wol, respectivamente) e divergem de forma significativa no vocabulário. Como a Gâmbia é uma ex-colônia britânica, o wolof gambiano faz empréstimos ao inglês, enquanto o senegalês faz ao francês. A alternância de código natural de um falante de wolof gambiano é para o inglês, não para o francês.

A implicação prática: a solução alternativa da trilha do francês, que ajuda com o conteúdo urbano de Dacar, não funciona para conteúdo em wolof gambiano. Uma frase em wolof gambiano com empréstimos do inglês falharia num modelo de francês tão gravemente quanto num modelo de wolof. Para o wolof gambiano, a resposta honesta em 2026 é a transcrição manual, com a IA usada apenas nas passagens predominantemente em inglês.

Os dois dialetos são mutuamente inteligíveis na fala, mas diferem nas convenções ortográficas e no inventário de empréstimos. Os dados de treinamento de ASR em wolof são esmagadoramente senegaleses, de modo que até ferramentas como o ElevenLabs Scribe, que afirmam ter suporte ao wolof, terão desempenho pior com entrada gambiana.

Escrita e ortografia

A ortografia latina oficial do wolof no Senegal foi padronizada em 1974 por decreto governamental, tendo o Centre de linguistique appliquée de Dakar (CLAD) como órgão autoritativo. O alfabeto inclui:

  • Ñ para a nasal palatal (como o ñ do espanhol)
  • Ŋ para a nasal velar
  • À, É, Ë, Ó como vogais com diacríticos
  • Consoantes geminadas (dobradas) para indicar duração: kk, bb, tt

Existe uma escrita paralela de base árabe, o Wolofal, com uso histórico religioso, mas que nunca foi adotada formalmente por decreto governamental. O conteúdo digital em wolof hoje usa quase exclusivamente a ortografia latina.

A saída de transcrição por IA em wolof deve produzir o alfabeto latino. Se você estiver revisando a saída do Google STT ou do ElevenLabs Scribe, verifique se o ñ está sendo renderizado corretamente e se as consoantes geminadas estão sendo preservadas, em vez de colapsadas. Esses são modos de falha comuns na saída de idiomas africanos de poucos recursos.

Arquivo de áudio sendo processado para transcrição
Arquivo de áudio sendo processado para transcrição

Comparando as opções de transcrição em wolof em 2026

FerramentaWolof listadoWER realObservações
Whisper Large-v3NãoN/ANão está na lista de idiomas
AssemblyAI UniversalNãoN/ANão listado
Deepgram Nova-3NãoN/ANão listado
Google STT V2Sim (wo-SN)Não publicadoModelo V2 básico, cobrança medida
ElevenLabs ScribeSim~40,7% de WERBenchmark do Scribe v1, faixa "Moderado"
Transcrição humanaN/APróximo de 0%Lenta, exige bilíngue wolof-francês

A tabela mostra um mercado sem opção pronta para produção. Um WER "Moderado" de 40% significa cerca de 4 palavras erradas a cada 10, o que é um peso enorme de edição para uso profissional.

Para uma visão mais ampla de como idiomas africanos de poucos recursos se saem diante dos modelos de ASR atuais, veja o post por que a IA sofre com idiomas de poucos recursos. A situação do wolof não é única: lacunas semelhantes existem para o hauçá, o amárico e vários outros idiomas com dezenas de milhões de falantes, mas corpora digitais de texto e áudio escassos.

O que podcasters e jornalistas de língua wolof devem fazer agora

A cena de podcasts em wolof está crescendo. O Wolof Tech, no Spotify e no Apple Podcasts, aborda tecnologia em wolof. O projeto "Xam sa démb, xam sa tey" publicou 50 episódios de conteúdo histórico em wolof e francês em parceria com os Arquivos Nacionais do Senegal. Pesquisadores acadêmicos estão usando gravações de campo para estudar a tradição oral.

Para esses produtores, o fluxo de trabalho prático em 2026 depende do tipo de conteúdo:

Podcasts em wolof-francês urbano (audiência de Dacar): Transcreva na trilha do francês. Revise a saída e preencha manualmente os elementos gramaticais do wolof. Exporte como SRT para legendas após a passada de edição. É mais lento do que o ideal, mas produz uma saída utilizável.

Wolof formal ou rural (francês mínimo): Use o ElevenLabs Scribe com o wolof selecionado e reserve tempo e orçamento para uma passada completa de edição. A 40% de WER, trate-o como um primeiro rascunho, não como uma transcrição pronta. Para gravações importantes de acervo, um transcritor humano bilíngue é a escolha mais honesta.

Wolof gambiano: Use transcrição humana ou a trilha do inglês para as passagens predominantlye em inglês. Nenhuma ferramenta de IA produz saída utilizável em wolof especificamente para conteúdo gambiano.

Uso jornalístico: Jornalistas senegaleses que escrevem em francês muitas vezes precisam extrair citações de entrevistas em wolof. A abordagem da trilha do francês captura com precisão as passagens em francês. Citações em wolof que precisam ser reproduzidas exatamente exigem transcrição manual.

Para conteúdo majoritariamente em francês com inserções de wolof, o post melhor transcrição para idiomas africanos aborda quais motores lidam com mais precisão com o cenário de sotaques franco-africanos.

O que vai mudar (e quando)

A pesquisa publicada em 2025 trouxe progresso mensurável. O corpus de 860 horas de wolof curado e o modelo de linguagem de fala baseado no HuBERT do artigo arXiv:2509.15362 mostram que um pré-treinamento dedicado move o WER do wolof da linha de base acadêmica para uma faixa mais viável. O ElevenLabs Scribe a 40,7% de WER já é, por si só, uma melhoria significativa em relação ao estado do ASR em wolof dois anos atrás.

O próximo passo que mudaria o panorama prático seria um dos grandes provedores hospedados (Deepgram, AssemblyAI, OpenAI) treinar um modelo capaz de lidar com o wolof e implantá-lo em escala de produção. Nenhum deles anunciou isso. A contribuição da comunidade wolof ao Common Voice e a corpora públicos semelhantes aceleraria esse cronograma, já que os laboratórios comerciais de ASR usam esses conjuntos de dados como benchmarks e sinais de treinamento.

Até lá, a resposta honesta é: a transcrição em wolof em 2026 é um problema de IA de baixa precisão ou de trabalho manual humano, e a solução alternativa da trilha do francês é o caminho mais prático para o conteúdo que a maioria dos usuários realmente tem.

Perguntas frequentes

O Whisper Large-v3 oferece suporte ao wolof?

Não. O wolof não está na lista de idiomas do Whisper Large-v3. O modelo oferece suporte a 99 idiomas, e os idiomas africanos que ele cobre incluem suaíli, iorubá, hauçá, amárico, somali, africâner, lingala e xona, mas não o wolof. Qualquer serviço construído sobre o Whisper, portanto, não tem suporte ao wolof.

Quais ferramentas de IA realmente oferecem suporte à transcrição em wolof em 2026?

O Google Cloud Speech-to-Text V2 lista o wolof (código de idioma wo-SN) no suporte documentado a idiomas. O ElevenLabs Scribe também lista o wolof, com um benchmark publicado mostrando aproximadamente 40,7% de taxa de erro por palavra. Ambas as opções existem, mas nenhuma produz uma saída limpa sem uma passada de revisão. Nenhuma grande ferramenta de bot de reuniões ou de colaboração em equipe (Otter, Fireflies, Trint, Descript) lista suporte ao wolof.

Por que a precisão do ASR em wolof é muito pior do que em francês ou inglês?

Escassez de dados de treinamento. Os maiores conjuntos públicos de dados de fala em wolof têm de 55 a 860 horas de áudio, dependendo do projeto. O treinamento de ASR em inglês chega às centenas de milhares de horas. O Common Voice, o maior corpus colaborativo multilíngue, não tem nenhuma coleta em wolof. Sem dados de treinamento, os modelos generalizam mal para a fonologia do wolof, seus padrões tonais e o inventário sonoro específico da língua.

Qual é a solução alternativa da alternância de código com o francês e quando ela se aplica?

Os falantes de wolof urbano em Dacar produzem uma fala intensamente misturada com francês, a ponto de pesquisadores descrevê-la como uma variedade de contato distinta. Se o seu áudio vem de falantes escolarizados de Dacar, definir o idioma da transcrição como francês fará com que todo o conteúdo em francês (frequentemente a maior parte do conteúdo lexical) seja transcrito corretamente, enquanto as partículas gramaticais do wolof geram saída em branco ou embaralhada. O rascunho resultante precisa de edição nos elementos do wolof, mas captura o conteúdo proposicional com precisão. Essa solução não se aplica ao wolof rural senegalês nem ao wolof gambiano, onde o código não-wolof é o inglês, e não o francês.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles