
Transcrição de amárico: escrita ge'ez e a realidade dos motores
Summarize this article with:
O amárico é uma língua oficialmente suportada por vários motores ASR importantes, mas a qualidade desse suporte varia drasticamente. O modelo Universal-2 da AssemblyAI cobre o idioma com um aviso de "precisão razoável" classificado pelo próprio fornecedor (WER acima de 50%). A família Chirp do Google Cloud e o AWS Transcribe incluem am-ET, mas o Whisper large-v3 apresenta taxas de erro de caracteres relatadas acima de 100% em áudio limpo em amárico, indicando comportamento severo de alucinação ou inserção. Se o seu trabalho depende de saída correta em Fidel, planeje uma etapa significativa de edição ou considere modelos etíopes de nível acadêmico para fluxos de trabalho centrados no amárico.
O amárico tem cerca de 32 milhões de falantes nativos e é a língua de trabalho do governo federal etíope. Para transcrição por IA, é uma das línguas semíticas mais difíceis de acertar. O problema central não é que as ferramentas ignorem o amárico, e sim que as ferramentas que afirmam oferecer suporte frequentemente têm um desempenho muito pior do que seu marketing sugere. Este artigo percorre o que cada motor importante realmente faz com o amárico, por que a escrita Fidel cria modos de falha específicos e como são os fluxos de trabalho práticos em 2026.
A escrita ge'ez e por que ela quebra o ASR de forma diferente
O amárico é escrito na escrita ge'ez, chamada Fidel em amárico. Fidel não é um alfabeto; é um silabário. Cada um dos 33 caracteres base representa um par completo consoante-vogal, e cada caractere base tem sete formas variantes de vogal, resultando em mais de 200 caracteres distintos em uso cotidiano. A sílaba ሀ (ha) torna-se ሁ (hu), ሂ (hi), ሃ (haa), ሄ (he), ህ (apenas a consoante) e ሆ (ho). Uma única substituição de caractere não é um erro de ortografia: é um erro de palavra inteira.
É por isso que línguas com escrita ge'ez apresentam taxas de erro de palavra estruturalmente mais altas do que línguas com escrita latina em volumes comparáveis de dados de treinamento. Pesquisas comparando ASR entre línguas africanas constataram que línguas com escrita ge'ez têm, em média, cerca de 43,5% de melhor WER após fine-tuning, contra cerca de 36,2% para línguas africanas com escrita latina, mesmo quando as condições de teste são equivalentes. A arquitetura da escrita faz parte dessa penalidade, não apenas a escassez de dados.
Três características no nível da escrita tornam o amárico particularmente difícil:
A geminação é invisível na escrita. No amárico falado, a duração das consoantes é fonêmica: alä significa "ele disse", allä significa "há". A escrita não marca nenhuma das duas. Um sistema de ASR que tenta produzir saída em Fidel não pode inferir a geminação apenas pelo mapeamento áudio-caractere; ele precisa de contexto fonológico para o qual a maioria dos modelos não é treinada.
Vários caracteres compartilham o mesmo som. O grupo ha, o grupo a e o grupo sa contêm, cada um, caracteres foneticamente idênticos no amárico moderno falado. Quando um modelo ouve o mesmo fone, ele precisa adivinhar qual caractere Fidel escrever. A ambiguidade homofônica cria um piso de erro mesmo quando o reconhecimento de fonemas é preciso.
Consoantes labializadas usam sequências de múltiplos caracteres. Vinte grafemas labiovelares e dezoito grafemas labializados no amárico são representados como combinações de duas ou três sílabas consoante-vogal. Modelos que não tratam essas sequências explicitamente tendem a produzir saída fragmentada ou incorreta.
Para entender por que esses padrões aparecem nas línguas africanas de baixos recursos, veja por que a IA tem dificuldade com línguas de baixos recursos.
O que os principais motores realmente suportam
A comparação abaixo é baseada em documentação verificada até julho de 2026.
| Motor | Suporte ao amárico | Código de idioma | Nível de precisão | Observações |
|---|---|---|---|---|
| Google Cloud STT | Sim | am-ET | Não publicado | Modelos Chirp, Chirp 2, Chirp 3 |
| AWS Transcribe | Sim | am-ET | Não publicado | Lote e streaming |
| AssemblyAI | Sim (somente Universal-2) | am | Razoável (WER acima de 50%) | Não está no Universal-3 Pro |
| Whisper large-v3 | Nominal | am | Ruim | CER relatado acima de 100% em benchmarks |
| Deepgram Nova-2/Nova-3 | Não | n/a | n/a | Não está na lista de idiomas suportados |
| Ethio-ASR (pesquisa) | Sim | am | ~30% WER (relatado) | Modelo de pesquisa aberto, corpus WAXAL |
Google Cloud Speech-to-Text (am-ET) está disponível na família de modelos Chirp e inclui suporte à pontuação automática. O Google não publica benchmarks de precisão específicos por idioma para o amárico, então a qualidade no seu tipo específico de áudio é algo que você precisará medir por conta própria.
AWS Transcribe (am-ET) oferece suporte tanto à transcrição em lote quanto em streaming, mas não suporta recursos avançados como modelos de linguagem personalizados, redação de PII ou Call Analytics para o amárico. É um caminho básico de transcrição.
O modelo Universal-2 da AssemblyAI é a única API comercial importante que publica um nível de precisão para o amárico. Eles o classificam como "precisão razoável", o que significa taxa de erro de palavra acima de 50%. Essa é uma desvantagem significativa para qualquer fluxo de trabalho em que a qualidade da saída importa. O modelo de nível superior Universal-3 Pro, que cobre a maioria dos outros idiomas da AssemblyAI, não inclui o amárico até o momento em que este artigo foi escrito.
Whisper large-v3 lista o amárico entre seus idiomas suportados, mas os resultados de benchmark contam outra história. Pesquisas constataram taxas de erro de caracteres relatadas acima de 100% para o Whisper large-v3 em áudio limpo em amárico do FLEURS, ou seja, o modelo insere, repete ou alucina mais caracteres do que o texto de referência contém. Esse provavelmente é um padrão de alucinação exacerbado pelos limitados dados de treinamento em amárico e pela dificuldade do modelo em atribuir caracteres Fidel. O Whisper large-v2 não apresenta essa regressão no mesmo grau. Variantes do Whisper submetidas a fine-tuning, treinadas especificamente em conjuntos de dados de amárico (FLEURS, Mozilla Common Voice e corpora específicos de domínio), têm desempenho consideravelmente melhor. O artigo de março de 2025 "Whispering in Amharic" mostra que a normalização de homófonos e o treinamento combinado com FLEURS reduzem significativamente o WER em relação ao modelo base.
Deepgram (Nova-2 e Nova-3) não inclui o amárico em sua lista de idiomas suportados. Nenhum dos dois níveis de modelo cobre o idioma.
Para uma visão mais ampla de como preços e profundidade de recursos variam entre esses motores, veja a comparação de preços de transcrição e o guia de preços do AWS Transcribe.

O amárico na Etiópia: os casos de uso reais
A demanda por transcrição de amárico é real e concentrada em setores específicos. Entender o caso de uso define qual ferramenta é adequada.
A Ethiopian Broadcasting Corporation (EBC) é a emissora mais antiga e maior do país, sediada em Adis Abeba. Sua principal língua de produção é o amárico, com cobertura adicional em oromo, somali, tigrínia e afar. Jornalistas, pesquisadores e monitores de mídia que trabalham com conteúdo da EBC enfrentam todo o desafio do ASR em amárico: amárico de redação jornalística com múltiplos falantes, sotaques regionais, vocabulário técnico e político e velocidades de fala rápidas.
A documentação do governo federal é feita em amárico. Processos judiciais, documentos de políticas públicas e reuniões oficiais geram áudio em amárico que precisa ser transcrito para registro, acessibilidade e arquivamento. O padrão de precisão aqui é alto, e saídas com "precisão razoável" ou WER acima de 50% não são utilizáveis sem uma revisão significativa.
A diáspora etíope gera demanda por transcrição de conteúdo familiar e comunitário: entrevistas, gravações de podcasts, programação religiosa, eventos culturais. Esse áudio tende a incluir alternância de código entre amárico e inglês (comunidades da diáspora nos EUA e na Europa) ou entre amárico e árabe (comunidades no Golfo e no Oriente Médio). A alternância de código desestabiliza qualquer modelo monolíngue.
Pesquisa e jornalismo que acompanham eventos políticos e sociais etíopes produzem cada vez mais áudio em amárico que precisa de indexação e tradução. Instituições acadêmicas e ONGs internacionais que atuam na Etiópia enfrentam esse problema regularmente.
Para fluxos de trabalho relacionados de transcrição de línguas africanas, os guias irmãos sobre transcrição de suaíli no Quênia e na Tanzânia, transcrição de hauçá na Nigúria e a visão geral mais ampla sobre melhor transcrição para línguas africanas abordam o mesmo cenário de qualidade de ASR sob diferentes ângulos linguísticos.
Como é um fluxo de trabalho prático de amárico hoje
Dado o cenário de precisão, uma transcrição de amárico com qualidade de produção exige uma etapa de edição humana independentemente do motor que você usar. A questão é qual motor lhe dá o melhor ponto de partida.
Se você está na infraestrutura do Google Cloud ou da AWS, comece por esses endpoints nativos de amárico. Eles fornecem saída em Fidel sem qualquer custo adicional de portabilidade de modelo e se integram a pipelines de nuvem existentes. Faça benchmark em uma amostra de 5 a 10 minutos do seu áudio real antes de escalar.
Se você precisa de um endpoint de API com um piso de precisão conhecido, o modelo Universal-2 da AssemblyAI é a opção comercial mais transparente: ele declara seu nível de precisão, e você não fica no chute. A classificação de WER acima de 50% significa planejar que um falante fluente de amárico revise cada transcrição antes do uso.
Se você opera sua própria infraestrutura e tem tempo para fazer fine-tuning, um modelo Whisper-small ajustado com dados combinados de amárico do FLEURS e do Common Voice supera o modelo large-v3 pronto para uso no amárico. O modelo de pesquisa Ethio-ASR, treinado no corpus WAXAL em cinco línguas etíopes, apresenta cerca de 30% de WER médio como linha de base de pesquisa.
Uma coisa a verificar em qualquer saída: confirme se o modelo está produzindo escrita Fidel, não transliteração latina. Se você receber "ena alle" em vez de "እና አለ", a saída é inutilizável para leitores de amárico e representa uma falha de geração de escrita, não apenas um problema de precisão.
Para fluxos de trabalho que envolvem várias línguas africanas na mesma gravação, ou amárico combinado com inglês, note que a precisão com alternância de código em todos os motores disponíveis hoje é mais fraca do que o desempenho monolíngue em amárico. Este é um problema de pesquisa em aberto, não uma questão de configuração.
Se você precisa de uma ferramenta de transcrição para outros arquivos de áudio, o ConvertAudioToText lida com uma ampla variedade de idiomas com alta precisão. Para o amárico especificamente, a posição honesta é que nenhuma ferramenta entrega hoje uma saída com qualidade de produção sem uma etapa de revisão, e essa é uma lacuna que você deve incorporar ao seu fluxo de trabalho e orçamento independentemente do motor que usar.
A trajetória da pesquisa
O ASR de amárico avançou significativamente entre 2022 e 2026, em grande parte por meio de esforço acadêmico e de pesquisa, e não de investimento comercial. Três desenvolvimentos merecem atenção:
O projeto Ethio-ASR (março de 2026) é o trabalho mais atual de ASR multilíngue etíope, cobrindo o amárico junto com tigrínia, oromo, sidaama e wolaytta usando o corpus WAXAL. Ele supera modelos multilíngues maiores, como o OmniASR, com menos parâmetros ao focar na família linguística. Modelos como esse provavelmente serão incorporados a APIs comerciais conforme a pesquisa amadurece.
O projeto Massively Multilingual Speech (MMS) da Meta cobre o amárico em seu modelo de fala para texto com 1.100 idiomas. O MMS está disponível como checkpoint de código aberto no Hugging Face. Ele não está polido para uso em produção, mas é uma das opções de cobertura mais amplas disponíveis para línguas de baixos recursos, incluindo o amárico.
O modelo Chirp 3 do Google agora inclui o amárico com suporte a am-ET em várias regiões. O Chirp 3 representa o mais recente modelo fundacional do Google para fala, e sua inclusão do amárico sugere investimento comercial no idioma que estava ausente das ofertas anteriores de STT do Google.
A tendência é positiva, mas a lacuna entre "listado como suportado" e "pronto para produção sem revisão" continua ampla para o amárico em 2026. Planeje-se de acordo.
Perguntas frequentes
O Whisper suporta amárico?
O Whisper lista o amárico entre seus mais de 99 idiomas suportados, mas o desempenho no mundo real é ruim. Benchmarks de pesquisa mostram taxas de erro de caracteres relatadas acima de 100% para o Whisper large-v3 em áudio limpo em amárico, ou seja, o modelo insere, repete ou alucina mais do que transcreve corretamente. Variantes do Whisper submetidas a fine-tuning (treinadas com dados de amárico do FLEURS e do Common Voice) têm desempenho consideravelmente melhor, mas o modelo base não é confiável para transcrição de amárico em produção.
O Google Cloud Speech-to-Text ou o AWS Transcribe conseguem lidar com o amárico?
Ambos incluem o amárico. O Google Cloud Speech-to-Text oferece suporte a am-ET nos modelos Chirp, Chirp 2 e Chirp 3. O AWS Transcribe oferece suporte a am-ET tanto para transcrição em lote quanto em streaming. Nenhum dos dois serviços publica números de precisão específicos para o amárico, então você deve fazer benchmarks em uma amostra representativa do seu áudio antes de se comprometer com um fluxo de trabalho.
Por que a escrita Fidel torna o ASR de amárico mais difícil do que línguas com escrita latina?
Fidel é um silabário em que cada caractere codifica um par completo consoante-vogal. Isso significa que uma única substituição errada de caractere é contada como um erro de palavra inteira, não como um erro parcial de ortografia. Além disso, a ortografia do amárico não marca geminação (consoantes dobradas que distinguem significados, como alä "ele disse" versus allä "há"), e vários caracteres Fidel distintos compartilham a mesma pronúncia (o grupo ha, o grupo a, o grupo sa). Essas ambiguidades amplificam os erros do ASR de formas que línguas com escrita latina não enfrentam na mesma taxa.
Qual é a opção de ASR para amárico mais precisa disponível hoje?
O modelo de pesquisa Ethio-ASR, treinado conjuntamente em amárico e outras quatro línguas etíopes usando o corpus WAXAL, alcançou um WER médio relatado de cerca de 30% nos benchmarks de março de 2026, o que representa o estado da arte acadêmico. Entre os serviços comerciais, o modelo Universal-2 da AssemblyAI suporta amárico e é a única API importante com um nível de precisão publicado para o idioma, embora o sinalize como "precisão razoável" (WER acima de 50%). Para fluxos de trabalho de produção em que a precisão é crítica, espere uma etapa significativa de edição humana com qualquer motor comercial atual.
Fontes
- Idiomas suportados pelo Google Cloud Speech-to-Text: https://docs.cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Idiomas suportados pelo AWS Transcribe: https://docs.aws.amazon.com/transcribe/latest/dg/supported-languages.html
- Idiomas suportados pela AssemblyAI: https://www.assemblyai.com/docs/supported-languages
- Visão geral de modelos e idiomas da Deepgram: https://developers.deepgram.com/docs/models-languages-overview
- "Whispering in Amharic: Fine-tuning Whisper for Low-resource Language" (arXiv 2503.18485): https://arxiv.org/abs/2503.18485
- "Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages" (arXiv 2603.23654): https://arxiv.org/abs/2603.23654v1
- Visão geral da Ethiopian Broadcasting Corporation: https://statemediamonitor.com/2026/04/ethiopian-broadcasting-corporation-ebc/
- TTS de amárico do Meta MMS no Hugging Face: https://huggingface.co/facebook/mms-tts-amh
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.