
Por que a transcrição erra: os modos de falha explicados
Summarize this article with:
Erros de transcrição caem em cinco categorias com correções diferentes: acústico (o modelo ouviu errado; corrija a gravação), linguístico (homófonos e nomes desconhecidos; adicione vocabulário ou edite), atribuição de falante (limites da diarização), erros de limite (palavras certas, timestamps errados) e alucinação (texto inventado como 'obrigado por assistir' durante o silêncio; corte o silêncio). Diagnostique a categoria antes de culpar o motor, porque os erros raramente são aleatórios.
A Resposta Curta
Erros de transcrição por IA se enquadram em cinco categorias distintas, cada uma com uma causa raiz diferente. Saber a qual categoria um erro pertence indica onde focar a correção. Erros que parecem aleatórios, na maioria das vezes, não são aleatórios de jeito nenhum.

Erros Acústicos: O Modelo Entendeu Errado
A causa subjacente é um sinal de áudio degradado. Quando o som que chega ao modelo é ambíguo, o modelo chuta, e às vezes chuta errado.
Os culpados acústicos mais comuns:
Áudio telefônico de banda estreita. A telefonia padrão codifica a fala a 8 kHz, cortando a maior parte do conteúdo de frequência acima de 4 kHz. Um benchmark de 2025 em gravações reais de call center descobriu que até o melhor sistema atingiu apenas 87,7% de precisão nesse áudio, contra os 95-99% vistos rotineiramente em gravações de banda larga. As altas frequências que faltam são exatamente o que distingue certas fricativas e oclusivas entre si.
Ruído de fundo. O ruído mascara o sinal de fala e reduz a relação sinal-ruído. O que o modelo recebe é uma mistura de vozes e ambiente, não uma voz limpa. Veja como lidar com ruído de fundo na transcrição para as opções técnicas.
Distância e reverberação. Um microfone do outro lado da sala capta um borrão de reverberação do som original. Quando a forma de onda chega ao modelo, as bordas das consoantes já estão borradas e palavras curtas desaparecem nas reflexões do ambiente.
Artefatos de microfone. Estalos de plosivas, ruído de vento, clipping e quedas de sinal removem cada um informações que o modelo precisa para distinguir fonemas. Uma forma de onda com clipping é irrecuperável; o modelo vê uma linha reta onde deveria haver uma consoante.
Minha visão: erros acústicos quase sempre são corrigíveis na fonte. Um microfone direcional de proximidade em uma sala silenciosa é uma melhoria de precisão maior do que trocar de provedor de transcrição.
Erros Linguísticos: O Modelo Ouviu Certo, mas Escolheu Errado
O modelo recebeu o áudio corretamente, mas selecionou a palavra errada entre opções acusticamente semelhantes. Isso é uma falha do modelo de linguagem, não um problema de sinal.
Homófonos
"Their", "there" e "they're" soam idênticos. O modelo usa o contexto ao redor para escolher um, e com frases curtas ou turnos rápidos de fala, esse contexto é raso. O mesmo vale para "affect" versus "effect", "principal" versus "principle", e centenas de pares parecidos. A escolha é probabilística, e o modelo às vezes erra com confiança.
Palavras Fora do Vocabulário (OOV)
Esse é um dos modos de falha mais consistentes. Todo modelo de transcrição tem um vocabulário treinado. Palavras fora desse vocabulário, na maioria das vezes nomes próprios, marcas, sobrenomes incomuns e termos técnicos, são reconhecidas erroneamente como o equivalente mais próximo dentro do vocabulário. O modelo não consegue gerar algo que nunca foi treinado para produzir.
Uma empresa chamada "Atrion" volta como "Adrian". Um nome de medicamento como "Dupixent" vira "duplex aunt". O nome de um fundador é renderizado como a palavra comum mais próxima. Erros OOV prejudicam justamente onde a precisão mais importa, porque nomes e termos de marca carregam significado que uma substituição genérica destrói.
Mitigação prática: tanto sistemas baseados em Deepgram quanto em Whisper suportam viés de vocabulário ou prompts iniciais. Alimentar uma lista de nomes próprios esperados antes da transcrição reduz substancialmente as falhas OOV.
Números e Formatos
"Três e cinquenta", "trezentos e cinquenta", "350" e "3:50" são todas interpretações plausíveis da mesma fala, dependendo do contexto. O modelo escolhe uma e, muitas vezes, erra o registro. Contextos técnicos com muitos números, como documentos jurídicos, chamadas financeiras ou palestras científicas, tendem a gerar uma taxa de erro numérico mais alta.
Vocabulário de Domínio
Áreas médicas, jurídicas, científicas e técnicas têm jargões sub-representados nos dados de treinamento geral. "Disartria" vira "dis artria". "Fiduciário" às vezes volta como "teoria de campo". O modelo recorre à palavra mais comum que ocupa um espaço acústico parecido.
Para saber mais sobre como os modelos escolhem entre candidatos concorrentes, veja explicação sobre precisão de transcrição.
Erros de Falante: Palavras Certas, Pessoa Errada
A diarização atribui palavras a falantes. Quando falha, a transcrição está correta, mas a atribuição está errada. Em áudio não segmentado, a taxa de erro de diarização em canal único fica entre 10% e 18%, segundo pesquisa publicada em 2025.
Por Que Vozes São Confundidas
A diarização de falantes funciona extraindo uma impressão vocal de cada segmento e agrupando-os. Dois falantes com tom, ritmo e sotaque parecidos ficam próximos nesse espaço de impressões, e o algoritmo de agrupamento acaba atribuindo os segmentos errados.
Turnos curtos pioram a situação. Quando alguém fala só "certo" ou "uhum" antes de devolver a palavra, o modelo quase não tem sinal para ancorar a identidade daquele falante. Esses backchannels de uma palavra só são frequentemente atribuídos de forma errada.
Fala Sobreposta: O Caso Mais Difícil
Quando duas pessoas falam ao mesmo tempo em um único microfone, as características acústicas delas se fundem em uma única forma de onda, e o algoritmo de diarização não consegue separá-las matematicamente. O resultado é ou um falante descartado ou um falante fantasma que não existe na realidade. Sistemas de diarização cientes de sobreposição detectam explicitamente essas regiões e as sinalizam, o que é melhor do que uma atribuição errada silenciosa, mas o conteúdo subjacente ainda é ambíguo.
A gravação multicanal, um microfone por falante, resolve isso de forma limpa. A separação de canais dá ao modelo um sinal que a diarização com um único microfone não consegue reproduzir.
Veja diarização de falantes explicada para um detalhamento mais completo de como o agrupamento funciona.
Erros de Fronteira: Palavras Certas, Posições Erradas
Palavras nas bordas dos segmentos de áudio são consistentemente o ponto de maior risco para erros. Dois mecanismos causam isso.
Corte na Detecção de Atividade de Voz
A maioria dos pipelines de transcrição usa detecção de atividade de voz (VAD) para identificar regiões de fala e pular o silêncio. Uma VAD agressiva dispara um pouco cedo ou um pouco tarde, cortando o primeiro fonema de uma fala ou a última consoante de uma frase. Palavras curtas, "sim", "não", "e", desaparecem por completo. O erro é invisível porque não há palavra errada na transcrição; a palavra correta simplesmente não está lá.
Artefatos de Fronteira de Bloco no Whisper
O Whisper processa áudio longo em janelas de 30 segundos, avançando com base nos timestamps previstos. Palavras que cruzam uma fronteira de bloco são processadas duas vezes, uma vez no fim de uma janela e outra no início da próxima. O resultado é duplicação de palavras, omissão de palavras ou uma emenda que funde duas palavras distintas. Esse é um comportamento documentado no pipeline de transcrição de formato longo do Whisper, não um caso isolado.
Ferramentas como WhisperX adicionam uma etapa dedicada de alinhamento que reancora os timestamps das palavras contra o sinal de áudio após a decodificação, o que reduz, mas não elimina, esses artefatos de fronteira.
Ao revisar uma transcrição, as posições das fronteiras de segmento, aproximadamente a cada 30 segundos, são os locais de maior probabilidade para esse tipo de erro.
Alucinação: Palavras que Ninguém Disse
O modelo produziu texto sem áudio correspondente. Isso é qualitativamente diferente das outras categorias porque não há uma entrada real que foi mal interpretada; o modelo inventou a saída do nada.
Silêncios Longos e Áudio Não Verbal
Está amplamente documentado que o Whisper gera texto durante silêncios, música de fundo ou ruído não verbal. As alucinações específicas não são aleatórias: como o Whisper foi treinado em aproximadamente 680 mil horas de áudio da web, incluindo grandes quantidades de conteúdo do YouTube, ele aprendeu a associar silêncio perto do fim de uma gravação com frases de encerramento de vídeos. Saídas como "Obrigado por assistir" ou "Inscreva-se no meu canal" aparecendo na transcrição de uma oitiva legal são o Whisper inserindo texto que aprendeu de roteiros de encerramento do YouTube, não texto que alguém realmente falou.
Laços de Repetição
Um modo de falha separado e reconhecido é o laço de repetição: o decodificador fica preso gerando a mesma frase repetidamente até que algo no áudio forneça uma nova âncora. Pesquisas documentaram esse comportamento em 14 de 19 idiomas auditados. O padrão é visualmente óbvio, uma frase se repetindo cinco ou dez vezes em sequência, e deve ser tratado como um sinal para truncar essa seção.
Vazamento de Dados de Treinamento
Além das frases do YouTube, foi demonstrado que o Whisper produz frases que parecem vir de seus dados de treinamento, e não do áudio de entrada. Essas são difíceis de detectar automaticamente porque são gramaticalmente plausíveis. Verificações manuais pontuais de transcrições de regiões de áudio silencioso ou muito baixo são a maneira mais confiável de pegá-las.
Uma mitigação: VAD antes do modelo, para que o modelo nunca veja as regiões de silêncio que disparam a alucinação. A maioria dos pipelines de transcrição bem configurados faz isso por padrão.
Como as Categorias se Combinam
Uma gravação real quase nunca falha em apenas uma categoria. Um podcast com dois apresentadores que às vezes falam por cima um do outro, gravado com microfones de laptop em uma sala com ruído de ar-condicionado, vai produzir erros acústicos, falhas de diarização durante sobreposições de fala, erros de OOV quando os convidados mencionam nomes obscuros, e alucinação durante o silêncio antes do episódio. O perfil de erro é aditivo.
O diagnóstico mais eficiente é pegar dez erros da sua transcrição, classificar cada um por categoria, e ver qual categoria domina. Isso te diz onde investir o esforço de correção.
| Condição de áudio | Faixa típica de precisão |
|---|---|
| Gravação em estúdio, um único falante, vocabulário comum | 95 a 99 por cento |
| Home office, um único falante, microfone decente | 90 a 96 por cento |
| Videoconferência, setup profissional, múltiplos falantes | 85 a 92 por cento |
| Chamada telefônica ou VoIP, áudio de banda estreita | 80 a 88 por cento |
| Gravação de campo, múltiplos falantes, ruído ambiente | 70 a 85 por cento |
| Sotaque carregado em áudio degradado | Abaixo de 70 por cento nos piores casos |
Faixas de precisão baseadas no benchmark de 2026 da AssemblyAI e no estudo de call center de 2025 da Voicegain. Resultados individuais variam conforme o motor e o áudio.
Onde Buscar Soluções
Este post explica os mecanismos. Para as mitigações práticas:
- Qualidade de áudio e escolha de microfone: dicas de microfone para transcrição clara e melhore a qualidade do áudio antes de transcrever
- Técnicas de redução de ruído: lidando com ruído de fundo na transcrição
- Como obter resultados mais precisos de arquivos com ruído: transcreva áudio de baixa qualidade
- Por que os índices de precisão variam entre serviços: precisão de transcrição explicada
Se você quiser testar seu próprio áudio antes de investir tempo em correções, o plano gratuito do ConvertAudioToText permite enviar até 10 minutos sem precisar de conta. O resultado vai mostrar qual categoria de erro predomina no seu arquivo específico.
Perguntas Frequentes
Por que minha transcrição diz "obrigado por assistir" quando ninguém falou isso?
Isso é uma alucinação documentada do Whisper, ligada aos dados de treinamento dele. O Whisper aprendeu com cerca de 680 mil horas de áudio da web, e uma grande parte veio de vídeos do YouTube com legendas. O modelo associa silêncio ou ruído não verbal aos finais típicos de vídeos do YouTube e gera essas frases como saída. Não é que ele esteja transcrevendo algo fraco ao fundo; é um reconhecimento de padrões na ausência de fala.
Por que nomes próprios quase sempre saem errados nas minhas transcrições?
Nomes próprios, sobrenomes, marcas e nomes incomuns são sub-representados nos dados gerais de treinamento. Quando o modelo encontra um nome que raramente ou nunca viu, ele substitui pela palavra mais próxima do vocabulário que se encaixa no padrão acústico. Esse é o problema de palavras fora do vocabulário (OOV), e é um dos modos de falha mais consistentes em todos os mecanismos de transcrição. O ajuste direto é usar viés de vocabulário ou um prompt inicial listando os nomes esperados.
Por que o mesmo locutor às vezes é identificado como duas pessoas diferentes?
A diarização de locutores funciona agrupando embeddings de voz. Enunciados curtos, palavras isoladas ou sons de concordância, não carregam sinal acústico suficiente para ancorar uma identidade de locutor de forma confiável. O modelo os atribui ao cluster mais próximo naquele momento, que pode não ser o locutor correto. Isso é especialmente comum em trocas rápidas, onde respostas curtas se alternam em sequência.
A transcrição por IA pode alucinar em áudio claramente falado?
Sim, mas é raro. O cenário mais comum é alucinação durante silêncio, música ou ruído não relacionado à fala. Em áudio claramente falado, os erros mais prováveis são substituições (palavra errada escolhida) em vez de inserções (palavra inventada). Alucinação real em fala limpa acontece, principalmente em loops de repetição onde o decodificador trava, mas é um mecanismo diferente do tipo desencadeado por silêncio.
Existe algo que eu possa fazer sobre erros de transcrição causados por locutores sobrepostos?
A solução mais eficaz é gravar com microfones separados, um por locutor. Áudio multicanal elimina a mistura de formas de onda que torna o cruzamento de falas impossível de diarizar corretamente. Se isso não for viável, a maioria dos sistemas modernos de diarização tem um modo de detecção de sobreposição que pelo menos sinaliza os segmentos ambíguos, em vez de fazer uma atribuição errada silenciosa. Edite manualmente esses segmentos sinalizados depois.
Fontes
- AssemblyAI, "Quão preciso é o reconhecimento de fala em 2026?" https://www.assemblyai.com/blog/how-accurate-speech-to-text
- Voicegain, "Benchmark de precisão de reconhecimento de fala 2025 para arquivos de áudio de call center de 8 kHz" https://www.voicegain.ai/post/2025-speech-to-text-accuracy-benchmark-for-8-khz-call-center-audio-files
- TechCrunch, "A ferramenta de transcrição Whisper da OpenAI tem problemas de alucinação, dizem pesquisadores" https://techcrunch.com/2024/10/26/openais-whisper-transcription-tool-has-hallucination-issues-researchers-say/
- Gladia, "Vieses em modelos de IA: o que deu errado com o Whisper da OpenAI?" https://www.gladia.io/blog/ai-model-biases-what-went-wrong-with-whisper-by-openai
- AssemblyAI, "O que é diarização de locutores e como funciona?" https://www.assemblyai.com/blog/what-is-speaker-diarization-and-how-does-it-work
- arxiv.org, "Investigação sobre alucinações do ASR Whisper induzidas por áudio não falado" https://arxiv.org/html/2501.11378v1
- Kerson AI Solutions, "Vieses de sotaque no reconhecimento de fala: desafios, impactos e soluções" https://kerson.ai/research/accent-bias-in-speech-recognition-challenges-impacts-and-solutions/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.