Whisper Large-v3 explicado: arquitetura, WER e limites (2026)
whisperopenaireconhecimento de fala

Whisper Large-v3 explicado: arquitetura, WER e limites (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

O Whisper Large-v3 é o transformer encoder-decoder de 1,55B parâmetros da OpenAI, treinado em 5 milhões de horas de áudio e com suporte a 99 idiomas sob uma licença aberta permissiva. Ele atinge 2,7% de WER no LibriSpeech test-clean e reduz erros em 10-20% em relação ao Large-v2. As principais fraquezas são alucinação durante silêncio, falta de diarização nativa de falantes e baixa adequação para streaming em tempo real. A variante Turbo de outubro de 2024 reduz o decoder de 32 camadas para 4, caindo para 809M parâmetros e rodando 2-5x mais rápido com perda mínima de precisão.

Whisper Large-v3 é o modelo de reconhecimento de fala de pesos abertos da OpenAI, lançado em novembro de 2023. Ele tem 1,55 bilhão de parâmetros, suporta 99 idiomas e está no centro de grande parte das ferramentas de transcrição construídas em 2024 e 2025. Este post cobre a arquitetura, a história dos dados de treinamento, números de benchmark verificados e os modos de falha reais que você vai encontrar em produção.

Arquitetura: Transformer Encoder-Decoder

O Whisper é um transformer sequência a sequência com duas metades conectadas por atenção cruzada.

O encoder converte áudio bruto em uma representação compacta. O áudio é primeiro transformado em um espectrograma log-Mel usando 128 bins de frequência (o Large-v3 aumentou isso dos 80 bins usados nas versões anteriores). O espectrograma alimenta uma pilha de blocos transformer que produzem uma codificação de alta dimensão do conteúdo de áudio ao longo do tempo. O encoder processa áudio em janelas de 30 segundos.

O decoder é autorregressivo: ele gera tokens de saída um a um, atendendo à saída do encoder e aos seus próprios tokens anteriores. Esse único processo generativo lida com transcrição, tradução, identificação de idioma e detecção de atividade de voz por meio de roteamento de tokens especiais. O mesmo modelo produz texto em francês a partir de áudio em francês, texto em inglês a partir de áudio em inglês e texto em inglês a partir de áudio estrangeiro quando roda em modo de tradução.

Para o Large-v3 especificamente, a arquitetura tem 32 camadas de encoder e 32 camadas de decoder, largura de modelo de 1.280 e 20 cabeças de atenção. Esses números não mudaram em relação ao Large-v2; o que mudou no v3 foi os dados de treinamento e a contagem de bins Mel.

Os Dados de Treinamento por Trás do v3

O Whisper original (2022) foi treinado em 680.000 horas de áudio da web com rótulos fracos. O Large-v3 expandiu isso substancialmente.

A mistura de treinamento do v3 é:

  • 1 milhão de horas de áudio com rótulos fracos (transcrito por humanos ou pareado da web)
  • 4 milhões de horas de áudio com pseudo-rótulos gerados rodando o Large-v2 sobre dados não rotulados

Isso dá um total de 5 milhões de horas, treinadas por 2 épocas. A abordagem de pseudo-rotulagem, que usa um modelo existente para anotar dados novos, é o principal motivo pelo qual a v3 mostra uma redução de erro de 10 a 20% em relação à v2 em uma ampla gama de idiomas. A qualidade das pseudo-rotulas é limitada pela própria Large-v2, o que é tanto o ponto forte quanto o teto dessa abordagem.

A divisão original de 680 mil horas do artigo de 2022 dá uma ideia da distribuição de idiomas: cerca de 438 mil horas de inglês pareadas com transcrições em inglês, 117 mil horas de áudio em outros idiomas pareadas com transcrições no idioma nativo e 125 mil horas de áudio em outros idiomas pareadas com traduções para o inglês. Essa última categoria é o que dá ao Whisper sua capacidade de tradução pronta para uso.

Interface de upload de áudio usada para transcrição em lote com Whisper Large-v3
Interface de upload de áudio usada para transcrição em lote com Whisper Large-v3

Benchmarks de WER Verificados

Números retirados do cartão oficial do modelo e do Open ASR Leaderboard do Hugging Face, avaliados em Common Voice 15 e Fleurs.

BenchmarkWER
LibriSpeech test-clean (inglês lido)2,7%
LibriSpeech test-other (inglês variado)5,2%
Média do Open ASR Leaderboard7,44%
Corpus AMI (áudio de reuniões)15,95%
Hindi (ARTPARK-IISc Vaani)26,8%

Áudio do mundo real, reuniões, podcasts, ligações telefônicas, entrevistas, normalmente fica na faixa de 8 a 12% de WER. O LibriSpeech test-clean é áudio de audiolivros lidos em condições de gravação quase ideais, então o número de 2,7% representa o teto, não a média.

Para contexto, modelos open-source mais novos, como o Parakeet e o Canary da NVIDIA, agora superam o Whisper no LibriSpeech test-clean (cerca de 1,6 a 1,7% de WER). A posição dominante do Whisper nas ferramentas em uso vem da maturidade do seu ecossistema, da cobertura de idiomas e da variedade de runtimes otimizados ao redor dele, não da precisão no topo do ranking.

Cobertura de Idiomas: 99, mas Desigual

O Whisper Large-v3 suporta oficialmente 99 idiomas, com o cantonês adicionado como novo token de idioma na v3. O desempenho é fortemente concentrado nos idiomas com mais dados de treinamento.

Os idiomas com melhor suporte incluem inglês, espanhol, francês, alemão, italiano, japonês, coreano, português e russo. O desempenho em idiomas de baixos recursos, muitos idiomas africanos e idiomas regionais do sul da Ásia pode chegar a 25-35% de WER ou pior. O benchmark de hindi acima (26,8%) dá um ponto de dados concreto sobre onde até um idioma de recursos moderadamente altos se encontra em áudio desafiador.

Para casos de uso com idiomas de baixos recursos, veja nossa análise sobre por que a IA tem dificuldade com idiomas de baixos recursos.

O que a Large-v3 melhorou em relação à Large-v2

A arquitetura é essencialmente a mesma entre v2 e v3. Os ganhos vêm de:

  • Aumento dos bins de frequência Mel (128 vs 80), dando ao encoder resolução de frequência mais fina.
  • Um conjunto de treinamento de 5 milhões de horas versus as 680 mil horas originais, com pseudo-rotulagem da Large-v2.
  • Redução de 10-20% no erro entre idiomas, especialmente nos de baixos recursos.
  • Melhor precisão de timestamps.
  • Melhor tratamento de code-switching, quando falantes misturam dois idiomas no meio da frase.

A alegação de redução de alucinações que circulou após o lançamento da v3 é parcialmente precisa: a v3 alucina menos que a v2 em algumas condições, mas o problema não está resolvido. Continua sendo uma fraqueza conhecida em produção.

A variante Turbo (outubro de 2024)

A OpenAI lançou o Whisper Large-v3-Turbo em outubro de 2024. A mudança principal é a poda do decoder: 32 camadas do decoder reduzidas para 4, derrubando a contagem de parâmetros de 1,55B para 809M. O encoder permanece inalterado.

O resultado é uma inferência 2 a 5 vezes mais rápida, com o que a OpenAI descreve como "degradação mínima de qualidade". Em GPUs NVIDIA, as medições de fator de tempo real mostram o Turbo processando áudio significativamente mais rápido que o tempo real. A contrapartida é que o Turbo exclui tarefas de tradução do seu fine-tuning, então ele lida apenas com transcrição.

Para a maioria dos casos de transcrição em lote em produção, o Turbo agora é a escolha padrão quando você controla a infraestrutura. A diferença de precisão é pequena o bastante para que o ganho de throughput geralmente compense.

Limitações Conhecidas em Produção

Alucinação durante silêncios. O decoder do Whisper continua gerando tokens mesmo quando não há fala presente, especialmente na temperatura 0. A saída costuma ser um texto com aparência plausível que nunca foi falado. A correção padrão é o pré-processamento com VAD (detecção de atividade de voz) para remover segmentos de silêncio antes que cheguem ao modelo. Um esquema de fallback de temperatura, que fornece uma tupla de valores crescentes em vez de um float fixo, também reduz loops. Nosso post sobre como o VAD funciona cobre a técnica.

Sem diarização nativa de falantes. O Whisper produz uma transcrição contínua sem rótulos de falante. A solução padrão é o WhisperX, que encadeia Whisper (via backend faster-whisper), alinhamento forçado em nível de fonema usando wav2vec2 e diarização com pyannote.audio em um único pipeline. Cada etapa também pode ser executada de forma independente. Para mais sobre diarização, veja diarização de falantes explicada.

Ajuste ruim para streaming em tempo real. A janela de processamento de 30 segundos e o decoder autorregressivo dificultam streaming de baixa latência. Modelos feitos para streaming usam uma arquitetura diferente, tipicamente CTC de streaming ou atenção em blocos com saída de hipóteses parciais. A série Nova da Deepgram é a alternativa mais comum para casos de uso em tempo real. O post sobre Deepgram Nova-3 cobre a comparação.

Sem contexto entre blocos. Um arquivo de áudio de 60 minutos é processado como 120 blocos sequenciais de 30 segundos. O modelo não tem memória do bloco 1 quando processa o bloco 5. Um nome, sigla ou termo introduzido no início pode ser transcrito de forma inconsistente mais adiante no mesmo arquivo.

Vocabulário especializado. O Whisper não tem mecanismo de ajuste de vocabulário. Terminologia médica, jurídica ou financeira que não apareceu com frequência no treinamento vai gerar erros até em áudio limpo. O ajuste fino com dados específicos do domínio é a correção certa para casos de uso especializados de alto risco.

Rodando o Whisper Você Mesmo

Três caminhos práticos para implantação local:

Implementação de referência da OpenAI (Python). O código canônico, com inferência mais lenta. Útil para testar ou depurar o comportamento do modelo, mas não para produção com alto volume.

Whisper.cpp (C++). Roda em CPU, Apple Silicon (Metal), CUDA e Vulkan. A melhor opção para implantações em Mac ou sistemas embarcados. Sem dependência de Python.

Faster-Whisper (Python, via CTranslate2). Roda 4x mais rápido que a implementação de referência em GPUs NVIDIA, com quantização INT8 reduzindo o uso de VRAM em cerca de 40%. É a escolha padrão para servidores Linux com GPU.

Os três produzem saída equivalente a partir dos mesmos pesos do modelo. A diferença está na velocidade de inferência e no uso de recursos.

Licença

O código e os pesos do Whisper são liberados sob a Licença MIT, conforme o repositório oficial da OpenAI no GitHub. A página do modelo no Hugging Face lista Apache 2.0. Ambas são licenças permissivas que permitem uso comercial sem royalties. Se o seu caso de uso exigir uma licença específica, verifique o repositório do GitHub diretamente, em vez de confiar na listagem do Hugging Face.

Quando o Whisper Serve, e Quando Não Serve

O Whisper Large-v3 é uma boa opção padrão para:

  • Transcrição em lote de áudio pré-gravado.
  • Conteúdo multilíngue ou com idioma de origem desconhecido.
  • Tarefas de tradução (áudio em outros idiomas para texto em inglês).
  • Casos de uso que exigem um modelo de pesos abertos que você possa rodar na sua própria infraestrutura.

É a escolha errada para:

  • Streaming em tempo real ou de baixa latência, use um modelo otimizado para streaming.
  • Transcrição de reuniões com atribuição de falantes, adicione uma camada de diarização ou use um serviço que já inclua isso.
  • Vocabulário altamente especializado sem fine-tuning, é necessária adaptação de domínio.

Para uma comparação mais ampla de abordagens de transcrição e seus custos, veja a comparação de preços de transcrição e a visão geral das melhores APIs de speech-to-text.

Se você quiser avaliar o Whisper no seu próprio áudio sem montar nenhuma infraestrutura, o plano gratuito do ConvertAudioToText roda um pipeline Whisper Large-v3 no áudio enviado. Suba um arquivo de amostra e compare a saída com seu benchmark antes de se comprometer com qualquer caminho de implementação.

Perguntas Frequentes

Quantos parâmetros o Whisper Large-v3 tem?

O Whisper Large-v3 tem 1.550 milhões de parâmetros (1,55B). A variante Turbo de outubro de 2024 reduz isso para 809M ao diminuir o decoder de 32 camadas para 4, entregando inferência 2-5x mais rápida com uma pequena perda de precisão.

Qual taxa de erro por palavra o Whisper Large-v3 alcança?

No LibriSpeech test-clean (áudio de audiolivros em inglês lido), o Whisper Large-v3 chega a 2,7% de WER. Na divisão test-other, mais difícil, alcança 5,2%. A média de WER no conjunto de benchmarks do Open ASR Leaderboard é 7,44. Áudio do mundo real com ruído, sotaques ou qualidade de telefone normalmente fica na faixa de 8-12%.

O Whisper Large-v3 suporta diarização de falantes?

Não. O Whisper não identifica nativamente quem está falando. A abordagem padrão é rodar o Whisper para a transcrição, depois rodar o pyannote.audio separadamente para as fronteiras de falantes, e alinhar as duas saídas usando timestamps em nível de palavra. A biblioteca WhisperX empacota esse pipeline de três etapas em uma única ferramenta.

Por que o Whisper alucina texto durante o silêncio?

O decodificador autoregressivo do Whisper continua gerando tokens mesmo quando não há fala, principalmente com decodificação determinística (temperatura 0). A correção mais confiável é aplicar pré-processamento com detecção de atividade de voz (VAD) para remover segmentos de silêncio antes que cheguem ao modelo. Usar um agendamento de fallback de temperatura em vez de um único valor fixo também ajuda, pois dispara a reamostragem quando o modelo entra em loop.

Qual é a diferença entre Whisper Large-v3 e Large-v3-Turbo?

Ambos compartilham o mesmo encoder. O Turbo reduz o decoder de 32 camadas para 4 e ajusta o resultado, diminuindo o total de parâmetros de 1,55B para 809M. O ganho de velocidade é de 2 a 5 vezes, dependendo do hardware. A OpenAI descreve a diferença de precisão como "degradação menor de qualidade". O Turbo não suporta tarefas de tradução, porque o fine-tuning excluiu dados de tradução.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles