Whisper vs Google Cloud Speech-to-Text em 2026: qual API vence?
apitranscricaocomparacaowhispergoogle-cloud

Whisper vs Google Cloud Speech-to-Text em 2026: qual API vence?

BMMamane B. MoussaFebruary 23, 2026Updated July 1, 202615 min read

Summarize this article with:

Qual usar em 2026, OpenAI Whisper ou Google Cloud Speech-to-Text? Se você precisa de streaming em tempo real ou diarização de falantes hoje, o Google vence. Se você precisa da transcrição em lote mais barata por minuto, com ampla cobertura de idiomas, o Whisper vence. E se sua carga de trabalho é processamento em lote sem urgência, o tier Dynamic Batch do Google, a cerca de $0.004 por minuto, agora sai mais barato que a própria API do Whisper.

Uma alternativa gerenciada de preço fixo ao preço por minuto da API
Uma alternativa gerenciada de preço fixo ao preço por minuto da API

O resto deste guia explica o porquê.

A Versão Resumida

Ambos os serviços mudaram bastante desde a última rodada de posts comparativos. A API V2 do Google e o modelo Chirp 3 substituíram a antiga estrutura de tiers Standard/Enhanced. A OpenAI adicionou o gpt-4o-transcribe ao lado do whisper-1, que continua disponível. E o tier Dynamic Batch do Google virou a comparação de custos de cabeça para baixo, de um jeito que a maioria dos desenvolvedores ainda não notou.

Principais pontos:

  • Google Standard com Chirp 3: $0.016/min, inclui streaming, diarização e um denoiser embutido. O tier "Enhanced" separado não existe mais.
  • API Whisper (whisper-1): $0.006/min, apenas em lote, cobertura de 99 idiomas, sem diarização nativa.
  • Google Dynamic Batch: cerca de $0.004/min, resultados em até 24 horas, sem streaming.
  • gpt-4o-mini-transcribe: $0.003/min, a opção hospedada mais barata da OpenAI, com restrições de lote parecidas com as do whisper-1.

Se você precisa decidir rápido: só lote, sensível a custo, multilíngue? Comece com o Whisper. Precisa de tempo real ou de um serviço empresarial gerenciado? Google Cloud Speech-to-Text.

Duas Filosofias Diferentes

Antes de comparar preços, vale entender o que cada serviço realmente é.

OpenAI Whisper é um modelo de código aberto cujos pesos estão disponíveis publicamente no GitHub. Quando desenvolvedores falam "Whisper", podem estar se referindo ao modelo open-source rodando na própria GPU, ao endpoint hospedado whisper-1, ou aos modelos mais novos da OpenAI, como o gpt-4o-transcribe. O custo, o controle e a carga operacional são bem diferentes entre essas três opções.

Google Cloud Speech-to-Text é um serviço de nuvem totalmente gerenciado. Você envia o áudio, o Google processa, e você recebe o resultado de volta. O modelo subjacente não pode ser baixado. O que você ganha em troca é um serviço de nível de produção: streaming em tempo real, diarização de falantes, cobertura de mais de 100 idiomas com o Chirp 3, e um denoiser embutido para áudio ruidoso. A documentação oficial cobre o conjunto completo de recursos.

Essa diferença de filosofia molda todo o resto. O Whisper troca conveniência gerenciada por flexibilidade e controle de custo. O Google troca controle por polimento e completude.

Comparação Lado a Lado

RecursoOpenAI Whisper (API whisper-1)Google Cloud STT (V2 / Chirp 3)
Preço por minuto (padrão)$0.006$0.016
Menor preço gerenciado$0.003 (gpt-4o-mini-transcribe)~$0.004 (Dynamic Batch, retorno em 24h)
Camada gratuita$5 de créditos para contas novas60 minutos/mês contínuos
StreamingNão (endpoint whisper-1 é somente batch)Sim, em tempo real com resultados provisórios
Idiomas99100+ (Chirp 3 cobre 85+ GA/preview)
Diarização de falantesSem suporte nativoSim (modos batch/sync; não em streaming com Chirp 3)
Áudio ruidosoModeradoForte (denoiser embutido no Chirp 3)
Vocabulário personalizadoSomente via texto no promptSim, até 1.000 sugestões de frases
Self-hostingSim (pesos do modelo open-source)Não
Melhor paraBatch sensível a custo, self-hosting, multilíngueApps de streaming, empresas, áudio ruidoso

Detalhamento de Preços

É aqui que a comparação mudou mais em 2026, e vale a pena acertar os números.

Opções da OpenAI

O endpoint whisper-1 cobra uma taxa fixa de $0,006 por minuto, cobrada por segundo. A OpenAI agora também oferece:

  • gpt-4o-transcribe: $0,006/min (mesma taxa, promete melhor precisão que o whisper-1)
  • gpt-4o-mini-transcribe: $0,003/min (metade do preço, adequado para trabalhos em lote de menor risco)

Todos os três são endpoints somente em lote. A OpenAI tem um produto separado de fala em tempo real, mas a cerca de $0,017/min ele atende aplicações de voz ao vivo num patamar de preço bem diferente.

Opções V2 do Google

A API V2 com Chirp 3 simplificou os preços do Google:

  • Standard (tempo real ou lote): $0,016/min, Chirp 3 incluído sem custo extra
  • Dynamic Batch: cerca de $0,004/min, resultados entregues em até 24 horas
  • Modelos médicos: $0,078/min (ditado e conversação, não aplicável para uso geral)
  • Camada gratuita: 60 minutos/mês contínuos, mais $300 em créditos GCP para contas novas

A camada Dynamic Batch fica cerca de 75% abaixo da taxa standard. Essa conta dá aproximadamente $0,004/min, que fica abaixo dos $0,006/min da API Whisper. Para arquivos de podcast, transcrição de mídia e qualquer carga de trabalho em que você possa esperar até o dia seguinte, essa é a opção gerenciada mais econômica disponível entre os dois provedores.

Custo em Escala

Custo por hora de transcrição de áudio (julho de 2026)
gpt-4o-mini
$0,18/hr
Google Batch
~$0,24/hr
Whisper-1
$0,36/hr
Google Standard
$0,96/hr

Taxas verificadas: gpt-4o-mini-transcribe $0,003/min, Whisper-1 $0,006/min, Google Dynamic Batch ~$0,004/min, Google Standard $0,016/min. Dynamic Batch exige prazo de 24h. Google Standard inclui Chirp 3.

Volume MensalWhisper-1Google StandardGoogle Dynamic Batch
100 horas$36$96~$24
1.000 horas$360$960~$240

Com 1.000 horas por mês, o Dynamic Batch economiza cerca de $120 em relação ao Whisper e $720 em relação ao Google Standard. A contrapartida é uma janela de resultados de 24 horas, que muitos workloads em lote conseguem absorver.

Para uma visão mais ampla do que os serviços de transcrição cobram no mercado, o guia de comparação de preços de transcrição traz mais provedores lado a lado.

O Curinga do Self-Hosted

Hospedar o Whisper por conta própria muda completamente a estrutura de custos. Os pesos do modelo são gratuitos. O custo está no compute de GPU.

Na AWS, uma instância g5.xlarge (1x A10G, 24GB de VRAM) custa cerca de $1/hora sob demanda. O Whisper large-v3 em uma única A10G transcreve a aproximadamente 100x a velocidade em tempo real, ou seja, uma hora de GPU cobre cerca de 100 horas de áudio. Com utilização total, o custo efetivo por minuto de áudio fica bem abaixo de $0,002.

Isso parece atraente até você considerar o tempo ocioso. Uma GPU com 50% de utilização dobra seu custo efetivo por minuto. Some a isso o overhead de DevOps para deploy, monitoramento e escalonamento, e o ponto de equilíbrio contra a API do Whisper fica em torno de 500 horas por mês. Abaixo disso, a API quase sempre sai mais barata quando você precifica o tempo de engenharia.

O self-hosting faz sentido claro em dois cenários: volume acima de 500 horas por mês, ou requisitos de soberania de dados onde o áudio não pode sair da sua infraestrutura.

O artigo sobre custos ocultos dos serviços de transcrição detalha a matemática de utilização de GPU e overhead de infraestrutura.

Precisão por Idioma e Tipo de Áudio

Ambos os serviços alcançam forte precisão em áudio limpo em inglês. As diferenças em 2026 são mais sutis.

Google Chirp 3 em áudio ruidoso. O modelo Chirp 3 tem um removedor de ruído integrado que lida melhor com som de fundo, salas com eco e áudio de telefone do que a arquitetura Standard/Enhanced anterior. Para ligações e gravações de campo, isso é uma melhoria relevante, e vem incluso na tarifa padrão de $0,016/min, sem precisar de upgrade de plano.

Whisper em conteúdo multilíngue. O Whisper foi treinado com cerca de 680 mil horas de áudio multilíngue em 99 idiomas. Para línguas com menos recursos, como galês, suaíli, malaio e catalão, o Whisper costuma superar as alternativas, porque o conjunto de treinamento foi pensado de propósito para ter amplitude. O Google Chirp 3 cobre mais de 100 idiomas, mas só 24 estão totalmente disponíveis, o resto segue em preview. Cobertura no papel e precisão na prática divergem para esses idiomas em preview.

Comparativo direto em inglês. Para áudio limpo de estúdio, podcasts e reuniões bem gravadas, os dois serviços têm desempenho parecido, na faixa de 90% ou mais de precisão de palavras. A OpenAI afirma que o gpt-4o-transcribe reduz a taxa de erro em relação ao whisper-1, principalmente em fala com sotaque e áudio difícil. Essas alegações batem com benchmarks independentes, embora a margem varie conforme o domínio.

Minha visão: faça um piloto específico para o seu caso antes de decidir. A precisão em depoimentos jurídicos não é a mesma de ligações de suporte ao cliente, que também difere de apresentações em conferências. Benchmarks publicados são um ponto de partida, não uma decisão de contratação.

Para entender melhor o que a taxa de erro de palavras significa na prática, veja transcrição, precisão explicada.

A Questão do Streaming

O endpoint da API whisper-1 não suporta streaming. Você envia um arquivo de áudio completo, espera o processamento terminar e recebe a transcrição inteira em uma única resposta. Isso funciona bem para conteúdo pré-gravado, mas elimina qualquer uso que exija resultados ao vivo.

O Google Cloud Speech-to-Text oferece streaming em tempo real de verdade, via uma conexão gRPC bidirecional. Você envia os pedaços de áudio conforme eles chegam do microfone ou de uma transmissão ao vivo e recebe resultados provisórios em milissegundos, enquanto o Google processa cada segmento. Isso faz dele a escolha natural para legendagem ao vivo, assistentes de voz e transcrição de reuniões em tempo real.

Um aviso sobre o Chirp 3 e streaming: embora o modelo Chirp 3 suporte o método StreamingRecognize, a diarização de locutores no Chirp 3 está disponível, por enquanto, apenas nos modos de reconhecimento em lote e síncrono. Se você precisa de streaming e diarização ao mesmo tempo, consulte a documentação atual antes de montar seu pipeline.

O Whisper auto-hospedado pode se aproximar do streaming com ferramentas como o faster-whisper, usando segmentos de áudio sobrepostos, mas o Whisper foi arquitetado como um modelo em lote de blocos de 30 segundos. Dá para contornar isso, mas você não vai igualar a latência de um serviço feito sob medida para streaming.

Se streaming é um requisito inegociável, o Google Cloud Speech-to-Text é a escolha prática.

Auto-hospedar o Whisper: a avaliação honesta

Auto-hospedar garante privacidade total dos dados, sem custo por minuto, sem limites de requisição e a possibilidade de ajustar o modelo com seus próprios dados de domínio. Essas vantagens são reais.

Os custos também são reais:

  • Instâncias de GPU a US$ 0,75 a US$ 1 por hora sob demanda, muitas vezes mais
  • Tempo de engenharia para implantar, escalar, monitorar e atualizar o modelo
  • Sem diarização, vocabulário personalizado ou streaming prontos para uso

Auto-hospedar vale a pena quando você processa mais de 500 horas de áudio por mês com utilização consistente, ou quando sua postura de conformidade (HIPAA, interpretações rígidas da LGPD, contratos de defesa) exige que o áudio nunca saia da sua infraestrutura.

Abaixo de 500 horas por mês, a API do Whisper ou o Google Dynamic Batch costumam sair mais baratos, considerando as horas de engenharia. Para a maioria das startups e times de médio porte, a API é o ponto de partida certo.

Matriz de decisão

Caso de usoRecomendaçãoPor quê
Legendas ao vivo ou subtítulos em tempo realGoogle Cloud STTStreaming com resultados provisórios é essencial
Aplicativo controlado por vozGoogle Cloud STTStreaming de baixa latência é obrigatório
Lote de podcast ou arquivo de vídeoGoogle Dynamic BatchMais barato que a API do Whisper se um prazo de 24h for aceitável
Transcrição em lote de baixo custo (resultados rápidos)gpt-4o-mini-transcribe$0,003/min, resultados sob demanda
Conteúdo multilíngue (mais de 50 idiomas)API do WhisperMaior abrangência de treinamento multilíngue
Chamadas telefônicas, gravações de campo com ruídoGoogle Cloud STTRedutor de ruído integrado do Chirp 3
Soberania de dados exigidaWhisper auto-hospedadoO áudio nunca sai da sua infraestrutura
Alto volume (mais de 500h/mês)Whisper auto-hospedadoA economia de custo justifica o trabalho operacional em escala
Empresa com stack GCPGoogle Cloud STTIntegração nativa com os serviços do GCP
MVP ou protótipo de startupAPI do Whisper ou gpt-4o-miniPreço simples, caminho mais rápido para código funcionando

Se você só precisa de uma transcrição limpa de um arquivo de áudio ou vídeo sem montar uma integração de API, o ConvertAudioToText cuida do upload, da transcrição e da exportação sem precisar escrever código.

Como Decidir

Passe por estas quatro perguntas.

Você precisa de streaming em tempo real? Se sim, Google Cloud STT. O endpoint whisper-1 não faz isso, e soluções de streaming com Whisper auto-hospedado trazem um custo de engenharia considerável.

Seu trabalho em lote tolera um prazo de 24 horas? Se sim, o Google Dynamic Batch a cerca de $0,004/min agora é mais barato que a API do Whisper a $0,006/min. A vantagem de custo do concorrente virou para lotes não urgentes.

Você precisa de cobertura multilíngue forte em mais de 90 idiomas? Se sim, Whisper. A abrangência de treinamento para idiomas com menos recursos ainda não tem igual entre os serviços gerenciados.

Privacidade de dados é um requisito legal rígido? Se sim, o Whisper auto-hospedado é o caminho mais limpo.

Se nenhuma dessas opções der uma resposta clara, fique com o provedor que se encaixa melhor na sua infraestrutura atual. O Google se integra naturalmente a ambientes GCP. O Whisper combina com stacks em Python onde as bibliotecas do Hugging Face já estão em uso. Ambos dão conta da transcrição.

Para um detalhamento completo das tarifas por minuto em todas as principais APIs, incluindo Deepgram e AWS Transcribe, o guia de preços de APIs de speech-to-text cobre todo o cenário.

Perguntas Frequentes

O OpenAI Whisper é mais preciso que o Google Cloud Speech-to-Text?

Para áudio limpo em inglês, os dois são parecidos. O Google Chirp 3 leva uma leve vantagem em gravações com ruído, graças ao seu denoiser embutido. Para idiomas com menos recursos, o Whisper tende a performar melhor, porque seu conjunto de treinamento cobre 99 idiomas com dados multilíngues profundos. A resposta honesta é: rode um teste com 50 amostras do seu próprio áudio antes de se comprometer, já que fatores específicos do domínio pesam mais que benchmarks publicados.

Posso usar o Whisper para transcrição de reuniões ao vivo?

Não com o endpoint da API whisper-1, que é somente em lote e tem limite de 25MB por arquivo. Você precisaria hospedar o Whisper por conta própria e montar um pipeline de streaming com ferramentas como o faster-whisper, o que adiciona complexidade de engenharia. O Google Cloud Speech-to-Text (modelo Chirp 3) suporta streaming em tempo real com resultados provisórios e é a escolha mais prática para transcrição de reuniões ao vivo. A OpenAI até oferece um endpoint separado de fala em tempo real, mas custa cerca de $0,017 por minuto, o que muda bastante a conta.

É mais barato hospedar o Whisper por conta própria do que usar o Google Cloud Speech-to-Text?

Em volumes altos e com boa utilização de GPU, sim. Uma instância de GPU rodando Whisper large-v3 pode atingir custos efetivos bem abaixo de $0.002 por minuto. Mas o tier Dynamic Batch do Google, a aproximadamente $0.004 por minuto com exigência de entrega em 24 horas, agora sai mais barato que a API do Whisper ($0.006/min) para trabalhos em lote que não são sensíveis ao tempo, sem nenhum peso de operação de GPU. O self-hosting só compensa claramente quando você passa de cerca de 500 horas por mês e tem capacidade de engenharia para manter a infraestrutura.

O Google Cloud Speech-to-Text suporta diarização de locutores?

Sim. A diarização de locutores está disponível tanto na API V1 quanto na API V2 com o Chirp 3. Uma ressalva: com o Chirp 3, a diarização funciona em modo batch e síncrono (Recognize) para cerca de 15 idiomas suportados, mas ainda não está disponível em modo streaming. O Whisper não inclui diarização nativamente de forma alguma; você precisaria rodar um modelo separado, como o pyannote, por cima da saída do Whisper.

Posso alternar entre Whisper e Google Cloud Speech-to-Text depois?

Sim, com algum trabalho de integração. Ambos aceitam formatos de áudio padrão e retornam texto com timestamps. Os formatos das APIs são diferentes, os formatos de resposta diferem, e recursos exclusivos de cada serviço (vocabulário customizado do Google, modo de tradução do Whisper) precisam de adaptação. Se você prevê alternar, envolva suas chamadas de transcrição atrás de uma camada de abstração fina desde o início, assim a troca de provedor afeta um único arquivo, não todo o seu código.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles