
Whisper vs Google Cloud Speech-to-Text em 2026: qual API vence?
Summarize this article with:
Qual usar em 2026, OpenAI Whisper ou Google Cloud Speech-to-Text? Se você precisa de streaming em tempo real ou diarização de falantes hoje, o Google vence. Se você precisa da transcrição em lote mais barata por minuto, com ampla cobertura de idiomas, o Whisper vence. E se sua carga de trabalho é processamento em lote sem urgência, o tier Dynamic Batch do Google, a cerca de $0.004 por minuto, agora sai mais barato que a própria API do Whisper.

O resto deste guia explica o porquê.
A Versão Resumida
Ambos os serviços mudaram bastante desde a última rodada de posts comparativos. A API V2 do Google e o modelo Chirp 3 substituíram a antiga estrutura de tiers Standard/Enhanced. A OpenAI adicionou o gpt-4o-transcribe ao lado do whisper-1, que continua disponível. E o tier Dynamic Batch do Google virou a comparação de custos de cabeça para baixo, de um jeito que a maioria dos desenvolvedores ainda não notou.
Principais pontos:
- Google Standard com Chirp 3: $0.016/min, inclui streaming, diarização e um denoiser embutido. O tier "Enhanced" separado não existe mais.
- API Whisper (whisper-1): $0.006/min, apenas em lote, cobertura de 99 idiomas, sem diarização nativa.
- Google Dynamic Batch: cerca de $0.004/min, resultados em até 24 horas, sem streaming.
- gpt-4o-mini-transcribe: $0.003/min, a opção hospedada mais barata da OpenAI, com restrições de lote parecidas com as do whisper-1.
Se você precisa decidir rápido: só lote, sensível a custo, multilíngue? Comece com o Whisper. Precisa de tempo real ou de um serviço empresarial gerenciado? Google Cloud Speech-to-Text.
Duas Filosofias Diferentes
Antes de comparar preços, vale entender o que cada serviço realmente é.
OpenAI Whisper é um modelo de código aberto cujos pesos estão disponíveis publicamente no GitHub. Quando desenvolvedores falam "Whisper", podem estar se referindo ao modelo open-source rodando na própria GPU, ao endpoint hospedado whisper-1, ou aos modelos mais novos da OpenAI, como o gpt-4o-transcribe. O custo, o controle e a carga operacional são bem diferentes entre essas três opções.
Google Cloud Speech-to-Text é um serviço de nuvem totalmente gerenciado. Você envia o áudio, o Google processa, e você recebe o resultado de volta. O modelo subjacente não pode ser baixado. O que você ganha em troca é um serviço de nível de produção: streaming em tempo real, diarização de falantes, cobertura de mais de 100 idiomas com o Chirp 3, e um denoiser embutido para áudio ruidoso. A documentação oficial cobre o conjunto completo de recursos.
Essa diferença de filosofia molda todo o resto. O Whisper troca conveniência gerenciada por flexibilidade e controle de custo. O Google troca controle por polimento e completude.
Comparação Lado a Lado
| Recurso | OpenAI Whisper (API whisper-1) | Google Cloud STT (V2 / Chirp 3) |
|---|---|---|
| Preço por minuto (padrão) | $0.006 | $0.016 |
| Menor preço gerenciado | $0.003 (gpt-4o-mini-transcribe) | ~$0.004 (Dynamic Batch, retorno em 24h) |
| Camada gratuita | $5 de créditos para contas novas | 60 minutos/mês contínuos |
| Streaming | Não (endpoint whisper-1 é somente batch) | Sim, em tempo real com resultados provisórios |
| Idiomas | 99 | 100+ (Chirp 3 cobre 85+ GA/preview) |
| Diarização de falantes | Sem suporte nativo | Sim (modos batch/sync; não em streaming com Chirp 3) |
| Áudio ruidoso | Moderado | Forte (denoiser embutido no Chirp 3) |
| Vocabulário personalizado | Somente via texto no prompt | Sim, até 1.000 sugestões de frases |
| Self-hosting | Sim (pesos do modelo open-source) | Não |
| Melhor para | Batch sensível a custo, self-hosting, multilíngue | Apps de streaming, empresas, áudio ruidoso |
Detalhamento de Preços
É aqui que a comparação mudou mais em 2026, e vale a pena acertar os números.
Opções da OpenAI
O endpoint whisper-1 cobra uma taxa fixa de $0,006 por minuto, cobrada por segundo. A OpenAI agora também oferece:
- gpt-4o-transcribe: $0,006/min (mesma taxa, promete melhor precisão que o whisper-1)
- gpt-4o-mini-transcribe: $0,003/min (metade do preço, adequado para trabalhos em lote de menor risco)
Todos os três são endpoints somente em lote. A OpenAI tem um produto separado de fala em tempo real, mas a cerca de $0,017/min ele atende aplicações de voz ao vivo num patamar de preço bem diferente.
Opções V2 do Google
A API V2 com Chirp 3 simplificou os preços do Google:
- Standard (tempo real ou lote): $0,016/min, Chirp 3 incluído sem custo extra
- Dynamic Batch: cerca de $0,004/min, resultados entregues em até 24 horas
- Modelos médicos: $0,078/min (ditado e conversação, não aplicável para uso geral)
- Camada gratuita: 60 minutos/mês contínuos, mais $300 em créditos GCP para contas novas
A camada Dynamic Batch fica cerca de 75% abaixo da taxa standard. Essa conta dá aproximadamente $0,004/min, que fica abaixo dos $0,006/min da API Whisper. Para arquivos de podcast, transcrição de mídia e qualquer carga de trabalho em que você possa esperar até o dia seguinte, essa é a opção gerenciada mais econômica disponível entre os dois provedores.
Custo em Escala
Taxas verificadas: gpt-4o-mini-transcribe $0,003/min, Whisper-1 $0,006/min, Google Dynamic Batch ~$0,004/min, Google Standard $0,016/min. Dynamic Batch exige prazo de 24h. Google Standard inclui Chirp 3.
| Volume Mensal | Whisper-1 | Google Standard | Google Dynamic Batch |
|---|---|---|---|
| 100 horas | $36 | $96 | ~$24 |
| 1.000 horas | $360 | $960 | ~$240 |
Com 1.000 horas por mês, o Dynamic Batch economiza cerca de $120 em relação ao Whisper e $720 em relação ao Google Standard. A contrapartida é uma janela de resultados de 24 horas, que muitos workloads em lote conseguem absorver.
Para uma visão mais ampla do que os serviços de transcrição cobram no mercado, o guia de comparação de preços de transcrição traz mais provedores lado a lado.
O Curinga do Self-Hosted
Hospedar o Whisper por conta própria muda completamente a estrutura de custos. Os pesos do modelo são gratuitos. O custo está no compute de GPU.
Na AWS, uma instância g5.xlarge (1x A10G, 24GB de VRAM) custa cerca de $1/hora sob demanda. O Whisper large-v3 em uma única A10G transcreve a aproximadamente 100x a velocidade em tempo real, ou seja, uma hora de GPU cobre cerca de 100 horas de áudio. Com utilização total, o custo efetivo por minuto de áudio fica bem abaixo de $0,002.
Isso parece atraente até você considerar o tempo ocioso. Uma GPU com 50% de utilização dobra seu custo efetivo por minuto. Some a isso o overhead de DevOps para deploy, monitoramento e escalonamento, e o ponto de equilíbrio contra a API do Whisper fica em torno de 500 horas por mês. Abaixo disso, a API quase sempre sai mais barata quando você precifica o tempo de engenharia.
O self-hosting faz sentido claro em dois cenários: volume acima de 500 horas por mês, ou requisitos de soberania de dados onde o áudio não pode sair da sua infraestrutura.
O artigo sobre custos ocultos dos serviços de transcrição detalha a matemática de utilização de GPU e overhead de infraestrutura.
Precisão por Idioma e Tipo de Áudio
Ambos os serviços alcançam forte precisão em áudio limpo em inglês. As diferenças em 2026 são mais sutis.
Google Chirp 3 em áudio ruidoso. O modelo Chirp 3 tem um removedor de ruído integrado que lida melhor com som de fundo, salas com eco e áudio de telefone do que a arquitetura Standard/Enhanced anterior. Para ligações e gravações de campo, isso é uma melhoria relevante, e vem incluso na tarifa padrão de $0,016/min, sem precisar de upgrade de plano.
Whisper em conteúdo multilíngue. O Whisper foi treinado com cerca de 680 mil horas de áudio multilíngue em 99 idiomas. Para línguas com menos recursos, como galês, suaíli, malaio e catalão, o Whisper costuma superar as alternativas, porque o conjunto de treinamento foi pensado de propósito para ter amplitude. O Google Chirp 3 cobre mais de 100 idiomas, mas só 24 estão totalmente disponíveis, o resto segue em preview. Cobertura no papel e precisão na prática divergem para esses idiomas em preview.
Comparativo direto em inglês. Para áudio limpo de estúdio, podcasts e reuniões bem gravadas, os dois serviços têm desempenho parecido, na faixa de 90% ou mais de precisão de palavras. A OpenAI afirma que o gpt-4o-transcribe reduz a taxa de erro em relação ao whisper-1, principalmente em fala com sotaque e áudio difícil. Essas alegações batem com benchmarks independentes, embora a margem varie conforme o domínio.
Minha visão: faça um piloto específico para o seu caso antes de decidir. A precisão em depoimentos jurídicos não é a mesma de ligações de suporte ao cliente, que também difere de apresentações em conferências. Benchmarks publicados são um ponto de partida, não uma decisão de contratação.
Para entender melhor o que a taxa de erro de palavras significa na prática, veja transcrição, precisão explicada.
A Questão do Streaming
O endpoint da API whisper-1 não suporta streaming. Você envia um arquivo de áudio completo, espera o processamento terminar e recebe a transcrição inteira em uma única resposta. Isso funciona bem para conteúdo pré-gravado, mas elimina qualquer uso que exija resultados ao vivo.
O Google Cloud Speech-to-Text oferece streaming em tempo real de verdade, via uma conexão gRPC bidirecional. Você envia os pedaços de áudio conforme eles chegam do microfone ou de uma transmissão ao vivo e recebe resultados provisórios em milissegundos, enquanto o Google processa cada segmento. Isso faz dele a escolha natural para legendagem ao vivo, assistentes de voz e transcrição de reuniões em tempo real.
Um aviso sobre o Chirp 3 e streaming: embora o modelo Chirp 3 suporte o método StreamingRecognize, a diarização de locutores no Chirp 3 está disponível, por enquanto, apenas nos modos de reconhecimento em lote e síncrono. Se você precisa de streaming e diarização ao mesmo tempo, consulte a documentação atual antes de montar seu pipeline.
O Whisper auto-hospedado pode se aproximar do streaming com ferramentas como o faster-whisper, usando segmentos de áudio sobrepostos, mas o Whisper foi arquitetado como um modelo em lote de blocos de 30 segundos. Dá para contornar isso, mas você não vai igualar a latência de um serviço feito sob medida para streaming.
Se streaming é um requisito inegociável, o Google Cloud Speech-to-Text é a escolha prática.
Auto-hospedar o Whisper: a avaliação honesta
Auto-hospedar garante privacidade total dos dados, sem custo por minuto, sem limites de requisição e a possibilidade de ajustar o modelo com seus próprios dados de domínio. Essas vantagens são reais.
Os custos também são reais:
- Instâncias de GPU a US$ 0,75 a US$ 1 por hora sob demanda, muitas vezes mais
- Tempo de engenharia para implantar, escalar, monitorar e atualizar o modelo
- Sem diarização, vocabulário personalizado ou streaming prontos para uso
Auto-hospedar vale a pena quando você processa mais de 500 horas de áudio por mês com utilização consistente, ou quando sua postura de conformidade (HIPAA, interpretações rígidas da LGPD, contratos de defesa) exige que o áudio nunca saia da sua infraestrutura.
Abaixo de 500 horas por mês, a API do Whisper ou o Google Dynamic Batch costumam sair mais baratos, considerando as horas de engenharia. Para a maioria das startups e times de médio porte, a API é o ponto de partida certo.
Matriz de decisão
| Caso de uso | Recomendação | Por quê |
|---|---|---|
| Legendas ao vivo ou subtítulos em tempo real | Google Cloud STT | Streaming com resultados provisórios é essencial |
| Aplicativo controlado por voz | Google Cloud STT | Streaming de baixa latência é obrigatório |
| Lote de podcast ou arquivo de vídeo | Google Dynamic Batch | Mais barato que a API do Whisper se um prazo de 24h for aceitável |
| Transcrição em lote de baixo custo (resultados rápidos) | gpt-4o-mini-transcribe | $0,003/min, resultados sob demanda |
| Conteúdo multilíngue (mais de 50 idiomas) | API do Whisper | Maior abrangência de treinamento multilíngue |
| Chamadas telefônicas, gravações de campo com ruído | Google Cloud STT | Redutor de ruído integrado do Chirp 3 |
| Soberania de dados exigida | Whisper auto-hospedado | O áudio nunca sai da sua infraestrutura |
| Alto volume (mais de 500h/mês) | Whisper auto-hospedado | A economia de custo justifica o trabalho operacional em escala |
| Empresa com stack GCP | Google Cloud STT | Integração nativa com os serviços do GCP |
| MVP ou protótipo de startup | API do Whisper ou gpt-4o-mini | Preço simples, caminho mais rápido para código funcionando |
Se você só precisa de uma transcrição limpa de um arquivo de áudio ou vídeo sem montar uma integração de API, o ConvertAudioToText cuida do upload, da transcrição e da exportação sem precisar escrever código.
Como Decidir
Passe por estas quatro perguntas.
Você precisa de streaming em tempo real? Se sim, Google Cloud STT. O endpoint whisper-1 não faz isso, e soluções de streaming com Whisper auto-hospedado trazem um custo de engenharia considerável.
Seu trabalho em lote tolera um prazo de 24 horas? Se sim, o Google Dynamic Batch a cerca de $0,004/min agora é mais barato que a API do Whisper a $0,006/min. A vantagem de custo do concorrente virou para lotes não urgentes.
Você precisa de cobertura multilíngue forte em mais de 90 idiomas? Se sim, Whisper. A abrangência de treinamento para idiomas com menos recursos ainda não tem igual entre os serviços gerenciados.
Privacidade de dados é um requisito legal rígido? Se sim, o Whisper auto-hospedado é o caminho mais limpo.
Se nenhuma dessas opções der uma resposta clara, fique com o provedor que se encaixa melhor na sua infraestrutura atual. O Google se integra naturalmente a ambientes GCP. O Whisper combina com stacks em Python onde as bibliotecas do Hugging Face já estão em uso. Ambos dão conta da transcrição.
Para um detalhamento completo das tarifas por minuto em todas as principais APIs, incluindo Deepgram e AWS Transcribe, o guia de preços de APIs de speech-to-text cobre todo o cenário.
Perguntas Frequentes
O OpenAI Whisper é mais preciso que o Google Cloud Speech-to-Text?
Para áudio limpo em inglês, os dois são parecidos. O Google Chirp 3 leva uma leve vantagem em gravações com ruído, graças ao seu denoiser embutido. Para idiomas com menos recursos, o Whisper tende a performar melhor, porque seu conjunto de treinamento cobre 99 idiomas com dados multilíngues profundos. A resposta honesta é: rode um teste com 50 amostras do seu próprio áudio antes de se comprometer, já que fatores específicos do domínio pesam mais que benchmarks publicados.
Posso usar o Whisper para transcrição de reuniões ao vivo?
Não com o endpoint da API whisper-1, que é somente em lote e tem limite de 25MB por arquivo. Você precisaria hospedar o Whisper por conta própria e montar um pipeline de streaming com ferramentas como o faster-whisper, o que adiciona complexidade de engenharia. O Google Cloud Speech-to-Text (modelo Chirp 3) suporta streaming em tempo real com resultados provisórios e é a escolha mais prática para transcrição de reuniões ao vivo. A OpenAI até oferece um endpoint separado de fala em tempo real, mas custa cerca de $0,017 por minuto, o que muda bastante a conta.
É mais barato hospedar o Whisper por conta própria do que usar o Google Cloud Speech-to-Text?
Em volumes altos e com boa utilização de GPU, sim. Uma instância de GPU rodando Whisper large-v3 pode atingir custos efetivos bem abaixo de $0.002 por minuto. Mas o tier Dynamic Batch do Google, a aproximadamente $0.004 por minuto com exigência de entrega em 24 horas, agora sai mais barato que a API do Whisper ($0.006/min) para trabalhos em lote que não são sensíveis ao tempo, sem nenhum peso de operação de GPU. O self-hosting só compensa claramente quando você passa de cerca de 500 horas por mês e tem capacidade de engenharia para manter a infraestrutura.
O Google Cloud Speech-to-Text suporta diarização de locutores?
Sim. A diarização de locutores está disponível tanto na API V1 quanto na API V2 com o Chirp 3. Uma ressalva: com o Chirp 3, a diarização funciona em modo batch e síncrono (Recognize) para cerca de 15 idiomas suportados, mas ainda não está disponível em modo streaming. O Whisper não inclui diarização nativamente de forma alguma; você precisaria rodar um modelo separado, como o pyannote, por cima da saída do Whisper.
Posso alternar entre Whisper e Google Cloud Speech-to-Text depois?
Sim, com algum trabalho de integração. Ambos aceitam formatos de áudio padrão e retornam texto com timestamps. Os formatos das APIs são diferentes, os formatos de resposta diferem, e recursos exclusivos de cada serviço (vocabulário customizado do Google, modo de tradução do Whisper) precisam de adaptação. Se você prevê alternar, envolva suas chamadas de transcrição atrás de uma camada de abstração fina desde o início, assim a troca de provedor afeta um único arquivo, não todo o seu código.
- Preços do Google Cloud Speech-to-Text
- Preços da API da OpenAI
- Documentação do Chirp 3
- Página do modelo Whisper da OpenAI
- Detalhamento de preços do Google STT (costbench.com)
- Detalhamento de preços do Whisper da OpenAI (costbench.com)
- Análise de custos ocultos do Google STT
- Tópico do fórum sobre diarização de falantes do Google STT
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Google Cloud STT Pricing 2026: $0.003–$0.016/min
Google Cloud Speech-to-Text pricing 2026: V2 real-time is $0.016/min but Dynamic Batch drops to ~$0.003/min with 24-hr turnaround. Free 60 min/month ongoing. Chirp, V1 vs V2, and volume tier math.

OpenAI Whisper API Pricing 2026: $0.003–$0.006/min
OpenAI Whisper API pricing in 2026: whisper-1 is still $0.006/min but gpt-4o-mini-transcribe cuts that to $0.003/min. Real per-hour math, file limits (25MB/25-min), and how it stacks up against Deepgram Nova-3 and AssemblyAI.