
Preços de APIs de Speech-to-Text em 2026: Google Cloud vs AWS Transcribe vs OpenAI Whisper vs Deepgram
Summarize this article with:
O Cenário de Preços de APIs de Speech-to-Text em 2026
Construir um produto que transforma áudio em texto significa escolher uma API de speech-to-text. E embora precisão e latência recebam toda a atenção durante a prova de conceito, é o preço que determina a viabilidade em escala. Uma diferença de $0.002 por minuto parece insignificante até você processar 10.000 horas por mês e essa diferença custar $1,200 a mais.
Este guia detalha os preços das APIs de speech-to-text dos quatro principais provedores em 2026: Google Cloud Speech-to-Text, AWS Transcribe, OpenAI Whisper API e Deepgram. Testamos cada provedor, analisamos a documentação de preços e calculamos custos reais em múltiplas faixas de volume para que você possa tomar uma decisão informada antes de escrever uma única linha de código de integração.
Se você está avaliando esses provedores individualmente, temos análises aprofundadas dedicadas sobre preços do Google Cloud Speech-to-Text, preços do AWS Transcribe e preços da OpenAI Whisper API.
Tabela Comparativa Completa de Preços
Aqui está o detalhamento completo dos preços das APIs de speech-to-text dos quatro provedores em fevereiro de 2026.
| Recurso | Google Cloud STT | AWS Transcribe | OpenAI Whisper API | Deepgram |
|---|---|---|---|---|
| Preço/Min (Padrão) | $0.024 | $0.024 | $0.006 | $0.0043 |
| Preço/Min (Avançado) | $0.036 | $0.024 (médico: $0.075) | N/A (modelo único) | $0.0059 (Nova-3) |
| Plano Gratuito | 60 min/mês | 60 min/mês (12 meses) | Nenhum | $200 em créditos |
| Suporte a Streaming | Sim | Sim | Não (apenas em lote) | Sim |
| Idiomas | 125+ | 100+ | 57 | 36 |
| Detecção de Falantes | Sim | Sim | Não (via pós-processamento) | Sim |
| Vocabulário Personalizado | Sim | Sim | Via prompting | Sim |
| Ideal Para | Empresas, multilíngue | Apps nativos da AWS, área médica | Processamento em lote sensível a custo | Alto volume, tempo real |
Algumas coisas chamam a atenção imediatamente. A OpenAI Whisper API é a mais barata por minuto, a $0.006, mas não tem streaming nem diarização nativa de falantes. A Deepgram oferece o melhor equilíbrio entre preço baixo e recursos completos de tempo real. Google Cloud e AWS Transcribe têm preços quase idênticos para transcrição padrão, mas divergem significativamente em seus níveis avançados e especializados.

Entendendo o Modelo de Preços de Cada Provedor
Preços do Google Cloud Speech-to-Text
O Google Cloud Speech-to-Text usa um modelo de preços em camadas, baseado no modelo de reconhecimento e nos recursos que você ativa.
As tarifas base são calculadas em incrementos de 15 segundos, arredondados para cima. Se o seu clipe de áudio tem 16 segundos, você paga por 30 segundos. Esse arredondamento afeta os cálculos de custo de forma significativa quando você processa muitos clipes curtos de áudio.
- Reconhecimento padrão: $0.024 por minuto
- Reconhecimento avançado (Chirp 2): $0.036 por minuto
- Transcrição médica: $0.078 por minuto
- Desconto por adesão ao data logging: redução de 33% nos modelos padrão
O plano gratuito oferece 60 minutos de reconhecimento padrão por mês, por tempo indeterminado. Isso é genuinamente útil para desenvolvimento e testes, mas se esgota rapidamente em produção.
As sobretaxas por recurso se acumulam. Ativar diarização de falantes, pontuação automática ou timestamps por palavra não muda o preço base, mas mudar para o modelo avançado Chirp 2 para obter melhor precisão aumenta o custo em 50%.
Preços do AWS Transcribe
O AWS Transcribe mantém os preços simples, com uma tarifa única para transcrição padrão e descontos por volume em faixas mais altas.
- Transcrição padrão: $0.024 por minuto
- Acima de 250K minutos/mês: $0.015 por minuto
- Acima de 1M minutos/mês: $0.0102 por minuto
- Transcrição médica: $0.075 por minuto
- Análise de chamadas: $0.024 por minuto (streaming), $0.012 por minuto (pós-chamada)
A AWS arredonda para o segundo mais próximo em vez de incrementos de 15 segundos, o que a torna um pouco mais econômica que o Google Cloud para clipes curtos. O plano gratuito oferece 60 minutos por mês apenas nos primeiros 12 meses. Depois disso, cada minuto custa dinheiro.
Os descontos por volume são o ponto em que a AWS se torna competitiva. Se você processa mais de 250.000 minutos por mês (cerca de 4.167 horas), o preço cai para $0.015 por minuto, um desconto de 37.5%. Acima de um milhão de minutos por mês, cai ainda mais, para $0.0102, ficando abaixo da maioria dos concorrentes nessa escala.
Preços da OpenAI Whisper API
O preço da API da OpenAI para o Whisper é o mais simples entre os quatro provedores.
- Whisper large-v3: $0.006 por minuto
- Sem plano gratuito
- Sem descontos por volume
- Sem streaming
É isso. Não há níveis, sobretaxas por recurso nem variantes de modelo para escolher. Você paga $0.006 por minuto de áudio processado, cobrado por segundo de áudio de entrada.
O porém está no que você não recebe. A Whisper API funciona apenas em lote, sem suporte a streaming em tempo real. Não há diarização nativa de falantes, nem vocabulário personalizado, nem pontuações de confiança por palavra. Você envia áudio e recebe texto de volta. Para muitas aplicações, isso é perfeitamente suficiente. Para outras, os recursos ausentes significam que você precisa construir ou comprar camadas adicionais de processamento.
Preços da Deepgram
O preço da Deepgram varia conforme o modelo e se você precisa de transcrição pré-gravada ou em streaming.
- Nova-2 (pré-gravado): $0.0043 por minuto
- Nova-2 (streaming): $0.0059 por minuto
- Nova-3 (pré-gravado): $0.0059 por minuto
- Nova-3 (streaming): $0.0065 por minuto
- Whisper Cloud (pré-gravado): $0.0048 por minuto
- Crédito pré-pago: $200 grátis para começar
Os preços da Deepgram são consistentemente os mais baixos entre os provedores com recursos completos. Mesmo o modelo premium Nova-3 para streaming sai por $0.0065 por minuto, o que ainda é mais barato que o modelo padrão do Google Cloud.
O crédito inicial de $200 é generoso o suficiente para processar aproximadamente 46.500 minutos (775 horas) de áudio no modelo Nova-2 pré-gravado, o que faz dele um dos melhores planos gratuitos para uma avaliação séria.
Custo em Escala: Cálculos do Mundo Real
O preço por minuto é útil para comparação, mas o que importa é a fatura real no fim do mês. Aqui estão os custos reais em três faixas de volume que representam cargas de produção comuns.
100 Horas Por Mês (Startup/PME)
Esse volume é típico de um SaaS de transcrição que atende algumas centenas de usuários ativos, uma rede de podcasts processando episódios semanais ou um pequeno call center.
| Provedor | Modelo | Custo Mensal |
|---|---|---|
| Google Cloud STT | Padrão | $144.00 |
| Google Cloud STT | Avançado (Chirp 2) | $216.00 |
| AWS Transcribe | Padrão | $144.00 |
| OpenAI Whisper | large-v3 | $36.00 |
| Deepgram | Nova-2 (pré-gravado) | $25.80 |
| Deepgram | Nova-3 (pré-gravado) | $35.40 |
Com 100 horas por mês, a Deepgram Nova-2 custa 82% menos que o padrão do Google Cloud ou da AWS. A OpenAI Whisper é a segunda opção mais barata, a $36.00, mas não tem streaming nem diarização. A diferença entre a Deepgram e os preços dos hyperscalers já é relevante nesse volume.
1.000 Horas Por Mês (Fase de Crescimento)
Um produto SaaS em crescimento, um call center de médio porte ou uma empresa de mídia processando conteúdo em escala.
| Provedor | Modelo | Custo Mensal |
|---|---|---|
| Google Cloud STT | Padrão | $1,440.00 |
| Google Cloud STT | Avançado (Chirp 2) | $2,160.00 |
| AWS Transcribe | Padrão | $1,440.00 |
| OpenAI Whisper | large-v3 | $360.00 |
| Deepgram | Nova-2 (pré-gravado) | $258.00 |
| Deepgram | Nova-3 (pré-gravado) | $354.00 |
Com 1.000 horas, o padrão se mantém. Google Cloud e AWS ficam em $1,440 por mês, enquanto a Deepgram processa o mesmo volume por $258. São $14,184 economizados por ano ao escolher a Deepgram Nova-2 em vez do padrão do Google Cloud. Para uma startup de olho no seu burn rate, é uma diferença significativa.
10.000 Horas Por Mês (Empresarial)
Processamento em escala empresarial. Pense em call centers globais, grandes acervos de mídia, sistemas de gravação para compliance ou uma API de transcrição atendendo milhares de desenvolvedores.
| Provedor | Modelo | Custo Mensal |
|---|---|---|
| Google Cloud STT | Padrão | $14,400.00 |
| Google Cloud STT | Avançado (Chirp 2) | $21,600.00 |
| AWS Transcribe | Padrão (escalonado) | $10,620.00 |
| OpenAI Whisper | large-v3 | $3,600.00 |
| Deepgram | Nova-2 (pré-gravado) | $2,580.00 |
| Deepgram | Nova-3 (pré-gravado) | $3,540.00 |
Em escala empresarial, os descontos por volume da AWS finalmente entram em ação e derrubam o preço para $10,620 (de $14,400 sem descontos). Mas a Deepgram Nova-2 ainda vence, a $2,580, economizando mais de $8,000 por mês em comparação com o preço da AWS já com desconto e mais de $11,800 por mês em comparação com o padrão do Google Cloud.
A OpenAI Whisper, a $3,600, é competitiva em preço, mas lembre-se: sem streaming, sem diarização, sem vocabulário personalizado. Com 10.000 horas por mês, você quase certamente precisa desses recursos.
Custos Ocultos Que Você Deve Conhecer
A tarifa por minuto na página de preços de cada provedor conta apenas parte da história. Vários custos adicionais podem afetar significativamente o seu gasto total.
Taxas de Transferência de Dados e Egress
O Google Cloud e a AWS cobram pelo egress de dados quando você move os resultados de transcrição para fora da nuvem deles. Se a sua aplicação roda fora do ecossistema deles, espere pagar:
- Google Cloud: $0.12 por GB no primeiro 1 TB de egress por mês
- AWS: $0.09 por GB nos primeiros 10 TB de egress por mês
- OpenAI: Sem taxas de egress (resultados entregues via resposta da API)
- Deepgram: Sem taxas de egress
Os dados de transcrição são pequenos (alguns KB por hora de áudio), então o egress dos resultados é insignificante. Mas se você está enviando os arquivos de áudio primeiro para o armazenamento em nuvem, o ingress dos arquivos de áudio e qualquer processamento intermediário se acumulam. Um arquivo WAV de uma hora em qualidade de CD tem aproximadamente 635 MB. Processar 10.000 horas significa ingerir cerca de 635 TB de áudio por mês.
Custos de Armazenamento de Áudio
Se você precisa reter o áudio original para compliance, reprocessamento ou garantia de qualidade:
- Google Cloud Storage: $0.020 por GB/mês (Standard)
- AWS S3: $0.023 por GB/mês (Standard)
- Cloudflare R2: $0.015 por GB/mês (sem taxas de egress)
Para 10.000 horas de áudio comprimido (aproximadamente 60 TB em MP3 a 128kbps), os custos mensais de armazenamento variam de $900 a $1,380 dependendo do provedor. Usar um provedor de armazenamento como o Cloudflare R2, que não cobra taxas de egress, pode gerar uma economia substancial ao longo do tempo.
Pré-processamento de Áudio
Nem todos os provedores aceitam todos os formatos de áudio nativamente. Se o seu áudio de origem está em um formato que exige conversão (arquivos de vídeo, codecs incomuns, layouts multicanal), você precisa considerar:
- Tempo de processamento do FFmpeg na sua própria infraestrutura
- Custos de computação para extração e conversão de áudio
- Armazenamento temporário para arquivos intermediários
Deepgram e Google Cloud aceitam a maior variedade de formatos de entrada. O AWS Transcribe exige que o áudio esteja no S3 ou seja transmitido em formatos específicos. A OpenAI Whisper aceita a maioria dos formatos comuns, mas tem um limite de 25 MB por arquivo em cada requisição, obrigando você a dividir arquivos mais longos em pedaços.
Sobrecarga de SDK e Integração
Google Cloud e AWS exigem seus respectivos SDKs, configuração de autenticação e configuração de IAM. Isso não é um custo direto em dólares, mas o tempo de engenharia para integrar, manter e depurar esses SDKs é real.
OpenAI e Deepgram oferecem APIs REST mais simples, que podem ser chamadas com uma única requisição HTTP e uma chave de API. Para equipes pequenas, essa diferença na complexidade de integração se traduz em dias de tempo de engenharia economizados.

Qual API Vence Para o Seu Caso de Uso?
Não existe uma única API de speech-to-text que seja a melhor. A escolha certa depende do seu volume, dos recursos necessários, da infraestrutura existente e das restrições de orçamento.
Melhor Para Startups e Equipes Pequenas
Vencedora: Deepgram
Startups precisam de custos baixos, integração simples e espaço para escalar sem renegociar contratos. A Deepgram atende aos três critérios. O crédito gratuito de $200 dá fôlego suficiente para construir e testar sua integração com calma. O Nova-2, a $0.0043 por minuto, mantém os custos gerenciáveis conforme você cresce. A API REST é direta, e você ganha streaming, diarização e detecção de tópicos sem pagar a mais.
Segunda colocada: OpenAI Whisper API, se você só precisa de transcrição em lote e consegue viver sem streaming. A $0.006 por minuto e sem nenhuma sobretaxa por recurso, é difícil de superar em simplicidade.
Melhor Para Empresas e Alto Volume
Vencedora: AWS Transcribe (com descontos por volume) ou Deepgram (com contrato empresarial)
Em escala empresarial, a conversa muda de preços de tabela para tarifas negociadas. Os descontos automáticos por volume do AWS Transcribe a partir de 250K e 1M de minutos por mês o tornam cada vez mais competitivo sem exigir uma reunião com o time de vendas. Se você já roda na infraestrutura da AWS, a integração é fluida e você evita transferência de dados entre nuvens.
A Deepgram oferece contratos empresariais com preços personalizados que, de acordo com estudos de caso publicados, podem levar o custo por minuto para abaixo de $0.003 em volumes muito altos. Se você não está preso a um provedor de nuvem específico, vale a pena explorar o plano empresarial da Deepgram.
O Google Cloud se torna uma opção forte se você já está fortemente investido no GCP e valoriza a amplitude do suporte de idiomas (125+ idiomas contra os 36 da Deepgram).
Melhor Para Aplicações Multilíngues
Vencedor: Google Cloud Speech-to-Text
Se o seu produto atende uma base global de usuários e precisa transcrever áudio em dezenas de idiomas com alta precisão, o suporte a 125+ idiomas do Google Cloud é incomparável. O modelo Chirp 2 traz melhorias significativas de precisão para idiomas além do inglês em comparação com modelos anteriores.
Segunda colocada: OpenAI Whisper suporta 57 idiomas e lida com code-switching (múltiplos idiomas em uma mesma gravação) melhor que a maioria dos concorrentes. A $0.006 por minuto, é uma opção multilíngue com bom custo-benefício.
A Deepgram suporta 36 idiomas, o que cobre a maioria dos principais idiomas globais, mas pode ficar aquém se você precisar de idiomas menos comuns ou dialetos regionais.
Melhor Para Medicina e Saúde
Vencedor: AWS Transcribe Medical
O AWS Transcribe Medical foi criado especificamente para transcrição na área da saúde, com conformidade com a HIPAA, vocabulário médico e modelos específicos por especialidade para cardiologia, neurologia, oncologia, radiologia e urologia. A $0.075 por minuto é caro, mas organizações de saúde normalmente priorizam conformidade e precisão acima do custo.
Segundo colocado: Google Cloud oferece transcrição médica a $0.078 por minuto, com integração à Healthcare API e infraestrutura elegível para HIPAA.
Nem a OpenAI Whisper nem a Deepgram oferecem modelos médicos dedicados, embora o recurso de vocabulário personalizado da Deepgram possa ser treinado para reconhecer terminologia médica.
Melhor Para Tempo Real e Streaming
Vencedora: Deepgram
A transcrição em streaming da Deepgram a $0.0059 por minuto (Nova-2) entrega latência abaixo de 300ms com diarização de falantes, resultados parciais e endpointing. Para aplicações como legendas ao vivo, assistentes de voz ou transcrição de reuniões em tempo real, essa combinação de baixa latência, recursos completos e baixo custo é difícil de superar.
Segundo colocado: Google Cloud oferece streaming confiável com amplo suporte a idiomas, mas a 4x o custo da tarifa de streaming da Deepgram.
Fora de cogitação: OpenAI Whisper API não suporta streaming de forma alguma em fevereiro de 2026.
Como o ConvertAudioToText Mantém os Custos Baixos
No ConvertAudioToText, construímos nosso pipeline de transcrição sobre a infraestrutura da Deepgram justamente pelo equilíbrio entre preço e recursos descrito acima. Ao usar os modelos Nova da Deepgram, repassamos essa economia aos nossos usuários, sem abrir mão de diarização de falantes, análise de sentimento, detecção de tópicos e múltiplos formatos de exportação.
Nossa arquitetura processa áudio de forma assíncrona por meio de um sistema baseado em filas, o que nos permite agrupar requisições com eficiência e evitar a sobrecarga de manter conexões de streaming persistentes quando elas não são necessárias. O resultado é um serviço que entrega a precisão dos melhores modelos da Deepgram por uma fração do que você pagaria integrando a API diretamente, depois de considerar infraestrutura, pré-processamento e manutenção.
Para desenvolvedores que querem a API pura, confira nosso guia das melhores APIs de speech-to-text com tutoriais de integração e exemplos de código.
Tendências de Preço: Para Onde Caminham os Custos de APIs de Speech-to-Text
Nos últimos três anos, o preço por minuto em todos os principais provedores caiu de 30 a 50 por cento. Essa tendência não dá sinais de desaceleração. Várias forças estão empurrando os custos para baixo:
Melhorias na eficiência dos modelos. Arquiteturas mais novas, como o Nova-3 da Deepgram e o Chirp 2 do Google, alcançam maior precisão com menos recursos de computação por minuto de áudio processado. À medida que esses modelos amadurecem, os provedores repassam parte dessa economia aos clientes.
Concorrência de modelos open-source. O lançamento open-source do Whisper pela OpenAI forçou os provedores comerciais a justificarem seu preço premium com recursos (streaming, diarização, modelos personalizados) que o Whisper não oferece. Essa pressão competitiva saudável mantém os preços em queda.
Melhorias de hardware. A mudança para hardware de inferência mais eficiente (ASICs personalizados, clusters de GPU otimizados) reduz o custo bruto de computação para rodar reconhecimento de fala em escala.
Crescimento de volume. Conforme mais aplicações integram speech-to-text (recursos de acessibilidade, indexação de conteúdo, ferramentas de reunião, interfaces de voz), o volume total do mercado aumenta, permitindo que os provedores amortizem os custos de infraestrutura em mais minutos.
Para quem planeja uma integração de vários anos, isso significa que a API que você escolher hoje provavelmente ficará mais barata com o tempo. Garanta condições de preço favoráveis agora e orce reduções de custo anuais de 10 a 15 por cento.
Perguntas Frequentes
Qual é a API de speech-to-text mais barata em 2026?
A Deepgram Nova-2, a $0.0043 por minuto, é a API de speech-to-text mais barata entre as de recursos completos. Se você só precisa de transcrição em lote, sem streaming ou diarização, a OpenAI Whisper API, a $0.006 por minuto, é a opção mais barata sem compromisso de volume. Para volumes muito altos (acima de 1 milhão de minutos por mês), o preço escalonado do AWS Transcribe cai para $0.0102 por minuto, o que é competitivo com o preço de tabela da Deepgram.
O Google Cloud Speech-to-Text tem plano gratuito?
Sim. O Google Cloud oferece 60 minutos gratuitos de reconhecimento padrão por mês, sem limite de tempo. Esse plano gratuito permanece indefinidamente, ao contrário do plano gratuito do AWS Transcribe, que expira após 12 meses. Os 60 minutos são suficientes para desenvolvimento e testes, mas não para nenhuma carga de produção relevante.
A OpenAI Whisper API é boa o suficiente para uso em produção?
Para cargas de transcrição em lote em que você não precisa de streaming em tempo real nem de diarização de falantes, a Whisper API é uma escolha sólida para produção. A precisão é comparável à de alternativas mais caras, especialmente em inglês. As principais limitações são a falta de suporte a streaming, o limite de 25 MB por arquivo em cada requisição e a ausência de identificação nativa de falantes. Se o seu caso de uso exige algum desses recursos, você precisará construir camadas adicionais de processamento ou escolher outro provedor.
Como estimo meu custo mensal com uma API de speech-to-text?
Calcule seu volume mensal de áudio em minutos e multiplique pela tarifa por minuto do provedor e do modelo escolhidos. Por exemplo, se você processa 500 horas de áudio por mês usando a Deepgram Nova-2: 500 horas x 60 minutos x $0.0043 = $129 por mês. Lembre-se de considerar os custos ocultos, como armazenamento de áudio, egress de dados (no caso do Google Cloud e da AWS) e qualquer computação de pré-processamento necessária para conversão de formato de áudio.
Posso trocar de API de speech-to-text sem reconstruir minha aplicação?
Trocar de provedor exige mudanças no código de integração da API, na autenticação e, possivelmente, no seu pipeline de pré-processamento de áudio, mas o fluxo central (enviar áudio, receber texto) é semelhante em todos os provedores. Para minimizar os custos de troca, abstraia sua lógica de transcrição atrás de uma interface interna, de modo a poder trocar de provedor sem tocar no resto da aplicação. Serviços como o ConvertAudioToText cuidam dessa abstração para você, entregando a melhor transcrição disponível sem que você precise gerenciar integrações de API diretamente.
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tools with API Access (2026)
Which transcription SaaS tools actually give you API keys, and on which plan? Verified pricing and plan gates for Descript, Sonix, Fireflies, Happy Scribe, AssemblyAI, and more.

Transcription API Comparison 2026: Dev Decision Matrix
Verified pricing, accuracy, and feature table for Deepgram, AssemblyAI, OpenAI, AWS Transcribe, and Google Cloud STT. Pick the right API for your use case.