Melhores APIs de Speech-to-Text em 2026 (Preços Reais)
apitranscricaocomparacaorankingprecos

Melhores APIs de Speech-to-Text em 2026 (Preços Reais)

BMMamane B. MoussaFebruary 23, 2026Updated June 30, 202619 min read

Summarize this article with:

TL;DR

Não existe uma única "melhor" API de speech-to-text em 2026. Para áudio pré-gravado com orçamento apertado, AssemblyAI Universal-2 ($0,15/hora) e Rev Reverb ($0,20/hora) são agora as opções completas mais baratas, com Cloudflare Workers AI Whisper (~$0,027/hora) ainda mais barato se você não precisar de diarização ou streaming. Para streaming em tempo real, Deepgram Nova-3 ($0,0048/minuto) lidera em latência. Para áudio que você também quer resumir ou analisar, AssemblyAI é a escolha de uma chamada só. Preços abaixo são das próprias páginas de preços de cada fornecedor em junho de 2026.

A resposta honesta: não existe uma única API de fala para texto que seja a melhor em 2026

Se você veio aqui atrás de uma lista ranqueada onde o número 1 vence para todo mundo, a resposta honesta é que essa lista não existe. A API certa de fala para texto (STT) depende de três coisas: se o seu áudio é ao vivo ou pré-gravado, se você precisa saber quem falou o quê, e quanto volume você realmente processa. Um agente de voz que precisa de streaming abaixo de 200ms não tem nada em comum com um pipeline de podcast noturno que quer o menor custo por hora.

O que mudou desde que a maioria dos guias de "melhor API de STT" foi escrita é que os preços mudaram bastante, e vários argumentos antigos agora estão errados. A AssemblyAI caiu para US$ 0,15/hora com o modelo Universal-2. A Rev cortou a API para US$ 0,20/hora. A OpenAI adicionou diarização de falantes e um modelo em tempo real, então a velha frase "Whisper não tem streaming nem diarização" não vale mais. A Speechmatics agora publica preços self-service em vez de esconder atrás de uma ligação comercial. Este guia usa preços tirados da página de preços de cada provedor em junho de 2026, normalizados para você comparar na mesma base.

Eu construí o ConvertAudioToText em cima desses motores, então esta é a comparação que eu queria que alguém tivesse me entregado. Para uma análise só de custos mais aprofundada, veja nossa comparação de preços de APIs de fala para texto.

Como ler os preços (isso confunde todo mundo)

Os fornecedores cotam preços em bases diferentes, e é aí que a maioria das comparações erra. Três coisas tornam um preço "barato" na manchete enganoso:

  • Por minuto vs. por hora. $0,0077/min e $0,46/hora são o mesmo número. Mostramos os dois em todas as tabelas.
  • Lote vs. streaming. Pré-gravado (lote) é quase sempre mais barato e mais preciso do que streaming em tempo real, porque o modelo vê o arquivo inteiro antes de se comprometer. Se o seu áudio já está gravado, nunca pague tarifas de streaming.
  • Extras. Diarização de falantes, análise de sentimento, resumo e redação de PII são frequentemente cobrados por cima da tarifa base de transcrição. Um modelo de "$0,15/hora" pode virar $0,23/hora quando você ativa a diarização. Destacamos o custo dos extras onde isso importa.

Todos os valores em dólar abaixo foram verificados na página de preços publicada de cada fornecedor em junho de 2026. Os preços de transcrição de fala mudam com frequência, então trate isso como um retrato, não um contrato, e clique para confirmar antes de comprometer o orçamento.

Preços publicados verificados na página de cada fornecedor; planos de tarifa fixa como referência
Preços publicados verificados na página de cada fornecedor; planos de tarifa fixa como referência

A comparação de preços de 2026 de relance

Aqui está cada fornecedor na mesma base: preço pré-gravado (lote), o que a diarização adiciona, disponibilidade de streaming e o nível gratuito. Ordenado pelo preço de lote, do mais barato ao mais caro.

ProvedorModeloPreço em loteComplemento de diarizaçãoStreamingCamada gratuita
Cloudflare Workers AIWhisper~US$ 0,0005/min (~US$ 0,027/h)Não nativoNão10.000 neurônios/dia (~240 min)
AssemblyAIUniversal-2US$ 0,0025/min (US$ 0,15/h)+US$ 0,02/hSim (US$ 0,15/h)Crédito de US$ 50
RevReverbUS$ 0,0033/min (US$ 0,20/h)IncluídoSim5 horas de créditos
Google CloudDynamic BatchUS$ 0,004/min (US$ 0,24/h)SimNão (camada em lote)60 min/mês
OpenAIgpt-4o-mini-transcribeUS$ 0,003/min (US$ 0,18/h)NãoSim (modelo em tempo real)Nenhuma
OpenAIgpt-4o-transcribeUS$ 0,006/min (US$ 0,36/h)IncluídoSim (modelo em tempo real)Nenhuma
AWS TranscribeStandard (em lote, camada 1)US$ 0,006/min (US$ 0,36/h)SimSim60 min/mês (12 meses)
DeepgramNova-3 (em lote)US$ 0,0077/min (US$ 0,46/h)+US$ 0,002/minSim (US$ 0,0048/min)Crédito de US$ 200
SpeechmaticsMelia 1 / Standarda partir de US$ 0,129/h (multilíngue)SimSim (~US$ 0,40/h)480 min/mês
Google CloudStandard (Chirp)US$ 0,016/min (US$ 0,96/h)SimSim60 min/mês
AWS TranscribeMedicalUS$ 0,075/min (US$ 4,50/h)SimSim60 min/mês (12 meses)
Transcrição em lote: custo por hora
Cloudflare Workers AI
US$ 0,03/h
AssemblyAI
US$ 0,15/h
OpenAI 4o-mini
US$ 0,18/h
Rev
US$ 0,20/h
Google Cloud
US$ 0,24/h
OpenAI 4o
US$ 0,36/h

Preço publicado por hora em lote, 2026. Menor é mais barato.

Alguns pontos se destacam. A opção pré-gravada mais barata e completa em 2026 é a AssemblyAI a US$ 0,15/hora, não a Deepgram, que agora custa US$ 0,46/hora para o lote Nova-3. A Deepgram ainda lidera em preço de streaming a US$ 0,0048/minuto quando você trabalha em tempo real. O Cloudflare Workers AI é o verdadeiro outlier de orçamento a cerca de US$ 0,027/hora, com a ressalva de que não tem diarização nativa nem streaming. E o lote padrão da AWS agora custa US$ 0,006/minuto, bem abaixo dos US$ 0,024/minuto que artigos antigos ainda citam (essa era a taxa de streaming).

Nota sobre a mudança da AssemblyAI em 1º de julho de 2026: a AssemblyAI vai aumentar o preço dos modelos regionais em 10% a partir de 1º de julho de 2026. Você pode manter a taxa atual adicionando "model_region": "global" às suas chamadas de API. Se você estiver lendo isto depois dessa data, trate a linha da AssemblyAI como o preço da região global.

Provedor por provedor: no que cada um realmente é bom

Deepgram Nova-3

A Deepgram construiu sua reputação como o provedor de STT focado em streaming e obcecado por latência, e é aí que ela ainda vence. O streaming Nova-3 custa US$ 0,0048/minuto para monolíngue (US$ 0,288/hora), com latência abaixo de 300ms que é difícil de superar para legendas ao vivo, agentes de voz e ferramentas de reunião. Contas novas ganham um crédito grátis de US$ 200 sem precisar de cartão, o crédito mais generoso do mercado.

A ressalva honesta é que a Deepgram não é mais a opção barata para lote. O pré-gravado Nova-3 custa US$ 0,0077/minuto (US$ 0,46/hora) monolíngue, e a diarização é um adicional separado de US$ 0,002/minuto. Se você só processa áudio gravado e não precisa dos pontos fortes em tempo real, está pagando um prêmio por recursos que não usa. A Deepgram cobra por segundo, sem arredondamento, o que ajuda em muitos clipes curtos.

Melhor para: streaming em tempo real, agentes de voz e equipes que priorizam a menor latência em vez do menor preço de lote. Veja nosso mergulho profundo na Deepgram Nova-3 para detalhes do modelo.

AssemblyAI Universal

AssemblyAI é a história de custo-benefício de 2026. O Universal-2 pré-gravado custa $0,15/hora ($0,0025/minuto), e o mais novo Universal-3.5 Pro sai por $0,21/hora. A diarização assíncrona padrão é um adicional pequeno de +$0,02/hora, então uma transcrição totalmente diarizada no Universal-3.5 Pro fica em torno de $0,23/hora, ainda mais barata que o batch da Deepgram antes da diarização.

O que diferencia a AssemblyAI é a camada de inteligência de áudio. Em uma única chamada de API você obtém a transcrição mais sumarização, sentimento, detecção de entidades, capítulos por tópico, moderação de conteúdo e redação de PII, além de prompting por palavras-chave em linguagem natural (até 1.500 palavras) para enviesar o vocabulário no Universal-3.5 Pro. Se você quer dados estruturados de áudio, não só texto, isso evita encadear um LLM separado. Contas novas ganham $50 em créditos grátis, sem precisar de cartão. O modelo antigo SLAM-1 está descontinuado; builds novos devem mirar o Universal-3.5 Pro.

Melhor para: áudio pré-gravado com orçamento apertado e qualquer produto que precise de análise (resumos, capítulos, redação) junto com a transcrição.

OpenAI (gpt-4o-transcribe e Whisper)

OpenAI corrigiu silenciosamente as duas maiores críticas ao Whisper. Agora existem três modelos de transcrição: gpt-4o-mini-transcribe a $0,003/minuto ($0,18/hora), gpt-4o-transcribe a $0,006/minuto ($0,36/hora) com diarização de falantes incluída, e um modelo em tempo real para transcrição ao vivo. Então a reclamação antiga de que "Whisper não tem streaming nem diarização" está ultrapassada desde 2026.

A API original do Whisper continua em US$ 0,006/min e ainda é open source, então você pode hospedar os pesos você mesmo com faster-whisper ou whisper.cpp para trocar a taxa por minuto pelo custo da sua própria GPU. A restrição real que sobra é o limite de 25 MB por arquivo, o que força uma lógica de divisão em partes para gravações longas. A precisão multilíngue é um ponto forte de verdade. Veja nossa análise de preços da API do OpenAI Whisper e o explicador do Whisper large-v3 para entender os detalhes do modelo.

Melhor para: trabalhos em lote multilíngues, times que já estão no ecossistema da OpenAI e qualquer pessoa que queira uma opção de hospedagem própria como plano B.

Google Cloud Speech-to-Text

O Google Cloud ainda domina a cobertura multilíngue com mais de 125 idiomas e a linha de modelos Chirp. O reconhecimento padrão custa US$ 0,016/min (US$ 0,96/hora), o que fica no lado caro. A jogada inteligente é o Dynamic Batch a US$ 0,004/min (US$ 0,24/hora) quando você pode esperar até 24 horas pelos resultados, um desconto de 75% sobre a tarifa padrão e um dos caminhos mais baratos para uma transcrição em escala. O nível gratuito é de 60 minutos por mês sem prazo para acabar.

Melhor para: produtos globais que precisam da maior variedade de idiomas e trabalhos em lote de alto volume que toleram a latência do Dynamic Batch. Detalhes completos no nosso guia de preços do Google Cloud Speech-to-Text.

AWS Transcribe

O AWS Transcribe é a escolha nativa da AWS. O nível 1 padrão em lote custa US$ 0,006/min (US$ 0,36/hora) com descontos agressivos por volume que reduzem a tarifa a partir de 250.000 minutos/mês, então fica mais barato conforme você escala. O destaque é o modelo Médico a US$ 0,075/min (US$ 4,50/hora), feito sob medida para conversas clínicas e fluxos de trabalho que exigem conformidade com HIPAA, uma das poucas APIs treinadas para esse domínio. O nível gratuito é de 60 minutos/mês durante os primeiros 12 meses, e depois acaba.

Ideal para: arquiteturas nativas da AWS, transcrição clínica e de saúde, e equipes que precisam manter o áudio dentro da AWS. Veja nosso detalhamento de preços do AWS Transcribe.

Rev (Reverb)

A Rev treinou o modelo Reverb com milhões de horas de áudio profissionalmente transcrito, e isso aparece em conteúdo com qualidade de transmissão. A API agora custa US$ 0,20/hora (US$ 0,0033/minuto) para o Reverb, com o Reverb turbo mais rápido a US$ 0,10/hora, e a diarização de falantes vem incluída por padrão (até 8 falantes) sem custo extra. Contas novas ganham 5 horas de créditos gratuitos. A grande mudança em relação aos guias antigos: a API da Rev costumava custar US$ 0,02/minuto, então o preço caiu cerca de 6 vezes.

Ideal para: podcasts, transmissões e mídia produzida profissionalmente, onde diarização inclusa e saída limpa fazem diferença.

Speechmatics

A Speechmatics é a especialista em sotaques e dialetos do Reino Unido, forte em inglês britânico, australiano, indiano e sul-africano, além de línguas europeias. A mudança notável em 2026 é que os preços agora são self-service e publicados, em vez de só sob consulta comercial. O modelo Melia 1 batch multilíngue parte de US$ 0,129/hora, o tempo real sai de aproximadamente US$ 0,40/hora, e o plano gratuito inclui 480 minutos/mês, com implantação em contêiner on-premise disponível para necessidades de soberania de dados.

Ideal para: sotaques diversos do inglês, línguas europeias e organizações que precisam de implantação on-premise.

Cloudflare Workers AI (Whisper)

A opção que quase nenhum roundup menciona: o Cloudflare Workers AI roda o Whisper na borda por 41,14 neurônios por minuto de áudio a US$ 0,011 por 1.000 neurônios, o que dá aproximadamente US$ 0,027/hora (whisper-large-v3-turbo fica em torno de US$ 0,031/hora). Há uma alocação gratuita de 10.000 neurônios/dia, cerca de 240 minutos gratuitos de Whisper por dia. É de longe a transcrição paga mais barata desta lista.

As desvantagens são reais: sem diarização de falantes nativa, sem streaming e com os limites conhecidos do Whisper (viés de dialeto, divisão em blocos de 25 MB). Mas para trabalho em alto volume, com um único falante e sem necessidade de tempo real, onde você só precisa do texto, é imbatível em custo.

Melhor para: transcrição em lote barata e de alto volume, quando diarização e streaming não são necessários.

Precisão: leia os benchmarks, depois teste seu próprio áudio

Os títulos sobre precisão mentem mais do que os de preço. Cada fornecedor faz benchmark em um conjunto de dados que o favorece, então números de taxa de erro de palavras (WER) de duas fontes diferentes não se somam. Uma alegação de "WER de 5% em lote" e outra de "WER de 18% no mundo real" podem ser verdadeiras para o mesmo modelo em áudios diferentes.

A referência neutra mais útil é um ranking independente como o Artificial Analysis AA-WER v2.0, que em áudio limpo em inglês mostra atualmente Deepgram Nova-3, OpenAI gpt-4o-transcribe e AssemblyAI Universal todos agrupados na faixa de WER de um dígito a baixos dois dígitos, próximos o suficiente para que a diferença raramente decida um projeto. Em áudio com sotaque forte ou ruído, as lacunas aumentam, e é exatamente aí que suas próprias amostras importam.

A regra confiável: pegue um trecho de 10 minutos do seu áudio real (seus sotaques, seu ruído de fundo, suas palavras de domínio), rode nos dois ou três finalistas e leia as transcrições você mesmo. Esse único teste diz mais do que qualquer WER publicado. Nosso guia para melhorar a precisão da transcrição cobre as alavancas que movem o WER no mundo real mais do que a escolha do modelo.

Como escolher: um caminho de decisão que combina com a intenção real

Use isto para reduzir a um ou dois candidatos e depois rode o teste de 10 minutos acima.

Seu áudio é ao vivo (streaming) ou já gravado (lote)?

  • Ao vivo: vá direto para a pergunta sobre streaming abaixo.
  • Gravado: continue.

Para áudio gravado, o menor custo é sua prioridade máxima?

  • Sim, e você não precisa de diarização ou streaming: Cloudflare Workers AI Whisper (~$0,027/hora) ou OpenAI gpt-4o-mini-transcribe ($0,18/hora).
  • Sim, mas você precisa de diarização: AssemblyAI Universal-2 ($0,15/hora + $0,02/hora de diarização) ou Rev Reverb ($0,20/hora, diarização inclusa).

Você também precisa de resumos, capítulos, análise de sentimento ou remoção de PII?

  • Sim: AssemblyAI faz tudo isso em uma única chamada.

Você precisa de streaming ou tempo real?

  • Menor latência: Deepgram Nova-3 ($0,0048/min).
  • Mais idiomas ao vivo: Google Cloud (Chirp).
  • Já está em uma nuvem: AWS Transcribe streaming ou Google Cloud streaming.

Você tem um domínio ou mercado específico?

  • Médico / HIPAA: AWS Transcribe Medical.
  • Sotaques diversos de inglês ou on-premise: Speechmatics.
  • Lista mais ampla de idiomas: Google Cloud (125+).

Minha recomendação honesta para um novo projeto em 2026: se você está processando áudio gravado e quer um único provedor que seja barato e completo, comece com AssemblyAI. Se você está construindo algo em tempo real, comece com Deepgram. Se você só precisa de texto em massa pelo menor custo possível, olhe para Cloudflare Workers AI. Nenhum deles é "o melhor" no abstrato; cada um é o melhor para uma tarefa específica.

Não quer construir contra uma API de jeito nenhum?

Se você precisa de transcrições, mas não de integração de código, não é obrigado a configurar nada disso. O ConvertAudioToText é uma ferramenta sem código que cuida do upload, extração de áudio, diarização e exportação para SRT, VTT e TXT direto no navegador. Ele roteia por vários dos mecanismos citados acima (AssemblyAI, Deepgram e Cloudflare Whisper) nos bastidores, então você aproveita o melhor de cada um sem precisar gerenciar chaves ou fallbacks por conta própria. Você também pode gerar legendas, transcrever uma reunião ou converter vídeo em texto diretamente. É o caminho que eu escolho quando o objetivo é "preciso da transcrição", não "estou lançando um recurso de transcrição".

Uma nota do Bello

Passei boa parte de 2026 conectando esses mecanismos para usuários reais, e o maior erro que vejo é escolher um provedor com base em uma lista de "melhor STT" de um ano atrás. Os preços nessas listas geralmente já estão desatualizados, e as lacunas de recursos que elas descrevem (Whisper não tem diarização, Rev é caro, Speechmatics esconde os preços) quase todas se fecharam. Escolha com base no seu áudio real e no seu volume real, confira o preço na página do próprio fornecedor na semana em que for fechar, e rode o teste de 10 minutos. Isso vale mais do que qualquer ranking, inclusive este.

Perguntas frequentes

O FAQ é fornecido na seção estruturada de perguntas frequentes.

Perguntas Frequentes

Qual é a API de speech-to-text mais barata em 2026?

Para transcrição paga completa, AssemblyAI Universal-2 a US$ 0,15/hora (US$ 0,0025/min) e Rev Reverb a US$ 0,20/hora (US$ 0,0033/min, diarização incluída) são as opções mais baratas para áudio pré-gravado. Cloudflare Workers AI rodando Whisper é ainda mais barato, cerca de US$ 0,027/hora, mas não tem diarização de falantes nativa nem streaming. Google Cloud Dynamic Batch (US$ 0,004/min) e OpenAI gpt-4o-mini-transcribe (US$ 0,003/min) também estão na faixa econômica. Deepgram, frequentemente citado como o mais barato em artigos antigos, agora custa US$ 0,46/hora para Nova-3 batch. Preços verificados em junho de 2026.

Qual API de speech-to-text é a mais precisa?

Não existe uma API única mais precisa, porque cada fornecedor avalia em áudio que favorece seu próprio modelo, e as taxas de erro de palavra de fontes diferentes não são comparáveis. Em rankings independentes para áudio limpo em inglês, Deepgram Nova-3, OpenAI gpt-4o-transcribe e AssemblyAI Universal ficam próximos, na faixa de erro de palavra de um dígito baixo a baixos adolescentes. A diferença aumenta em áudio com sotaque ou ruído. O teste confiável é rodar um clipe de 10 minutos do seu próprio áudio real nos seus dois ou três finalistas e ler as transcrições você mesmo.

Qual API é melhor para transcrição em streaming em tempo real?

Deepgram Nova-3 lidera em latência de streaming a US$ 0,0048/min (monolíngue), com latência abaixo de 300ms, por isso é a escolha comum para agentes de voz e legendas ao vivo. AssemblyAI Universal Streaming (US$ 0,15/hora) e o modelo de transcrição em tempo real da OpenAI são alternativas fortes, e Google Cloud é a opção quando você precisa da maior cobertura de idiomas em tempo real. Para áudio pré-gravado, use sempre o tier batch, mais barato e preciso, em vez de streaming.

Essas APIs incluem diarização de falantes, e isso custa extra?

Varia. O Rev Reverb inclui diarização por padrão (até 8 falantes) sem custo extra, e o gpt-4o-transcribe da OpenAI também inclui. A AssemblyAI cobra um adicional pequeno de cerca de +$0,02/hora para diarização assíncrona padrão. A Deepgram cobra +$0,002/minuto como um add-on separado. AWS Transcribe e Google Cloud suportam o recurso. O Cloudflare Workers AI Whisper não tem diarização nativa. Sempre confira se o preço anunciado inclui diarização, porque os add-ons podem elevar um modelo de $0,15/hora para $0,23/hora.

Posso usar o OpenAI Whisper de graça?

As APIs do OpenAI Whisper e do gpt-4o-transcribe não têm camada gratuita e cobram por minuto ($0,006/min para Whisper e gpt-4o-transcribe, $0,003/min para gpt-4o-mini-transcribe). Porém, o modelo Whisper é open source, então você pode baixar os pesos e rodar você mesmo com ferramentas como faster-whisper ou whisper.cpp, trocando as taxas por minuto pelo custo da sua própria GPU. Para transcrição hospedada realmente gratuita, o Cloudflare Workers AI oferece cerca de 240 minutos de Whisper por dia sem cobrança, ou você pode usar uma ferramenta sem código como o ConvertAudioToText.

A Deepgram ainda é a melhor escolha em 2026?

A Deepgram continua excelente para streaming em tempo real, onde o Nova-3 a $0,0048/min com latência abaixo de 300ms é difícil de superar, e ela oferece o crédito gratuito mais generoso ($200). Mas ela não é mais a mais barata para áudio pré-gravado: o batch do Nova-3 custa $0,0077/min ($0,46/hora) mais um add-on de diarização de $0,002/min, o que é várias vezes mais caro que AssemblyAI ou Rev. Se você só processa arquivos gravados, provavelmente está pagando a mais com a Deepgram; se você cria produtos em tempo real, ela ainda é uma escolha de topo.

O que mudou nos preços das APIs de speech-to-text desde 2025?

Os preços caíram bastante e vários argumentos antigos ficaram obsoletos. A AssemblyAI baixou para US$ 0,15/hora, a API da Rev caiu de cerca de US$ 0,02/minuto para US$ 0,20/hora, e o lote padrão da AWS está em US$ 0,006/minuto (artigos mais antigos citam US$ 0,024, que era a taxa de streaming). A OpenAI adicionou diarização de falantes ao gpt-4o-transcribe e um modelo em tempo real, então o Whisper não é mais sem streaming nem sem diarização. A Speechmatics agora publica preços de autoatendimento em vez de exigir uma ligação comercial. Note que a AssemblyAI aumenta os preços regionais em 10% em 1º de julho de 2026, evitável com model_region: global.

Devo usar uma API de STT ou uma ferramenta de transcrição sem código?

Use uma API se você está integrando transcrição como um recurso dentro do seu próprio produto e precisa de controle programático, vocabulário personalizado ou webhooks. Use uma ferramenta sem código se você só precisa do transcript em si, para uma reunião, entrevista, podcast ou vídeo. Uma ferramenta sem código como a ConvertAudioToText cuida do upload, extração de áudio, diarização e exportação para SRT, VTT e TXT sem você gerenciar chaves de API, fallbacks ou divisão em partes. Ela roteia internamente entre vários motores, então você aproveita os pontos fortes de cada um sem o trabalho de integração.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles