Comparação de APIs de Transcrição 2026: Matriz de Decisão para Devs
apitranscricaodesenvolvedores

Comparação de APIs de Transcrição 2026: Matriz de Decisão para Devs

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

Deepgram Nova-3 é a opção de streaming mais barata e a mais rápida para inglês. AssemblyAI Universal-2 supera todo mundo em preço por minuto em lote, enquanto a Universal-3 Pro entrega o melhor WER publicado. O gpt-4o-transcribe da OpenAI é a escolha mais forte para trabalhos em lote multilíngues. AWS Transcribe só faz sentido se você já está bem dentro do ecossistema AWS. Google Cloud STT é o mais barato de todos em lote dinâmico a $0.003/min, mas é lento. Escolha pelo volume, mix de idiomas e exigência de latência, não pelo nome.

Escolher a API de transcrição errada pode fazer você pagar 5x mais do que o necessário, ficar sem metade dos idiomas que precisa ou desenvolver contra um recurso que só funciona em inglês. Este post detalha os principais provedores com base em preços verificados, benchmarks de precisão e padrões de integração, para você decidir em uma única leitura.

O público aqui são desenvolvedores e equipes técnicas. Se você quer uma comparação do lado do comprador, focada em ferramentas SaaS em vez de integração de API, comece pela visão geral das melhores APIs de speech-to-text em 2026.

Como o Mercado se Divide em 2026

Cinco provedores lidam com a maior parte do tráfego de API em produção: Deepgram, AssemblyAI, OpenAI (gpt-4o-transcribe), AWS Transcribe e Google Cloud STT. Cada um tem um nicho de verdade.

Os principais diferenciais:

  • Custo por minuto em batch: varia de $0.0025 (AssemblyAI Universal-2) a $0.016 (Google real-time standard)
  • Latência de streaming: Deepgram abaixo de 300ms, outros de 300ms a 800ms ou sem streaming algum
  • Amplitude de idiomas: OpenAI com 99+, Deepgram forte em 10-30, AWS em torno de 30
  • Profundidade de recursos: AssemblyAI inclui diarização, redação, detecção de entidades e resumos; outros cobram add-ons ou nem oferecem o recurso

Os preços abaixo são pay-as-you-go, batch (pré-gravado), áudio em inglês, salvo indicação contrária. Verificados em julho de 2026 nas páginas dos fornecedores.

Detalhamento Provedor por Provedor

Deepgram Nova-3

Nova-3 é o líder em velocidade de streaming. Batch pré-gravado custa $0.0043/min (inglês, PAYG), streaming sai por $0.0077/min (standard). O plano Growth, com compromisso anual de $4.000+, reduz o batch para $0.0036/min. A Deepgram cobra por segundo, sem arredondamento.

O Nova-3 Multilingual (não inglês) custa $0.0092/min em batch, o que pesa mais. Se você transcreve muito volume em outros idiomas, vale conferir se a sobretaxa multilíngue muda a conta em relação à OpenAI.

O modelo de diarização recebeu uma atualização significativa na v2 em 2026. A Deepgram relata uma preferência de 3,3x pela v2 sobre a v1 em avaliação lado a lado, com os maiores ganhos em áudio de contact center. Você ativa isso via diarize_model=nova-3.

A Deepgram afirma 5,26% de WER no Nova-3 batch em seu conjunto de testes de produção (2.703 arquivos, nove domínios). Idiomas suportados com qualidade: cerca de 30 para o Nova-3, com 10 novos idiomas monolíngues europeus e do Sudeste Asiático adicionados em 2026.

Créditos gratuitos: $200 sem necessidade de cartão de crédito.

Bom para: Agentes de voz em tempo real, call centers, qualquer aplicativo onde a latência de streaming importa. Não é o mais barato para batch assíncrono em alto volume.

AssemblyAI Universal-2 e Universal-3 Pro

A AssemblyAI é a opção batch verificada mais barata para inglês a $0,0025/min ($0,15/hr) no Universal-2. O Universal-3 Pro custa $0,0035/min ($0,21/hr) e cobre seis idiomas com a maior precisão publicada. Nota: o preço regional da AssemblyAI aumentou 10% a partir de 1º de julho de 2026, mas você pode evitar isso adicionando "model_region": "global" à sua solicitação.

Segundo o benchmark da AssemblyAI de junho de 2026 (mais de 80.000 arquivos, 26 datasets, normalizador de texto da OpenAI), o Universal-3 Pro marca 4,5% de WER em áudio inglês pré-gravado. O Deepgram Nova-3 marca 6,66% no mesmo benchmark. Esses números vêm do próprio conjunto de testes da AssemblyAI, então trate-os como direcionais, não como um veredito neutro de terceiros.

Os add-ons de recursos se acumulam sobre a taxa base de transcrição. Diarização de locutor em async adiciona $0,02-$0,065/hr. Redação de PII custa $0,08/hr. Moderação de conteúdo custa $0,15/hr. Resumização custa $0,08/hr. Para uma transcrição em inglês diarizada e redigida, você está olhando para cerca de $0,30/hr no total.

Streaming (modelo Universal-Streaming): $0,15/hr, cobrado pelo tempo de conexão WebSocket, não pela duração do áudio. Uma conexão aberta por 60 minutos com 30 minutos de áudio falado é cobrada por 60 minutos. Planeje isso em aplicativos interativos sensíveis à latência.

Créditos gratuitos: $50, sem necessidade de cartão de crédito.

Bom para: lotes assíncronos de alto volume, pipelines focados em inglês onde a amplitude de recursos (resumos, entidades, moderação) importa. Não é o ideal para streaming em outros idiomas.

OpenAI (gpt-4o-transcribe e gpt-4o-mini-transcribe)

Para lotes multilíngues, o gpt-4o-transcribe a $0.006/min é a opção mais confiável em mais de 99 idiomas. A variante mini corta esse valor pela metade, a $0.003/min, com uma pequena perda de precisão. A página de preços da OpenAI lista ambos como modelos atuais.

Para streaming em tempo real, o gpt-realtime-whisper (lançado em maio de 2026) é o caminho dedicado, a $0.017/min. Ele conecta via WebSocket e entrega trechos da transcrição enquanto o locutor fala.

A velha alegação de que "a API Whisper não tem streaming" está ultrapassada. O streaming agora existe pelo caminho realtime, só que a uma taxa maior que a do lote.

Limitações que ainda valem: a API hospedada tem um limite de 25 MB por arquivo em cada requisição de lote padrão. Não há diarização nativa no gpt-4o-transcribe (existe uma variante separada para diarização). Sem resumo nativo por IA. Sem elegibilidade para HIPAA na API padrão ao consumidor.

Para um detalhamento completo dos preços dos modelos de áudio da OpenAI, veja preços da API Whisper da OpenAI em 2026.

Bom para: transcrição multilíngue, apps que já usam a pilha da API OpenAI, cenários onde a cobertura de idiomas pesa mais que o custo.

AWS Transcribe

A taxa de lote de $0.006/min do AWS Transcribe (Leste dos EUA, padrão) é competitiva, mas só faz sentido se você já está investido na pilha AWS. Streaming sai a $0.01/min. Os níveis de volume começam em 250 mil minutos (Nível 2: $0.0186/min, 38% de desconto). Transcrição médica custa $0.075/min em lote e $0.15/min em streaming. Todo uso é cobrado em incrementos de 1 segundo, com mínimo de 15 segundos por requisição.

A precisão fica atrás da Deepgram e da OpenAI em benchmarks comparáveis de áudio limpo. A história de integração é o valor real: gatilhos de S3, criptografia KMS, papéis IAM, logs do CloudWatch e PrivateLink funcionam nativamente. Para um time de saúde que já roda Textract e Comprehend na AWS, as integrações nativas cortam semanas de trabalho de colagem.

O AWS Transcribe é elegível para HIPAA (BAA disponível). Vocabulário personalizado e modelos de linguagem personalizados estão disponíveis, mas são cobrados como complementos.

Veja preços do AWS Transcribe 2026 para o detalhamento completo por faixa de volume.

Bom para: arquitetura nativa da AWS, cargas de trabalho elegíveis para HIPAA, indústrias reguladas que já estão no ecossistema.

Google Cloud STT (Chirp 2)

A taxa mais atraente do Google é o batch dinâmico a $0,003/min, mas você aceita um prazo de 24 horas. O tempo real padrão via API V2 é $0,016/min, caindo com volume (500 mil+ minutos: $0,01/min). O modelo Chirp 2 está incluído no preço padrão sem prêmio, e adiciona timestamps em nível de palavra e adaptação de modelo sobre o Chirp original.

Nota de faturamento: o Google arredonda para o segundo mais próximo (não 15 segundos como na API V1 antiga). Áudio multicanal é cobrado por canal, o que pode dobrar seu custo em arquivos estéreo.

Camada gratuita: 60 minutos/mês contínuos para contas novas e existentes, mais $300 em créditos nos primeiros 90 dias para contas novas no GCP.

O Google Cloud STT combina bem com BigQuery, Vertex AI e Pub/Sub, então times que já rodam infraestrutura GCP têm o mesmo argumento de economia por integração que os times da AWS.

Bom para: times nativos do GCP, cargas de trabalho tolerantes a turnaround assíncrono em batch, aplicações que precisam da cobertura multilíngue do Chirp do Google.

Comparação de Preços em Volumes Reais de Batch

Processamento em batch, áudio em inglês, camada pay-as-you-go. CATT é um plano mensal fixo (não por minuto), então não aparece num eixo por minuto.

ProvedorModelo$/min (PAYG em lote)$/hora
AssemblyAIUniversal-2$0,0025$0,15
OpenAIgpt-4o-mini-transcribe$0,0030$0,18
Google CloudLote dinâmico (Chirp 2)$0,0030$0,18
DeepgramNova-3 (inglês)$0,0043$0,26
AssemblyAIUniversal-3 Pro$0,0035$0,21
OpenAIgpt-4o-transcribe$0,0060$0,36
AWS TranscribePadrão (Leste dos EUA)$0,0060$0,36
Google CloudTempo real padrão$0,0160$0,96
Custo de transcrição em lote por minuto (PAYG, julho de 2026)
AssemblyAI U2
$0,0025
AAI U3 Pro
$0,0035
OpenAI mini
$0,003
GCP dyn. batch
$0,003
Deepgram N3
$0,0043
OpenAI 4o-T
$0,006

Tarifas pagas conforme o uso para transcrição padrão em lote no inglês. Fontes: páginas de preços dos fornecedores, verificadas em julho de 2026.

Comparação de Tarifas em Streaming

Casos de uso em tempo real mudam bastante o cenário de custos.

ProvedorModelo$/min (streaming)Latência
DeepgramNova-3 streaming$0,0077abaixo de 300ms
AssemblyAIUniversal-Streaming$0,0025 ($0,15/hora)~300ms
OpenAIgpt-realtime-whisper$0,0170deltas de baixa latência
AWS TranscribeStreaming padrão$0,0100~800ms
Google CloudV2 em tempo real$0,0160~450ms

Observação: o streaming da AssemblyAI cobra pelo tempo de conexão, não pelo tempo de áudio. Uma sessão ociosa durante metade da duração ainda acumula custo.

Matriz de Recursos

Interface de upload da API ConvertAudioToText para transcrição de áudio
Interface de upload da API ConvertAudioToText para transcrição de áudio

RecursoDeepgramOpenAI 4o-TAssemblyAIAWSGoogle
DiarizaçãoSim (v2)LimitadaSim (+custo)SimSim
StreamingSimSim (caminho em tempo real)SimSimSim
Resumos com IANãoNãoSim (+custo)NãoNão
Redação de PIISimNãoSim (+custo)Sim (+custo)Sim
Vocabulário personalizadoSimLimitadoSimSimSim
WebhooksSimNãoSimVia LambdaVia Pub/Sub
Idiomas (qualidade)~3099+99 (U2), 6 (U3)~30100+ (Chirp 2)
HIPAA BAAEnterpriseNãoEnterpriseSimSim
Plano gratuitoCrédito de $200Sem cartão de créditoCrédito de $5060 min/mês60 min/mês

Para um olhar mais detalhado sobre os modelos de preço individuais, veja preços de API de transcrição de fala 2026 e modelos de preço de transcrição explicados.

A Matriz de Decisão do Desenvolvedor

Algumas regras de decisão claras com base no que realmente importa:

Você precisa de streaming abaixo de 300ms para agentes de voz ou legendas ao vivo. Deepgram Nova-3. Nada mais chega perto da latência nesse preço.

Você quer o menor custo de processamento em lote e o inglês é seu idioma principal. AssemblyAI Universal-2 a $0,0025/min. Adicione a diarização e você ainda fica abaixo de $0,30/hora.

Você precisa de cobertura em 99 idiomas com precisão sólida. OpenAI gpt-4o-transcribe a $0,006/min. Os benchmarks multilíngues se sustentam em mais combinações de idiomas do que qualquer concorrente.

Você quer máxima precisão em inglês e não se importa de pagar um pouco mais. AssemblyAI Universal-3 Pro (4,5% de WER segundo seus benchmarks de junho de 2026, seis idiomas).

Você já está no ecossistema AWS e precisa de HIPAA. AWS Transcribe. A $0,006/min com S3, KMS e IAM nativos, a economia com integração compensa a diferença de precisão.

Você roda no GCP e seus jobs não são sensíveis ao tempo. O batch dinâmico do Google Cloud a $0,003/min é difícil de bater quando um prazo de 24 horas é aceitável.

Você quer resumos com IA e detecção de entidades em uma única chamada de API, sem precisar integrar um LLM separado. AssemblyAI. O modelo de preço por add-on significa que você só paga pelos recursos que ativar.

Se você só precisa de transcrições limpas, sem construir uma integração, sem cadastro e com retorno imediato, o ConvertAudioToText lida com áudio, vídeo, reuniões e links do YouTube sem chave de API. O plano Business adiciona acesso à API e webhooks para equipes que integram em escala. É uma taxa mensal fixa, em vez de cobrança por minuto, então a conta favorece equipes com volume regular e previsível, em vez de cargas esporádicas e baixas.

Padrões de Migração

Troca direta para uma única rota. Substitua um endpoint por vez. Envie 10% do tráfego para o provedor candidato em um pipeline paralelo por uma semana, compare o WER em uma amostra de áudio real e então faça a virada.

Migração por custo acima de um limite de volume. Se você está em um provedor por minuto e os custos estão subindo, calcule suas horas mensais de áudio. O ponto de equilíbrio de US$ 0,15/hora do AssemblyAI Universal-2 contra alternativas mais caras é muito curto.

Migração por recursos. Sair de uma API de transcrição básica para a AssemblyAI para obter resumos embutidos costuma ser mais barato do que rodar uma API simples mais uma chamada separada de GPT-4o por transcrição. Faça as contas do seu gasto atual com LLM por transcrição.

O teste paralelo sempre vale a hora que leva. Escolha dez arquivos representativos entre seus tipos reais de áudio (fala limpa, ruidosa, com sotaque, multilíngue), rode todos os candidatos e compare a saída com um padrão de referência. Benchmarks de laboratório e posts de blog de fornecedores não preveem a precisão no seu áudio específico.

Veja a comparação de APIs de transcrição 2026 se quiser compartilhar um link permanente desta matriz com sua equipe.

FAQ

Qual API de transcrição tem o menor custo por minuto em 2026?

AssemblyAI Universal-2 é a opção mais barata de pagamento conforme o uso, a $0,0025/min ($0,15/hora). O Google Cloud STT só o supera no modo batch dinâmico ($0,003/min), mas com um prazo de 24 horas. O Deepgram Nova-3 batch custa $0,0043/min, e o OpenAI gpt-4o-mini-transcribe sai por $0,003/min para uploads de arquivos padrão.

O Deepgram ou o AssemblyAI tem melhor precisão?

Segundo os próprios benchmarks do AssemblyAI de junho de 2026 (mais de 80.000 arquivos, normalizador OpenAI), o Universal-3 Pro marca 4,5% de WER contra 6,66% do Deepgram Nova-3. O número divulgado pelo próprio Deepgram é 5,26% de WER para o Nova-3. Esses dados são autorreportados, então trate-os como referência. Ambos passam confortavelmente de 95% em áudio limpo em inglês.

Qual API suporta mais idiomas?

O gpt-4o-transcribe da OpenAI suporta mais de 99 idiomas com qualidade razoável. O AssemblyAI Universal-2 também cobre 99 idiomas. O Deepgram Nova-3 cobre inglês e cerca de 30 idiomas, com qualidade caindo fora dos dez primeiros. O AWS Transcribe suporta cerca de 30 idiomas, e o modelo Chirp 2 do Google Cloud cobre mais de 100, com qualidade variável.

Qual API de transcrição é melhor para streaming em tempo real?

O Deepgram lidera em tempo real: a API de streaming Nova-3 entrega latência abaixo de 300ms a $0,0077/min. O gpt-realtime-whisper da OpenAI ($0,017/min) é mais novo e feito para legendagem ao vivo e fluxos de assistente de voz. O modelo Universal-Streaming do AssemblyAI roda a cerca de $0,15/hora com latência de menos de um segundo. O streaming do AWS Transcribe custa $0,01/min e é o mais simples de integrar se você vive no ecossistema AWS.

Preciso de cartão de crédito para testar essas APIs?

O Deepgram dá $200 em créditos gratuitos sem exigir cartão de crédito. O AssemblyAI dá $50 em créditos gratuitos sem cartão. A OpenAI exige cartão de crédito para liberar chaves de API. O AWS Transcribe oferece 60 minutos gratuitos por mês durante 12 meses, mas requer conta AWS e configuração de cobrança. O Google Cloud dá 60 minutos gratuitos por mês de forma contínua, além de $300 em créditos para contas novas.

Qual API de transcrição é elegível para HIPAA?

AWS Transcribe (com um Business Associate Agreement), AssemblyAI Enterprise e Google Cloud Speech-to-Text (com BAA) todos oferecem caminhos elegíveis para HIPAA. A Deepgram oferece um BAA HIPAA para clientes enterprise. A API hospedada da OpenAI e o ConvertAudioToText não são certificados para HIPAA atualmente.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles