
Preço da API Whisper da OpenAI Por Minuto em 2026
Summarize this article with:
A API Whisper da OpenAI se tornou um dos serviços de transcrição mais comentados desde o seu lançamento, em grande parte por causa do seu preço direto e da reputação do modelo open source Whisper por trás dela. Mas entender o que você realmente paga, o que recebe e o que abre mão em comparação com outras opções exige uma análise mais detalhada do que a maioria dos resumos oferece.
Este guia cobre tudo o que você precisa saber sobre o preço por minuto da API Whisper da OpenAI em 2026, incluindo os custos reais, as limitações de tamanho de arquivo, a economia do self-hosting e como o Whisper se compara às alternativas pagas do Google, da AWS e da Deepgram.
Preço da API Whisper em Resumo
A OpenAI mantém o preço da API Whisper simples. Há um preço, um modelo e nenhum sistema complicado de níveis para navegar.
| Detalhe | Valor |
|---|---|
| Preço por minuto | $0.006 |
| Preço por hora | $0.36 |
| Incremento de cobrança | Por segundo (arredondado para o segundo mais próximo) |
| Plano gratuito | Nenhum |
| Descontos por volume | Nenhum |
| Cobrança mínima | Baseada na duração real do áudio |
| Modelo | Whisper v3 (large-v3) |
Essa taxa fixa de $0.006 por minuto se aplica independentemente da quantidade de áudio que você processa. Seja transcrevendo dez minutos de áudio por mês ou dez mil horas, o custo por minuto permanece o mesmo. A OpenAI não oferece descontos por volume, preços de uso comprometido nem plano gratuito para a API Whisper.
Para contextualizar, uma hora de transcrição custa $0.36. Dez horas custam $3.60. Cem horas custam $36. A conta é direta, o que é um dos maiores atrativos do Whisper para equipes que querem uma cobrança previsível, sem surpresas.
Você paga apenas pela duração real do áudio no seu arquivo. Se você enviar uma gravação de cinco minutos, paga por cinco minutos, independentemente de quanto tempo a API leva para processá-la. O silêncio dentro do arquivo ainda conta para a duração, já que a API processa todo o fluxo de áudio.
Visite a página de preços da OpenAI para conferir as tarifas oficiais mais recentes.
O Que Você Recebe por $0.006 Por Minuto
Nesse preço, a API Whisper entrega um serviço de transcrição competente, sustentado por um dos modelos de reconhecimento de fala mais conhecidos do mundo.
Recursos Incluídos
Modelo Whisper v3 (large-v3). A API executa o maior e mais preciso modelo Whisper da OpenAI. Você não precisa escolher entre tamanhos de modelo nem gerenciar diferentes níveis de precisão. Toda requisição usa o mesmo modelo.
Suporte a mais de 57 idiomas. O Whisper lida com transcrição em dezenas de idiomas, do inglês e espanhol ao hindi, árabe, japonês e muitos outros. O suporte a idiomas é uma das maiores vantagens do Whisper. A lista completa de idiomas suportados está disponível no repositório do Whisper no GitHub.
Detecção automática de idioma. Se você não especificar o idioma, o Whisper o detectará automaticamente a partir dos primeiros 30 segundos de áudio. Isso funciona bem para a maioria das gravações, embora especificar o idioma quando você o conhece melhore a precisão.
Timestamps em nível de palavra. A API pode retornar timestamps para palavras individuais, o que é útil para geração de legendas, busca em áudio e alinhamento de transcrições com vídeo.
Tradução para o inglês. Além da transcrição, o Whisper oferece um modo de tradução que transcreve áudio em outros idiomas diretamente para texto em inglês em uma única etapa, sem precisar de um serviço de tradução separado.
O Que Você NÃO Recebe
Entender as limitações do Whisper é tão importante quanto conhecer seus recursos, especialmente ao compará-lo com alternativas pagas.
Sem streaming ou transcrição em tempo real. A API Whisper funciona apenas em lote. Você envia um arquivo de áudio completo e recebe a transcrição integral quando o processamento termina. Não há endpoint WebSocket, nem resultados parciais, nem capacidade de legendagem ao vivo. Se você precisa de transcrição em tempo real para reuniões ou transmissões ao vivo, o Whisper não é a ferramenta certa.
Sem diarização nativa de falantes. O Whisper não identifica nem rotula os diferentes falantes em uma conversa. A transcrição chega como um fluxo único de texto, sem nenhuma indicação de quem disse o quê. Você pode adicionar diarização de terceiros por cima, mas isso acrescenta complexidade e custo.
Sem vocabulário personalizado ou reforço de palavras-chave. Se o seu áudio contém terminologia especializada, nomes de marcas ou palavras incomuns, você não pode fornecer um dicionário personalizado para melhorar a precisão. O Whisper transcreve com base apenas nos seus dados de treinamento.
Sem análise de sentimento ou detecção de tópicos. A API retorna texto e timestamps. Ela não analisa o tom emocional, não identifica tópicos de discussão nem oferece qualquer análise semântica do conteúdo.
Sem controle automático de pontuação. O Whisper adiciona pontuação automaticamente, mas você tem controle limitado sobre como ele pontua. Em alguns idiomas, a precisão da pontuação pode ser inconsistente.

O Limite de 25MB de Tamanho de Arquivo
Uma das frustrações mais comuns com a API Whisper é o limite de 25MB por requisição. Para gravações curtas ou áudio comprimido, isso raramente é um problema. Mas para arquivos mais longos, especialmente arquivos de vídeo ou gravações de alta taxa de bits, você atingirá esse teto rapidamente.
Um limite de 25MB equivale aproximadamente a:
| Formato | Duração Aproximada em 25MB |
|---|---|
| MP3 a 128kbps | ~26 minutos |
| MP3 a 64kbps | ~52 minutos |
| WAV (16-bit, 16kHz mono) | ~13 minutos |
| M4A a 128kbps | ~26 minutos |
| Vídeo MP4 | 3-10 minutos (varia bastante) |
Se as suas gravações ultrapassam essas durações, você precisa de uma estratégia de contorno.
Estratégia 1: Comprimir Antes de Enviar
A abordagem mais simples é converter o seu áudio para um formato comprimido antes de enviá-lo para a API. Converter um arquivo WAV para MP3 a 64kbps pode reduzir o tamanho do arquivo em 90% ou mais, mantendo uma precisão de transcrição praticamente idêntica à do original. Ferramentas como o FFmpeg fazem essa conversão de forma eficiente. Para conteúdo apenas de fala, MP3 a 64kbps preserva toda a informação de frequência de que o Whisper precisa.
Estratégia 2: Dividir Arquivos Longos em Partes
Para gravações que excedem 25MB mesmo após a compressão, dividir o arquivo em segmentos menores é a abordagem padrão. A consideração principal aqui é escolher os pontos de divisão com cuidado. Dividir no meio de uma frase fará a API retornar frases incompletas nas fronteiras das partes, e você precisará juntar os resultados de forma inteligente. Dividir em pontos naturais de silêncio produz resultados mais limpos.
A maioria das bibliotecas de processamento de áudio consegue detectar intervalos de silêncio nas gravações e usá-los como pontos de divisão. Busque partes entre 20 e 24MB para deixar uma pequena margem abaixo do limite.
Estratégia 3: Extrair o Áudio do Vídeo
Se você está trabalhando com arquivos de vídeo, extraia primeiro a trilha de áudio em vez de enviar o vídeo completo. Um vídeo MP4 de uma hora pode ter 500MB, mas a trilha de áudio sozinha, como MP3, pode ficar abaixo de 30MB. Essa etapa de extração é rápida e evita enviar dados de vídeo que a API ignora de qualquer forma.
Estratégia 4: Usar um Serviço Que Cuida Disso para Você
Plataformas como o ConvertAudioToText cuidam do pré-processamento de arquivos automaticamente. Você envia arquivos de qualquer tamanho, e a plataforma gerencia a compressão, a divisão e a remontagem nos bastidores. Isso elimina o esforço de engenharia de construir o seu próprio pipeline de pré-processamento.
Self-Hosting do Whisper: Grátis, Mas Não de Graça
Como o Whisper é open source, você pode executá-lo na sua própria infraestrutura sem pagar nada à OpenAI. Os pesos do modelo estão disponíveis gratuitamente e a base de código é bem documentada. Isso levanta uma pergunta óbvia: por que pagar $0.006 por minuto quando você pode executá-lo de graça?
A resposta se resume a custos de GPU, tempo de engenharia e escala.
Custos de GPU para Self-Hosting
O modelo large-v3 do Whisper exige uma GPU capaz para rodar em velocidades razoáveis. Veja o que as opções mais comuns custam nos principais provedores de nuvem:
| GPU | Custo na Nuvem (por hora) | Velocidade de Processamento do Whisper | Custo Por Hora de Áudio |
|---|---|---|---|
| NVIDIA A100 (80GB) | ~$1.50 - $3.00 | ~6-10x tempo real | $0.15 - $0.50 |
| NVIDIA A10G | ~$0.75 - $1.20 | ~3-5x tempo real | $0.15 - $0.40 |
| NVIDIA T4 | ~$0.35 - $0.50 | ~1-2x tempo real | $0.18 - $0.50 |
| NVIDIA L4 | ~$0.50 - $0.80 | ~3-4x tempo real | $0.13 - $0.27 |
A velocidade de processamento importa porque determina quantas horas de áudio você consegue transcrever por hora de GPU. Uma A100 pode processar uma gravação de uma hora em cerca de seis a dez minutos, o que significa que você pode transcrever aproximadamente seis a dez horas de áudio por hora de GPU. Uma T4 processa próximo do tempo real, então uma hora de GPU rende aproximadamente uma a duas horas de áudio transcrito.
Os Custos Ocultos
O aluguel bruto de GPU é apenas parte da equação. O self-hosting do Whisper também exige:
Gestão de infraestrutura. Você precisa provisionar servidores, gerenciar escalonamento, lidar com failover e manter o uptime. Não é um deploy do tipo configurar e esquecer.
Gestão de filas e jobs. Processar áudio em escala exige uma fila de jobs, gestão de workers, lógica de retry e rastreamento de status. Essencialmente, você está construindo a infraestrutura de backend que as APIs gerenciadas oferecem de fábrica.
Atualizações de modelo. Quando a OpenAI lança pesos de modelo aprimorados, você precisa atualizar o seu deploy. Testar, validar e implantar atualizações de modelo consome tempo de engenharia.
Monitoramento e depuração. Cargas de trabalho em GPU falham de maneiras diferentes dos serviços web típicos. Erros de falta de memória, problemas de driver e conflitos de versão do CUDA são dores de cabeça comuns.
Armazenamento e rede. Mover arquivos de áudio para os seus servidores de GPU e armazenar resultados acrescenta custos de banda e armazenamento fáceis de passar despercebidos.
Quando o Self-Hosting Economiza Dinheiro
O self-hosting começa a fazer sentido financeiro quando você processa volumes grandes e consistentes. O ponto de equilíbrio depende das suas escolhas de infraestrutura, mas, como referência aproximada:
| Volume Mensal | Custo da API (a $0.006/min) | Estimativa de Self-Hosting | Melhor Opção |
|---|---|---|---|
| Abaixo de 100 horas | $36 | $150 - $400+ | API |
| 100 - 500 horas | $36 - $180 | $200 - $600 | API (geralmente) |
| 500 - 2,000 horas | $180 - $720 | $300 - $800 | Self-hosting (depende) |
| Acima de 2,000 horas | $720+ | $400 - $1,200 | Self-hosting |
Essas estimativas pressupõem que você tem recursos de engenharia disponíveis para construir e manter a infraestrutura. Se você precisar contratar ou realocar engenheiros para gerenciar um deploy self-hosted do Whisper, o ponto de equilíbrio sobe consideravelmente.
Prós e Contras do Self-Hosting
| Prós | Contras |
|---|---|
| Sem cobrança por minuto | Esforço de engenharia inicial significativo |
| Controle total sobre o modelo e o pipeline | Custos de GPU sobem rápido em volumes baixos |
| Os dados ficam na sua infraestrutura | Você cuida do escalonamento, monitoramento e atualizações |
| Permite personalizar pré e pós-processamento | Sem SLA ou suporte da OpenAI |
| Sem limites de tamanho de arquivo | Exige expertise em GPU na sua equipe |
Whisper vs Alternativas Pagas
O preço por minuto é a métrica mais visível, mas conta uma história incompleta. O que importa é o custo total para alcançar a qualidade de transcrição e os recursos que o seu fluxo de trabalho exige.
Tabela Comparativa de Preços
| Serviço | Preço Por Minuto | Diarização de Falantes | Streaming | Idiomas | Vocabulário Personalizado |
|---|---|---|---|---|---|
| OpenAI Whisper API | $0.006 | Não | Não | 57+ | Não |
| Deepgram (Nova-2) | $0.0043 | Sim | Sim | 36+ | Sim |
| Google Cloud STT | $0.016 | Sim | Sim | 125+ | Sim (frases) |
| AWS Transcribe | $0.024 | Sim | Sim | 37+ | Sim |
| Azure Speech | $0.016 | Sim | Sim | 100+ | Sim |
| AssemblyAI | $0.0065 | Sim | Sim | 20+ | Não |
O Que a Tabela Revela
O Whisper é barato, mas não é o mais barato. O modelo Nova-2 da Deepgram supera o Whisper em preço, a $0.0043 por minuto, e ainda inclui diarização de falantes, streaming, vocabulário personalizado e recursos como análise de sentimento e detecção de tópicos. Para aplicações que precisam de mais do que transcrição bruta, a Deepgram frequentemente oferece melhor custo-benefício, mesmo sendo um serviço pago. Você pode ler mais sobre como esses serviços se comparam na nossa comparação de preços de APIs de speech-to-text.
Serviços empresariais cobram mais, mas entregam mais. O Google Cloud Speech-to-Text e o AWS Transcribe custam de duas a quatro vezes mais que o Whisper, mas incluem suporte a streaming, diarização de falantes, vocabulário personalizado e SLAs de nível empresarial. Para aplicações em produção onde o downtime custa dinheiro de verdade, esses extras importam.
Recursos ausentes têm custos ocultos. Se você precisa de diarização de falantes com o Whisper, terá que adicionar um serviço ou biblioteca de diarização de terceiros, o que acrescenta complexidade, latência e, potencialmente, custo adicional. A "economia" da tarifa por minuto mais baixa do Whisper pode evaporar quando você considera as integrações necessárias para igualar o que outros serviços incluem nativamente.
Para uma comparação detalhada entre o Whisper e a oferta do Google, veja a nossa análise Whisper vs Google Cloud Speech.

Quando o Whisper É a Escolha Certa
Apesar das suas limitações, há cenários em que a API Whisper é genuinamente a melhor opção.
Transcrição em Lote Multilíngue
Se você transcreve regularmente áudio em muitos idiomas diferentes e não precisa de resultados em tempo real, a combinação do Whisper de amplo suporte a idiomas e custo baixo é difícil de superar. Uma empresa de mídia que transcreve entrevistas em francês, japonês e português pode usar uma única API com preço consistente em todos os idiomas. A maioria dos concorrentes ou cobra mais por idiomas além do inglês, ou suporta menos deles.
Projetos de Pequena Escala com Orçamento Limitado
Para startups, pesquisadores e desenvolvedores individuais que processam volumes modestos de áudio, a tarifa de $0.006 por minuto do Whisper mantém os custos mínimos. Transcrever dez horas de áudio custa $3.60, sem nenhuma infraestrutura para gerenciar. Não há compromisso mínimo, nem assinatura, nem custo inicial além dos seus créditos de API da OpenAI.
Preferência por Open Source e Controle de Dados
Organizações que preferem tecnologia open source podem usar a API Whisper como uma porta de entrada conveniente e migrar para o Whisper self-hosted mais tarde, se os volumes crescerem. Como o modelo é idêntico, os resultados de transcrição serão consistentes nos dois modelos de implantação. Essa é uma flexibilidade que serviços proprietários não conseguem igualar. Para desenvolvedores explorando opções gratuitas de transcrição, a disponibilidade open source do Whisper é uma vantagem significativa.
Transcrição Simples, Sem Extras
Se o seu caso de uso é direto — enviar um arquivo e obter uma transcrição —, o Whisper entrega exatamente isso, sem você pagar por recursos de que não precisa. Você não está subsidiando um motor de diarização, uma infraestrutura de streaming ou um sistema de vocabulário personalizado que nunca vai usar.
Prototipagem e Desenvolvimento
O Whisper é uma excelente escolha para construir e testar recursos de transcrição antes de se comprometer com um serviço mais rico em recursos (e mais caro). A API simples, o preço previsível e o guia de integração bem documentado facilitam colocar um protótipo funcional no ar rapidamente.
Estimando os Seus Custos Mensais
Para ajudar no seu orçamento, aqui estão alguns casos de uso comuns com custos mensais estimados usando a API Whisper.
| Caso de Uso | Volume Mensal | Custo Mensal |
|---|---|---|
| Jornalista freelancer transcrevendo entrevistas | 10 horas | $3.60 |
| Equipe pequena de podcast transcrevendo episódios | 20 horas | $7.20 |
| Equipe de pesquisa processando grupos focais | 50 horas | $18.00 |
| Agência de conteúdo transcrevendo mídia de clientes | 200 horas | $72.00 |
| Empresa processando gravações de chamadas | 1,000 horas | $360.00 |
| Digitalização de acervo de mídia em larga escala | 5,000 horas | $1,800.00 |
Esses custos cobrem apenas o uso da API Whisper. Se você precisa de processamento adicional, como diarização, formatação ou geração de legendas, considere o custo desses serviços adicionais ou avalie uma plataforma como o ConvertAudioToText, que reúne esses recursos em um só lugar.
Perguntas Frequentes
Existe um plano gratuito para a API Whisper da OpenAI?
Não. A OpenAI não oferece plano gratuito para a API Whisper. Cada minuto de áudio processado é cobrado a $0.006. Contas novas da OpenAI às vezes recebem uma pequena quantidade de créditos gratuitos de API que podem ser usados no Whisper, mas trata-se de um crédito introdutório único, não de um plano gratuito contínuo. Se você precisa de transcrição gratuita, o modelo open source Whisper pode ser hospedado por conta própria sem custo de software, embora você precise fornecer a sua própria infraestrutura de GPU.
Como o preço da API Whisper se compara à contratação de transcritores humanos?
Serviços de transcrição humana normalmente cobram entre $1.00 e $3.00 por minuto de áudio para prazos padrão, com tarifas urgentes mais altas. A $0.006 por minuto, a API Whisper é aproximadamente 150 a 500 vezes mais barata que a transcrição humana. No entanto, transcritores humanos ainda entregam maior precisão em áudios difíceis, incluindo gravações com sotaques fortes, falantes se sobrepondo ou ruído de fundo significativo. Para áudio limpo, com um único falante, a precisão do Whisper é competitiva com a transcrição humana por uma fração do custo.
Posso usar o Whisper para transcrição em tempo real de reuniões ao vivo?
Não. A API Whisper só suporta processamento em lote. Você precisa enviar um arquivo de áudio completo e esperar a transcrição integral ser retornada. Não há endpoint de streaming, nem suporte a WebSocket, nem forma de receber resultados parciais enquanto o áudio está sendo gravado. Para transcrição de reuniões em tempo real, você precisará de um serviço que suporte streaming, como Deepgram, Google Cloud Speech-to-Text ou AssemblyAI.
A OpenAI oferece descontos por volume para clientes de alto uso da API Whisper?
No início de 2026, a OpenAI não oferece descontos por volume listados publicamente para a API Whisper. A tarifa de $0.006 por minuto é a mesma, seja você processando uma hora ou dez mil horas por mês. Clientes corporativos com volumes muito altos podem conseguir negociar preços personalizados entrando em contato diretamente com a equipe de vendas da OpenAI, mas não há uma estrutura de desconto self-service.
O que acontece se o meu arquivo de áudio exceder o limite de 25MB?
A API rejeitará a requisição com um erro. Você precisa reduzir o tamanho do arquivo antes de enviá-lo. As abordagens mais eficazes são comprimir o áudio para um formato MP3 de taxa de bits mais baixa, extrair o áudio de arquivos de vídeo para eliminar os dados de vídeo, ou dividir gravações longas em partes menores. A maioria das implementações em produção automatiza essa etapa de pré-processamento para que os usuários finais nunca encontrem o limite diretamente.
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

AWS Transcribe Pricing 2026: $0.024/min Entry, $0.0078 at Scale
AWS Transcribe pricing 2026: Standard starts at $0.024/min and drops to $0.0078/min above 5M minutes/month. Medical is $0.075/min. Free 60 min/month for first 12 months. When AWS beats Deepgram and when it doesn't.

Best Speech-to-Text APIs in 2026 (Real Prices)
A current, honestly-priced comparison of the best speech-to-text APIs in 2026: Deepgram, AssemblyAI, OpenAI, Google, AWS, Rev, Speechmatics, and Cloudflare. Real per-minute and per-hour prices from ea