Formatos de Áudio Suportados: A Tabela de Compatibilidade
transcriçãoformatos de áudiotécnico

Formatos de Áudio Suportados: A Tabela de Compatibilidade

BMMamane B. MoussaApril 14, 2026Updated July 2, 202614 min read

Summarize this article with:

A Tabela de Compatibilidade

Toda ferramenta de transcrição importante aceita MP3, WAV, M4A e MP4. As diferenças aparecem nos formatos menos comuns, nos limites de tamanho de arquivo e nas restrições de codec. Use a tabela abaixo para conferir seu formato antes de enviar, e depois leia as seções seguintes para entender os casos extremos que causam falhas de verdade.

FormatoTipoCATTOtter.aiTurboScribeDescriptRev.comTrintFirefliesHappy ScribeAWS TranscribeOpenAI Whisper API
MP3ÁudioSimSimSimSimSimSimSimSimSimSim
WAVÁudioSimSimSimSimSimSimSimSimSimSim
M4AÁudioSimSimSimSimSimSimSimSimNão*Sim
FLACÁudioSimNãoSimSimSimNãoNãoSimSimNão
AACÁudioSimNãoSimSimSimSimNãoSimNãoNão
OGGÁudioSimSimSimNãoNãoNãoNãoSimSimNão
OpusÁudioSimNãoSimNãoNãoNãoNãoSimSim (via OGG/WebM)Não
WMAÁudioSimSimSimNãoNãoSimNãoSimNãoNão
AIFFÁudioNãoNãoSimSimNãoNãoNãoSimNãoNão
MP4VídeoSimSimSimSimSimSimSimSimSimSim
MOVVídeoSimSimSimSimSimSimNãoSimNãoNão
AVIVídeoSimSimSimNãoNãoSimNãoSimNãoNão
MKVVídeoSimSimSimNãoNãoNãoNãoSimNãoNão
WebMVídeoSimNãoSimNãoNãoNãoSimSimSimSim

*O AWS Transcribe batch suporta contêiner MP4 (que pode carregar áudio AAC), mas não arquivos M4A avulsos por nome, conforme a documentação deles. Verifique seu caso de uso específico.

Verificado em julho de 2026. Fontes listadas no final.

Limites de Tamanho de Arquivo e Duração

É aqui que as pessoas se surpreendem. Suporte a formato importa menos do que se o seu arquivo cabe fisicamente no limite de upload do serviço.

ServiçoLimite de Tamanho de ArquivoLimite de DuraçãoObservações
ConvertAudioToText100 MBSem limite rígidoCota baseada em minutos varia por plano
Otter.ai5 GBSem limite declarado3 importações grátis por vida; 10/mês no Pro
TurboScribe5 GB10 horasAté 50 arquivos de uma vez no Unlimited
Descript50 GB por projeto15 horas para transcrição automática3+ canais de áudio reduzidos para estéreo
Rev.com2 GB (upload via API), 5 TB (URL)17 horasTranscrição jurídica: 20 GB no total
Trint3 GB (recomendado)3 horas (recomendado)Arquivos maiores são aceitos, mas com risco de erros
Fireflies200 MB150 minutosPlano grátis limitado a 100 MB
Happy ScribeSem limite declaradoSem limite declarado31 formatos de áudio + 16 de vídeo
AWS Transcribe2 GB4 horasArquivos precisam estar no S3 para jobs em lote
OpenAI Whisper API25 MBSem limite declaradoAfeta mais o WAV: um WAV de 25 MB equivale a cerca de 25 minutos de áudio
Deepgram (API)2 GBSem limite declarado100+ formatos; extração de áudio de vídeo
AssemblyAI (API)2.2 GB (upload), 5 GB (URL)10 horasRecomenda enviar no formato nativo

O limite de 25 MB da OpenAI Whisper API é a fonte mais comum de confusão. Uma entrevista de 2 horas em WAV normalmente passa de 1 GB. O limite é sobre tamanho de arquivo, não duração, então um MP3 de 2 horas a 96 kbps (cerca de 86 MB) também falha. A solução é comprimir para um bitrate menor ou usar um serviço que lide com o tamanho do seu arquivo.

Ferramenta de upload de áudio no ConvertAudioToText
Ferramenta de upload de áudio no ConvertAudioToText
O uploader do ConvertAudioToText aceita MP3, WAV, M4A, FLAC, AAC, OGG, Opus, WMA e todos os principais containers de vídeo. O limite de 100 MB por arquivo vale para uploads; jobs via URL (YouTube, Vimeo, links diretos) não estão sujeitos a esse limite.

Formatos de Áudio: O Que Cada Um Realmente Significa

MP3

MP3 é o padrão seguro. É aceito universalmente, é leve e, a partir de 128 kbps, não há perda mensurável de precisão em comparação com WAV. Abaixo de 64 kbps, os artefatos de compressão começam a degradar a clareza da fala. Gravações antigas de caixa postal a 32 kbps são as maiores vilãs.

Tamanhos práticos de arquivo: cerca de 1 MB por minuto a 128 kbps. Uma gravação de 2 horas tem aproximadamente 115 MB, o que passa do limite da API do Whisper, mas cabe em qualquer outro lugar.

WAV

WAV é sem perdas, o que importa para arquivamento, não para precisão de transcrição. Um WAV e um MP3 a 128 kbps da mesma gravação de fala produzem resultados de transcrição praticamente idênticos em qualquer modelo moderno de IA. A diferença real está no tamanho do arquivo: WAV ocupa cerca de 10 MB por minuto em qualidade de CD (44,1 kHz, estéreo de 16 bits).

Se você está batendo no limite de tamanho de arquivo, converta para MP3 antes de enviar. Você não vai perder nenhuma precisão.

M4A

O Voice Memos do iPhone exporta como M4A. Ele usa compressão AAC dentro de um contêiner MP4, que é mais eficiente que MP3. Os arquivos são um pouco menores que MP3s de qualidade equivalente, e todas as principais ferramentas de transcrição para consumidores suportam esse formato.

O AWS Transcribe não lista M4A como formato suportado na documentação de lote; se você usa a API da AWS diretamente, converta para MP3 ou WAV antes. Ferramentas para consumidores (CATT, TurboScribe, Otter, Descript, Rev) lidam com ele nativamente.

FLAC

FLAC é compressão sem perdas. Os arquivos ficam de 50 a 70 por cento menores que WAV, preservando cada bit do áudio original. Para transcrição, não oferece vantagem de precisão sobre um MP3 bem codificado, mas é útil quando você precisa arquivar o original e enviar um único arquivo.

Nem todos os serviços aceitam: Otter.ai, Fireflies e Trint não suportam FLAC. Verifique antes de enviar.

OGG / Opus

OGG Vorbis e Opus são formatos open-source comuns em gravações de Android e aplicativos web. Opus, em particular, é usado em WebRTC (gravações de navegador, chamadas de voz, exportações do Discord). O suporte é irregular no nível do consumidor: Descript, Rev e Fireflies não suportam OGG diretamente. AWS Transcribe e Deepgram lidam com ambos por meio de seus respectivos containers.

Se sua fonte é uma gravação de Android em OGG, converta para MP3 primeiro para máxima compatibilidade.

WMA

O Windows Media Audio está desaparecendo do uso em produção, mas ainda aparece em exportações antigas do Voice Recorder do Windows e em gravações legadas de call centers. TurboScribe, Otter.ai e Trint aceitam; Descript, Fireflies e Rev não.

AIFF

AIFF é o formato não comprimido da Apple, geralmente produzido por GarageBand e Pro Tools. Os tamanhos de arquivo são semelhantes aos do WAV. Apenas TurboScribe e Descript aceitam AIFF entre os serviços desta tabela; se seu DAW exporta AIFF, verifique o serviço de destino antes de enviar.

Formatos de Vídeo e Extração de Áudio

Todos os serviços desta tabela extraem a trilha de áudio do vídeo automaticamente. Você não precisa pré-processar um arquivo de vídeo antes de enviar.

MP4 funciona em todos os lugares. MOV funciona na maioria dos serviços de consumo, mas não no AWS Transcribe nem no Fireflies. MKV tem suporte limitado (CATT, Otter, TurboScribe, Happy Scribe). Se sua fonte é MKV ou AVI e você está usando um serviço que não suporta, extraia o áudio para MP3 com FFmpeg: ffmpeg -i input.mkv -vn -ab 192k output.mp3.

Para mais detalhes sobre a saída de legendas de arquivos de vídeo, veja SRT vs VTT vs TTML: qual formato de legenda usar.

Quando o Formato Afeta a Precisão (e Quando Não Afeta)

Em quase todos os casos do mundo real, o formato não afeta a precisão. Modelos modernos de transcrição por IA processam as formas de onda de áudio após a decodificação, então o formato do container e o codec de compressão não fazem diferença significativa em configurações normais de qualidade.

Os três casos em que o formato realmente importa:

MP3 de bitrate muito baixo (abaixo de 64 kbps). Artefatos de compressão em áudio abaixo de 64 kbps podem prejudicar a inteligibilidade da fala, tanto para ouvintes humanos quanto para modelos de IA. Isso aparece em arquivos de podcasts muito antigos, exportações de caixa postal comprimidas e streams de áudio agressivamente compactados.

Reencodificação de múltiplas gerações. Converter WAV para MP3, depois para OGG e de volta para MP3 acumula perdas de compressão e degrada a qualidade a cada etapa. Sempre que possível, trabalhe a partir do arquivo de origem original.

Arquivos corrompidos ou truncados. Um arquivo baixado parcialmente ou uma gravação interrompida pode passar na validação de formato, mas falhar no meio da transcrição. Baixe novamente ou reexporte a fonte.

Para um olhar mais aprofundado sobre como taxas de amostragem e número de canais afetam a precisão no nível da API, veja o post explicação sobre precisão de transcrição.

Peculiaridades de Codec que Vale a Pena Conhecer

Alguns detalhes específicos que causam falhas silenciosas:

AWS Transcribe exige codec Opus para OGG. O serviço aceita contêineres OGG e WebM, mas apenas com áudio Opus dentro. Um arquivo OGG Vorbis vai falhar. Isso está documentado nos requisitos de entrada deles.

Google Cloud STT exige declaração de encoding. Diferente da Deepgram, a API do Google exige que você especifique o encoding do áudio na sua requisição. Enviar um MP3 sem declarar MP3 no campo de encoding vai falhar. A API V2 deles consegue detectar alguns formatos automaticamente, mas a V1 não.

Áudio multicanal (mais de 2 canais). O AWS Transcribe não suporta áudio com mais de dois canais. O Descript reduz automaticamente arquivos com 3 ou mais canais para estéreo na importação. Se você grava em multicanal (gravador de conferência de 4 canais, microfone ambissônico), faça o downmix para estéreo antes de enviar para qualquer serviço baseado em API.

Encoding PCM dentro de WAV. A maioria dos arquivos WAV usa encoding PCM e funciona em qualquer lugar. Arquivos WAV com encodings incomuns (GSM, ADPCM) podem falhar em alguns serviços, mesmo que o contêiner seja reconhecido. O ffprobe do FFmpeg pode te dizer qual encoding está dentro do seu arquivo WAV.

Para uma visão mais ampla sobre a escolha do formato ao longo do pipeline, da gravação ao arquivamento, veja formatos de arquivo de transcrição explicados e WAV vs MP3 para transcrição.

Convertendo para um Formato Suportado

Se você tem um arquivo em um formato não suportado ou precisa reduzir o tamanho antes do upload, a ferramenta de áudio para texto aceita o arquivo diretamente e faz a conversão internamente. Para fluxos de trabalho programáticos, o comando de uma linha abaixo cobre a maioria dos casos:

ffmpeg -i input.anyformat -vn -ar 16000 -ac 1 -ab 64k output.mp3

Isso extrai o áudio, define uma taxa de amostragem de 16 kHz (suficiente para fala), converte para mono e codifica a 64 kbps, o que reduz um WAV de 1 hora de cerca de 600 MB para aproximadamente 30 MB, sem perda de precisão na transcrição.

Se você quiser manter o original e só precisar de uma cópia menor para o upload, o mesmo comando funciona: -ab 128k dá mais margem e ainda fica bem abaixo de qualquer limite do serviço.

Se você só precisa de uma transcrição limpa, sem bot de reunião ou editor de vídeo, o ConvertAudioToText aceita todos os formatos desta tabela (exceto AIFF) e processa a maioria dos arquivos em menos de um minuto.

Perguntas Frequentes

Qual é o melhor formato de áudio para precisão na transcrição?

Qualquer formato sem perdas (WAV, FLAC) ou formato com perdas de alta qualidade (MP3 a 128 kbps ou mais, M4A em qualidade padrão) vai produzir a mesma precisão de transcrição em qualquer modelo moderno de IA. O ambiente de gravação e a qualidade do microfone importam muito mais do que o formato do áudio. Guarde WAV ou FLAC para arquivamento; faça upload de MP3 para manter os tamanhos de arquivo gerenciáveis.

Por que a API do OpenAI Whisper rejeita meu arquivo quando outros serviços aceitam?

A API do Whisper impõe um limite de 25 MB por arquivo, bem menor que o de outros serviços. Um MP3 de 1 hora a 128 kbps tem cerca de 57 MB e vai falhar. A solução é comprimir para uma taxa de bits menor (64 kbps já basta para fala), dividir o arquivo em partes ou usar um serviço sem esse limite de 25 MB.

Posso enviar um arquivo de vídeo diretamente ou preciso extrair o áudio antes?

Você pode enviar vídeo direto para todos os serviços desta tabela. Eles extraem a trilha de áudio automaticamente. MP4 funciona em todos; MOV e MKV têm suporte irregular em serviços via API, como o AWS Transcribe. Se você usa uma API diretamente e seu formato de vídeo não está na lista de suportados, extraia o áudio com o FFmpeg antes.

Gravações multicanal (som surround) funcionam?

A maioria das ferramentas de transcrição faz downmix para estéreo automaticamente ou não suporta mais de dois canais de forma explícita. O AWS Transcribe documenta um limite rígido de dois canais. O Descript faz downmix na importação. Para resultados confiáveis, converta qualquer gravação multicanal para mono ou estéreo antes de enviar.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles