
Formatos de arquivo para transcrição explicados: um guia de entrada para 2026
Summarize this article with:
As ferramentas de transcrição de áudio e vídeo aceitam uma ampla variedade de formatos extraindo primeiro a faixa de áudio, então a sua escolha de contêiner importa menos do que você imagina. Para gravações de fala, MP3 em 192 kbps mono é o padrão prático: pequeno, universal e preciso o suficiente. WAV e FLAC preservam cada amostra, mas raramente melhoram a qualidade da transcrição em gravações limpas. Quando você não tem escolha de formato, um único comando FFmpeg pode converter quase qualquer coisa em um MP3 mono limpo de 16 kHz antes do upload.
O formato do seu arquivo de áudio quase nunca é o motivo de uma transcrição sair errada. A maioria das ferramentas de transcrição aceita MP3, WAV, M4A, FLAC, OGG, MP4, MOV e mais uma dúzia de outros. Este post mapeia cada formato, explica quando a escolha realmente importa e diz o que fazer nos casos complicados.
Para uma tabela rápida de compatibilidade sim/não entre ferramentas, consulte a referência de formatos de áudio suportados para transcrição. O lado da saída — SRT, VTT e TXT — está coberto em formatos de exportação de transcrição explicados.
Áudio vs. vídeo: o que as ferramentas de transcrição realmente processam
Quando você envia um arquivo de vídeo, a ferramenta de transcrição extrai primeiro a faixa de áudio (usando FFmpeg ou um equivalente) e depois roda o modelo de fala nesse áudio. Os quadros de vídeo são ignorados por completo.
Um MP4 de 1 GB e um MP3 de 50 MB carregando o mesmo áudio produzem transcrições idênticas. O MP4 só demora mais para enviar. Para trabalho puramente de transcrição, formatos somente de áudio são sempre a escolha mais eficiente. A exceção é o trabalho com legendas, em que você quer manter o arquivo de vídeo como referência.
Os formatos de áudio
MP3
O padrão prático para quase tudo. Suporte universal, arquivos pequenos, nenhuma surpresa de compatibilidade.
- Compressão: Com perdas. 128 kbps é aceitável; 192 kbps é o ponto ideal de precisão para fala; 320 kbps é o teto prático.
- Taxa de amostragem: Geralmente 44,1 kHz. Os modelos de transcrição reamostram internamente para 16 kHz.
- Tamanho do arquivo: Arquivo de 60 minutos em 192 kbps mono = cerca de 86 MB.
- Melhor para: Podcasts, memos de voz, entrevistas, qualquer gravação somente de fala em que você queira arquivos pequenos.
O MP3 remove conteúdo de alta frequência durante a codificação. Em 192 kbps ou acima, a perda é desprezível para transcrição. Em 64 kbps ou abaixo, as fricativas ("f", "s", "sh") ficam abafadas e a precisão cai visivelmente.
WAV
Áudio PCM não comprimido. Cada amostra é armazenada explicitamente.
- Compressão: Nenhuma.
- Taxa de amostragem: De 8 kHz a 192 kHz. 16 kHz é o padrão dos modelos de fala.
- Tamanho do arquivo: Arquivo mono de 60 minutos em 16 kHz = cerca de 110 MB. A mesma gravação em 44,1 kHz estéreo chega a cerca de 600 MB.
- Melhor para: Gravações master que você planeja editar, trabalho profissional de radiodifusão ou situações em que você não quer etapas com perdas no fluxo.
WAV costuma ser exagero para upload. Se você está numa conexão lenta ou perto de um limite de tamanho, converter para um MP3 de 192 kbps praticamente não perde precisão. Para uma comparação detalhada, veja WAV vs. MP3 para transcrição.
M4A
O formato padrão dos dispositivos Apple. Às vezes descrito como "AAC dentro de um contêiner MP4".
- Compressão: Com perdas (codec AAC). Um pouco mais eficiente que o MP3 no mesmo bitrate.
- Taxa de amostragem: Geralmente 44,1 kHz.
- Tamanho do arquivo: Arquivo de 60 minutos em 128 kbps = cerca de 58 MB.
- Melhor para: Memos de voz do iPhone, exportações do GarageBand, qualquer áudio de origem Apple.
M4A e AAC são quase idênticos: M4A é o contêiner, AAC é o codec dentro dele. A maioria das ferramentas trata os dois de forma intercambiável. Não há motivo para converter um memo de voz do iPhone antes de enviar.
FLAC
Compressão sem perdas. Mesma qualidade de áudio do WAV, arquivo menor.
- Compressão: Sem perdas (nenhum dado de áudio é removido).
- Taxa de amostragem: Tipicamente 44,1 kHz ou 48 kHz.
- Tamanho do arquivo: Arquivo estéreo de 60 minutos = cerca de 300 MB.
- Melhor para: Fluxos de arquivamento em que você não pode abrir mão de nenhuma etapa com perdas e quer arquivos menores que o WAV.
FLAC raramente é o formato certo para upload de transcrição. O ganho de precisão sobre um MP3 limpo de 192 kbps é essencialmente zero para fala, e os arquivos continuam muito maiores que os do MP3. Ele é mais útil em pipelines de audiófilos e de arquivamento, onde o áudio será processado ainda mais.
OGG / Opus
Formatos open source. O Opus em particular é o que o WhatsApp, o Discord e a maioria dos apps WebRTC usam para mensagens de voz.
- Compressão: Com perdas. O Opus é altamente eficiente em bitrates baixos, frequentemente superando MP3 e AAC.
- Tamanho do arquivo: Arquivo de 60 minutos em Opus de 64 kbps = cerca de 29 MB.
- Melhor para: Mensagens de voz do WhatsApp, gravações WebRTC, ferramentas open source.
OGG é um contêiner (como o MP4); Vorbis e Opus são codecs que podem existir dentro dele. Em 64 kbps ou acima, o Opus preserva bem a clareza da fala.
AAC
O codec puro, geralmente entregue dentro de um contêiner M4A, mas ocasionalmente como um arquivo .aac independente.
- Compressão: Com perdas. Um pouco mais eficiente que o MP3 no mesmo bitrate.
- Tamanho do arquivo: Similar ao M4A.
- Melhor para: Conteúdo do Apple Podcasts, iTunes Store ou fluxos modernos de radiodifusão.
AAC e M4A são processados de forma idêntica pelas ferramentas de transcrição. Você raramente precisará distingui-los na prática.
WMA
Windows Media Audio. Incomum em 2026, mas ainda presente em sistemas antigos.
- Compressão: Com perdas (codec proprietário da Microsoft).
- Melhor para: Gravações antigas do Windows. Converta para MP3 se estiver processando arquivos em lote.
WMA é aceito pela maioria das ferramentas modernas, mas vale a pena converter para MP3 primeiro se você tem muitos arquivos: isso evita casos extremos de decodificação de codec mais adiante.
Os formatos de vídeo
MP4
O contêiner de vídeo dominante. O áudio interno geralmente é AAC; o vídeo normalmente é H.264 ou H.265.
- Melhor para: Downloads do YouTube, gravações de tela, vídeo de celular, exportações do Loom.
- Qualidade de áudio: Geralmente AAC de 128 a 192 kbps, que transcreve bem.
MOV
O contêiner de vídeo da Apple. Funcionalmente similar ao MP4.
- Melhor para: Gravações do QuickTime, vídeo do iPhone, ScreenFlow, exportações do Final Cut Pro.
WebM
Formato de vídeo open source. Comum em gravações do Google Meet e ferramentas de gravação baseadas em navegador.
- Áudio: Geralmente Opus.
- Melhor para: Gravações do Google Meet, ferramentas de captura na web, downloads da Twitch.
MKV
O contêiner Matroska. Flexível, frequentemente usado para vídeos baixados em alta qualidade.
- Melhor para: Gravações de conferências, palestras baixadas, vídeo em alta definição com múltiplas faixas de áudio.
AVI, WMV, FLV
Formatos mais antigos que você ainda vai encontrar.
- AVI: Vídeo antigo do Windows. Aceito pela maioria das ferramentas; converta para MP4 se tiver escolha.
- WMV: Windows Media antigo. Mesma recomendação.
- FLV: Vídeo Flash antigo. Raramente visto depois de 2020, mas algumas gravações mais antigas ainda o utilizam.
Para qualquer um deles, converter para MP4 antes de enviar gera arquivos menores e evita qualquer decodificação de codec exótica.
Quando a escolha do formato realmente importa

Na maior parte do tempo, a escolha do formato não importa: qualquer ferramenta moderna lida com MP3, WAV, M4A e MP4 sem reclamações. Os casos em que ela importa:
Arquivos com perdas em bitrate baixo. Um MP3 em 32 ou 48 kbps, ou uma gravação de celular fortemente comprimida, introduz distorção suficiente nas consoantes para que até o melhor modelo sofra. Se você puder regravar em um bitrate mais alto, faça isso antes de transcrever.
Converter de com perdas para sem perdas. Se você pega um MP3 e converte para WAV, obtém um arquivo WAV grande com a mesma perda de dados do MP3 original. A conversão é permanente; não há como recuperar o áudio removido. A transcrição será a mesma do MP3 original.
Arquivos protegidos por DRM. Compras do iTunes anteriores a 2009 e alguns arquivos de audiobook trazem DRM que impede a extração. Transcrevê-los exige remover o DRM primeiro, o que pode configurar violação de licença dependendo do seu caso de uso.
Casos extremos de bitrate variável. Alguns arquivos codificados em VBR têm cabeçalhos malformados que confundem os decodificadores. Recodificar para bitrate constante (CBR) resolve isso de forma confiável.
Som surround multicanal. Uma faixa de áudio 5.1 de uma gravação de filme é incomum como entrada de transcrição. A maioria das ferramentas faz downmix para mono automaticamente; algumas recusam o arquivo.
Mono vs. estéreo
Mono reduz o tamanho do arquivo pela metade sem custo de precisão para conteúdo de um único falante. A fala é inerentemente mono: a sua voz é o mesmo sinal nos dois canais de uma gravação estéreo.
A única exceção é a gravação de entrevista em faixas separadas, em que um falante é posicionado no canal esquerdo e outro no direito. Algumas ferramentas conseguem usar essa separação de canais para diarização de falantes, rotulando quem fala por canal sem precisar de agrupamento acústico. Se o seu gravador suporta faixas separadas e a sua ferramenta de transcrição suporta diarização baseada em canais, vale a pena ativar. Para todo o resto, grave em mono.
Taxa de amostragem
O padrão dos modelos de fala é 16 kHz. Essa taxa captura toda a faixa de frequência da voz humana (que fica abaixo de 8 kHz) com folga. Taxas mais altas (44,1 kHz do áudio de CD, 48 kHz da radiodifusão, 96 kHz de equipamentos de estúdio) aumentam o tamanho do arquivo sem nenhum benefício de precisão para reconhecimento de fala.
Praticamente todas as ferramentas de transcrição reamostram internamente para 16 kHz. Enviar áudio de 44,1 kHz significa apenas um upload maior pelo mesmo resultado. Numa conexão lenta, reamostrar antes de enviar economiza tempo:
ffmpeg -i input.wav -ac 1 -ar 16000 output_16k.wav
Tamanho do arquivo e os limites práticos
Ferramentas de transcrição impõem limite de tamanho ou duração de arquivo, com planos gratuitos mais restritivos que os pagos. O padrão é consistente entre as ferramentas: planos gratuitos limitam seja por minutos totais por mês, seja por duração por arquivo; planos pagos elevam esses limites consideravelmente ou os removem.
Se o seu arquivo esbarrar em um limite, suas opções são:
- Converter para um formato mais eficiente. Um WAV de 600 MB vira cerca de 50 MB como MP3 de 192 kbps, muitas vezes o bastante para passar de um limite de tamanho sem nenhum custo de precisão.
- Dividir o arquivo em uma pausa natural. Audacity e FFmpeg dão conta disso.
- Usar upload via URL, se disponível. Algumas ferramentas, incluindo o ConvertAudioToText, aceitam uma URL e baixam o arquivo no servidor, contornando completamente a sua largura de banda de upload.
A válvula de escape do FFmpeg
Se você estiver preso a um formato problemático, converter para um MP3 mono limpo via FFmpeg resolve quase todos os casos extremos:
ffmpeg -i input.weird-format -ac 1 -ar 16000 -b:a 192k output.mp3
Esse comando produz um MP3 mono, de 16 kHz e 192 kbps, a partir de qualquer coisa que o FFmpeg consiga ler (ou seja, quase tudo).
Mapa de formatos: referência rápida
| Formato | Tipo | Compressão | Uso típico |
|---|---|---|---|
| MP3 | Áudio | Com perdas | Padrão para fala |
| WAV | Áudio | Nenhuma | Gravações master |
| M4A | Áudio | Com perdas (AAC) | Dispositivos Apple |
| FLAC | Áudio | Sem perdas | Arquivamento |
| OGG / Opus | Áudio | Com perdas | WhatsApp, WebRTC |
| AAC | Áudio | Com perdas | Apple Podcasts, radiodifusão |
| WMA | Áudio | Com perdas | Windows antigo |
| MP4 | Vídeo | Com perdas | Vídeo padrão |
| MOV | Vídeo | Com perdas | Vídeo Apple |
| WebM | Vídeo | Com perdas | Google Meet, ferramentas de navegador |
| MKV | Vídeo | Variável | Downloads em alta qualidade |
| AVI / WMV / FLV | Vídeo | Com perdas | Legado |
Minha leitura: a coisa mais útil desta tabela é perceber que todas as linhas de vídeo se resumem a 'extração de áudio primeiro'. Depois que você internaliza isso, a preocupação com a escolha do contêiner para arquivos de vídeo praticamente desaparece.
Escolhendo um formato quando você tem escolha
Se você está gravando áudio novo especificamente para transcrição:
- MP3 em 192 kbps mono para conteúdo somente de fala. Pequeno, universal, preciso.
- M4A em AAC de 128 kbps se você está em um dispositivo Apple e quer o formato nativo.
- WAV em 16 kHz mono se você tem espaço de armazenamento e não quer etapas com perdas no fluxo.
Para trabalho com vídeo, MP4 com vídeo H.264 e áudio AAC em 128 kbps ou acima é o padrão seguro.
Perguntas frequentes
A escolha do formato realmente afeta a precisão da transcrição?
Raramente na prática. A qualidade da gravação por baixo do formato importa muito mais do que o contêiner ou o codec. Um MP3 limpo e bem gravado em 192 kbps produzirá uma transcrição praticamente idêntica à de um WAV do mesmo áudio. As exceções são bitrates muito baixos (abaixo de 64 kbps), áudio de celular fortemente comprimido e arquivos com cabeçalhos corrompidos.
Devo converter meu arquivo para WAV antes de enviar?
Somente se a sua origem já for WAV ou sem perdas. Converter um formato com perdas como MP3 ou M4A para WAV não restaura nenhum dado de áudio: as decisões originais de compressão são permanentes. A conversão apenas infla o tamanho do arquivo sem nenhum benefício de precisão.
Qual é o melhor formato para transcrever um memo de voz do iPhone?
M4A, que é o formato nativo usado pelos iPhones. Não há motivo para convertê-lo antes. O M4A usa o codec AAC e é aceito diretamente por todas as ferramentas de transcrição modernas.
Por que os modelos de transcrição preferem áudio de 16 kHz?
A fala humana fica abaixo de 8 kHz. Uma taxa de amostragem de 16 kHz captura toda a faixa de frequência da voz sem perda para fins de reconhecimento de fala. Taxas mais altas (44,1 kHz, 48 kHz) contêm frequências que o modelo ignora, então enviá-las significa apenas um upload mais lento sem melhoria na transcrição.
O que devo fazer se meu arquivo for grande demais para enviar?
Três opções: converter para um formato mais eficiente (um WAV de 600 MB vira cerca de 50 MB como MP3 de 192 kbps), dividir o arquivo em uma pausa natural usando Audacity ou FFmpeg, ou verificar se a sua ferramenta de transcrição aceita uma URL para que ela possa baixar o arquivo no servidor e contornar completamente a sua largura de banda de upload.
Fontes
- AssemblyAI: melhores formatos de arquivo de áudio para conversão de fala em texto - verificado em 2026-07-02
- Página de preços do ConvertAudioToText - verificado em 2026-07-02
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.