Como converter WAV em texto: guia de formatos e dicas de precisão
transcriçãowaváudio

Como converter WAV em texto: guia de formatos e dicas de precisão

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Arquivos WAV armazenam áudio PCM bruto sem compressão com perdas, o que os torna a entrada mais limpa possível para motores de transcrição de fala. Em 44,1 kHz / 16 bits estéreo, um minuto de WAV ocupa cerca de 10 MB, então uma gravação de 60 minutos chega perto de 600 MB. Para a maioria dos envios, converter primeiro para um WAV mono de 16 kHz (cerca de 110 MB/hora) ou para um MP3 de alta taxa de bits não custa nada em precisão e reduz drasticamente o tempo de envio. Para gravações jurídicas, de arquivamento ou de qualidade limítrofe, enviar o WAV diretamente é a decisão certa.

O WAV é a entrada com precisão ideal para transcrição de fala em texto porque é áudio PCM bruto e não comprimido. Não há nada para descompactar, sem artefatos de codecs com perdas e sem suposições de reconstrução antes de o áudio chegar ao modelo. Se você tem um WAV de um gravador de estúdio, de um equipamento de campo de broadcast ou de um sistema de captura de aulas, está partindo do melhor material-fonte possível.

Envios de WAV funcionam diretamente; o tamanho é a única consideração
Envios de WAV funcionam diretamente; o tamanho é a única consideração

Este post aborda a mecânica dos formatos que importa para a transcrição, e não apenas as etapas de upload.

Qual é o tamanho de arquivo de uma gravação WAV de 60 minutos?

O WAV armazena áudio como PCM linear: cada amostra é escrita como está, sem compressão. O cálculo é simples e os números são grandes.

Em 44,1 kHz / 16 bits estéreo (qualidade CD, comum em gravadores domésticos e mesas de podcast):

DuraçãoTamanho do WAVMP3 de 192 kbpsWAV mono de 16 kHz
1 minuto~10 MB~1,4 MB~1,9 MB
30 minutos~300 MB~43 MB~57 MB
60 minutos~600 MB~86 MB~110 MB
3 horas~1,8 GB~259 MB~330 MB

Em 48 kHz / 24 bits estéreo (padrão em gravadores de campo de broadcast como a linha Zoom F e o RodeCaster Pro II), os números são novamente cerca de 65% maiores; uma gravação de 60 minutos chega a cerca de 990 MB.

Esses tamanhos determinam se você pode enviar diretamente ou precisa converter primeiro. Eles também explicam por que um WAV de conferência de 3 horas pode travar o upload no navegador por 20 minutos em uma conexão doméstica típica.

Qual é a diferença entre WAV, BWF e polyWAV?

WAV é um formato de contêiner (especificação RIFF/WAVE), não um codec. A maioria dos arquivos WAV contém áudio PCM linear não comprimido, mas o contêiner pode armazenar outras codificações também. Três variantes que você realmente encontrará ao transcrever:

PCM WAV é o padrão. Amostras de áudio armazenadas como inteiros de ponto fixo: 16 bits (doméstico), 24 bits (profissional) ou inteiro de 32 bits (raro). Todos os serviços de transcrição modernos lidam com esses formatos nativamente. A grande maioria dos WAVs que você encontrará é PCM de 16 ou 24 bits.

BWF (Broadcast Wave Format) é WAV mais um bloco de metadados BEXT que carrega timecode, dados de cena/take e IDs únicos de arquivo. É o formato padrão na maioria dos gravadores de campo de broadcast (Sound Devices, linha Zoom F, Tascam Portacapture no modo ENG). Para transcrição, o BWF é funcionalmente idêntico ao WAV simples; o bloco BEXT é ignorado pelos motores de transcrição.

PolyWAV é um BWF multicanal: um arquivo, várias trilhas, cada trilha em seu próprio canal. Um RodeCaster Pro grava um polyWAV de 14 canais (cada microfone mais a mixagem estéreo). Um Zoom F8n Pro pode gravar até 10 canais em um único polyWAV.

Esta é a maior pegadinha específica de formato para transcrição: a maioria dos serviços de transcrição que aceita WAV trata um polyWAV como um único fluxo de áudio mixado. Eles executam a diarização na mixagem, não por trilha. Para obter uma transcrição limpa por trilha, você precisa:

  1. Dividir o polyWAV em WAVs mono individuais primeiro (ffmpeg -i poly.wav -map 0:a:0 track1.wav -map 0:a:1 track2.wav ...) e depois enviar um por falante.
  2. Usar um serviço com suporte explícito a multicanal (o parâmetro multichannel=true da Deepgram processa cada canal como uma transcrição separada). Observe que multicanal e diarização de falantes são mutuamente exclusivos: você escolhe uma abordagem por requisição.

Para saber mais sobre quando usar separação de falantes baseada em canal versus baseada em diarização, veja diarização de falantes explicada.

Posso enviar um WAV float de 32 bits para ferramentas de transcrição?

Comum em ferramentas profissionais de produção (Pro Tools, Logic Pro, o formato interno do Audacity) e em gravadores de campo com modo "float de 32 bits" como o Zoom F8n Pro ou o Sound Devices MixPre-10 II. A vantagem é a folga dinâmica (headroom): o float de 32 bits captura áudio que sofreria clipping no hardware sem limitação rígida. A pegadinha para transcrição: o Google Cloud Speech-to-Text v1 rejeita WAV float de 32 bits, exigindo conversão antes do envio. Se um serviço de transcrição retornar um erro de codificação em um WAV, essa é a causa mais provável.

Converta antes de enviar:

ffmpeg -i input-float.wav -acodec pcm_s16le output-pcm.wav

A maioria dos serviços de transcrição modernos aceita WAV float de 32 bits sem problemas; a conversão só é necessária quando uma ferramenta rejeita o arquivo.

WAV de gravadores comuns: qual taxa de amostragem e profundidade de bits esperar

Diferentes dispositivos de gravação produzem especificações de WAV diferentes, e isso afeta o tamanho do envio:

Mesas de podcast (RodeCaster Pro II, Rodecaster Duo): 48 kHz / 24 bits, polyWAV para multitrilha. A mixagem estéreo é um WAV padrão de 2 canais.

Gravadores de campo profissionais (linha Zoom F, Sound Devices MixPre): até 192 kHz / float de 32 bits. Para transcrição, qualquer coisa acima de 16 kHz / 16 bits é enviar mais dados do que o modelo vai usar.

Câmeras DSLR e mirrorless (linha Canon R, linha Sony A7): PCM WAV ou BWF a 48 kHz / 16 bits, gravados no cartão interno ou em um gravador acoplado. Fonte comum para entrevistas filmadas na câmera.

Sistemas de captura de aulas (Echo360, Panopto): Frequentemente geram WAV a 44,1 kHz / 16 bits junto com o vídeo, ou incorporam o áudio no contêiner de vídeo. A trilha WAV, se disponível separadamente, é mais limpa de processar do que extrair de vídeo H.264.

Para fins de transcrição, o alvo de processamento interno do modelo é PCM de 16 bits mono a 16 kHz. Tudo acima disso é descartado internamente. Você está pagando banda de envio por dados que o motor não usa.

Devo converter WAV para MP3 antes de enviar se o arquivo for muito grande?

Se o seu WAV exceder o limite de upload de um serviço, converta para MP3 de 192 kbps e arquive o WAV original. Há quatro caminhos no total:

Caminho 1: Envie o WAV diretamente. Para arquivos abaixo do limite de upload do seu serviço, o envio direto é o caminho mais simples. Vá fazer outra coisa e volte depois. O tempo de envio é o fator dominante.

Caminho 2: Converta para WAV mono de 16 kHz (sem perdas da perspectiva do modelo). O motor de transcrição fará essa conversão internamente de qualquer forma. Faça-a localmente primeiro para cortar o tamanho do envio em cerca de 80%:

ffmpeg -i recording.wav -ac 1 -ar 16000 recording-16k-mono.wav

Um WAV estéreo de 60 minutos a 44,1 kHz cai de 600 MB para cerca de 110 MB. O modelo vê conteúdo idêntico.

Caminho 3: Converta para FLAC (sem perdas, menor). O FLAC comprime os mesmos dados PCM sem perdas, tipicamente para 40–60% do tamanho do WAV. Um WAV de 60 minutos com 300 MB vira aproximadamente 150–180 MB em FLAC.

ffmpeg -i recording.wav -acodec flac recording.flac

O FLAC vale a pena quando você quer preservar a fidelidade exata do áudio original, mas precisa de envios mais rápidos do que o WAV permite. Para saber mais sobre conversão de formatos de áudio para transcrição, veja como converter FLAC em texto.

Caminho 4: Converta para MP3 e arquive o WAV. O fluxo de trabalho mais prático para situações de alto volume. Envie um MP3 de 192 kbps (cerca de 1,4 MB/min) e mantenha o WAV como master de arquivamento.

ffmpeg -i recording.wav -acodec mp3 -ab 192k recording.mp3

A 192 kbps, a diferença de precisão em comparação com o WAV original é desprezível para fala em gravações limpas. Abaixo de 128 kbps, a compressão com perdas começa a corroer consoantes de alta frequência. Abaixo de 64 kbps, a precisão cai o suficiente para produzir erros sistemáticos em nomes incomuns e vocabulário técnico. Para uma comparação completa dos trade-offs de formato para reconhecimento de fala, veja WAV vs MP3 para transcrição.

Quando converter para MP3 primeiro realmente faz sentido? Quando o seu WAV excede um limite de upload. Um WAV longo a 48 kHz / 24 bits pode atingir os limites de tamanho de arquivo do serviço. Converter para MP3 a 192 kbps traz uma gravação de 5 horas de cerca de 5 GB para aproximadamente 700 MB, bem dentro do limite de qualquer serviço. Sempre arquive o WAV original antes de converter.

Como transcrever um arquivo WAV

A etapa de upload é propositalmente curta porque o conhecimento de formato é o ponto deste post.

  1. Escolha o caminho acima (WAV direto, WAV convertido para mono, FLAC ou MP3).
  2. Envie para o serviço de transcrição de sua escolha.
  3. Defina o idioma, o número de falantes e quaisquer dicas de vocabulário.
  4. Execute. Arquivos WAV são processados na mesma velocidade que MP3s de duração equivalente; o motor trabalha com a duração do áudio, não com o tamanho do arquivo.
  5. Exporte como TXT, SRT, VTT ou DOCX.

Se você só precisa de uma transcrição limpa sem bot de reunião ou ferramentas de edição pesadas, o ConvertAudioToText lida com WAV nativamente, suporta todo o caminho de downmix para 16 kHz no servidor e aceita uploads de vários gigabytes nos planos pagos.

Edições pré-transcrição que ajudam

Para arquivos WAV com problemas de áudio, uma passada curta de edição antes do envio compensa:

  • Redução de ruído: iZotope RX, Adobe Enhance Speech ou o filtro de redução de ruído do Audacity. Mais valioso em gravações de sala com zumbido de ar-condicionado ou gravações externas com vento.
  • Corte de silêncios: Corte o silêncio morto no início e no fim. Ajuda a diarização, que pode falhar em silêncios longos.
  • Normalização de loudness: Traga falantes baixos para um nível consistente. Problema comum em gravações de podcast com várias pessoas em que um microfone estava longe demais do falante.
  • Faixa dinâmica: A faixa dinâmica do WAV (96 dB para 16 bits, 144 dB para 24 bits) significa que passagens muito baixas, que comprimem mal em MP3, ainda são capturadas com clareza. Esta é a principal vantagem prática de arquivar em WAV.

Para gravações capturadas de forma limpa, pule completamente a passada de edição e apenas envie. O tempo de edição se acumula rápido, e os modelos de fala modernos lidam melhor com ruído moderado do que há três anos. Reserve a edição para gravações em que você consegue ouvir o problema claramente ao revisar.

O WAV é transcrito com mais precisão do que o MP3?

A principal vantagem de precisão do WAV é o que ele não tem: artefatos de codificação com perdas. Um WAV de 44,1 kHz e 16 bits carrega toda a faixa de frequência até cerca de 22 kHz, bem acima do corte de 8 kHz do áudio telefônico e acima da faixa de 4 kHz onde vive a maior parte do conteúdo de fala.

Na prática, a diferença de precisão entre WAV e um MP3 de 192 kbps da mesma gravação é desprezível para a maioria dos conteúdos de fala. A diferença cresce em dois cenários:

  • Qualidade de áudio limítrofe: salas barulhentas, microfones distantes, sotaques fortes. A codificação com perdas torna o áudio marginal mais difícil de recuperar.
  • Idiomas tonais ou vocabulário técnico: fonemas que dependem de estrutura espectral fina são melhor preservados em áudio não comprimido.

Para uma análise mais profunda de como o formato de áudio afeta a precisão da transcrição, veja precisão da transcrição explicada.

Perguntas frequentes

O WAV é transcrito com mais precisão do que o MP3?

Para uma mesma gravação, a diferença entre WAV e um MP3 de alta taxa de bits (192 kbps ou acima) é desprezível em áudio limpo. A diferença cresce com MP3s de menor qualidade: a 64 kbps você perde conteúdo suficiente de alta frequência para que a precisão caia visivelmente. Mantenha o WAV para gravações limítrofes ou necessidades de cadeia de custódia jurídica; use MP3 de 192 kbps para o trabalho do dia a dia.

Qual é o tamanho de arquivo de uma gravação WAV de 60 minutos?

Em 44,1 kHz / 16 bits estéreo (qualidade CD), um WAV de 60 minutos tem aproximadamente 600 MB. Em 48 kHz / 24 bits estéreo (comum em gravadores de campo), fica mais próximo de 1 GB. Converter para mono de 16 kHz antes do envio reduz a mesma hora de áudio para cerca de 110 MB, que é o que a maioria dos motores de transcrição processa internamente de qualquer forma.

Posso enviar um WAV float de 32 bits para ferramentas de transcrição?

A maioria dos serviços de transcrição modernos aceita WAV float de 32 bits, mas algumas integrações mais antigas e o Google Cloud Speech-to-Text v1 o rejeitam. Se uma ferramenta rejeitar seu arquivo, converta primeiro para PCM de 16 bits com o ffmpeg: ffmpeg -i input.wav -acodec pcm_s16le output.wav. O conteúdo do áudio é idêntico após a conversão.

Qual é a diferença entre WAV, BWF e polyWAV?

WAV é o contêiner padrão da Microsoft/IBM para áudio PCM. BWF (Broadcast Wave Format) é WAV com um bloco adicional de metadados BEXT que carrega timecode, informações de cena/take e identificadores únicos de arquivo, a saída padrão da maioria dos gravadores de campo de broadcast. PolyWAV é um BWF multicanal que armazena até 99 trilhas em um único arquivo, uma por microfone. Para transcrição, os três se comportam de forma idêntica; os metadados são ignorados pelos motores de transcrição.

Devo converter WAV para MP3 antes de enviar se o arquivo for muito grande?

Sim. Se o seu WAV exceder o limite de upload de um serviço, converta para MP3 de 192 kbps usando ffmpeg (ffmpeg -i recording.wav -acodec mp3 -ab 192k recording.mp3) e mantenha o WAV como sua cópia de arquivamento. A 192 kbps, a diferença de precisão é pequena demais para importar na maioria das gravações. Alternativamente, converta primeiro para WAV mono de 16 kHz, o que lhe dá áudio sem perdas com aproximadamente um quinto do tamanho original do arquivo.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles