
Como converter AAC para texto: streams vs M4A explicados
Summarize this article with:
O AAC (Advanced Audio Coding) é o codec de áudio dominante nos dispositivos Apple, no YouTube e no rádio digital, mas ele se esconde sob dois formatos de empacotamento muito diferentes: streams ADTS brutos (.aac) e containers M4A (.m4a). Ambos são transcritos com precisão por um motor de IA moderno, e você não precisa converter para MP3 primeiro. Entender qual empacotamento você tem, e onde fica o piso de bitrate para boa precisão, faz toda a diferença entre uma transcrição limpa e uma cheia de palpites.
Você pode transcrever um arquivo AAC diretamente, sem convertê-lo para MP3 primeiro. Envie o arquivo, escolha o idioma e um motor baseado no Whisper Large-v3 retorna uma transcrição com marcações de tempo em menos de dois minutos para a maioria das gravações. A única coisa que vale saber de antemão é se o seu arquivo é um stream ADTS bruto (.aac) ou um AAC em container M4A (.m4a), porque isso muda o comportamento de algumas ferramentas — e explica o motivo.

Qual é a diferença entre .aac e .m4a?
Essa é a coisa mais confusa sobre o formato, e ela pega de surpresa todo mundo que lida com ele pela primeira vez.
Um arquivo .aac é um bitstream ADTS puro. ADTS significa Audio Data Transport Stream. Cada quadro tem um pequeno cabeçalho seguido dos dados de áudio comprimidos. Não há container de metadados: sem capa, sem tag de título, sem marcadores de capítulo. O ADTS foi projetado para protocolos de streaming como SHOUTcast e transport streams de broadcast, então carrega apenas o enquadramento necessário para que um decodificador consiga sincronizar no meio da transmissão.
Um arquivo .m4a é o mesmo codec AAC, envolto em um container MPEG-4. Esse container adiciona átomos de metadados, suporta marcadores de capítulo e é o formato que a Apple escolheu para iTunes, Apple Podcasts e Gravações de Voz do iPhone. É o mesmo áudio, só melhor empacotado.
A confusão: ambos os tipos de arquivo às vezes aparecem com a extensão .aac. Downloaders do YouTube que usam yt-dlp sem flags explícitas podem gerar qualquer um dos dois formatos. Só a extensão não diz qual você tem. Rodar ffprobe yourfile.aac dirá: procure container: adts (stream puro) versus container: mov,mp4,m4a,3gp,3g2,mj2 (container MPEG-4).
Para transcrição, a diferença prática é a confiabilidade. Containers M4A carregam sem problemas em todas as ferramentas. Streams ADTS brutos ocasionalmente produzem cabeçalhos ilegíveis nos primeiros segundos, especialmente em fontes extraídas de broadcast ou mal muxadas. Se você recebe uma transcrição parcial ou um trecho inicial estranho e sem sentido vindo de um arquivo .aac, a solução é trocar o container sem recodificar:
ffmpeg -i input.aac -c:a copy output.m4a
Isso reempacota exatamente os mesmos bits de áudio em um container M4A. Sem perda de qualidade. A maioria dos problemas desaparece.
De onde os arquivos AAC realmente vêm
Conhecer a origem diz o que esperar antes do upload.
Gravações de Voz do iPhone são salvas como .m4a contendo AAC-LC a cerca de 64-96 kbps por padrão. O bitrate varia conforme o conteúdo: uma gravação de alguém falando perto do microfone é codificada com mais eficiência do que a gravação de uma sala com barulho de ar-condicionado. Se você precisa de melhor precisão em gravações difíceis, alterne para Sem Perdas (Lossless) em Ajustes > Gravações de Voz, que grava em ALAC (Apple Lossless). Para um fluxo de trabalho de transcrição de entrevista, veja o guia sobre como transcrever uma Gravação de Voz do iPhone.
YouTube distribui o áudio dos vídeos padrão como AAC-LC a aproximadamente 126-128 kbps em um container M4A (o stream de áudio .m4a dentro do vídeo .mp4). O YouTube Music Premium eleva isso para 256 kbps AAC-LC. Quando você usa yt-dlp para extrair o áudio, a flag padrão bestaudio geralmente entrega a versão M4A: yt-dlp -f bestaudio --extract-audio --audio-format m4a URL. Esse arquivo é transcrito sem problemas. Não o converta para MP3 no caminho, você perderá qualidade sem nenhum benefício.
Apple Music faz streaming a 256 kbps AAC-LC via HLS. A marca de 256 kbps está bem acima do patamar em que a precisão da transcrição se estabiliza.
Rádio digital e streams de broadcast frequentemente usam HE-AAC (High-Efficiency AAC). O HE-AAC v1 adiciona Spectral Band Replication para extrair qualidade de áudio decente de 32-64 kbps. O HE-AAC v2 adiciona Parametric Stereo e abaixa esse piso para 16-48 kbps. Ambos os perfis são usados no rádio digital DAB+ e em serviços de rádio na internet. Se você tem uma gravação de um stream de broadcast, confirme o bitrate antes de assumir que terá fala limpa. Em HE-AAC a 32 kbps, a inteligibilidade vocal se sustenta para escuta, mas a precisão do reconhecimento de fala cai consideravelmente com falantes de sotaque forte.
Downloads de podcasts vindos da Apple Podcasts são M4A AAC-LC, tipicamente 128-192 kbps. São transcritos sem nenhum pré-processamento.
Áudio extraído do Final Cut Pro, iMovie ou de exportações do QuickTime é AAC em um container M4A. A extensão .mp4 é comum aqui, mas o stream de áudio continua sendo AAC.
AAC vs MP3: isso importa para a transcrição?
A versão curta: o AAC vence em bitrates baixos, fica praticamente igualado acima de 192 kbps, e você nunca deve recodificar um formato com perdas para o outro.
O AAC usa um algoritmo baseado exclusivamente em MDCT, mais eficiente que a abordagem híbrida do MP3. A 128 kbps, o AAC-LC soa aproximadamente equivalente ao MP3 a 160-192 kbps. Para transcrição, essa eficiência se traduz em detalhes de consoantes e sibilantes melhor preservados nos bitrates que os celulares realmente usam (64-128 kbps). Uma gravação em AAC a 64 kbps de fala clara será transcrita melhor do que um MP3 a 64 kbps da mesma sessão.
A 192 kbps ou mais, a diferença entre codecs não é audível e não é uma variável relevante para transcrição. Ambos os formatos alimentam bem os motores STT.
O que você nunca deve fazer é converter AAC para MP3 (ou o contrário) antes do upload. Transcodificação de um formato com perdas para outro também com perdas recomprime um áudio que já estava comprimido, adicionando perda de geração e artefatos de codificação. Envie o arquivo original .aac ou .m4a diretamente. Motores de transcrição modernos, incluindo AssemblyAI Universal-2 e Whisper Large-v3, aceitam ambos nativamente via ffmpeg internamente. A discussão sobre o formato irmão em M4A para texto e o guia de MP3 para texto cobrem os outros containers caso você tenha formatos misturados em um projeto.
Como transcrever um arquivo AAC
Uma seção para a mecânica, porque a maior parte é só enviar o arquivo.
1. Localize o arquivo. Gravações de Voz do iPhone: toque em Compartilhar na gravação, escolha "Salvar no Arquivos" e salve no iCloud Drive ou No Meu iPhone. Episódios de podcast: no macOS, clique com o botão direito no app Podcasts e escolha "Mostrar no Finder".
2. Envie-o diretamente. Acesse ConvertAudioToText. Arraste seu arquivo .aac ou .m4a. Nenhuma conversão necessária. Ambas as extensões são suportadas, junto com MP3, WAV, FLAC, OGG e WMA.
3. Defina o idioma explicitamente. Não confie na detecção automática para clipes com menos de 60 segundos. A detecção automática funciona bem em arquivos longos, mas pode identificar erroneamente inglês com sotaque como irlandês ou galês em clipes curtos.
4. Revise o resultado. Marcações de tempo, rótulos de falante quando o áudio tem vozes distintas e opções de exportação (TXT, DOCX, SRT, VTT) estão incluídos. Para uma Gravação de Voz de 30 minutos, espere resultados em cerca de 60-90 segundos.
O uso anônimo recebe uma prévia de 10 minutos. Uma conta gratuita adiciona 10 minutos de transcrição, concedidos uma única vez no cadastro e utilizáveis em até 3 arquivos por dia. O plano Pro, a US$ 9,99/mês, remove todos os limites.
Armadilhas específicas de transcrição com AAC
As pegadinhas .m4r e .m4b. Ambos são áudio AAC. .m4r é um arquivo de toque (ringtone) do iPhone. .m4b é um audiobook com marcadores de capítulo. Algumas ferramentas rejeitam esses arquivos pela extensão, embora o áudio interno seja AAC padrão. Renomeie para .m4a e tente novamente. Se isso falhar, ffmpeg -i input.m4r -c:a copy output.m4a reempacota sem problemas.
Artefatos do "Melhorar Gravação" das Gravações de Voz. Se você tem a opção Melhorar Gravação ativada em Ajustes > Gravações de Voz, o recurso aplica equalização automática e redução de ruído no momento da gravação. O áudio processado soa mais limpo aos ouvidos, mas pode introduzir um sutil borramento nas sibilantes. Para precisão máxima de transcrição em gravações importantes, desative Melhorar Gravação e posicione o celular mais perto do falante.
Gravações mono codificadas em estéreo. Muitos aplicativos móveis gravam em estéreo mesmo quando ambos os canais são cópias idênticas de um único microfone. Isso duplica o tamanho do arquivo sem adicionar informação alguma. Se o seu aplicativo permitir, configure a gravação em mono. Se você já tem um arquivo estéreo em que ambos os canais são iguais, ffmpeg -i input.m4a -ac 1 output_mono.m4a o converte sem nenhuma perda de qualidade para fins de transcrição.
HE-AAC de fontes de broadcast. Se o seu arquivo veio de um stream de rádio gravado ou de uma rádio na internet, verifique o perfil com ffprobe. HE-AAC v2 em bitrates muito baixos produzirá menor precisão com sotaques fora do padrão ou fala rápida. Nada corrige isso além de regravar em um bitrate mais alto, mas conhecer a limitação ajuda a administrar as expectativas.
Tamanho do arquivo vs duração. Uma gravação AAC de 4 horas a 128 kbps resulta em cerca de 230 MB. É um arquivo grande, mas bem dentro do que a maioria das ferramentas de transcrição suporta. Para gravações com mais de 4-5 horas, divida com ffmpeg -i long.m4a -t 3600 -c copy hour1.m4a para trabalhar em blocos gerenciáveis. O guia de formatos de áudio suportados cobre os limites de tamanho por ferramenta.
Referência rápida de containers
| Extensão | O Que É | Origem Comum |
|---|---|---|
.aac | Bitstream ADTS bruto, sem metadados | Downloaders do YouTube, rips de broadcast |
.m4a | AAC-LC em container MPEG-4 | Gravações de Voz do iPhone, Apple Podcasts |
.mp4 (somente áudio) | AAC em container MPEG-4 de vídeo | Exportações do iMovie/Final Cut, arquivos de vídeo |
.m4b | AAC com marcadores de capítulo | Audiobooks |
.m4r | Toque (ringtone) AAC | Toques do iPhone |
Para transcrição, todas as linhas são o mesmo codec. O container importa para a compatibilidade com as ferramentas, não para a qualidade do áudio. Se você tem um .mp4 com vídeo real e quer transcrever apenas o áudio, o guia de MP4 para texto cobre a etapa de extração.
Minha opinião: para gravações novas destinadas à transcrição, use as Gravações de Voz do iPhone no modo padrão M4A e mantenha o celular a um braço de distância do falante. O codec é eficiente o bastante para que AAC-LC a 64-96 kbps produza transcrições limpas de fala padrão em uma sala silenciosa. Suba para Lossless ALAC apenas se tiver áudio difícil: sotaques pesados, vários falantes sobrepostos ou ruído de fundo significativo.
Se você só precisa de uma transcrição limpa sem instalar nada, o ConvertAudioToText aceita AAC e M4A diretamente. Envie o arquivo, defina o idioma e a transcrição estará pronta em minutos.
Perguntas Frequentes
O AAC tem qualidade melhor que o MP3 para transcrição?
Com o mesmo bitrate, o AAC (perfil AAC-LC) é mais eficiente que o MP3 graças ao seu algoritmo baseado exclusivamente em MDCT. A 128 kbps, o AAC soa aproximadamente equivalente ao MP3 a 160-192 kbps, então uma Gravação de Voz em AAC a 128 kbps sai mais limpa na transcrição do que uma gravação em MP3 a 128 kbps do mesmo material. Para fins de transcrição, a vantagem do codec é real abaixo de 128 kbps; acima desse limite, ambos os formatos alimentam bem os motores STT.
Qual é a diferença entre um arquivo .aac e um arquivo .m4a?
Ambos contêm áudio codificado em AAC, mas o empacotamento é diferente. Um arquivo .aac é um bitstream ADTS bruto (Audio Data Transport Stream): cabeçalhos de quadro, dados de áudio, sem container de metadados. Um arquivo .m4a envolve o AAC dentro de um container MPEG-4 que pode armazenar capa, título, artista e dados de capítulos. Os iPhones salvam as Gravações de Voz como .m4a; downloaders do YouTube às vezes produzem arquivos .aac ADTS puros, dependendo da ferramenta e dos parâmetros usados.
Posso transcrever arquivos AAC de graça sem criar conta?
Sim. O ConvertAudioToText aceita arquivos AAC e M4A e oferece uma prévia de transcrição de 10 minutos sem necessidade de conta. Criar uma conta gratuita concede 10 minutos de transcrição, entregues uma única vez e não todo mês. O plano Pro, a US$ 9,99/mês, remove todos os limites.
Por que meu arquivo AAC mostra texto embaralhado no começo?
Isso geralmente indica um cabeçalho ADTS corrompido em um arquivo .aac bruto. Tente reempacotar o arquivo sem recodificar: rode ffmpeg -i input.aac -c:a copy output.m4a para colocar o mesmo fluxo de áudio dentro de um container M4A. A maioria dos motores de transcrição lida com a versão com container de forma mais confiável do que com um stream ADTS puro.
Fontes
- Advanced Audio Coding (Wikipedia)
- AAC Format Guide: AAC-LC, HE-AAC, M4A and MPEG-4 Audio Explained (KaijuConverter)
- ADTS (MultimediaWiki)
- YouTube Music Audio Quality (2026)
- What Is The Bitrate Of Apple Music? (Musconv)
- Best Audio Codec for Online Video Streaming in 2026 (AntMedia)
- How to Improve the Sound Quality of Your Voice Memos on iPhone (HowToGeek)
- ConvertAudioToText Pricing
- OpenAI Whisper GitHub discussion: supported audio formats
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.