
Cómo convertir AAC a texto: streams vs M4A explicados
Summarize this article with:
AAC (Advanced Audio Coding) es el códec de audio dominante en los dispositivos Apple, YouTube y la radio digital, pero se esconde bajo dos formatos de empaquetado muy diferentes: streams ADTS en bruto (.aac) y contenedores M4A (.m4a). Ambos se transcriben limpiamente con un motor de IA moderno, y no necesitas convertirlos a MP3 primero. Entender qué empaquetado tienes y dónde está el bitrate mínimo para lograr buena precisión marca la diferencia entre una transcripción limpia y otra llena de conjeturas.
Puedes transcribir un archivo AAC directamente, sin convertirlo primero a MP3. Sube el archivo, elige el idioma y un motor basado en Whisper Large-v3 devuelve una transcripción con marcas de tiempo en menos de dos minutos para la mayoría de las grabaciones. Lo único que conviene saber de antemano es si tu archivo es un stream ADTS en bruto (.aac) o un AAC dentro de un contenedor M4A (.m4a), porque eso cambia cómo se comportan algunas herramientas y por qué.

¿Cuál es la diferencia entre .aac y .m4a?
Esta es la cosa más confusa del formato, y desconcierta a todo aquel que se topa con él por primera vez.
Un archivo .aac es un stream ADTS en bruto. ADTS son las siglas de Audio Data Transport Stream. Cada fotograma lleva una pequeña cabecera seguida de los datos de audio comprimidos. No existe ningún contenedor de metadatos: ni portada, ni etiqueta de título, ni marcadores de capítulo. ADTS se diseñó para protocolos de streaming como SHOUTcast y para transport streams de radiodifusión, así que incluye justo lo necesario para que un decodificador pueda sincronizarse a mitad del stream.
Un archivo .m4a es el mismo códec AAC, envuelto en un contenedor MPEG-4. Ese contenedor añade átomos de metadatos, admite marcadores de capítulo y es el formato que Apple eligió para iTunes, Apple Podcasts y las notas de voz del iPhone. Es el mismo audio, simplemente mejor empaquetado.
La confusión: ambos tipos de archivo a veces aparecen con la extensión .aac. Los descargadores de YouTube que usan yt-dlp sin flags explícitas pueden escupir cualquiera de los dos formatos. La extensión por sí sola no te dice cuál tienes. Ejecutar ffprobe yourfile.aac sí lo dirá: busca container: adts (stream en bruto) frente a container: mov,mp4,m4a,3gp,3g2,mj2 (contenedor MPEG-4).
Para transcribir, la diferencia práctica es la fiabilidad. Los contenedores M4A cargan sin problemas en todas las herramientas. Los streams ADTS en bruto ocasionalmente producen cabeceras corruptas en los primeros segundos, sobre todo si provienen de rips de radiodifusión o de multiplexaciones mal hechas. Si obtienes una transcripción parcial o un galimatías inicial extraño con un archivo .aac, la solución es cambiar de contenedor sin recodificar:
ffmpeg -i input.aac -c:a copy output.m4a
Esto vuelve a empaquetar exactamente los mismos bits de audio en un contenedor M4A. Sin pérdida de calidad. La mayoría de los problemas desaparecen.
De dónde provienen realmente los archivos AAC
Conocer el origen te dice qué esperar antes de subir el archivo.
Las notas de voz del iPhone se guardan como .m4a con AAC-LC a unos 64-96 kbps por defecto. El bitrate varía según el contenido: una nota de alguien hablando cerca del micrófono se codifica más eficientemente que una grabación de sala con ruido de climatización. Si necesitas más precisión en grabaciones difíciles, cambia a Sin pérdida en Ajustes > Notas de voz, que graba en ALAC (Apple Lossless). Para un flujo de trabajo de transcripción de entrevistas, consulta la guía sobre cómo transcribir una nota de voz del iPhone.
YouTube sirve el audio de los vídeos estándar como AAC-LC a aproximadamente 126-128 kbps en un contenedor M4A (el stream de audio .m4a dentro del vídeo .mp4). YouTube Music Premium lo sube a 256 kbps AAC-LC. Cuando usas yt-dlp para extraer audio, el flag por defecto bestaudio normalmente te da la versión M4A: yt-dlp -f bestaudio --extract-audio --audio-format m4a URL. Ese archivo transcribe limpiamente. No lo conviertas a MP3 al extraerlo: perderás calidad sin beneficio alguno.
Apple Music emite a 256 kbps AAC-LC mediante HLS. La marca de 256 kbps está muy por encima del umbral en el que la precisión de transcripción se estanca.
La radio digital y los streams de radiodifusión suelen usar HE-AAC (High-Efficiency AAC). HE-AAC v1 añade Spectral Band Replication para exprimir una calidad de audio decente desde 32-64 kbps. HE-AAC v2 añade Parametric Stereo y baja ese suelo hasta 16-48 kbps. Ambos perfiles se usan en la radio digital DAB+ y en servicios de radio por internet. Si tienes una grabación de un stream de radiodifusión, confirma el bitrate antes de dar por hecho que obtendrás voz limpia. Con HE-AAC a 32 kbps, la inteligibilidad vocal se mantiene para escuchar, pero la precisión de voz a texto cae notablemente con hablantes acentuados.
Las descargas de podcasts de Apple Podcasts son M4A AAC-LC, normalmente de 128-192 kbps. Se transcriben sin preprocesamiento alguno.
El audio extraído de Final Cut Pro, iMovie o exportaciones de QuickTime es AAC en un contenedor M4A. Aquí la extensión .mp4 es habitual, pero el stream de audio sigue siendo AAC.
AAC vs MP3: ¿importa para la transcripción?
En resumen: AAC gana a bitrates bajos, queda aproximadamente igualado por encima de 192 kbps, y nunca deberías recodificar de un formato con pérdida al otro.
AAC usa un algoritmo basado puramente en MDCT, más eficiente que el enfoque híbrido de MP3. A 128 kbps, AAC-LC suena aproximadamente equivalente a MP3 a 160-192 kbps. Para transcribir, esta eficiencia se traduce en un detalle de las consonantes y unas sibilantes mejor conservados a los bitrates que los teléfonos usan realmente (64-128 kbps). Una grabación AAC a 64 kbps de habla clara transcribirá mejor que un MP3 a 64 kbps de la misma sesión.
A partir de 192 kbps, la diferencia entre códecs no es audible ni constituye una variable relevante para la transcripción. Ambos formatos alimentan sin problemas a los motores STT.
Lo que nunca debes hacer es convertir AAC a MP3 (o al revés) antes de subirlo. La transcodificación de un formato con pérdida a otro recomprime un audio que ya estaba comprimido, añadiendo pérdida generacional y artefactos de codificación. Sube directamente el archivo original .aac o .m4a. Los motores de transcripción modernos, incluidos AssemblyAI Universal-2 y Whisper Large-v3, aceptan ambos de forma nativa usando ffmpeg internamente. El análisis del formato hermano en M4A a texto y la guía de MP3 a texto cubren los demás contenedores si tienes formatos variados en un proyecto.
Cómo transcribir un archivo AAC
Una sección para la mecánica, porque la mayor parte consiste simplemente en subir el archivo.
1. Localiza el archivo. Notas de voz del iPhone: pulsa Compartir en la nota, elige «Guardar en Archivos» y guárdala en iCloud Drive o En mi iPhone. Episodios de podcast: en macOS, haz clic derecho en Apple Podcasts y elige «Mostrar en el Finder».
2. Súbelo directamente. Ve a ConvertAudioToText. Arrastra tu archivo .aac o .m4a. No hace falta conversión. Ambas extensiones están soportadas junto con MP3, WAV, FLAC, OGG y WMA.
3. Fija el idioma explícitamente. No confíes en la detección automática para clips de menos de 60 segundos. La detección automática funciona bien en archivos largos, pero puede identificar erróneamente inglés con acento como irlandés o galés en clips cortos.
4. Revisa el resultado. Se incluyen marcas de tiempo, etiquetas de hablante cuando el audio tiene voces diferenciadas y opciones de exportación (TXT, DOCX, SRT, VTT). Para una nota de voz de 30 minutos, espera resultados en unos 60-90 segundos.
El uso anónimo incluye una vista previa de 10 minutos. Una cuenta gratuita añade 10 minutos de transcripción, otorgados una sola vez al registrarte y utilizables a un máximo de 3 archivos al día. El plan Pro, a $9.99/mes, elimina todos los límites.
Trampas de transcripción específicas de AAC
Las trampas de .m4r y .m4b. Ambos son audio AAC. .m4r es un archivo de tono de llamada del iPhone. .m4b es un audiolibro con marcadores de capítulo. Algunas herramientas los rechazan por la extensión, aunque el audio que contienen sea AAC estándar. Cámbiales la extensión a .m4a y prueba otra vez. Si eso falla, ffmpeg -i input.m4r -c:a copy output.m4a vuelve a empaquetar el archivo limpiamente.
Artefactos de «Mejorar grabación» en las notas de voz. Si tienes activada Mejorar grabación en Ajustes > Notas de voz, la función aplica ecualización automática y reducción de ruido en el momento de grabar. El audio procesado suena más limpio al oído, pero puede introducir un sutil emborronamiento de las sibilantes. Para máxima precisión de transcripción en grabaciones importantes, desactiva Mejorar grabación y acerca el teléfono al hablante.
Grabaciones mono codificadas en estéreo. Muchas apps móviles graban en estéreo incluso cuando ambos canales son copias idénticas de un único micrófono. Esto duplica el tamaño del archivo sin aportar información alguna. Si tu app lo permite, configura la grabación en mono. Si ya tienes un archivo estéreo cuyos dos canales son iguales, ffmpeg -i input.m4a -ac 1 output_mono.m4a lo convierte sin ninguna pérdida de calidad a efectos de transcripción.
HE-AAC procedente de fuentes de radiodifusión. Si tu archivo viene de un stream de radio grabado o de radio por internet, comprueba el perfil con ffprobe. HE-AAC v2 a bitrates muy bajos producirá menor precisión con acentos no estándar o habla rápida. Nada lo arregla salvo volver a grabar a un bitrate mayor, pero conocer la limitación ayuda a gestionar expectativas.
Tamaño de archivo frente a duración. Una grabación AAC de 4 horas a 128 kbps pesa unos 230 MB. Es un archivo grande, pero perfectamente asumible para la mayoría de las herramientas de transcripción. Para grabaciones de más de 4-5 horas, divídelas con ffmpeg -i long.m4a -t 3600 -c copy hour1.m4a para trabajar en fragmentos manejables. La guía de formatos de audio compatibles cubre los límites de tamaño por herramienta.
Referencia rápida de contenedores
| Extensión | Qué es | Origen habitual |
|---|---|---|
.aac | Stream de bits ADTS en bruto, sin metadatos | Descargadores de YouTube, rips de radiodifusión |
.m4a | AAC-LC en contenedor MPEG-4 | Notas de voz del iPhone, Apple Podcasts |
.mp4 (solo audio) | AAC en contenedor MPEG-4 de vídeo | Exportaciones de iMovie/Final Cut, archivos de vídeo |
.m4b | AAC con marcadores de capítulo | Audiolibros |
.m4r | Tono de llamada AAC | Tonos de llamada del iPhone |
Para transcribir, todas las filas son el mismo códec. Lo que importa del contenedor es la compatibilidad con las herramientas, no la calidad del audio. Si tienes un .mp4 con vídeo real y quieres transcribir solo el audio, la guía de MP4 a texto cubre el paso de extracción.
Mi opinión: para grabaciones nuevas destinadas a transcribirse, usa las notas de voz del iPhone en el modo M4A predeterminado y mantén el teléfono a un brazo del hablante. El códec es suficientemente eficiente como para que AAC-LC a 64-96 kbps produzca transcripciones limpias de habla estándar en una habitación silenciosa. Sube solo a ALAC sin pérdida si tienes audio difícil: acentos fuertes, varios hablantes superpuestos o ruido de fondo considerable.
Si solo necesitas una transcripción limpia sin instalar nada, ConvertAudioToText acepta AAC y M4A directamente. Sube el archivo, fija el idioma y la transcripción estará lista en minutos.
FAQ
¿El AAC tiene mejor calidad que el MP3 para transcribir?
Al mismo bitrate, AAC (perfil AAC-LC) es más eficiente que MP3 gracias a su algoritmo basado puramente en MDCT. A 128 kbps, el AAC suena aproximadamente equivalente a un MP3 a 160-192 kbps, así que una nota de voz AAC a 128 kbps se transcribe más limpiamente que una grabación MP3 a 128 kbps del mismo material. Para transcribir, la ventaja del códec es real por debajo de 128 kbps; por encima de ese umbral, ambos formatos alimentan bien a los motores STT.
¿Cuál es la diferencia entre un archivo .aac y un archivo .m4a?
Ambos contienen audio codificado en AAC, pero el empaquetado difiere. Un archivo .aac es un stream de bits ADTS (Audio Data Transport Stream) en bruto: cabeceras de fotograma, datos de audio, sin contenedor de metadatos. Un archivo .m4a envuelve el AAC dentro de un contenedor MPEG-4 que puede alojar portada, título, artista y datos de capítulos. Los iPhones guardan las notas de voz como .m4a; los descargadores de YouTube a veces producen archivos .aac ADTS desnudos según la herramienta y sus flags.
¿Puedo transcribir archivos AAC gratis sin registrarme?
Sí. ConvertAudioToText acepta archivos AAC y M4A y ofrece una transcripción de vista previa de 10 minutos sin cuenta. Crear una cuenta gratuita te da 10 minutos de transcripción, otorgados una sola vez y no cada mes. El plan Pro, a $9.99/mes, elimina todos los límites.
¿Por qué mi archivo AAC muestra texto ilegible al principio?
Esto suele apuntar a una cabecera ADTS corrupta en un archivo .aac en bruto. Prueba a reempaquetarlo sin recodificar: ejecuta ffmpeg -i input.aac -c:a copy output.m4a para colocar el mismo stream de audio dentro de un contenedor M4A. La mayoría de los motores de transcripción manejan la versión con contenedor de forma más fiable que un stream ADTS desnudo.
Fuentes
- Codificación de audio avanzada (Wikipedia)
- Guía del formato AAC: AAC-LC, HE-AAC, M4A y audio MPEG-4 explicados (KaijuConverter)
- ADTS (MultimediaWiki)
- Calidad de audio de YouTube Music (2026)
- ¿Cuál es el bitrate de Apple Music? (Musconv)
- El mejor códec de audio para streaming de vídeo online en 2026 (AntMedia)
- Cómo mejorar la calidad de sonido de tus notas de voz en el iPhone (HowToGeek)
- Precios de ConvertAudioToText
- Discusión en GitHub de OpenAI Whisper: formatos de audio compatibles
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Building a Second Brain With Audio: The 2026 Workflow
How to build a second brain using voice capture, AI transcription, and PARA. A practical workflow covering capture, distill, organize, and synthesize steps for 2026.

Content Repurposing From Audio: The Routing Map (2026)
One recording can become 15-25 distinct content pieces. Here is the hub guide: every major derivative format, when it is worth it, and the dedicated guide for each lane.