Formatos de archivo para transcripción explicados: guía de entrada 2026
transcripciónformatos de archivoaudio

Formatos de archivo para transcripción explicados: guía de entrada 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Las herramientas de transcripción de audio y vídeo aceptan una amplia variedad de formatos extrayendo primero la pista de audio, así que la elección del contenedor importa menos de lo que cabría esperar. Para grabaciones de voz, el MP3 a 192 kbps mono es el valor práctico por defecto: pequeño, universal y suficientemente preciso. WAV y FLAC conservan cada muestra, pero rara vez mejoran la calidad de la transcripción en grabaciones limpias. Cuando no hay opción de formato, un solo comando de FFmpeg puede convertir casi cualquier cosa en un MP3 mono limpio a 16 kHz antes de subirlo.

El formato de tu archivo de audio casi nunca es la razón por la que una transcripción sale mal. La mayoría de las herramientas de transcripción aceptan MP3, WAV, M4A, FLAC, OGG, MP4, MOV y una docena más. Esta publicación repasa cada formato, explica cuándo la elección importa de verdad y te dice qué hacer con los casos complicados.

Para una tabla rápida de compatibilidad sí/no entre herramientas, consulta la referencia de formatos de audio admitidos para transcripción. El lado de la salida, SRT, VTT y TXT, se trata en formatos de exportación de transcripción explicados.

Audio frente a vídeo: lo que procesan realmente las herramientas de transcripción

Cuando subes un archivo de vídeo, la herramienta de transcripción extrae primero la pista de audio (usando FFmpeg o un equivalente) y después ejecuta el modelo de voz sobre ese audio. Los fotogramas de vídeo se ignoran por completo.

Un MP4 de 1 GB y un MP3 de 50 MB con audio idéntico producen transcripciones idénticas. El MP4 simplemente tarda más en subirse. Para trabajo de transcripción pura, los formatos de solo audio son siempre la opción más eficiente. La excepción es el trabajo de subtítulos, donde quieres conservar el archivo de vídeo como referencia.

Los formatos de audio

MP3

El valor práctico por defecto para casi todo. Soporte universal, archivos pequeños, sorpresas de compatibilidad nulas.

  • Compresión: Con pérdida. 128 kbps es aceptable; 192 kbps es el punto óptimo de precisión para el habla; 320 kbps es el techo práctico.
  • Frecuencia de muestreo: Normalmente 44,1 kHz. Los modelos de transcripción remuestrean internamente a 16 kHz.
  • Tamaño de archivo: Archivo de 60 minutos a 192 kbps mono = unos 86 MB.
  • Ideal para: Pódcast, notas de voz, entrevistas, cualquier grabación de solo voz donde quieras archivos pequeños.

El MP3 elimina contenido de alta frecuencia durante la codificación. A 192 kbps o más, la pérdida es insignificante para la transcripción. A 64 kbps o menos, las fricativas ("f", "s", "sh") se vuelven turbias y la precisión cae notablemente.

WAV

Audio PCM sin comprimir. Cada muestra se almacena explícitamente.

  • Compresión: Ninguna.
  • Frecuencia de muestreo: De 8 kHz a 192 kHz. 16 kHz es el estándar de los modelos de voz.
  • Tamaño de archivo: Archivo mono de 60 minutos a 16 kHz = unos 110 MB. La misma grabación a 44,1 kHz estéreo se dispara hasta unos 600 MB.
  • Ideal para: Grabaciones máster que planeas editar, trabajo profesional de radiodifusión o situaciones donde no quieres pasos con pérdida en la cadena.

WAV suele ser excesivo para subir. Si tienes una conexión lenta o estás cerca de un límite de tamaño, convertir a un MP3 de 192 kbps no pierde prácticamente nada de precisión. Para una comparativa detallada, consulta WAV frente a MP3 para transcripción.

M4A

El formato predeterminado de los dispositivos Apple. A veces descrito como «AAC dentro de un contenedor MP4».

  • Compresión: Con pérdida (códec AAC). Ligeramente más eficiente que el MP3 al mismo bitrate.
  • Frecuencia de muestreo: Normalmente 44,1 kHz.
  • Tamaño de archivo: Archivo de 60 minutos a 128 kbps = unos 58 MB.
  • Ideal para: Notas de voz de iPhone, exportaciones de GarageBand, cualquier audio de origen Apple.

M4A y AAC son casi idénticos: M4A es el contenedor y AAC es el códec que va dentro. La mayoría de las herramientas manejan ambos indistintamente. No hay razón para convertir una nota de voz de iPhone antes de subirla.

FLAC

Compresión sin pérdida. La misma calidad de audio que WAV, en un archivo más pequeño.

  • Compresión: Sin pérdida (no se elimina ningún dato de audio).
  • Frecuencia de muestreo: Normalmente 44,1 kHz o 48 kHz.
  • Tamaño de archivo: Archivo estéreo de 60 minutos = unos 300 MB.
  • Ideal para: Flujos de trabajo de archivado donde no puedes permitirte ningún paso con pérdida y quieres archivos más pequeños que WAV.

FLAC rara vez es el formato adecuado para subir a transcripción. La ganancia de precisión frente a un MP3 limpio de 192 kbps es prácticamente cero para el habla, y los archivos siguen siendo mucho más grandes que el MP3. Es más útil en flujos de trabajo de audiófilos y de archivado donde el audio se procesará aún más.

OGG / Opus

Formatos de código abierto. Opus en particular es lo que usan WhatsApp, Discord y la mayoría de las aplicaciones WebRTC para los mensajes de voz.

  • Compresión: Con pérdida. Opus es muy eficiente a bitrates bajos, superando a menudo al MP3 y al AAC.
  • Tamaño de archivo: Archivo de 60 minutos a 64 kbps Opus = unos 29 MB.
  • Ideal para: Mensajes de voz de WhatsApp, grabaciones WebRTC, herramientas de código abierto.

OGG es un contenedor (como MP4); Vorbis y Opus son códecs que pueden vivir dentro de él. A 64 kbps o más, Opus conserva bien la claridad del habla.

AAC

El códec en bruto, normalmente entregado dentro de un contenedor M4A pero ocasionalmente como archivo .aac independiente.

  • Compresión: Con pérdida. Ligeramente más eficiente que el MP3 al mismo bitrate.
  • Tamaño de archivo: Similar al M4A.
  • Ideal para: Contenido de Apple Podcasts, iTunes Store o flujos de radiodifusión modernos.

AAC y M4A se procesan de forma idéntica por las herramientas de transcripción. Rara vez necesitarás distinguirlos en la práctica.

WMA

Windows Media Audio. Poco común en 2026 pero todavía presente en sistemas antiguos.

  • Compresión: Con pérdida (códec propietario de Microsoft).
  • Ideal para: Grabaciones antiguas de Windows. Convierte a MP3 si procesas archivos en lote.

WMA es aceptado por la mayoría de las herramientas modernas, pero vale la pena convertirlo a MP3 primero si tienes muchos archivos: evita cualquier caso límite de decodificación de códecs más adelante.

Los formatos de vídeo

MP4

El contenedor de vídeo dominante. El audio interior suele ser AAC; el vídeo es típicamente H.264 o H.265.

  • Ideal para: Descargas de YouTube, grabaciones de pantalla, vídeo de smartphone, exportaciones de Loom.
  • Calidad de audio: Normalmente AAC de 128-192 kbps, que transcribe bien.

MOV

El contenedor de vídeo de Apple. Funcionalmente similar a MP4.

  • Ideal para: Grabaciones de QuickTime, vídeo de iPhone, ScreenFlow, exportaciones de Final Cut Pro.

WebM

Formato de vídeo de código abierto. Común en las grabaciones de Google Meet y en las herramientas de grabación basadas en el navegador.

  • Audio: Normalmente Opus.
  • Ideal para: Grabaciones de Google Meet, herramientas de captura basadas en web, descargas de Twitch.

MKV

El contenedor Matroska. Flexible, usado a menudo para vídeo descargado de alta calidad.

  • Ideal para: Grabaciones de conferencias, charlas descargadas, vídeo de alta definición con varias pistas de audio.

AVI, WMV, FLV

Formatos antiguos con los que todavía te encontrarás.

  • AVI: Vídeo antiguo de Windows. Aceptado por la mayoría de las herramientas; conviértelo a MP4 si tienes elección.
  • WMV: Windows Media antiguo. El mismo consejo.
  • FLV: Vídeo Flash antiguo. Casi invisible después de 2020, pero algunas grabaciones viejas todavía lo usan.

Para cualquiera de estos, convertir a MP4 antes de subir produce archivos más pequeños y evita cualquier decodificación de códecs exótica.

Cuándo importa realmente la elección del formato

Los contenedores de vídeo también se suben: la pista de audio se extrae automáticamente
Los contenedores de vídeo también se suben: la pista de audio se extrae automáticamente

La mayor parte del tiempo, la elección del formato no importa: cualquier herramienta moderna manejará MP3, WAV, M4A y MP4 sin quejas. Los casos en los que sí importa:

Archivos con pérdida a bitrate bajo. Un MP3 a 32 o 48 kbps, o una grabación de teléfono muy comprimida, introduce suficiente emborronamiento de las consonantes como para que incluso el mejor modelo sufra. Si puedes volver a grabar a un bitrate más alto, hazlo antes de transcribir.

Convertir de con pérdida a sin pérdida. Si tomas un MP3 y lo conviertes a WAV, obtienes un archivo WAV grande con la misma pérdida de datos que el MP3 original. La conversión es permanente; no hay forma de recuperar el audio eliminado. La transcripción será la misma que la del MP3 original.

Archivos protegidos con DRM. Las compras de iTunes anteriores a 2009 y algunos archivos de audiolibros llevan DRM que impide la extracción. Transcribirlos requiere eliminar primero el DRM, lo que puede constituir una infracción de licencia según tu caso de uso.

Casos límite de bitrate variable. Algunos archivos codificados en VBR tienen cabeceras malformadas que confunden a los decodificadores. Recodificar a bitrate constante (CBR) lo soluciona de manera fiable.

Sonido envolvente multicanal. Una pista de audio 5.1 de una grabación de película es inusual como entrada de transcripción. La mayoría de las herramientas la reducen a mono automáticamente; algunas rechazan el archivo.

Mono frente a estéreo

El mono reduce a la mitad el tamaño del archivo sin coste de precisión para contenido de un solo hablante. El habla es inherentemente mono: tu voz es la misma señal en ambos canales de una grabación estéreo.

La única excepción es la grabación de entrevistas con pistas divididas, en la que un hablante se sitúa en el canal izquierdo y otro en el derecho. Algunas herramientas pueden usar esa separación de canales para la diarización de hablantes, etiquetando a los hablantes por canal sin necesidad de agrupamiento acústico. Si tu grabadora admite pistas divididas y tu herramienta de transcripción admite diarización basada en canales, vale la pena activarlo. Para todo lo demás, graba en mono.

Frecuencia de muestreo

El estándar de los modelos de voz es 16 kHz. Esa frecuencia captura todo el rango de frecuencias de la voz humana (que se sitúa por debajo de 8 kHz) con margen de sobra. Frecuencias de muestreo más altas (44,1 kHz del audio de CD, 48 kHz de la radiodifusión, 96 kHz del equipo de estudio) añaden tamaño de archivo pero ningún beneficio de precisión para el reconocimiento del habla.

Prácticamente todas las herramientas de transcripción remuestrean internamente a 16 kHz. Subir audio a 44,1 kHz solo significa una subida más grande para el mismo resultado. Con una conexión lenta, remuestrear antes de subir ahorra tiempo:

ffmpeg -i input.wav -ac 1 -ar 16000 output_16k.wav

Tamaño de archivo y límites prácticos

Las herramientas de transcripción limitan el tamaño del archivo o la duración, siendo los planes gratuitos más restrictivos que los de pago. El patrón es consistente entre herramientas: los planes gratuitos limitan ya sea por minutos totales al mes o por duración por archivo; los planes de pago elevan esos límites considerablemente o los eliminan.

Si tu archivo choca contra un límite, tus opciones son:

  1. Convertir a un formato más eficiente. Un WAV de 600 MB pasa a rondar los 50 MB como MP3 de 192 kbps, a menudo suficiente para superar un límite de tamaño sin ningún coste de precisión.
  2. Dividir el archivo en una pausa natural. Audacity y FFmpeg ambos lo permiten.
  3. Usar subida mediante URL si está disponible. Algunas herramientas, incluida ConvertAudioToText, aceptan una URL y descargan el archivo en el servidor, evitando por completo tu ancho de banda de subida.

La válvula de escape de FFmpeg

Si estás atascado con un formato problemático, convertir a un MP3 mono limpio vía FFmpeg arregla casi todos los casos límite:

ffmpeg -i input.weird-format -ac 1 -ar 16000 -b:a 192k output.mp3

Ese comando produce un MP3 mono, a 16 kHz y 192 kbps, a partir de cualquier cosa que FFmpeg pueda leer (que es casi todo).

Mapa de formatos: referencia rápida

FormatoTipoCompresiónUso típico
MP3AudioCon pérdidaPredeterminado para el habla
WAVAudioNingunaGrabaciones máster
M4AAudioCon pérdida (AAC)Dispositivos Apple
FLACAudioSin pérdidaArchivado
OGG / OpusAudioCon pérdidaWhatsApp, WebRTC
AACAudioCon pérdidaApple Podcasts, radiodifusión
WMAAudioCon pérdidaWindows antiguo
MP4VídeoCon pérdidaVídeo predeterminado
MOVVídeoCon pérdidaVídeo de Apple
WebMVídeoCon pérdidaGoogle Meet, herramientas de navegador
MKVVídeoVariableDescargas de alta calidad
AVI / WMV / FLVVídeoCon pérdidaAntiguo

Mi opinión: lo más útil de esta tabla es darse cuenta de que todas las filas de vídeo se reducen a «primero extraer el audio». Una vez que interiorizas eso, preocuparse por la elección del contenedor para archivos de vídeo desaparece en gran medida.

Elegir un formato cuando tienes elección

Si vas a grabar audio nuevo específicamente para transcripción:

  • MP3 a 192 kbps mono para contenido de solo voz. Pequeño, universal, preciso.
  • M4A a 128 kbps AAC si estás en un dispositivo Apple y quieres el formato nativo.
  • WAV a 16 kHz mono si tienes espacio de almacenamiento y no quieres pasos con pérdida en la cadena.

Para trabajo de vídeo, MP4 con vídeo H.264 y audio AAC a 128 kbps o más es el valor seguro por defecto.

Preguntas frecuentes

¿La elección del formato afecta realmente a la precisión de la transcripción?

Rara vez en la práctica. La calidad de la grabación subyacente al formato importa mucho más que el contenedor o el códec. Un MP3 limpio y bien grabado a 192 kbps producirá una transcripción casi idéntica a la de un WAV del mismo audio. Las excepciones son los bitrates muy bajos (por debajo de 64 kbps), el audio de teléfono muy comprimido y los archivos con cabeceras corruptas.

¿Debería convertir mi archivo a WAV antes de subirlo?

Solo si tu fuente ya es WAV o sin pérdida. Convertir un formato con pérdida como MP3 o M4A a WAV no restaura ningún dato de audio: las decisiones de compresión originales son permanentes. La conversión simplemente infla el tamaño del archivo sin ningún beneficio de precisión.

¿Cuál es el mejor formato para transcribir una nota de voz de iPhone?

M4A, que es el formato nativo que usan los iPhones. No hay razón para convertirlo antes. M4A usa el códec AAC y es aceptado directamente por todas las herramientas de transcripción modernas.

¿Por qué prefieren los modelos de transcripción el audio a 16 kHz?

La voz humana se sitúa por debajo de 8 kHz. Una frecuencia de muestreo de 16 kHz captura todo el rango de frecuencias de la voz sin pérdida alguna para el reconocimiento del habla. Frecuencias más altas (44,1 kHz, 48 kHz) contienen frecuencias que el modelo ignora, así que subirlas solo significa una subida más lenta sin ninguna mejora en la transcripción.

¿Qué debo hacer si mi archivo es demasiado grande para subirlo?

Tres opciones: convertir a un formato más eficiente (un WAV de 600 MB pasa a rondar los 50 MB como MP3 a 192 kbps), dividir el archivo en una pausa natural usando Audacity o FFmpeg, o comprobar si tu herramienta de transcripción acepta una URL para que pueda descargar el archivo en el servidor y evitar por completo tu ancho de banda de subida.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles