Cómo convertir MP4 a texto (subida directa, sin necesidad de extracción)
transcripciónvídeomp4

Cómo convertir MP4 a texto (subida directa, sin necesidad de extracción)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

La respuesta rápida

No necesitas extraer el audio de tu MP4 antes de transcribirlo. Sube el archivo directamente a cualquier herramienta de transcripción seria y el servidor extrae el audio automáticamente usando ffmpeg. Lo único que vale la pena comprobar antes: ¿el archivo tiene realmente una pista de audio y, si tiene más de una, cuál quieres?

Subidas de vídeo MP4: la pista de audio se extrae automáticamente
Subidas de vídeo MP4: la pista de audio se extrae automáticamente

Qué hay realmente dentro de un MP4

MP4 es un contenedor, no un códec. El vídeo que grabaste la semana pasada probablemente usa H.264 o HEVC (H.265) para la imagen y AAC para el audio. El contenedor simplemente los mantiene juntos junto con metadatos de tiempo, pistas de subtítulos y marcadores de capítulos.

Esta distinción importa para la transcripción porque el modelo de reconocimiento de voz solo ve la pista de audio, no el vídeo. La herramienta demultiplexa el contenedor, extrae el audio, remuestrea a 16 kHz mono (el formato que esperan los modelos tipo Whisper) y ejecuta la inferencia. Nada de eso depende del códec de vídeo que haya dentro.

Lo que sí importa:

  • AAC (el más común): se extrae limpiamente en todas las herramientas de transcripción.
  • AC-3 / Dolby: presente en MP4 ripeados de emisiones de televisión o Blu-ray. Algunas herramientas lo manejan; otras necesitan que primero lo transcodifiques a AAC.
  • Opus dentro de MP4: menos común, cada vez más usado por grabaciones capturadas desde la web. Bien soportado en las herramientas modernas, ocasionalmente hace tropezar a los flujos de trabajo más antiguos.

El códec de vídeo (H.264 frente a H.265) es irrelevante para la precisión de la transcripción.

El problema de las múltiples pistas de audio

Este es el fallo silencioso más común en la transcripción de MP4. Un archivo MP4 puede contener legítimamente varias pistas de audio en un único contenedor, y la mayoría de las herramientas de transcripción usan por defecto la pista con índice 0 sin avisarte.

Dónde te encuentras con esto:

  • Contenido doblado: un MP4 de película o documental puede tener comentarios en inglés en la pista 0 y el idioma original en la pista 1, o al revés, según cómo se empaquetó.
  • Grabaciones de pantalla con OBS: OBS en modo de salida avanzada puede grabar el audio del juego en la pista 1 y un micrófono en la pista 2, ambos incrustados en el mismo MP4. Transcribir ese archivo con la configuración predeterminada te da una sola pista mezclada, no necesariamente la que contiene la voz.
  • Exportaciones de conferencias multilingües: algunas plataformas de seminarios web incrustan una pista de intérprete como pista 2. La detección automática sobre un archivo que empieza en inglés pero contiene francés en la pista 2 producirá un desastre.
  • Grabaciones de comentarios: configuraciones de podcast que graban una mezcla bruta más una pista individual por hablante en pistas incrustadas separadas.

Para ver con qué estás lidiando antes de subir, ejecuta ffprobe localmente:

ffprobe -i video.mp4 -show_streams -select_streams a -v quiet

Eso lista cada pista de audio, su códec, etiqueta de idioma y disposición de canales. Si ves dos o más pistas, decide cuál quieres y especifícala al subir (si la herramienta admite selección de pistas) o extrae primero solo esa pista:

ffmpeg -i video.mp4 -map 0:a:1 -c copy track2.m4a

(Sustituye 0:a:1 por el índice de la pista que quieras, empezando en cero.)

Grabaciones de pantalla frente a material de cámara: perfiles de calidad distintos

Ambos producen archivos MP4, pero se comportan de forma muy diferente para la transcripción.

Material de cámara (teléfono, cámara sin espejo, videocámara): el audio lo captura un micrófono físico en un espacio físico. La calidad se degrada con la distancia. Una entrevista rodada a 30 cm del micrófono del teléfono se transcribe con una precisión del 96-98 %. Una mesa redonda filmada desde 10 metros con el micrófono de sala baja al 85-90 %, a veces menos si hay eco significativo o ruido de climatización.

Grabaciones de pantalla (OBS, Loom, ScreenFlow, Camtasia, Game Bar de Windows, Captura de pantalla de macOS): la fuente de audio suele ser un micrófono USB o de auriculares situado a unos centímetros de la boca del hablante. Esto es casi ideal para la transcripción. La relación señal-ruido es alta, no hay reverberación de sala, bitrate constante (normalmente AAC de 128-320 kbps). El desafío no es la calidad del audio; es el vocabulario. Las grabaciones de pantalla tienden a contener sintaxis de línea de comandos, nombres de bibliotecas, mensajes de error, atajos de teclado y nombres de productos que los modelos de reconocimiento de voz no han visto con frecuencia. Espera errores ocasionales en términos técnicos incluso cuando la precisión en palabras conversacionales supera el 97 %.

Una diferencia estructural: las grabaciones de pantalla suelen producir una única pista mono o estéreo sin variación a lo largo de todo el archivo. El material de cámara a veces cambia de calidad a mitad del archivo (el hablante se aleja del micrófono, el ruido del público aumenta). Para el caso de la cámara, una edición limpia antes de subir gana a una corrección posterior más larga sobre la transcripción.

Tamaños de archivo y qué hacer cuando tu MP4 es demasiado grande

FuenteResolución / FPSTamaño aproximado por minuto
iPhone 16 (HEVC H.265)4K 30 fps~350 MB/min
iPhone 16 (HEVC H.265)1080p 30 fps~60 MB/min
Grabación en la nube de Zoom1080p (H.264, AAC 128 kbps)~70-120 MB/min
Grabación de pantalla con OBS1080p 60 fps (H.264)~150-400 MB/min (según el bitrate)
Teléfono Android (H.264)1080p 30 fps~100-200 MB/min
Seminario web exportado (comprimido)720p H.264~20-50 MB/min

La mayoría de las herramientas de transcripción aceptan archivos de hasta 500 MB a 2 GB. Una reunión de Zoom de 1 hora (~4,2-7,2 GB) puede superar ese límite.

Tus opciones, ordenadas por esfuerzo:

  1. Sube a una herramienta que acepte archivos grandes vía URL. Si tu MP4 es accesible mediante una URL (un vídeo de YouTube, un enlace compartido de Loom, un enlace de grabación en la nube de Zoom), sáltate por completo la descarga. La herramienta de vídeo a texto de ConvertAudioToText acepta URLs directas precisamente por esta razón.

  2. Extrae solo el audio antes de subir. Un MP4 de 1080p de 1 hora puede pesar 4 GB; el audio AAC extraído de él ronda los 55-70 MB. No se pierde calidad para fines de transcripción porque descartas la señal de vídeo, no la de audio. El comando de ffmpeg es una copia sin pérdidas de la pista de audio:

    ffmpeg -i recording.mp4 -vn -c:a copy audio.m4a
    
  3. Divide en un corte natural. Si necesitas marcas de tiempo a nivel de palabra que abarquen toda la grabación, dividir y volver a unir las marcas manualmente es tedioso. Extraer es más fácil.

La trampa del HEVC

Los dispositivos de Apple graban en HEVC (H.265) por defecto desde 2017. Los contenedores HEVC siguen llevando la extensión .mp4, así que el nombre del archivo no te dice nada. La mayoría de las herramientas de transcripción actuales manejan HEVC bien porque pasan el contenedor por ffmpeg, que tiene un soporte sólido de HEVC. Pero algunas herramientas antiguas o herramientas de subida basadas en navegador intentan leer el vídeo en el cliente antes de enviarlo, y los navegadores antiguos no pueden decodificar H.265. Si obtienes un error de «formato no compatible» en un archivo que claramente es MP4, el códec de vídeo es el sospechoso habitual.

Solución: extrae primero el audio (el comando anterior), lo que produce un archivo AAC puro que cualquier herramienta acepta. O recodifica el vídeo a H.264:

ffmpeg -i hevc_video.mp4 -c:v libx264 -c:a copy h264_video.mp4

Esto es más lento y genera un archivo más grande; mejor opta por la extracción de solo audio si únicamente necesitas la transcripción.

De dónde vienen estos archivos (y qué vigilar)

Grabaciones en la nube de Zoom

Zoom codifica las grabaciones en la nube como vídeo H.264 con audio AAC a aproximadamente 64-128 kbps mono. El audio tiene banda limitada y está comprimido para minimizar el almacenamiento, lo que significa que elimina las frecuencias fuera del rango del habla. Eso en realidad es bueno para la transcripción: las frecuencias altas que causan ruido desaparecen y el modelo recibe una señal de voz limpia. La precisión en reuniones de Zoom con uno o dos hablantes suele ser del 95-97 % en inglés claro, menor con acentos fuertes o habla rápida.

Para un flujo específico de Zoom sin descargar primero el MP4, la guía para transcribir reuniones de Zoom explica el acceso a nivel de plataforma.

Vídeos de iPhone y Android

Los iPhone graban en contenedores MOV (H.264 o HEVC, audio AAC) y pueden compartirse como MP4 con el mismo contenido dentro. Los dispositivos Android graban MP4 directamente. Cualquiera de los dos se sube y transcribe sin intervención. La advertencia sobre el tamaño del archivo es real: un clip de 10 minutos de iPhone en 4K a 30 fps pesa unos 3,5 GB. Extrae el audio antes de subir.

Grabaciones de pantalla de OBS

Los usuarios de OBS en modo de salida avanzada a veces tienen 6 pistas de audio incrustadas en un mismo MP4. La pista 1 suele ser la mezcla completa; las pistas siguientes son pistas individuales por cada fuente. Si tu transcripción está en un idioma que no esperabas, o está transcribiendo el audio del juego en lugar de tu locución, estás en la pista equivocada. Usa ffprobe para ver qué hay y luego extrae la pista concreta.

Para añadir subtítulos de nuevo al material grabado después de transcribir, la herramienta generadora de subtítulos produce archivos SRT y VTT que puedes volver a importar en OBS o en cualquier editor de vídeo.

Descargas de YouTube

Si descargaste un vídeo de YouTube con yt-dlp o una herramienta similar, el MP4 resultante lleva el audio a la calidad con la que YouTube lo sirvió, normalmente AAC de 128 kbps para el estándar y 256 kbps para contenido elegible de Premium. Ambos son suficientes para la transcripción. La herramienta generadora de transcripciones de YouTube se salta por completo el paso de descarga leyendo la URL directamente.

Grabaciones de conferencias y eventos

Las exportaciones de conferencias multicámara suelen tener audio procedente del sistema de megafonía de la sala, no de una corbatera en el ponente. Espera una precisión del 85-92 % si la sala es grande o tiene ruido de público. Si el archivo vino de un proveedor que mezcló alimentaciones de micrófono separadas antes de exportar, la precisión es mayor. Comprueba el audio en VLC o en cualquier reproductor antes de subir: si a tu oído suena apagado, al modelo también le costará.

Qué pasa del lado del servidor

Subes el MP4. El backend de transcripción ejecuta algo equivalente a:

  1. Inspeccionar el contenedor e identificar todas las pistas de audio.
  2. Extraer la pista 0 (o la pista especificada por el usuario) a un archivo de audio temporal. Es una operación de copia sin pérdidas: ffmpeg -i input.mp4 -map 0:a:0 -vn -c:a copy temp.m4a.
  3. Remuestrear a PCM mono de 16 kHz, el formato que esperan los modelos tipo Whisper y tipo Deepgram.
  4. Dividir en ventanas de 30 segundos con solapamientos de 5 segundos para mayor precisión en los límites.
  5. Ejecutar la inferencia y volver a unir las marcas de tiempo a nivel de palabra.
  6. Aplicar restauración de puntuación, diarización de hablantes (si está activada) y posprocesamiento.
  7. Eliminar el archivo temporal.

El paso que consume más tiempo en un archivo grande es el paso 3 (remuestreo), especialmente en archivos 4K HEVC donde la lectura del contenedor es lenta. Un archivo de audio preextraído se salta por completo los pasos 1-2.

Si el MP4 tiene una pista de vídeo con framerate variable (común en grabaciones de pantalla de ciertas aplicaciones), las marcas de tiempo del audio siguen siendo correctas después de la extracción porque no estás recodificando nada: -c:a copy conserva el tiempo exacto a partir de las marcas de tiempo de la pista de audio, independientemente de la pista de vídeo.

Cómo subir: la versión corta

  1. Abre la herramienta de transcripción y arrastra tu MP4, o pega una URL si el archivo está alojado.
  2. Comprueba: si el archivo tiene varias pistas de audio y no estás seguro de cuál contiene la voz, extrae primero la correcta usando ffprobe y ffmpeg.
  3. Selecciona manualmente el idioma hablado. La detección automática funciona, pero la selección manual añade 2-5 puntos de precisión en contenido con acento o multilingüe.
  4. Envía. Una grabación de Zoom de 1080p de 30 minutos suele devolverse en 3-6 minutos.
  5. Revisa nombres propios, términos técnicos y cualquier segmento con interferencia de voces donde los hablantes se solaparon.
  6. Exporta como TXT, DOCX, SRT o VTT según necesites el contenido para leerlo, editarlo o subtitularlo.

Si solo necesitas una transcripción sin crear una cuenta, ConvertAudioToText transcribe los primeros 10 minutos de un MP4 sin cuenta, y una cuenta gratuita añade 10 minutos de transcripción que se otorgan una sola vez al registrarte, sin tarjeta de crédito.

Preguntas frecuentes

¿Necesito extraer el audio de un MP4 antes de transcribirlo?

No. Sube el MP4 directamente. Los servicios de transcripción extraen el audio del lado del servidor usando ffmpeg o una biblioteca equivalente. La extracción manual solo es útil si tu archivo supera el límite de tamaño del servicio, en cuyo caso extraer el audio reduce el archivo a una fracción de su tamaño original sin ninguna pérdida de calidad.

Mi transcripción del MP4 salió en el idioma equivocado. ¿Qué ocurrió?

Dos causas probables. Primera, la detección automática falló en un archivo con una introducción corta o con acento: configura el idioma manualmente. Segunda, y más común de lo que la gente espera, tu MP4 tiene varias pistas de audio y la herramienta transcribió la pista 0, que está en un idioma distinto al que querías. Ejecuta ffprobe -i video.mp4 -show_streams -select_streams a para listar todas las pistas de audio y sus etiquetas de idioma, y luego extrae la correcta.

¿Por qué no puedo subir mi vídeo 4K del iPhone? Dice que el archivo es demasiado grande.

El iPhone graba en 4K a 30 fps aproximadamente 350 MB por minuto en HEVC. Un clip de 10 minutos ronda los 3,5 GB, lo que supera la mayoría de los límites de subida. Ejecuta ffmpeg -i input.mp4 -vn -c:a copy audio.m4a para extraer solo el audio, que ocupará unos 10-15 MB para esos mismos 10 minutos. Sube el archivo de audio en su lugar.

¿Afecta un vídeo HEVC (H.265) dentro de un MP4 a la calidad de la transcripción?

No. El códec de vídeo se descarta durante la extracción del audio. HEVC frente a H.264 no influye en la precisión de la transcripción. El único problema práctico es que algunas herramientas de subida basadas en navegador intentan decodificar el vídeo en el cliente antes de subirlo, y los navegadores antiguos no pueden decodificar H.265. Si te aparece un error de «formato no compatible», extrae primero el audio o recodifica el vídeo a H.264.

Mi grabación de OBS tiene pistas de audio separadas para el juego y el micrófono. ¿Transcribirá la herramienta ambas?

La mayoría de las herramientas transcriben solo la pista 0, que en una configuración multipista típica de OBS es el audio mezclado completo. Si quieres solo la pista del micrófono (normalmente la pista 1 en la configuración predeterminada de OBS), extráela antes de subir: ffmpeg -i recording.mp4 -map 0:a:1 -c copy mic.m4a. Transcribir solo la pista del micrófono mejora la precisión de la diarización de hablantes si otras fuentes de audio se colaban en la mezcla.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles