Cómo convertir MKV a texto: audio multicanal y grabaciones de OBS
transcripciónvídeomkv

Cómo convertir MKV a texto: audio multicanal y grabaciones de OBS

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

La versión corta

Sube tu MKV a una herramienta de transcripción y funciona, con una salvedad: si tu archivo tiene varias pistas de audio (algo común en grabaciones de OBS, rips de Blu-ray y configuraciones con varios micrófonos), necesitas saber qué pista contiene el audio que realmente quieres. Ejecuta un ffprobe rápido primero, mapea la pista correcta y el resto es rutina.

Las grabaciones MKV se suben tal cual; se usa la pista de audio predeterminada
Las grabaciones MKV se suben tal cual; se usa la pista de audio predeterminada

Qué es MKV y de dónde provienen tus archivos

MKV (Matroska Video) es el contenedor de vídeo más flexible de uso común. A diferencia del MP4, no impone límites estrictos en el número de pistas de audio, pistas de subtítulos o capítulos dentro de un solo archivo. Esa flexibilidad es la razón por la que MKV es común en:

  • Grabaciones de OBS Studio (recomendado para trabajo multicanal, aunque OBS 32 cambió el valor predeterminado para nuevas instalaciones)
  • DVDs y Blu-rays ripeados con varios idiomas de audio
  • Archivos de anime y televisión con audio en idioma original más doblaje
  • Configuraciones de podcast con varios micrófonos, donde cada micrófono queda en su propia pista
  • Grabaciones de conferencias con alimentaciones de micrófono separadas por ponente
  • Grabadoras de pantalla de Linux como SimpleScreenRecorder y Kazam

Para la transcripción, el soporte multicanal de MKV es a la vez una ventaja y una complicación. Necesitas elegir la pista correcta antes de transcribir.

El formato predeterminado de OBS cambió en la versión 32

El consejo habitual de que «OBS graba en MKV de forma predeterminada» ya está desactualizado. OBS 30.2 introdujo Hybrid MP4 (un MP4 fragmentado resistente a fallos), y OBS 32.0 convirtió Hybrid MP4/MOV en el contenedor predeterminado para nuevas instalaciones. Si instalaste OBS recientemente, es posible que ya estés obteniendo archivos Hybrid MP4, no MKV.

Dicho esto, MKV sigue siendo el formato recomendado para la grabación multicanal. La protección contra fallos de Hybrid MP4 cubre el caso de uso de una sola pista. El MKV multicanal sigue siendo la mejor opción cuando quieres audio aislado por fuente, porque:

  • MKV admite hasta 6 pistas de audio en OBS (Hybrid MP4 normalmente graba como una única secuencia combinada)
  • Siempre puedes remultiplexar MKV a MP4 mediante Archivo > Remux grabaciones sin volver a codificar
  • Los editores y las herramientas de transcripción pueden entonces seleccionar la pista específica que necesitan

Mi opinión: si estás grabando un podcast, una entrevista o una conferencia con micrófonos separados, usa MKV en OBS de forma explícita. Si estás grabando una captura de pantalla de una sola fuente o una captura de juego, Hybrid MP4 está bien y es más sencillo.

Qué contienen realmente las pistas de un MKV de OBS

La documentación de OBS describe la Pista 1 como la mezcla combinada «todas las fuentes» predeterminada. Las pistas 2 a 6 son donde enrutas fuentes aisladas en Propiedades de audio avanzadas. Una configuración multicanal típica de OBS podría verse así:

  • Pista 1: Mezcla estéreo combinada de todo (pista de reproducción predeterminada)
  • Pista 2: Solo tu micrófono
  • Pista 3: Solo audio de escritorio/juego
  • Pista 4: Comunicaciones (Discord, llamadas)

Para la transcripción, la Pista 2 (solo micrófono) es casi siempre lo que quieres. La Pista 1 capta pulsaciones de teclas, audio del juego y ruido de fondo junto con tu voz.

Paso 1: Inspecciona tus pistas antes de subir

Diez segundos con ffprobe te ahorran transcribir el idioma equivocado o una mezcla combinada cargada de ruido. Ejecuta:

ffprobe -v error -show_streams -select_streams a -of json input.mkv

Esto muestra cada secuencia de audio con su índice, nombre de códec, número de canales y etiqueta de idioma. Para un rip típico de Blu-ray podrías ver:

  • Secuencia 0:1 - AC3, 6 canales, lang: eng
  • Secuencia 0:2 - AAC, 2 canales, lang: spa
  • Secuencia 0:3 - AC3, 2 canales, lang: fra (comentario del director)

Para un MKV multicanal típico de OBS:

  • Secuencia 0:1 - AAC, 2 canales (mezcla combinada)
  • Secuencia 0:2 - AAC, 1 canal (micrófono)
  • Secuencia 0:3 - AAC, 2 canales (audio de escritorio)

Identifica el índice de la secuencia antes de continuar. Los índices de pista comienzan en cero en ffmpeg (la segunda pista de audio es 0:a:1).

Paso 2: Extrae la pista correcta

Si tu MKV tiene una sola pista de audio, súbelo tal cual. Si tiene varias pistas, extrae primero la que necesites. Esto también reduce drásticamente el tamaño del archivo. Un MKV de película de 90 minutos puede pesar entre 8 y 15 GB; la pista de audio sola suele pesar entre 100 y 300 MB.

Extrae una pista de audio específica sin volver a codificar:

ffmpeg -i video.mkv -map 0:a:1 -c:a copy track2.m4a

Sustituye 0:a:1 por 0:a:2 para la tercera pista de audio, y así sucesivamente.

Si el archivo es demasiado grande para subirlo por culpa del vídeo, elimina el vídeo por completo:

ffmpeg -i in.mkv -vn -c:a copy audio.mka

La extensión .mka es Matroska Audio, un contenedor que aceptan la mayoría de herramientas de transcripción. También puedes usar .aac, .mp3 o .m4a según el códec de origen.

Paso 3: Gestiona la compatibilidad de códecs

MKV puede contener códecs que confunden a las herramientas de transcripción basadas en web. Los más comunes:

AC3 y AAC funcionan en todas partes. No hace falta hacer nada.

Opus funciona en todas partes. Las grabaciones de OBS suelen usar Opus.

FLAC funciona en la mayoría de herramientas. Es sin pérdida y pesado, pero los servicios de transcripción lo manejan.

DTS y DTS-HD son comunes en rips de Blu-ray y a menudo son rechazados por las herramientas en línea. Convierte primero:

ffmpeg -i bluray.mkv -map 0:a:0 -c:a libmp3lame -b:a 192k audio.mp3

TrueHD (Dolby Atmos) también es un elemento básico de Blu-ray y tiene el mismo problema. Misma solución, mismo comando; solo especifica el índice de secuencia correcto.

El audio multicanal (5.1, 7.1) puede confundir la detección de hablantes. Para voz a texto puro, reduce la mezcla a estéreo o mono:

ffmpeg -i input.mkv -map 0:a:0 -ac 2 -c:a aac output.m4a

Paso 4: Sube y configura el idioma

Haz coincidir el idioma de transcripción con la pista de audio que extrajiste. Si estás transcribiendo la pista en español, configura español en la herramienta. La discrepancia de idioma es la causa más común de resultados de transcripción ilegibles.

Para flujos de trabajo de vídeo a texto, puedes usar la herramienta de vídeo a texto de ConvertAudioToText. Arrastra el archivo, configura el idioma y déjalo correr. Una grabación de 2 horas termina en unos 10 a 20 minutos según la carga de la cola.

Si quieres precisión por hablante en una grabación con varios micrófonos en lugar de depender de la diarización automática, consulta diarización de hablantes explicada para saber cuándo la extracción por pista supera a la división de hablantes con IA.

El atajo de la pista de subtítulos (cuando aplica)

MKV puede llevar pistas de subtítulos incrustadas junto a su audio. Existen dos tipos distintos:

Subtítulos basados en texto (SRT, ASS, SSA): Se almacenan como secuencias de texto legibles. Si tu MKV ya tiene subtítulos precisos, puedes extraerlos directamente sin ejecutar ninguna transcripción:

ffmpeg -i video.mkv -map 0:s:0 subtitles.srt

Es instantáneo y gratuito. Solo funciona si los subtítulos ya existen y son precisos.

Subtítulos PGS (subtítulos de imagen de Blu-ray): Se almacenan como imágenes de mapa de bits, no como texto. ffmpeg -map 0:s:0 exportará un archivo .sup, no texto legible. Convertir PGS a SRT requiere software de OCR (el módulo OCR de Subtitle Edit es la herramienta estándar), y el resultado normalmente necesita limpieza manual. Para rips de Blu-ray con subtítulos PGS, volver a transcribir el audio suele ser más rápido y preciso que ejecutar OCR sobre mapas de bits de imágenes.

Para comprobar qué tipo de subtítulos tiene tu MKV:

ffprobe -v error -show_streams -select_streams s -of json input.mkv

Mira el campo codec_name. subrip o ass significa basado en texto. hdmv_pgs_subtitle significa PGS de mapa de bits basado en imagen.

Flujos de trabajo MKV por fuente

Grabaciones de OBS

Para archivos MKV multicanal de OBS, extrae siempre la pista de solo micrófono (normalmente la Pista 2) antes de transcribir. La mezcla combinada de la Pista 1 incluye ruido de teclado, audio del juego y sonidos de notificación que degradan la precisión.

Si grabaste directos y quieres quedarte solo con la voz, activa el audio multicanal en OBS antes de tu próxima sesión de grabación: Configuración > Salida > Grabación > casillas de Pista de audio. Una vez configurado, el MKV separará cada fuente.

DVDs y Blu-rays ripeados

Los rips de DVD suelen tener varias pistas de idiomas además de comentarios. Las etiquetas de idioma son tu guía, pero no siempre son precisas. Haz una comprobación rápida con VLC cambiando manualmente entre las pistas de audio antes de ponerte a transcribir. Para un proyecto de investigación cinematográfica, considera si quieres la pista en idioma original (diálogos autoritativos) o una pista doblada (puede diferir del guion original en fraseo y sincronización).

Las pistas de comentario del director a menudo se transcriben por error cuando los usuarios olvidan especificar una pista. Comprueba con ffprobe primero.

Grabaciones de conferencias y con varios micrófonos

Los sistemas de grabación multisala y con varios micrófonos pueden producir MKV con una pista por micrófono. En cuanto a la calidad de la transcripción, transcribir las pistas individuales de cada micrófono por separado supera a confiar en la diarización aplicada a una mezcla combinada con ruido.

Extrae cada pista, transcribe cada una por separado y luego combina los resultados en orden de marca de tiempo. Esto produce una atribución limpia de hablantes sin ninguna ambigüedad de detección de hablantes. Para saber más sobre cuándo ese compromiso merece los pasos adicionales, consulta diarización de hablantes explicada.

Grabadoras de pantalla de Linux

OBS, SimpleScreenRecorder y Kazam en Linux producen todos MKV. La calidad del audio depende del backend de audio. PipeWire (el predeterminado moderno en la mayoría de distribuciones actuales) captura limpiamente a 48 kHz. Las configuraciones antiguas de PulseAudio pueden introducir cortes cada pocos segundos durante grabaciones largas. Si tu MKV tiene fallos de audio periódicos, comprueba si una migración a PipeWire en tu sistema lo solucionaría antes de culpar a la herramienta de transcripción.

MKV frente a otros contenedores multicanal

ContenedorPistas de audioPistas de subtítulosSoporte de herramientasIdeal para
MKVIlimitadasIlimitadas (texto + PGS)BuenoArchivo, multiidioma, varios micrófonos
MP4VariasLimitadas (sin PGS)ExcelenteDistribución en un solo idioma
MOVVariasLimitadasCentrado en AppleiPhone, ProRes, Final Cut
WebMLimitadasSolo VTTNativo del navegadorInserciones web

MKV es el contenedor adecuado para contenido con múltiples versiones de audio o subtítulos. No es la elección correcta si necesitas máxima compatibilidad con dispositivos de consumo o plataformas de streaming, que esperan MP4. Consulta formatos de audio compatibles para transcripción para saber cómo los diferentes contenedores afectan a la compatibilidad de subida entre herramientas.

Problemas comunes de transcripción de MKV

Idioma incorrecto en la transcripción

Tu herramienta usó la Pista 1 por defecto. Si tu MKV tiene audio en inglés y español, y necesitabas el español, vuelve a extraer con -map 0:a:1 y vuelve a subirlo.

Error de «códec no compatible»

Casi seguro que es DTS o TrueHD de un rip de Blu-ray. Convierte a MP3 o AAC con el comando ffmpeg de la sección de códecs anterior.

La etiqueta de idioma es incorrecta

Algunos codificadores etiquetan mal las pistas. Un archivo etiquetado como «eng» que reproduce audio en japonés es común en rips antiguos. No confíes a ciegas en la etiqueta. Verifica escuchando una muestra de 30 segundos en VLC.

Marcadores de capítulo de MKV que causan errores de segmentación

Algunas herramientas fallan con los marcadores de capítulo Matroska incrustados en el archivo. Elimínalos:

ffmpeg -i in.mkv -map 0 -map_chapters -1 -c copy out.mkv

Archivo demasiado grande para subirlo

La secuencia de vídeo es la causa. Una película de 2 horas a 1080p pesa entre 8 y 15 GB. La secuencia de audio pesa entre 100 y 300 MB. Elimina primero el vídeo con el comando -vn anterior.

Si quieres una vía rápida sin registro para un único MKV sin complicaciones de pistas, ConvertAudioToText acepta subidas de MKV y las procesa sin cuenta durante hasta 10 minutos. El nivel gratuito con sesión iniciada da 10 minutos de transcripción, otorgados una sola vez al registrarte en lugar de cada mes; el nivel Pro a $9,99/mes elimina el límite por completo.

Preguntas frecuentes

¿Puedo transcribir varias pistas de audio a la vez?

La mayoría de las herramientas transcriben una pista por trabajo. Para archivos MKV multicanal, ejecuta trabajos de transcripción separados por pista y luego combina los resultados en orden de marca de tiempo. Es el enfoque más limpio para podcasts con varios hablantes donde cada uno tiene su propia pista, y es más fiable que la diarización automática de hablantes.

¿Es la calidad de audio de MKV mejor que la de MP4?

El contenedor no afecta a la calidad del audio. MKV puede contener códecs de mayor calidad (FLAC, DTS-HD, TrueHD) que el MP4 estándar, pero un MKV típico de OBS usa el mismo AAC que usa el MP4. La elección del códec importa; la del contenedor, no.

¿Puedo transcribir MKV gratis?

Sí. ConvertAudioToText acepta archivos MKV y procesa hasta 10 minutos sin cuenta, y un plan gratuito añade 10 minutos de transcripción otorgados una sola vez al registrarte. Para archivos más largos o flujos de trabajo multicanal por hablante, el nivel Pro a $9,99/mes elimina el límite por completo.

¿Qué pasa con los archivos MKV sin etiqueta de idioma de audio?

Ábrelo en VLC y escucha unos segundos de cada pista en Audio > Pista de audio. O confía en el orden: en la mayoría de los rips de películas, la pista 1 es el idioma original y las siguientes son doblajes. No está garantizado, pero es un punto de partida razonable antes de ejecutar ffprobe.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles