
Cómo convertir MKV a texto: audio multicanal y grabaciones de OBS
Summarize this article with:
La versión corta
Sube tu MKV a una herramienta de transcripción y funciona, con una salvedad: si tu archivo tiene varias pistas de audio (algo común en grabaciones de OBS, rips de Blu-ray y configuraciones con varios micrófonos), necesitas saber qué pista contiene el audio que realmente quieres. Ejecuta un ffprobe rápido primero, mapea la pista correcta y el resto es rutina.

Qué es MKV y de dónde provienen tus archivos
MKV (Matroska Video) es el contenedor de vídeo más flexible de uso común. A diferencia del MP4, no impone límites estrictos en el número de pistas de audio, pistas de subtítulos o capítulos dentro de un solo archivo. Esa flexibilidad es la razón por la que MKV es común en:
- Grabaciones de OBS Studio (recomendado para trabajo multicanal, aunque OBS 32 cambió el valor predeterminado para nuevas instalaciones)
- DVDs y Blu-rays ripeados con varios idiomas de audio
- Archivos de anime y televisión con audio en idioma original más doblaje
- Configuraciones de podcast con varios micrófonos, donde cada micrófono queda en su propia pista
- Grabaciones de conferencias con alimentaciones de micrófono separadas por ponente
- Grabadoras de pantalla de Linux como SimpleScreenRecorder y Kazam
Para la transcripción, el soporte multicanal de MKV es a la vez una ventaja y una complicación. Necesitas elegir la pista correcta antes de transcribir.
El formato predeterminado de OBS cambió en la versión 32
El consejo habitual de que «OBS graba en MKV de forma predeterminada» ya está desactualizado. OBS 30.2 introdujo Hybrid MP4 (un MP4 fragmentado resistente a fallos), y OBS 32.0 convirtió Hybrid MP4/MOV en el contenedor predeterminado para nuevas instalaciones. Si instalaste OBS recientemente, es posible que ya estés obteniendo archivos Hybrid MP4, no MKV.
Dicho esto, MKV sigue siendo el formato recomendado para la grabación multicanal. La protección contra fallos de Hybrid MP4 cubre el caso de uso de una sola pista. El MKV multicanal sigue siendo la mejor opción cuando quieres audio aislado por fuente, porque:
- MKV admite hasta 6 pistas de audio en OBS (Hybrid MP4 normalmente graba como una única secuencia combinada)
- Siempre puedes remultiplexar MKV a MP4 mediante Archivo > Remux grabaciones sin volver a codificar
- Los editores y las herramientas de transcripción pueden entonces seleccionar la pista específica que necesitan
Mi opinión: si estás grabando un podcast, una entrevista o una conferencia con micrófonos separados, usa MKV en OBS de forma explícita. Si estás grabando una captura de pantalla de una sola fuente o una captura de juego, Hybrid MP4 está bien y es más sencillo.
Qué contienen realmente las pistas de un MKV de OBS
La documentación de OBS describe la Pista 1 como la mezcla combinada «todas las fuentes» predeterminada. Las pistas 2 a 6 son donde enrutas fuentes aisladas en Propiedades de audio avanzadas. Una configuración multicanal típica de OBS podría verse así:
- Pista 1: Mezcla estéreo combinada de todo (pista de reproducción predeterminada)
- Pista 2: Solo tu micrófono
- Pista 3: Solo audio de escritorio/juego
- Pista 4: Comunicaciones (Discord, llamadas)
Para la transcripción, la Pista 2 (solo micrófono) es casi siempre lo que quieres. La Pista 1 capta pulsaciones de teclas, audio del juego y ruido de fondo junto con tu voz.
Paso 1: Inspecciona tus pistas antes de subir
Diez segundos con ffprobe te ahorran transcribir el idioma equivocado o una mezcla combinada cargada de ruido. Ejecuta:
ffprobe -v error -show_streams -select_streams a -of json input.mkv
Esto muestra cada secuencia de audio con su índice, nombre de códec, número de canales y etiqueta de idioma. Para un rip típico de Blu-ray podrías ver:
- Secuencia 0:1 - AC3, 6 canales, lang: eng
- Secuencia 0:2 - AAC, 2 canales, lang: spa
- Secuencia 0:3 - AC3, 2 canales, lang: fra (comentario del director)
Para un MKV multicanal típico de OBS:
- Secuencia 0:1 - AAC, 2 canales (mezcla combinada)
- Secuencia 0:2 - AAC, 1 canal (micrófono)
- Secuencia 0:3 - AAC, 2 canales (audio de escritorio)
Identifica el índice de la secuencia antes de continuar. Los índices de pista comienzan en cero en ffmpeg (la segunda pista de audio es 0:a:1).
Paso 2: Extrae la pista correcta
Si tu MKV tiene una sola pista de audio, súbelo tal cual. Si tiene varias pistas, extrae primero la que necesites. Esto también reduce drásticamente el tamaño del archivo. Un MKV de película de 90 minutos puede pesar entre 8 y 15 GB; la pista de audio sola suele pesar entre 100 y 300 MB.
Extrae una pista de audio específica sin volver a codificar:
ffmpeg -i video.mkv -map 0:a:1 -c:a copy track2.m4a
Sustituye 0:a:1 por 0:a:2 para la tercera pista de audio, y así sucesivamente.
Si el archivo es demasiado grande para subirlo por culpa del vídeo, elimina el vídeo por completo:
ffmpeg -i in.mkv -vn -c:a copy audio.mka
La extensión .mka es Matroska Audio, un contenedor que aceptan la mayoría de herramientas de transcripción. También puedes usar .aac, .mp3 o .m4a según el códec de origen.
Paso 3: Gestiona la compatibilidad de códecs
MKV puede contener códecs que confunden a las herramientas de transcripción basadas en web. Los más comunes:
AC3 y AAC funcionan en todas partes. No hace falta hacer nada.
Opus funciona en todas partes. Las grabaciones de OBS suelen usar Opus.
FLAC funciona en la mayoría de herramientas. Es sin pérdida y pesado, pero los servicios de transcripción lo manejan.
DTS y DTS-HD son comunes en rips de Blu-ray y a menudo son rechazados por las herramientas en línea. Convierte primero:
ffmpeg -i bluray.mkv -map 0:a:0 -c:a libmp3lame -b:a 192k audio.mp3
TrueHD (Dolby Atmos) también es un elemento básico de Blu-ray y tiene el mismo problema. Misma solución, mismo comando; solo especifica el índice de secuencia correcto.
El audio multicanal (5.1, 7.1) puede confundir la detección de hablantes. Para voz a texto puro, reduce la mezcla a estéreo o mono:
ffmpeg -i input.mkv -map 0:a:0 -ac 2 -c:a aac output.m4a
Paso 4: Sube y configura el idioma
Haz coincidir el idioma de transcripción con la pista de audio que extrajiste. Si estás transcribiendo la pista en español, configura español en la herramienta. La discrepancia de idioma es la causa más común de resultados de transcripción ilegibles.
Para flujos de trabajo de vídeo a texto, puedes usar la herramienta de vídeo a texto de ConvertAudioToText. Arrastra el archivo, configura el idioma y déjalo correr. Una grabación de 2 horas termina en unos 10 a 20 minutos según la carga de la cola.
Si quieres precisión por hablante en una grabación con varios micrófonos en lugar de depender de la diarización automática, consulta diarización de hablantes explicada para saber cuándo la extracción por pista supera a la división de hablantes con IA.
El atajo de la pista de subtítulos (cuando aplica)
MKV puede llevar pistas de subtítulos incrustadas junto a su audio. Existen dos tipos distintos:
Subtítulos basados en texto (SRT, ASS, SSA): Se almacenan como secuencias de texto legibles. Si tu MKV ya tiene subtítulos precisos, puedes extraerlos directamente sin ejecutar ninguna transcripción:
ffmpeg -i video.mkv -map 0:s:0 subtitles.srt
Es instantáneo y gratuito. Solo funciona si los subtítulos ya existen y son precisos.
Subtítulos PGS (subtítulos de imagen de Blu-ray): Se almacenan como imágenes de mapa de bits, no como texto. ffmpeg -map 0:s:0 exportará un archivo .sup, no texto legible. Convertir PGS a SRT requiere software de OCR (el módulo OCR de Subtitle Edit es la herramienta estándar), y el resultado normalmente necesita limpieza manual. Para rips de Blu-ray con subtítulos PGS, volver a transcribir el audio suele ser más rápido y preciso que ejecutar OCR sobre mapas de bits de imágenes.
Para comprobar qué tipo de subtítulos tiene tu MKV:
ffprobe -v error -show_streams -select_streams s -of json input.mkv
Mira el campo codec_name. subrip o ass significa basado en texto. hdmv_pgs_subtitle significa PGS de mapa de bits basado en imagen.
Flujos de trabajo MKV por fuente
Grabaciones de OBS
Para archivos MKV multicanal de OBS, extrae siempre la pista de solo micrófono (normalmente la Pista 2) antes de transcribir. La mezcla combinada de la Pista 1 incluye ruido de teclado, audio del juego y sonidos de notificación que degradan la precisión.
Si grabaste directos y quieres quedarte solo con la voz, activa el audio multicanal en OBS antes de tu próxima sesión de grabación: Configuración > Salida > Grabación > casillas de Pista de audio. Una vez configurado, el MKV separará cada fuente.
DVDs y Blu-rays ripeados
Los rips de DVD suelen tener varias pistas de idiomas además de comentarios. Las etiquetas de idioma son tu guía, pero no siempre son precisas. Haz una comprobación rápida con VLC cambiando manualmente entre las pistas de audio antes de ponerte a transcribir. Para un proyecto de investigación cinematográfica, considera si quieres la pista en idioma original (diálogos autoritativos) o una pista doblada (puede diferir del guion original en fraseo y sincronización).
Las pistas de comentario del director a menudo se transcriben por error cuando los usuarios olvidan especificar una pista. Comprueba con ffprobe primero.
Grabaciones de conferencias y con varios micrófonos
Los sistemas de grabación multisala y con varios micrófonos pueden producir MKV con una pista por micrófono. En cuanto a la calidad de la transcripción, transcribir las pistas individuales de cada micrófono por separado supera a confiar en la diarización aplicada a una mezcla combinada con ruido.
Extrae cada pista, transcribe cada una por separado y luego combina los resultados en orden de marca de tiempo. Esto produce una atribución limpia de hablantes sin ninguna ambigüedad de detección de hablantes. Para saber más sobre cuándo ese compromiso merece los pasos adicionales, consulta diarización de hablantes explicada.
Grabadoras de pantalla de Linux
OBS, SimpleScreenRecorder y Kazam en Linux producen todos MKV. La calidad del audio depende del backend de audio. PipeWire (el predeterminado moderno en la mayoría de distribuciones actuales) captura limpiamente a 48 kHz. Las configuraciones antiguas de PulseAudio pueden introducir cortes cada pocos segundos durante grabaciones largas. Si tu MKV tiene fallos de audio periódicos, comprueba si una migración a PipeWire en tu sistema lo solucionaría antes de culpar a la herramienta de transcripción.
MKV frente a otros contenedores multicanal
| Contenedor | Pistas de audio | Pistas de subtítulos | Soporte de herramientas | Ideal para |
|---|---|---|---|---|
| MKV | Ilimitadas | Ilimitadas (texto + PGS) | Bueno | Archivo, multiidioma, varios micrófonos |
| MP4 | Varias | Limitadas (sin PGS) | Excelente | Distribución en un solo idioma |
| MOV | Varias | Limitadas | Centrado en Apple | iPhone, ProRes, Final Cut |
| WebM | Limitadas | Solo VTT | Nativo del navegador | Inserciones web |
MKV es el contenedor adecuado para contenido con múltiples versiones de audio o subtítulos. No es la elección correcta si necesitas máxima compatibilidad con dispositivos de consumo o plataformas de streaming, que esperan MP4. Consulta formatos de audio compatibles para transcripción para saber cómo los diferentes contenedores afectan a la compatibilidad de subida entre herramientas.
Problemas comunes de transcripción de MKV
Idioma incorrecto en la transcripción
Tu herramienta usó la Pista 1 por defecto. Si tu MKV tiene audio en inglés y español, y necesitabas el español, vuelve a extraer con -map 0:a:1 y vuelve a subirlo.
Error de «códec no compatible»
Casi seguro que es DTS o TrueHD de un rip de Blu-ray. Convierte a MP3 o AAC con el comando ffmpeg de la sección de códecs anterior.
La etiqueta de idioma es incorrecta
Algunos codificadores etiquetan mal las pistas. Un archivo etiquetado como «eng» que reproduce audio en japonés es común en rips antiguos. No confíes a ciegas en la etiqueta. Verifica escuchando una muestra de 30 segundos en VLC.
Marcadores de capítulo de MKV que causan errores de segmentación
Algunas herramientas fallan con los marcadores de capítulo Matroska incrustados en el archivo. Elimínalos:
ffmpeg -i in.mkv -map 0 -map_chapters -1 -c copy out.mkv
Archivo demasiado grande para subirlo
La secuencia de vídeo es la causa. Una película de 2 horas a 1080p pesa entre 8 y 15 GB. La secuencia de audio pesa entre 100 y 300 MB. Elimina primero el vídeo con el comando -vn anterior.
Si quieres una vía rápida sin registro para un único MKV sin complicaciones de pistas, ConvertAudioToText acepta subidas de MKV y las procesa sin cuenta durante hasta 10 minutos. El nivel gratuito con sesión iniciada da 10 minutos de transcripción, otorgados una sola vez al registrarte en lugar de cada mes; el nivel Pro a $9,99/mes elimina el límite por completo.
Preguntas frecuentes
¿Puedo transcribir varias pistas de audio a la vez?
La mayoría de las herramientas transcriben una pista por trabajo. Para archivos MKV multicanal, ejecuta trabajos de transcripción separados por pista y luego combina los resultados en orden de marca de tiempo. Es el enfoque más limpio para podcasts con varios hablantes donde cada uno tiene su propia pista, y es más fiable que la diarización automática de hablantes.
¿Es la calidad de audio de MKV mejor que la de MP4?
El contenedor no afecta a la calidad del audio. MKV puede contener códecs de mayor calidad (FLAC, DTS-HD, TrueHD) que el MP4 estándar, pero un MKV típico de OBS usa el mismo AAC que usa el MP4. La elección del códec importa; la del contenedor, no.
¿Puedo transcribir MKV gratis?
Sí. ConvertAudioToText acepta archivos MKV y procesa hasta 10 minutos sin cuenta, y un plan gratuito añade 10 minutos de transcripción otorgados una sola vez al registrarte. Para archivos más largos o flujos de trabajo multicanal por hablante, el nivel Pro a $9,99/mes elimina el límite por completo.
¿Qué pasa con los archivos MKV sin etiqueta de idioma de audio?
Ábrelo en VLC y escucha unos segundos de cada pista en Audio > Pista de audio. O confía en el orden: en la mayoría de los rips de películas, la pista 1 es el idioma original y las siguientes son doblajes. No está garantizado, pero es un punto de partida razonable antes de ejecutar ffprobe.
Fuentes
- Notas de la versión 32.0 de OBS Studio - confirma que Hybrid MP4/MOV se convirtió en el contenedor predeterminado en OBS 32
- Formatos Hybrid MP4 y Hybrid MOV | Base de conocimiento de OBS - detalles del formato y mecánica de recuperación ante fallos
- Guía de grabación con múltiples pistas de audio | Base de conocimiento de OBS - asignación de pistas y comportamiento de la Pista 1
- Guía de grabación avanzada y audio multipista | Base de conocimiento de OBS - verifica la Pista 1 como mezcla combinada de todas las fuentes
- Guía de salida de grabación estándar | Base de conocimiento de OBS - recomendación de MKV para grabación multicanal
- Entender los subtítulos PGS | suptosrt.com - PGS como formato de subtítulos basado en mapa de bits
- Extraer subtítulos y leyendas de archivos de vídeo con FFmpeg | Mux - flujo de trabajo de extracción de subtítulos de texto
- Precios de ConvertAudioToText - verifica el nivel gratuito (10 minutos únicos con cuenta, vista previa de 10 min sin registro) y el plan Pro ($9,99/mes)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.