Como converter MKV em texto: áudio multitrilha e gravações do OBS
transcriçãovídeomkv

Como converter MKV em texto: áudio multitrilha e gravações do OBS

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

A versão resumida

Envie seu MKV para uma ferramenta de transcrição e funciona, com uma pegadinha: se o seu arquivo tiver várias faixas de áudio (comum em gravações do OBS, rips de Blu-ray e configurações com vários microfones), você precisa saber qual faixa contém o áudio que realmente quer. Rode um ffprobe rápido primeiro, mapeie a faixa certa e o resto é rotina.

Gravações MKV são enviadas como estão; a faixa de áudio padrão é usada
Gravações MKV são enviadas como estão; a faixa de áudio padrão é usada

O que é MKV e de onde vêm seus arquivos

MKV (Matroska Video) é o contêiner de vídeo mais flexível em uso atualmente. Diferentemente do MP4, ele não impõe limites rígidos ao número de faixas de áudio, faixas de legendas ou capítulos dentro de um único arquivo. Essa flexibilidade é o motivo pelo qual o MKV é comum em:

  • Gravações do OBS Studio (recomendado para trabalho multitrilha, mesmo que o OBS 32 tenha mudado o padrão para novas instalações)
  • Rips de DVDs e Blu-rays com vários idiomas de áudio
  • Acervos de animes e programas de TV com áudio no idioma original além de dublagem
  • Configurações de podcast com vários microfones, em que cada microfone vai para sua própria faixa
  • Gravações de conferências com alimentações separadas de microfone por palestrante
  • Gravadores de tela do Linux como SimpleScreenRecorder e Kazam

Para transcrição, o suporte multitrilha do MKV é tanto uma vantagem quanto uma complicação. Você precisa escolher a faixa certa antes de transcrever.

O padrão do OBS mudou na versão 32

O conselho antigo de que "o OBS grava em MKV por padrão" está desatualizado. O OBS 30.2 introduziu o Hybrid MP4 (um MP4 fragmentado resistente a travamentos), e o OBS 32.0 tornou o Hybrid MP4/MOV o contêiner padrão para novas instalações. Se você instalou o OBS recentemente, pode já estar recebendo arquivos Hybrid MP4, não MKV.

Dito isso, o MKV continua sendo o formato recomendado para gravação multitrilha. A proteção contra travamentos do Hybrid MP4 cobre o caso de uso de faixa única. O MKV multitrilha ainda é a melhor escolha quando você quer áudio isolado por fonte, porque:

  • O MKV suporta até 6 faixas de áudio no OBS (o Hybrid MP4 normalmente grava como um único fluxo combinado)
  • Você sempre pode remuxar MKV para MP4 via Arquivo > Remuxar Gravações sem recodificar
  • Editores e ferramentas de transcrição podem então selecionar a faixa específica de que precisam

Minha opinião: se você está gravando um podcast, entrevista ou conferência com microfones separados, use MKV no OBS explicitamente. Se está gravando uma captura de tela de fonte única ou captura de jogo, o Hybrid MP4 funciona bem e é mais simples.

O que as faixas de um MKV do OBS realmente contêm

A documentação do OBS descreve a Faixa 1 como a mixagem combinada padrão de "todas as fontes". As Faixas 2 a 6 são onde você roteia fontes isoladas nas Propriedades Avançadas de Áudio. Uma configuração típica multitrilha do OBS pode ser assim:

  • Faixa 1: Mixagem estéreo combinada de tudo (faixa de reprodução padrão)
  • Faixa 2: Somente seu microfone
  • Faixa 3: Somente áudio da área de trabalho/jogo
  • Faixa 4: Comunicações (Discord, chamadas)

Para transcrição, a Faixa 2 (somente microfone) é quase sempre o que você quer. A Faixa 1 capta teclas digitadas, áudio do jogo e ruído de fundo junto com sua voz.

Etapa 1: Inspecione suas faixas antes de enviar

Dez segundos com ffprobe evitam que você transcreva o idioma errado ou uma mixagem cheia de ruído. Execute:

ffprobe -v error -show_streams -select_streams a -of json input.mkv

Isso exibe cada fluxo de áudio com seu índice, nome do codec, número de canais e etiqueta de idioma. Em um rip típico de Blu-ray, você pode ver:

  • Fluxo 0:1 - AC3, 6 canais, lang: eng
  • Fluxo 0:2 - AAC, 2 canais, lang: spa
  • Fluxo 0:3 - AC3, 2 canais, lang: fra (comentário do diretor)

Em um MKV multitrilha típico do OBS:

  • Fluxo 0:1 - AAC, 2 canais (mixagem combinada)
  • Fluxo 0:2 - AAC, 1 canal (microfone)
  • Fluxo 0:3 - AAC, 2 canais (áudio da área de trabalho)

Identifique o índice do fluxo antes de prosseguir. Os índices das faixas começam em zero no ffmpeg (a segunda faixa de áudio é 0:a:1).

Etapa 2: Extraia a faixa certa

Se o seu MKV tem uma única faixa de áudio, envie como está. Se tem várias faixas, extraia primeiro a que você precisa. Isso também reduz drasticamente o tamanho do arquivo. Um MKV de filme de 90 minutos pode ter de 8 a 15 GB; só a faixa de áudio costuma ter de 100 a 300 MB.

Extraia uma faixa de áudio específica sem recodificar:

ffmpeg -i video.mkv -map 0:a:1 -c:a copy track2.m4a

Substitua 0:a:1 por 0:a:2 para a terceira faixa de áudio, e assim por diante.

Se o arquivo é grande demais para enviar por causa do vídeo, remova completamente o vídeo:

ffmpeg -i in.mkv -vn -c:a copy audio.mka

A extensão .mka é Matroska Audio, um contêiner que a maioria das ferramentas de transcrição aceita. Você também pode usar .aac, .mp3 ou .m4a, dependendo do codec de origem.

Etapa 3: Lide com a compatibilidade de codecs

O MKV pode carregar codecs que confundem ferramentas de transcrição baseadas na web. Os mais comuns:

AC3 e AAC funcionam em qualquer lugar. Nenhuma ação necessária.

Opus funciona em qualquer lugar. Gravações do OBS costumam usar Opus.

FLAC funciona na maioria das ferramentas. É sem perdas e grande, mas os serviços de transcrição dão conta dele.

DTS e DTS-HD são comuns em rips de Blu-ray e frequentemente rejeitados por ferramentas online. Converta primeiro:

ffmpeg -i bluray.mkv -map 0:a:0 -c:a libmp3lame -b:a 192k audio.mp3

TrueHD (Dolby Atmos) também é presença constante em Blu-rays e tem o mesmo problema. Mesma solução, mesmo comando, basta especificar o índice certo do fluxo.

Áudio multicanal (5.1, 7.1) pode confundir a detecção de falantes. Para conversão pura de fala em texto, reduza para estéreo ou mono:

ffmpeg -i input.mkv -map 0:a:0 -ac 2 -c:a aac output.m4a

Etapa 4: Envie e defina o idioma

Combine o idioma da transcrição com a faixa de áudio que você extraiu. Se está transcrevendo a faixa em espanhol, selecione espanhol na ferramenta. Incompatibilidade de idioma é a causa mais comum de saída de transcrição embaralhada.

Para fluxos de vídeo para texto, você pode usar a ferramenta de vídeo para texto do ConvertAudioToText. Arraste o arquivo, defina o idioma e deixe rodar. Uma gravação de 2 horas termina em cerca de 10 a 20 minutos, dependendo da carga da fila.

Se você quer precisão por falante em uma gravação com vários microfones em vez de depender da diarização automática, veja diarização de falantes explicada para saber quando a extração por faixa supera a divisão de falantes por IA.

O atalho da faixa de legendas (quando se aplica)

O MKV pode carregar faixas de legenda embutidas junto com o áudio. Existem dois tipos distintos:

Legendas baseadas em texto (SRT, ASS, SSA): São armazenadas como fluxos de texto legíveis. Se o seu MKV já tem legendas precisas, você pode extraí-las diretamente sem executar nenhuma transcrição:

ffmpeg -i video.mkv -map 0:s:0 subtitles.srt

Isso é instantâneo e gratuito. Só funciona se as legendas já existirem e forem precisas.

Legendas PGS (legendas de imagem de Blu-ray): São armazenadas como imagens bitmap, não texto. O comando ffmpeg -map 0:s:0 exportará um arquivo .sup, não texto legível. Converter PGS para SRT exige software de OCR (o módulo de OCR do Subtitle Edit é a ferramenta padrão), e o resultado geralmente precisa de limpeza manual. Para rips de Blu-ray com legendas PGS, retranscrever o áudio costuma ser mais rápido e mais preciso do que rodar OCR sobre bitmaps de imagem.

Para verificar que tipo de legenda o seu MKV tem:

ffprobe -v error -show_streams -select_streams s -of json input.mkv

Observe o campo codec_name. subrip ou ass significa baseado em texto. hdmv_pgs_subtitle significa PGS bitmap baseado em imagem.

Fluxos de trabalho do MKV por fonte

Gravações do OBS

Para arquivos MKV multitrilha do OBS, sempre extraia a faixa somente com microfone (normalmente a Faixa 2) antes de transcrever. A mixagem combinada da Faixa 1 inclui ruído de teclado, áudio do jogo e sons de notificação que prejudicam a precisão.

Se você gravou streams e quer apenas a voz, ative o áudio multitrilha no OBS antes da próxima sessão de gravação: Configurações > Saída > Gravação > caixas de seleção de Faixa de Áudio. Depois de configurado, o MKV separará cada fonte.

DVDs e Blu-rays ripados

Rips de DVD geralmente têm várias faixas de idioma além de comentários. As etiquetas de idioma servem de guia, mas nem sempre são precisas. Faça uma verificação rápida no VLC alternando manualmente entre as faixas de áudio antes de iniciar a transcrição. Para um projeto de pesquisa de filmes, considere se você quer a faixa no idioma original (diálogo autoritativo) ou uma faixa dublada (pode diferir do roteiro original em fraseado e sincronização).

As faixas de comentário do diretor muitas vezes são transcritas por engano quando os usuários esquecem de especificar uma faixa. Verifique com ffprobe primeiro.

Conferências e gravações com vários microfones

Sistemas de gravação com várias salas e vários microfones podem produzir MKV com uma faixa por microfone. Para a qualidade da transcrição, transcrever individualmente as faixas de cada microfone supera depender da diarização aplicada a uma mixagem combinada cheia de ruído.

Extraia cada faixa, transcreva cada uma separadamente e depois mescle os resultados em ordem de marcação de tempo. Isso gera atribuição limpa de falantes, sem ambiguidade de detecção. Para saber mais sobre quando essa troca vale os passos extras, veja diarização de falantes explicada.

Gravadores de tela do Linux

O OBS, o SimpleScreenRecorder e o Kazam no Linux produzem MKV. A qualidade do áudio depende do backend de áudio. O PipeWire (o padrão moderno na maioria das distribuições atuais) captura de forma limpa a 48 kHz. Configurações antigas com PulseAudio podem introduzir quedas de áudio a cada poucos segundos durante gravações longas. Se o seu MKV tem falhas periódicas de áudio, verifique se uma migração para o PipeWire no seu sistema resolveria antes de culpar a ferramenta de transcrição.

MKV vs outros contêineres multitrilha

ContêinerFaixas de ÁudioFaixas de LegendaSuporte em FerramentasMelhor Para
MKVIlimitadasIlimitadas (texto + PGS)BomAcervos, multilíngue, vários mics
MP4MúltiplasLimitadas (sem PGS)ExcelenteDistribuição em idioma único
MOVMúltiplasLimitadasCentrado na AppleiPhone, ProRes, Final Cut
WebMLimitadasSomente VTTNativo do navegadorIncorporação na web

O MKV é o contêiner certo para conteúdo com múltiplas versões de áudio ou legenda. Não é a escolha certa se você precisa de compatibilidade máxima com dispositivos de consumo ou plataformas de streaming, que esperam MP4. Veja formatos de áudio suportados para transcrição para entender como diferentes contêineres afetam a compatibilidade de envio entre ferramentas.

Problemas comuns de transcrição de MKV

Idioma errado na transcrição

Sua ferramenta usou a Faixa 1 como padrão. Se o seu MKV tem áudio em inglês e espanhol, e você precisava do espanhol, extraia novamente com -map 0:a:1 e envie de novo.

Erro de "codec não suportado"

Quase certamente DTS ou TrueHD de um rip de Blu-ray. Converta para MP3 ou AAC com o comando ffmpeg da seção de codecs acima.

A etiqueta de idioma está errada

Alguns codificadores etiquetam as faixas incorretamente. Um arquivo marcado como "eng" que toca áudio em japonês é comum em rips antigos. Não confie cegamente na etiqueta. Verifique ouvindo uma amostra de 30 segundos no VLC.

Marcadores de capítulo do MKV causando erros de segmentação

Algumas ferramentas tropeçam nos marcadores de capítulo Matroska embutidos no arquivo. Remova-os:

ffmpeg -i in.mkv -map 0 -map_chapters -1 -c copy out.mkv

Arquivo grande demais para enviar

O culpado é o fluxo de vídeo. Um filme de 2 horas em 1080p tem de 8 a 15 GB. O fluxo de áudio tem de 100 a 300 MB. Remova o vídeo primeiro com o comando -vn acima.

Se você quer um caminho rápido sem cadastro para um único MKV sem complicações de faixas, o ConvertAudioToText aceita uploads de MKV e processa sem conta por até 10 minutos. O plano gratuito logado dá 10 minutos de transcrição, concedidos uma única vez no cadastro, e não todo mês; o plano Pro a US$ 9,99/mês remove o limite totalmente.

Perguntas frequentes

Posso transcrever várias faixas de áudio de uma vez?

A maioria das ferramentas transcreve uma faixa por tarefa. Para arquivos MKV multitrilha, execute tarefas de transcrição separadas por faixa e depois mescle os resultados em ordem de marcação de tempo. Essa é a abordagem mais limpa para podcasts com vários falantes, em que cada falante tem sua própria faixa, e é mais confiável do que a diarização automática de falantes.

A qualidade de áudio do MKV é melhor que a do MP4?

O contêiner não afeta a qualidade do áudio. O MKV pode armazenar codecs de maior qualidade (FLAC, DTS-HD, TrueHD) do que o MP4 padrão, mas um MKV típico do OBS usa o mesmo AAC que o MP4 usa. A escolha do codec importa; a escolha do contêiner, não.

Posso transcrever MKV gratuitamente?

Sim. O ConvertAudioToText aceita arquivos MKV e processa até 10 minutos sem conta, e um plano gratuito adiciona 10 minutos de transcrição concedidos uma única vez no cadastro. Para arquivos maiores ou fluxos multitrilha por falante, o plano Pro a US$ 9,99/mês remove o limite totalmente.

E os arquivos MKV sem etiqueta de idioma no áudio?

Abra no VLC e ouça alguns segundos de cada faixa em Áudio > Faixa de Áudio. Ou confie na ordem: na maioria dos rips de filmes, a faixa 1 é o idioma original e as seguintes são dublagens. Não garantido, mas um ponto de partida razoável antes de rodar o ffprobe.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles