Como converter MP4 em texto (envio direto, sem extração necessária)
transcriçãovídeomp4

Como converter MP4 em texto (envio direto, sem extração necessária)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

A resposta rápida

Você não precisa extrair o áudio do seu MP4 antes de transcrevê-lo. Envie o arquivo diretamente para qualquer ferramenta de transcrição séria e o servidor extrai o áudio automaticamente usando ffmpeg. As únicas coisas que valem a pena verificar antes: o arquivo realmente tem uma faixa de áudio e, se tiver mais de uma, qual faixa você quer?

Envios de vídeo MP4: a faixa de áudio é extraída automaticamente
Envios de vídeo MP4: a faixa de áudio é extraída automaticamente

O que realmente existe dentro de um MP4

MP4 é um contêiner, não um codec. O vídeo que você gravou semana passada provavelmente usa H.264 ou HEVC (H.265) para a imagem e AAC para o áudio. O contêiner apenas mantém tudo junto com metadados de tempo, faixas de legenda e marcadores de capítulo.

Essa distinção importa para a transcrição porque o modelo de reconhecimento de fala enxerga apenas o fluxo de áudio, não o vídeo. A ferramenta desmultiplexa o contêiner, extrai o áudio, reamostra para 16 kHz mono (o formato que modelos da classe Whisper esperam) e executa a inferência. Nada disso depende de qual codec de vídeo está dentro.

O que importa:

  • AAC (o mais comum): é extraído sem problemas em qualquer ferramenta de transcrição.
  • AC-3 / Dolby: encontrado em MP4s ripados de transmissões de TV ou Blu-ray. Algumas ferramentas lidam com ele; outras exigem que você transcode para AAC primeiro.
  • Opus dentro de MP4: menos comum, cada vez mais usado por gravações capturadas na web. Bem suportado em ferramentas modernas, ocasionalmente derruba pipelines mais antigos.

O codec de vídeo (H.264 vs. H.265) é irrelevante para a precisão da transcrição.

O problema das múltiplas faixas de áudio

Esta é a falha silenciosa mais comum na transcrição de MP4. Um arquivo MP4 pode conter, legitimamente, vários fluxos de áudio em um único contêiner, e a maioria das ferramentas de transcrição usa como padrão o fluxo de índice 0 sem avisar você.

Onde você encontra isso:

  • Conteúdo dublado: o MP4 de um filme ou documentário pode ter comentários em inglês na faixa 0 e o idioma original na faixa 1, ou vice-versa, dependendo de como foi empacotado.
  • Gravações de tela do OBS: o OBS, no modo Saída Avançada, pode gravar o áudio do jogo na faixa 1 e um microfone na faixa 2, ambos embutidos no mesmo MP4. Transcrever esse arquivo com as configurações padrão lhe dá uma faixa mixada, não necessariamente a que tem fala.
  • Exportações de conferências multilíngues: algumas plataformas de webinar embutem uma faixa de intérprete como faixa 2. A detecção automática em um arquivo que começa em inglês mas contém francês na faixa 2 produzirá uma bagunça.
  • Gravações de comentários: configurações de podcast que gravam uma mixagem bruta mais um stem por locutor em faixas embutidas separadas.

Para ver com o que você está lidando antes de enviar, execute o ffprobe localmente:

ffprobe -i video.mp4 -show_streams -select_streams a -v quiet

Isso lista todos os fluxos de áudio, seus codecs, etiquetas de idioma e layout de canais. Se você vir dois ou mais fluxos, decida qual quer e especifique-o no envio (se a ferramenta suportar seleção de faixa) ou extraia apenas esse fluxo primeiro:

ffmpeg -i video.mp4 -map 0:a:1 -c copy track2.m4a

(Substitua 0:a:1 pelo índice do fluxo que você quer, começando do zero.)

Gravações de tela vs. filmagens de câmera: perfis de qualidade diferentes

Ambos produzem arquivos MP4, mas se comportam de forma muito diferente para a transcrição.

Filmagens de câmera (celular, câmera mirrorless, filmadora): o áudio é capturado por um microfone físico em um espaço físico. A qualidade piora com a distância. Uma entrevista gravada a 30 cm do microfone do celular transcreve com 96-98% de precisão. Um painel de discussão filmado a 10 metros de distância com o microfone ambiente cai para 85-90%, às vezes menos se houver eco significativo ou ruído de ar-condicionado.

Gravações de tela (OBS, Loom, ScreenFlow, Camtasia, Windows Game Bar, macOS Screenshot): a fonte de áudio geralmente é um microfone USB ou de headset posicionado a poucos centímetros da boca do falante. Isso é quase ideal para transcrição. A relação sinal-ruído é alta, não há reverberação do ambiente, e o bitrate é consistente (normalmente 128-320 kbps AAC). O desafio não é a qualidade do áudio; é o vocabulário. Gravações de tela tendem a conter sintaxe de linha de comando, nomes de bibliotecas, mensagens de erro, atalhos de teclado e nomes de produtos que os modelos de reconhecimento de fala não veem com frequência. Espere erros ocasionais em termos técnicos mesmo quando a precisão em palavras conversacionais estiver acima de 97%.

Uma diferença estrutural: gravações de tela frequentemente produzem uma única faixa mono ou estéreo sem variação ao longo da duração do arquivo. Filmagens de câmera às vezes mudam de qualidade no meio do arquivo (o falante se afasta do microfone, o ruído da plateia aumenta). Para o caso de câmera, uma edição limpa antes de enviar rende mais do que uma edição posterior mais longa na transcrição.

Tamanhos de arquivo e o que fazer quando seu MP4 é grande demais

OrigemResolução / FPSTamanho aproximado por minuto
iPhone 16 (HEVC H.265)4K 30fps~350 MB/min
iPhone 16 (HEVC H.265)1080p 30fps~60 MB/min
Gravação na nuvem do Zoom1080p (H.264, AAC 128 kbps)~70-120 MB/min
Gravação de tela do OBS1080p 60fps (H.264)~150-400 MB/min (depende do bitrate)
Celular Android (H.264)1080p 30fps~100-200 MB/min
Webinar exportado (comprimido)720p H.264~20-50 MB/min

A maioria das ferramentas de transcrição aceita arquivos de até 500 MB a 2 GB. Uma reunião do Zoom de 1 hora (~4,2-7,2 GB) pode exceder esse limite.

Suas opções, em ordem de esforço:

  1. Envie para uma ferramenta que aceita arquivos grandes via URL. Se o seu MP4 estiver acessível em uma URL (um vídeo do YouTube, um link de compartilhamento do Loom, um link de gravação na nuvem do Zoom), pule totalmente o download. A ferramenta de vídeo para texto do ConvertAudioToText aceita URLs diretas justamente por isso.

  2. Extraia apenas o áudio antes de enviar. Um MP4 1080p de 1 hora pode ter 4 GB; o áudio AAC extraído dele tem cerca de 55-70 MB. Nenhuma qualidade é perdida para fins de transcrição, porque você está descartando o sinal de vídeo, não o áudio. O comando ffmpeg faz uma cópia sem perdas do fluxo de áudio:

    ffmpeg -i recording.mp4 -vn -c:a copy audio.m4a
    
  3. Divida em uma pausa natural. Se você precisa de marcações de tempo no nível da palavra que cubram toda a gravação, dividir e remontar as marcações manualmente é trabalhoso. A extração é mais fácil.

A pegadinha do HEVC

Dispositivos Apple gravam em HEVC (H.265) por padrão desde 2017. Os contêineres HEVC ainda são rotulados como .mp4, então o nome do arquivo não diz nada. A maioria das ferramentas de transcrição atuais lida bem com HEVC porque passam o contêiner pelo ffmpeg, que tem suporte robusto a HEVC. Mas algumas ferramentas legadas ou uploaders baseados em navegador tentam ler o vídeo no cliente antes de enviá-lo, e navegadores mais antigos não conseguem decodificar H.265. Se você receber um erro de “formato não suportado” em um arquivo que definitivamente é MP4, o codec de vídeo é o provável culpado.

Solução: extraia o áudio primeiro (comando acima), o que produz um arquivo AAC puro que qualquer ferramenta aceita. Ou recodifique o vídeo para H.264:

ffmpeg -i hevc_video.mp4 -c:v libx264 -c:a copy h264_video.mp4

Isso é mais lento e gera um arquivo maior; prefira a extração somente de áudio se você precisa apenas da transcrição.

De onde vêm esses arquivos (e o que ficar de olho)

Gravações na nuvem do Zoom

O Zoom codifica as gravações na nuvem como vídeo H.264 com áudio AAC a aproximadamente 64-128 kbps mono. O áudio tem banda limitada e é comprimido para minimizar o armazenamento, o que significa que ele remove as frequências fora da faixa da fala. Isso é, na verdade, bom para a transcrição: as frequências altas que causam ruído somem, e o modelo recebe um sinal de voz limpo. A precisão em reuniões do Zoom com um ou dois participantes costuma ser de 95-97% em inglês claro, menor com sotaques fortes ou fala rápida.

Para um fluxo específico do Zoom sem baixar o MP4 primeiro, o guia para transcrever reuniões do Zoom mostra o acesso no nível da plataforma.

Vídeos de iPhone e Android

iPhones gravam em contêineres MOV (H.264 ou HEVC, áudio AAC) e podem compartilhar como MP4 com o mesmo conteúdo dentro. Dispositivos Android gravam MP4 diretamente. Ambos são enviados e transcritos sem intervenção. A ressalva sobre o tamanho do arquivo é real: um clipe de 10 minutos do iPhone em 4K a 30 fps tem cerca de 3,5 GB. Extraia o áudio antes de enviar.

Gravações de tela do OBS

Usuários do OBS no modo Saída Avançada às vezes têm 6 faixas de áudio embutidas em um único MP4. A faixa 1 costuma ser a mixagem completa; as faixas seguintes são stems por fonte. Se a sua transcrição saiu em um idioma que você não esperava, ou está transcrevendo o áudio do jogo em vez da sua narração, você pegou a faixa errada. Use o ffprobe para ver o que existe lá e, então, extraia a faixa específica.

Para adicionar legendas de volta à gravação depois de transcrever, a ferramenta geradora de legendas produz arquivos SRT e VTT que você pode reimportar no OBS ou em qualquer editor de vídeo.

Downloads do YouTube

Se você baixou um vídeo do YouTube usando yt-dlp ou uma ferramenta semelhante, o MP4 resultante traz o áudio na qualidade que o YouTube serviu, tipicamente 128 kbps AAC para o padrão e 256 kbps para conteúdo elegível ao Premium. Ambos são suficientes para a transcrição. A ferramenta geradora de transcrições do YouTube pula totalmente a etapa de download lendo a URL diretamente.

Gravações de conferências e eventos

Exportações de conferências multicâmera frequentemente têm áudio vindo da sonorização do salão, não de um microfone de lapela no palestrante. Espere 85-92% de precisão se o salão for grande ou tiver ruído de plateia. Se o arquivo veio de um fornecedor que mixou alimentações de microfones separadas antes da exportação, a precisão é maior. Verifique o áudio no VLC ou em qualquer player antes de enviar: se ele soa abafado para o seu ouvido, o modelo também vai sofrer.

O que acontece no lado do servidor

Você envia o MP4. O backend de transcrição executa algo equivalente a:

  1. Inspecionar o contêiner e identificar todos os fluxos de áudio.
  2. Extrair o fluxo 0 (ou o fluxo especificado pelo usuário) para um arquivo de áudio temporário. Esta é uma operação de cópia sem perdas: ffmpeg -i input.mp4 -map 0:a:0 -vn -c:a copy temp.m4a.
  3. Reamostrar para PCM mono de 16 kHz, o formato esperado por modelos da classe Whisper e da classe Deepgram.
  4. Dividir em janelas de 30 segundos com sobreposições de 5 segundos para maior precisão nas fronteiras.
  5. Executar a inferência e remontar as marcações de tempo no nível da palavra.
  6. Aplicar restauração de pontuação, diarização de falantes (se ativada) e pós-processamento.
  7. Excluir o arquivo temporário.

A etapa que consome mais tempo real em um arquivo grande é a etapa 3 (reamostragem), especialmente em arquivos 4K HEVC, em que a leitura do contêiner é lenta. Um arquivo de áudio pré-extraído pula totalmente as etapas 1-2.

Se o MP4 tiver uma faixa de vídeo com taxa de quadros variável (comum em gravações de tela de certos aplicativos), as marcações de tempo do áudio permanecem corretas após a extração, porque você não está recodificando nada: -c:a copy preserva o tempo exato a partir das marcações de tempo do fluxo de áudio, independentemente da faixa de vídeo.

Como enviar: a versão curta

  1. Abra a ferramenta de transcrição e arraste seu MP4 para dentro, ou cole uma URL se o arquivo estiver hospedado.
  2. Verifique: se o arquivo tem várias faixas de áudio e você não tem certeza de qual delas tem a fala, extraia a correta primeiro usando ffprobe e ffmpeg.
  3. Selecione manualmente o idioma falado. A detecção automática funciona, mas a seleção manual adiciona 2-5 pontos de precisão em conteúdo com sotaque ou multilíngue.
  4. Envie. Uma gravação do Zoom de 30 minutos em 1080p normalmente fica pronta em 3-6 minutos.
  5. Revise nomes próprios, termos técnicos e quaisquer trechos de conversa cruzada em que os falantes se sobrepuseram.
  6. Exporte como TXT, DOCX, SRT ou VTT dependendo de se você precisa do conteúdo para leitura, edição ou legendagem.

Se você só precisa de uma transcrição sem criar uma conta, o ConvertAudioToText transcreve os primeiros 10 minutos de um MP4 sem conta, e uma conta gratuita adiciona 10 minutos de transcrição concedidos uma única vez no cadastro, sem necessidade de cartão de crédito.

Perguntas Frequentes

Preciso extrair o áudio de um MP4 antes de transcrever?

Não. Envie o MP4 diretamente. Os serviços de transcrição extraem o áudio no servidor usando ffmpeg ou uma biblioteca equivalente. A extração manual só é útil se o seu arquivo exceder o limite de tamanho do serviço; nesse caso, extrair o áudio reduz o arquivo a uma fração do tamanho original sem nenhuma perda de qualidade.

Minha transcrição do MP4 saiu no idioma errado. O que aconteceu?

Duas causas prováveis. Primeira, a detecção automática falhou em um arquivo com introdução curta ou com sotaque: defina o idioma manualmente. Segunda, e mais comum do que as pessoas imaginam, seu MP4 tem vários fluxos de áudio e a ferramenta transcreveu o fluxo 0, que está em um idioma diferente do que você queria. Execute ffprobe -i video.mp4 -show_streams -select_streams a para listar todos os fluxos de áudio e suas etiquetas de idioma e, então, extraia o correto.

Por que não consigo enviar meu vídeo 4K do iPhone? Diz que o arquivo é grande demais.

O iPhone grava em 4K a 30 fps a cerca de 350 MB por minuto em HEVC. Um clipe de 10 minutos tem aproximadamente 3,5 GB, o que excede a maioria dos limites de envio. Execute ffmpeg -i input.mp4 -vn -c:a copy audio.m4a para extrair apenas o áudio, que terá cerca de 10 a 15 MB pelos mesmos 10 minutos. Em vez disso, envie o arquivo de áudio.

O vídeo HEVC (H.265) dentro de um MP4 afeta a qualidade da transcrição?

Não. O codec de vídeo é descartado durante a extração do áudio. HEVC vs. H.264 não faz diferença na precisão da transcrição. O único problema prático é que alguns uploaders baseados em navegador tentam decodificar o vídeo no cliente antes do envio, e navegadores mais antigos não conseguem decodificar H.265. Se você receber um erro de “formato não suportado”, extraia o áudio primeiro ou recodifique o vídeo para H.264.

Minha gravação do OBS tem faixas de áudio separadas para o jogo e o microfone. A ferramenta vai transcrever ambas?

A maioria das ferramentas transcreve apenas o fluxo 0, que em uma configuração típica de múltiplas faixas do OBS é o áudio mixado completo. Se você quiser apenas a faixa do microfone (geralmente o fluxo 1 na configuração padrão do OBS), extraia-a antes de enviar: ffmpeg -i recording.mp4 -map 0:a:1 -c copy mic.m4a. Transcrever somente a faixa do microfone melhora a precisão da diarização de falantes se outras fontes de áudio estavam vazando na mixagem.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles