Como converter FLV em texto: transcreva acervos da era do Flash (2026)
transcriçãovídeoflv

Como converter FLV em texto: transcreva acervos da era do Flash (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Arquivos FLV da era do Flash (2003-2020) ainda têm valor real: acervos de webinars, vídeos de treinamento, capturas de streams RTMP. O plugin do Flash acabou, mas o FLV como contêiner continua totalmente legível pelo ffmpeg, VLC e ferramentas modernas de transcrição. O codec de áudio importa mais que o contêiner: MP3 e AAC dentro de FLV transcrevem com facilidade, enquanto os codecs de voz Nellymoser e Speex de gravações antigas de webcam precisam de uma etapa extra de conversão. Se sua ferramenta rejeita FLV, um único comando ffmpeg de uma linha faz o remux para MP4 sem tocar na qualidade do áudio.

Para obter uma transcrição de um arquivo FLV, envie-o diretamente para uma ferramenta que aceite o formato ou extraia o áudio com ffmpeg primeiro, se sua ferramenta exigir. A era do Flash acabou, mas os arquivos sobrevivem muito bem em qualquer pipeline moderno.

O que é FLV e por que os acervos ainda importam

FLV (Flash Video) foi o formato de vídeo da web de aproximadamente 2003 a 2020. Ele movia o YouTube antes da migração para o HTML5, todas as primeiras transmissões do Twitch, a maioria das plataformas de webinar antes de migrarem para MP4 e grande parte dos sistemas corporativos de treinamento que rodavam no Adobe Flash.

A Adobe encerrou o suporte ao Flash Player no fim de 2020. Os navegadores o removeram. A web seguiu em frente.

Os acervos não. Ainda há grandes coleções de FLV paradas em armazenamento corporativo, capturadas de:

  • Webinars anteriores a 2014 no WebEx, GoToMeeting e Microsoft LiveMeeting
  • Gravações de streams RTMP do Twitch e Periscope antes de mudarem de formato
  • Bibliotecas de cursos educacionais construídas sobre Adobe Captivate e Articulate
  • Repositórios internos de treinamento nunca migrados para MP4
  • Gravações de servidores de broadcast como Adobe Media Server e Wowza

Se você herdou um desses acervos, o caminho para a transcrição é direto assim que você conhece a realidade dos codecs.

O que há realmente dentro do seu arquivo FLV

O contêiner é a parte fácil. O codec de dentro é o que determina seu fluxo de trabalho.

O FLV carrega o vídeo em um de três formatos:

  • Sorenson Spark (baseado em H.263): o codec original do Flash Video, comum antes de 2005
  • VP6: tornou-se o codec preferencial com o Flash Player 8 em setembro de 2005
  • H.264: adicionado no Flash Player 9 Update 3 (dezembro de 2007) e usado até o fim do Flash

Para transcrição, o codec de vídeo não importa nada. O que importa é a faixa de áudio:

  • MP3 em FLV: o formato de áudio mais comum nos acervos FLV, transcreve de forma idêntica a um arquivo MP3 avulso
  • AAC em FLV: usado nas versões mais recentes do Flash Player, transcreve limpo em bitrates padrão
  • Nellymoser Asao: um codec de voz proprietário de baixa largura de banda integrado ao Flash para captura de microfone, usado em gravações com webcam e VoIP iniciais; transcreve de forma aceitável, mas se degrada em bitrates mais baixos
  • Speex: um codec de voz open source adicionado no Flash Player 10 para streaming, ajustado para voz, mas de baixa largura de banda

Rode ffprobe seuarquivo.flv para identificar exatamente qual codec de áudio seu arquivo usa antes de decidir o fluxo de trabalho.

Passo a passo: converter FLV em texto

Etapa 1: confirme que o arquivo reproduz

Abra-o no VLC. O VLC lê todas as variantes de codec FLV: vídeo Sorenson Spark, VP6, H.264 e todos os codecs de áudio, incluindo Nellymoser e Speex. Se o VLC reproduzir com áudio, você tem um arquivo utilizável.

Se o VLC recusar com um erro de reprodução (não um aviso de DRM), o arquivo pode ter metadados truncados de uma captura RTMP interrompida no meio do stream. Siga para a Etapa 2 antes de transcrever.

Etapa 2: repare os metadados, se necessário

Gravações de streams RTMP costumam ter metadados de duração ausentes ou incorretos. A correção é uma única passagem do ffmpeg que copia todos os streams sem recodificar:

ffmpeg -i broken.flv -c copy -fflags +genpts fixed.flv

Isso reconstrói os timestamps do contêiner sem tocar nos dados reais de áudio ou vídeo. Rode em qualquer FLV que informe "could not determine duration" (não foi possível determinar a duração) ou que falhe ao avançar corretamente.

Etapa 3: envie ou extraia o áudio

Se sua ferramenta aceita FLV diretamente, envie o arquivo como está. O CATT aceita arquivos FLV junto com MP4, MOV, MKV e outros formatos por meio da ferramenta de vídeo para texto.

Se sua ferramenta exige outro formato, extraia a faixa de áudio. Quando o áudio já é MP3 ou AAC, a cópia de stream é mais rápida e sem perdas:

ffmpeg -i video.flv -vn -c:a copy audio.mp3

Quando o áudio é Nellymoser ou Speex, transcodifique para MP3:

ffmpeg -i video.flv -vn -c:a libmp3lame -b:a 192k audio.mp3

Se você precisa de saída completa em MP4 (para uma ferramenta que exija isso) e o FLV usa vídeo H.264, dá para copiar as duas faixas via stream copy:

ffmpeg -i video.flv -c copy output.mp4

Se o FLV usa vídeo Sorenson Spark ou VP6, você precisa de uma recodificação completa, que é mais lenta:

ffmpeg -i video.flv -c:v libx264 -c:a aac output.mp4

Interface de upload da ferramenta de vídeo para texto do CATT processando formatos de vídeo legados, incluindo FLV
Interface de upload da ferramenta de vídeo para texto do CATT processando formatos de vídeo legados, incluindo FLV

Etapa 4: defina o idioma

Especifique o idioma manualmente. Conteúdo FLV mais antigo às vezes tem áudio degradado que confunde a detecção automática de idioma. Para conteúdo que não esteja em inglês, configure o idioma antes do processamento em vez de corrigir depois.

Etapa 5: execute a transcrição

Um FLV de 60 minutos leva de 3 a 6 minutos para processar na maioria dos serviços. A extração de áudio é quase instantânea; a transcrição é a fase mais longa.

Etapa 6: revise o resultado

Áudio FLV legado tem características que afetam a precisão:

  • Áudio de bitrate baixo (32 a 96 kbps era típico para streaming)
  • Microfones de webcam e áudio de participantes por linha telefônica
  • Artefatos de quedas de rede em capturas RTMP

Espere de 80 a 92% de precisão em conteúdo de webinar antigo com áudio misto, e de 90 a 95% em FLV gravado profissionalmente com microfone dedicado do apresentador.

Quando o remux para MP4 realmente ajuda (e quando não ajuda)

A dúvida surge constantemente com acervos FLV: converter para MP4 primeiro ou transcrever direto?

Remuxar não melhora a precisão da transcrição. O modelo de fala processa o codec de áudio, e o wrapper do contêiner é descartado antes do processamento. Uma faixa de áudio Nellymoser em um FLV produz o mesmo resultado que uma faixa Nellymoser em um MP4.

Remuxar ajuda em duas situações reais:

  1. Sua ferramenta de transcrição rejeita FLV de imediato. Muitas ferramentas de consumo aceitam apenas MP4, MOV, MP3 e WAV. Se a sua for assim, um remux com stream copy leva segundos e não custa qualidade.
  2. Você quer verificar se o arquivo reproduz antes de enviá-lo. O MP4 é mais universalmente reproduzível em players de mídia e janelas de pré-visualização do navegador, caso você precise confirmar o conteúdo antes do upload.

Para um lote de centenas de arquivos, pule a etapa de remux por completo e trabalhe com os originais. Leia mais sobre fluxos de trabalho específicos por formato no guia de como converter vídeo em texto e no post complementar sobre acervos WMV, outro formato com questões de legado semelhantes.

Cenários comuns de FLV

Acervos de webinars legados

Plataformas de 2004 a 2014 (WebEx, GoToMeeting, MS LiveMeeting, ON24) gravavam em FLV. A qualidade do áudio se divide drasticamente por fonte:

  • Microfone do apresentador: geralmente limpo, transcreve com 90 a 95%
  • Áudio de participante por telefone (PSTN): qualidade telefônica de 8 kHz, transcreve com 75 a 85%
  • Misto apresentador-mais-participante: faz a média dos dois

Para grandes acervos de webinars, verifique se a plataforma gravou faixas de áudio separadas para apresentador e participantes. Se sim, extraia-as separadamente, transcreva cada uma e depois una os resultados.

Capturas do Twitch e de streaming

O Twitch usava RTMP antes de migrar para HLS por volta de 2017. As gravações de streams desse período são FLV. A precisão varia conforme a configuração de áudio do streamer.

Conteúdo de streaming costuma ter música de fundo, áudio de jogo e efeitos sonoros misturados na faixa de fala. Modelos de IA podem alucinar texto durante trechos musicais. Corte para segmentos somente de fala antes do upload se a precisão importa.

Bibliotecas de cursos educacionais

Adobe Captivate, Articulate Storyline e ferramentas de autoria semelhantes exportavam módulos baseados em FLV de 2005 a 2015. A narração em off nesses cursos costuma ser gravada em estúdio com microfone dedicado. A precisão geralmente fica em 95% ou mais.

Gravações de servidores RTMP

Adobe Media Server (antigo Flash Media Server), Wowza e Red5 gravavam streams RTMP em FLV por padrão. Essas capturas às vezes têm:

  • Metadados de duração ausentes ou incorretos (repare com -fflags +genpts, como mostrado acima)
  • Desvio de áudio em gravações com mais de uma hora
  • Quedas de quadros ou lacunas de áudio por interrupções de rede

Repare os metadados antes de transcrever. O desvio de áudio é mais difícil de corrigir na pós-produção e afeta principalmente o alinhamento de timestamps, não a precisão da transcrição.

Acervos de marketing e corporativos

Bibliotecas de vídeos de marketing anteriores a 2015 costumam existir tanto na forma original FLV quanto em MP4 recodificado. Se você tem as duas, transcreva a partir do original FLV. A recodificação para MP4 passou por uma etapa de compressão com perdas que o original não passou.

O que ficar de olho

Gravações truncadas. Capturas RTMP às vezes cortam no meio de uma frase quando o stream caiu ou o servidor parou. Reproduza até o fim antes de presumir que tem o conteúdo completo. Uma transcrição que termina abruptamente no meio de um pensamento é um sintoma, não um erro da transcrição.

Faixas de áudio duplas. Alguns FLVs de webinar gravam apresentador e participantes em faixas de áudio separadas. A maioria das ferramentas de transcrição processa apenas a primeira faixa. Verifique com ffprobe -show_streams se seu arquivo tem mais de um stream de áudio e extraia o que você precisa.

Pontos de sinalização (cue points) e dados de chat embutidos. Alguns arquivos FLV de sistemas de webinar embutem o chat de texto como pontos de sinalização nos metadados. Isso não é áudio; são metadados do contêiner. A maioria das ferramentas de transcrição os ignora. Se uma ferramenta reportar erros de análise, remova primeiro os metadados que não são de áudio:

ffmpeg -i in.flv -c copy -map 0:v -map 0:a clean.flv

Qualidade Nellymoser e Speex. Ambos são codecs de voz operando em bitrates baixos. Eles transcrevem, mas a precisão cai comparada a MP3 ou AAC com qualidade de conteúdo equivalente. Se você tem áudio Nellymoser ou Speex e a precisão é crítica, transcodifique primeiro para MP3 a 192k. A recodificação introduz alguma perda de geração, mas o resultado costuma ser mais reconhecível para um modelo de fala do que o stream bruto Nellymoser a 5,5 kHz.

Dicas práticas para acervos FLV em lote

Repare todos os arquivos primeiro. Rode um reparo de metadados em lote no acervo inteiro antes de transcrever qualquer coisa:

for f in *.flv; do ffmpeg -i "$f" -c copy -fflags +genpts "fixed_$f"; done

Isso reconstrói os metadados do contêiner sem tocar no áudio. Qualquer arquivo com metadados truncados ou incorretos fica bem formado antes de entrar no seu pipeline de transcrição.

Processe em ordem cronológica. Arquivos da mesma época e plataforma têm padrões de qualidade de áudio semelhantes. Calibre suas expectativas em um arquivo representativo e depois aplique as mesmas configurações aos demais.

Use acesso à API para grandes volumes. Enviar 500 horas de arquivos de acervo um por vez não é prático. Os planos Developer e Business do CATT incluem acesso à API com webhooks, o que torna o processamento em lote automatizável via scripts. Confira os custos ocultos dos serviços de transcrição antes de escolher um plano para trabalho em volume.

Pule o pré-processamento de áudio. O áudio FLV antigo já é pesadamente comprimido. Adicionar redução de ruído, equalização ou normalização sobre uma fonte já comprimida muitas vezes piora a precisão da IA, não melhora. Envie o áudio original e deixe o modelo cuidar dele.

Verifique DRM antes de começar. Conteúdo FLV comercial de serviços extintos da era do Flash às vezes era protegido por DRM. O VLC vai recusar com um erro de "conteúdo protegido". Conteúdo gravado por usuários (webinars, treinamentos, streams) quase nunca tem DRM. Se você esbarrar em DRM, não há caminho prático para a transcrição.

Formato FLV vs. formatos modernos

FormatoÉpocaCodec de áudio típicoBitrate comumPrecisão de transcrição
FLV (MP3)2003-2014MP332-128 kbps88-95%
FLV (AAC)2009-2020AAC64-192 kbps92-97%
FLV (Nellymoser)2003-2011Nellymoser5-64 kbps80-90%
FLV (Speex)2008-2016Speex8-45 kbps82-92%
MP42008-presenteAAC96-256 kbps94-98%
WebM2013-presenteOpus64-192 kbps94-98%

FLV que contém vídeo H.264 e áudio AAC transcreve essencialmente de forma idêntica a um MP4 com os mesmos codecs. O contêiner externo é descartado pelo pipeline de transcrição. O áudio interno é o que conta.

Se você só precisa de uma transcrição limpa de um arquivo e quer pular as etapas do ffmpeg, o ConvertAudioToText aceita FLV diretamente: envie, selecione o idioma e o serviço cuida da extração automaticamente.

Perguntas frequentes

Posso transcrever arquivos FLV em 2026 mesmo com o Flash morto?

Sim. O plugin do Flash nos navegadores acabou, mas o FLV como formato de arquivo ainda é totalmente suportado pelo ffmpeg, VLC e muitos serviços de transcrição. O contêiner é lido sem problemas; o que importa é o codec de áudio interno. MP3 e AAC dentro de FLV transcrevem igual a qualquer MP3 ou AAC avulso.

Devo converter FLV para MP4 antes de transcrever?

Somente se sua ferramenta de transcrição rejeitar FLV de imediato. Para a qualidade do áudio, a conversão não ajuda: o codec de áudio dentro do contêiner é o que o modelo de fala realmente processa, então remuxar o contêiner não muda nada na precisão. A extração somente de áudio com ffmpeg é mais rápida que um remux completo, e qualquer uma das abordagens chega à mesma transcrição.

Quando o FLV realmente precisa ser recodificado antes da transcrição?

O áudio precisa ser recodificado quando o FLV contém áudio Nellymoser ou Speex, já que esses codecs podem soar degradados em bitrates baixos e algumas ferramentas os rejeitam. Rode o ffprobe no arquivo primeiro para verificar. Se a faixa de áudio já estiver em MP3 ou AAC, você pode extraí-la com cópia de stream (-c:a copy) e pular completamente a recodificação, o que preserva a qualidade original.

E se meu arquivo FLV tiver DRM?

Tente reproduzi-lo no VLC primeiro. Se ele recusar com erro de conteúdo protegido, o arquivo está bloqueado por DRM. Arquivos FLV gravados por usuários (webinars, vídeos de treinamento, capturas de stream) raramente têm DRM. Conteúdo FLV comercial de serviços extintos da era do Flash às vezes tem, e removê-lo raramente é prático ou legal uma década depois do desligamento do serviço original.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles