Transcrição vs. Legendagem vs. Legendas: Guia de 2026
transcriçãolegendagemlegendas

Transcrição vs. Legendagem vs. Legendas: Guia de 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

A transcrição produz um documento legível a partir do áudio. A legendagem produz texto cronometrado exibido na tela para espectadores que não podem ouvir, incluindo efeitos sonoros e identificação dos falantes. As legendas traduzem ou transcrevem diálogos para espectadores que não entendem o idioma e omitem indicações sonoras que o espectador já consegue ouvir. Uma mesma rodada de transcrição pode gerar os três resultados; basta usar a exportação e a passada de edição certas para cada um. Legendas traduzidas não satisfazem a lei de acessibilidade: apenas legendas ocultas verdadeiras satisfazem.

Uma transcrição, uma trilha de legendas ocultas e um arquivo de legendas são três coisas diferentes. Todos os três partem do mesmo áudio, mas cada um resolve um problema diferente, chega em um formato diferente e carrega um conteúdo diferente. Escolher o errado significa decepcionar seu público ou reprovar em uma verificação de conformidade.

Os Três Artefatos, Mapeados

TranscriçãoLegendas OcultasLegendas
PúblicoLeitoresEspectadores que não podem ouvirEspectadores que não entendem o idioma falado
Inclui efeitos sonoros?Não (exceto se essenciais)Sim, obrigatórioNão
Inclui indicações musicais?NãoSimNão
Inclui identificação dos falantes?Quando há vários falantesSim, obrigatórioSomente se ambíguo na tela
Traduzido?RaramenteMesmo idioma ou traduzidoGeralmente traduzido
Formatos típicosTXT, DOCX, PDFSRT, VTT, SCC, TTMLSRT, VTT, SBV
Onde é exigido por leiConteúdo somente em áudio (Section 508)Vídeo pré-gravado (WCAG SC 1.2.2), vídeo ao vivo (SC 1.2.4)Nenhuma lei de acessibilidade exige

Essa última linha é a que mais surpreende as pessoas: legendas traduzidas não satisfazem a lei de acessibilidade. Apenas legendas ocultas verdadeiras satisfazem.

Transcrição: O Resultado É um Documento

Qual é a diferença entre uma transcrição e legendas ocultas?

Uma transcrição é um documento: sem códigos de tempo, otimizada para leitura, com estrutura em parágrafos e sem limites de comprimento de linha. Legendas ocultas são uma trilha de texto cronometrada e sincronizada com um vídeo, armazenada separadamente do vídeo para que os espectadores possam ativá-las ou desativá-las. Ambas começam com a mesma passada de reconhecimento de fala, mas o formato de saída, o conteúdo e as convenções de edição são diferentes.

Uma transcrição foi feita para ser lida, não assistida. Isso muda tudo sobre como ela é formatada.

  • Estrutura em nível de parágrafo para legibilidade, não quebras de linha de 32 caracteres.
  • Rótulos de falantes quando há mais de uma voz, escritos por extenso para facilitar a leitura.
  • Sem necessidade de códigos de tempo (marcações de tempo opcionais para navegação são aceitáveis).
  • Pontuação e formatação otimizadas para um leitor, não para um player de vídeo.
  • Sem limite de comprimento de linha. Sem marcadores de fim de legenda.

Se você pegar um arquivo de legendas e colá-lo em um documento, obterá algo que parece uma fita de teletipo impressa. Uma transcrição adequada é editada para ler como uma entrevista ou artigo bem acabados. As duas coisas são estruturalmente diferentes mesmo quando as palavras são as mesmas.

Casos de uso comuns: posts de blog a partir de entrevistas, notas de episódios de podcasts, registros de reuniões, trabalhos acadêmicos, depoimentos jurídicos e conteúdo para indexação em buscadores.

Legendas Ocultas: O Resultado É uma Trilha de Acessibilidade Sincronizada

Gere a trilha de legendas ocultas uma vez e exporte SRT ou VTT por plataforma
Gere a trilha de legendas ocultas uma vez e exporte SRT ou VTT por plataforma

O que as legendas ocultas devem incluir que as legendas não incluem?

Legendas ocultas devem incluir identificação dos falantes, efeitos sonoros (por exemplo, [porta bate], [telefone toca]), indicações musicais ([música animada], [aplausos da plateia]), identificação de falantes fora da tela e indicadores de tom quando o texto sozinho é ambíguo. As legendas carregam apenas diálogos, às vezes traduzidos, porque o espectador consegue ouvir todo o resto.

A legendagem é projetada para um espectador assistindo sem nenhum áudio. Tudo o que ele ouviria deve aparecer na tela, e é por isso que as legendas ocultas carregam conteúdo que transcrições e legendas não carregam.

Elementos obrigatórios:

  • Identificação dos falantes. "Alice:" ou "[Bob]" antes de cada fala, especialmente quando os falantes estão fora da tela ou não são visualmente identificáveis.
  • Efeitos sonoros. "[porta bate]", "[telefone toca]", "[plateia aplaude]".
  • Indicações musicais. "[música animada tocando]", "[cordas sombrias]", "[música: letra aqui]".
  • Indicadores de tom quando o significado emocional não fica claro apenas pelas palavras. "[sarcástico]", "[sussurrando]".

As legendas ocultas também são sincronizadas com o tempo do vídeo: cada legenda tem horário de início e de término, e o texto aparece na tela em sincronia com o áudio. A qualidade dessa sincronização importa legalmente.

Para plataformas sociais, o post sobre legendas abertas vs ocultas cobre a distinção em detalhes. Em resumo: legendas ocultas são um interruptor (o botão CC no YouTube); legendas abertas são gravadas nos pixels do vídeo e não podem ser removidas. Conteúdo social curto (TikTok, Instagram Reels) normalmente usa legendas abertas porque a maioria dos espectadores assiste no mudo e o suporte a legendas ocultas das plataformas é inconsistente. Saiba mais no guia de legendagem para TikTok e Instagram.

Legendas: O Resultado É uma Trilha de Diálogo para Acesso ao Idioma

As legendas contam como legendas ocultas para fins de conformidade de acessibilidade?

Não. As legendas presumem que o espectador consegue ouvir e, portanto, omitem efeitos sonoros, indicações musicais e áudio não verbal. A lei de acessibilidade (WCAG SC 1.2.2, ADA Title II, Section 508, EAA) exige legendas ocultas que incluam todas as informações de áudio necessárias para entender o conteúdo. Uma trilha de legendas que carrega apenas diálogos não satisfaz esses requisitos.

As legendas presumem que o espectador consegue ouvir. Elas incluem apenas o necessário para acompanhar o diálogo em outro idioma (ou ocasionalmente no mesmo idioma, para espectadores que precisam de apoio de leitura).

  • Texto do diálogo, geralmente traduzido para o idioma do espectador.
  • Sem efeitos sonoros. O espectador consegue ouvir a porta batendo.
  • Sem indicações musicais. O espectador consegue ouvir a trilha sonora.
  • Sem identificação dos falantes, a menos que seja completamente ambíguo na tela.

Uma legenda de espanhol para inglês de um filme traduz o diálogo e para por aí. A trilha de legendas confia que o espectador ouviu o tiro, as risadas e o silêncio.

A implicação prática: se você tem uma trilha de legendas no seu vídeo, mas nenhuma trilha de legendas ocultas, você atendeu espectadores que não falam o idioma original, mas não atendeu espectadores surdos ou com deficiência auditiva. São duas entregas separadas.

Uma Observação sobre Terminologia

Os termos não são universais. Nos EUA, "captions" (legendas ocultas) geralmente significa a trilha de acessibilidade (indicações sonoras, identificação dos falantes), e "subtitles" (legendas) geralmente significa a trilha apenas de diálogo. No Reino Unido e em grande parte da Europa, "subtitles" cobre ambos, e "captions" raramente é usado. Plataformas de streaming (Netflix, Disney+, Amazon Prime) listam os dois tipos sob a palavra "legendas" em suas interfaces, mas os tratam de forma diferente internamente.

A Netflix, por exemplo, usa o termo SDH (Subtitles for the Deaf and Hard of Hearing — legendas para surdos e pessoas com deficiência auditiva) para a trilha de acessibilidade que carrega indicações sonoras. Internamente, a Netflix exige todos os arquivos SDH e de legendas em formato TTML1 (.xml ou .ttml), não SRT ou VTT, para seu pipeline de distribuição. É nesse contexto que a lacuna terminológica causa problemas reais de produção.

Formatos de Arquivo: O Que Usar Onde

Qual formato de arquivo devo usar para legendas ocultas vs legendas?

SRT é o mais portátil e funciona no YouTube, Vimeo, Facebook e na maioria dos players de vídeo. VTT (WebVTT) adiciona estilização e posicionamento para players HTML5 e é preferido para vídeo hospedado na web. TTML (e seu perfil IMSC1.1) é exigido para distribuição profissional de broadcast e OTT, como Netflix. SCC é usado em fluxos de trabalho de broadcast norte-americanos. Para a maioria dos criadores independentes e cursos online, gere SRT primeiro e converta conforme necessário.

FormatoMelhor paraPrincipais plataformas
SRTPortabilidade, maioria das plataformas onlineYouTube, Vimeo, Facebook, maioria dos players
VTT (WebVTT)Players web HTML5, controle de estilizaçãoVimeo, vídeo hospedado na web, elemento track do HTML5
SCCFluxos de trabalho de broadcast norte-americanoBroadcast legado e edição profissional
TTML / IMSC1.1Distribuição OTT e streamingNetflix, broadcast, Disney+, Amazon Prime
TXT / DOCXTranscrições para leituraPosts de blog, documentos, indexação em buscadores

A regra prática: gere SRT primeiro para máxima portabilidade e converta para TTML depois para distribuição OTT profissional. SRT e VTT servem tanto para legendagem quanto para legendas; o conteúdo determina qual tipo você tem, não a extensão do arquivo.

Para uma análise mais profunda do que cada formato contém e como os players os interpretam, veja como criar um arquivo SRT.

Trilhas no Mesmo Idioma vs Traduzidas

Um vídeo do YouTube em inglês pode ter uma trilha de legendas ocultas em inglês (acessibilidade, inclui indicações sonoras) e uma trilha de legendas em espanhol (diálogo traduzido, sem indicações sonoras). Mesmo formato de arquivo, conteúdo diferente:

  • Legendas ocultas no mesmo idioma: trilha de acessibilidade com identificação dos falantes e efeitos sonoros.
  • Legendas no mesmo idioma: apenas diálogo, às vezes usadas para apoio à compreensão ou em ambientes ruidosos; não substituem a acessibilidade.
  • Legendas ocultas traduzidas (SDH em outro idioma): indicações sonoras traduzidas junto com o diálogo; necessárias quando o conteúdo é originalmente em um idioma e o público-alvo pode ser surdo ou ter deficiência auditiva nesse idioma.
  • Legendas traduzidas: diálogo traduzido, sem indicações sonoras; atendem ao acesso ao idioma, não à acessibilidade.

O pipeline de transcrição produz o texto no idioma de origem. A tradução é uma etapa posterior, aplicada tanto às legendas ocultas quanto às legendas, dependendo da necessidade do público.

Quando Você Precisa de Cada Um

ObjetivoResultado correto
Post de blog a partir de uma entrevista gravadaTranscrição (TXT ou DOCX)
Notas de episódio de podcastTranscrição
Vídeo do YouTube: espectadores surdos e com deficiência auditivaLegendas ocultas no mesmo idioma (SRT ou VTT)
Vídeo do YouTube: espectadores que não falam inglêsLegendas traduzidas (SRT ou VTT)
TikTok ou Instagram ReelsLegendas abertas gravadas no vídeo
Registro de reunião ao vivo para a equipeTranscrição
Aula universitária ou curso onlineLegendas ocultas + transcrição separada
Filme para lançamento internacionalLegendas traduzidas por idioma
Vídeo de agência federal ou contratada (Section 508)Legendas ocultas + transcrição descritiva
Vídeo voltado ao público (ADA Title II, EAA)Legendas ocultas (apenas legendas não satisfazem isso)

Para a maioria dos criadores de conteúdo, a resposta é "transcrição e legendas ocultas". Tudo bem. Uma única rodada de transcrição pode produzir ambos: exporte TXT para leitura, exporte SRT para incorporação. O gerador de legendas produz arquivos SRT e VTT a partir de áudio ou vídeo em uma única etapa.

Exigências Legais: O Que a Lei Realmente Diz

Legendas geradas automaticamente são boas o suficiente para conformidade de acessibilidade?

Geralmente não por si só. A FCC usa 99% de precisão de palavras como referência para legendas de broadcast. A Section 508 e as diretrizes WCAG afirmam que legendas geradas automaticamente são insuficientes, a menos que sejam confirmadas como totalmente precisas, porque erros que alteram o significado criam uma barreira de acessibilidade. Planeje uma passada de edição humana na saída automática antes de publicar para fins de conformidade.

Minha opinião: o cenário legal é mais específico do que a maioria dos posts reconhece, e as distinções entre transcrição, legendas ocultas e legendas são exatamente onde as organizações erram.

WCAG (Diretrizes de Acessibilidade para Conteúdo Web):

  • SC 1.2.2 (Nível A): legendas ocultas para áudio pré-gravado em mídia sincronizada.
  • SC 1.2.4 (Nível AA): legendas ocultas para áudio ao vivo em mídia sincronizada.
  • Transcrições sozinhas satisfazem conteúdo somente em áudio, mas não vídeo com áudio.
  • Legendas não satisfazem nenhum dos dois requisitos.

ADA Title II (EUA): A regra final de abril de 2024 do DOJ estabeleceu WCAG 2.1 Nível AA como padrão de conformidade para entidades públicas. O primeiro prazo venceu em 24 de abril de 2026, para entidades que atendem populações acima de 50 mil.

Section 508 (federal dos EUA): Mídia sincronizada exige legendas ocultas (WCAG SC 1.2.2) mais audiodescrições para conteúdo visual significativo. Transcrições são exigidas separadamente para mídia somente em áudio.

FCC (broadcast dos EUA): Os padrões de qualidade adotados em 2014 definem precisão, sincronicidade, completude do programa e posicionamento das legendas como os quatro princípios. A referência do setor é 99% de precisão de palavras. Legendas geradas automaticamente não são consideradas suficientes sem uma passada de revisão humana.

Lei Europeia de Acessibilidade (EAA): Entrou em vigor em 28 de junho de 2025, abrangendo empresas que operam na UE ou vendem para residentes da UE. Conteúdo audiovisual deve incluir legendas ocultas ou legendas sincronizadas que atendam aos padrões de qualidade, com velocidade de leitura de aproximadamente 160-180 palavras por minuto.

Para uma análise completa da conformidade de legendagem entre jurisdições, veja conformidade WCAG com transcrições e legendas de acessibilidade e conformidade ADA.

Esta seção está atualizada até meados de 2026 e é fornecida apenas para informação geral, não como aconselhamento jurídico. Verifique os requisitos para sua jurisdição específica e caso de uso.

O Que Fazer a Seguir

Identifique primeiro sua entrega. Se o público vai ler, você precisa de uma transcrição. Se o público assiste sem áudio, você precisa de legendas ocultas. Se o público assiste, mas não entende o idioma falado, você precisa de legendas. A mesma rodada de transcrição produz os três; escolha a exportação e a passada de edição corretas para cada um.

Se você precisa gerar um arquivo de legendas ocultas ou de legendas sem construir um fluxo de trabalho completo, o gerador de legendas do ConvertAudioToText processa arquivos de áudio e vídeo e exporta SRT ou VTT diretamente.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles