
Transcrição vs. Legendagem vs. Legendas: Guia de 2026
Summarize this article with:
A transcrição produz um documento legível a partir do áudio. A legendagem produz texto cronometrado exibido na tela para espectadores que não podem ouvir, incluindo efeitos sonoros e identificação dos falantes. As legendas traduzem ou transcrevem diálogos para espectadores que não entendem o idioma e omitem indicações sonoras que o espectador já consegue ouvir. Uma mesma rodada de transcrição pode gerar os três resultados; basta usar a exportação e a passada de edição certas para cada um. Legendas traduzidas não satisfazem a lei de acessibilidade: apenas legendas ocultas verdadeiras satisfazem.
Uma transcrição, uma trilha de legendas ocultas e um arquivo de legendas são três coisas diferentes. Todos os três partem do mesmo áudio, mas cada um resolve um problema diferente, chega em um formato diferente e carrega um conteúdo diferente. Escolher o errado significa decepcionar seu público ou reprovar em uma verificação de conformidade.
Os Três Artefatos, Mapeados
| Transcrição | Legendas Ocultas | Legendas | |
|---|---|---|---|
| Público | Leitores | Espectadores que não podem ouvir | Espectadores que não entendem o idioma falado |
| Inclui efeitos sonoros? | Não (exceto se essenciais) | Sim, obrigatório | Não |
| Inclui indicações musicais? | Não | Sim | Não |
| Inclui identificação dos falantes? | Quando há vários falantes | Sim, obrigatório | Somente se ambíguo na tela |
| Traduzido? | Raramente | Mesmo idioma ou traduzido | Geralmente traduzido |
| Formatos típicos | TXT, DOCX, PDF | SRT, VTT, SCC, TTML | SRT, VTT, SBV |
| Onde é exigido por lei | Conteúdo somente em áudio (Section 508) | Vídeo pré-gravado (WCAG SC 1.2.2), vídeo ao vivo (SC 1.2.4) | Nenhuma lei de acessibilidade exige |
Essa última linha é a que mais surpreende as pessoas: legendas traduzidas não satisfazem a lei de acessibilidade. Apenas legendas ocultas verdadeiras satisfazem.
Transcrição: O Resultado É um Documento
Qual é a diferença entre uma transcrição e legendas ocultas?
Uma transcrição é um documento: sem códigos de tempo, otimizada para leitura, com estrutura em parágrafos e sem limites de comprimento de linha. Legendas ocultas são uma trilha de texto cronometrada e sincronizada com um vídeo, armazenada separadamente do vídeo para que os espectadores possam ativá-las ou desativá-las. Ambas começam com a mesma passada de reconhecimento de fala, mas o formato de saída, o conteúdo e as convenções de edição são diferentes.
Uma transcrição foi feita para ser lida, não assistida. Isso muda tudo sobre como ela é formatada.
- Estrutura em nível de parágrafo para legibilidade, não quebras de linha de 32 caracteres.
- Rótulos de falantes quando há mais de uma voz, escritos por extenso para facilitar a leitura.
- Sem necessidade de códigos de tempo (marcações de tempo opcionais para navegação são aceitáveis).
- Pontuação e formatação otimizadas para um leitor, não para um player de vídeo.
- Sem limite de comprimento de linha. Sem marcadores de fim de legenda.
Se você pegar um arquivo de legendas e colá-lo em um documento, obterá algo que parece uma fita de teletipo impressa. Uma transcrição adequada é editada para ler como uma entrevista ou artigo bem acabados. As duas coisas são estruturalmente diferentes mesmo quando as palavras são as mesmas.
Casos de uso comuns: posts de blog a partir de entrevistas, notas de episódios de podcasts, registros de reuniões, trabalhos acadêmicos, depoimentos jurídicos e conteúdo para indexação em buscadores.
Legendas Ocultas: O Resultado É uma Trilha de Acessibilidade Sincronizada

O que as legendas ocultas devem incluir que as legendas não incluem?
Legendas ocultas devem incluir identificação dos falantes, efeitos sonoros (por exemplo, [porta bate], [telefone toca]), indicações musicais ([música animada], [aplausos da plateia]), identificação de falantes fora da tela e indicadores de tom quando o texto sozinho é ambíguo. As legendas carregam apenas diálogos, às vezes traduzidos, porque o espectador consegue ouvir todo o resto.
A legendagem é projetada para um espectador assistindo sem nenhum áudio. Tudo o que ele ouviria deve aparecer na tela, e é por isso que as legendas ocultas carregam conteúdo que transcrições e legendas não carregam.
Elementos obrigatórios:
- Identificação dos falantes. "Alice:" ou "[Bob]" antes de cada fala, especialmente quando os falantes estão fora da tela ou não são visualmente identificáveis.
- Efeitos sonoros. "[porta bate]", "[telefone toca]", "[plateia aplaude]".
- Indicações musicais. "[música animada tocando]", "[cordas sombrias]", "[música: letra aqui]".
- Indicadores de tom quando o significado emocional não fica claro apenas pelas palavras. "[sarcástico]", "[sussurrando]".
As legendas ocultas também são sincronizadas com o tempo do vídeo: cada legenda tem horário de início e de término, e o texto aparece na tela em sincronia com o áudio. A qualidade dessa sincronização importa legalmente.
Para plataformas sociais, o post sobre legendas abertas vs ocultas cobre a distinção em detalhes. Em resumo: legendas ocultas são um interruptor (o botão CC no YouTube); legendas abertas são gravadas nos pixels do vídeo e não podem ser removidas. Conteúdo social curto (TikTok, Instagram Reels) normalmente usa legendas abertas porque a maioria dos espectadores assiste no mudo e o suporte a legendas ocultas das plataformas é inconsistente. Saiba mais no guia de legendagem para TikTok e Instagram.
Legendas: O Resultado É uma Trilha de Diálogo para Acesso ao Idioma
As legendas contam como legendas ocultas para fins de conformidade de acessibilidade?
Não. As legendas presumem que o espectador consegue ouvir e, portanto, omitem efeitos sonoros, indicações musicais e áudio não verbal. A lei de acessibilidade (WCAG SC 1.2.2, ADA Title II, Section 508, EAA) exige legendas ocultas que incluam todas as informações de áudio necessárias para entender o conteúdo. Uma trilha de legendas que carrega apenas diálogos não satisfaz esses requisitos.
As legendas presumem que o espectador consegue ouvir. Elas incluem apenas o necessário para acompanhar o diálogo em outro idioma (ou ocasionalmente no mesmo idioma, para espectadores que precisam de apoio de leitura).
- Texto do diálogo, geralmente traduzido para o idioma do espectador.
- Sem efeitos sonoros. O espectador consegue ouvir a porta batendo.
- Sem indicações musicais. O espectador consegue ouvir a trilha sonora.
- Sem identificação dos falantes, a menos que seja completamente ambíguo na tela.
Uma legenda de espanhol para inglês de um filme traduz o diálogo e para por aí. A trilha de legendas confia que o espectador ouviu o tiro, as risadas e o silêncio.
A implicação prática: se você tem uma trilha de legendas no seu vídeo, mas nenhuma trilha de legendas ocultas, você atendeu espectadores que não falam o idioma original, mas não atendeu espectadores surdos ou com deficiência auditiva. São duas entregas separadas.
Uma Observação sobre Terminologia
Os termos não são universais. Nos EUA, "captions" (legendas ocultas) geralmente significa a trilha de acessibilidade (indicações sonoras, identificação dos falantes), e "subtitles" (legendas) geralmente significa a trilha apenas de diálogo. No Reino Unido e em grande parte da Europa, "subtitles" cobre ambos, e "captions" raramente é usado. Plataformas de streaming (Netflix, Disney+, Amazon Prime) listam os dois tipos sob a palavra "legendas" em suas interfaces, mas os tratam de forma diferente internamente.
A Netflix, por exemplo, usa o termo SDH (Subtitles for the Deaf and Hard of Hearing — legendas para surdos e pessoas com deficiência auditiva) para a trilha de acessibilidade que carrega indicações sonoras. Internamente, a Netflix exige todos os arquivos SDH e de legendas em formato TTML1 (.xml ou .ttml), não SRT ou VTT, para seu pipeline de distribuição. É nesse contexto que a lacuna terminológica causa problemas reais de produção.
Formatos de Arquivo: O Que Usar Onde
Qual formato de arquivo devo usar para legendas ocultas vs legendas?
SRT é o mais portátil e funciona no YouTube, Vimeo, Facebook e na maioria dos players de vídeo. VTT (WebVTT) adiciona estilização e posicionamento para players HTML5 e é preferido para vídeo hospedado na web. TTML (e seu perfil IMSC1.1) é exigido para distribuição profissional de broadcast e OTT, como Netflix. SCC é usado em fluxos de trabalho de broadcast norte-americanos. Para a maioria dos criadores independentes e cursos online, gere SRT primeiro e converta conforme necessário.
| Formato | Melhor para | Principais plataformas |
|---|---|---|
| SRT | Portabilidade, maioria das plataformas online | YouTube, Vimeo, Facebook, maioria dos players |
| VTT (WebVTT) | Players web HTML5, controle de estilização | Vimeo, vídeo hospedado na web, elemento track do HTML5 |
| SCC | Fluxos de trabalho de broadcast norte-americano | Broadcast legado e edição profissional |
| TTML / IMSC1.1 | Distribuição OTT e streaming | Netflix, broadcast, Disney+, Amazon Prime |
| TXT / DOCX | Transcrições para leitura | Posts de blog, documentos, indexação em buscadores |
A regra prática: gere SRT primeiro para máxima portabilidade e converta para TTML depois para distribuição OTT profissional. SRT e VTT servem tanto para legendagem quanto para legendas; o conteúdo determina qual tipo você tem, não a extensão do arquivo.
Para uma análise mais profunda do que cada formato contém e como os players os interpretam, veja como criar um arquivo SRT.
Trilhas no Mesmo Idioma vs Traduzidas
Um vídeo do YouTube em inglês pode ter uma trilha de legendas ocultas em inglês (acessibilidade, inclui indicações sonoras) e uma trilha de legendas em espanhol (diálogo traduzido, sem indicações sonoras). Mesmo formato de arquivo, conteúdo diferente:
- Legendas ocultas no mesmo idioma: trilha de acessibilidade com identificação dos falantes e efeitos sonoros.
- Legendas no mesmo idioma: apenas diálogo, às vezes usadas para apoio à compreensão ou em ambientes ruidosos; não substituem a acessibilidade.
- Legendas ocultas traduzidas (SDH em outro idioma): indicações sonoras traduzidas junto com o diálogo; necessárias quando o conteúdo é originalmente em um idioma e o público-alvo pode ser surdo ou ter deficiência auditiva nesse idioma.
- Legendas traduzidas: diálogo traduzido, sem indicações sonoras; atendem ao acesso ao idioma, não à acessibilidade.
O pipeline de transcrição produz o texto no idioma de origem. A tradução é uma etapa posterior, aplicada tanto às legendas ocultas quanto às legendas, dependendo da necessidade do público.
Quando Você Precisa de Cada Um
| Objetivo | Resultado correto |
|---|---|
| Post de blog a partir de uma entrevista gravada | Transcrição (TXT ou DOCX) |
| Notas de episódio de podcast | Transcrição |
| Vídeo do YouTube: espectadores surdos e com deficiência auditiva | Legendas ocultas no mesmo idioma (SRT ou VTT) |
| Vídeo do YouTube: espectadores que não falam inglês | Legendas traduzidas (SRT ou VTT) |
| TikTok ou Instagram Reels | Legendas abertas gravadas no vídeo |
| Registro de reunião ao vivo para a equipe | Transcrição |
| Aula universitária ou curso online | Legendas ocultas + transcrição separada |
| Filme para lançamento internacional | Legendas traduzidas por idioma |
| Vídeo de agência federal ou contratada (Section 508) | Legendas ocultas + transcrição descritiva |
| Vídeo voltado ao público (ADA Title II, EAA) | Legendas ocultas (apenas legendas não satisfazem isso) |
Para a maioria dos criadores de conteúdo, a resposta é "transcrição e legendas ocultas". Tudo bem. Uma única rodada de transcrição pode produzir ambos: exporte TXT para leitura, exporte SRT para incorporação. O gerador de legendas produz arquivos SRT e VTT a partir de áudio ou vídeo em uma única etapa.
Exigências Legais: O Que a Lei Realmente Diz
Legendas geradas automaticamente são boas o suficiente para conformidade de acessibilidade?
Geralmente não por si só. A FCC usa 99% de precisão de palavras como referência para legendas de broadcast. A Section 508 e as diretrizes WCAG afirmam que legendas geradas automaticamente são insuficientes, a menos que sejam confirmadas como totalmente precisas, porque erros que alteram o significado criam uma barreira de acessibilidade. Planeje uma passada de edição humana na saída automática antes de publicar para fins de conformidade.
Minha opinião: o cenário legal é mais específico do que a maioria dos posts reconhece, e as distinções entre transcrição, legendas ocultas e legendas são exatamente onde as organizações erram.
WCAG (Diretrizes de Acessibilidade para Conteúdo Web):
- SC 1.2.2 (Nível A): legendas ocultas para áudio pré-gravado em mídia sincronizada.
- SC 1.2.4 (Nível AA): legendas ocultas para áudio ao vivo em mídia sincronizada.
- Transcrições sozinhas satisfazem conteúdo somente em áudio, mas não vídeo com áudio.
- Legendas não satisfazem nenhum dos dois requisitos.
ADA Title II (EUA): A regra final de abril de 2024 do DOJ estabeleceu WCAG 2.1 Nível AA como padrão de conformidade para entidades públicas. O primeiro prazo venceu em 24 de abril de 2026, para entidades que atendem populações acima de 50 mil.
Section 508 (federal dos EUA): Mídia sincronizada exige legendas ocultas (WCAG SC 1.2.2) mais audiodescrições para conteúdo visual significativo. Transcrições são exigidas separadamente para mídia somente em áudio.
FCC (broadcast dos EUA): Os padrões de qualidade adotados em 2014 definem precisão, sincronicidade, completude do programa e posicionamento das legendas como os quatro princípios. A referência do setor é 99% de precisão de palavras. Legendas geradas automaticamente não são consideradas suficientes sem uma passada de revisão humana.
Lei Europeia de Acessibilidade (EAA): Entrou em vigor em 28 de junho de 2025, abrangendo empresas que operam na UE ou vendem para residentes da UE. Conteúdo audiovisual deve incluir legendas ocultas ou legendas sincronizadas que atendam aos padrões de qualidade, com velocidade de leitura de aproximadamente 160-180 palavras por minuto.
Para uma análise completa da conformidade de legendagem entre jurisdições, veja conformidade WCAG com transcrições e legendas de acessibilidade e conformidade ADA.
Esta seção está atualizada até meados de 2026 e é fornecida apenas para informação geral, não como aconselhamento jurídico. Verifique os requisitos para sua jurisdição específica e caso de uso.
O Que Fazer a Seguir
Identifique primeiro sua entrega. Se o público vai ler, você precisa de uma transcrição. Se o público assiste sem áudio, você precisa de legendas ocultas. Se o público assiste, mas não entende o idioma falado, você precisa de legendas. A mesma rodada de transcrição produz os três; escolha a exportação e a passada de edição corretas para cada um.
Se você precisa gerar um arquivo de legendas ocultas ou de legendas sem construir um fluxo de trabalho completo, o gerador de legendas do ConvertAudioToText processa arquivos de áudio e vídeo e exporta SRT ou VTT diretamente.
Fontes
- W3C WAI, "Captions/Subtitles": https://www.w3.org/WAI/media/av/captions/
- W3C WAI, "Understanding SC 1.2.2 Captions (Prerecorded)": https://www.w3.org/WAI/WCAG22/Understanding/captions-prerecorded.html
- Section508.gov, "Video and Other Synchronized Media": https://www.section508.gov/create/synchronized-media/
- 3Play Media, "FCC Closed Captioning Quality Standards": https://www.3playmedia.com/blog/fccs-new-quality-standards-closed-captioning-video-programming/
- FCC, "FCC Adopts Closed Captioning Quality Standards for TV Programs": https://www.fcc.gov/fcc-adopts-closed-captioning-quality-standards-tv-programs
- Netflix Partner Help Center, "Timed Text Style Guide: General Requirements": https://partnerhelp.netflixstudios.com/hc/en-us/articles/215758617-Timed-Text-Style-Guide-General-Requirements
- Interprefy, "The European Accessibility Act 2025 Captioning Requirements": https://www.interprefy.com/resources/blog/european-accessibility-act-captioning-requirements
- DOJ April 2024 Title II final rule, ADA.gov
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.