
Como tornar vídeos acessíveis com legendas (Guia 2026)
Summarize this article with:
As legendas tornam seu vídeo acessível às mais de 430 milhões de pessoas com perda auditiva incapacitante, além de todos que assistem sem som. O processo tem quatro etapas: gerar legendas com uma ferramenta de IA, corrigi-las conforme o padrão de acessibilidade (diálogo literal, eventos sonoros, identificação dos falantes), escolher o formato certo para cada plataforma e testar antes de publicar. A maioria das plataformas aceita upload de arquivos SRT; feeds sociais exigem legendas abertas gravadas no vídeo. As exigências legais agora se aplicam a um conjunto de organizações mais amplo do que a maioria imagina, e o nível de precisão exigido para conformidade é maior do que qualquer legenda automática de plataforma consegue atingir de forma confiável.
Legendas são a melhoria de acessibilidade de maior impacto que você pode fazer em um vídeo. Elas atendem às 430 milhões de pessoas no mundo com perda auditiva incapacitante (estimativa da OMS), todos que assistem sem som em público e qualquer pessoa cujo primeiro idioma não seja o idioma falado do vídeo. Vídeos legendados também alcançam taxas de conclusão de visualização 40% maiores do que vídeos sem legendas, e no Facebook cerca de 85% dos vídeos são assistidos sem som.
Este guia percorre todo o processo de legendagem: gerar, corrigir conforme o padrão, formatar para cada plataforma e verificar. Para se aprofundar em conformidade, veja conformidade ADA de legendas de acessibilidade.
Entenda os três tipos de legendas
Legendas ocultas (closed captions) são faixas de texto separadas que o espectador pode ativar ou desativar. Elas trazem diálogo, identificação dos falantes e descrições de áudio não falado. SRT, VTT, SBV e TTML são formatos de legendas ocultas. Legendas ocultas são o padrão para conformidade de acessibilidade.
Legendas abertas (open captions) são gravadas permanentemente no vídeo. O espectador não pode removê-las. É o padrão para conteúdo de redes sociais (Instagram Reels, TikTok, feed do Facebook), onde a reprodução automática acontece sem som.
Legendas traduzidas (subtitles) traduzem o diálogo para outro idioma. Elas pressupõem que o espectador consegue ouvir o áudio e normalmente omitem sons não falados. Para fins de acessibilidade, legendas traduzidas não substituem legendas ocultas.
A base para qualquer requisito de acessibilidade são as legendas ocultas, não as legendas traduzidas. Legendas abertas satisfazem o mesmo requisito apenas quando o espectador não tem nenhum mecanismo para desativar as legendas.
Etapa 1: Gerar legendas
Envie seu vídeo para o gerador de legendas. Ele aceita MP4, MOV, AVI, MKV, WebM e outros formatos comuns. Selecione o idioma falado e inicie o processamento. Um vídeo de 10 minutos normalmente leva menos de 90 segundos.

Legendas geradas por IA alcançam 95–98% de precisão em áudio limpo com fala clara. A precisão cai com falantes sobrepostos, sotaques fortes, música de fundo ou discurso técnico rápido. O gerador dá o ponto de partida; a revisão humana é o que leva você ao padrão de conformidade.
Se você precisa apenas de uma transcrição sem formatação específica de plataforma, o ConvertAudioToText produz texto literal limpo a partir de áudio ou vídeo na mesma etapa.
Etapa 2: Corrigir conforme o padrão de acessibilidade
A saída bruta da IA não está pronta para acessibilidade. Revise e corrija:
Precisão literal. Cada palavra falada deve aparecer, na ordem correta. Não parafraseie, resuma nem omita palavras de preenchimento se a experiência do espectador depender delas. Nomes próprios, marcas e termos técnicos são os erros mais comuns da IA.
Eventos sonoros. Conforme os padrões de legendagem do DCMP e a WCAG 1.2.2, as legendas devem incluir informações de áudio não falado que afetam o significado. Use colchetes: [telefone tocando], [jazz animado], [porta batendo]. Omita sons ambientes que não carregam informação significativa. Quando um evento sonoro ocorre ao mesmo tempo que o diálogo, mova a legenda do evento sonoro para o topo da tela.
Identificação do falante. Quando mais de uma pessoa fala, rotule cada legenda com o nome do falante ou um rótulo consistente de papel (NARRADOR, ENTREVISTADOR, DRA. CHEN). Use letras maiúsculas ou notação entre parênteses consistente. Isso não é opcional para conteúdo com múltiplos falantes segundo os padrões de acessibilidade.
Temporização. As legendas devem aparecer no momento em que as palavras são ditas e desaparecer logo em seguida. Legendas adiantadas ou atrasadas prejudicam a compreensão. Preste muita atenção a pausas, limites de frases e trechos de fala rápida.
Comprimento de linha e velocidade de leitura. As diretrizes do DCMP e da Seção 508 recomendam no máximo duas linhas por legenda, 32–42 caracteres por linha e velocidade de leitura abaixo de 180 palavras por minuto (cerca de 17–22 caracteres por segundo para broadcast). Quebre as linhas em fronteiras linguísticas naturais, não no meio de frases ou palavras.
Etapa 3: Escolher o formato certo para cada plataforma
Nem toda plataforma lida com legendas da mesma forma.
| Plataforma | Método preferido | Arquivo suportado | Observações |
|---|---|---|---|
| YouTube | Upload de SRT | SRT, VTT, SBV | Sempre envie o arquivo; legendas automáticas alcançam 78–96% de precisão, bem abaixo do padrão de conformidade |
| Vimeo | Upload de VTT ou SRT | SRT, VTT | Suporta várias faixas de idiomas |
| Upload de SRT na hora da publicação | SRT | Não é possível adicionar ou editar legendas depois de publicar | |
| Upload de SRT | SRT | Legendas automáticas disponíveis, mas exigem revisão | |
| Instagram Reels | Gravar legendas no vídeo | N/A | Legendas automáticas da plataforma são inconsistentes; legendas abertas gravadas no vídeo são mais confiáveis |
| TikTok | Gravar legendas no vídeo ou usar o recurso nativo | SRT limitado | As legendas automáticas do TikTok melhoram constantemente, mas ainda erram em nomes e termos técnicos |
| Seu site | Referenciar VTT via elemento track do HTML5 | VTT | Use o elemento track com kind="captions" |
Para o YouTube, as etapas de upload são: YouTube Studio, depois Legendas, selecione seu vídeo, clique em "Adicionar idioma", depois em "Adicionar" e envie o arquivo SRT. Nunca dependa das legendas geradas automaticamente pelo YouTube para conformidade de acessibilidade.
Para Instagram e TikTok, grave as legendas no vídeo antes do upload usando Adicionar Legendas ao Vídeo. No TikTok, mantenha as legendas no terço superior do quadro para evitar sobreposição com os elementos de interface da própria plataforma.
Para o seu próprio site, o HTML fica assim:
<video>
<track kind="captions" src="captions.vtt" srclang="en" label="English" default>
</video>
Se você precisar converter entre SRT e VTT, o Gerador de Legendas exporta ambos os formatos.
Etapa 4: Testar antes de publicar
Assista ao vídeo completo com as legendas ativadas. Verifique:
- As legendas aparecem e saem em sincronia com a fala
- Os rótulos de falante estão presentes e consistentes em todo o conteúdo com múltiplos falantes
- Os eventos sonoros estão capturados e com a temporização correta
- Sem linhas longas que saiam da tela ou obscureçam conteúdo visual crítico
- O tamanho da fonte é legível no tamanho típico de exibição (mínimo equivalente a 18px para resolução de vídeo padrão, texto branco com sombra escura ou caixa)
Teste no celular. A maioria dos espectadores está no celular e a legibilidade das legendas é mais difícil de avaliar na prévia do desktop.
Requisitos legais
O cenário de conformidade ficou bem mais rigoroso nos últimos dois anos.
WCAG 2.1 Nível AA exige legendas para toda mídia sincronizada pré-gravada (Critério de Sucesso 1.2.2, Nível A) e para todo vídeo ao vivo (1.2.4, Nível AA). A WCAG 2.2 não alterou esses critérios. A maioria das organizações mira o Nível AA.
Título II da ADA (EUA): A regra final de abril de 2024 do DOJ codificou a WCAG 2.1 Nível AA para serviços digitais de governos estaduais e locais. O prazo de conformidade foi estendido em abril de 2026: entidades que atendem populações acima de 50 mil devem cumprir até 26 de abril de 2027; entidades menores e distritos especiais têm até 26 de abril de 2028.
Seção 508 (federal dos EUA): Agências federais e seus contratados devem adicionar legendas a todo vídeo disponível publicamente. Legendas automáticas não atendem ao padrão de precisão da Seção 508 para conteúdo pré-gravado.
Ato Europeu de Acessibilidade (EAA): Entrou em vigor em 28 de junho de 2025. Vídeo voltado ao público publicado após essa data deve incluir legendas ocultas precisas e sincronizadas com o tempo. Vídeos publicados antes de 28 de junho de 2025 devem ser tornados acessíveis até 28 de junho de 2030. As multas variam de 5.000 a 100.000 euros por descumprimento.
A Seção 1.2.2 é um requisito de Nível A, ou seja, é o limite mínimo, não uma meta avançada. Organizações que alegam qualquer conformidade WCAG devem atendê-lo.
Minha opinião: a maioria das organizações está mais longe da conformidade do que imagina, porque conta legendas automáticas como "legendado". Legendas automáticas de plataforma só marcam a caixinha quando são revisadas e corrigidas. Uma taxa de precisão de 85% sem correção não é legendagem acessível; é um rascunho inicial.
Referência de formatação de legendas
Seguir estas convenções mantém as legendas legíveis e atende à maioria dos órgãos de padronização:
- Máximo de duas linhas por legenda
- 32–42 caracteres por linha (32 para broadcast, até 42 para vídeo online)
- Caixa mista (não TUDO EM MAIÚSCULAS para legendas completas)
- Velocidade de leitura: 17–22 caracteres por segundo
- Eventos sonoros entre colchetes: [telefone tocando]
- Identificação do falante em maiúsculas antes dos dois-pontos: ANNA: Precisamos sair agora.
- Posição no centro inferior do quadro, a menos que isso bloqueie conteúdo crítico
- Mínimo de 1 segundo em tela; nada de aparecer e sumir rapidamente
- Quebre as linhas em limites de orações, nunca no meio de frases
Para legendas abertas em vídeo social, o peso da fonte importa mais do que em sistemas de legendas ocultas. Use uma sans-serif em negrito, limpa, com contorno ou sombra de alto contraste. A legenda deve ser legível tanto em fundos claros quanto escuros.
O argumento de negócio, em resumo
Acessibilidade não deveria precisar de justificativa financeira, mas os números são reais. Anúncios em vídeo legendados têm taxa de skip de 18%, contra 41% dos sem legendas. Vídeos do YouTube com legendas têm cerca de 7% mais engajamento. Conteúdo do TikTok com legendas mostra aumento mensurável de recall de marca. Os 85% dos vídeos do Facebook assistidos sem som são a estatística mais antiga desse universo, mas continua sendo verdade.
Arquivos de legenda também são a ferramenta de reaproveitamento de conteúdo mais barata que você tem. Um SRT limpo vira uma transcrição, um rascunho de post de blog e notas do episódio sem trabalho extra. Veja melhor transcrição para podcasts 2026 para saber como isso se aplica a conteúdo de áudio.
Perguntas frequentes
Qual é a diferença entre legendas ocultas (closed captions) e legendas traduzidas para acessibilidade?
As legendas ocultas incluem diálogos, identificação dos falantes e descrições de áudio não falado, como efeitos sonoros e indicações musicais. As legendas traduzidas apenas transcrevem a fala para espectadores que conseguem ouvir o áudio, mas precisam de outro idioma. Para fins de acessibilidade, as legendas ocultas são obrigatórias; legendas traduzidas sozinhas não atendem ao padrão.
As legendas geradas automaticamente no YouTube ou no TikTok atendem aos requisitos de acessibilidade?
Não, não da forma como são entregues. As legendas automáticas das plataformas variam de 78% a 96% de precisão, dependendo da qualidade do áudio e da clareza do falante. Os padrões de acessibilidade, incluindo WCAG 1.2.2 e Seção 508, exigem legendas precisas. A prática do setor e as orientações do DOJ tratam legendas automáticas não corrigidas como insuficientes para conteúdo pré-gravado. Você precisa gerar, revisar e corrigir as legendas antes de fazer o upload.
O que as legendas acessíveis devem incluir além das palavras faladas?
Seguindo os padrões WCAG 1.2.2 e DCMP, as legendas acessíveis devem incluir todo o áudio não falado com significado: efeitos sonoros que transmitem informação (indicados entre colchetes), descrições de música quando relevantes, identificação do falante quando mais de uma pessoa fala e vocalizações não verbais como risadas ou suspiros quando carregam significado. Silêncio e ruído ambiente só precisam ser indicados se a ausência deles confundir o espectador.
Quais organizações são legalmente obrigadas a adicionar legendas aos seus vídeos?
Nos Estados Unidos, a Seção 508 cobre agências federais e seus contratados. O Título II da ADA cobre entidades governamentais estaduais e locais (prazo estendido para 2027–2028). O Título III da ADA aplica-se cada vez mais a empresas que operam acomodações públicas, incluindo sites. O Ato Europeu de Acessibilidade cobre empresas que vendem para clientes da UE, com prazo de junho de 2025 para conteúdo novo. Instituições educacionais que recebem financiamento federal enfrentam requisitos adicionais sob a Seção 504. Em caso de dúvida, legendas em todo vídeo voltado ao público é a abordagem mais segura.
Como adicionar legendas a uma transmissão ao vivo ou a um evento em tempo real?
A legendagem ao vivo exige conversão de fala em texto em tempo real. As opções incluem provedores profissionais de CART (Communication Access Realtime Translation) para eventos de alto risco, legendas ao vivo nativas do YouTube Live e do Microsoft Teams e ferramentas de transcrição em tempo real com IA. As expectativas de precisão para legendas ao vivo são menores do que para conteúdo pré-gravado sob a WCAG 1.2.4, mas as legendas ainda devem estar sincronizadas e substancialmente precisas. Para reuniões e sessões gravadas, transcrever depois com transcrição de reuniões e adicionar legendas à gravação costuma ser mais prático.
Fontes
- W3C WAI, WCAG 2.2 Understanding 1.2.2 Captions (Prerecorded): https://www.w3.org/WAI/WCAG22/Understanding/captions-prerecorded.html
- DCMP Captioning Key standards and guidelines: https://dcmp.org/learn/captioningkey
- Section 508, Captions and Transcripts: https://www.section508.gov/create/captions-transcripts/
- Federal Register, Extension of ADA Title II Compliance Dates, April 2026: https://www.federalregister.gov/documents/2026/04/20/2026-07663/extension-of-compliance-dates-for-nondiscrimination-on-the-basis-of-disability-accessibility-of-web
- Interprefy, European Accessibility Act Captioning Requirements: https://www.interprefy.com/resources/blog/european-accessibility-act-captioning-requirements
- WHO, World Report on Hearing (hearing loss prevalence): https://www.ncbi.nlm.nih.gov/pmc/articles/PMC8085630/
- GrabCaptions, YouTube Auto-Caption Accuracy 2026: https://grabcaptions.com/blog/youtube-auto-captions-accuracy/
- Nieman Journalism Lab, 85 percent of Facebook video watched without sound: https://www.niemanlab.org/reading/publishers-say-85-percent-of-facebook-video-is-watched-without-sound/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.