
Conformidade WCAG com transcrições: SC 1.2 mapeado (2026)
Summarize this article with:
Este artigo não constitui orientação jurídica. Os critérios do WCAG são padrões técnicos, não instrumentos legais. Se uma regulamentação específica exige conformidade, e em qual nível, depende da sua jurisdição, do tipo da sua organização e da lei em questão. Consulte assessoria jurídica para determinações de conformidade.
Os Critérios Que Envolvem Transcrições
Transcrições são o artefato de acessibilidade mais versátil para conteúdo de áudio, mas cobrem apenas parte do cenário da Diretriz 1.2. O SC 1.2.1 exige uma transcrição para conteúdo somente em áudio. O SC 1.2.3 permite usar uma transcrição como alternativa de mídia para vídeo no nível A. Além desses dois, as transcrições apoiam o trabalho, mas não substituem legendas nem audiodescrição.
O WCAG 2.2 deixou a Diretriz 1.2 completamente inalterada em relação à 2.1. Os critérios abaixo se aplicam igualmente nas duas versões. Os novos critérios do WCAG 2.2 tratam de navegação por teclado, áreas de toque e acessibilidade cognitiva, não de mídia baseada em tempo.
Como o SC 1.2 É Organizado
Os nove critérios de sucesso da Diretriz 1.2 se distribuem em três níveis de conformidade:
| Nível | Critérios de Sucesso |
|---|---|
| A (mínimo) | 1.2.1, 1.2.2, 1.2.3 |
| AA (meta para a maior parte do conteúdo público) | 1.2.4, 1.2.5 |
| AAA (aspiracional, geralmente não exigido) | 1.2.6, 1.2.7, 1.2.8, 1.2.9 |
A maioria das regulamentações tem como meta o nível AA. A ADA Title II nos EUA exige WCAG 2.1 AA para governos estaduais e locais (prazos de conformidade prorrogados para abril de 2027 e abril de 2028, dependendo do tamanho da população). A Seção 508, para agências federais dos EUA, exige WCAG 2.0 AA. O Ato Europeu da Acessibilidade da UE, aplicado a partir de junho de 2025 sob a EN 301 549, atualmente referencia o WCAG 2.1 AA. Para uma comparação mais aprofundada desses marcos por país, veja leis de acessibilidade por país.
SC 1.2.1: Somente Áudio e Somente Vídeo (Pré-gravado), Nível A
Para conteúdo somente em áudio, forneça uma transcrição em texto. Para conteúdo somente em vídeo (sem som), forneça uma transcrição ou uma trilha de áudio descrevendo o que é exibido.
Um episódio de podcast, uma aula gravada sem vídeo ou qualquer arquivo de áudio autônomo se enquadra neste critério. A transcrição deve transmitir as mesmas informações do áudio: fala, sons relevantes que não sejam fala e identificação dos falantes quando houver mais de uma pessoa falando.
O que conta como suficiente: o W3C especifica "descrições textuais corretamente sequenciadas das informações visuais e sonoras baseadas em tempo". Um resumo não serve. Uma transcrição que pula trechos ou omite conteúdo-chave também não serve. Pequenas variações de palavras e erros de grafia em nomes próprios são geralmente aceitáveis quando o significado está preservado.
A transcrição não precisa estar incorporada na mesma página do áudio, mas deve ser facilmente alcançável a partir dele. HTML na própria página ou HTML vinculado satisfazem o critério. Uma transcrição em PDF pode atender ao requisito, mas cria barreiras extras de acessibilidade; HTML é o caminho mais limpo.
Uma exceção: se o conteúdo somente em áudio for, ele próprio, uma alternativa de mídia para conteúdo textual já presente na página, e estiver claramente rotulado como tal, o SC 1.2.1 não se aplica.

Se você só precisa de uma transcrição limpa para um podcast ou áudio gravado, a ferramenta de áudio para texto do ConvertAudioToText produz uma transcrição em texto que você pode baixar, revisar e publicar junto ao seu player de áudio.
SC 1.2.2: Legendas (Pré-gravado), Nível A
Todo vídeo pré-gravado com áudio em um site de acesso público precisa de legendas sincronizadas.
"Sincronizadas" é a palavra-chave. As legendas devem aparecer durante a fala que representam, não antes nem depois, em bloco. Elas também devem incluir o áudio relevante que não é fala: "[porta se fecha]", "[música animada]", rótulos de falantes para conteúdo com várias pessoas.
O WCAG não define uma porcentagem específica de precisão. As orientações da FCC e do DOJ apontam 99% como meta para conteúdo de transmissão e público. Profissionais de acessibilidade geralmente tratam 95% como piso prático. Legendas automáticas de plataformas de vídeo costumam falhar em nomes próprios, termos técnicos, falantes sobrepostos e áudio que não é fala.
O fluxo de trabalho para legendas conformes:
- Envie o vídeo diretamente para uma ferramenta de transcrição ou extraia o áudio para uma conversão de vídeo para texto.
- Gere um arquivo de legendas cronometrado em SRT ou VTT.
- Faça a revisão humana: corrija nomes, termos técnicos, adicione indicações de sons que não são fala, verifique a temporização.
- Envie o arquivo revisado ao seu host de vídeo como faixa de legendas manual.
Legendas automáticas do seu host de vídeo são um ponto de partida, não um ponto de chegada.
SC 1.2.3: Audiodescrição ou Alternativa de Mídia (Pré-gravado), Nível A
Para vídeo sincronizado pré-gravado (vídeo com áudio), forneça audiodescrição ou uma alternativa de mídia completa em texto. Você escolhe qual.
Este é o critério mais frequentemente mal interpretado. O "ou" é real e sustenta tudo no nível A.
Opção A, audiodescrição: Um narrador descreve o conteúdo visual durante as pausas naturais do diálogo. "Ela caminha até o quadro branco e circula o terceiro item da lista." Isso exige gravar uma trilha de áudio adicional.
Opção B, alternativa de mídia: Um documento em texto cobrindo tudo o que existe no vídeo, com diálogo e conteúdo visual integrados. A pessoa que não consegue ver nem ouvir o vídeo deve conseguir ler este documento e obter as mesmas informações.
Para vídeos de pessoa falando para a câmera, aulas e apresentações em que o conteúdo visual é relativamente esparso, a Opção B costuma ser mais fácil de produzir. Comece com uma transcrição completa do áudio e adicione breves anotações visuais durante a revisão.
Para vídeos de demonstração, tutoriais de produto ou qualquer material em que a tela ou a ação carrega conteúdo significativo não descrito no diálogo, a audiodescrição tende a servir melhor os usuários.
Nota: se você escolher a Opção B (a alternativa de mídia) para o 1.2.3, ainda precisa satisfazer o 1.2.5 no nível AA, que exige audiodescrição especificamente.
SC 1.2.4: Legendas (Ao Vivo), Nível AA
Transmissões ao vivo, webinários e eventos virtuais com áudio precisam de legendas em tempo real.
Legendas pré-gravadas dão tempo para revisão humana. Legendas ao vivo, não. As principais opções:
CART (Communication Access Realtime Translation): Um estenógrafo profissional gera as legendas em tempo real. A precisão é alta. Serviços CART custam tipicamente a partir de cerca de US$ 60 por hora para inglês até US$ 120 a 200 por hora, dependendo do assunto, do provedor e da duração. O padrão-ouro para conteúdo ao vivo de alta importância.
Reconhecimento Automático de Fala (ASR): Serviços de ASR ao vivo de plataformas como Zoom, Google Meet, Microsoft Teams e outras. Rápido e barato, mas a precisão cai com vários falantes, sotaques, vocabulário técnico ou problemas de qualidade de áudio.
Híbrido: ASR com um revisor humano monitorando e corrigindo em tempo real. Equilibra custo e precisão para a maioria dos casos de uso.
Para conformidade no nível AA, o WCAG exige que as legendas sejam precisas e oportunas. A CART atende esse patamar com confiabilidade. O ASR isolado normalmente atende para conteúdo controlado, de falante único, com áudio limpo. Eventos complexos ou de alta importância justificam cobertura CART ou híbrida.
Para fins de transcrição de reuniões ao vivo, a maioria das equipes usa o ASR nativo da plataforma de conferência durante o evento e depois processa a gravação pós-evento em uma ferramenta de transcrição mais precisa para produzir a versão corrigida e arquivada.
SC 1.2.5: Audiodescrição (Pré-gravado), Nível AA
No nível AA, a audiodescrição para vídeo pré-gravado é obrigatória, não opcional.
Isso fecha a flexibilidade que o 1.2.3 oferece no nível A. Não é mais possível substituir por uma alternativa de mídia. Se você forneceu uma alternativa textual para o 1.2.3, o 1.2.5 acrescenta um novo requisito por cima.
O caminho prático que satisfaz ambos: forneça audiodescrição para cumprir o 1.2.5. Fazendo isso, você satisfaz automaticamente o 1.2.3 também, já que a audiodescrição é uma das duas opções aceitáveis nesse critério.
A combinação AA prática para conteúdo em vídeo: legendas (1.2.2) mais audiodescrição (1.2.5). Muitos fluxos de trabalho de conformidade tratam esses dois como o par do nível AA.
Um atalho útil para conteúdo em que as pausas do diálogo são suficientes: durante a produção, deixe intervalos deliberados na narração para que a audiodescrição possa ser inserida depois. Encaixar descrições em diálogos densos e contínuos do início ao fim é consideravelmente mais difícil do que projetar o conteúdo para elas desde o início.
Minha visão: para a maioria dos produtores de vídeos educacionais e corporativos, o maior desafio não é entender os critérios, mas construir o fluxo de trabalho. Tratar legendas e transcrições como parte do processo de produção, e não como correções de pós-produção, corta o custo pela metade.
SC 1.2.6: Linguagem de Sinais (Pré-gravado), Nível AAA
Para vídeo pré-gravado com áudio, forneça interpretação em linguagem de sinais.
Nível AAA, raramente exigido por regulamentação. A maior parte do conteúdo público não atende a isso, e metas de conformidade AA não o exigem. É mais relevante para conteúdo voltado especificamente a públicos surdos ou para comunicações críticas em serviços públicos e saúde.
SC 1.2.7: Audiodescrição Estendida (Pré-gravado), Nível AAA
Quando a audiodescrição padrão é insuficiente porque não há pausas naturais suficientes no diálogo, forneça audiodescrição estendida: o vídeo pausa para permitir a inserção de uma descrição mais longa e depois retoma.
Nível AAA. Raro na prática porque a maioria dos conteúdos tem pausas suficientes. Onde se aplica: conteúdo instrucional com narração densa e contínua e informação visual crítica.
SC 1.2.8: Alternativa de Mídia (Pré-gravado), Nível AAA
Um documento em texto completo cobrindo todo o conteúdo sonoro e visual de um vídeo sincronizado, para qualquer usuário que não consiga acessar nem o áudio nem a pista visual.
Isso vai além de legendas ou audiodescrição isoladas. O documento precisa de:
- Todo o diálogo com identificação dos falantes
- Todo o áudio relevante que não seja fala
- Todo o conteúdo visual significativo, incluindo texto exibido na tela, descrições de cenário e ações dos personagens
- Navegação estrutural (capítulos, mudanças de cena)
Uma transcrição bem preparada fornece a camada de diálogo. O trabalho de anotação visual é humano, mas partir de uma transcrição completa, com falantes rotulados, reduz substancialmente o tempo.
SC 1.2.9: Somente Áudio (Ao Vivo), Nível AAA
Alternativa textual em tempo real para conteúdo ao vivo somente em áudio: rádio ao vivo, audioconferências, transmissões somente de áudio.
Nível AAA, raramente atingido na prática. Alternativas textuais em tempo real para transmissões somente de áudio normalmente exigem ASR ao vivo ou um legendador ao vivo. Pouquíssimas transmissões ao vivo somente de áudio atendem a este critério.
Um Fluxo de Trabalho Prático de Conformidade AA
Para um site com podcasts e vídeos gravados mirando o WCAG AA:
Para episódios de podcast (SC 1.2.1)
- Transcreva o áudio usando uma ferramenta de áudio para texto.
- Revisão humana: corrija nomes, termos técnicos, verifique os rótulos de falantes.
- Publique a transcrição revisada em HTML na página do episódio ou próximo a ela.
Para vídeos gravados (SC 1.2.2 e 1.2.5)
- Transcreva para obter um arquivo de legendas cronometrado (SRT ou VTT).
- Revisão humana: precisão, rótulos de falantes, indicações de sons que não são fala.
- Envie as legendas ao seu host de vídeo.
- Grave ou contrate a audiodescrição cobrindo o conteúdo visual durante as pausas do diálogo.
- Publique a audiodescrição como uma trilha de áudio alternativa.
Para webinários ao vivo (SC 1.2.4)
- Durante o evento ao vivo: use CART ou legendas ASR ao vivo.
- Após o evento: processe a gravação em uma ferramenta de transcrição para a versão arquivada.
- Revise e corrija as legendas arquivadas antes de publicar junto com a gravação.
Falhas Comuns de Conformidade
Legendas automáticas publicadas sem revisão. Legendas geradas automaticamente erram nomes próprios, vocabulário técnico, rótulos de falantes e sons que não são fala. Revisão não é opcional.
Um resumo no lugar de uma transcrição. O SC 1.2.1 exige as mesmas informações do áudio, não um resumo editado. Publicar "show notes" no lugar de uma transcrição não satisfaz o critério.
Falta de descrição visual para conteúdo visual. Uma demonstração de produto que mostra a interface sem narrar o que é exibido precisa de audiodescrição ou de uma alternativa de mídia. Legendas sozinhas não cobrem informação exclusivamente visual.
Transcrição presa atrás de um download obrigatório. Um download em PDF satisfaz a letra do critério, mas cria atrito de acesso para usuários de leitores de tela. HTML na página ou HTML vinculado é o caminho mais limpo.
Falta de identificação de falantes em conteúdo com várias pessoas falando. Quando duas ou mais pessoas estão falando, tanto as legendas quanto as transcrições precisam identificar quem diz o quê.
Documentação para Auditorias de Conformidade
Ao documentar seu processo de acessibilidade:
- Nomeie o padrão-alvo (WCAG 2.2 nível AA, ou WCAG 2.1 AA se for isso o que sua jurisdição exige).
- Descreva seu processo de geração (transcrição por IA seguida de revisão humana).
- Indique qual SC cada artefato satisfaz e para qual conteúdo.
- Registre as exceções conhecidas e os prazos de correção.
- Referencie as ferramentas usadas na geração. A conformidade pertence ao seu processo, não a qualquer ferramenta única.
Para saber mais sobre os marcos legais que referenciam esses critérios, veja leis de acessibilidade por país e conformidade com a ADA para conteúdo de áudio. Na dimensão de experiência do usuário, transcrições para usuários de leitores de tela aborda como esses artefatos são realmente usados.
Perguntas Frequentes
Uma transcrição satisfaz todos os requisitos do WCAG 1.2?
Não. Uma transcrição satisfaz o SC 1.2.1 para conteúdo somente em áudio e pode satisfazer a opção de alternativa de mídia no SC 1.2.3, mas não satisfaz o SC 1.2.2 (as legendas devem ser sincronizadas), o SC 1.2.5 (exige audiodescrição real para vídeo) nem os critérios de conteúdo ao vivo.
Qual é a diferença entre o SC 1.2.3 e o SC 1.2.5?
O SC 1.2.3 é nível A e dá a você uma escolha: fornecer audiodescrição ou uma alternativa completa em texto para vídeo pré-gravado. O SC 1.2.5 é nível AA e elimina essa escolha, exigindo especificamente audiodescrição. Se você atender ao 1.2.5 com audiodescrição, automaticamente atende ao 1.2.3.
As legendas geradas automaticamente pelo YouTube satisfazem o SC 1.2.2?
Não sozinhas. O WCAG não define uma porcentagem específica de precisão, mas as orientações da FCC e do DOJ apontam 99% como meta, e a prática do setor trata 95% como piso mínimo. Legendas automáticas erram nomes próprios, termos técnicos, identificação dos falantes e sons que não são fala. É necessária revisão humana antes de tratá-las como conformes.
Quais regulamentações realmente exigem WCAG 2.2?
Até meados de 2026, a maioria das regulamentações ainda referencia WCAG 2.1 AA ou versões anteriores. A ADA Title II (governos estaduais e locais dos EUA) exige WCAG 2.1 AA. A Seção 508 (federal dos EUA) exige WCAG 2.0 AA. A EAA da UE e a atual EN 301 549 referenciam WCAG 2.1 AA. A adoção do WCAG 2.2 em regulamentações vinculantes está em andamento.
Fontes
- Diretrizes de Acessibilidade para Conteúdo Web (WCAG) 2.2, W3C
- Entendendo o WCAG 2.2, W3C WAI
- Entendendo o SC 1.2.1: Somente Áudio e Somente Vídeo (Pré-gravado), W3C WAI
- Entendendo o SC 1.2.5: Audiodescrição (Pré-gravado), W3C WAI
- Tornando Mídias de Áudio e Vídeo Acessíveis, W3C WAI
- Prorrogação dos Prazos de Conformidade de Acessibilidade Web da ADA Title II, Federal Register, abril de 2026
- Folha Informativa: Regra Web da ADA Title II, ADA.gov
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.