Transcrição para usuários surdos e com deficiência auditiva
acessibilidadesurdosdeficiência auditivatranscrição

Transcrição para usuários surdos e com deficiência auditiva

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Para usuários surdos e com deficiência auditiva, uma boa transcrição significa 99% de precisão, rótulos claros de falante a cada mudança, sons não verbais entre colchetes e timing de legenda legível. A transcrição por IA chega a 90-97% de precisão em condições ideais, mas consistentemente fica aquém em situações reais, especialmente em transmissões ao vivo. O fluxo prático é primeiro rascunho com IA, depois revisão humana para precisão, identificação de falantes e sons não verbais. Padrões de conformidade como WCAG 2.1 AA descrevem bem esse nível, mas o motivo real para atingi-lo é que reflete o que de fato torna o conteúdo utilizável.

Para usuários surdos e com deficiência auditiva (DA), a qualidade de uma transcrição ou arquivo de legendas não é uma preferência estética. Ela determina se o conteúdo é utilizável ou não. O padrão prático é 99% de precisão em nível de palavra, identificação clara do falante a cada mudança e sons não verbais entre colchetes. A maioria das transcrições por IA não atinge esse nível sem revisão humana. Este post explica o que usuários com DA realmente precisam, onde a IA ajuda e o que ainda exige atenção humana.

(Orientação prática, não aconselhamento jurídico.)

A Diversidade por Trás de "DA"

"Surdo e com deficiência auditiva" cobre uma ampla gama de experiências, e o que ajuda cada pessoa varia.

Usuários surdos culturalmente, especialmente aqueles para quem a Língua de Sinais Americana (ASL) ou a Língua de Sinais Britânica (BSL) é a primeira língua, podem ler inglês como segunda língua. Transcrições longas e densas podem ser mais difíceis de acompanhar do que ASL falada. Para esse público, linguagem simples importa tanto quanto precisão: frases mais curtas, vocabulário comum e quebras de parágrafo claras. A interpretação em língua de sinais costuma ser mais acessível do que legendas para conteúdo extenso.

Usuários com deficiência auditiva geralmente leem com fluência nativa, mas perdem o acesso ao áudio em ambientes ruidosos, em gravações de baixa qualidade ou quando os falantes têm sotaques fortes ou fala sobreposta. Legendas e transcrições dão a eles o mesmo acesso ao conteúdo que um áudio claro proporciona a outros.

Adultos que perderam a audição tardiamente costumam preferir legendas à língua de sinais, pois têm forte alfabetização em inglês, mas nenhuma fluência em língua sinalizada.

Nota de terminologia da comunidade existente: "Surdo" com S maiúsculo se refere à identidade cultural; "surdo" com s minúsculo se refere à condição audiológica. "Deficiente auditivo" é geralmente considerado negativo pela comunidade surda e é melhor evitar.

O Que a Transcrição por IA Realmente Entrega

Antes de entrar no que usuários com DA precisam, vale ser honesto sobre o que a transcrição por IA oferece, porque o marketing nem sempre corresponde à experiência real.

As taxas de precisão divulgadas pelos fornecedores de IA para transcrição geralmente variam de 90 a 97% em boas condições. Pesquisas revisadas por pares contam uma história mais complicada. Um estudo de 2024 que mediu 11 serviços de ASR usando gravações reais de aulas universitárias encontrou grande variação de desempenho entre fornecedores e amostras de áudio individuais, com ASR em streaming, a tecnologia usada para legendas ao vivo, apresentando desempenho significativamente pior do que a transcrição de pós-produção. Os pesquisadores concluíram que "serviços comuns não têm confiabilidade na precisão" e documentaram uma clara discrepância entre as alegações publicadas pela indústria e a experiência que os usuários de DHH realmente relatam.

Isso não é um argumento contra o uso de transcrição por IA. É um argumento para entender seu papel: a IA processa a maior parte das palavras em velocidade, humanos fecham a lacuna de precisão e acrescentam o que a IA não consegue.

Para uma palestra de 90 minutos, uma passada de IA leva cerca de dois a três minutos. Transcrição manual do zero leva de seis a nove horas. Um humano revisando um rascunho de IA normalmente termina em duas a três horas. A passada de IA ainda é o lugar certo para começar.

As Quatro Coisas Que Usuários de DHH Realmente Precisam

O Piso de Precisão Que Realmente Atende Usuários de DHH

Com 97% de precisão em 1.500 palavras, cerca de 45 palavras estão erradas. Com 95%, são 75 erros. Para conteúdo geral, um leitor muitas vezes consegue inferir o significado correto pelo contexto. Para palestras técnicas, conteúdo médico, procedimentos legais ou diálogos acelerados, 5% de erros quebram a compreensão.

O DCMP e a FCC ambos definem 99% de precisão em nível de palavra como o padrão publicado para legendas de pós-produção, com 98,5% para tempo real. Essa lacuna entre o padrão e a saída típica da IA é o motivo pelo qual a revisão humana existe.

Para um olhar mais aprofundado sobre medição de precisão e o que a taxa de erro de palavras realmente significa, veja explicação sobre precisão de transcrição.

Identificação de Falantes em Cada Mudança

As convenções de legendas exigem um rótulo de falante toda vez que o falante muda, não apenas na primeira vez que cada um aparece. Formatos comuns: "SARAH:" no início da linha, ou "[Sarah]" como marcador inline. A diarização por IA lida razoavelmente bem com entrevistas de dois falantes em áudio limpo. Ela falha com três ou mais falantes, sobreposição de fala, vozes parecidas e áudio gravado com um único microfone de campo distante.

A falta de rótulos de falante em uma conversa com três pessoas torna a transcrição quase inutilizável. O leitor não consegue acompanhar quem está discordando de quem, que é exatamente o ponto de muitas gravações com bastante diálogo.

Para uma explicação completa de como a diarização de falantes funciona e onde ela quebra, veja diarização de falantes explicada.

Os Sons Não Verbais Que Precisam Ser Legendados

As legendas partem do princípio de que o espectador não consegue ouvir. Isso significa que todo áudio relevante precisa de um equivalente em texto, não apenas a fala.

As diretrizes de qualidade de legendagem da DCMP exigem uma representação textual completa do áudio, incluindo informações não verbais. Na prática:

  • Sons ambientais que afetam a compreensão: "[porta batendo]", "[alarme tocando]", "[multidão vibrando]"
  • Música com letra: A letra em si quando é central para a cena, não "[música tocando]"
  • Música instrumental: "[música de cordas tensa]" ou "[piano animado]" quando o clima é relevante para a narrativa
  • Tom e maneira de falar: "[tom sarcástico]" ou "[sussurrado]" quando ler as palavras sem o contexto do tom muda o significado

A transcrição por IA quase nunca gera anotações de sons não verbais. Essa é uma das lacunas mais claras entre a saída da IA e legendas com padrão de acessibilidade. Cada som não verbal em um arquivo precisa de adição manual durante a revisão.

Ferramenta geradora de legendas ConvertAudioToText mostrando exportação de legendas
Ferramenta geradora de legendas ConvertAudioToText mostrando exportação de legendas

Tempo de Exibição e Quebras de Linha Legíveis

Legendas que aparecem antes ou depois da fala que descrevem são desorientadoras. O tempo da legenda deve posicionar o texto durante a fala, desaparecendo em cerca de um segundo após o orador parar.

A velocidade de leitura importa: o DCMP define 150 a 160 palavras por minuto para conteúdo adulto, com um teto rígido de 225 ppm no máximo absoluto. A FCC recomenda que as legendas não passem mais rápido do que os espectadores conseguem ler. Quando o áudio ultrapassa 160 ppm (oradores rápidos, conversas sobrepostas, linguagem jurídica ou médica densa), as legendas precisam ser editadas, em vez de exibidas na íntegra a uma velocidade que ninguém acompanha.

Comprimento da linha: no máximo 32 caracteres por linha, com até duas linhas na tela ao mesmo tempo. Quebre em fronteiras naturais de cláusula, nunca no meio de uma frase.

Perguntas Adicionais que Usuários e Produtores de DHH Fazem

Onde a Saída de IA Precisa de Edição Humana

Para transformar uma transcrição de IA em um arquivo de legenda com qualidade de acessibilidade:

  1. Gere a transcrição usando uma ferramenta como áudio para texto. Exporte como TXT ou VTT.
  2. Abra em um editor de legendas (Subtitle Edit, Aegisub ou uma ferramenta de legendagem baseada em navegador).
  3. Ouça o áudio enquanto lê. Corrija palavras mal compreendidas. Preste atenção especial a nomes próprios, termos técnicos e nomes.
  4. Adicione rótulos de orador a cada mudança de falante.
  5. Adicione sons não falados entre colchetes quando eles carregam significado.
  6. Verifique o comprimento da linha e quebre nas fronteiras de cláusula.
  7. Confirme a velocidade de leitura. Se um bloco de legenda for longo demais para sua janela de tempo, corte ou divida.
  8. Exporte o VTT ou SRT final.

Para uma hora de áudio ou vídeo, a passagem de edição humana normalmente leva de duas a três horas. Isso é muito mais rápido do que começar do zero (seis a nove horas para legendagem manual), e o rascunho de IA lida com o volume de palavras faladas de forma confiável. A passagem humana cuida de tudo que a IA deixa passar.

Se você só precisa de uma transcrição limpa, sem montar um arquivo de legenda, o ConvertAudioToText gera o rascunho com IA e exporta arquivos SRT e VTT que você pode levar para um editor de legendas.

Para ver como fica o lado da geração de legendas nesse fluxo, a ferramenta de gerador de legendas exporta tanto SRT quanto VTT.

Além dos Arquivos de Legenda Individuais

Para eventos ao vivo e situações em tempo real, o CART (Communication Access Realtime Translation) é o padrão profissional. Um provedor de CART treinado usa uma máquina de estenotipia para produzir legendas palavra por palavra em tempo real. O CART atinge cerca de 98,5% de precisão, que é o padrão de tempo real citado pela FCC. A legenda automática por IA para eventos ao vivo melhorou, mas continua menos confiável, principalmente em salas barulhentas, com sotaques ou com vários falantes se sobrepondo.

Para situações de alto risco (procedimentos jurídicos, consultas médicas, processos governamentais), legendas por IA não substituem o CART nem um intérprete de língua de sinais qualificado.

Versões em linguagem simples do conteúdo ajudam usuários surdos ou com deficiência auditiva para quem o inglês é segunda língua. Transcrições resumidas, com vocabulário comum e frases mais curtas, muitas vezes atendem esse público melhor do que legendas verbatim. Muitos produtores de conteúdo oferecem as duas opções.

O Que as Normas Codificam

Os requisitos de conformidade (WCAG 2.1 AA, ADA, Seção 508, Lei Europeia de Acessibilidade) valem a pena ser entendidos, mas as normas codificam o que os usuários surdos ou com deficiência auditiva precisam, em vez de inventar limites arbitrários. A meta de 99% de precisão existe porque pesquisas sobre compreensão de leitura desse público mostram que taxas de erro acima de 1% prejudicam de forma mensurável o entendimento de conteúdo com vocabulário técnico. Os requisitos de não fala existem porque conteúdo narrativo sem pistas sonoras fica incompleto para espectadores que não conseguem ouvir.

A Lei Europeia de Acessibilidade entrou em vigor em 28 de junho de 2025, ampliando os requisitos de legendas para serviços do setor privado nos estados-membros da UE em conteúdo novo. Conteúdo legado tem um período de transição até 2030. Isso é uma expansão significativa além do escopo anterior, que cobria apenas o setor público.

Para um passo a passo completo dos critérios da WCAG 2.1 e o que eles exigem, veja conformidade com WCAG por meio de transcrições. Para saber como a ADA se aplica a tipos específicos de entidades, veja conformidade com ADA para conteúdo de áudio. Para o panorama internacional mais amplo, veja leis de acessibilidade por país.

Minha opinião: a falha de acessibilidade mais comum não é ignorância jurídica. É a suposição de que legendas geradas automaticamente são "boas o bastante" porque capturam a maioria das palavras. Para usuários surdos ou com deficiência auditiva que dependem do texto como acesso principal ao conteúdo de áudio, a maioria das palavras não é o padrão. Todo o significado é o padrão. A revisão humana não é opcional. É o ponto central.

FAQ

Qual nível de precisão as legendas precisam atingir para realmente atender usuários surdos e com deficiência auditiva?

O DCMP e a FCC definem 99% de precisão em nível de palavra como o padrão para legendas de pós-produção, com 98,5% para tempo real. Com 95% de precisão, uma palestra de 1.500 palavras contém cerca de 75 erros, o que é suficiente para quebrar a compreensão de conteúdo técnico. A transcrição por IA normalmente chega a 90-97% em boas condições, mas pesquisas publicadas mostram que o desempenho no mundo real, especialmente para legendas ao vivo, fica bem abaixo dos números divulgados pelos fornecedores. A revisão humana após um rascunho de IA é o caminho confiável para chegar a 99%.

Quais sons que não são fala precisam ser incluídos nas legendas?

Qualquer áudio que carregue significado para a compreensão do conteúdo: sons de fundo que afetam a narrativa ("[porta batendo]", "[telefone tocando]"), música com letra, música instrumental quando é emocional ou narrativamente significativa ("[música de violino tensa]") e identificação do falante a cada troca de voz. Ferramentas de IA quase nunca captam sons que não são fala. Eles precisam ser adicionados manualmente durante a revisão humana.

Qual é a diferença entre legendas e subtítulos para fins de acessibilidade?

Legendas são escritas para espectadores que não conseguem ouvir e incluem todo áudio significativo: diálogo, identificação do falante, efeitos sonoros relevantes e indicações de música. Subtítulos são traduções do diálogo para espectadores que ouvem, mas não entendem o idioma, então omitem sons que não são fala. Para acessibilidade, legendas são o que você precisa. Legendas ocultas podem ser ativadas e desativadas. Legendas abertas são gravadas permanentemente no vídeo.

Usuários surdos preferem legendas ou interpretação em língua de sinais?

As preferências variam por pessoa e contexto. Muitos usuários surdos culturalmente, especialmente aqueles para quem ASL ou BSL é a primeira língua, acham a língua de sinais mais natural e menos cansativa do que ler legendas em conteúdos longos. Em situações de alto risco, como procedimentos legais ou consultas médicas, intérpretes de língua de sinais oferecem melhor acesso para quem é fluente em sinais. Legendas atendem a um público mais amplo, incluindo adultos que ficaram surdos tardiamente e usuários com deficiência auditiva que se sentem mais confortáveis com texto. Quando possível, oferecer ambos é a opção mais inclusiva.

Uma transcrição gerada por IA é suficiente para o requisito de legenda WCAG 2.1 AA?

Não sozinho. A WCAG 2.1 SC 1.2.2 (Nível A) exige legendas sincronizadas para vídeo pré-gravado, e a SC 1.2.4 (Nível AA) exige legendas em tempo real para vídeo ao vivo. As diretrizes especificam que as legendas devem ser equivalentes ao áudio, incluindo informações não faladas. Uma transcrição bruta de IA convertida para VTT pode atender ao requisito técnico de formato, mas normalmente perde identificação de falantes, sons não falados e precisão de sincronização. A revisão humana fecha essa lacuna. Para um detalhamento completo das obrigações de conformidade por tipo de entidade, veja nosso post sobre conformidade com WCAG usando transcrições.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles