Cumplimiento de WCAG con transcripciones: SC 1.2 mapeado (2026)
WCAGaccesibilidadcumplimiento

Cumplimiento de WCAG con transcripciones: SC 1.2 mapeado (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

Esto no es asesoramiento legal. Los criterios de WCAG son estándares técnicos, no instrumentos legales. Si una regulación concreta exige conformidad, y en qué nivel, depende de tu jurisdicción, del tipo de tu organización y de la ley en cuestión. Consulta a un abogado para las determinaciones de cumplimiento.

Los criterios que implican transcripciones

Las transcripciones son el recurso de accesibilidad más versátil para contenido de audio, pero solo cubren parte del panorama de la Pauta 1.2 de WCAG. El SC 1.2.1 exige una transcripción para contenido solo de audio. El SC 1.2.3 permite usar una transcripción como alternativa mediática para vídeo en el Nivel A. Más allá de esos dos, las transcripciones apoyan el trabajo pero no sustituyen a los subtítulos ni a la audiodescripción.

WCAG 2.2 dejó la Pauta 1.2 completamente sin cambios respecto a 2.1. Los criterios siguientes se aplican por igual en ambas versiones. Los nuevos criterios de WCAG 2.2 abordan la navegación con teclado, los objetivos táctiles y la accesibilidad cognitiva, no los medios basados en el tiempo.

Cómo se organiza el SC 1.2

Los nueve criterios de éxito de la Pauta 1.2 se reparten en tres niveles de conformidad:

NivelCriterios de éxito
A (mínimo)1.2.1, 1.2.2, 1.2.3
AA (objetivo para la mayoría del contenido público)1.2.4, 1.2.5
AAA (aspiracional, normalmente no exigido)1.2.6, 1.2.7, 1.2.8, 1.2.9

La mayoría de las regulaciones apuntan al Nivel AA. La ADA Title II en EE. UU. exige WCAG 2.1 AA para gobiernos estatales y locales (plazos de cumplimiento ampliados a abril de 2027 y abril de 2028 según el tamaño de la población). La Sección 508 para agencias federales de EE. UU. exige WCAG 2.0 AA. El Acta Europea de Accesibilidad de la UE, aplicable desde junio de 2025 mediante EN 301 549, referencia actualmente WCAG 2.1 AA. Para una comparación más profunda de estos marcos por país, consulta leyes de accesibilidad por país.

SC 1.2.1: Solo audio y solo vídeo (pregrabado), Nivel A

Para contenido solo de audio, proporciona una transcripción textual. Para contenido solo de vídeo (sin sonido), proporciona una transcripción o una pista de audio que describa lo que se muestra.

Un episodio de podcast, una clase grabada sin vídeo o cualquier archivo de audio independiente queda bajo este criterio. La transcripción debe transmitir la misma información que el audio: el discurso, los sonidos no verbales relevantes y la identificación de los hablantes cuando hay varias personas.

Qué cuenta como suficiente: el W3C especifica "descripciones textuales correctamente secuenciadas de la información visual y auditiva basada en el tiempo". Un resumen no califica. Una transcripción que salta secciones u omite contenido clave no califica. Pequeñas variaciones de palabras y nombres propios mal escritos son generalmente aceptables cuando se conserva el significado.

La transcripción no tiene que estar incrustada en la misma página que el audio, pero debe poder alcanzarse fácilmente desde él. HTML en la página o HTML enlazado satisfacen ambos el criterio. Una transcripción en PDF puede satisfacer el requisito, pero crea cargas adicionales de accesibilidad; HTML es el camino más limpio.

Una excepción: si el contenido solo de audio es en sí mismo una alternativa mediática para contenido textual ya presente en la página, y está claramente etiquetado como tal, el SC 1.2.1 no aplica.

Herramienta de carga de audio de ConvertAudioToText para generar transcripciones
Herramienta de carga de audio de ConvertAudioToText para generar transcripciones

Si solo necesitas una transcripción limpia para un podcast o audio grabado, la herramienta de audio a texto de ConvertAudioToText produce una transcripción textual que puedes descargar, revisar y publicar junto a tu reproductor de audio.

SC 1.2.2: Subtítulos (pregrabados), Nivel A

Todo vídeo pregrabado con audio en un sitio web de acceso público necesita subtítulos sincronizados.

"Sincronizados" es la palabra clave. Los subtítulos deben aparecer durante el discurso que representan, no antes ni después en bloque. También deben incluir el audio no verbal relevante: "[la puerta se cierra]", "[música animada]", etiquetas de los hablantes para contenido con varias personas.

WCAG no establece un porcentaje específico de precisión. Las guías de la FCC y del DOJ señalan el 99 % como objetivo para contenido de difusión y público. Los profesionales de accesibilidad suelen considerar el 95 % como el suelo práctico. Los subtítulos autogenerados de plataformas de vídeo suelen quedarse cortos en nombres propios, términos técnicos, hablantes superpuestos y audio no verbal.

El flujo de trabajo para subtítulos conformes:

  1. Sube el vídeo directamente a una herramienta de transcripción o extrae el audio para una conversión de vídeo a texto.
  2. Genera un archivo de subtítulos temporizado SRT o VTT.
  3. Realiza la revisión humana: corrige nombres, términos técnicos, añade pistas de audio no verbal, verifica la sincronización.
  4. Sube el archivo revisado a tu plataforma de vídeo como pista de subtítulos manual.

Los subtítulos automáticos de tu plataforma de vídeo son un punto de partida, no un punto final.

SC 1.2.3: Audiodescripción o alternativa mediática (pregrabado), Nivel A

Para vídeo sincronizado pregrabado (vídeo con audio), proporciona audiodescripción o una alternativa mediática textual completa. Tú eliges cuál.

Este es el criterio que más a menudo se malinterpreta. El "o" es real y determinante en el Nivel A.

Opción A, audiodescripción: Un narrador aparte describe el contenido visual durante las pausas naturales del diálogo. "Ella camina hacia la pizarra y rodea el tercer elemento de la lista." Esto requiere grabar una pista de audio adicional.

Opción B, alternativa mediática: Un documento de texto que cubre todo lo del vídeo, con diálogo y contenido visual integrados. La persona que no puede ver ni oír el vídeo debería poder leer este documento y obtener la misma información.

Para vídeos con una persona hablando a cámara, clases y presentaciones donde el contenido visual es relativamente escaso, la Opción B suele ser más fácil de producir. Empieza con una transcripción completa del audio y luego añade breves anotaciones visuales durante la revisión.

Para vídeos de demostración, recorridos de producto o cualquier cosa donde la pantalla o la acción contengan contenido significativo no descrito en el diálogo, la audiodescripción suele servir mejor a los usuarios.

Nota: si eliges la Opción B (la alternativa mediática) para el 1.2.3, aún debes satisfacer el 1.2.5 en Nivel AA, que exige audiodescripción específicamente.

SC 1.2.4: Subtítulos (en directo), Nivel AA

Las emisiones en directo, los seminarios web y los eventos virtuales con audio necesitan subtítulos en tiempo real.

Los subtítulos pregrabados te dan tiempo para la revisión humana. Los subtítulos en directo no. Las opciones principales:

CART (Traducción de Acceso a la Comunicación en Tiempo Real): Un estenógrafo profesional subtitula en tiempo real. La precisión es alta. Los servicios CART suelen costar desde unos 60 dólares por hora para inglés hasta 120–200 dólares por hora, según la materia, el proveedor y la duración. El estándar de oro para contenido en directo de alto riesgo.

Reconocimiento automático del habla (ASR): Servicios de ASR en directo de plataformas como Zoom, Google Meet, Microsoft Teams y otras. Rápidos y de bajo costo, pero la precisión disminuye con varios hablantes, acentos, vocabulario técnico o problemas de calidad de audio.

Híbrido: ASR con un revisor humano que supervisa y hace correcciones en tiempo real. Equilibra costo y precisión en la mayoría de los casos de uso.

Para cumplir el Nivel AA, WCAG exige que los subtítulos sean precisos y oportunos. CART cumple este umbral de manera fiable. ASR por sí solo suele cumplirlo en contenido controlado, de un solo hablante y con audio claro. Los eventos complejos o de alto riesgo justifican cobertura CART o híbrida.

Para fines de transcripción de reuniones en directo, la mayoría de los equipos usa el ASR integrado de su plataforma de videoconferencia durante el evento y después procesa la grabación posterior con una herramienta de transcripción más precisa para producir la versión corregida y archivada.

SC 1.2.5: Audiodescripción (pregrabada), Nivel AA

En el Nivel AA, la audiodescripción para vídeo pregrabado es obligatoria, no opcional.

Esto cierra la flexibilidad que el 1.2.3 otorga en el Nivel A. Ya no puedes sustituirla por una alternativa mediática. Si proporcionaste una alternativa textual para el 1.2.3, el 1.2.5 añade un requisito nuevo además.

El camino práctico que satisface ambos: proporcionar audiodescripción para cumplir el 1.2.5. Al hacerlo también cumples automáticamente el 1.2.3, ya que la audiodescripción es una de las dos opciones aceptables ahí.

La combinación AA práctica para contenido de vídeo: subtítulos (1.2.2) más audiodescripción (1.2.5). Muchos flujos de trabajo de cumplimiento tratan estos como el par del Nivel AA.

Un atajo útil para contenidos donde las pausas del diálogo bastan: durante la producción, deja huecos deliberados en la narración para poder añadir después el audio de descripción. Insertar descripciones a posteriori en un diálogo denso y continuo es considerablemente más difícil que diseñarlo así desde el inicio.

Mi opinión: para la mayoría de los productores de vídeo educativo y corporativo, el mayor reto no es comprender los criterios sino construir el flujo de trabajo. Tratar los subtítulos y las transcripciones como parte del proceso de producción, en lugar de como arreglo de posproducción, reduce el costo a la mitad.

SC 1.2.6: Lengua de signos (pregrabada), Nivel AAA

Para vídeo pregrabado con audio, proporciona interpretación en lengua de signos.

Nivel AAA, rara vez exigido por la normativa. La mayoría del contenido público no cumple esto, y los objetivos de conformidad AA no lo requieren. Es más relevante para contenido dirigido específicamente a audiencias sordas o para comunicaciones de alto riesgo en servicios públicos y salud.

SC 1.2.7: Audiodescripción ampliada (pregrabada), Nivel AAA

Cuando la audiodescripción estándar resulta insuficiente porque no hay suficientes pausas naturales en el diálogo, proporciona audiodescripción ampliada: el vídeo se pausa para permitir insertar una descripción más larga y luego se reanuda.

Nivel AAA. Poco frecuente en la práctica porque la mayoría del contenido tiene pausas suficientes. Dónde aplica: contenido instructivo con narración continua y densa e información visual crítica.

SC 1.2.8: Alternativa mediática (pregrabada), Nivel AAA

Un documento de texto completo que cubre todo el contenido de audio y visual de un vídeo sincronizado, para cualquier usuario que no pueda acceder ni a la pista de audio ni a la visual.

Esto va más allá de los subtítulos o la audiodescripción por separado. El documento necesita:

  • Todo el diálogo con identificación de los hablantes
  • Todo el audio no verbal relevante
  • Todo el contenido visual significativo, incluido el texto en pantalla, las descripciones del escenario y las acciones de los personajes
  • Navegación estructural (capítulos, cambios de escena)

Una transcripción bien preparada aporta la capa de diálogo. El trabajo de anotación visual es humano, pero partir de una transcripción completa con los hablantes etiquetados reduce el tiempo sustancialmente.

SC 1.2.9: Solo audio (en directo), Nivel AAA

Alternativa textual en tiempo real para contenido en directo solo de audio: radio en directo, conferencias de audio, emisiones solo de audio.

Nivel AAA, rara vez alcanzado en la práctica. Las alternativas textuales en tiempo real para transmisiones solo de audio suelen requerir ASR en directo o un subtitulador en directo. Muy pocas emisiones en directo solo de audio cumplen este criterio.

Un flujo de trabajo práctico de cumplimiento AA

Para un sitio web con podcasts y vídeo grabado orientado a WCAG AA:

Para episodios de podcast (SC 1.2.1)

  1. Transcribe el audio usando una herramienta de audio a texto.
  2. Revisión humana: corrige nombres, términos técnicos y verifica las etiquetas de los hablantes.
  3. Publica la transcripción revisada como HTML en la página del episodio o cerca de ella.

Para vídeos grabados (SC 1.2.2 y 1.2.5)

  1. Transcribe para obtener un archivo de subtítulos temporizado (SRT o VTT).
  2. Revisión humana: precisión, etiquetas de los hablantes, pistas de audio no verbal.
  3. Sube los subtítulos a tu plataforma de vídeo.
  4. Graba o encarga una audiodescripción que cubra el contenido visual durante las pausas del diálogo.
  5. Publica la audiodescripción como pista de audio alternativa.

Para seminarios web en directo (SC 1.2.4)

  1. Durante el evento en directo: usa CART o subtítulos ASR en directo.
  2. Después del evento: procesa la grabación con una herramienta de transcripción para la versión archivada.
  3. Revisa y corrige los subtítulos archivados antes de publicarlos junto con la grabación.

Fallos comunes de cumplimiento

Subtítulos automáticos publicados sin revisión. Los subtítulos autogenerados omiten nombres propios, vocabulario técnico, etiquetas de los hablantes y sonidos no verbales. La revisión no es opcional.

Un resumen en lugar de una transcripción. El SC 1.2.1 exige la misma información que contiene el audio, no un resumen editado. Publicar "notas del episodio" en lugar de una transcripción no satisface el criterio.

Sin descripción visual para el contenido visual. Una demostración de producto que muestra la interfaz sin narrar lo que se ve necesita audiodescripción o una alternativa mediática. Los subtítulos por sí solos no cubren la información exclusivamente visual.

Transcripción detrás de una barrera de descarga. Una descarga en PDF satisface la letra del criterio, pero crea fricción de acceso para los usuarios de lectores de pantalla. HTML en la página o HTML enlazado es el camino más limpio.

Sin identificación de los hablantes en contenido con varias personas. Cuando hablan dos o más personas, tanto los subtítulos como las transcripciones deben identificar quién dice qué.

Documentación para auditorías de cumplimiento

Al documentar tu proceso de accesibilidad:

  • Indica el estándar objetivo (WCAG 2.2 Nivel AA, o WCAG 2.1 AA si es lo que exige tu jurisdicción).
  • Describe tu proceso de generación (transcripción con IA seguida de revisión humana).
  • Declara qué SC satisface cada recurso y para qué contenido.
  • Anota las excepciones conocidas y los plazos de corrección.
  • Referencia las herramientas utilizadas para la generación. El cumplimiento pertenece a tu proceso, no a ninguna herramienta en particular.

Para saber más sobre los marcos legales que referencian estos criterios, consulta leyes de accesibilidad por país y cumplimiento de la ADA para contenido de audio. En cuanto a la dimensión de experiencia de usuario, transcripciones para usuarios de lectores de pantalla explica cómo se usan realmente estos recursos.

Preguntas frecuentes

¿Una transcripción satisface todos los requisitos de WCAG 1.2?

No. Una transcripción satisface el SC 1.2.1 para contenido solo de audio y puede satisfacer la opción de alternativa mediática del SC 1.2.3, pero no satisface el SC 1.2.2 (los subtítulos deben estar sincronizados), el SC 1.2.5 (exige audiodescripción real para vídeo) ni los criterios de contenido en directo.

¿Cuál es la diferencia entre el SC 1.2.3 y el SC 1.2.5?

El SC 1.2.3 es Nivel A y te da una elección: proporcionar audiodescripción o una alternativa textual completa para vídeo pregrabado. El SC 1.2.5 es Nivel AA y elimina esa elección, exigiendo audiodescripción específicamente. Si cumples el 1.2.5 con audiodescripción, satisfaces automáticamente el 1.2.3.

¿Los subtítulos autogenerados de YouTube satisfacen el SC 1.2.2?

No por sí solos. WCAG no establece un porcentaje específico de precisión, pero las guías de la FCC y del DOJ apuntan al 99 % como objetivo, y la práctica del sector considera el 95 % como un suelo mínimo. Los subtítulos autogenerados omiten nombres, términos técnicos, identificación de los hablantes y sonidos no verbales. Se requiere revisión humana antes de tratarlos como conformes.

¿Qué regulaciones exigen realmente WCAG 2.2?

A mediados de 2026, la mayoría de las regulaciones todavía referencia WCAG 2.1 AA o versiones anteriores. La ADA Title II (gobiernos estatales y locales de EE. UU.) exige WCAG 2.1 AA. La Sección 508 (federal de EE. UU.) exige WCAG 2.0 AA. La EAA de la UE y la actual EN 301 549 referencian WCAG 2.1 AA. La adopción de WCAG 2.2 en regulaciones vinculantes está en curso.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles