Transcripciones para usuarios de lectores de pantalla: el formato que funciona
lectores de pantallaaccesibilidadtranscripciones

Transcripciones para usuarios de lectores de pantalla: el formato que funciona

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

Cómo leen los lectores de pantalla las transcripciones

Una transcripción es tan accesible como su estructura semántica. Los lectores de pantalla no muestran las páginas visualmente; analizan el HTML subyacente y lo presentan como salida de audio o braille. Un usuario ciego que navega una transcripción de 5000 palabras puede saltar por encabezados, avanzar párrafo a párrafo, buscar texto o leer de forma secuencial. Cuál de esos modos resulte rápido depende por completo de cómo se haya formateado la transcripción.

Los subtítulos y las transcripciones son herramientas distintas para usuarios distintos. Según WCAG 1.2.2 (nivel A), los subtítulos son obligatorios para el video sincronizado, porque aparecen en pantalla sincronizados con el audio. Según WCAG 1.2.1 (nivel A), se requiere una transcripción para el contenido de solo audio prerregistrado, porque los usuarios ciegos no pueden ver el reproductor de video y no pueden beneficiarse de los subtítulos temporizados. Para más detalles sobre dónde caen esos límites, consulta transcripción frente a subtitulado y subtítulos.

La conclusión práctica: si publicas un episodio de pódcast, una clase grabada o una entrevista, tu transcripción es la vía de acceso principal para los oyentes ciegos y con baja visión. Su estructura es la interfaz.

Qué pueden hacer los usuarios de lectores de pantalla con una transcripción

Un usuario de lector de pantalla dispone de varios modos de navegación:

  • Salto por encabezados: Desplegar una lista de todos los encabezados y saltar directamente a cualquier sección (rápido, el modo preferido para contenidos largos)
  • Salto de párrafo: Avanzar al siguiente párrafo a velocidad media
  • Salto de frase: Avanzar una frase cada vez para una lectura precisa
  • Búsqueda de texto: Saltar directamente a una palabra clave o frase
  • Lectura secuencial: Escuchar de arriba abajo (lento, se usa cuando falta estructura)

En una transcripción de una entrevista de 90 minutos, la navegación por encabezados marca la diferencia entre encontrar una sección en segundos y pasarse minutos escuchando todo el contenido. La presentación visual puede ser cualquier cosa. Lo que importa es la estructura semántica de debajo.

Patrones de formato que funcionan

Usa una jerarquía de encabezados real

Los encabezados dan a los usuarios de lectores de pantalla un mapa del documento. Para una transcripción de pódcast o de entrevista:

  • H1: Título del episodio o de la entrevista (en la página, no en el cuerpo de la transcripción)
  • H2: Secciones principales (introducción, tema central, preguntas y respuestas, cierre)
  • H3: Subsecciones dentro de las secciones principales, si el contenido lo amerita

Para una reunión o una clase:

  • H2: Puntos de la agenda o secciones de la clase en orden
  • H3: Cambios de tema dentro de una sección, si son sustanciales

Un encabezado etiquetado con el tema («Discusión sobre el modelo de precios») permite al usuario decidir si lee esa sección. Un encabezado etiquetado solo con una marca de tiempo («00:15:30») no da contexto alguno hasta que el usuario ya ha saltado allí.

Etiquetas de hablante en texto en cada cambio

Para contenido con varios hablantes, cada cambio de hablante necesita una etiqueta de texto visible. El patrón que funciona:

**Sarah:** I think we should focus on the second option.

**David:** Agreed, the timeline works better.

**Sarah:** And it costs less in the long run.

El estilo en negrita ayuda a los lectores visuales a escanear rápidamente. El nombre del hablante seguido de dos puntos da al usuario del lector de pantalla la atribución antes del contenido: «Sarah, creo que deberíamos centrarnos...». Las señales visuales como la sangría o el color no se trasladan al audio. Las etiquetas de texto sí.

Saltos de párrafo en los puntos naturales

Un muro de texto es difícil para todos, pero para un usuario de lector de pantalla que avanza párrafo a párrafo, un bloque de 600 palabras sin cortes significa escuchar todo el bloque para encontrar una sola frase. Corta los párrafos:

  • En los cambios de tema dentro del contenido de un hablante
  • Cada 100-150 palabras en monólogos largos
  • En pausas naturales del habla de tres segundos o más

Cada párrafo debe ser una unidad coherente por sí mismo.

Marcas de tiempo para la navegación

Para transcripciones de más de unos 20 minutos, las marcas de tiempo periódicas ayudan a los usuarios a encontrar momentos concretos. Formátalas en línea, antes del texto de ese punto:

**[00:15:30]** And then we got to the question of pricing...

La marca de tiempo entre corchetes es anunciada por el lector de pantalla y aporta un punto de referencia sin romper el flujo de lectura. En una transcripción de 90 minutos, una marca cada cinco o diez minutos es apropiada.

Sonidos no verbales entre corchetes

Los sonidos que afectan a la comprensión pertenecen a la transcripción:

  • [Risas del público]
  • [La música de fondo se desvanece]
  • [La puerta se cierra de golpe]

Estos elementos son aún más críticos en los subtítulos, donde deben temporizarse con el video. En una transcripción independiente añaden contexto para usuarios que nunca han escuchado el audio.

Desarrolla las siglas en el primer uso

Los lectores de pantalla suelen leer las siglas poco familiares letra por letra. «GDPR», en un lector de pantalla bien configurado, puede salir como «G-D-P-R». «Comisión de Igualdad de Oportunidades en el Empleo (EEOC)» en el primer uso, y luego «EEOC», da al usuario la forma completa antes de que aparezca la abreviatura. Siglas comunes como NASA o FBI suelen manejarse correctamente; las específicas de un dominio son el riesgo.

Solo puntuación estándar

Los lectores de pantalla modernos manejan correctamente los puntos, las comas y los signos de interrogación. Lo que causa problemas:

  • El uso excesivo de puntos suspensivos, que crea pausas incómodas
  • EL TEXTO EN MAYÚSCULAS SOSTENIDAS, que algunos lectores de pantalla leen letra por letra
  • Caracteres Unicode decorativos que pueden no pronunciarse de forma consistente
  • Las comillas tipográficas en algunas configuraciones de lectura antiguas

Mantén la puntuación estándar y funcional.

Patrones que fallan

Muros de texto sin hablantes identificados son funcionalmente inaccesibles. Un bloque de 3000 palabras sin etiquetas de hablante ni cortes de párrafo obliga a una lectura secuencial sin opciones de navegación.

Encabezados como única estructura es mejor que nada, pero si cada H2 cubre 800 palabras sin saltos internos de párrafo, el usuario puede saltar a una sección pero luego tiene que escucharla entera.

Distribuir solo en PDF es una trampa frecuente. Exportar a PDF desde Word o desde una página web suele eliminar la estructura de etiquetas semánticas, incluso cuando el diseño visual parece correcto. La navegación por encabezados desaparece. Para la accesibilidad con lectores de pantalla, el HTML en una página web es el formato más fiable.

Comentarios editoriales intercalados confunden el flujo de lectura secuencial. Si necesitas añadir contexto («[editorial: esta sección se recortó por tiempo]»), ponlo en una nota lateral claramente etiquetada o al pie, no intercalado con el texto del hablante.

Encabezados con solo marcas de tiempo («00:15:30») no aportan valor de navegación. Combina la marca de tiempo con el tema.

Contenido en varios idiomas sin marcado de idioma es un fallo concreto ante el que los lectores de pantalla no pueden hacer nada. Si una transcripción incluye pasajes en español dentro de un documento en inglés, el lector de pantalla necesita un atributo lang para cambiar las reglas de pronunciación. WCAG 3.1.2 (nivel AA) exige identificar el idioma de cada pasaje o frase en un idioma distinto al predeterminado de la página. Sin él, el texto en español se lee con fonética inglesa.

Flujo de trabajo: de la transcripción con IA a un documento accesible

Partiendo de una transcripción generada por IA mediante la herramienta de audio a texto:

Herramienta de carga de audio de ConvertAudioToText con zona para arrastrar archivos y opciones de formato
Herramienta de carga de audio de ConvertAudioToText con zona para arrastrar archivos y opciones de formato

Paso 1: Revisión inicial. Lee la transcripción mientras escuchas el audio. Confirma la precisión e identifica los grandes cambios de tema que deberían convertirse en encabezados H2.

Paso 2: Añade la estructura de encabezados. Inserta encabezados H2 en los cambios importantes de tema. Para una entrevista de 60 minutos, un rango razonable es de cinco a quince encabezados. Nombra cada encabezado con el tema.

Paso 3: Verifica las etiquetas de hablante. La diarización por IA suele ser precisa entre el 80 y el 90 % de las veces, pero revisa si hay: habla solapada en la que ambos hablantes quedaron fusionados en uno, turnos rápidos que la IA colapsó y líneas mal atribuidas.

Paso 4: Corta los párrafos. Divide los monólogos largos en puntos naturales. Apunta a párrafos de 100 a 200 palabras.

Paso 5: Añade marcas de tiempo. Inserta marcas de tiempo cada cinco o diez minutos para facilitar la navegación.

Paso 6: Marca los sonidos no verbales. Para audio narrativo, añade descripciones de sonido entre corchetes en los momentos relevantes. Para diálogo puro (reuniones, entrevistas), normalmente innecesario.

Paso 7: Añade el marcado de idioma. Si alguna sección está en otro idioma, envuélvela en un atributo lang en HTML, o indica el idioma explícitamente en formatos de texto plano.

Paso 8: Valida con un lector de pantalla. NVDA (gratuito, de código abierto, Windows) y VoiceOver (integrado en macOS e iOS) son las dos herramientas más prácticas para esto. Navega la transcripción usando solo el teclado. Comprueba que la navegación por encabezados salta entre las secciones principales, que la navegación por párrafos avanza con fluidez y que las etiquetas de hablante se anuncian antes del texto.

Este paso de validación detecta problemas que la revisión visual pasa por alto.

Dónde publicar la transcripción

FormatoSoporte de lectores de pantallaNotas
HTML en la páginaExcelenteEstructura semántica completa; la navegación por encabezados y puntos de referencia funciona de forma nativa
PDF etiquetadoBuenoRequiere autoría intencional; no se produce con el «Guardar como PDF» por defecto
Markdown (renderizado)BuenoLas plataformas que renderizan a HTML conservan la mayor parte de la estructura
Texto planoAceptableSin navegación por encabezados; solo lectura secuencial
PDF sin etiquetarPobreEstructura semántica normalmente perdida; navegación por encabezados no disponible
Incrustada en el reproductor de videoPobreA menudo inaccesible para lectores de pantalla según la implementación del reproductor

Para plataformas que eliminan el formato (algunos alojamientos de pódcast, algunas plataformas de cursos), publica la versión HTML en tu propio sitio y enlaza a ella.

Ubicación en la página

Pon la transcripción en la misma página que el audio, no detrás de un enlace aparte. Un usuario que llegue a la página de tu episodio debería poder desplazarse hacia abajo (o saltar mediante un encabezado) hasta la transcripción sin abrir una URL nueva. Si la transcripción es larga, un enlace de salto en la parte superior del reproductor («Saltar a la transcripción») reduce la carga de navegación.

Para contenido de video, las transcripciones y los subtítulos sirven a usuarios distintos y puede que se necesiten ambos. La transcripción va como texto en la página. Los subtítulos van como archivo temporizado en el reproductor de video. Ninguno sustituye al otro. Consulta transcripción para usuarios sordos y con pérdida auditiva para ver el panorama completo de qué formatos cubren qué necesidades de acceso.

Longitud y estructura según el tipo de contenido

Menos de 15 minutos de audio: Una única sección en prosa sin subencabezados es aceptable. Las etiquetas de hablante y los cortes de párrafo siguen importando.

15-60 minutos: Encabezados H2 cada cinco a quince minutos. De cinco a diez encabezados para una entrevista típica.

60-180 minutos: Encabezados jerárquicos, H2 para las secciones principales y H3 para los cambios de tema dentro de las secciones.

Contenido multisesión o de varias horas: Considera dividirlo en páginas de transcripción separadas por sesión o tema. El objetivo de navegación es que cualquier usuario pueda encontrar cualquier momento en unos 30 segundos.

Para contenido educativo, clases accesibles con transcripciones explica cómo se integra la estructura de la transcripción con las plataformas de cursos. Para el panorama más amplio de cumplimiento, cumplimiento de WCAG con transcripciones cubre qué criterios de éxito aplican a qué tipos de medios.

Lista de verificación rápida de accesibilidad

Antes de publicar una transcripción, confirma:

  1. ¿Puede un usuario de lector de pantalla identificar al hablante en cualquier punto del texto?
  2. ¿Puede saltar a una sección concreta mediante la navegación por encabezados?
  3. ¿Puede navegar párrafo a párrafo por el contenido?
  4. ¿Están los pasajes que no están en inglés marcados con atributos de idioma?
  5. ¿Está la transcripción en la misma página que el audio, y no detrás de un enlace aparte?
  6. ¿Probaste la navegación con un lector de pantalla real?

Si alguna respuesta es no, la transcripción no es totalmente accesible. Las correcciones son cambios de formato, no reescrituras de contenido. Una transcripción que supera estas comprobaciones sirve a más gente que a los usuarios de lectores de pantalla: ayuda a cualquiera que busque una palabra clave, lea en una pantalla pequeña o busque una cita concreta. El trabajo estructural que hace accesibles las transcripciones las hace más útiles para todos.

Si generas transcripciones a partir de archivos de audio o video, ConvertAudioToText produce una salida de texto que puedes pegar directamente en tu flujo de publicación y formatear con los patrones anteriores.

Preguntas frecuentes

¿Necesitan los usuarios ciegos subtítulos o transcripciones?

Los usuarios ciegos necesitan transcripciones, no subtítulos. Los subtítulos son texto sincronizado superpuesto al video, pensados para usuarios que pueden ver el video pero no pueden oír el audio. Una transcripción es un documento de texto independiente que un lector de pantalla puede recorrer por sí mismo. WCAG 1.2.1 (nivel A) exige una transcripción para el contenido de solo audio prerregistrado; WCAG 1.2.2 (nivel A) exige subtítulos para el video sincronizado. Puede que hagan falta ambos, pero cumplen propósitos distintos y sirven a usuarios distintos.

¿Dónde debe colocarse la transcripción en la página?

Pon la transcripción en la misma página del audio o el video, no detrás de un enlace de descarga aparte. Un usuario de lector de pantalla no debería tener que ir a otra página para acceder al texto. Si la transcripción es larga, colócala debajo del reproductor multimedia con un encabezado claro para que el usuario pueda saltar a ella desde la lista de encabezados. También ayuda un enlace de salto («Saltar a la transcripción») sobre el reproductor. Si ofreces descarga, el HTML es más fiablemente accesible que el PDF.

¿Cómo ayudan los encabezados a los usuarios de lectores de pantalla a navegar por una transcripción larga?

Los lectores de pantalla permiten a los usuarios desplegar una lista de todos los encabezados de la página y saltar directamente a cualquiera de ellos. En una transcripción de 90 minutos sin encabezados, el usuario tiene que leer palabra por palabra para encontrar una sección concreta. Con encabezados H2 para los temas principales cada 10-15 minutos, el usuario puede saltar a la sección correcta en segundos. El texto del encabezado debe describir el tema, no limitarse a mostrar una marca de tiempo: «00:15:30: Discusión sobre precios» aporta contexto útil; «00:15:30» solo, no.

¿Son accesibles para los lectores de pantalla las transcripciones en PDF?

Los PDF pueden ser accesibles, pero la mayoría no lo son por defecto. Un PDF creado con «Guardar como PDF» desde Word o exportado desde una página web suele perder su estructura de etiquetas semánticas. Los lectores de pantalla aún pueden leer el texto secuencialmente, pero la navegación por encabezados, la estructura de listas y los atributos de idioma suelen eliminarse. Para una accesibilidad fiable con lectores de pantalla, el HTML en una página web es el mejor formato. Si necesitas ofrecer un PDF, usa una herramienta de autoría que exporte PDF etiquetados con etiquetas explícitas de encabezado, párrafo e idioma.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles