
Transcripción para usuarios sordos y con pérdida auditiva
Summarize this article with:
Para los usuarios sordos y con pérdida auditiva, una buena transcripción significa un 99% de precisión, etiquetas claras de hablante en cada cambio, sonidos no verbales entre corchetes y un ritmo de subtítulos legible. La IA supera el 90-97% de precisión en condiciones ideales, pero se queda corta de forma constante en entornos reales, sobre todo en streaming en directo. El flujo práctico es un primer borrador con IA y luego una revisión humana para precisión, identificación de hablantes y sonidos no verbales. Normas como WCAG 2.1 AA describen bien este nivel, pero la razón real para cumplirlo es que refleja lo que hace que el contenido sea realmente utilizable.
Para los usuarios sordos o con pérdida auditiva (DHH, por sus siglas en inglés), la calidad de una transcripción o de un archivo de subtítulos no es una cuestión estética. Determina si el contenido es siquiera utilizable. El estándar práctico es una precisión del 99% a nivel de palabra, una identificación clara del hablante en cada cambio y los sonidos no verbales entre corchetes. La mayoría de las transcripciones por IA no alcanzan ese nivel sin revisión humana. Esta publicación explica qué necesitan realmente los usuarios DHH, dónde ayuda la IA y qué sigue requiriendo atención humana.
(Orientación práctica, no asesoramiento legal.)
La diversidad detrás de "DHH"
"Sordos o con pérdida auditiva" abarca una amplia gama de experiencias, y lo que ayuda a cada persona varía.
Los usuarios culturalmente sordos, especialmente aquellos para quienes la lengua de signos americana (ASL) o la británica (BSL) es su primera lengua, pueden leer inglés como segunda lengua. Las transcripciones largas y densas pueden ser más difíciles de seguir que la ASL hablada. Para este público, el lenguaje sencillo importa tanto como la precisión: frases más cortas, vocabulario común y saltos de párrafo claros. La interpretación en lengua de signos suele ser más accesible que los subtítulos para contenido extenso.
Los usuarios con pérdida auditiva suelen leer con fluidez nativa, pero pierden el acceso al audio en entornos ruidosos, con grabaciones de baja calidad, o cuando los hablantes tienen acentos fuertes o superposición de voces. Los subtítulos y las transcripciones les dan el mismo acceso al contenido que el audio claro proporciona a otros.
Los adultos que perdieron la audición más tarde suelen preferir los subtítulos a la lengua de signos porque tienen un buen dominio del inglés escrito, pero no fluidez en ninguna lengua signada.
Una nota terminológica de la comunidad existente: "Sordo" con mayúscula se refiere a la identidad cultural; "sordo" en minúscula se refiere a la condición audiológica. "Discapacitado auditivo" se considera generalmente negativo en la comunidad sorda y es mejor evitarlo.
Lo que la transcripción por IA ofrece realmente
Antes de entrar en lo que necesitan los usuarios DHH, conviene ser honestos sobre lo que proporciona la transcripción por IA, porque el marketing no siempre coincide con la experiencia real.
Vendor-reported accuracy rates for AI transcription typically range from 90-97% in good conditions. Peer-reviewed research tells a more complicated story. A 2024 study measuring 11 ASR services using real university lecture recordings found wide performance variation across vendors and individual audio samples, with streaming ASR, the technology used for live captions, performing significantly worse than post-production transcription. The researchers concluded that "common services lack reliability in accuracy" and documented a clear mismatch between published industry claims and the experience DHH users actually report.
This is not an argument against using AI transcription. It is an argument for understanding its role: AI handles the bulk of words at speed, humans close the accuracy gap and add what AI cannot.
For a 90-minute lecture, an AI pass completes in about two to three minutes. Manual transcription from scratch takes six to nine hours. A human reviewing an AI draft typically finishes in two to three hours. The AI pass is still the right place to start.
The Four Things DHH Users Actually Need
The Accuracy Floor That Actually Serves DHH Users
At 97% accuracy on 1,500 words, roughly 45 words are wrong. At 95%, it is 75 errors. For general content, a reader can often infer correct meaning from context. For technical lectures, medical content, legal proceedings, or fast-paced dialogue, 5% errors break comprehension.
The DCMP and the FCC both set 99% word-level accuracy as the published standard for post-production captions, with 98.5% for real-time. That gap between standard and typical AI output is why human review exists.
For a deeper look at accuracy measurement and what word error rate actually means, see transcription accuracy explained.
Speaker Identification on Every Change
Las convenciones de subtítulos requieren una etiqueta de hablante cada vez que cambia el interlocutor, no solo la primera vez que aparece cada uno. Los formatos habituales son: "SARAH:" al inicio de una línea, o "[Sarah]" como marcador dentro del texto. La diarización por IA maneja razonablemente bien las entrevistas con dos interlocutores en audio limpio. Sin embargo, falla con tres o más hablantes, superposiciones de voz, voces similares y grabaciones realizadas con un único micrófono de campo lejano.
La falta de etiquetas de hablante en una conversación entre tres personas hace que la transcripción sea casi inutilizable. El lector no puede seguir quién está en desacuerdo con quién, que es precisamente el sentido de muchas grabaciones con gran carga de diálogo.
Para una explicación completa de cómo funciona la diarización de hablantes y dónde falla, consulta diarización de hablantes explicada.
Los Sonidos No Verbales Que Deben Subtitularse
Los subtítulos asumen que el espectador no puede oír. Eso significa que todo audio relevante necesita un equivalente textual, no solo el habla.
Las pautas de calidad de subtitulado del DCMP exigen una representación textual completa del audio, incluida la información no verbal. En la práctica:
- Sonidos ambientales que afectan a la comprensión: "[se cierra la puerta]", "[suena la alarma]", "[la multitud aplaude]"
- Música con letra: La letra real cuando es central para la escena, no "[suena música]"
- Música instrumental: "[música de cuerda tensa]" o "[piano alegre]" cuando el ambiente es relevante para la narrativa
- Tono y manera: "[tono sarcástico]" o "[susurrando]" cuando leer las palabras sin el contexto del tono cambia su significado
La transcripción por IA casi nunca genera anotaciones de sonidos no verbales. Esta es una de las diferencias más claras entre la salida de la IA y los subtítulos de calidad accesible. Cada sonido no verbal en un archivo requiere una adición manual durante la revisión.

Sincronización Legible y Saltos de Línea
Los subtítulos que aparecen antes o después del discurso que describen resultan desorientadores. La sincronización debe colocar el texto durante el discurso y hacerlo desaparecer aproximadamente un segundo después de que el hablante se detenga.
La velocidad de lectura importa: el DCMP establece entre 150 y 160 palabras por minuto para contenido adulto, con un límite máximo absoluto de 225 ppm. La FCC recomienda que los subtítulos no vayan más rápido de lo que el espectador puede leer. Cuando el audio supera las 160 ppm (hablantes rápidos, conversaciones superpuestas, lenguaje legal o médico denso), los subtítulos deben editarse y resumirse, en lugar de mostrarse palabra por palabra a una velocidad que nadie puede seguir.
Longitud de línea: no más de 32 caracteres por línea, con un máximo de dos líneas en pantalla a la vez. Se debe cortar en los límites naturales de las cláusulas, nunca a mitad de una frase.
Preguntas adicionales que hacen los usuarios y productores con discapacidad auditiva
Dónde la salida de IA necesita edición humana
Para convertir una transcripción de IA en un archivo de subtítulos con calidad de accesibilidad:
- Genera la transcripción con una herramienta como audio a texto. Exporta como TXT o VTT.
- Ábrela en un editor de subtítulos (Subtitle Edit, Aegisub o una herramienta de subtitulado basada en navegador).
- Escucha el audio mientras lees. Corrige las palabras mal interpretadas. Presta especial atención a nombres propios, términos técnicos y nombres de personas.
- Añade etiquetas de hablante en cada cambio de interlocutor.
- Añade sonidos no verbales entre corchetes cuando aporten significado.
- Comprueba la longitud de línea y corta en los límites de las cláusulas.
- Verifica la velocidad de lectura. Si un bloque de subtítulos es demasiado largo para su ventana de tiempo, recórtalo o divídelo.
- Exporta el archivo final en VTT o SRT.
Para una hora de audio o vídeo, la pasada de edición humana suele llevar entre dos y tres horas. Eso es mucho más rápido que empezar desde cero (de seis a nueve horas para subtitulado manual), y el borrador de IA maneja de forma fiable el volumen de palabras habladas. La pasada humana se encarga de todo lo que la IA no capta.
Si solo necesitas una transcripción limpia sin crear un archivo de subtítulos, ConvertAudioToText te da el borrador de IA y exporta archivos SRT y VTT que puedes llevar a un editor de subtítulos.
Para ver cómo se ve el lado de generación de subtítulos en este flujo de trabajo, la herramienta de generación de subtítulos exporta tanto SRT como VTT.
Más allá de los archivos de subtítulos individuales
Para eventos en directo y entornos en tiempo real, CART (Communication Access Realtime Translation) es el estándar profesional. Un proveedor de CART capacitado usa una máquina de estenotipia para producir subtítulos palabra por palabra en tiempo real. CART alcanza aproximadamente un 98,5% de precisión, que es el estándar en tiempo real que cita la FCC. Los subtítulos automáticos con IA para eventos en directo han mejorado, pero siguen siendo menos fiables, especialmente en salas ruidosas, con acentos o con varios oradores superpuestos.
Para entornos de alto riesgo (procedimientos legales, consultas médicas, procedimientos gubernamentales), los subtítulos con IA no sustituyen ni a CART ni a un intérprete de lengua de signos cualificado.
Las versiones en lenguaje sencillo del contenido ayudan a los usuarios sordos o con dificultades auditivas para los que el inglés es un segundo idioma. Las transcripciones resumidas con vocabulario común y frases más cortas suelen servir mejor a este público que los subtítulos verbatim. Muchos productores de contenido ofrecen ambas opciones.
Qué codifican los estándares
Los requisitos de cumplimiento (WCAG 2.1 AA, ADA, Sección 508, Ley Europea de Accesibilidad) merece la pena entenderlos, pero los estándares codifican lo que los usuarios con sordera o dificultades auditivas necesitan, en lugar de inventar umbrales arbitrarios. El objetivo del 99% de precisión existe porque la investigación sobre comprensión lectora en este colectivo muestra que tasas de error superiores al 1% degradan de forma medible la comprensión de contenido con vocabulario técnico. Los requisitos no relacionados con el habla existen porque el contenido narrativo sin señales de sonido está incompleto para los espectadores que no pueden oír.
La Ley Europea de Accesibilidad entró en vigor el 28 de junio de 2025, ampliando los requisitos de subtitulado a los servicios del sector privado en los estados miembros de la UE para contenido nuevo. El contenido heredado tiene un periodo transitorio hasta 2030. Esta es una expansión significativa más allá del alcance anterior, limitado al sector público.
Para un recorrido completo de los criterios WCAG 2.1 y lo que exigen, consulta cumplimiento de WCAG con transcripciones. Para saber cómo se aplica la ADA a tipos específicos de entidades, consulta cumplimiento de ADA para contenido de audio. Para el panorama internacional más amplio, consulta leyes de accesibilidad por país.
Mi opinión: el fallo de accesibilidad más común no es la ignorancia legal. Es la suposición de que los subtítulos generados automáticamente son "suficientemente buenos" porque capturan la mayoría de las palabras. Para los usuarios con sordera o hipoacusia que dependen del texto como su acceso principal al contenido de audio, la mayoría de las palabras no es el estándar. Todo el significado es el estándar. La revisión humana no es opcional. Es el punto central.
Preguntas frecuentes
¿Qué nivel de precisión necesitan los subtítulos para servir realmente a los usuarios sordos y con hipoacusia?
Tanto el DCMP como la FCC establecen un 99% de precisión a nivel de palabra como estándar para subtítulos en postproducción, con un 98,5% para tiempo real. Con un 95% de precisión, una conferencia de 1.500 palabras contiene alrededor de 75 errores, suficientes para romper la comprensión de contenido técnico. La transcripción con IA suele alcanzar entre el 90% y el 97% en buenas condiciones, pero la investigación publicada encuentra que el rendimiento en el mundo real, especialmente para subtítulos en streaming, queda muy por debajo de las cifras reportadas por los proveedores. La revisión humana después de un borrador de IA es el camino fiable hacia el 99%.
¿Qué sonidos no verbales deben incluirse en los subtítulos?
Cualquier audio que aporte significado para comprender el contenido: sonidos de fondo que afectan a la narrativa ("[portazo]", "[suena el teléfono]"), música con letra, música instrumental cuando tiene relevancia emocional o narrativa ("[música de violín tensa]") e identificación del hablante en cada cambio de interlocutor. Las herramientas de IA casi nunca capturan los sonidos que no son habla. Estos deben añadirse manualmente durante la revisión humana.
¿Cuál es la diferencia entre subtítulos y subtítulos para sordos con fines de accesibilidad?
Los subtítulos para sordos están escritos para espectadores que no pueden oír e incluyen todo el audio con significado: diálogo, identificación del hablante, efectos de sonido relevantes y señales musicales. Los subtítulos son traducciones del diálogo para espectadores que sí oyen pero no entienden el idioma, por lo que omiten los sonidos no verbales. Para la accesibilidad, los subtítulos para sordos son lo que necesitas. Los subtítulos ocultos se pueden activar o desactivar. Los subtítulos abiertos están incrustados permanentemente en el vídeo.
¿Prefieren los usuarios sordos los subtítulos o la interpretación en lengua de signos?
Las preferencias varían según la persona y el contexto. Muchos usuarios sordos culturales, especialmente aquellos para quienes la ASL o la BSL son su primera lengua, encuentran la lengua de signos más natural y menos fatigosa que leer subtítulos en contenidos largos. En situaciones de alto riesgo, como procedimientos legales o consultas médicas, los intérpretes de lengua de signos ofrecen un mejor acceso para quienes dominan la lengua de signos. Los subtítulos sirven a un público más amplio, incluidos adultos con pérdida auditiva tardía y usuarios con hipoacusia que se sienten más cómodos con el texto. Cuando sea posible, ofrecer ambas opciones es la alternativa más inclusiva.
¿Es suficiente una transcripción generada por IA para cumplir el requisito de subtítulos WCAG 2.1 AA?
No por sí solo. La WCAG 2.1 SC 1.2.2 (nivel A) exige subtítulos sincronizados para vídeo pregrabado, y la SC 1.2.4 (nivel AA) requiere subtítulos en tiempo real para vídeo en directo. Las pautas especifican que los subtítulos deben ser equivalentes al audio, incluida la información no verbal. Una transcripción automática en bruto convertida a VTT puede cumplir el requisito técnico de formato, pero normalmente carece de etiquetas de hablante, sonidos no verbales y precisión en la sincronización. La revisión humana cubre esa carencia. Para un análisis detallado de las obligaciones de cumplimiento según el tipo de entidad, consulta nuestro artículo sobre cumplimiento de la WCAG con transcripciones.
Fuentes
- Ficha técnica de la OMS: Sordera y pérdida de audición
- Directrices de subtitulado del DCMP
- Medición de la precisión de las soluciones de reconocimiento automático del habla (ACM / arXiv 2408.16287)
- Criterio de éxito 1.2.2 de W3C WCAG 2.1: Subtítulos (pregrabados)
- Criterio de éxito 1.2.4 de W3C WCAG 2.1: Subtítulos (en directo)
- Estándares de calidad de subtítulos cerrados de la FCC
- Ley Europea de Accesibilidad: resumen de accesibilidad digital, Davis Wright Tremaine
- NAD: Traducción en tiempo real del acceso a la comunicación
- DO-IT: Cómo se suelen usar los términos sordo, sordo profundo, con pérdida de audición e hipoacúsico
- Centro Nacional de Sordera: estándares de calidad para subtítulos
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.