
Transcripción vs subtitulado vs subtítulos: guía 2026
Summarize this article with:
La transcripción produce un documento legible a partir del audio. El subtitulado accesible produce texto sincronizado en pantalla para espectadores que no pueden oír, incluidos los efectos de sonido y la identificación de los hablantes. Los subtítulos traducen o transcriben el diálogo para espectadores que no pueden entender el idioma, y omiten las señales sonoras que el espectador ya puede oír. Una misma pasada de transcripción puede producir los tres resultados; solo necesitas la exportación y la pasada de edición adecuadas para cada uno. Los subtítulos traducidos no satisfacen la legislación de accesibilidad: solo lo hacen los subtítulos accesibles completos.
Una transcripción, una pista de subtítulos accesibles y un archivo de subtítulos son tres cosas distintas. Las tres parten del mismo audio, pero cada una resuelve un problema diferente, se entrega en un formato diferente y contiene contenido diferente. Elegir el equivocado hace que fracases ante tu audiencia o ante una comprobación de cumplimiento.
Los tres artefactos, de un vistazo
| Transcripción | Subtítulos cerrados | Subtítulos | |
|---|---|---|---|
| Público | Lectores | Espectadores que no pueden oír | Espectadores que no entienden el idioma hablado |
| ¿Incluye efectos de sonido? | No (salvo que sean imprescindibles) | Sí, obligatorio | No |
| ¿Incluye referencias musicales? | No | Sí | No |
| ¿Incluye identificación de hablantes? | Cuando hay varios hablantes | Sí, obligatorio | Solo si hay ambigüedad en pantalla |
| ¿Traducido? | Rara vez | En el mismo idioma o traducido | Normalmente traducido |
| Formatos habituales | TXT, DOCX, PDF | SRT, VTT, SCC, TTML | SRT, VTT, SBV |
| Dónde es obligatorio por ley | Contenido solo de audio (Sección 508) | Vídeo pregrabado (WCAG SC 1.2.2), vídeo en directo (SC 1.2.4) | Ninguna ley de accesibilidad los exige |
Esa última fila es la que más sorprende: los subtítulos traducidos no cumplen la legislación de accesibilidad. Solo lo hacen los subtítulos accesibles completos.
Transcripción: el resultado es un documento
¿Cuál es la diferencia entre una transcripción y los subtítulos cerrados?
Una transcripción es un documento: sin códigos de tiempo, optimizado para la lectura, con estructura de párrafos y sin límites de longitud de línea. Los subtítulos cerrados son una pista de texto sincronizada con un vídeo, almacenada por separado del vídeo para que los espectadores puedan activarlos o desactivarlos. Ambos parten de la misma pasada de reconocimiento de voz, pero el formato de salida, el contenido y las convenciones de edición son diferentes.
Una transcripción está pensada para leerse, no para verse. Eso lo cambia todo en cuanto al formato.
- Estructura a nivel de párrafo para facilitar la lectura, no saltos de línea de 32 caracteres.
- Etiquetas de hablante cuando hay más de una voz, escritas de forma legible.
- Sin códigos de tiempo obligatorios (las marcas de tiempo opcionales para navegar están bien).
- Puntuación y formato optimizados para un lector, no para un reproductor de vídeo.
- Sin límite de longitud de línea. Sin marcas de fin de subtítulo.
Si pegas un archivo de subtítulos en un documento, obtienes algo que se lee como una cinta de teletipo impresa. Una transcripción bien hecha se edita para que se lea como una entrevista o un artículo pulido. Las dos cosas son estructuralmente diferentes aunque las palabras sean las mismas.
Casos de uso habituales: entradas de blog a partir de entrevistas, notas de episodios de podcast, actas de reuniones, trabajos académicos, declaraciones judiciales y contenido para indexación en buscadores.
Subtítulos accesibles: el resultado es una pista de accesibilidad sincronizada

¿Qué deben incluir los subtítulos cerrados que los subtítulos convencionales no llevan?
Los subtítulos cerrados deben incluir la identificación de los hablantes, efectos de sonido (p. ej., [la puerta se cierra de golpe], [suena el teléfono]), referencias musicales ([música animada], [aplausos del público]), identificación de hablantes fuera de pantalla e indicadores de tono cuando el texto por sí solo resulta ambiguo. Los subtítulos solo contienen el diálogo, a veces traducido, porque el espectador puede oír todo lo demás.
El subtitulado accesible está diseñado para un espectador que ve el vídeo sin ningún audio. Todo lo que oiría debe aparecer en pantalla, y por eso los subtítulos accesibles incluyen contenido que las transcripciones y los subtítulos no llevan.
Elementos obligatorios:
- Identificación de los hablantes. «Alice:» o «[Bob]» antes de cada intervención, especialmente cuando los hablantes están fuera de cámara o no se les puede identificar visualmente.
- Efectos de sonido. «[la puerta se cierra de golpe]», «[suena el teléfono]», «[el público aplaude]».
- Referencias musicales. «[suena música animada]», «[cuerdas ominosas]», «[canción: letra aquí]».
- Indicadores de tono cuando el significado emocional no queda claro solo con las palabras. «[en tono sarcástico]», «[susurrando]».
Los subtítulos accesibles también van codificados en el tiempo respecto al vídeo: cada subtítulo tiene hora de inicio y de fin, y el texto aparece en pantalla sincronizado con el audio. La calidad de esa sincronización tiene relevancia legal.
Para redes sociales, la entrada subtítulos abiertos vs cerrados explica la distinción en detalle. En resumen: los subtítulos cerrados son un interruptor (el botón CC de YouTube); los subtítulos abiertos van incrustados en los píxeles del vídeo y no se pueden quitar. El contenido social de formato corto (TikTok, Instagram Reels) suele usar subtítulos abiertos porque la mayoría de los espectadores ven sin sonido y el soporte de subtítulos cerrados de las plataformas es inconsistente. Aprende más en la guía subtitulado para TikTok e Instagram.
Subtítulos: el resultado es una pista de diálogo para el acceso al idioma
¿Los subtítulos valen como subtítulos accesibles a efectos de cumplimiento normativo?
No. Los subtítulos asumen que el espectador puede oír y, por tanto, omiten los efectos de sonido, las referencias musicales y el audio no verbal. La legislación de accesibilidad (WCAG SC 1.2.2, ADA Título II, Sección 508, EAA) exige subtítulos accesibles que incluyan toda la información sonora necesaria para comprender el contenido. Una pista de subtítulos que solo contiene diálogo no satisface estos requisitos.
Los subtítulos asumen que el espectador puede oír. Solo incluyen lo necesario para seguir el diálogo en otro idioma (u ocasionalmente en el mismo idioma para espectadores que necesitan apoyo de lectura).
- Texto del diálogo, normalmente traducido al idioma del espectador.
- Sin efectos de sonido. El espectador puede oír el portazo.
- Sin referencias musicales. El espectador puede oír la banda sonora.
- Sin identificación de hablantes salvo que haya ambigüedad total en pantalla.
Un subtítulo de español a inglés de una película traduce el diálogo y hasta ahí llega. La pista de subtítulos confía en que el espectador oyó el disparo, las risas y el silencio.
La implicación práctica: si tu vídeo tiene pista de subtítulos pero no pista de subtítulos accesibles, has servido a los espectadores que no dominan el idioma, pero no a los espectadores sordos o con pérdida auditiva. Son dos entregables separados.
Una nota sobre terminología
Los términos no son universales. En EE. UU., «captions» suele referirse a la pista de accesibilidad (señales sonoras, identificación de hablantes) y «subtitles» a la pista de solo diálogo. En Reino Unido y gran parte de Europa, «subtitles» cubre ambos usos y «captions» casi no se usa. Las plataformas de streaming (Netflix, Disney+, Amazon Prime) agrupan ambos tipos bajo la palabra «subtítulos» en su interfaz, pero los tratan de forma diferente internamente.
Netflix, por ejemplo, usa el término SDH (Subtitles for the Deaf and Hard of Hearing, subtítulos para sordos y personas con discapacidad auditiva) para la pista de accesibilidad que incluye señales sonoras. Internamente, Netflix exige todos los archivos SDH y de subtítulos en formato TTML1 (.xml o .ttml), no SRT ni VTT, para su cadena de entrega. Ese es el contexto en el que la brecha terminológica causa problemas reales de producción.
Formatos de archivo: qué va donde
¿Qué formato de archivo debo usar para subtítulos accesibles y para subtítulos?
SRT es el más portable y funciona en YouTube, Vimeo, Facebook y la mayoría de reproductores de vídeo. VTT (WebVTT) añade estilos y posicionamiento para reproductores HTML5 y es el preferido para vídeo alojado en la web. TTML (y su perfil IMSC1.1) es obligatorio para la difusión profesional de broadcast y OTT, como Netflix. SCC se usa en flujos de trabajo de broadcast norteamericanos. Para la mayoría de creadores independientes y cursos online, genera primero SRT y convierte después según sea necesario.
| Formato | Ideal para | Plataformas clave |
|---|---|---|
| SRT | Portabilidad, la mayoría de plataformas online | YouTube, Vimeo, Facebook, la mayoría de reproductores |
| VTT (WebVTT) | Reproductores web HTML5, control de estilos | Vimeo, vídeo alojado en web, elemento track de HTML5 |
| SCC | Flujos de trabajo de broadcast norteamericanos | Broadcast heredado y edición profesional |
| TTML / IMSC1.1 | Entrega OTT y streaming | Netflix, broadcast, Disney+, Amazon Prime |
| TXT / DOCX | Transcripciones para lectura | Entradas de blog, documentos, indexación en buscadores |
La regla práctica: genera primero SRT para máxima portabilidad y convierte a TTML aguas abajo para entrega OTT profesional. SRT y VTT sirven tanto para el subtitulado accesible como para los subtítulos; el contenido determina de qué tipo se trata, no la extensión del archivo.
Para ver en profundidad qué contiene cada formato y cómo los interpretan los reproductores, consulta cómo crear un archivo SRT.
Pistas en el mismo idioma vs pistas traducidas
Un vídeo de YouTube en inglés puede tener una pista de subtítulos accesibles en inglés (accesibilidad, incluye señales sonoras) y una pista de subtítulos en español (diálogo traducido, sin señales sonoras). Mismo formato de archivo, contenido diferente:
- Subtítulos accesibles en el mismo idioma: pista de accesibilidad con identificación de hablantes y señales sonoras.
- Subtítulos en el mismo idioma: solo diálogo, a veces usados como apoyo de comprensión o en entornos ruidosos; no sustituyen a la accesibilidad.
- Subtítulos accesibles traducidos (SDH en otro idioma): señales sonoras traducidas junto con el diálogo; obligatorios cuando el contenido está originalmente en un idioma y el público objetivo puede ser sordo o tener pérdida auditiva en ese idioma.
- Subtítulos traducidos: diálogo traducido, sin señales sonoras; sirven para el acceso al idioma, no para la accesibilidad.
El flujo de transcripción produce el texto en el idioma original. La traducción es un paso posterior, aplicado ya sea a los subtítulos accesibles o a los subtítulos según la necesidad del público.
Cuándo necesitas cada uno
| Objetivo | Resultado adecuado |
|---|---|
| Entrada de blog a partir de una entrevista grabada | Transcripción (TXT o DOCX) |
| Notas de episodio de podcast | Transcripción |
| Vídeo de YouTube: espectadores sordos o con pérdida auditiva | Subtítulos cerrados en el mismo idioma (SRT o VTT) |
| Vídeo de YouTube: espectadores que no hablan inglés | Subtítulos traducidos (SRT o VTT) |
| TikTok o Instagram Reels | Subtítulos abiertos incrustados en el vídeo |
| Acta de reunión en directo para el equipo | Transcripción |
| Clase universitaria o curso online | Subtítulos cerrados + transcripción aparte |
| Película para estreno internacional | Subtítulos traducidos por idioma |
| Vídeo de agencia federal o contratista (Sección 508) | Subtítulos cerrados + transcripción descriptiva |
| Vídeo de cara al público (ADA Título II, EAA) | Subtítulos cerrados (los subtítulos por sí solos no bastan) |
Para la mayoría de creadores de contenido, la respuesta es «transcripción y subtítulos accesibles». Está bien así. Una sola pasada de transcripción puede producir ambos: exporta TXT para lectura y SRT para incrustar. El generador de subtítulos produce archivos SRT y VTT a partir de audio o vídeo en un solo paso.
Requisitos legales: lo que dice realmente la ley
¿Son suficientes los subtítulos generados automáticamente para cumplir la normativa de accesibilidad?
Normalmente no por sí solos. La FCC utiliza una precisión del 99 % en palabras como referente para los subtítulos de broadcast. Las directrices de la Sección 508 y de WCAG establecen que los subtítulos generados automáticamente son insuficientes salvo que se confirme su total exactitud, porque los errores que alteran el significado crean barreras de accesibilidad. Prevé una pasada de edición humana sobre el resultado automático antes de publicarlo si buscas cumplir la normativa.
Mi opinión: el panorama legal es más específico de lo que reconocen la mayoría de artículos, y las distinciones entre transcripción, subtitulado accesible y subtítulos son justo donde las organizaciones se equivocan.
WCAG (Web Content Accessibility Guidelines, Directrices de Accesibilidad para el Contenido Web):
- SC 1.2.2 (Nivel A): subtítulos accesibles para audio pregrabado en medios sincronizados.
- SC 1.2.4 (Nivel AA): subtítulos accesibles para audio en directo en medios sincronizados.
- Las transcripciones por sí solas satisfacen el contenido solo de audio, pero no el vídeo con audio.
- Los subtítulos no satisfacen ninguno de los dos requisitos.
ADA Título II (EE. UU.): La norma final de abril de 2024 del Departamento de Justicia (DOJ) estableció WCAG 2.1 Nivel AA como estándar de cumplimiento para las entidades públicas. El primer plazo venció el 24 de abril de 2026 para las entidades que prestan servicio a poblaciones de más de 50 000 habitantes.
Sección 508 (federal de EE. UU.): Los medios sincronizados requieren subtítulos accesibles (WCAG SC 1.2.2) además de audiodescripciones para el contenido visual significativo. Las transcripciones se exigen por separado para los medios solo de audio.
FCC (broadcast de EE. UU.): Los estándares de calidad adoptados en 2014 plantean la exactitud, la sincronización, la integridad del programa y la colocación de los subtítulos como los cuatro principios. El referente del sector es una precisión del 99 % en palabras. Los subtítulos generados automáticamente no se consideran suficientes sin una pasada de revisión humana.
Ley Europea de Accesibilidad (EAA): Entró en vigor el 28 de junio de 2025 y abarca a las empresas que operan en la UE o venden a residentes de la UE. El contenido audiovisual debe incluir subtítulos accesibles o subtítulos sincronizados que cumplan los estándares de calidad, con una velocidad de lectura de aproximadamente 160-180 palabras por minuto.
Para un análisis completo del cumplimiento del subtitulado accesible en distintas jurisdicciones, consulta cumplimiento WCAG con transcripciones y subtítulos de accesibilidad y cumplimiento ADA.
Esta sección está actualizada a mediados de 2026 y se ofrece solo con fines informativos generales, no como asesoramiento legal. Verifica los requisitos de tu jurisdicción y caso de uso concretos.
Qué hacer a continuación
Identifica primero tu entregable. Si el público lo lee, necesitas una transcripción. Si el público lo ve sin audio, necesitas subtítulos accesibles. Si el público lo ve pero no entiende el idioma hablado, necesitas subtítulos. Una misma pasada de transcripción produce los tres; elige la exportación y la pasada de edición adecuadas para cada uno.
Si necesitas generar un archivo de subtítulos accesibles o de subtítulos sin montar un flujo de trabajo completo, el generador de subtítulos de ConvertAudioToText procesa archivos de audio y vídeo y exporta directamente SRT o VTT.
Fuentes
- W3C WAI, "Captions/Subtitles": https://www.w3.org/WAI/media/av/captions/
- W3C WAI, "Understanding SC 1.2.2 Captions (Prerecorded)": https://www.w3.org/WAI/WCAG22/Understanding/captions-prerecorded.html
- Section508.gov, "Video and Other Synchronized Media": https://www.section508.gov/create/synchronized-media/
- 3Play Media, "FCC Closed Captioning Quality Standards": https://www.3playmedia.com/blog/fccs-new-quality-standards-closed-captioning-video-programming/
- FCC, "FCC Adopts Closed Captioning Quality Standards for TV Programs": https://www.fcc.gov/fcc-adopts-closed-captioning-quality-standards-tv-programs
- Netflix Partner Help Center, "Timed Text Style Guide: General Requirements": https://partnerhelp.netflixstudios.com/hc/en-us/articles/215758617-Timed-Text-Style-Guide-General-Requirements
- Interprefy, "The European Accessibility Act 2025 Captioning Requirements": https://www.interprefy.com/resources/blog/european-accessibility-act-captioning-requirements
- DOJ April 2024 Title II final rule, ADA.gov
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.