Transcripción vs subtitulado vs subtítulos: guía 2026
transcripciónsubtituladosubtítulos

Transcripción vs subtitulado vs subtítulos: guía 2026

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

La transcripción produce un documento legible a partir del audio. El subtitulado accesible produce texto sincronizado en pantalla para espectadores que no pueden oír, incluidos los efectos de sonido y la identificación de los hablantes. Los subtítulos traducen o transcriben el diálogo para espectadores que no pueden entender el idioma, y omiten las señales sonoras que el espectador ya puede oír. Una misma pasada de transcripción puede producir los tres resultados; solo necesitas la exportación y la pasada de edición adecuadas para cada uno. Los subtítulos traducidos no satisfacen la legislación de accesibilidad: solo lo hacen los subtítulos accesibles completos.

Una transcripción, una pista de subtítulos accesibles y un archivo de subtítulos son tres cosas distintas. Las tres parten del mismo audio, pero cada una resuelve un problema diferente, se entrega en un formato diferente y contiene contenido diferente. Elegir el equivocado hace que fracases ante tu audiencia o ante una comprobación de cumplimiento.

Los tres artefactos, de un vistazo

TranscripciónSubtítulos cerradosSubtítulos
PúblicoLectoresEspectadores que no pueden oírEspectadores que no entienden el idioma hablado
¿Incluye efectos de sonido?No (salvo que sean imprescindibles)Sí, obligatorioNo
¿Incluye referencias musicales?NoNo
¿Incluye identificación de hablantes?Cuando hay varios hablantesSí, obligatorioSolo si hay ambigüedad en pantalla
¿Traducido?Rara vezEn el mismo idioma o traducidoNormalmente traducido
Formatos habitualesTXT, DOCX, PDFSRT, VTT, SCC, TTMLSRT, VTT, SBV
Dónde es obligatorio por leyContenido solo de audio (Sección 508)Vídeo pregrabado (WCAG SC 1.2.2), vídeo en directo (SC 1.2.4)Ninguna ley de accesibilidad los exige

Esa última fila es la que más sorprende: los subtítulos traducidos no cumplen la legislación de accesibilidad. Solo lo hacen los subtítulos accesibles completos.

Transcripción: el resultado es un documento

¿Cuál es la diferencia entre una transcripción y los subtítulos cerrados?

Una transcripción es un documento: sin códigos de tiempo, optimizado para la lectura, con estructura de párrafos y sin límites de longitud de línea. Los subtítulos cerrados son una pista de texto sincronizada con un vídeo, almacenada por separado del vídeo para que los espectadores puedan activarlos o desactivarlos. Ambos parten de la misma pasada de reconocimiento de voz, pero el formato de salida, el contenido y las convenciones de edición son diferentes.

Una transcripción está pensada para leerse, no para verse. Eso lo cambia todo en cuanto al formato.

  • Estructura a nivel de párrafo para facilitar la lectura, no saltos de línea de 32 caracteres.
  • Etiquetas de hablante cuando hay más de una voz, escritas de forma legible.
  • Sin códigos de tiempo obligatorios (las marcas de tiempo opcionales para navegar están bien).
  • Puntuación y formato optimizados para un lector, no para un reproductor de vídeo.
  • Sin límite de longitud de línea. Sin marcas de fin de subtítulo.

Si pegas un archivo de subtítulos en un documento, obtienes algo que se lee como una cinta de teletipo impresa. Una transcripción bien hecha se edita para que se lea como una entrevista o un artículo pulido. Las dos cosas son estructuralmente diferentes aunque las palabras sean las mismas.

Casos de uso habituales: entradas de blog a partir de entrevistas, notas de episodios de podcast, actas de reuniones, trabajos académicos, declaraciones judiciales y contenido para indexación en buscadores.

Subtítulos accesibles: el resultado es una pista de accesibilidad sincronizada

Genera la pista de subtítulos accesibles una vez y exporta SRT o VTT según la plataforma
Genera la pista de subtítulos accesibles una vez y exporta SRT o VTT según la plataforma

¿Qué deben incluir los subtítulos cerrados que los subtítulos convencionales no llevan?

Los subtítulos cerrados deben incluir la identificación de los hablantes, efectos de sonido (p. ej., [la puerta se cierra de golpe], [suena el teléfono]), referencias musicales ([música animada], [aplausos del público]), identificación de hablantes fuera de pantalla e indicadores de tono cuando el texto por sí solo resulta ambiguo. Los subtítulos solo contienen el diálogo, a veces traducido, porque el espectador puede oír todo lo demás.

El subtitulado accesible está diseñado para un espectador que ve el vídeo sin ningún audio. Todo lo que oiría debe aparecer en pantalla, y por eso los subtítulos accesibles incluyen contenido que las transcripciones y los subtítulos no llevan.

Elementos obligatorios:

  • Identificación de los hablantes. «Alice:» o «[Bob]» antes de cada intervención, especialmente cuando los hablantes están fuera de cámara o no se les puede identificar visualmente.
  • Efectos de sonido. «[la puerta se cierra de golpe]», «[suena el teléfono]», «[el público aplaude]».
  • Referencias musicales. «[suena música animada]», «[cuerdas ominosas]», «[canción: letra aquí]».
  • Indicadores de tono cuando el significado emocional no queda claro solo con las palabras. «[en tono sarcástico]», «[susurrando]».

Los subtítulos accesibles también van codificados en el tiempo respecto al vídeo: cada subtítulo tiene hora de inicio y de fin, y el texto aparece en pantalla sincronizado con el audio. La calidad de esa sincronización tiene relevancia legal.

Para redes sociales, la entrada subtítulos abiertos vs cerrados explica la distinción en detalle. En resumen: los subtítulos cerrados son un interruptor (el botón CC de YouTube); los subtítulos abiertos van incrustados en los píxeles del vídeo y no se pueden quitar. El contenido social de formato corto (TikTok, Instagram Reels) suele usar subtítulos abiertos porque la mayoría de los espectadores ven sin sonido y el soporte de subtítulos cerrados de las plataformas es inconsistente. Aprende más en la guía subtitulado para TikTok e Instagram.

Subtítulos: el resultado es una pista de diálogo para el acceso al idioma

¿Los subtítulos valen como subtítulos accesibles a efectos de cumplimiento normativo?

No. Los subtítulos asumen que el espectador puede oír y, por tanto, omiten los efectos de sonido, las referencias musicales y el audio no verbal. La legislación de accesibilidad (WCAG SC 1.2.2, ADA Título II, Sección 508, EAA) exige subtítulos accesibles que incluyan toda la información sonora necesaria para comprender el contenido. Una pista de subtítulos que solo contiene diálogo no satisface estos requisitos.

Los subtítulos asumen que el espectador puede oír. Solo incluyen lo necesario para seguir el diálogo en otro idioma (u ocasionalmente en el mismo idioma para espectadores que necesitan apoyo de lectura).

  • Texto del diálogo, normalmente traducido al idioma del espectador.
  • Sin efectos de sonido. El espectador puede oír el portazo.
  • Sin referencias musicales. El espectador puede oír la banda sonora.
  • Sin identificación de hablantes salvo que haya ambigüedad total en pantalla.

Un subtítulo de español a inglés de una película traduce el diálogo y hasta ahí llega. La pista de subtítulos confía en que el espectador oyó el disparo, las risas y el silencio.

La implicación práctica: si tu vídeo tiene pista de subtítulos pero no pista de subtítulos accesibles, has servido a los espectadores que no dominan el idioma, pero no a los espectadores sordos o con pérdida auditiva. Son dos entregables separados.

Una nota sobre terminología

Los términos no son universales. En EE. UU., «captions» suele referirse a la pista de accesibilidad (señales sonoras, identificación de hablantes) y «subtitles» a la pista de solo diálogo. En Reino Unido y gran parte de Europa, «subtitles» cubre ambos usos y «captions» casi no se usa. Las plataformas de streaming (Netflix, Disney+, Amazon Prime) agrupan ambos tipos bajo la palabra «subtítulos» en su interfaz, pero los tratan de forma diferente internamente.

Netflix, por ejemplo, usa el término SDH (Subtitles for the Deaf and Hard of Hearing, subtítulos para sordos y personas con discapacidad auditiva) para la pista de accesibilidad que incluye señales sonoras. Internamente, Netflix exige todos los archivos SDH y de subtítulos en formato TTML1 (.xml o .ttml), no SRT ni VTT, para su cadena de entrega. Ese es el contexto en el que la brecha terminológica causa problemas reales de producción.

Formatos de archivo: qué va donde

¿Qué formato de archivo debo usar para subtítulos accesibles y para subtítulos?

SRT es el más portable y funciona en YouTube, Vimeo, Facebook y la mayoría de reproductores de vídeo. VTT (WebVTT) añade estilos y posicionamiento para reproductores HTML5 y es el preferido para vídeo alojado en la web. TTML (y su perfil IMSC1.1) es obligatorio para la difusión profesional de broadcast y OTT, como Netflix. SCC se usa en flujos de trabajo de broadcast norteamericanos. Para la mayoría de creadores independientes y cursos online, genera primero SRT y convierte después según sea necesario.

FormatoIdeal paraPlataformas clave
SRTPortabilidad, la mayoría de plataformas onlineYouTube, Vimeo, Facebook, la mayoría de reproductores
VTT (WebVTT)Reproductores web HTML5, control de estilosVimeo, vídeo alojado en web, elemento track de HTML5
SCCFlujos de trabajo de broadcast norteamericanosBroadcast heredado y edición profesional
TTML / IMSC1.1Entrega OTT y streamingNetflix, broadcast, Disney+, Amazon Prime
TXT / DOCXTranscripciones para lecturaEntradas de blog, documentos, indexación en buscadores

La regla práctica: genera primero SRT para máxima portabilidad y convierte a TTML aguas abajo para entrega OTT profesional. SRT y VTT sirven tanto para el subtitulado accesible como para los subtítulos; el contenido determina de qué tipo se trata, no la extensión del archivo.

Para ver en profundidad qué contiene cada formato y cómo los interpretan los reproductores, consulta cómo crear un archivo SRT.

Pistas en el mismo idioma vs pistas traducidas

Un vídeo de YouTube en inglés puede tener una pista de subtítulos accesibles en inglés (accesibilidad, incluye señales sonoras) y una pista de subtítulos en español (diálogo traducido, sin señales sonoras). Mismo formato de archivo, contenido diferente:

  • Subtítulos accesibles en el mismo idioma: pista de accesibilidad con identificación de hablantes y señales sonoras.
  • Subtítulos en el mismo idioma: solo diálogo, a veces usados como apoyo de comprensión o en entornos ruidosos; no sustituyen a la accesibilidad.
  • Subtítulos accesibles traducidos (SDH en otro idioma): señales sonoras traducidas junto con el diálogo; obligatorios cuando el contenido está originalmente en un idioma y el público objetivo puede ser sordo o tener pérdida auditiva en ese idioma.
  • Subtítulos traducidos: diálogo traducido, sin señales sonoras; sirven para el acceso al idioma, no para la accesibilidad.

El flujo de transcripción produce el texto en el idioma original. La traducción es un paso posterior, aplicado ya sea a los subtítulos accesibles o a los subtítulos según la necesidad del público.

Cuándo necesitas cada uno

ObjetivoResultado adecuado
Entrada de blog a partir de una entrevista grabadaTranscripción (TXT o DOCX)
Notas de episodio de podcastTranscripción
Vídeo de YouTube: espectadores sordos o con pérdida auditivaSubtítulos cerrados en el mismo idioma (SRT o VTT)
Vídeo de YouTube: espectadores que no hablan inglésSubtítulos traducidos (SRT o VTT)
TikTok o Instagram ReelsSubtítulos abiertos incrustados en el vídeo
Acta de reunión en directo para el equipoTranscripción
Clase universitaria o curso onlineSubtítulos cerrados + transcripción aparte
Película para estreno internacionalSubtítulos traducidos por idioma
Vídeo de agencia federal o contratista (Sección 508)Subtítulos cerrados + transcripción descriptiva
Vídeo de cara al público (ADA Título II, EAA)Subtítulos cerrados (los subtítulos por sí solos no bastan)

Para la mayoría de creadores de contenido, la respuesta es «transcripción y subtítulos accesibles». Está bien así. Una sola pasada de transcripción puede producir ambos: exporta TXT para lectura y SRT para incrustar. El generador de subtítulos produce archivos SRT y VTT a partir de audio o vídeo en un solo paso.

Requisitos legales: lo que dice realmente la ley

¿Son suficientes los subtítulos generados automáticamente para cumplir la normativa de accesibilidad?

Normalmente no por sí solos. La FCC utiliza una precisión del 99 % en palabras como referente para los subtítulos de broadcast. Las directrices de la Sección 508 y de WCAG establecen que los subtítulos generados automáticamente son insuficientes salvo que se confirme su total exactitud, porque los errores que alteran el significado crean barreras de accesibilidad. Prevé una pasada de edición humana sobre el resultado automático antes de publicarlo si buscas cumplir la normativa.

Mi opinión: el panorama legal es más específico de lo que reconocen la mayoría de artículos, y las distinciones entre transcripción, subtitulado accesible y subtítulos son justo donde las organizaciones se equivocan.

WCAG (Web Content Accessibility Guidelines, Directrices de Accesibilidad para el Contenido Web):

  • SC 1.2.2 (Nivel A): subtítulos accesibles para audio pregrabado en medios sincronizados.
  • SC 1.2.4 (Nivel AA): subtítulos accesibles para audio en directo en medios sincronizados.
  • Las transcripciones por sí solas satisfacen el contenido solo de audio, pero no el vídeo con audio.
  • Los subtítulos no satisfacen ninguno de los dos requisitos.

ADA Título II (EE. UU.): La norma final de abril de 2024 del Departamento de Justicia (DOJ) estableció WCAG 2.1 Nivel AA como estándar de cumplimiento para las entidades públicas. El primer plazo venció el 24 de abril de 2026 para las entidades que prestan servicio a poblaciones de más de 50 000 habitantes.

Sección 508 (federal de EE. UU.): Los medios sincronizados requieren subtítulos accesibles (WCAG SC 1.2.2) además de audiodescripciones para el contenido visual significativo. Las transcripciones se exigen por separado para los medios solo de audio.

FCC (broadcast de EE. UU.): Los estándares de calidad adoptados en 2014 plantean la exactitud, la sincronización, la integridad del programa y la colocación de los subtítulos como los cuatro principios. El referente del sector es una precisión del 99 % en palabras. Los subtítulos generados automáticamente no se consideran suficientes sin una pasada de revisión humana.

Ley Europea de Accesibilidad (EAA): Entró en vigor el 28 de junio de 2025 y abarca a las empresas que operan en la UE o venden a residentes de la UE. El contenido audiovisual debe incluir subtítulos accesibles o subtítulos sincronizados que cumplan los estándares de calidad, con una velocidad de lectura de aproximadamente 160-180 palabras por minuto.

Para un análisis completo del cumplimiento del subtitulado accesible en distintas jurisdicciones, consulta cumplimiento WCAG con transcripciones y subtítulos de accesibilidad y cumplimiento ADA.

Esta sección está actualizada a mediados de 2026 y se ofrece solo con fines informativos generales, no como asesoramiento legal. Verifica los requisitos de tu jurisdicción y caso de uso concretos.

Qué hacer a continuación

Identifica primero tu entregable. Si el público lo lee, necesitas una transcripción. Si el público lo ve sin audio, necesitas subtítulos accesibles. Si el público lo ve pero no entiende el idioma hablado, necesitas subtítulos. Una misma pasada de transcripción produce los tres; elige la exportación y la pasada de edición adecuadas para cada uno.

Si necesitas generar un archivo de subtítulos accesibles o de subtítulos sin montar un flujo de trabajo completo, el generador de subtítulos de ConvertAudioToText procesa archivos de audio y vídeo y exporta directamente SRT o VTT.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles