
Formatos de exportación de transcripciones: TXT, SRT, VTT, JSON
Summarize this article with:
Cada formato de exportación de transcripciones tiene un único caso de uso ideal: SRT para plataformas de vídeo, VTT para reproductores web HTML5, TXT para entradas de blog y notas del episodio, DOCX para clientes y trabajo jurídico, JSON para desarrolladores que construyen sobre una transcripción, y PDF para entregables de diseño fijo. Elige según lo que necesite el destinatario final, no según lo que parezca más completo. Netflix exige TTML, no SRT, así que revisa los requisitos de la plataforma antes de dar por hecho que se aceptará un formato de subtítulos.
Una transcripción terminada puede entregarse en media docena de formatos, y el adecuado depende por completo de lo que venga después. ¿Incrustarla en un reproductor de vídeo? Usa SRT o VTT. ¿Publicarla en una entrada de blog? TXT o DOCX. ¿Introducirla en otra herramienta? JSON. Esta referencia cubre qué contiene realmente cada formato, dónde se utiliza y las peculiaridades que pillan desprevenidos a la gente.
TXT: el valor predeterminado en texto plano
El formato más simple. Solo palabras, opcionalmente con etiquetas de hablante y marcas de tiempo por párrafo.
[00:00:00] Speaker 1: Welcome back to the show. Today we're talking about pricing.
[00:00:18] Speaker 2: Thanks for having me. Pricing is one of those topics...
TXT es el camino más rápido del audio al texto legible. No necesita ningún reproductor ni biblioteca especial. Copia y pega en cualquier editor, CMS o cliente de correo electrónico.
Lo que TXT sacrifica:
- Sin temporización fina para sincronizar con vídeo.
- Sin estructura legible por máquina (todo es una cadena de texto).
- Distintas herramientas producen diseños ligeramente diferentes, algo que importa en el procesamiento por lotes.
Usa TXT para entradas de blog, notas del episodio, actas de reuniones, cualquier contexto donde el archivo lo leerán personas. Para profundizar en cuándo merece la pena este compromiso, consulta servicios de transcripción gratuitos vs. de pago.
DOCX: TXT con formato
Formato de Microsoft Word. Mismo contenido que TXT pero con encabezados con estilo, nombres de hablante en negrita y, a veces, una cabecera con metadatos (nombre del archivo, fecha, duración).
DOCX es el entregable estándar de los servicios de transcripción humana. Los taquígrafos judiciales, los transcriptores jurídicos y las empresas de transcripción académica casi siempre envían DOCX. Es el formato que la mayoría de los clientes no técnicos esperan abrir.
Para las herramientas de IA, DOCX es simplemente TXT con estilo. La precisión y el contenido son idénticos; el archivo solo se ve mejor en Word. Si el destinatario va a editar el texto, DOCX es mejor que PDF porque las funciones de control de cambios y comentarios de Word funcionan correctamente.
SRT: el formato universal de subtítulos
SubRip Subtitle. El formato de subtítulos más ampliamente soportado de uso común. YouTube, Vimeo, Premiere, Final Cut y DaVinci Resolve aceptan todos SRT.
Formato:
1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.
2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models for small businesses.
Cada subtítulo tiene cuatro partes:
- Número de subtítulo (1, 2, 3, ...).
- Hora de inicio --> Hora de fin en formato HH:MM:SS,mmm (fíjate en la coma decimal, no en un punto).
- Texto (una o varias líneas).
- Línea en blanco para separar los subtítulos.
Peculiaridades de SRT:
- Coma decimal, no punto.
00:00:03,500, no00:00:03.500. Este es el error de sintaxis de SRT más común. Muchos analizadores rechazarán un archivo que use punto en su lugar. - La especificación no incluye etiquetas de hablante. La mayoría de herramientas incrustan las etiquetas de hablante en el texto como
Speaker 1: Welcome back. Algunos reproductores lo muestran en línea; otros pueden eliminarlo. - Los saltos de línea importan. La mayoría de reproductores muestran de 1 a 2 líneas por subtítulo. Los subtítulos de tres líneas pueden cortarse u ocultar más vídeo del previsto.
- Límites de caracteres por línea. La convención es de 32 a 42 caracteres por línea para facilitar la lectura en pantallas pequeñas.
- Duración del subtítulo. Lo habitual son de 2 a 7 segundos por subtítulo. Los subtítulos de una sola palabra resultan entrecortados; los de más de 7 segundos exigen demasiada velocidad de lectura.
Una plataforma que NO acepta SRT para entregas profesionales es Netflix. Netflix exige TTML1 (con extensión .xml o .ttml) para la entrega de subtítulos. SRT, VTT y SCC no se aceptan en las entregas de Netflix sin una excepción explícita de un representante de Netflix. Es un malentendido frecuente.
Usa SRT para subir vídeos a YouTube, importarlos a editores de vídeo y para la mayoría de plataformas de vídeo de consumo.

VTT: el primo nativo web de SRT
WebVTT. El estándar HTML5 para subtítulos en el navegador, definido en la especificación del W3C. Funcionalmente similar a SRT pero con diferencias notables en estructura y capacidades.
Formato:
WEBVTT
00:00:00.000 --> 00:00:03.500
Welcome back to the show.
00:00:03.500 --> 00:00:09.200
Today we're talking about pricing models for small businesses.
Diferencias clave respecto a SRT:
- Punto decimal, no coma.
00:00:03.500. Lo contrario de SRT. Es la fuente de confusión más frecuente al convertir entre ambos. - Cabecera
WEBVTTobligatoria. El archivo debe comenzar con la cadena «WEBVTT» seguida de dos o más saltos de línea. Sin ella, el archivo no es un VTT válido. - Los identificadores de subtítulo son opcionales. A diferencia de SRT, donde los números de subtítulo son convencionales (si no estrictamente obligatorios), VTT no los exige.
- Compatible con etiquetas de voz.
<v Speaker 1>Welcome back.</v>es la forma correcta definida por el W3C de etiquetar hablantes. Los reproductores pueden dar estilo a cada voz de forma distinta mediante pseudoelementos CSS. - Compatible con estilos. Las etiquetas tipo HTML para cursiva, negrita y color funcionan dentro de los subtítulos.
- Compatible con ajustes de subtítulo. Posición, alineación y texto vertical pueden especificarse por subtítulo.
VTT es lo que espera el elemento <track> de HTML5. Si estás incrustando subtítulos en un sitio web usando el elemento de vídeo nativo, VTT es el formato que el navegador entiende de forma nativa. YouTube acepta VTT pero recomienda SRT a los creadores nuevos.
Para una comparación más profunda de estos dos formatos más TTML, consulta SRT vs. VTT vs. TTML.
TTML: el estándar de radiodifusión
Timed Text Markup Language. El formato basado en XML del W3C que exigen los radiodifusores profesionales y las plataformas de streaming. También conocido como DFXP (Distribution Format Exchange Profile), que es un perfil específico de TTML.
TTML admite estilos complejos, posicionamiento preciso en pantalla, metadatos de accesibilidad (marcadores SDH, identificación de hablantes) y varias pistas de idioma dentro de un mismo archivo. Netflix exige TTML1 para todos los idiomas; BBC iPlayer y Hulu también lo exigen para entregas profesionales.
Para la mayoría de creadores que suben contenido a YouTube o lo incrustan en su propio sitio, TTML no es necesario. Importa cuando entregas contenido a un socio de radiodifusión o a una plataforma con una especificación formal de entrega. YouTube sí acepta TTML y DFXP, pero SRT o VTT cubren la mayoría de flujos de trabajo de los creadores.
JSON: el formato legible por máquina
Para los desarrolladores, JSON es la exportación sin pérdidas. Todo lo que sabe el motor de transcripción, estructurado y consultable.
{
"transcript": "Welcome back to the show...",
"words": [
{"word": "Welcome", "start": 0.020, "end": 0.380, "confidence": 0.998, "speaker": 0},
{"word": "back", "start": 0.380, "end": 0.640, "confidence": 0.997, "speaker": 0}
],
"utterances": [
{"speaker": 0, "text": "Welcome back to the show.", "start": 0.020, "end": 1.880}
],
"metadata": {
"duration": 1845.2,
"language": "en",
"model": "whisper-large-v3"
}
}
JSON contiene lo que SRT y TXT no pueden llevar: marcas de tiempo a nivel de palabra, puntuaciones de confianza por palabra, asignación de hablantes, agrupaciones de intervenciones y metadatos del modelo. Los campos opcionales de motores con IA incluyen temas, sentimientos y resúmenes.
Usa JSON cuando construyas cualquier cosa sobre una transcripción: reproductores de vídeo personalizados, índices de búsqueda, pipelines de IA o análisis de datos. El formato es verboso pero sin pérdidas. Si tu servicio de transcripción guarda el JSON, puedes reexportar a SRT o TXT más adelante sin volver a pasar el audio por el motor.
PDF: el entregable pulido
Las transcripciones en PDF se generan exportando DOCX a PDF. Tienen un aspecto profesional, fijan el formato y son el entregable esperado por muchos clientes jurídicos y académicos.
Usa PDF para:
- Escritos jurídicos y presentaciones judiciales.
- Entregables de investigación académica.
- Informes para clientes donde importa un diseño fijo.
- Archivo (suponiendo que el texto está incrustado, no escaneado).
No uses PDF si:
- El destinatario va a editar el texto. Editar PDF es lento y propenso a errores; dale DOCX en su lugar.
- El destinatario va a introducirlo en otra herramienta. JSON o TXT son más compatibles.
Cuándo usar cada formato
| Caso de uso | Formato adecuado |
|---|---|
| Notas del episodio de un podcast | TXT |
| Entrada de blog a partir de una entrevista | TXT o DOCX |
| Subtítulos de vídeo de YouTube | SRT |
| Vídeo HTML5 en tu sitio web | VTT |
| TikTok o Instagram Reel | SRT |
| Entrega para Netflix | TTML (según especificación de entrega) |
| Entregable jurídico o judicial | DOCX o PDF |
| Datos de investigación académica | JSON + TXT |
| Crear un índice de búsqueda | JSON |
| Pipeline personalizado de NLP o IA | JSON |
| El cliente quiere editar el contenido | DOCX |
| Correo a un colega | TXT |
| Archivo con diseño fijo |
Ante la duda, exporta tanto TXT como SRT. Son archivos pequeños; tener ambos te da opciones para flujos de trabajo de vídeo y de texto sin volver a ejecutar la transcripción.
Duración de los subtítulos y saltos de línea
Este es el tema que muerde a quienes subtitulan por primera vez. Los ajustes predeterminados de muchas herramientas producen archivos SRT o VTT con subtítulos demasiado largos, demasiado cortos o que se ajustan de forma torpe en pantallas pequeñas. En especial para decisiones de temporización, consulta cuándo usar marcas de tiempo en la transcripción.
Buenas prácticas:
- Duración del subtítulo: de 2 a 6 segundos. Los subtítulos de una sola palabra resultan entrecortados; los de más de 7 segundos elevan demasiado la velocidad de lectura.
- Caracteres por línea: de 32 a 42 es la convención. Por encima de 42, la línea se ajusta mal en móvil.
- Líneas por subtítulo: 2 como máximo. Los subtítulos de tres líneas cubren demasiado vídeo.
- Palabras por minuto: apunta a una velocidad de lectura de 160-180 ppm, ajustando la duración del subtítulo al ritmo del hablante.
La mayoría de herramientas modernas producen valores predeterminados razonables. Si los subtítulos salen mal, busca un ajuste de «longitud de línea» o «velocidad de lectura» antes de editar manualmente.
Conversión entre formatos
Pasar de un formato a otro es casi siempre gratis, pero no siempre sin pérdidas:
- TXT hacia/desde DOCX: Word gestiona ambos de forma nativa. No se pierde información.
- SRT hacia/desde VTT: Transformación de texto trivial: cambiar comas por puntos (o al revés), añadir o quitar la cabecera WEBVTT. Una sola línea con cualquier lenguaje de scripting.
- JSON a TXT/SRT/VTT: La mayoría de herramientas de transcripción lo hacen automáticamente. JSON es la fuente de verdad; todos los demás formatos se derivan de él.
- TXT a SRT/VTT: Requiere realinear el texto con el audio, lo cual necesita los datos de temporización originales. Imposible sin el audio o el JSON original.
- PDF a cualquier otro: Fiable solo cuando el PDF se generó a partir de texto. Los PDF escaneados requieren OCR y pierden el formato.
Si usas ConvertAudioToText, exporta TXT, SRT, VTT, JSON y DOCX desde un único trabajo de transcripción, así que solo tendrás que volver a ejecutar el motor si cambias ajustes como el idioma o el número de hablantes. También puedes generar archivos de subtítulos directamente en la herramienta generadora de subtítulos.
Preguntas frecuentes
¿Cuál es la diferencia entre SRT y VTT?
Ambos son formatos de subtítulos temporizados con una estructura casi idéntica. SRT usa una coma como separador decimal en las marcas de tiempo (00:00:03,500) y requiere números de subtítulo. VTT usa un punto (00:00:03.500), hace opcionales los números de subtítulo, exige una cabecera WEBVTT al inicio del archivo y añade compatibilidad con etiquetas de voz, estilos CSS y posicionamiento en pantalla. SRT funciona en más plataformas de forma predeterminada; VTT es el formato nativo de los elementos de vídeo HTML5.
¿Qué formato debo usar para YouTube?
SRT es la opción práctica predeterminada para YouTube. YouTube también acepta VTT, SBV, TTML y varios formatos de radiodifusión, pero SRT es el formato que la propia documentación de ayuda de YouTube recomienda a los creadores que empiezan con los subtítulos. Está ampliamente soportado por las herramientas de exportación y no requiere ninguna configuración especial.
¿Acepta Netflix archivos SRT?
No, no para entregas profesionales. Netflix exige TTML1 (con extensión .xml o .ttml) para los archivos de subtítulos. SRT, VTT y SCC no se aceptan sin una excepción explícita de un representante de Netflix. Si vas a entregar contenido a Netflix, consulta el Netflix Partner Help Center para conocer la especificación TTML vigente.
¿Qué contiene una transcripción JSON que no contengan SRT ni TXT?
JSON incluye marcas de tiempo a nivel de palabra, puntuaciones de confianza por palabra, asignación de hablantes, agrupaciones de intervenciones y metadatos del modelo. SRT solo lleva bloques de texto temporizados sin detalle a nivel de palabra. TXT solo lleva las palabras, con etiquetas de hablante opcionales y marcas de tiempo por párrafo. Si necesitas crear búsquedas, ejecutar análisis de NLP o alimentar un reproductor personalizado, JSON es el único formato que contiene todos los datos.
¿Puedo convertir entre formatos de transcripción sin volver a ejecutar la transcripción?
Para la mayoría de conversiones, sí. SRT, VTT, TXT y DOCX pueden regenerarse todos desde el JSON original sin volver a tocar el audio, siempre que tu servicio de transcripción haya guardado el JSON. La conversión que no puede hacerse a la inversa es de TXT a SRT o VTT: sin datos de temporización a nivel de palabra, no hay forma de colocar las marcas de tiempo con precisión.
Fuentes
- Especificación WebVTT del W3C: https://www.w3.org/TR/webvtt1/
- Guía de estilo de Timed Text de Netflix (Requisitos generales): https://partnerhelp.netflixstudios.com/hc/en-us/articles/215758617-Timed-Text-Style-Guide-General-Requirements
- Perfil de texto IMSC 1.1 de Netflix: https://partnerhelp.netflixstudios.com/hc/en-us/articles/360053755033-Netflix-IMSC-1-1-Text-Profile
- Archivos de subtítulos y closed captions admitidos por YouTube: https://support.google.com/youtube/answer/2734698
- Documentación de la API WebVTT en MDN: https://developer.mozilla.org/en-US/docs/Web/API/WebVTT_API/Web_Video_Text_Tracks_Format
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Subtitle Translation for Video: The Reliable Path
Translate existing subtitles the reliable way: machine pass plus review, length expansion handling, and timing re-fit.

How to Create an SRT File: Format, Rules, Examples
Learn the exact SRT file format: index, timecodes, text blocks, blank lines. Plus encoding gotchas, hand-writing tips, and when to auto-generate instead.