Marcas de tiempo en transcripciones: cuándo y con qué nivel de detalle
transcripciónmarcas de tiemposubtítulos

Marcas de tiempo en transcripciones: cuándo y con qué nivel de detalle

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

No toda transcripción necesita marcas de tiempo. Las notas de lectura limpias no las requieren; las notas de episodio de podcast funcionan bien con anclas a nivel de párrafo; la evidencia de reuniones y la codificación cualitativa piden nivel de frase; los subtítulos exigen formato de rango de señales (SRT/VTT); los resaltados de karaoke y la sincronización de subtítulos necesitan nivel de palabra. Elige el nivel más ligero que cubra tu flujo de trabajo real.

The first question is not which granularity, but whether you need timestamps at all. A transcript for reading, sharing as notes, or feeding into a summarizer gains nothing from timestamp markers. They add visual noise and larger file size without value. Timestamps pay off in one situation: when you need to navigate back to a specific moment in the audio, or sync text to a video display.

Do You Need Timestamps at All?

Start here before picking a granularity.

Use caseTimestamps needed?
Meeting notes (for reading)No
Blog post derived from an interviewNo
AI summarization inputNo
Legal or HR evidenceYes
Podcast show notes with chapter linksYes
Video captionsYes
Editing a video by cutting transcriptYes
Qualitative research codingYes

If your use case lands in the "No" column, stop. Export plain text, skip the anchors, and keep the document clean.

The Four Granularities

When you do need timestamps, the right level is determined by what you will do with the result.

None

A clean paragraph transcript without any time markers. Right for reading, sharing, and text processing. Every downstream tool handles this format.

Paragraph-level

Timestamps appear once per paragraph or speaker turn.

[00:00:00] Speaker 1: Welcome back to the show. Today we're talking about pricing models for small businesses.

[00:00:18] Speaker 2: Thanks for having me. Pricing is one of those topics that...

Best for: podcast show notes, long-form reading, blog posts derived from interviews. The reader can find roughly where they are in the audio without a timestamp on every sentence cluttering the page.

Sentence-level

One timestamp per sentence.

[00:00:00] Welcome back to the show.
[00:00:03] Today we're talking about pricing models.
[00:00:09] Our guest has 20 years of experience.

Best for: búsquedas orientadas a la revisión, transcripciones de pruebas legales o de RR. HH., codificación cualitativa en entrevistas de investigación. Puedes navegar a cualquier frase para verificar exactamente lo que se dijo. Cuando tengas dudas, el nivel de frase es la opción segura por defecto: siempre puedes quitar las marcas de tiempo para la visualización y mantenerlas en el archivo fuente.

Nivel de palabra

Una marca de tiempo en cada token.

[00:00:00.020] Welcome [00:00:00.380] back [00:00:00.640] to [00:00:00.780] the [00:00:00.880] show.

Best for: edición de vídeo de precisión, resaltado de palabras al estilo karaoke, creación de un índice de audio buscable, datos de entrenamiento para ML. Las marcas de tiempo a nivel de palabra también te permiten recortar una cita concreta de una grabación larga sin tener que buscar manualmente en el audio.

Una nota sobre precisión: no todas las marcas de tiempo de palabra son iguales. APIs como Deepgram devuelven marcas de tiempo nativas a nivel de palabra sin un paso de alineación adicional. Las salidas nativas de Whisper generan marcas de tiempo a nivel de segmento (normalmente bloques de 5 a 30 segundos) e interpolan las posiciones de las palabras dentro de cada segmento, lo que significa que los errores se acumulan en archivos largos. Herramientas de alineación forzada como WhisperX ejecutan un segundo paso de alineación fonémica después de la transcripción y llevan la precisión de las palabras a menos de 100 ms en audio limpio. Si la precisión de las palabras importa para tu flujo de trabajo, comprueba cómo produce esas marcas de tiempo tu herramienta.

Nivel de pista de subtítulos

Marcas de tiempo de inicio y fin en rangos de pista, normalmente de 1 a 7 segundos por pista, ajustadas para su visualización en pantalla.

1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.

2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models.

Este es el formato SRT y VTT. Está diseñado específicamente para renderizar vídeo, no para leer. El artículo sobre formatos de exportación SRT, VTT y TXT cubre los detalles de formato en profundidad, pero la regla que debes recordar es: las pistas SRT se limitan a unas 2 líneas y 42 caracteres por línea para cumplir con las directrices de las plataformas (Netflix, YouTube, emisión). Las palabras se agrupan en pistas mediante la herramienta de transcripción; no debes escribir las pistas a mano.

Timestamp granularity is an export decision, not a recording one
Timestamp granularity is an export decision, not a recording one

Tabla de referencia por caso de uso

Caso de usoNivel de marca temporal adecuado
Leer la transcripción como un artículoNinguno
Resumen con IA o extracción de temasNinguno
Notas del programa de un podcastPárrafo
Actas de reunionesFrase o párrafo
Registros de pruebas judiciales o de RR. HH.Frase
Entrevistas de investigación (codificación cualitativa)Frase
Subtítulos de vídeo (YouTube, TikTok, Reels)Pista de subtítulos (SRT/VTT)
Resaltado de palabras al estilo karaokePalabra
Crear un índice de búsqueda de vídeo o audioPalabra
Montar un reel de momentos destacados desde la transcripciónPalabra
Datos de entrenamiento para MLPalabra

Convenciones de formato

Existen tres formatos habituales, y mezclarlos es una fuente recurrente de errores:

  • HH:MM:SS (por ejemplo, 00:01:30). Sencillo, se usa en la mayoría de transcripciones por párrafos y frases.
  • HH:MM:SS,mmm con coma (por ejemplo, 00:01:30,500). Es la convención de SRT. Según la especificación del formato SRT, la coma es obligatoria.
  • HH:MM:SS.mmm con punto (por ejemplo, 00:01:30.500). La especificación W3C WebVTT usa un punto (U+002E FULL STOP) como separador fraccionario. Este es también el formato que devuelven la mayoría de las API JSON.

Si un archivo pasa por varias herramientas (exportación de un servicio de transcripción, importación en un editor de vídeo, subida a una plataforma), normaliza el separador decimal en el primer paso. Las librerías que esperan una forma concreta fallarán en silencio o lanzarán un error de análisis con la otra.

De dónde salen las marcas temporales

En la transcripción con IA, las marcas temporales provienen del modelo de reconocimiento de voz. La distinción clave es si el modelo emite marcas temporales por palabra de forma nativa o las deriva de datos a nivel de segmento.

  • Marcas de tiempo nativas por palabra (Deepgram y APIs de streaming similares): el modelo devuelve una tupla (palabra, hora_inicio, hora_fin) para cada token directamente.
  • Interpoladas por segmento (Whisper nativo): el modelo genera límites de segmento e infiere las posiciones de las palabras, lo que puede desviarse cientos de milisegundos en grabaciones largas.
  • Alineación forzada posterior (WhisperX, aeneas, Montreal Forced Aligner): una pasada separada de alineación fonética mapea las palabras al audio después de la transcripción, logrando una precisión inferior a 100 ms.

Las marcas de tiempo a nivel de frase y párrafo siempre se agregan a partir de los datos de nivel de palabra: la herramienta agrupa las palabras según la puntuación y las pausas por turnos de hablante.

En la transcripción humana, las marcas de tiempo se insertan manualmente con una tecla de acceso rápido. El nivel de párrafo es habitual; el de frase es más lento y cuesta más; el de palabra prácticamente nunca se hace a mano.

Peculiaridades Comunes de Edición

Desviación en archivos largos

Con herramientas que usan marcas de tiempo interpoladas por palabra, una grabación de 3 horas puede mostrar marcas desfasadas uno o más segundos hacia el final del archivo. La solución es un pipeline que reancla en los límites de silencio, o usar una API que emita marcas nativas a nivel de palabra desde el principio. Si ves desviación de forma constante, comprueba qué método de marcas usa tu herramienta.

Tiempo de la puntuación

La mayoría de las herramientas asignan la coma o el punto a la palabra anterior, así que la marca de tiempo corresponde al final de esa palabra. Esto es correcto para la lectura, pero puede causar un error de desfase si cortas el audio programáticamente en los límites de puntuación. Añade un pequeño margen (50-100 ms) al hacer cortes automáticos en la puntuación.

Límites de turno de hablante

Cuando el hablante 1 se detiene y el hablante 2 empieza, la marca de tiempo en la primera palabra del hablante 2 indica cuándo comienza realmente su discurso, no el inicio de la pausa. Para clips de evidencia o extracción de citas, inicia el clip aproximadamente medio segundo antes de la etiqueta del hablante para incluir el contexto natural.

Alineación de velocidad de fotogramas

Para trabajo con video, las marcas de tiempo deben alinearse con la velocidad de fotogramas (24, 25, 30 o 60 fps). Una marca como 00:01:30.123 no corresponde exactamente a un fotograma a 30 fps. La mayoría de los editores de video redondean al fotograma más cercano, lo que suele ser suficiente, pero ten en cuenta que "hacer clic para buscar" en un editor puede caer un fotograma fuera del punto de corte deseado.

Edición Manteniendo las Marcas de Tiempo Intactas

La parte más difícil de trabajar con transcripciones con marcas de tiempo es editar texto sin romper los anclajes temporales. Tres enfoques:

  1. Usar un editor que mantenga la alineación. Las herramientas de transcripción dedicadas (Otter, Descript y otras, según la documentación del proveedor) desplazan automáticamente las marcas de tiempo cuando eliminas o insertas palabras.
  2. Editar el texto y realinear mediante alineación forzada. Ejecuta aeneas o Montreal Forced Aligner sobre el texto editado contra el audio original. Es preciso, pero añade un paso de procesamiento.
  3. Editar el texto y aceptar una pequeña deriva. Para marcas de tiempo a nivel de párrafo, las ediciones menores rara vez mueven los anclajes lo suficiente como para importar. Aceptable para notas del programa; no aceptable para transcripciones legales.

Para ediciones intensas (recortar la mitad del contenido para un reel de destacados), usa un editor que tenga en cuenta la línea de tiempo. Realinear manualmente marcas de tiempo a nivel de palabra después de recortes grandes no es práctico.

Flujo de Trabajo: Notas del Programa con Marcadores de Capítulo

Un flujo de trabajo común para podcasters:

  1. Transcribe el episodio con marcas de tiempo a nivel de frase.
  2. Revisa la transcripción y elige de 5 a 10 transiciones de tema (por ejemplo, "Cómo fundaron la empresa", "El error de precios").
  3. Usa las marcas de tiempo para escribir marcadores de capítulo: tramas ID3v2 CHAP en archivos MP3, átomos chpl de MP4 en archivos M4A, o el formato JSON de capítulos de Podcasting Index en el feed RSS.
  4. Publica las notas del programa con marcas de tiempo como enlaces de anclaje a la página de la transcripción.

Para un punto de partida limpio, la herramienta /tools/audio-to-text en ConvertAudioToText produce una transcripción a nivel de frase que puedes usar para el paso 1 sin necesidad de registrarte.

Flujo de Trabajo: Subtítulos para Video

Para YouTube, TikTok, Instagram Reels y plataformas de difusión:

  1. Transcribe el vídeo con marcas de tiempo a nivel de palabra.
  2. Agrupa las palabras en subtítulos dentro de la ventana de 1 a 7 segundos, respetando el límite de 42 caracteres por línea.
  3. Exporta en SRT (coma decimal) para una compatibilidad amplia, o VTT (punto decimal) para reproductores web.
  4. Sube el archivo a la plataforma.

Consulta formatos SRT vs VTT vs TTML para ver una comparativa lado a lado sobre cuándo cada formato es obligatorio u opcional.

FAQ

¿Necesito siempre marcas de tiempo en una transcripción?

No. Si planeas leer la transcripción como documento, compartirla como notas de reunión o pasarla a un resumidor, las marcas de tiempo añaden ruido visual sin beneficio. Importan cuando necesitas volver al audio o sincronizar el texto con el vídeo.

¿Cuál es la diferencia entre los formatos de marca de tiempo SRT y VTT?

SRT usa coma como separador decimal (00:01:30,500) mientras que VTT usa punto (00:01:30.500). Ambos representan milisegundos. La distinción importa cuando las herramientas procesan archivos de forma programática: algunas librerías rechazan la coma, otras rechazan el punto. Normaliza al principio si mueves archivos entre herramientas.

¿Por qué las marcas de tiempo a nivel de palabra se desvían en grabaciones largas?

Whisper nativo emite marcas de tiempo a nivel de segmento (normalmente bloques de 5 a 30 segundos) e interpola las posiciones de las palabras dentro de cada bloque. Los pequeños errores se acumulan entre bloques, produciendo una desviación de cientos de milisegundos al final de un archivo largo. Herramientas de alineación forzada como WhisperX reanclan las palabras a los fonemas del audio tras la transcripción, logrando precisión por debajo de 100 ms. APIs como Deepgram emiten marcas de tiempo nativas a nivel de palabra sin paso de interpolación.

¿Cómo edito una transcripción sin romper las marcas de tiempo?

Usa un editor que mantenga la alineación (la mayoría de las herramientas específicas para transcripciones lo hacen). Para ediciones ligeras a nivel de párrafo, los cambios pequeños de texto rara vez desplazan los anclajes de tiempo lo suficiente como para que importe. Para cortes grandes, usa un editor con línea de tiempo en lugar de un editor de texto plano, porque realinear manualmente las marcas de tiempo a nivel de palabra después de ediciones extensas es muy lento.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles