Horodatages dans la transcription : quand et à quel niveau de précision
transcriptionhorodatagessous-titres

Horodatages dans la transcription : quand et à quel niveau de précision

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

Toutes les transcriptions n'ont pas besoin d'horodatages. Des notes de lecture propres n'en exigent aucun ; les notes d'épisode de podcast fonctionnent très bien avec des ancres au niveau du paragraphe ; les preuves de réunion et le codage qualitatif appellent un niveau phrase ; les sous-titres nécessitent un format par réplique (SRT/VTT) ; les surlignages karaoké et la synchronisation des légendes demandent un niveau mot. Choisissez le niveau le plus léger qui couvre votre flux de travail réel.

La première question n'est pas de savoir quel niveau de granularité choisir, mais si vous avez besoin de timestamps du tout. Un transcript destiné à la lecture, au partage sous forme de notes, ou à l'alimentation d'un outil de résumé ne gagne rien à contenir des marqueurs temporels. Ils ajoutent du bruit visuel et alourdissent le fichier sans apporter de valeur. Les timestamps sont utiles dans un seul cas : quand vous devez revenir à un moment précis de l'audio, ou synchroniser le texte avec un affichage vidéo.

Avez-vous vraiment besoin de timestamps ?

Commencez par là avant de choisir une granularité.

Cas d'usageTimestamps nécessaires ?
Notes de réunion (pour lecture)Non
Article de blog tiré d'un entretienNon
Entrée pour résumé IANon
Preuve juridique ou RHOui
Notes d'épisode de podcast avec liens de chapitresOui
Sous-titres vidéoOui
Montage vidéo en coupant le transcriptOui
Codage pour recherche qualitativeOui

Si votre cas d'usage tombe dans la colonne « Non », arrêtez-vous là. Exportez en texte brut, oubliez les ancres, et gardez le document propre.

Les quatre niveaux de granularité

Quand vous avez besoin de timestamps, le bon niveau dépend de ce que vous comptez faire du résultat.

Aucun

Un transcript en paragraphes propres, sans aucun marqueur temporel. Idéal pour la lecture, le partage et le traitement de texte. Tous les outils en aval gèrent ce format.

Niveau paragraphe

Un timestamp par paragraphe ou par tour de parole.

[00:00:00] Intervenant 1 : Bon retour sur le plateau. Aujourd'hui, on parle des modèles de tarification pour les petites entreprises.

[00:00:18] Intervenant 2 : Merci de m'accueillir. La tarification, c'est un sujet qui...

Idéal pour : les notes d'épisode de podcast, la lecture longue, les articles de blog issus d'entretiens. Le lecteur peut situer approximativement sa position dans l'audio sans que chaque phrase ne vienne encombrer la page.

Niveau phrase

Un timestamp par phrase.

[00:00:00] Bon retour sur le plateau.
[00:00:03] Aujourd'hui, on parle des modèles de tarification.
[00:00:09] Notre invité a 20 ans d'expérience.

Idéal pour : les revues orientées recherche, les transcriptions de preuves juridiques ou RH, le codage qualitatif d'entretiens de recherche. Vous pouvez naviguer jusqu'à n'importe quelle phrase pour vérifier exactement ce qui a été dit. En cas de doute, le niveau phrase est le choix sûr par défaut : vous pouvez toujours retirer les horodatages pour l'affichage et les conserver dans le fichier source.

Niveau mot

Un horodatage sur chaque token.

[00:00:00.020] Welcome [00:00:00.380] back [00:00:00.640] to [00:00:00.780] the [00:00:00.880] show.

Idéal pour : le montage vidéo de précision, le surlignage de mots façon karaoké, la construction d'un index audio consultable, les données d'entraînement ML. Les horodatages au niveau mot permettent aussi d'extraire une citation précise d'un long enregistrement sans avoir à parcourir manuellement l'audio.

Une précision importante : tous les horodatages au niveau mot ne se valent pas. Des API comme Deepgram renvoient des horodatages natifs au niveau mot sans étape d'alignement séparée. Whisper en version native produit des horodatages au niveau segment (généralement des blocs de 5 à 30 secondes) et interpole les positions des mots dans chaque segment, ce qui entraîne une accumulation d'erreurs sur les fichiers longs. Les outils d'alignement forcé comme WhisperX exécutent une seconde passe d'alignement phonémique après la transcription et ramènent la précision des mots sous les 100 ms sur un audio propre. Si la précision au niveau mot compte pour votre flux de travail, vérifiez comment votre outil génère ces horodatages.

Niveau réplique de sous-titres

Horodatages de début et de fin dans des plages de répliques, généralement de 1 à 7 secondes par réplique, calibrés pour l'affichage à l'écran.

1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.

2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models.

C'est le format SRT et VTT. Il est conçu pour le rendu vidéo, pas pour la lecture. L'article sur les formats d'export SRT, VTT et TXT détaille les spécificités de ces formats, mais une règle à retenir : les répliques SRT sont limitées à environ 2 lignes et 42 caractères par ligne pour rester dans les directives des plateformes (Netflix, YouTube, diffusion TV). Les mots sont regroupés en répliques par l'outil de transcription ; vous ne devez pas écrire les répliques à la main.

La granularité des horodatages est une décision d'export, pas d'enregistrement
La granularité des horodatages est une décision d'export, pas d'enregistrement

Tableau de référence par cas d'usage

Cas d'usageNiveau d'horodatage adapté
Lire la transcription comme un articleAucun
Résumé IA ou extraction de sujetsAucun
Notes d'épisode de podcastParagraphe
Comptes rendus de réunionPhrase ou paragraphe
Registres de preuves judiciaires ou RHPhrase
Entretiens de recherche (codage qualitatif)Phrase
Sous-titres vidéo (YouTube, TikTok, Reels)Réplique (SRT/VTT)
Surlignage de mots façon karaokéMot
Index de recherche vidéo ou audioMot
Montage d'un best-of à partir de la transcriptionMot
Données d'entraînement MLMot

Conventions de format

Trois formats courants existent, et les mélanger est une source récurrente de bugs :

  • HH:MM:SS (par ex. 00:01:30). Simple, utilisé dans la plupart des transcriptions par paragraphe ou par phrase.
  • HH:MM:SS,mmm avec une virgule (par ex. 00:01:30,500). La convention SRT. Selon la spécification du format SRT, la virgule est obligatoire.
  • HH:MM:SS.mmm avec un point (par ex. 00:01:30.500). La spécification W3C WebVTT utilise un point (U+002E FULL STOP) comme séparateur décimal. C'est aussi le format renvoyé par la plupart des API JSON.

Si un fichier passe par plusieurs outils (export depuis un service de transcription, import dans un éditeur vidéo, téléversement sur une plateforme), normalisez le séparateur décimal dès la première étape. Les bibliothèques qui attendent une forme précise échoueront silencieusement ou lèveront une erreur d'analyse sur l'autre.

D'où viennent les horodatages

En transcription IA, les horodatages proviennent du modèle de reconnaissance vocale. La distinction clé est de savoir si le modèle émet des horodatages par mot nativement ou s'il les dérive à partir de données au niveau du segment :

  • Horodatage natif par mot (Deepgram et autres API de streaming) : le modèle renvoie directement un tuple (mot, heure_de_début, heure_de_fin) pour chaque token.
  • Interpolation par segments (Whisper natif) : le modèle produit des limites de segments et déduit les positions des mots, ce qui peut dériver de plusieurs centaines de millisecondes sur de longs enregistrements.
  • Alignement forcé a posteriori (WhisperX, aeneas, Montreal Forced Aligner) : une passe distincte d'alignement phonème-mot fait correspondre les mots à l'audio après la transcription, atteignant une précision inférieure à 100 ms.

Les horodatages au niveau de la phrase et du paragraphe sont toujours agrégés à partir des données au niveau du mot : l'outil regroupe les mots selon la ponctuation et les pauses entre tours de parole.

En transcription humaine, les horodatages sont insérés manuellement via un raccourci clavier. Le niveau paragraphe est courant ; le niveau phrase est plus lent et plus coûteux ; le niveau mot n'est pratiquement jamais fait à la main.

Particularités d'édition courantes

Dérive sur les fichiers longs

Avec les outils qui utilisent des horodatages interpolés par mot, un enregistrement de 3 heures peut afficher des horodatages décalés d'une seconde ou plus en fin de fichier. La solution est un pipeline qui ré-ancre aux frontières de silence, ou l'utilisation d'une API qui émet des horodatages natifs au niveau du mot dès le départ. Si vous observez une dérive constante, vérifiez quelle méthode d'horodatage votre outil utilise.

Timing de la ponctuation

La plupart des outils rattachent une virgule ou un point au mot précédent, donc l'horodatage correspond à la fin de ce mot. C'est correct pour la lecture, mais cela peut créer un décalage d'un cran si vous découpez l'audio par programmation aux frontières de ponctuation. Ajoutez une petite marge (50-100 ms) lors du découpage automatique à la ponctuation.

Frontières de tours de parole

Quand le locuteur 1 s'arrête et que le locuteur 2 commence, l'horodatage du premier mot du locuteur 2 marque le début réel de sa parole, pas le début de la pause. Pour des extraits de preuve ou des citations, commencez le clip environ une demi-seconde avant l'étiquette du locuteur afin d'inclure le contexte naturel.

Alignement de la cadence d'images

Pour le travail vidéo, les horodatages doivent correspondre à la fréquence d'images (24, 25, 30 ou 60 fps). Un horodatage comme 00:01:30.123 ne correspond pas exactement à une image à 30 fps. La plupart des éditeurs vidéo arrondissent à l'image la plus proche, ce qui est généralement acceptable, mais sachez que le « clic pour rechercher » dans un éditeur peut atterrir une image à côté du point de coupe prévu.

Édition tout en préservant les horodatages

La partie la plus délicate du travail avec des transcriptions horodatées est de modifier le texte sans casser les ancres temporelles. Trois approches :

  1. Utiliser un éditeur qui maintient l'alignement. Les outils de transcription dédiés (Otter, Descript, et autres, selon la documentation des fournisseurs) décalent automatiquement les horodatages lorsque vous supprimez ou insérez des mots.
  2. Modifier le texte et ré-aligner via un alignement forcé. Exécutez aeneas ou Montreal Forced Aligner sur le texte modifié par rapport à l'audio d'origine. Précis, mais ajoute une étape de traitement.
  3. Modifier le texte et accepter une légère dérive. Pour les horodatages au niveau des paragraphes, de petites modifications de texte déplacent rarement les ancres au point de poser problème. Acceptable pour les notes d'émission ; pas acceptable pour les transcriptions juridiques.

Pour des modifications lourdes (couper la moitié du contenu pour un best-of), utilisez un éditeur sensible à la timeline. Ré-aligner manuellement les horodatages au niveau des mots après de grandes coupes n'est pas réaliste.

Flux de travail : notes d'émission avec marqueurs de chapitre

Un flux de travail courant pour les podcasteurs :

  1. Transcrire l'épisode avec des horodatages au niveau des phrases.
  2. Parcourir la transcription et choisir 5 à 10 transitions de sujets (par exemple, « Comment ils ont lancé l'entreprise », « L'erreur de tarification »).
  3. Utiliser les horodatages pour rédiger les marqueurs de chapitre : trames ID3v2 CHAP dans les fichiers MP3, atomes chpl MP4 dans les fichiers M4A, ou le format JSON de chapitres du Podcasting Index dans le flux RSS.
  4. Publier les notes d'émission avec des horodatages comme liens d'ancrage vers la page de transcription.

Pour un point de départ propre, l'outil /tools/audio-to-text sur ConvertAudioToText produit une transcription au niveau des phrases que vous pouvez utiliser pour l'étape 1 sans inscription.

Flux de travail : sous-titres vidéo

Pour YouTube, TikTok, Instagram Reels et les plateformes de diffusion :

  1. Transcrivez la vidéo avec des horodatages au niveau du mot.
  2. Regroupez les mots en sous-titres dans une fenêtre de 1 à 7 secondes, en respectant la limite de 42 caractères par ligne.
  3. Exportez en SRT (virgule décimale) pour une compatibilité large, ou en VTT (point décimal) pour les lecteurs web.
  4. Téléversez sur la plateforme.

Consultez comparaison des formats SRT, VTT et TTML pour un aperçu côte à côte des cas où chaque format est requis ou facultatif.

FAQ

Ai-je toujours besoin d'horodatages dans une transcription ?

Non. Si vous comptez lire la transcription comme un document, la partager comme notes de réunion ou la fournir à un outil de résumé, les horodatages ajoutent du bruit visuel sans bénéfice. Ils deviennent utiles quand vous devez revenir à l'audio ou synchroniser le texte avec la vidéo.

Quelle est la différence entre les formats d'horodatage SRT et VTT ?

Le SRT utilise une virgule comme séparateur décimal (00:01:30,500) tandis que le VTT utilise un point (00:01:30.500). Les deux représentent des millisecondes. La distinction compte quand des outils traitent les fichiers de manière programmatique : certaines bibliothèques rejettent la virgule, d'autres rejettent le point. Normalisez tôt si vous faites circuler des fichiers entre plusieurs outils.

Pourquoi les horodatages au niveau du mot dérivent-ils sur les enregistrements longs ?

Whisper natif émet des horodatages au niveau du segment (généralement des blocs de 5 à 30 secondes) et interpole les positions des mots dans chaque bloc. De petites erreurs s'accumulent entre les blocs, produisant une dérive de plusieurs centaines de millisecondes à la fin d'un fichier long. Les outils d'alignement forcé comme WhisperX réancrent les mots sur les phonèmes audio après la transcription, ramenant la précision sous les 100 ms. Des API comme Deepgram émettent des horodatages natifs au niveau du mot sans étape d'interpolation.

Comment modifier une transcription sans casser les horodatages ?

Utilisez un éditeur qui préserve l'alignement (la plupart des outils de transcription dédiés le font). Pour des modifications légères au niveau des paragraphes, de petits changements de texte déplacent rarement les ancres temporelles au point de poser problème. Pour des coupes importantes, préférez un éditeur basé sur la timeline plutôt qu'un éditeur de texte brut, car le réalignement manuel des horodatages au niveau du mot après de grosses coupes est très lent.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles