
Horodatages dans la transcription : quand et à quel niveau de précision
Summarize this article with:
Toutes les transcriptions n'ont pas besoin d'horodatages. Des notes de lecture propres n'en exigent aucun ; les notes d'épisode de podcast fonctionnent très bien avec des ancres au niveau du paragraphe ; les preuves de réunion et le codage qualitatif appellent un niveau phrase ; les sous-titres nécessitent un format par réplique (SRT/VTT) ; les surlignages karaoké et la synchronisation des légendes demandent un niveau mot. Choisissez le niveau le plus léger qui couvre votre flux de travail réel.
La première question n'est pas de savoir quel niveau de granularité choisir, mais si vous avez besoin de timestamps du tout. Un transcript destiné à la lecture, au partage sous forme de notes, ou à l'alimentation d'un outil de résumé ne gagne rien à contenir des marqueurs temporels. Ils ajoutent du bruit visuel et alourdissent le fichier sans apporter de valeur. Les timestamps sont utiles dans un seul cas : quand vous devez revenir à un moment précis de l'audio, ou synchroniser le texte avec un affichage vidéo.
Avez-vous vraiment besoin de timestamps ?
Commencez par là avant de choisir une granularité.
| Cas d'usage | Timestamps nécessaires ? |
|---|---|
| Notes de réunion (pour lecture) | Non |
| Article de blog tiré d'un entretien | Non |
| Entrée pour résumé IA | Non |
| Preuve juridique ou RH | Oui |
| Notes d'épisode de podcast avec liens de chapitres | Oui |
| Sous-titres vidéo | Oui |
| Montage vidéo en coupant le transcript | Oui |
| Codage pour recherche qualitative | Oui |
Si votre cas d'usage tombe dans la colonne « Non », arrêtez-vous là. Exportez en texte brut, oubliez les ancres, et gardez le document propre.
Les quatre niveaux de granularité
Quand vous avez besoin de timestamps, le bon niveau dépend de ce que vous comptez faire du résultat.
Aucun
Un transcript en paragraphes propres, sans aucun marqueur temporel. Idéal pour la lecture, le partage et le traitement de texte. Tous les outils en aval gèrent ce format.
Niveau paragraphe
Un timestamp par paragraphe ou par tour de parole.
[00:00:00] Intervenant 1 : Bon retour sur le plateau. Aujourd'hui, on parle des modèles de tarification pour les petites entreprises.
[00:00:18] Intervenant 2 : Merci de m'accueillir. La tarification, c'est un sujet qui...
Idéal pour : les notes d'épisode de podcast, la lecture longue, les articles de blog issus d'entretiens. Le lecteur peut situer approximativement sa position dans l'audio sans que chaque phrase ne vienne encombrer la page.
Niveau phrase
Un timestamp par phrase.
[00:00:00] Bon retour sur le plateau.
[00:00:03] Aujourd'hui, on parle des modèles de tarification.
[00:00:09] Notre invité a 20 ans d'expérience.
Idéal pour : les revues orientées recherche, les transcriptions de preuves juridiques ou RH, le codage qualitatif d'entretiens de recherche. Vous pouvez naviguer jusqu'à n'importe quelle phrase pour vérifier exactement ce qui a été dit. En cas de doute, le niveau phrase est le choix sûr par défaut : vous pouvez toujours retirer les horodatages pour l'affichage et les conserver dans le fichier source.
Niveau mot
Un horodatage sur chaque token.
[00:00:00.020] Welcome [00:00:00.380] back [00:00:00.640] to [00:00:00.780] the [00:00:00.880] show.
Idéal pour : le montage vidéo de précision, le surlignage de mots façon karaoké, la construction d'un index audio consultable, les données d'entraînement ML. Les horodatages au niveau mot permettent aussi d'extraire une citation précise d'un long enregistrement sans avoir à parcourir manuellement l'audio.
Une précision importante : tous les horodatages au niveau mot ne se valent pas. Des API comme Deepgram renvoient des horodatages natifs au niveau mot sans étape d'alignement séparée. Whisper en version native produit des horodatages au niveau segment (généralement des blocs de 5 à 30 secondes) et interpole les positions des mots dans chaque segment, ce qui entraîne une accumulation d'erreurs sur les fichiers longs. Les outils d'alignement forcé comme WhisperX exécutent une seconde passe d'alignement phonémique après la transcription et ramènent la précision des mots sous les 100 ms sur un audio propre. Si la précision au niveau mot compte pour votre flux de travail, vérifiez comment votre outil génère ces horodatages.
Niveau réplique de sous-titres
Horodatages de début et de fin dans des plages de répliques, généralement de 1 à 7 secondes par réplique, calibrés pour l'affichage à l'écran.
1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.
2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models.
C'est le format SRT et VTT. Il est conçu pour le rendu vidéo, pas pour la lecture. L'article sur les formats d'export SRT, VTT et TXT détaille les spécificités de ces formats, mais une règle à retenir : les répliques SRT sont limitées à environ 2 lignes et 42 caractères par ligne pour rester dans les directives des plateformes (Netflix, YouTube, diffusion TV). Les mots sont regroupés en répliques par l'outil de transcription ; vous ne devez pas écrire les répliques à la main.

Tableau de référence par cas d'usage
| Cas d'usage | Niveau d'horodatage adapté |
|---|---|
| Lire la transcription comme un article | Aucun |
| Résumé IA ou extraction de sujets | Aucun |
| Notes d'épisode de podcast | Paragraphe |
| Comptes rendus de réunion | Phrase ou paragraphe |
| Registres de preuves judiciaires ou RH | Phrase |
| Entretiens de recherche (codage qualitatif) | Phrase |
| Sous-titres vidéo (YouTube, TikTok, Reels) | Réplique (SRT/VTT) |
| Surlignage de mots façon karaoké | Mot |
| Index de recherche vidéo ou audio | Mot |
| Montage d'un best-of à partir de la transcription | Mot |
| Données d'entraînement ML | Mot |
Conventions de format
Trois formats courants existent, et les mélanger est une source récurrente de bugs :
- HH:MM:SS (par ex.
00:01:30). Simple, utilisé dans la plupart des transcriptions par paragraphe ou par phrase. - HH:MM:SS,mmm avec une virgule (par ex.
00:01:30,500). La convention SRT. Selon la spécification du format SRT, la virgule est obligatoire. - HH:MM:SS.mmm avec un point (par ex.
00:01:30.500). La spécification W3C WebVTT utilise un point (U+002E FULL STOP) comme séparateur décimal. C'est aussi le format renvoyé par la plupart des API JSON.
Si un fichier passe par plusieurs outils (export depuis un service de transcription, import dans un éditeur vidéo, téléversement sur une plateforme), normalisez le séparateur décimal dès la première étape. Les bibliothèques qui attendent une forme précise échoueront silencieusement ou lèveront une erreur d'analyse sur l'autre.
D'où viennent les horodatages
En transcription IA, les horodatages proviennent du modèle de reconnaissance vocale. La distinction clé est de savoir si le modèle émet des horodatages par mot nativement ou s'il les dérive à partir de données au niveau du segment :
- Horodatage natif par mot (Deepgram et autres API de streaming) : le modèle renvoie directement un tuple
(mot, heure_de_début, heure_de_fin)pour chaque token. - Interpolation par segments (Whisper natif) : le modèle produit des limites de segments et déduit les positions des mots, ce qui peut dériver de plusieurs centaines de millisecondes sur de longs enregistrements.
- Alignement forcé a posteriori (WhisperX, aeneas, Montreal Forced Aligner) : une passe distincte d'alignement phonème-mot fait correspondre les mots à l'audio après la transcription, atteignant une précision inférieure à 100 ms.
Les horodatages au niveau de la phrase et du paragraphe sont toujours agrégés à partir des données au niveau du mot : l'outil regroupe les mots selon la ponctuation et les pauses entre tours de parole.
En transcription humaine, les horodatages sont insérés manuellement via un raccourci clavier. Le niveau paragraphe est courant ; le niveau phrase est plus lent et plus coûteux ; le niveau mot n'est pratiquement jamais fait à la main.
Particularités d'édition courantes
Dérive sur les fichiers longs
Avec les outils qui utilisent des horodatages interpolés par mot, un enregistrement de 3 heures peut afficher des horodatages décalés d'une seconde ou plus en fin de fichier. La solution est un pipeline qui ré-ancre aux frontières de silence, ou l'utilisation d'une API qui émet des horodatages natifs au niveau du mot dès le départ. Si vous observez une dérive constante, vérifiez quelle méthode d'horodatage votre outil utilise.
Timing de la ponctuation
La plupart des outils rattachent une virgule ou un point au mot précédent, donc l'horodatage correspond à la fin de ce mot. C'est correct pour la lecture, mais cela peut créer un décalage d'un cran si vous découpez l'audio par programmation aux frontières de ponctuation. Ajoutez une petite marge (50-100 ms) lors du découpage automatique à la ponctuation.
Frontières de tours de parole
Quand le locuteur 1 s'arrête et que le locuteur 2 commence, l'horodatage du premier mot du locuteur 2 marque le début réel de sa parole, pas le début de la pause. Pour des extraits de preuve ou des citations, commencez le clip environ une demi-seconde avant l'étiquette du locuteur afin d'inclure le contexte naturel.
Alignement de la cadence d'images
Pour le travail vidéo, les horodatages doivent correspondre à la fréquence d'images (24, 25, 30 ou 60 fps). Un horodatage comme 00:01:30.123 ne correspond pas exactement à une image à 30 fps. La plupart des éditeurs vidéo arrondissent à l'image la plus proche, ce qui est généralement acceptable, mais sachez que le « clic pour rechercher » dans un éditeur peut atterrir une image à côté du point de coupe prévu.
Édition tout en préservant les horodatages
La partie la plus délicate du travail avec des transcriptions horodatées est de modifier le texte sans casser les ancres temporelles. Trois approches :
- Utiliser un éditeur qui maintient l'alignement. Les outils de transcription dédiés (Otter, Descript, et autres, selon la documentation des fournisseurs) décalent automatiquement les horodatages lorsque vous supprimez ou insérez des mots.
- Modifier le texte et ré-aligner via un alignement forcé. Exécutez aeneas ou Montreal Forced Aligner sur le texte modifié par rapport à l'audio d'origine. Précis, mais ajoute une étape de traitement.
- Modifier le texte et accepter une légère dérive. Pour les horodatages au niveau des paragraphes, de petites modifications de texte déplacent rarement les ancres au point de poser problème. Acceptable pour les notes d'émission ; pas acceptable pour les transcriptions juridiques.
Pour des modifications lourdes (couper la moitié du contenu pour un best-of), utilisez un éditeur sensible à la timeline. Ré-aligner manuellement les horodatages au niveau des mots après de grandes coupes n'est pas réaliste.
Flux de travail : notes d'émission avec marqueurs de chapitre
Un flux de travail courant pour les podcasteurs :
- Transcrire l'épisode avec des horodatages au niveau des phrases.
- Parcourir la transcription et choisir 5 à 10 transitions de sujets (par exemple, « Comment ils ont lancé l'entreprise », « L'erreur de tarification »).
- Utiliser les horodatages pour rédiger les marqueurs de chapitre : trames ID3v2 CHAP dans les fichiers MP3, atomes chpl MP4 dans les fichiers M4A, ou le format JSON de chapitres du Podcasting Index dans le flux RSS.
- Publier les notes d'émission avec des horodatages comme liens d'ancrage vers la page de transcription.
Pour un point de départ propre, l'outil /tools/audio-to-text sur ConvertAudioToText produit une transcription au niveau des phrases que vous pouvez utiliser pour l'étape 1 sans inscription.
Flux de travail : sous-titres vidéo
Pour YouTube, TikTok, Instagram Reels et les plateformes de diffusion :
- Transcrivez la vidéo avec des horodatages au niveau du mot.
- Regroupez les mots en sous-titres dans une fenêtre de 1 à 7 secondes, en respectant la limite de 42 caractères par ligne.
- Exportez en SRT (virgule décimale) pour une compatibilité large, ou en VTT (point décimal) pour les lecteurs web.
- Téléversez sur la plateforme.
Consultez comparaison des formats SRT, VTT et TTML pour un aperçu côte à côte des cas où chaque format est requis ou facultatif.
FAQ
Ai-je toujours besoin d'horodatages dans une transcription ?
Non. Si vous comptez lire la transcription comme un document, la partager comme notes de réunion ou la fournir à un outil de résumé, les horodatages ajoutent du bruit visuel sans bénéfice. Ils deviennent utiles quand vous devez revenir à l'audio ou synchroniser le texte avec la vidéo.
Quelle est la différence entre les formats d'horodatage SRT et VTT ?
Le SRT utilise une virgule comme séparateur décimal (00:01:30,500) tandis que le VTT utilise un point (00:01:30.500). Les deux représentent des millisecondes. La distinction compte quand des outils traitent les fichiers de manière programmatique : certaines bibliothèques rejettent la virgule, d'autres rejettent le point. Normalisez tôt si vous faites circuler des fichiers entre plusieurs outils.
Pourquoi les horodatages au niveau du mot dérivent-ils sur les enregistrements longs ?
Whisper natif émet des horodatages au niveau du segment (généralement des blocs de 5 à 30 secondes) et interpole les positions des mots dans chaque bloc. De petites erreurs s'accumulent entre les blocs, produisant une dérive de plusieurs centaines de millisecondes à la fin d'un fichier long. Les outils d'alignement forcé comme WhisperX réancrent les mots sur les phonèmes audio après la transcription, ramenant la précision sous les 100 ms. Des API comme Deepgram émettent des horodatages natifs au niveau du mot sans étape d'interpolation.
Comment modifier une transcription sans casser les horodatages ?
Utilisez un éditeur qui préserve l'alignement (la plupart des outils de transcription dédiés le font). Pour des modifications légères au niveau des paragraphes, de petits changements de texte déplacent rarement les ancres temporelles au point de poser problème. Pour des coupes importantes, préférez un éditeur basé sur la timeline plutôt qu'un éditeur de texte brut, car le réalignement manuel des horodatages au niveau du mot après de grosses coupes est très lent.
Sources
- Spécification W3C WebVTT : https://www.w3.org/TR/webvtt1/
- Article WhisperX (ASR longue durée précis dans le temps) : https://arxiv.org/html/2303.00747v2
- Documentation Deepgram Nova-3 et horodatages des mots : https://developers.deepgram.com/docs/models-languages-overview
- Lignes directrices de Capital Captions pour les sous-titres (limites de caractères, durée des répliques) : https://capitalcaptions.com/services/subtitle-services-2/capital-captions-standard-subtitling-guidelines/
- Auphonic sur les marqueurs de chapitre MP3 ID3v2 : https://auphonic.com/blog/2013/07/03/chapter-marks-and-enhanced-podcasts/
- Aligneur forcé aeneas : https://github.com/readbeyond/aeneas
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.