Formats d'export de transcription : TXT, SRT, VTT, JSON
transcriptionsous-titressrtvtt

Formats d'export de transcription : TXT, SRT, VTT, JSON

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Chaque format d'export de transcription a un cas d'usage idéal : SRT pour les plateformes vidéo, VTT pour les lecteurs web HTML5, TXT pour les articles de blog et les notes d'émission, DOCX pour les clients et le travail juridique, JSON pour les développeurs qui construisent à partir d'une transcription, et PDF pour les livrables à mise en page fixe. Choisissez en fonction de ce dont le destinataire final a besoin, pas selon ce qui semble le plus complet. Netflix exige du TTML, pas du SRT : vérifiez donc les exigences de la plateforme avant de partir du principe qu'un format de sous-titres sera accepté.

Une transcription terminée peut être livrée dans une demi-douzaine de formats, et le bon dépend entièrement de ce qui vient ensuite. À intégrer dans un lecteur vidéo ? Prenez SRT ou VTT. À glisser dans un article de blog ? TXT ou DOCX. À injecter dans un autre outil ? JSON. Cette référence passe en revue ce que contient réellement chaque format, où on l'utilise, et les subtilités qui piègent tout le monde.

TXT : le format texte brut par défaut

Le format le plus simple. Juste des mots, éventuellement avec des étiquettes de locuteurs et des horodatages de paragraphe.

[00:00:00] Speaker 1: Welcome back to the show. Today we're talking about pricing.

[00:00:18] Speaker 2: Thanks for having me. Pricing is one of those topics...

TXT est le chemin le plus rapide de l'audio vers un texte lisible. Aucun lecteur ni bibliothèque spéciale nécessaire. Copiez-collez dans n'importe quel éditeur, CMS ou client de messagerie.

Ce que TXT sacrifie :

  • Pas d'horodatage fin pour la synchronisation vidéo.
  • Pas de structure lisible par machine (tout est une chaîne de caractères).
  • Des outils différents produisent des mises en page légèrement différentes, ce qui compte pour le traitement par lots.

Utilisez TXT pour les articles de blog, les notes d'émission, les comptes rendus de réunion, bref tout contexte où des humains liront le fichier. Pour approfondir la question de savoir quand ce compromis vaut la peine, voir services de transcription gratuits vs payants.

DOCX : TXT avec mise en forme

Format Microsoft Word. Même contenu que TXT, mais avec des titres stylisés, les locuteurs en gras, et parfois un en-tête avec des métadonnées (nom du fichier, date, durée).

DOCX est le livrable standard des services de transcription humaine. Les sténographes judiciaires, les transcripteurs juridiques et les sociétés de transcription académique envoient presque toujours du DOCX. C'est le format que la plupart des clients non techniques s'attendent à ouvrir.

Pour les outils IA, DOCX n'est que du TXT avec du style. La précision et le contenu sont identiques ; le fichier a simplement meilleure allure dans Word. Si le destinataire va modifier le texte, DOCX est préférable au PDF parce que les fonctions de suivi des modifications et de commentaires de Word fonctionnent correctement.

SRT : le format de sous-titres universel

SubRip Subtitle. Le format de sous-titres le plus largement pris en charge en usage courant. YouTube, Vimeo, Premiere, Final Cut et DaVinci Resolve acceptent tous le SRT.

Format :

1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.

2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models for small businesses.

Chaque sous-titre comporte quatre parties :

  1. Numéro de sous-titre (1, 2, 3, ...).
  2. Heure de début --> Heure de fin au format HH:MM:SS,mmm (notez la virgule décimale, pas un point).
  3. Texte (une ou plusieurs lignes).
  4. Ligne vide pour séparer les sous-titres.

Particularités du SRT :

  • Virgule décimale, pas point. 00:00:03,500, pas 00:00:03.500. C'est l'erreur de syntaxe SRT la plus courante. De nombreux parseurs rejetteront un fichier qui utilise un point à la place.
  • Pas d'étiquettes de locuteur dans la spécification. La plupart des outils intègrent les étiquettes de locuteur dans le texte, sous la forme Speaker 1: Welcome back. Certains lecteurs l'affichent tel quel ; d'autres peuvent le retirer.
  • Les sauts de ligne comptent. La plupart des lecteurs affichent 1 à 2 lignes par sous-titre. Les sous-titres sur trois lignes peuvent être tronqués ou masquer plus de vidéo que prévu.
  • Limites de caractères par ligne. La convention est de 32 à 42 caractères par ligne pour une bonne lisibilité sur petits écrans.
  • Durée du sous-titre. Typiquement 2 à 7 secondes par sous-titre. Les sous-titres d'un seul mot paraissent saccadés ; ceux de plus de 7 secondes exigent une vitesse de lecture trop élevée.

Une plateforme qui n'accepte PAS le SRT pour une livraison professionnelle est Netflix. Netflix exige du TTML1 (avec une extension .xml ou .ttml) pour la livraison des sous-titres. SRT, VTT et SCC ne sont pas acceptés pour les livraisons Netflix sans exception explicite accordée par un représentant de Netflix. C'est une idée reçue répandue.

Utilisez SRT pour les téléversements YouTube, l'import dans les logiciels de montage vidéo et la plupart des plateformes vidéo grand public.

Outil générateur de sous-titres affichant l'option d'export SRT
Outil générateur de sous-titres affichant l'option d'export SRT

VTT : le cousin web natif du SRT

WebVTT. La norme HTML5 pour les sous-titres dans le navigateur, définie dans la spécification du W3C. Fonctionnellement proche du SRT, mais avec des différences notables de structure et de capacités.

Format :

WEBVTT

00:00:00.000 --> 00:00:03.500
Welcome back to the show.

00:00:03.500 --> 00:00:09.200
Today we're talking about pricing models for small businesses.

Principales différences avec le SRT :

  • Point décimal, pas virgule. 00:00:03.500. L'inverse du SRT. C'est la source de confusion la plus fréquente lors de la conversion entre les deux.
  • En-tête WEBVTT obligatoire. Le fichier doit commencer par la chaîne « WEBVTT » suivie d'au moins deux sauts de ligne. Sans cet en-tête, le fichier n'est pas un VTT valide.
  • Les identifiants de sous-titre sont facultatifs. Contrairement au SRT, où les numéros sont conventionnels (voire strictement requis), VTT ne les impose pas.
  • Prend en charge les balises de voix. <v Speaker 1>Welcome back.</v> est la façon normalisée par le W3C d'étiqueter les locuteurs. Les lecteurs peuvent styler chaque voix différemment grâce aux pseudo-éléments CSS.
  • Prend en charge le style. Les balises de type HTML pour l'italique, le gras et la couleur fonctionnent à l'intérieur des sous-titres.
  • Prend en charge les réglages de sous-titre. Position, alignement et texte vertical peuvent être définis sous-titre par sous-titre.

VTT est ce qu'attend l'élément HTML5 <track>. Si vous intégrez des sous-titres sur un site web avec l'élément vidéo natif, VTT est le format que le navigateur comprend nativement. YouTube accepte le VTT mais recommande le SRT aux nouveaux créateurs.

Pour une comparaison approfondie de ces deux formats ainsi que du TTML, voir SRT vs VTT vs TTML.

TTML : la norme de diffusion professionnelle

Timed Text Markup Language. Le format XML du W3C qu'exigent les diffuseurs professionnels et les plateformes de streaming. Connu aussi sous le nom de DFXP (Distribution Format Exchange Profile), un profil spécifique de TTML.

Le TTML prend en charge les styles complexes, le positionnement précis à l'écran, les métadonnées d'accessibilité (marqueurs SDH, identification des locuteurs) et plusieurs pistes de langue dans un même fichier. Netflix exige du TTML1 pour toutes les langues ; BBC iPlayer et Hulu l'exigent aussi pour une livraison professionnelle.

Pour la plupart des créateurs qui publient sur YouTube ou intègrent sur leur propre site, le TTML n'est pas nécessaire. Il devient important quand vous livrez du contenu à un partenaire de diffusion ou à une plateforme dotée d'une spécification de livraison formelle. YouTube accepte bien le TTML et le DFXP, mais SRT ou VTT couvre la plupart des flux de création.

JSON : le format lisible par machine

Pour les développeurs, JSON est l'export sans perte. Tout ce que sait le moteur de transcription, structuré et interrogeable.

{
  "transcript": "Welcome back to the show...",
  "words": [
    {"word": "Welcome", "start": 0.020, "end": 0.380, "confidence": 0.998, "speaker": 0},
    {"word": "back", "start": 0.380, "end": 0.640, "confidence": 0.997, "speaker": 0}
  ],
  "utterances": [
    {"speaker": 0, "text": "Welcome back to the show.", "start": 0.020, "end": 1.880}
  ],
  "metadata": {
    "duration": 1845.2,
    "language": "en",
    "model": "whisper-large-v3"
  }
}

JSON contient ce que SRT et TXT ne peuvent pas transporter : les horodatages au niveau du mot, les scores de confiance par mot, les attributions de locuteurs, les groupements d'énoncés et les métadonnées du modèle. Les champs facultatifs des moteurs augmentés par l'IA incluent les sujets, les sentiments et les résumés.

Utilisez JSON dès que vous construisez quelque chose à partir d'une transcription : lecteurs vidéo personnalisés, index de recherche, pipelines IA ou analyse de données. Le format est verbeux mais sans perte. Si votre service de transcription conserve le JSON, vous pourrez réexporter en SRT ou TXT plus tard sans refaire passer l'audio dans le moteur.

PDF : le livrable soigné

Les transcriptions PDF sont générées en exportant le DOCX en PDF. Elles ont un rendu professionnel, figent la mise en forme et constituent le livrable attendu par nombre de clients juridiques et académiques.

Utilisez le PDF pour :

  • Dépôts légaux et judiciaires.
  • Livrables de recherche académique.
  • Rapports clients où la mise en page fixe compte.
  • Archivage (à condition que le texte soit incorporé, et non scanné).

N'utilisez pas le PDF si :

  • Le destinataire doit modifier le texte. L'édition d'un PDF est lente et source d'erreurs ; donnez-lui plutôt du DOCX.
  • Le destinataire doit l'injecter dans un autre outil. JSON ou TXT est plus compatible.

Quel format utiliser et quand

Cas d'usageFormat adapté
Notes d'émission de podcastTXT
Article de blog à partir d'une interviewTXT ou DOCX
Sous-titres de vidéo YouTubeSRT
Vidéo HTML5 sur votre siteVTT
TikTok ou Instagram ReelSRT
Livraison NetflixTTML (selon la spécification de livraison)
Livrable juridique ou judiciaireDOCX ou PDF
Données de recherche académiqueJSON + TXT
Construction d'un index de rechercheJSON
Pipeline NLP ou IA personnaliséJSON
Le client veut modifier le contenuDOCX
E-mail à un collègueTXT
Archivage avec mise en page fixePDF

Dans le doute, exportez à la fois en TXT et en SRT. Ce sont de petits fichiers ; disposer des deux vous laisse le choix entre les flux vidéo et texte sans relancer la transcription.

Longueur des sous-titres et sauts de ligne

C'est le sujet qui mord tous les sous-titreurs débutants. Les réglages par défaut de nombreux outils produisent des fichiers SRT ou VTT dont les sous-titres sont trop longs, trop courts, ou se replient maladroitement sur les petits écrans. Pour les décisions d'horodatage en particulier, voir quand utiliser les horodatages en transcription.

Bonnes pratiques :

  • Durée du sous-titre : 2 à 6 secondes. Un sous-titre d'un seul mot paraît saccadé ; au-delà de 7 secondes, la vitesse de lecture devient trop élevée.
  • Caractères par ligne : 32 à 42 est la convention. Au-delà de 42, la ligne se replie mal sur mobile.
  • Lignes par sous-titre : 2 au maximum. Trois lignes couvrent trop de la vidéo.
  • Mots par minute : visez une vitesse de lecture de 160 à 180 mots/minute, en ajustant la durée des sous-titres au rythme du locuteur.

La plupart des outils modernes proposent des valeurs par défaut saines. Si les sous-titres sortent mal, cherchez un réglage « longueur de ligne » ou « vitesse de lecture » avant d'éditer à la main.

Conversion entre formats

Passer d'un format à l'autre est généralement immédiat, mais pas toujours sans perte :

  • TXT vers/depuis DOCX : Word gère les deux nativement. Aucune information perdue.
  • SRT vers/depuis VTT : transformation de texte triviale : remplacez les virgules par des points (ou l'inverse), ajoutez ou retirez l'en-tête WEBVTT. Une seule ligne de code dans n'importe quel langage de script.
  • JSON vers TXT/SRT/VTT : la plupart des outils de transcription le font automatiquement. JSON est la source de vérité ; tous les autres formats en dérivent.
  • TXT vers SRT/VTT : nécessite de recaler le texte sur l'audio, ce qui exige les données d'horodatage d'origine. Impossible sans l'audio ou le JSON d'origine.
  • PDF vers n'importe quel format : fiable uniquement si le PDF a été généré à partir de texte. Les PDF scannés exigent de l'OCR et perdent la mise en forme.

Si vous utilisez ConvertAudioToText, il exporte TXT, SRT, VTT, JSON et DOCX à partir d'une seule tâche de transcription : vous ne relancez le moteur que si vous modifiez des réglages comme la langue ou le nombre de locuteurs. Vous pouvez aussi générer directement vos fichiers de sous-titres via l'outil générateur de sous-titres.

FAQ

Quelle est la différence entre SRT et VTT ?

Les deux sont des formats de sous-titres horodatés avec une structure quasi identique. SRT utilise une virgule comme séparateur décimal dans les horodatages (00:00:03,500) et exige des numéros de sous-titre. VTT utilise un point (00:00:03.500), rend les numéros de sous-titre facultatifs, exige un en-tête WEBVTT en haut du fichier et ajoute la prise en charge des balises de voix, du style CSS et du positionnement à l'écran. SRT fonctionne par défaut sur davantage de plateformes ; VTT est le format natif des éléments vidéo HTML5.

Quel format dois-je utiliser pour YouTube ?

SRT est le choix par défaut le plus pratique pour YouTube. YouTube accepte aussi VTT, SBV, TTML et plusieurs formats de diffusion, mais SRT est le format que la documentation d'aide de YouTube elle-même recommande aux créateurs débutants en sous-titrage. Il est largement pris en charge par les outils d'export et ne nécessite aucune configuration particulière.

Netflix accepte-t-il les fichiers SRT ?

Non, pas pour une livraison professionnelle. Netflix exige du TTML1 (avec une extension .xml ou .ttml) pour les fichiers de sous-titres. SRT, VTT et SCC ne sont pas acceptés sans exception explicite accordée par un représentant de Netflix. Si vous livrez du contenu à Netflix, consultez le Netflix Partner Help Center pour connaître la spécification TTML en vigueur.

Que contient une transcription JSON que SRT et TXT ne contiennent pas ?

JSON transporte les horodatages au niveau du mot, les scores de confiance par mot, les attributions de locuteurs, les groupements d'énoncés et les métadonnées du modèle. SRT ne transporte que des blocs de texte horodatés, sans détail au niveau du mot. TXT ne transporte que les mots, avec des étiquettes de locuteur facultatives et des horodatages de paragraphe. Si vous devez construire une recherche, lancer une analyse NLP ou alimenter un lecteur personnalisé, JSON est le seul format qui contient toutes les données.

Puis-je convertir entre formats de transcription sans relancer la transcription ?

Pour la plupart des conversions, oui. SRT, VTT, TXT et DOCX peuvent tous être régénérés à partir du JSON d'origine sans retoucher l'audio, à condition que votre service de transcription ait conservé le JSON. La conversion qui ne peut pas se faire en sens inverse est TXT vers SRT ou VTT : sans données d'horodatage au niveau du mot, impossible de placer les horodatages avec précision.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles