
Transcription vs sous-titrage vs sous-titres : le guide 2026
Summarize this article with:
La transcription produit un document lisible à partir de l'audio. Le sous-titrage produit du texte chronométré affiché à l'écran pour les spectateurs qui ne peuvent pas entendre, y compris les effets sonores et l'identification des locuteurs. Les sous-titres traduisent ou transcrivent les dialogues pour les spectateurs qui ne comprennent pas la langue, et omettent les indications sonores que le spectateur peut déjà entendre. Une seule passe de transcription peut produire les trois sorties ; il suffit d'avoir le bon export et la bonne passe d'édition pour chacune. Les sous-titres traduits ne satisfont pas la loi sur l'accessibilité : seuls les véritables sous-titres codés le font.
Une transcription, une piste de sous-titres codés et un fichier de sous-titres sont trois choses différentes. Les trois partent du même audio, mais chacun résout un problème différent, se livre dans un format différent et contient des éléments différents. Choisir le mauvais revient soit à laisser votre public sur le carreau, soit à échouer à un contrôle de conformité.
Les trois livrables, comparés
| Transcription | Sous-titres codés | Sous-titres | |
|---|---|---|---|
| Public | Lecteurs | Spectateurs qui ne peuvent pas entendre | Spectateurs qui ne comprennent pas la langue parlée |
| Effets sonores inclus ? | Non (sauf s'ils sont essentiels au sens) | Oui, obligatoires | Non |
| Indications musicales incluses ? | Non | Oui | Non |
| Identification des locuteurs incluse ? | Lorsqu'il y a plusieurs locuteurs | Oui, obligatoire | Seulement si ambigu à l'écran |
| Traduits ? | Rarement | Même langue ou traduits | Généralement traduits |
| Formats habituels | TXT, DOCX, PDF | SRT, VTT, SCC, TTML | SRT, VTT, SBV |
| Où c'est exigé par la loi | Contenu audio seul (Section 508) | Vidéo préenregistrée (WCAG SC 1.2.2), vidéo en direct (SC 1.2.4) | Aucune loi sur l'accessibilité ne les exige |
C'est cette dernière ligne qui surprend le plus : les sous-titres traduits ne satisfont pas la loi sur l'accessibilité. Seuls les véritables sous-titres codés le font.
La transcription : le résultat est un document
Quelle est la différence entre une transcription et des sous-titres codés ?
Une transcription est un document : sans codes temporels, optimisé pour la lecture, avec une structure en paragraphes et sans limite de longueur de ligne. Les sous-titres codés sont une piste de texte synchronisée avec une vidéo, stockée séparément de la vidéo afin que les spectateurs puissent les activer ou les désactiver. Les deux partent de la même passe de reconnaissance vocale, mais le format de sortie, le contenu et les conventions d'édition diffèrent.
Une transcription est faite pour être lue, pas regardée. Cela change tout dans sa mise en forme.
- Structure en paragraphes pour la lisibilité, pas des retours à la ligne de 32 caractères.
- Étiquettes de locuteur lorsqu'il y a plus d'une voix, écrites en toutes lettres pour la lisibilité.
- Aucun code temporel requis (des horodatages facultatifs pour la navigation sont acceptables).
- Ponctuation et mise en forme optimisées pour un lecteur humain, pas pour un lecteur vidéo.
- Pas de limite de longueur de ligne. Pas de marqueurs de fin de séquence.
Si vous collez un fichier de sous-titres codés dans un document, vous obtenez quelque chose qui se lit comme un bandeau défilant imprimé. Une vraie transcription est éditée pour se lire comme un entretien ou un article soigné. Les deux sont structurellement différents même quand les mots sont identiques.
Cas d'usage courants : articles de blog à partir d'entretiens, notes d'émission de podcast, comptes rendus de réunion, travaux académiques, dépositions judiciaires et contenu destiné à l'indexation par les moteurs de recherche.
Les sous-titres codés : le résultat est une piste d'accessibilité synchronisée

Que doivent contenir les sous-titres codés, contrairement aux sous-titres ?
Les sous-titres codés doivent inclure l'identification des locuteurs, les effets sonores (par ex. [porte qui claque], [téléphone qui sonne]), les indications musicales ([musique entraînante], [applaudissements du public]), l'identification des locuteurs hors champ et les indicateurs de ton lorsque le texte seul est ambigu. Les sous-titres ne portent que les dialogues, parfois traduits, car le spectateur peut entendre tout le reste.
Le sous-titrage est conçu pour un spectateur qui regarde sans aucun son. Tout ce qu'il entendrait doit apparaître à l'écran, c'est pourquoi les sous-titres codés contiennent des éléments absents des transcriptions et des sous-titres.
Éléments obligatoires :
- Identification des locuteurs. « Alice : » ou « [Bob] » avant chaque prise de parole, surtout lorsque les locuteurs sont hors champ ou non identifiables visuellement.
- Effets sonores. « [porte qui claque] », « [téléphone qui sonne] », « [applaudissements de la foule] ».
- Indications musicales. « [musique entraînante] », « [cordes menaçantes] », « [chanson : paroles ici] ».
- Indicateurs de ton lorsque le sens émotionnel ne ressort pas clairement des mots seuls. « [sur un ton sarcastique] », « [chuchotement] ».
Les sous-titres codés sont également synchronisés avec la vidéo : chaque séquence a une heure de début et une heure de fin, et le texte apparaît à l'écran en phase avec l'audio. La qualité de cette synchronisation a une importance légale.
Pour les plateformes sociales, l'article sous-titres incrustés vs sous-titres codés détaille cette distinction. En résumé : les sous-titres codés s'activent via un bouton (le bouton CC sur YouTube) ; les sous-titres incrustés sont gravés dans les pixels de la vidéo et ne peuvent pas être retirés. Les contenus sociaux courts (TikTok, Instagram Reels) utilisent généralement des sous-titres incrustés, car la plupart des spectateurs regardent sans le son et la prise en charge des sous-titres codés varie selon les plateformes. Pour en savoir plus, consultez le guide sous-titrage pour TikTok et Instagram.
Les sous-titres : le résultat est une piste de dialogues pour l'accès linguistique
Les sous-titres comptent-ils comme des sous-titres codés pour la conformité en matière d'accessibilité ?
Non. Les sous-titres partent du principe que le spectateur entend, et omettent donc les effets sonores, les indications musicales et l'audio hors parole. La loi sur l'accessibilité (WCAG SC 1.2.2, ADA Title II, Section 508, EAA) exige des sous-titres codés incluant toutes les informations audio nécessaires à la compréhension du contenu. Une piste de sous-titres ne portant que les dialogues ne satisfait pas ces exigences.
Les sous-titres partent du principe que le spectateur entend. Ils n'incluent que ce qui est nécessaire pour suivre le dialogue dans une autre langue (ou parfois dans la même langue pour les spectateurs ayant besoin d'un soutien à la lecture).
- Texte des dialogues, généralement traduit dans la langue du spectateur.
- Pas d'effets sonores. Le spectateur entend la porte claquer.
- Pas d'indications musicales. Le spectateur entend la musique.
- Pas d'identification des locuteurs sauf si c'est totalement ambigu à l'écran.
Un sous-titrage espagnol vers anglais d'un film traduit les dialogues et s'arrête là. La piste de sous-titres suppose que le spectateur a entendu le coup de feu, les rires et le silence.
Conséquence pratique : si votre vidéo comporte une piste de sous-titres mais aucune piste de sous-titres codés, vous avez servi les spectateurs ne maîtrisant pas la langue d'origine, mais pas les spectateurs sourds ou malentendants. Ce sont deux livrables distincts.
Remarque sur la terminologie
Les termes ne sont pas universels. Aux États-Unis, « captions » désigne généralement la piste d'accessibilité (indications sonores, identification des locuteurs) et « subtitles » la piste ne contenant que les dialogues. Au Royaume-Uni et dans une grande partie de l'Europe, « subtitles » couvre les deux, et « captions » est rarement employé. Les plateformes de streaming (Netflix, Disney+, Amazon Prime) regroupent les deux types sous le terme « subtitles » dans leur interface, mais les traitent différemment en interne.
Netflix, par exemple, utilise le terme SDH (Subtitles for the Deaf and Hard of Hearing, sous-titres pour sourds et malentendants) pour la piste d'accessibilité qui contient les indications sonores. En interne, Netflix exige que tous les fichiers SDH et de sous-titres soient au format TTML1 (.xml ou .ttml), et non en SRT ou VTT, pour son pipeline de diffusion. C'est précisément là que cet écart de terminologie crée de vrais problèmes de production.
Formats de fichiers : quel format pour quel usage
Quel format de fichier utiliser pour les sous-titres codés et pour les sous-titres ?
Le SRT est le plus portable et fonctionne sur YouTube, Vimeo, Facebook et la plupart des lecteurs vidéo. Le VTT (WebVTT) ajoute la gestion du style et du positionnement pour les lecteurs HTML5 et est privilégié pour la vidéo hébergée sur le web. Le TTML (et son profil IMSC1.1) est requis pour la diffusion broadcast professionnelle et OTT, comme chez Netflix. Le SCC est utilisé dans les flux de travail broadcast nord-américains. Pour la plupart des créateurs indépendants et des formations en ligne, générez d'abord du SRT et convertissez ensuite en aval selon vos besoins.
| Format | Idéal pour | Plateformes principales |
|---|---|---|
| SRT | Portabilité, la plupart des plateformes en ligne | YouTube, Vimeo, Facebook, la plupart des lecteurs |
| VTT (WebVTT) | Lecteurs web HTML5, contrôle du style | Vimeo, vidéo hébergée sur le web, élément track HTML5 |
| SCC | Flux de travail broadcast nord-américains | Broadcast hérité et montage professionnel |
| TTML / IMSC1.1 | Diffusion OTT et streaming | Netflix, broadcast, Disney+, Amazon Prime |
| TXT / DOCX | Transcriptions pour lecture | Articles de blog, documents, indexation pour moteurs de recherche |
Règle pratique : générez d'abord du SRT pour une portabilité maximale, puis convertissez en TTML en aval pour une diffusion OTT professionnelle. Le SRT et le VTT servent aussi bien le sous-titrage codé que le sous-titrage classique ; c'est le contenu qui détermine le type dont il s'agit, pas l'extension du fichier.
Pour un examen approfondi du contenu de chaque format et de la façon dont les lecteurs les analysent, voir comment créer un fichier SRT.
Pistes dans la même langue ou pistes traduites
Une vidéo YouTube en anglais peut comporter une piste de sous-titres codés en anglais (accessibilité, avec indications sonores) et une piste de sous-titres en espagnol (dialogues traduits, sans indications sonores). Même format de fichier, contenus différents :
- Sous-titres codés dans la même langue : piste d'accessibilité avec identification des locuteurs et effets sonores.
- Sous-titres dans la même langue : dialogues uniquement, parfois utilisés pour faciliter la compréhension ou dans les environnements bruyants ; ce n'est pas un substitut à l'accessibilité.
- Sous-titres codés traduits (SDH dans une autre langue) : indications sonores traduites avec les dialogues ; requis lorsque le contenu est initialement dans une langue et que le public cible peut inclure des personnes sourdes ou malentendantes dans cette langue.
- Sous-titres traduits : dialogues traduits, sans indications sonores ; sert l'accès linguistique, pas l'accessibilité.
Le pipeline de transcription produit le texte dans la langue source. La traduction est une étape en aval, appliquée soit aux sous-titres codés, soit aux sous-titres selon les besoins du public.
Quand utiliser chacun
| Objectif | Livrable adapté |
|---|---|
| Article de blog à partir d'un entretien enregistré | Transcription (TXT ou DOCX) |
| Notes d'émission de podcast | Transcription |
| Vidéo YouTube : spectateurs sourds et malentendants | Sous-titres codés dans la même langue (SRT ou VTT) |
| Vidéo YouTube : spectateurs ne parlant pas anglais | Sous-titres traduits (SRT ou VTT) |
| TikTok ou Instagram Reels | Sous-titres incrustés dans la vidéo |
| Compte rendu de réunion en direct pour l'équipe | Transcription |
| Cours universitaire ou formation en ligne | Sous-titres codés + transcription séparée |
| Film destiné à une diffusion internationale | Sous-titres traduits pour chaque langue |
| Vidéo d'une agence fédérale ou d'un contractant (Section 508) | Sous-titres codés + transcription descriptive |
| Vidéo destinée au public (ADA Title II, EAA) | Sous-titres codés (les sous-titres seuls ne suffisent pas) |
Pour la plupart des créateurs de contenu, la réponse est « transcription et sous-titres codés ». C'est très bien. Une seule passe de transcription peut produire les deux : exportez en TXT pour la lecture, en SRT pour l'incrustation. Le générateur de sous-titres produit des fichiers SRT et VTT à partir d'un fichier audio ou vidéo en une seule étape.
Exigences légales : ce que dit vraiment la loi
Les sous-titres générés automatiquement suffisent-ils pour la conformité en matière d'accessibilité ?
Généralement pas à eux seuls. La FCC utilise une précision de 99 % des mots comme référence pour les sous-titres codés diffusés à la télévision. Les directives Section 508 et WCAG indiquent que les sous-titres générés automatiquement sont insuffisants tant qu'ils n'ont pas été confirmés entièrement exacts, car les erreurs qui altèrent le sens créent une barrière d'accessibilité. Prévoyez une passe d'édition humaine sur la sortie automatique avant toute publication à des fins de conformité.
Mon avis : le paysage juridique est plus précis que ce que la plupart des articles admettent, et les distinctions entre transcription, sous-titres codés et sous-titres sont exactement là où les organisations se trompent.
WCAG (Web Content Accessibility Guidelines) :
- SC 1.2.2 (niveau A) : sous-titres codés pour l'audio préenregistré dans les médias synchronisés.
- SC 1.2.4 (niveau AA) : sous-titres codés pour l'audio en direct dans les médias synchronisés.
- Les transcriptions seules satisfont l'exigence pour le contenu audio seul, mais pas pour la vidéo avec audio.
- Les sous-titres ne satisfont aucune de ces deux exigences.
ADA Title II (États-Unis) : la règle finale d'avril 2024 du DOJ a établi WCAG 2.1 niveau AA comme norme de conformité pour les entités publiques. La première échéance est tombée le 24 avril 2026 pour les entités desservant des populations de plus de 50 000 habitants.
Section 508 (fédéral américain) : les médias synchronisés exigent des sous-titres codés (WCAG SC 1.2.2) plus des descriptions audio pour le contenu visuel important. Des transcriptions sont requises séparément pour les médias audio seuls.
FCC (broadcast américain) : les normes de qualité adoptées en 2014 présentent l'exactitude, la synchronicité, l'exhaustivité du programme et le placement des sous-titres comme les quatre principes. La référence du secteur est une précision de 99 % des mots. Les sous-titres générés automatiquement ne sont pas jugés suffisants sans une passe de relecture humaine.
Acte européen sur l'accessibilité (EAA) : entré en vigueur le 28 juin 2025, il couvre les entreprises opérant dans l'UE ou vendant aux résidents de l'UE. Les contenus audiovisuels doivent inclure des sous-titres codés ou des sous-titres synchronisés respectant des normes de qualité, avec une vitesse de lecture d'environ 160 à 180 mots par minute.
Pour un panorama complet de la conformité du sous-titrage selon les juridictions, voir conformité WCAG avec transcriptions et sous-titres d'accessibilité et conformité ADA.
Cette section est à jour à mi-2026 et est fournie à titre d'information générale uniquement, pas comme un avis juridique. Vérifiez les exigences applicables à votre juridiction et à votre cas d'usage.
Que faire ensuite
Identifiez d'abord votre livrable. Si le public lit, il vous faut une transcription. Si le public regarde sans le son, il vous faut des sous-titres codés. Si le public regarde mais ne comprend pas la langue parlée, il vous faut des sous-titres. Une même passe de transcription produit les trois ; choisissez le bon export et la bonne passe d'édition pour chacun.
Si vous devez générer un fichier de sous-titres codés ou de sous-titres sans monter tout un workflow, le générateur de sous-titres de ConvertAudioToText traite les fichiers audio et vidéo et exporte directement en SRT ou VTT.
Sources
- W3C WAI, "Captions/Subtitles": https://www.w3.org/WAI/media/av/captions/
- W3C WAI, "Understanding SC 1.2.2 Captions (Prerecorded)": https://www.w3.org/WAI/WCAG22/Understanding/captions-prerecorded.html
- Section508.gov, "Video and Other Synchronized Media": https://www.section508.gov/create/synchronized-media/
- 3Play Media, "FCC Closed Captioning Quality Standards": https://www.3playmedia.com/blog/fccs-new-quality-standards-closed-captioning-video-programming/
- FCC, "FCC Adopts Closed Captioning Quality Standards for TV Programs": https://www.fcc.gov/fcc-adopts-closed-captioning-quality-standards-tv-programs
- Netflix Partner Help Center, "Timed Text Style Guide: General Requirements": https://partnerhelp.netflixstudios.com/hc/en-us/articles/215758617-Timed-Text-Style-Guide-General-Requirements
- Interprefy, "The European Accessibility Act 2025 Captioning Requirements": https://www.interprefy.com/resources/blog/european-accessibility-act-captioning-requirements
- DOJ April 2024 Title II final rule, ADA.gov
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.