Conformité WCAG avec les transcriptions : SC 1.2 décryptée (2026)
WCAGaccessibilitéconformité

Conformité WCAG avec les transcriptions : SC 1.2 décryptée (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

Ceci n'est pas un avis juridique. Les critères WCAG sont des normes techniques, pas des instruments juridiques. Qu'une réglementation donnée exige une conformité, et à quel niveau, dépend de votre juridiction, du type de votre organisation et de la loi concernée. Consultez un conseil juridique pour toute décision de conformité.

Les critères qui impliquent les transcriptions

Les transcriptions sont l'outil d'accessibilité le plus polyvalent pour les contenus audio, mais elles ne couvrent qu'une partie du périmètre des WCAG 1.2. Le SC 1.2.1 exige une transcription pour les contenus uniquement audio. Le SC 1.2.3 permet d'utiliser une transcription comme alternative au média pour la vidéo au niveau A. Au-delà de ces deux critères, les transcriptions soutiennent le travail mais ne remplacent ni les sous-titres ni l'audiodescription.

Les WCAG 2.2 ont laissé la directive 1.2 entièrement inchangée par rapport aux 2.1. Les critères ci-dessous s'appliquent à l'identique dans les deux versions. Les nouveaux critères des WCAG 2.2 portent sur la navigation au clavier, les cibles tactiles et l'accessibilité cognitive, pas sur les médias temporels.

Comment le SC 1.2 s'organise

Les neuf critères de succès de la directive 1.2 se répartissent sur trois niveaux de conformité :

NiveauCritères de succès
A (minimum)1.2.1, 1.2.2, 1.2.3
AA (cible pour la plupart des contenus publics)1.2.4, 1.2.5
AAA (aspirationnel, rarement exigé)1.2.6, 1.2.7, 1.2.8, 1.2.9

La plupart des réglementations ciblent le niveau AA. L'ADA Title II aux États-Unis exige les WCAG 2.1 AA pour les États et les collectivités locales (dates de conformité repoussées à avril 2027 et avril 2028 selon la taille de la population). La Section 508 pour les agences fédérales américaines exige les WCAG 2.0 AA. L'Acte européen sur l'accessibilité de l'UE, en vigueur depuis juin 2025 via l'EN 301 549, référence actuellement les WCAG 2.1 AA. Pour une comparaison plus approfondie de ces cadres par pays, voir les lois d'accessibilité par pays.

SC 1.2.1 : Contenu audio seul ou vidéo seule (préenregistré), niveau A

Pour un contenu uniquement audio, fournissez une transcription texte. Pour un contenu vidéo seule (sans son), fournissez une transcription ou une piste audio décrivant ce qui est montré.

Un épisode de podcast, un cours enregistré sans vidéo ou tout fichier audio autonome relève de ce critère. La transcription doit restituer les mêmes informations que l'audio : les paroles, les sons non verbaux pertinents et l'identification des locuteurs lorsqu'il y en a plusieurs.

Ce qui compte comme suffisant : le W3C précise « descriptions textuelles correctement séquencées des informations visuelles et sonores basées sur le temps ». Un résumé ne convient pas. Une transcription qui saute des passages ou omet du contenu clé ne convient pas. De légères variations de mots et des noms propres mal orthographiés sont généralement acceptables tant que le sens est préservé.

La transcription n'a pas besoin d'être intégrée sur la même page que l'audio, mais elle doit être facilement accessible depuis celle-ci. Du HTML sur la page ou du HTML lié satisfont tous deux le critère. Une transcription PDF peut satisfaire l'exigence, mais crée des contraintes d'accessibilité supplémentaires ; le HTML est la voie la plus propre.

Une exception : si le contenu uniquement audio est lui-même une alternative au média d'un contenu textuel déjà présent sur la page, et qu'il est clairement signalé comme tel, le SC 1.2.1 ne s'applique pas.

Outil de téléversement audio ConvertAudioToText pour générer des transcriptions
Outil de téléversement audio ConvertAudioToText pour générer des transcriptions

Si vous avez simplement besoin d'une transcription propre pour un podcast ou un audio enregistré, l'outil audio-vers-texte de ConvertAudioToText produit une transcription texte que vous pouvez télécharger, relire et publier à côté de votre lecteur audio.

SC 1.2.2 : Sous-titres (préenregistré), niveau A

Toute vidéo préenregistrée avec audio sur un site accessible au public doit avoir des sous-titres synchronisés.

« Synchronisés » est le maître-mot. Les sous-titres doivent apparaître pendant les propos qu'ils représentent, pas avant ni après en bloc. Ils doivent aussi inclure les éléments audio non verbaux pertinents : « [porte qui se ferme] », « [musique entraînante] », étiquettes de locuteurs pour les contenus à plusieurs personnes.

Les WCAG ne fixent aucun pourcentage de précision spécifique. Les recommandations de la FCC et du DOJ pointent vers 99 % comme objectif pour les contenus diffusés et publics. Les professionnels de l'accessibilité considèrent généralement 95 % comme le plancher pratique. Les sous-titres générés automatiquement par les plateformes vidéo sont généralement en défaut sur les noms propres, les termes techniques, les locuteurs qui se chevauchent et l'audio non verbal.

Le processus pour des sous-titres conformes :

  1. Téléversez la vidéo directement dans un outil de transcription ou extrayez l'audio pour une conversion vidéo-vers-texte.
  2. Générez un fichier de sous-titres horodaté SRT ou VTT.
  3. Effectuez une relecture humaine : corrigez les noms, les termes techniques, ajoutez les indices audio non verbaux, vérifiez le minutage.
  4. Téléchargez le fichier relu chez votre hébergeur vidéo comme piste de sous-titres manuelle.

Les sous-titres automatiques de votre hébergeur vidéo sont un point de départ, pas un aboutissement.

SC 1.2.3 : Audiodescription ou alternative au média (préenregistré), niveau A

Pour une vidéo préenregistrée synchronisée (vidéo avec audio), fournissez soit une audiodescription, soit une alternative textuelle complète au média. À vous de choisir.

C'est le critère le plus souvent mal interprété. Le « ou » est bien réel et déterminant au niveau A.

Option A, l'audiodescription : un narrateur distinct décrit le contenu visuel pendant les pauses naturelles du dialogue. « Elle marche jusqu'au tableau blanc et entoure le troisième élément de la liste. » Cela nécessite d'enregistrer une piste audio supplémentaire.

Option B, l'alternative au média : un document texte couvrant tout ce que contient la vidéo, dialogue et contenu visuel intégrés. La personne qui ne peut ni voir ni entendre la vidéo doit pouvoir lire ce document et obtenir les mêmes informations.

Pour les vidéos de type face caméra, les cours magistraux et les présentations où le contenu visuel est relativement peu dense, l'option B est généralement plus facile à produire. Partez d'une transcription complète de l'audio, puis ajoutez de brèves annotations visuelles lors de la relecture.

Pour les vidéos de démonstration, les présentations de produit ou tout contenu où l'écran ou l'action porte un contenu significatif non décrit dans le dialogue, l'audiodescription sert mieux les utilisateurs.

Remarque : si vous choisissez l'option B (l'alternative au média) pour le 1.2.3, vous devez quand même satisfaire le 1.2.5 au niveau AA, qui exige spécifiquement une audiodescription.

SC 1.2.4 : Sous-titres (direct), niveau AA

Les diffusions en direct, les webinaires et les événements virtuels avec audio nécessitent des sous-titres en temps réel.

Les sous-titres préenregistrés laissent le temps d'une relecture humaine. Pas les sous-titres en direct. Les principales options :

CART (Communication Access Realtime Translation) : un sténographe professionnel sous-titre en temps réel. La précision est élevée. Les services CART coûtent typiquement de l'ordre de 60 $ l'heure pour l'anglais, jusqu'à 120 à 200 $ l'heure selon le sujet, le prestataire et la durée. L'étalon-or pour les contenus en direct à forts enjeux.

Reconnaissance automatique de la parole (ASR) : services d'ASR en direct de plateformes comme Zoom, Google Meet, Microsoft Teams et autres. Rapides et peu coûteux, mais la précision chute avec plusieurs locuteurs, des accents, du vocabulaire technique ou des problèmes de qualité audio.

Hybride : ASR avec un relecteur humain qui surveille et corrige en temps réel. Équilibre coût et précision pour la plupart des usages.

Pour une conformité au niveau AA, les WCAG exigent que les sous-titres soient exacts et disponibles au bon moment. Le CART atteint fiablement cette barre. L'ASR seul y répond généralement pour des contenus maîtrisés, à locuteur unique et à l'audio clair. Les événements complexes ou à forts enjeux justifient le CART ou une couverture hybride.

Pour la transcription de réunions en direct, la plupart des équipes utilisent l'ASR intégré de leur plateforme de visioconférence pendant l'événement, puis font passer l'enregistrement d'après-événement dans un outil de transcription plus précis pour produire la version corrigée et archivée.

SC 1.2.5 : Audiodescription (préenregistré), niveau AA

Au niveau AA, l'audiodescription des vidéos préenregistrées est requise, pas optionnelle.

Cela referme la souplesse que le 1.2.3 offre au niveau A. Impossible désormais de substituer une alternative au média. Si vous avez fourni une alternative textuelle pour le 1.2.3, le 1.2.5 ajoute une nouvelle exigence par-dessus.

La voie pratique qui satisfait les deux : fournir une audiodescription pour répondre au 1.2.5. Ce faisant, vous satisfaites aussi automatiquement le 1.2.3, puisque l'audiodescription est l'une des deux options acceptables à ce niveau.

La combinaison AA pratique pour le contenu vidéo : sous-titres (1.2.2) plus audiodescription (1.2.5). Beaucoup de processus de conformité traitent ces deux-là comme le duo du niveau AA.

Un raccourci utile pour les contenus où les pauses du dialogue suffisent : pendant la production, laissez volontairement des espaces dans la narration pour insérer ensuite l'audiodescription. Intégrer des descriptions a posteriori dans un dialogue dense et ininterrompu est nettement plus difficile que de concevoir en conséquence.

Mon avis : pour la plupart des producteurs de vidéos pédagogiques et d'entreprise, le vrai défi n'est pas de comprendre les critères mais de construire le processus. Considérer les sous-titres et les transcriptions comme faisant partie de la production plutôt que de la post-production divise le coût par deux.

SC 1.2.6 : Langue des signes (préenregistré), niveau AAA

Pour les vidéos préenregistrées avec audio, fournissez une interprétation en langue des signes.

Niveau AAA, rarement exigé par la réglementation. La plupart des contenus publics ne le remplissent pas, et les objectifs de conformité AA ne l'exigent pas. Il concerne surtout les contenus destinés spécifiquement aux publics sourds ou les communications à forts enjeux dans les services publics et la santé.

SC 1.2.7 : Audiodescription étendue (préenregistré), niveau AAA

Lorsque l'audiodescription standard est insuffisante parce que les pauses naturelles manquent dans le dialogue, fournissez une audiodescription étendue : la vidéo se met en pause pour permettre l'insertion d'une description plus longue, puis reprend.

Niveau AAA. Rare en pratique car la plupart des contenus comportent suffisamment de pauses. Cas d'application : contenus pédagogiques à narration dense continue et informations visuelles critiques.

SC 1.2.8 : Alternative au média (préenregistré), niveau AAA

Un document texte complet couvrant tout le contenu audio et visuel d'une vidéo synchronisée, pour tout utilisateur qui ne peut accéder ni à la piste audio ni à la piste visuelle.

Cela va au-delà des sous-titres ou de la seule audiodescription. Le document doit contenir :

  • Tout le dialogue avec identification des locuteurs
  • Tout l'audio non verbal pertinent
  • Tout le contenu visuel significatif, y compris le texte à l'écran, les descriptions du décor et les actions des personnages
  • Une navigation structurale (chapitres, changements de scène)

Une transcription bien préparée fournit la couche dialoguée. Le travail d'annotation visuelle reste humain, mais partir d'une transcription complète avec locuteurs identifiés réduit considérablement le temps nécessaire.

SC 1.2.9 : Contenu audio seul (direct), niveau AAA

Alternative textuelle en temps réel pour les contenus uniquement audio en direct : radio en direct, conférences audio, diffusions uniquement audio.

Niveau AAA, rarement atteint en pratique. Les alternatives textuelles en temps réel pour les flux uniquement audio nécessitent généralement un ASR en direct ou un sous-titreur en direct. Très peu de diffusions uniquement audio en direct remplissent ce critère.

Un processus de conformité AA concret

Pour un site avec podcasts et vidéos enregistrées visant les WCAG AA :

Pour les épisodes de podcast (SC 1.2.1)

  1. Transcrivez l'audio avec un outil audio-vers-texte.
  2. Relecture humaine : corrigez les noms, les termes techniques, vérifiez les étiquettes de locuteurs.
  3. Publiez la transcription relue en HTML sur la page de l'épisode ou juste à proximité.

Pour les vidéos enregistrées (SC 1.2.2 et 1.2.5)

  1. Transcrivez pour obtenir un fichier de sous-titres horodaté (SRT ou VTT).
  2. Relecture humaine : exactitude, étiquettes de locuteurs, indices audio non verbaux.
  3. Téléchargez les sous-titres chez votre hébergeur vidéo.
  4. Enregistrez ou commandez une audiodescription couvrant le contenu visuel pendant les pauses du dialogue.
  5. Publiez l'audiodescription comme piste audio alternative.

Pour les webinaires en direct (SC 1.2.4)

  1. Pendant l'événement en direct : utilisez des sous-titres en direct CART ou ASR.
  2. Après l'événement : faites passer l'enregistrement dans un outil de transcription pour la version archivée.
  3. Relisez et corrigez les sous-titres archivés avant de les publier avec l'enregistrement.

Défauts de conformité fréquents

Sous-titres automatiques publiés sans relecture. Les sous-titres générés automatiquement oublient les noms propres, le vocabulaire technique, les étiquettes de locuteurs et les sons non verbaux. La relecture n'est pas optionnelle.

Un résumé au lieu d'une transcription. Le SC 1.2.1 exige les mêmes informations que l'audio, pas un résumé édité. Publier des « notes d'épisode » à la place d'une transcription ne satisfait pas le critère.

Aucune description visuelle pour le contenu visuel. Une démo produit qui montre l'interface sans narrer ce qui est affiché nécessite une audiodescription ou une alternative au média. Les sous-titres seuls ne couvrent pas l'information purement visuelle.

Transcription derrière un mur de téléchargement. Un téléchargement PDF satisfait la lettre du critère, mais crée une friction d'accès pour les utilisateurs de lecteurs d'écran. Du HTML sur la page ou du HTML lié est la voie la plus propre.

Absence d'identification des locuteurs dans les contenus à plusieurs voix. Quand deux personnes ou plus parlent, les sous-titres comme les transcriptions doivent identifier qui dit quoi.

Documentation pour les audits de conformité

Quand vous documentez votre processus d'accessibilité :

  • Nommez la norme cible (WCAG 2.2 niveau AA, ou WCAG 2.1 AA si c'est ce qu'exige votre juridiction).
  • Décrivez votre processus de génération (transcription IA suivie d'une relecture humaine).
  • Précisez quel SC chaque livrable satisfait et pour quels contenus.
  • Signalez les exceptions connues et les délais de correction.
  • Référencez les outils utilisés pour la génération. La conformité appartient à votre processus, pas à un outil unique.

Pour en savoir plus sur les cadres juridiques qui référencent ces critères, voir les lois d'accessibilité par pays et la conformité ADA pour le contenu audio. Pour la dimension expérience utilisateur, les transcriptions pour les utilisateurs de lecteurs d'écran explique comment ces livrables sont concrètement utilisés.

Questions fréquentes

Une transcription satisfait-elle toutes les exigences WCAG 1.2 ?

Non. Une transcription satisfait le SC 1.2.1 pour les contenus uniquement audio et peut satisfaire l'option « alternative au média » du SC 1.2.3, mais elle ne satisfait ni le SC 1.2.2 (les sous-titres doivent être synchronisés), ni le SC 1.2.5 (qui exige une véritable audiodescription pour la vidéo), ni les critères relatifs aux contenus en direct.

Quelle est la différence entre le SC 1.2.3 et le SC 1.2.5 ?

Le SC 1.2.3 est de niveau A et vous laisse le choix : fournir soit une audiodescription, soit une alternative textuelle complète pour la vidéo préenregistrée. Le SC 1.2.5 est de niveau AA et supprime ce choix en exigeant spécifiquement une audiodescription. Si vous remplissez le 1.2.5 par une audiodescription, vous satisfaites automatiquement le 1.2.3.

Les sous-titres générés automatiquement par YouTube satisfont-ils le SC 1.2.2 ?

Pas à eux seuls. Les WCAG ne fixent aucun pourcentage de précision spécifique, mais les recommandations de la FCC et du DOJ visent 99 % comme objectif, et la pratique du secteur considère 95 % comme un plancher minimal. Les sous-titres générés automatiquement oublient les noms propres, les termes techniques, l'identification des locuteurs et les sons non verbaux. Une relecture humaine est indispensable avant de les considérer comme conformes.

Quelles réglementations exigent réellement les WCAG 2.2 ?

À mi-2026, la plupart des réglementations renvoient encore aux WCAG 2.1 AA ou à des versions antérieures. L'ADA Title II (États et collectivités locales américains) exige les WCAG 2.1 AA. La Section 508 (administration fédérale américaine) exige les WCAG 2.0 AA. L'EAA européen et l'EN 301 549 actuelle référencent les WCAG 2.1 AA. L'adoption des WCAG 2.2 dans des réglementations contraignantes est en cours.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles