transcriptionétiquettes de locuteursaudio vers textediarisation

Comment transcrire plusieurs intervenants et les étiqueter

BMMamane B. MoussaAugust 22, 20269 min read

Summarize this article with:

TL;DR

Importez votre audio ou collez une URL dans CATT, activez les étiquettes de locuteurs, relisez et corrigez les noms attribués, puis exportez votre transcription en TXT, SRT, VTT ou dans un autre format.

Pour transcrire un audio avec plusieurs intervenants et les étiqueter, importez votre enregistrement dans l'outil audio-vers-texte, activez les étiquettes de locuteurs, puis relisez et renommez les attributions automatiques avant l'exportation.

Ce guide détaille tout le processus : préparation du fichier, exécution de la transcription avec les étiquettes de locuteurs activées, correction manuelle des étiquettes et exportation d'une transcription prête à partager ou à publier.

Pourquoi les étiquettes de locuteurs transforment la transcription

Lorsque vous transcrivez un entretien, une réunion, une table ronde ou un épisode de podcast, le texte brut peut vite devenir un mur de mots. Les étiquettes de locuteurs, aussi appelées diarisation, séparent la conversation en tours de parole et attribuent chaque tour à un locuteur. « Ce qui a été dit » devient ainsi « qui a dit quoi ».

Sans étiquettes, vous devez deviner qui a formulé chaque argument, ce qui est lent et source d'erreurs. Avec des étiquettes, vous pouvez survoler la structure d'une conversation, rechercher les interventions d'une personne précise et citer chacun fidèlement. Une transcription étiquetée se lit aussi mieux pour quiconque n'était pas présent, car questions et réponses se distinguent d'un simple coup d'œil.

Une bonne transcription multi-intervenants n'est pas un simple tas de texte. C'est un document que vous pouvez confier à un collègue, transformer en compte rendu de réunion, exploiter pour en extraire des citations ou convertir en sous-titres. Considérez l'étiquetage des locuteurs comme un travail en deux temps : laissez l'outil effectuer la séparation grossière, puis rendez-la fiable grâce à une relecture finale.

Avant de commencer : réunissez la bonne source

Une transcription multi-intervenants ne vaut que ce que vaut l'audio source. Il vous faut trois choses avant de commencer :

  • Un fichier audio ou vidéo sur votre appareil, ou l'URL d'un enregistrement public.
  • Un enregistrement suffisamment clair où chaque intervenant est audible.
  • Les noms ou rôles des intervenants, si vous les connaissez.

Ce troisième point compte plus qu'on ne le croit. Si vous connaissez les participants à l'avance, renommer Locuteur 1 et Locuteur 2 prend quelques secondes au lieu de relever de la devinette. Pour un entretien que vous avez mené, vous connaissez déjà les noms. Pour une réunion enregistrée, consultez l'invitation du calendrier ou la liste des participants de l'appel.

Si l'enregistrement est bruyant ou comporte beaucoup de chevauchements de voix, la séparation des locuteurs peut être moins fiable. Vous pouvez quand même le transcrire, mais prévoyez une passe de relecture plus longue. Un peu de préparation avant l'import fait gagner du temps ensuite.

Comment transcrire plusieurs intervenants et les étiqueter

Suivez ce flux de travail étape par étape pour passer d'un enregistrement multi-intervenants brouillon à une transcription propre et étiquetée.

  1. Ouvrez l'outil audio-vers-texte et importez votre enregistrement. Vous pouvez importer un fichier audio ou vidéo depuis votre appareil, ou coller une URL publique si l'enregistrement est hébergé en ligne.
  2. Choisissez la langue source si nécessaire. CATT prend en charge de nombreuses langues, donc les conversations multilingues ne sont pas un obstacle.
  3. Activez les étiquettes de locuteurs ou la diarisation. Cela indique à CATT de séparer l'audio en tours de parole plutôt que de renvoyer un bloc continu. Omettre cette étape est l'erreur la plus fréquente, car ajouter les étiquettes après coup signifie refaire le travail.
  4. Lancez la transcription. Patientez pendant que l'outil traite le fichier. Vous obtiendrez une transcription avec des étiquettes génériques telles que Locuteur 1, Locuteur 2, etc. CATT produit également un résumé par IA et des points d'action, qui vous aident à repérer les décisions clés avant de commencer l'édition ligne par ligne.
  5. Lisez la transcription une fois sans rien modifier. Repérez tout endroit où une étiquette semble erronée, où un locuteur change en pleine phrase ou où deux voix semblent fusionnées en un seul tour. Vous obtenez ainsi une carte des zones problématiques à corriger dans l'ordre.
  6. Renommez les étiquettes génériques. Remplacez Locuteur 1 par le vrai nom de la personne, Locuteur 2 par le nom suivant, et ainsi de suite pour chaque voix de l'enregistrement. Une passe de recherche-remplacement fonctionne très bien ici, surtout sur les longues transcriptions.
  7. Corrigez les lignes mal placées. Si une phrase figure sous le mauvais locuteur, déplacez-la sous la bonne étiquette. Si deux personnes ont parlé en même temps, décidez à qui revient la ligne ou répartissez-la manuellement entre les deux étiquettes.
  8. Exportez la transcription étiquetée. Choisissez TXT pour un document écrit propre, SRT ou VTT pour les sous-titres, ou tout autre format disponible adapté à votre flux de travail.

Les étapes 5 à 7 sont celles dont dépend la véritable qualité ; les deux sections suivantes s'y attardent plus en détail.

Rendre les étiquettes de locuteurs plus précises

Le facteur déterminant de la séparation automatique des locuteurs, c'est l'enregistrement lui-même. Pour améliorer les résultats avant l'import :

  • Enregistrez chaque intervenant sur un micro séparé lorsque c'est possible.
  • Réduisez le bruit de fond et l'écho. Les pièces aux surfaces dures réverbèrent le son et brouillent les signatures vocales entre elles.
  • Demandez aux intervenants de ne pas se couper la parole. Des tours de parole nets donnent à l'outil des limites claires sur lesquelles travailler.
  • Si un intervenant est bien moins fort que les autres, normalisez l'audio ou rapprochez-le du micro.
  • Évitez la musique diffusée pendant la conversation. Un jingle d'introduction passe encore, mais une nappe musicale continue rend les voix plus difficiles à séparer.
  • Testez d'abord avec un court extrait. Traitez les premières minutes d'un long enregistrement pour vérifier que votre configuration sépare bien les voix avant de lancer le fichier complet.

Aucune de ces mesures ne garantit une séparation parfaite, mais chacune élimine un obstacle courant. Des voix distinctes, des tours de parole nets et un faible niveau de bruit donnent à l'outil exactement ce dont il a besoin.

Relire et corriger les étiquettes de locuteurs

Les étiquettes automatiques obtiennent généralement la bonne structure, mais les noms et les cas particuliers exigent un humain. Parcourez la transcription en trois passes :

Première passe : lire et signaler. Lisez toute la transcription une fois et notez tout ce qui paraît suspect : des tours qui changent de sujet en plein milieu, de courtes interjections attribuées à la mauvaise personne, et des passages où le texte sonne comme une seule voix alors que le contenu en suggère deux.

Deuxième passe : renommer. Remplacez les étiquettes génériques par de vrais noms via recherche-remplacement. Utilisez un seul nom de façon cohérente partout. Si quelqu'un apparaît tantôt comme Sarah, tantôt comme Sarah K., choisissez une forme et tenez-vous-y, car des noms incohérents cassent la recherche par la suite.

Troisième passe : corriger les lignes signalées. Revenez à vos sections marquées. Écoutez l'audio à chaque endroit concerné, puis déplacez le texte sous la bonne étiquette ou scindez un tour partagé en deux. Quand deux personnes parlent en même temps, décidez quelles paroles comptent pour votre objectif et attribuez la ligne en conséquence. Si une formule est réellement inintelligible, marquez-la comme inaudible plutôt que de deviner, afin que personne ne cite un mot erroné plus tard.

Trois passes peuvent sembler plus lentes que corriger au fil de la lecture, mais c'est plus rapide en pratique. Renommer d'abord signifie que chaque correction ultérieure se fait sous les noms définitifs, donc vous ne refaites jamais une même correction.

Choisir un format d'exportation

Le bon format d'export dépend de ce qui suit :

  • TXT convient aux articles, aux notes, aux comptes rendus de réunion et partout où vous voulez un texte brut lisible avec le nom du locuteur attaché à chaque tour.
  • SRT et VTT conviennent aux sous-titres. Ils embarquent les informations de minutage avec le texte, si bien que chaque tour étiqueté s'affiche à l'écran pendant que la personne parle.
  • D'autres formats correspondent à des outils spécifiques, comme des éditeurs ou des plateformes de sous-titrage. Choisissez celui qui correspond au logiciel situé en aval de votre transcription.

En cas de doute, exportez d'abord en TXT pour le document écrit, puis exportez séparément un format de sous-titres si la transcription doit apparaître dans une vidéo. Conserver les deux versions couvre à la fois les besoins de rédaction et de publication.

Problèmes courants et solutions rapides

Chevauchements de voix importants. La parole simultanée est le cas le plus difficile pour tout système de diarisation. Attendez-vous à une passe de relecture plus longue et appuyez-vous sur l'audio lui-même pour trancher qui a dit quoi.

Voix qui se ressemblent. Quand deux intervenants ont des voix similaires, leurs tours peuvent être fusionnés. Les indices de contenu aident : les questions appartiennent généralement à l'intervieweur, les réponses à l'invité. Vérifiez chaque passage fusionné à l'aide de l'audio.

Un participant discret. Un intervenant qui parle doucement peut être absorbé par la voix forte la plus proche. Augmentez le volume de sa piste ou réenregistrez cette partie si vous en avez encore la possibilité ; sinon, prévoyez du temps de relecture supplémentaire pour ses tours de parole.

Enregistrements longs. Pour un fichier de plusieurs heures, corrigez en plusieurs passes plutôt qu'en une seule fois. Servez-vous du résumé par IA et des points d'action pour accéder directement aux segments les plus importants, puis nettoyez ceux-là en premier.

Pour conclure

La transcription multi-intervenants est une habitude en deux temps : laissez l'outil séparer les voix, puis consacrez une passe ciblée à rendre les étiquettes justes. Importez votre fichier dans l'outil audio-vers-texte, activez les étiquettes de locuteurs et considérez la relecture comme faisant partie du travail, non comme un bonus facultatif. Cette courte passe attentive à la fin fait toute la différence entre une transcription fiable et une autre que vous finirez par réécrire discrètement.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles