
La diarisation des locuteurs expliquée : comment les machines savent qui a dit quoi
Summarize this article with:
La diarisation des locuteurs est la partie de la transcription qui répond à « qui parle quand » en encodant chaque segment audio sous forme de vecteur vocal et en regroupant les vecteurs similaires en groupes de locuteurs. Sur un audio propre à deux locuteurs, les systèmes modernes atteignent un DER inférieur à 10 % (pyannote affiche 9,0 % sur VoxConverse, Deepgram v2 lancé en mai 2026), mais sur des audios multi-locuteurs difficiles comme DIHARD III, même les meilleurs systèmes plafonnent entre 11 et 14 %. Le principal mode de défaillance reste le chevauchement de parole. Maîtriser votre configuration d'enregistrement avant d'appuyer sur « enregistrer » élimine plus d'erreurs que n'importe quelle astuce de post-traitement.
La diarisation des locuteurs est la partie de la transcription qui détermine qui a dit quoi. Sans elle, une interview à deux personnes se lit comme un monologue sans interruption. Avec elle, la même transcription se lit comme une pièce de théâtre, chaque voix correctement attribuée et chaque citation traçable jusqu'à sa source.
Cet article couvre le pipeline derrière la diarisation moderne, pourquoi les voix peuvent être regroupées de manière fiable, les principaux modes de défaillance, comment interpréter la métrique de précision DER, et les étapes concrètes pour obtenir des étiquettes de locuteurs propres sur vos enregistrements.
Ce qu'est la diarisation — et ce qu'elle n'est pas
La diarisation répond à la question « qui parle quand », pas à « qui est précisément cette personne ». Un système de diarisation étiquette les locuteurs comme Locuteur 1, Locuteur 2, Locuteur 3 d'après leurs signatures acoustiques, sans recouper une base de données d'identités connues. Vous nommez les locuteurs après coup (« le Locuteur 1 est Alice ») et un simple rechercher-remplacer corrige toutes les occurrences.
Deux tâches connexes que l'on confond souvent avec la diarisation :
- Détection d'activité vocale (VAD). Détermine s'il y a de la parole, par opposition au silence, à la musique ou au bruit. La diarisation suppose que le VAD a déjà été exécuté. Consultez le fonctionnement du VAD pour l'étape en amont.
- Identification du locuteur. Compare une voix inconnue à des échantillons enregistrés de personnes connues (« cela ressemble à Alice »). Nécessite une base de données. La diarisation répond au besoin plus simple et plus courant.
Pour la plupart des cas d'usage d'interviews et de réunions, la diarisation sans identification suffit. Identifiez une fois, mettez à jour partout.
Le pipeline embedding-clustering
Un pipeline de diarisation standard comporte quatre étapes, mais les systèmes modernes les implémentent en une seule passe neuronale plutôt qu'en quatre appels séquentiels :
- VAD. Supprimer le silence, la musique de fond et les zones sans parole.
- Segmentation. Découper l'audio restant en fenêtres courtes, généralement de 1,5 à 3 secondes chacune.
- Embedding. Encoder chaque segment en un vecteur de grande dimension capturant les caractéristiques vocales de ce segment.
- Clustering. Regrouper les segments aux embeddings similaires en clusters de locuteurs et attribuer une étiquette à chaque cluster.
Le résultat est une séquence de tuples (heure de début, heure de fin, étiquette de locuteur). Une étape ASR distincte transcrit les mots ; la sortie de la diarisation associe les mots aux locuteurs.
Si vous voulez voir où la diarisation se situe par rapport à la transcription dans son ensemble, l'article sur le fonctionnement de la transcription par IA couvre tout le pipeline produit, de l'importation à la sortie formatée.
Pourquoi les embeddings vocaux fonctionnent
L'astuce qui rend la diarisation possible, c'est que les voix possèdent des signatures acoustiques stables, même lorsque les mots changent. L'étendue de la hauteur tonale, les fréquences des formants (les résonances qui distinguent les sons des voyelles), le débit de parole, les schémas respiratoires et les habitudes phonétiques sont étonnamment constants chez une même personne tout au long d'une conversation.
Un modèle d'embedding de locuteur moderne, tel qu'ECAPA-TDNN, TitaNet de NVIDIA NeMo ou les architectures x-vector, prend un court segment audio et produit un vecteur de 192 à 512 dimensions. Deux segments d'un même locuteur se regroupent étroitement dans cet espace ; deux segments de locuteurs différents se situent plus loin l'un de l'autre. Des algorithmes de clustering agglomératif ou spectral assurent le regroupement.
Les mathématiques ne sont pas le goulot d'étranglement. Le goulot d'étranglement, c'est ce qui se passe lorsque ces hypothèses s'effondrent.
Où la diarisation échoue
Cinq modes de défaillance que vous rencontrerez dans de vrais enregistrements :
Chevauchement de locuteurs
Lorsque deux personnes parlent en même temps, la plupart des systèmes en cascade choisissent un locuteur et abandonnent l'autre. Le mot prononcé en chevauchement va à une seule étiquette et la contribution de l'autre locuteur est perdue en silence. C'est la plus grande source unique d'erreur dans les tables rondes, les débats animés et les interviews rapides.
Les approches neurales de bout en bout, parfois appelées modèles EEND, traitent la diarisation comme un problème de prédiction multi-étiquettes et peuvent attribuer un segment à deux locuteurs simultanément. Cela gère mieux le chevauchement, mais augmente la complexité du système. Pour la plupart des flux de travail pratiques, la vraie solution reste une meilleure discipline micro.
Voix similaires
Deux locuteurs ayant une hauteur tonale, un accent et un débit similaires se retrouvent fusionnés dans un même cluster plus souvent qu'on ne le croit. Les panels composés de personnes du même sexe et les interviews familiales sont des cas problématiques fréquents. Le modèle n'a aucun moyen de savoir que les voix sont différentes si les embeddings se chevauchent significativement.
Des canaux microphone séparés par locuteur résolvent ce problème radicalement. Lorsque ce n'est pas possible, attendez-vous à un nettoyage manuel.
Énoncés courts
Une interjection d'un seul mot (« Ouais », « Exact », « Tout à fait ») manque souvent d'audio suffisant pour une attribution de locuteur fiable. La plupart des systèmes devinent (souvent à tort) ou ignorent le segment. Dans une interview en va-et-vient où une personne pose de courtes questions, le problème du mauvais locuteur devient très visible.
Voix en arrière-plan
Une télévision en arrière-plan, une seconde conversation audible à travers un mur mince ou une lecture audio depuis un téléphone sont tous traités comme de nouveaux locuteurs par le système de diarisation. Votre interview à deux personnes affiche soudain quatre locuteurs : les deux participants plus ceux du journal télévisé. Enregistrer dans un espace calme est la solution économique.
Estimation du nombre de locuteurs
La plupart des systèmes détectent automatiquement le nombre de locuteurs ou acceptent un indice. La détection automatique est imparfaite. La diarisation de Deepgram, par exemple, détecte automatiquement sans exiger de saisie du nombre et revendique des résultats précis avec 16 locuteurs ou plus. Pyannote accepte un nombre de locuteurs comme indice facultatif. Lorsqu'un outil que vous utilisez prend en charge ce paramètre et que vous connaissez le nombre, fournissez-le. Lorsque l'outil estime automatiquement, vérifiez attentivement la première minute du résultat.

Le taux d'erreur de diarisation (DER) expliqué
Le DER est la métrique de précision standard pour la diarisation. La formule combine trois types d'erreurs :
- Confusion de locuteur. Bonne parole détectée, mauvais locuteur attribué.
- Parole manquée. De la vraie parole étiquetée comme silence.
- Fausse alarme. Du silence ou du bruit étiqueté comme parole.
DER = (fausses alarmes + parole manquée + confusions de locuteur) / durée totale de parole de référence.
Un DER inférieur à 10 % est généralement considéré comme bon dans la plupart des domaines audio réels.
| Système | Benchmark | DER |
|---|---|---|
| pyannote (pyannote.ai) | VoxConverse | 9,0 % |
| Picovoice Falcon | VoxConverse | 10,3 % |
| Amazon Transcribe | VoxConverse | 11,1 % |
| PyannoteAI | DIHARD III | 11,2 % |
| DiariZen (open source) | DIHARD III | 13,3 % |
| EEND-TA | DIHARD III | 14,5 % |
| Diarisation Google STT | VoxConverse | 50,2 % |
Sources : benchmark ouvert de Picovoice (VoxConverse) et benchmarks de recherche indépendants (DIHARD III), juillet 2026.
Un DER de 10 % signifie qu'environ une seconde sur dix porte la mauvaise étiquette de locuteur. Pour un fichier de 60 minutes, cela représente 6 minutes de parole mal attribuée. Est-ce grave ? Cela dépend de votre cas d'usage. Un résumé approximatif de réunion le tolère. Une transcription judiciaire, non.
Mon avis : l'écart entre les meilleurs outils open source et les modules commerciaux les plus faibles est énorme, plus de 40 points de pourcentage aux extrêmes. Choisir un outil en fonction du modèle de diarisation sous-jacent plutôt que de la marque globale compte ici plus que pour presque toute autre fonctionnalité de transcription.
Pour comprendre comment la précision est mesurée dans l'ensemble de la chaîne de transcription, consultez la précision de la transcription expliquée.
Étapes pratiques pour une diarisation propre
Si vous contrôlez l'enregistrement, voici les leviers qui comptent le plus :
- Un microphone par locuteur. Micros USB, micros cravate ou casques pour chaque participant. Cela élimine la plupart des difficultés de diarisation avant même qu'elles n'apparaissent.
- Canaux audio séparés si possible. L'enregistrement multipiste (Riverside, Zencastr, ou capture locale sur la machine de chaque participant) permet au système de diarisation de travailler canal par canal au lieu de séparer un flux mixé. L'attribution basée sur les canaux est essentiellement résolue.
- Brèves pauses entre les tours de parole. Un intervalle d'une demi-seconde aide le système à détecter les frontières entre locuteurs de manière fiable.
- Environnement calme. Coupez les télévisions, fermez les portes, demandez aux autres personnes présentes de rester silencieuses.
- Indiquez le nombre de locuteurs si pris en charge. Lorsque vous savez combien de locuteurs figurent dans le fichier et que l'outil accepte cet indice, utilisez-le.
Pour les enregistrements de réunions en particulier, le guide pratique comment transcrire une réunion Zoom couvre la configuration d'enregistrement par canal qui rend la diarisation presque parfaite.
Quand vous recevez le fichier après coup
Si vous n'avez pas contrôlé l'enregistrement, vous travaillez avec ce que vous avez. Le processus de rattrapage :
- Utilisez un outil de diarisation de haute qualité. Pyannote, Deepgram avec
diarize_model=latest(le paramètre actuellement recommandé, selon la documentation Deepgram de mai 2026, remplaçant le paramètre obsolètediarize=true), ou AssemblyAI avecspeaker_labels: true. Les trois offrent une excellente précision sur les audios typiques d'interviews et de réunions. - Fournissez le nombre de locuteurs lorsque l'outil l'accepte. Là où l'API prend en charge cet indice, il réduit le bruit d'estimation.
- Relisez attentivement la première minute. Si les étiquettes sont justes au début, elles le sont généralement partout. Les erreurs se concentrent au début, lorsque le modèle calibre les identités des locuteurs.
- Cherchez les points de confusion connus. Les interjections courtes, les segments chevauchés et les changements de locuteur sont là où les erreurs se concentrent.
- Nommez les locuteurs manuellement une seule fois. Le rechercher-remplacer s'occupe du reste.
Si vous avez simplement besoin d'une transcription propre avec étiquettes de locuteurs sans monter votre propre pipeline de diarisation, l'outil de transcription de réunions de CATT exécute la diarisation automatiquement dès l'importation.
Ce que permettent les transcriptions diarisées
Une transcription avec étiquettes de locuteurs ouvre des flux de travail qu'une transcription sans étiquettes ne peut pas prendre en charge :
- Comptage de mots par locuteur. Qui domine vos réunions ?
- Analyse par locuteur. Sentiment par participant, sujets soulevés par chaque personne.
- Meilleurs résumés par LLM. Le modèle peut produire « Alice a soutenu X, Bob a répliqué Y » au lieu de « les participants ont discuté ».
- Extraction de citations. Rassemblez toutes les interventions du Locuteur 2 pour une note de recherche ou un témoignage client.
Pour la transcription d'interviews en particulier, le guide sur comment transcrire un enregistrement d'interview montre comment les étiquettes de locuteurs se traduisent en sortie structurée.
Quand vous n'avez pas besoin de la diarisation
Si l'enregistrement provient d'un seul locuteur (un mémo vocal, un cours, un podcast solo), désactivez la diarisation. La transcription est traitée plus rapidement et vous évitez le petit risque qu'une erreur de diarisation insère une rupture de locuteur fantôme dans un monologue.
Pour tout ce qui comporte deux voix ou plus, activer la diarisation vaut le coup. Le coût est minime et la différence de lisibilité sur un long enregistrement est significative.
FAQ
Qu'est-ce que la diarisation des locuteurs ?
La diarisation des locuteurs segmente un enregistrement audio par locuteur, en étiquetant chaque segment comme « Locuteur 1 », « Locuteur 2 », etc., d'après les caractéristiques vocales. Elle répond à « qui parle quand », pas à « qui est précisément cette personne ». Cette dernière étape nécessite un système distinct d'identification du locuteur, avec des échantillons de voix préalablement enregistrés.
Qu'est-ce que le taux d'erreur de diarisation (DER) ?
Le DER est la métrique de précision standard. Il additionne trois types d'erreurs : fausses alarmes de parole (du silence qualifié de parole), parole manquée (de la vraie parole qualifiée de silence) et confusion de locuteur (la bonne parole, mais avec la mauvaise étiquette), puis divise par la durée totale de parole de référence. Un DER inférieur à 10 % est généralement considéré comme bon. Les API commerciales modernes se situent entre environ 11 % et plus de 50 % sur le benchmark VoxConverse, selon le fournisseur.
Comment la diarisation automatique des locuteurs gère-t-elle le chevauchement de parole ?
La plupart des systèmes en cascade choisissent un seul locuteur par segment et abandonnent complètement l'autre voix. Les systèmes neuronaux de bout en bout comme EEND traitent la diarisation comme une prédiction multi-étiquettes et peuvent donc signaler qu'un segment contient deux locuteurs simultanément. Le chevauchement reste néanmoins le mode de défaillance le plus difficile. La solution pratique : une meilleure discipline micro avant le début de l'appel.
Puis-je spécifier le nombre de locuteurs pour améliorer la précision ?
Certains outils permettent de définir un nombre de locuteurs (Deepgram détecte automatiquement sans avoir besoin de cette information ; pyannote l'accepte comme indice). Lorsqu'un outil prend en charge ce paramètre et que vous connaissez le nombre, le fournir réduit l'erreur d'estimation. Si vous ne le connaissez pas ou si l'outil l'estime automatiquement, relisez la première minute du résultat pour repérer rapidement les erreurs d'étiquetage.
Quels enregistrements donnent les meilleurs résultats de diarisation ?
Des enregistrements propres avec un microphone par locuteur ou des canaux audio séparés pour chaque participant. Chaque locuteur sur son propre canal rend la diarisation quasi triviale. Des espaces silencieux, de brèves pauses entre les tours de parole et l'absence de voix en arrière-plan aident également considérablement. Si l'enregistrement est déjà mixé, une API de diarisation de haute qualité associée à une relecture manuelle de la première minute constitue la meilleure solution de rattrapage.
Sources
- Documentation Deepgram sur la diarisation des locuteurs
- Benchmark Picovoice de diarisation des locuteurs (VoxConverse)
- AssemblyAI : meilleures bibliothèques et API de diarisation des locuteurs 2026
- Évaluation comparative des modèles de diarisation, arxiv 2509.26177
- Repousser les limites de la diarisation de bout en bout, Interspeech 2025
- Deepgram : présentation de Batch Diarization V2 (mai 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.