
Corriger les mauvaises étiquettes de locuteurs dans votre transcription (guide 2026)
Summarize this article with:
Les mauvaises étiquettes de locuteurs relèvent généralement de l'un de trois problèmes : le modèle a donné de mauvais noms à des groupes de locuteurs pourtant correctement identifiés, il a fusionné deux voix similaires en un seul locuteur, ou il a scindé un même locuteur en plusieurs étiquettes. La plupart des cas se résolvent en moins de 20 minutes grâce à une passe de correction systématique. La configuration de l'enregistrement compte davantage que le choix de l'outil, et passer à un moteur de diarisation plus performant règle le reste.
Les mauvaises étiquettes de locuteurs peuvent être corrigées. Le diagnostic prend généralement deux minutes ; la correction demande entre 10 secondes et 30 minutes selon la profondeur du problème.
Identifier le type d'erreur réellement survenu
Avant de chercher une correction, déterminez lequel des trois types de panne vous avez sous les yeux :
Inversion d'étiquettes : le modèle a correctement identifié le locuteur A et le locuteur B comme deux personnes distinctes, mais les a nommés à l'envers. Chaque ligne attribuée à « Locuteur 1 » appartient en réalité au locuteur 2. Si vous constatez une inversion nette, c'est le cas rapide.
Fusion de locuteurs : deux personnes aux voix similaires ont été regroupées en un seul locuteur. Une seule étiquette traverse une section de dialogue que vous savez venir de deux personnes différentes.
Scission de locuteur : une même personne s'est vu attribuer deux étiquettes ou plus à différents moments de l'enregistrement. Vous verrez « Locuteur 1 » pendant les 10 premières minutes, puis « Locuteur 3 » prendra le relais à mi-parcours, alors qu'il s'agit clairement de la même voix.
Pour une explication plus approfondie du fonctionnement de la diarisation, notre article explicatif sur la diarisation des locuteurs couvre les mécanismes sous-jacents. Ici, l'objectif est de réparer ce qui est déjà cassé.
Pourquoi ces erreurs se produisent
La diarisation fonctionne en construisant une empreinte vocale à partir des premières secondes de l'audio de chaque locuteur, puis en regroupant les segments suivants par similarité acoustique. Plusieurs conditions font dérailler ce regroupement :
- Voix similaires. Deux locuteurs dont les plages de hauteur vocale se chevauchent, au débit similaire ou à l'accent identique fournissent au modèle des segments hautement ambigus qui basculent d'un groupe à l'autre.
- Audio téléphonique en bande étroite. Les appels téléphoniques traditionnels compressent l'audio à environ 300-3400 Hz, aplanissant les différences vocales qui sépareraient les locuteurs sur un enregistrement pleine bande.
- Locuteurs discrets ou éloignés. Un rapport signal/bruit faible signifie que le modèle dispose de moins de données vocales pour établir son empreinte.
- Nouveaux locuteurs arrivant en cours d'enregistrement. Le modèle a déjà stabilisé ses groupes ; il tend à attribuer la nouvelle voix au groupe existant le plus proche plutôt qu'à en créer un nouveau.
- Micro unique pour plusieurs locuteurs. Une salle de conférence avec un micro central placé à des distances variables de chaque participant constitue le scénario mono-canal le plus difficile.
Correction 1 : Renommer les étiquettes (cas d'inversion)
Dans le cas d'une inversion, le modèle a déjà identifié les bons groupes. Il vous suffit de corriger les noms.
La plupart des éditeurs de transcription permettent de cliquer sur une étiquette de locuteur pour la renommer. Le renommage s'applique partout où cette étiquette apparaît dans le document. Cela prend environ 10 secondes par locuteur. Si vous avez une inversion nette entre deux ou trois locuteurs, c'est toute la correction.
Vérification : après le renommage, lisez les deux premières minutes de la transcription en écoutant l'audio. Si l'attribution correspond désormais aux voix, c'est terminé.
Correction 2 : Passe de correction manuelle (cas de fusion et de scission)
Pour des locuteurs fusionnés ou scindés, le simple renommage ne suffira pas. Vous devez réattribuer les segments individuellement.
Le flux de travail efficace :
- Ouvrez la transcription dans votre éditeur à côté du lecteur audio.
- Écoutez les 60 à 90 premières secondes tout en lisant. Notez le schéma d'erreur : un même locuteur est-il scindé entre deux étiquettes ? Deux locuteurs apparaissent-ils tous deux sous une seule étiquette ?
- Identifiez un locuteur que vous pouvez ancler clairement. Trouvez un segment dont vous êtes certain qu'il lui appartient, notez l'étiquette et utilisez-la comme référence.
- Poursuivez la lecture. Réattribuez tout paragraphe qui ne correspond pas à son étiquette. La plupart des éditeurs permettent de cliquer sur un segment et de changer son locuteur.
- Utilisez la chronologie audio pour toute limite dont vous n'êtes pas sûr. L'affichage des horodatages montre généralement où un segment de locuteur se termine et où commence le suivant.
- Après la première passe complète, relisez la transcription corrigée. Une seconde erreur apparaît souvent une fois la première corrigée.
Pour une réunion de 60 minutes avec trois locuteurs, prévoyez 10 à 20 minutes. Davantage de locuteurs ou des erreurs plus nombreuses portent ce temps vers 30 minutes.

Correction 3 : Fournir des échantillons vocaux (pour les outils prenant en charge l'enrôlement)
Certains outils permettent de pré-entraîner la reconnaissance des locuteurs sur des voix connues.
Otter.ai prend en charge l'enrôlement d'empreintes vocales via Paramètres > Locuteurs > Ajouter un nouveau locuteur. Vous fournissez un échantillon vocal propre de 30 à 60 secondes par personne. Une fois enrôlé, Otter reconnaît automatiquement ce locuteur dans les enregistrements futurs. Selon la documentation d'Otter, la précision atteint environ 90 à 95 % avec deux à quatre locuteurs distincts et chute à 70-85 % lorsque six locuteurs ou plus sont présents. La limite pratique est de 10 locuteurs enrôlés.
AssemblyAI aborde l'identification des locuteurs différemment : au lieu d'échantillons vocaux, il utilise le contexte conversationnel de la transcription pour déduire les identités des locuteurs (comme « John Smith » ou « Agent ») et les substitue aux étiquettes génériques. Cela fonctionne sans pré-enrôlement, mais s'avère moins fiable lorsque la conversation ne contient pas de signaux d'identité clairs.
L'enrôlement est particulièrement utile pour les formats récurrents : podcasts d'interviews avec des invités fidèles, points d'équipe hebdomadaires ou appels clients réguliers où les mêmes voix reviennent sans cesse.
Correction 4 : Re-transcrire avec un moteur de diarisation plus performant
Si les erreurs sont systématiques plutôt qu'occasionnelles, c'est l'outil lui-même le problème.
La qualité de la diarisation varie sensiblement d'un service à l'autre en 2026 :
| Outil | Fonctionnalité de diarisation notable | Limite de nombre de locuteurs |
|---|---|---|
| AssemblyAI | Taux d'erreur de comptage des locuteurs de 2,9 % ; prise en charge du streaming temps réel | 10 (streaming), 20 (asynchrone) |
| Deepgram Nova-3 | Compatible avec tous les modèles batch Nova ; détecte automatiquement le nombre de locuteurs | Non publié |
| Pyannote 4.0 (Community-1) | Open source ; état de l'art sur les benchmarks standards ; auto-hébergé | Variable selon la configuration |
| Speechmatics | Revendique un avantage de précision de 25 % ; options cloud et on-premise | Non publié |
| Otter.ai | Enrôlement d'empreintes vocales par espace de travail ; idéal pour les locuteurs récurrents | 10 locuteurs enrôlés |
Les outils basés sur Whisper brut sans couche de diarisation ajoutée n'incluent aucune attribution de locuteur. Whisper transcrit les mots mais ne segmente pas par locuteur. La plupart des déploiements ajoutent Pyannote par-dessus pour obtenir la diarisation. Si votre outil actuel produit systématiquement de mauvaises étiquettes sur de l'audio multi-locuteurs, il utilise peut-être un module de diarisation faible ou mal configuré plutôt qu'un module dédié.
Pour les compromis entre précision et coût de ces API, la comparaison des meilleures API de reconnaissance vocale pour 2026 les détaille en profondeur.
Correction 5 : Modifier votre façon d'enregistrer à l'avenir
Pour tout enregistrement que vous possédez déjà, les options de correction sont les Corrections 1 à 4 ci-dessus. Pour les enregistrements futurs, un seul changement élimine la plupart des problèmes de diarisation :
Enregistrez une piste par locuteur. Lorsque la voix de chaque personne est isolée dans son propre fichier audio, la diarisation devient triviale : l'outil associe une piste à un locuteur. Aucune contamination croisée ne vient perturber l'algorithme de regroupement.
Comment l'activer :
- Zoom : Dans votre portail web Zoom, sous Paramètres > Enregistrement, activez « Enregistrer un fichier audio séparé pour chaque participant ». Cela s'applique aux enregistrements cloud sur les offres Pro et supérieures, et prend en charge jusqu'à 200 participants. Le résultat est un fichier .m4a par locuteur.
- Riverside.fm : L'enregistrement multipiste est activé par défaut. L'audio de chaque participant est capturé localement puis téléversé sous forme de fichier WAV séparé à 48 kHz. L'offre gratuite inclut 2 heures d'enregistrement multipiste ; l'offre Pro (actuellement 24 $/mois facturés annuellement) en inclut 15.
- Entretiens en présentiel : Des micros cravate sur chaque locuteur alimentent des pistes ou canaux d'enregistrement séparés, que vous exportez individuellement avant la transcription.
Si l'enregistrement multipiste n'est pas possible, demandez aux locuteurs de se présenter au début. « Je suis Sarah, directrice du design » et « Je suis John, directeur de l'ingénierie » fournissent au modèle de diarisation des échantillons vocaux propres et ancrés avant que la conversation principale ne commence. C'est une habitude de 30 secondes qui améliore mesurablement la précision des étiquettes pour le reste de l'enregistrement.
Quand l'audio rend la diarisation véritablement peu fiable
Certains scénarios dépassent ce que l'IA actuelle gère bien :
Appels téléphoniques avec plusieurs locuteurs. La plage de fréquences compressée de 300-3400 Hz de la téléphonie traditionnelle aplanit les caractéristiques vocales. Deux personnes aux voix similaires lors d'un appel en bande étroite peuvent être indiscernables pour le modèle. Si vous avez accès aux enregistrements d'appels par canal (courant dans les infrastructures de centres d'appels), utilisez-les. Pour les appels téléphoniques grand public, une passe de correction manuelle est souvent la seule voie.
Salles de conférence avec un seul micro. Variation des distances, bruit ambiant de la salle et plages vocales similaires se combinent pour former le scénario mono-canal le plus difficile. Les enregistrements futurs devraient utiliser un micro par locuteur. Pour les enregistrements existants, la Correction 2 (correction manuelle) est la voie à suivre.
Cinq locuteurs ou plus dans une discussion non structurée. AssemblyAI gère jusqu'à 20 locuteurs en mode asynchrone, mais la précision se dégrade au-delà de quatre ou cinq sur un audio bruyant et non structuré. Au-delà de ce seuil sur un seul canal, prévoyez une passe de correction quel que soit l'outil utilisé.
Segments de parole chevauchés. Lorsque deux personnes parlent simultanément, le modèle de diarisation doit scinder le segment selon les caractéristiques acoustiques, ce qu'il fait avec une fiabilité limitée. Le guide sur la gestion de la parole chevauchée traite ce sujet sous l'angle de l'enregistrement et du choix de l'outil. L'article sur la correction des locuteurs qui se chevauchent explique comment réparer les transcriptions existantes où les chevauchements ont causé des erreurs d'attribution.
Flux de récupération en un coup d'œil
Pour un enregistrement dont la diarisation est déjà mauvaise :
- Identifiez le type de panne concerné (inversion, fusion ou scission) à l'aide des 2 premières minutes.
- S'il s'agit d'une inversion, renommez les étiquettes. Terminé.
- S'il s'agit d'une fusion ou d'une scission, effectuez la passe de correction manuelle dans l'éditeur.
- Si les erreurs sont trop denses pour être corrigées manuellement, re-transcrivez via un outil doté d'une diarisation plus performante.
- Pour les enregistrements futurs, activez les pistes par locuteur ou, au minimum, ajoutez des présentations personnelles au début.
Si vous avez besoin d'une transcription propre sans configurer de bot de réunion ni créer de compte, ConvertAudioToText accepte l'audio téléversé depuis n'importe quelle source et applique la diarisation d'AssemblyAI pour les fichiers multi-locuteurs.
FAQ
Pourquoi la diarisation confond-elle les locuteurs aux voix similaires ?
Les modèles de diarisation construisent une empreinte vocale à partir des premières secondes de l'audio de chaque locuteur, puis associent les segments suivants par similarité acoustique. Lorsque deux voix partagent une hauteur, un débit ou un accent similaire, le chevauchement des empreintes est suffisamment élevé pour que le modèle attribue des segments au mauvais groupe. L'audio téléphonique aggrave ce problème en compressant la plage de fréquences à environ 300-3400 Hz, aplanissant les différences acoustiques qui permettraient autrement de distinguer les locuteurs.
Combien de locuteurs la diarisation IA peut-elle gérer de manière fiable ?
La précision chute nettement au-delà de trois à quatre locuteurs sur un enregistrement mono-canal. AssemblyAI gère jusqu'à 20 locuteurs en mode asynchrone et jusqu'à 10 en streaming temps réel. Deepgram Nova-3 ne publie pas de limite stricte, mais sa documentation indique que la diarisation est compatible avec tous les modèles batch Nova. En pratique, au-delà de cinq ou six locuteurs sur un seul micro, même les meilleurs outils commencent à commettre des erreurs d'attribution et une passe de correction manuelle devient nécessaire.
Otter.ai prend-il en charge l'enrôlement vocal des locuteurs ?
Oui. Otter vous permet de créer une empreinte vocale en fournissant un échantillon vocal de 30 à 60 secondes par locuteur via Paramètres > Locuteurs > Ajouter un nouveau locuteur. Une fois enrôlé, Otter reconnaît automatiquement ce locuteur dans les enregistrements futurs. La précision annoncée est de 90 à 95 % avec deux à quatre locuteurs distincts et chute à environ 70 à 85 % lorsque six locuteurs ou plus sont présents. Il existe une limite pratique de 10 locuteurs enrôlés par espace de travail.
Quelle est la correction la plus rapide pour des étiquettes de locuteurs erronées dans une transcription existante ?
Si le modèle a correctement identifié des groupes de locuteurs distincts mais leur a donné de mauvais noms, renommer les étiquettes prend environ 10 secondes par locuteur et se propage instantanément dans toute la transcription. Si les groupes eux-mêmes sont erronés (locuteurs fusionnés ou scindés incorrectement), la passe de correction manuelle dans un éditeur de transcription est la voie la plus fiable : écouter et lire la première minute, noter les schémas, réattribuer les paragraphes mal attribués et vérifier les limites douteuses sur la chronologie audio. Une réunion de 60 minutes prend généralement 10 à 20 minutes à corriger de cette façon.
Sources
- Fonctionnalités de diarisation des locuteurs d'AssemblyAI : https://www.assemblyai.com/features/speaker-diarization (consulté le 2026-07-01)
- Sélection des meilleurs outils de diarisation par AssemblyAI : https://www.assemblyai.com/blog/top-speaker-diarization-libraries-and-apis (consulté le 2026-07-01)
- Documentation de diarisation Deepgram : https://developers.deepgram.com/docs/diarization (consulté le 2026-07-01)
- Notes de version de Pyannote 4.0 Community-1 : https://www.pyannote.ai/changelog/community-1-now-available (consulté le 2026-07-01)
- Présentation de l'identification des locuteurs par Otter.ai : https://help.otter.ai/hc/en-us/articles/21665587209367-Speaker-Identification-Overview (consulté le 2026-07-01)
- Paramètres d'enregistrement de fichiers audio séparés de Zoom : https://support.zoom.com/hc/en/article?id=zm_kb&sysparm_article=KB0064676 (consulté le 2026-07-01)
- Enregistrement multipiste et tarifs de Riverside.fm : https://riverside.com/pricing (consulté le 2026-07-01)
- Plage de fréquences vocales : https://en.wikipedia.org/wiki/Voice_frequency (consulté le 2026-07-01)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.