
Comment l'IA gère plusieurs locuteurs : limites et réglages
Summarize this article with:
La transcription et la diarisation des locuteurs reposent sur deux modèles distincts dont les sorties sont recollées ensuite, ce qui explique la plupart des échecs en situation multi-locuteurs. La diarisation est fiable avec quelques locuteurs clairement distincts et se dégrade à mesure que leur nombre augmente ; la parole chevauchée est le principal point de rupture. Un réglage de nombre maximal de locuteurs est un indice donné au modèle, pas une garantie. Whisper seul n'offre aucune diarisation ; des moteurs comme AssemblyAI et Deepgram l'ajoutent. Pour les réunions, la capture par participant via un bot de réunion surpasse la diarisation d'un simple micro de salle.
Comment les moteurs séparent les locuteurs
Lorsque vous téléversez un enregistrement à plusieurs locuteurs, l'IA effectue deux tâches distinctes : elle transcrit les mots et elle détermine qui a dit chacun d'eux. La plupart des gens supposent que ces deux opérations se font ensemble. Il n'en est rien. Le modèle de transcription et le modèle de diarisation tournent en parallèle, et leurs sorties sont recollées à la fin. Comprendre cette séparation explique la plupart des façons dont la transcription multi-locuteurs tourne mal.
Le nom technique de la tâche « qui a dit quoi » est la diarisation des locuteurs. Pour un examen plus approfondi du fonctionnement des modèles sous-jacents, consultez la diarisation des locuteurs expliquée. Cet article se concentre sur l'aspect pratique : comment les moteurs gèrent l'audio multi-locuteurs, quelles sont leurs limites documentées en nombre de locuteurs, et où la précision chute.
L'architecture à deux modèles
Un moteur de transcription typique exécute deux modèles sur chaque fichier audio.
Le modèle de transcription convertit la forme d'onde audio en texte avec des horodatages au niveau du mot. Il produit quelque chose comme : « 0,4 s : la, 0,6 s : réunion, 0,9 s : commence, 1,2 s : maintenant. » Il n'a aucune idée du nombre de personnes qui parlent.
Le modèle de diarisation produit un type de sortie différent : une frise temporelle des locuteurs. Il indique « de 0,0 s à 14,2 s c'est le locuteur A ; de 14,2 s à 16,0 s c'est le locuteur B ». Il n'a aucune idée de ce que les locuteurs ont dit.
Une fois les deux modèles terminés, le moteur les aligne. Chaque mot reçoit l'étiquette de locuteur que la frise de diarisation a attribuée à son horodatage. Le résultat est une transcription étiquetée par locuteur.
Le modèle de diarisation lui-même fonctionne généralement en trois étapes : la détection d'activité vocale (repérer les régions de l'audio contenant de la parole), le plongement de locuteur (convertir de courts segments audio en vecteurs encodant l'identité vocale) et le clustering (regrouper les vecteurs similaires en étiquettes de locuteur). Sous le capot, la plupart des API commerciales utilisent des variantes de ce pipeline, souvent construites sur pyannote — le framework open source dominant en matière de diarisation — ou inspirées de celui-ci.
Une précision importante : le modèle de diarisation n'identifie pas les locuteurs par leur nom. Il attribue des étiquettes de cluster. « Locuteur 1 » et « Locuteur 2 » sont des identifiants de cluster, pas de vraies identités. L'attribution des noms, lorsqu'elle existe, se fait séparément via l'enrôlement des locuteurs, les métadonnées d'agenda ou un renommage manuel.

Ce que signifient réellement les réglages de « nombre maximal de locuteurs »
La plupart des API de transcription exposent un paramètre pour le nombre de locuteurs. Voici ce que les principaux moteurs documentent à la mi-2026.
| Moteur | Paramètre de locuteurs | Plage documentée | Remarques |
|---|---|---|---|
| AWS Transcribe | MaxSpeakerLabels | 2 à 30 | Selon la référence de l'API. Les locuteurs au-delà de la limite sont fusionnés dans le cluster le plus proche. |
| Google Cloud STT v1 | min_speaker_count / max_speaker_count | Plage illustrée dans les exemples de code jusqu'à 10 ; plafond strict non documenté | La documentation V1 montre des exemples jusqu'à 10 ; à considérer comme une indication plutôt que comme un plafond strict. |
| AssemblyAI (asynchrone) | speakers_expected / speaker_options | 1 à 20 | Selon la documentation de l'éditeur, vérifiée en juillet 2026. |
| AssemblyAI (streaming) | max_speakers | 1 à 10 | Un indice, pas un plafond strict ; la précision se dégrade en haut de plage. |
| Deepgram Nova-3 | Détection automatique | Aucun plafond publié dans la documentation | Deepgram ne documente aucun maximum ; le modèle détecte automatiquement le nombre de locuteurs. |
| Whisper (API OpenAI) | Aucun | Non pris en charge nativement | Whisper ne transcrit que les mots. La diarisation nécessite un module complémentaire tel que WhisperX avec pyannote. |
Quelques points que le tableau ne dit pas : un plafond de paramètre élevé ne signifie pas une sortie précise à ce plafond. Régler MaxSpeakerLabels=30 dans AWS Transcribe ne signifie pas qu'AWS identifie de manière fiable 30 locuteurs distincts. Cela signifie que le système va tenter de le faire. La précision en haut de plage de n'importe quel moteur est nettement inférieure à celle obtenue avec 2 à 4 locuteurs.
Comment la précision se dégrade avec le nombre de locuteurs
Plus vous ajoutez de locuteurs, moins chaque locuteur contribue d'audio par minute, et plus le problème de clustering devient difficile. Une conversation à deux locuteurs donne au modèle plusieurs minutes de signal vocal par personne pour construire un profil vocal fiable. Une téléconférence à 10 participants peut n'offrir à chacun que 90 secondes de tours de parole fragmentés.
Les jeux de données de référence fournissent quelques points de comparaison, mais il s'agit de chiffres obtenus en conditions contrôlées. Sur le corpus de réunions AMI (enregistrements micro, 3 à 4 locuteurs, conditions contrôlées), les systèmes de pointe atteignent un taux d'erreur de diarisation (DER) d'environ 7 %. Sur DIHARD, un jeu de données bien plus difficile avec un audio plus bruité et plus varié, le DER grimpe à environ 18 % même pour les systèmes performants. Les enregistrements réels avec une mauvaise configuration micro, de la parole chevauchée et de nombreux locuteurs se situent généralement plus près de la fourchette DIHARD, voire pire.
Le DER mesure la proportion de temps de parole attribuée au mauvais cluster de locuteur, ainsi que la parole manquée et les fausses alarmes. Un DER de 7 % sur un enregistrement d'une heure signifie qu'environ 4 minutes d'audio sont mal étiquetées. C'est gérable pour un compte rendu de réunion ; ce n'est pas acceptable pour un procès-verbal juridique verbatim.
Les conditions qui font systématiquement monter le DER :
De nombreux locuteurs. Six ou plus, c'est là que la plupart des moteurs commencent à peiner. Les clusters commencent à se chevaucher ; les tours courts sont mal attribués ; les locuteurs aux voix similaires sont fusionnés.
Tours de parole courts. « Oui », « exactement », « voilà ». Ces tours d'un seul mot ne donnent presque rien au modèle d'embedding pour travailler. Ils sont fréquemment mal étiquetés même quand des tours plus longs du même locuteur sont corrects.
Voix similaires. Deux personnes de même sexe, d'âge proche et d'accent similaire peuvent se retrouver proches dans l'espace d'embedding. L'algorithme de clustering les fusionne parfois ou échange leurs étiquettes en cours de conversation.
Micro unique, acoustique de la salle. Un micro plafonnier dans une salle de conférence mélange toutes les voix avant tout traitement du signal. Les signaux par canal provenant de micros individuels sont nettement plus faciles à diariser. Pour la parole chevauchée spécifiquement, voir gérer la parole chevauchée et corriger les locuteurs chevauchés.
Le fossé Whisper
Whisper mérite d'être traité à part car il sert de fondation à de nombreux outils de transcription. Le modèle Whisper d'OpenAI n'a aucune diarisation native. Il produit une transcription sans étiquettes de locuteur.
Les produits construits sur Whisper brut sautent entièrement la diarisation, greffent WhisperX (qui fait passer la sortie de Whisper par pyannote) ou exécutent un modèle de diarisation séparé sur le même audio. Si un outil se décrit comme « propulsé par Whisper » et propose des étiquettes de locuteur, demandez quel modèle de diarisation il utilise et où l'alignement se fait. La réponse compte pour la précision sur les audios difficiles.
Pour une comparaison de Whisper face aux API dédiées, voir Whisper vs Google Cloud Speech 2026 et meilleures API de transcription vocale 2026.
Bot de réunion vs. diarisation par téléversement de fichier
Deux architectures différentes, deux profils de précision différents.
Les bots de réunion (Otter, Fireflies et outils similaires) rejoignent l'appel en tant que participant. Ils peuvent capturer les flux audio de chaque participant depuis la plateforme, accéder aux métadonnées d'agenda avec les noms des participants et associer les étiquettes de locuteur aux vrais noms en temps réel. C'est un avantage structurel pour les cas d'usage centrés sur les réunions. Fireflies documente une prise en charge allant jusqu'à 50 locuteurs par conversation, ce qui dépasse la plupart des API par téléversement de fichier, en partie parce que la séparation des flux par participant rend le problème de diarisation beaucoup plus facile.
Les API par téléversement de fichier travaillent à partir d'un mixage mono ou stéréo. Elles n'ont aucun des avantages liés aux flux par participant. Pour les enregistrements de réunions, cela signifie que la précision est généralement inférieure à celle d'un bot ayant assisté à la même réunion en direct. Pour les autres types d'audio (podcasts, interviews, audiences judiciaires), l'approche par téléversement de fichier est la seule option.
Mon avis : pour la précision multi-locuteurs sur les réunions enregistrées, un bot de réunion natif a un avantage structurel. Pour tout le reste, Deepgram Nova-3 et AssemblyAI sont les meilleures options par téléversement de fichier d'après les benchmarks actuels et les plages de locuteurs documentées. Mais testez sur votre propre audio avant de vous engager dans un pipeline. Les benchmarks DER sont mesurés sur des jeux de données contrôlés ; vos enregistrements ne le sont pas.
Quand désactiver la diarisation
Tous les enregistrements multi-locuteurs n'ont pas besoin de diarisation. Quelques cas où elle ajoute du bruit plutôt que de la valeur :
Enregistrements solo avec voix de fond occasionnelles. Un narrateur unique avec un coanimateur qui parle rarement. La diarisation produira des changements de locuteur parasites chaque fois que la voix de fond s'exprime.
Sous-titres codés et sous-titres vidéo. Le spectateur regarde la vidéo ; la structure des locuteurs est visible. Les étiquettes ajoutent de l'encombrement.
Clips très courts. En dessous de deux minutes, la structure des locuteurs est généralement évidente d'après le contexte, et le modèle dispose de trop peu d'audio pour construire un cluster fiable.
Pour les fichiers à locuteur unique, la plupart des moteurs permettent de désactiver explicitement la diarisation. Faites-le. Vous obtenez une transcription plus propre et un traitement plus rapide.
Si vous devez corriger des étiquettes de locuteur erronées dans une transcription existante, l'article corriger les étiquettes de locuteur erronées couvre le processus de correction.
Ce qu'il faut rechercher dans une transcription multi-locuteurs
Une courte liste de contrôle pour évaluer n'importe quel moteur pour un usage multi-locuteurs :
- Détecte-t-il automatiquement le nombre de locuteurs, ou devez-vous le définir ? La détection automatique est plus flexible mais peut se tromper. Définir le nombre attendu de locuteurs, quand vous le connaissez, améliore généralement la précision.
- Documente-t-il un plafond maximal de locuteurs ? AWS Transcribe indique 30. AssemblyAI en asynchrone indique 20. Le plafond strict de Google Cloud est moins clairement documenté. Deepgram n'en publie pas. Sachez avec quoi vous travaillez.
- Expose-t-il des horodatages au niveau du mot en plus des étiquettes de locuteur ? La qualité de l'alignement dépend de la précision des horodatages. Sans horodatages au niveau du mot, les frontières des étiquettes de locuteur peuvent retarder ou devancer le changement réel de locuteur.
- Pouvez-vous corriger les étiquettes après traitement ? Les erreurs d'étiquetage sont inévitables. Une interface d'édition ou un export structuré permettant de renommer et de fusionner les clusters fait gagner du temps sur toute transcription à forts enjeux.
Si vous avez besoin d'une transcription rapide et précise sans configurer de bot de réunion, ConvertAudioToText traite les téléversements multi-locuteurs avec des étiquettes de locuteurs numérotées et une sortie structurée que vous pouvez télécharger ou copier directement. Aucun compte requis pour tester.
FAQ
Qu'est-ce que la diarisation des locuteurs et pourquoi s'exécute-t-elle séparément de la transcription ?
La diarisation des locuteurs est le processus qui consiste à découper l'audio en segments et à attribuer chaque segment à un cluster de locuteur. Elle s'exécute séparément de la transcription parce que les deux modèles résolvent des problèmes différents : l'un décode la parole en texte, l'autre encode l'identité vocale en vecteurs puis les regroupe en clusters. La plupart des moteurs exécutent les deux en parallèle et alignent leurs sorties par horodatage. Cette séparation permet aussi de remplacer le moteur de diarisation sans réentraîner le modèle de transcription.
Combien de locuteurs les moteurs de transcription IA peuvent-ils réellement traiter avec précision ?
Les plafonds de paramètres publiés sont élevés (AWS Transcribe monte jusqu'à 30, AssemblyAI en asynchrone jusqu'à 20), mais la précision se dégrade bien avant d'atteindre ces chiffres. En pratique, 2 à 4 locuteurs avec des pauses nettes entre les tours de parole produisent un résultat fiable. À partir de 6 locuteurs ou plus, la précision chute sensiblement, surtout sur des enregistrements à micro unique. Les tours courts et les profils vocaux similaires aggravent le problème quel que soit le nombre de locuteurs.
OpenAI Whisper prend-il en charge la diarisation des locuteurs ?
Non. Whisper produit une transcription sans étiquettes de locuteur. Les produits qui ajoutent la diarisation par-dessus Whisper intègrent soit WhisperX (qui greffe pyannote sur le pipeline Whisper), soit exécutent un modèle de diarisation séparé et alignent les sorties. Si les étiquettes de locuteur comptent pour vous, vérifiez quel modèle de diarisation tourne sous le capot, et pas seulement quel modèle de reconnaissance vocale.
Quand faut-il désactiver la diarisation ?
Pour les audios à locuteur unique, les clips de moins de deux minutes, et les cas d'usage de sous-titres ou de sous-titrage codé où la structure des locuteurs est visuellement évidente. Exécuter la diarisation sur un audio à locuteur unique produit souvent des changements de locuteur parasites qui encombrent la transcription. La plupart des moteurs permettent de la désactiver explicitement, ce qui accélère aussi le traitement.
Sources
- Référence de l'API AWS Transcribe, Settings.MaxSpeakerLabels : https://docs.aws.amazon.com/transcribe/latest/APIReference/API_Settings.html (vérifié en juillet 2026)
- AssemblyAI, Principales bibliothèques et API de diarisation des locuteurs 2026 : https://www.assemblyai.com/blog/top-speaker-diarization-libraries-and-apis (vérifié en juillet 2026)
- Deepgram, documentation sur la diarisation des locuteurs : https://developers.deepgram.com/docs/diarization (vérifié en juillet 2026)
- Google Cloud Speech-to-Text, Détecter différents locuteurs : https://docs.cloud.google.com/speech-to-text/docs/multiple-voices (vérifié en juillet 2026)
- Picovoice, État de la diarisation des locuteurs 2026 (benchmark pyannote vs Falcon) : https://picovoice.ai/blog/state-of-speaker-diarization/ (vérifié en juillet 2026)
- pyannote.ai, Qu'est-ce que la diarisation des locuteurs : https://www.pyannote.ai/blog/what-is-speaker-diarization (vérifié en juillet 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.