Comment fonctionne la détection d'activité vocale (VAD) en transcription
vaddétection d'activité vocaletechnique

Comment fonctionne la détection d'activité vocale (VAD) en transcription

BMMamane B. MoussaMay 26, 2026Updated July 2, 202615 min read

Summarize this article with:

Ce que décide le VAD

La détection d'activité vocale répond à une seule question pour chaque petit fragment d'audio : y a-t-il de la parole ici, ou non ? La réponse détermine quelles trames parviennent au modèle de transcription et lesquelles sont écartées. Se tromper, c'est soit halluciner du texte sur du silence, soit couper le début de vrais mots.

Pourquoi le VAD existe dans le pipeline

Un modèle de transcription prend de l'audio en entrée et produit du texte en sortie. Il n'a aucune notion intrinsèque de « personne ne parle ». Nourrissez-le de silence, de bruit de fond ou de musique d'attente, et il essaiera quand même de produire du texte, car c'est pour cela qu'il a été entraîné. Le VAD est le gardien placé en amont qui décide de ce qui atteint le modèle.

Trois effets concrets découlent de ce rôle de gardien.

Il empêche les hallucinations sur le silence

Whisper Large-v3 a une tendance bien documentée à générer du texte fantôme pendant les passages silencieux ou non parlés. Comme le modèle a été entraîné sur des données Internet dominées par des vidéos YouTube, il a appris à associer tout audio à une parole transcribable. Lorsqu'il rencontre du silence, il puise dans les fins les plus courantes de ses données d'entraînement : des phrases comme « merci d'avoir regardé » ou « abonnez-vous à ma chaîne » apparaissent dans la sortie de Whisper sur des passages audio qui ne contiennent ni l'un ni l'autre. Ce phénomène est documenté dans plusieurs analyses indépendantes et n'est pas un cas limite occasionnel. Des chercheurs ont découvert qu'un petit sous-ensemble de têtes d'attention du décodeur est responsable de la majorité des hallucinations sur audio non parlé.

Le VAD prévient cela en supprimant les régions non parlées avant que le modèle ne les voie. Le modèle ne peut pas halluciner sur un silence qu'il ne reçoit jamais.

Il réduit le coût de traitement

Faire tourner un modèle de transcription sur du silence n'est pas gratuit. Le modèle traite quand même le spectrogramme complet de chaque trame qu'il reçoit. Pour un audio contenant de longues plages de non-parole, sauter ces trames économise un calcul significatif. Des chercheurs ont relevé des économies allant de 50 à 70 % sur des enregistrements majoritairement silencieux. Un cours magistral de 90 minutes avec de longues pauses, un enregistrement de terrain avec du son ambiant entre deux salves de parole pertinente, un audio de centre d'appels où les agents attendent en ligne : tous en profitent proportionnellement à la part de l'audio qui n'est pas de la parole.

Pour les usages à faible volume, c'est un souci mineur. Pour les déploiements en production qui traitent des milliers d'heures par mois, cela devient un véritable levier de coûts.

Il offre aux horodatages de meilleures bases

Lorsque le modèle de transcription reçoit des segments de parole propres avec des temps de début exacts, son minutage au niveau des mots s'ancre sur de vrais événements audio plutôt que de s'étirer sur le silence. Résultat : des horodatages de mots plus fiables et un rendu de sous-titres plus propre. Cela compte surtout dans les flux de travail qui dépendent de coupes précises : génération de sous-titres, notes de réunion indexées par sujet, ou transcriptions associées à une vidéo.

Comment fonctionne le VAD sous le capot

L'approche technique a évolué du traitement du signal simple vers l'inférence neuronale. Trois générations sont encore utilisées aujourd'hui.

Le VAD basé sur l'énergie

L'approche la plus ancienne et la plus simple. On mesure l'énergie (le volume) de chaque trame audio. Les trames au-dessus d'un seuil sont étiquetées « parole » ; celles en dessous, « silence ».

Cela fonctionne dans un studio silencieux. Dans n'importe quel environnement réel, cela échoue : un bruit de fond à 60 décibels masque une parole discrète à 55 décibels, et un bourdonnement de ventilation puissant déclenche des faux positifs partout. Le VAD basé sur l'énergie est rarement utilisé dans les pipelines de transcription modernes, mais il subsiste dans les systèmes embarqués contraints en ressources, où le coût de calcul compte plus que la précision.

Le VAD statistique (WebRTC VAD)

Un cran au-dessus de l'énergie brute. Au lieu d'un unique seuil d'énergie, un modèle de mélange gaussien (GMM) est ajusté sur plusieurs caractéristiques acoustiques par trame : énergie, forme spectrale, taux de passage par zéro, hauteur tonale. Le GMM attribue une probabilité que la trame corresponde à la distribution « parole » apprise plutôt qu'à la distribution « non-parole ».

WebRTC VAD, l'implémentation open source du projet WebRTC de Google, utilise cette approche. Il pèse environ 158 Ko, traite des blocs de 30 ms en moins de 1 ms sur CPU, et bénéficie d'une licence permissive. Il est largement déployé dans les pipelines de communication vocale (appels vidéo, VoIP), où la latence compte plus que la précision.

Sa faiblesse : le GMM a été entraîné sur des conditions audio spécifiques. La musique avec voix, la parole dans des pièces très réverbérantes et les environnements très bruyants produisent tous des erreurs de classification. Dans un benchmark de Picovoice (qui vend un produit concurrent, donc à considérer ces chiffres comme indicatifs), WebRTC VAD a atteint un taux de détection de parole d'environ 50 % pour un taux de faux positifs de 5 %, un résultat qui illustre ses limites en conditions bruyantes plutôt que calmes.

Le VAD neuronal

Le standard actuel des pipelines de transcription. Un petit réseau de neurones est entraîné sur de l'audio étiqueté couvrant des milliers d'heures et de nombreuses conditions de fond, apprenant à détecter la parole dans la forme d'onde brute ou le spectrogramme sans caractéristiques artisanales.

Silero VAD est le VAD neuronal open source le plus adopté dans les pipelines de transcription en production. Publié en décembre 2020 et maintenu jusqu'en 2026 (version actuelle 6.2.1), il repose sur une architecture PyTorch et ONNX avec une taille de modèle d'environ 2 Mo. Il prend en charge les fréquences d'échantillonnage de 8000 Hz et 16000 Hz, a été entraîné sur des données couvrant plus de 6 000 langues, et traite chaque bloc de 30 ms en moins de 1 ms par thread CPU. La licence MIT signifie ni inscription ni dépendance à un fournisseur.

Dans le même benchmark Picovoice, Silero a atteint environ 87,7 % de détection de parole pour un taux de faux positifs de 5 %, une amélioration substantielle par rapport à l'approche GMM. Le VAD neuronal gère bien mieux que les méthodes statistiques la musique avec voix, la réverbération et la qualité variable des micros, même si aucun modèle unique n'élimine tous les cas limites.

Type de VADBase techniqueLatenceRobustesse au bruitExemple
Basé sur l'énergieSeuil de volumeMoins de 1 msFaibleAnciens systèmes embarqués
Statistique (GMM)GMM sur caractéristiques spectralesMoins de 1 msMoyenneWebRTC VAD (Google)
NeuronalRéseau de neurones profond1-5 msÉlevéeSilero VAD, modèles propriétaires

Le VAD dans le pipeline Whisper

L'implémentation de référence de Whisper par OpenAI n'inclut pas de VAD externe par défaut. Le modèle contient un jeton de probabilité interne « pas de parole », mais en pratique il est trop peu fiable pour que les déploiements en production n'ajoutent pas une passe VAD dédiée en amont.

L'architecture typique, utilisée par WhisperX et des wrappers Whisper similaires, fonctionne ainsi :

  1. L'audio passe par Silero VAD ou Pyannote, qui renvoie une liste de segments temporels actifs de parole.
  2. Les segments adjacents séparés par de courts intervalles (typiquement 0,5 seconde ou moins) sont fusionnés.
  3. Les zones de parole résultantes sont découpées selon la fenêtre de traitement de Whisper (30 secondes maximum).
  4. Chaque bloc est transcrit par Whisper Large-v3.
  5. Les horodatages sont recalés sur la chronologie d'origine avant la concaténation des blocs.

Cette conception est nettement plus fiable que de donner à Whisper l'audio brut, en particulier pour les enregistrements avec de longs silences ou un fond ambiant. Pour un examen approfondi du modèle lui-même, voir Whisper Large-v3 expliqué.

Outil d'import audio de CATT ; après l'import, le VAD s'exécute côté serveur avant que l'audio n'atteigne le modèle de transcription
Outil d'import audio de CATT ; après l'import, le VAD s'exécute côté serveur avant que l'audio n'atteigne le modèle de transcription

Le VAD dans le pipeline Deepgram

Deepgram Nova-3 intègre la détection d'activité vocale directement dans le pipeline de modèle de bout en bout. Les utilisateurs ne configurent pas d'étape VAD séparée. C'est plus simple opérationnellement : un modèle, un appel API, aucun réglage du VAD. Le VAD intégré de Nova-3 s'est spécifiquement amélioré par rapport aux précédents modèles Deepgram qui transcrivaient parfois de l'audio purement musical ou quasi silencieux en texte fantôme.

Le compromis, c'est la transparence. Vous ne pouvez pas inspecter les décisions de limites du VAD séparément de la sortie de transcription, ce qui complique le débogage des cas limites. Si votre flux de travail dépend d'un audit précis des trames classées comme parole, un VAD externe explicite est préférable. Pour la plupart des utilisateurs, l'approche intégrée est le meilleur défaut. Le décryptage complet se trouve dans Deepgram Nova-3 expliqué.

Ce que le VAD ne peut pas faire

Trois limites à connaître avant d'en attendre trop.

Le VAD n'identifie pas les locuteurs. Il distingue la parole du non-parole. Le locuteur A et le locuteur B produisent tous deux des trames étiquetées « parole ». Les séparer est un problème distinct, traité dans la diarisation des locuteurs expliquée.

Le VAD ne nettoie pas le bruit à l'intérieur des trames de parole. Il détermine seulement quelles trames atteignent le modèle ; l'audio de ces trames reste inchangé. Un enregistrement bruité reste bruité à l'intérieur des segments sélectionnés par le VAD. Le VAD prévient les hallucinations liées au silence, mais les erreurs de transcription causées par le bruit de fond à l'intérieur des zones de parole exigent un autre traitement.

Le VAD ne distingue pas les types de non-parole. Rires, musique, brouhaha et silence total produisent typiquement tous une étiquette « pas de parole ». Des systèmes spécialisés séparent ces catégories, mais le VAD standard utilisé dans les pipelines de transcription ne le fait pas.

Pour une cartographie plus large des causes d'erreurs de transcription, pourquoi la transcription fait des erreurs couvre toute la taxonomie des modes de défaillance.

Régler le VAD : trois paramètres qui comptent

Pour la plupart des utilisateurs, le VAD est invisible. Le pipeline arrive avec des valeurs par défaut, et elles conviennent généralement. Pour les développeurs qui intègrent la transcription dans leurs propres systèmes, trois paramètres ont le plus d'impact.

La sensibilité (le seuil de probabilité de parole). Un seuil élevé exige des preuves plus solides de parole avant d'étiqueter une trame comme active. Cela réduit les faux positifs (du bruit étiqueté comme parole) mais risque d'éliminer une parole faible ou soufflée. Un seuil bas capture plus de parole mais laisse aussi passer plus de bruit. Les systèmes en production règlent généralement ce paramètre sur un petit échantillon d'audio représentatif avant un déploiement à grande échelle.

La durée minimale de segment. Un filtre qui écarte les segments de parole détectés plus courts qu'une durée fixée, typiquement 250 ms. Sans lui, un clic bref ou un bruit d'impact est transmis au modèle de transcription comme segment « parole », produisant un mot ou une syllabe parasite isolé dans la sortie.

La marge (padding). La plupart des systèmes VAD étendent chaque segment de parole détecté d'une quantité fixe avant et après les limites détectées. Sans marge, le premier phonème d'un énoncé est souvent coupé, car le déclencheur du VAD s'active quelques millisecondes après le début de la parole. Une valeur de marge de 300 ms est un défaut courant pour la transcription ASR ; les pipelines d'entraînement TTS utilisent des valeurs plus longues, de 400 à 500 ms, pour préserver la prosodie naturelle.

Ces paramètres interagissent. Une sensibilité agressive avec une durée minimale courte et une marge serrée maximise la quantité de non-parole supprimée, au prix de couper parfois de la vraie parole. Une sensibilité permissive avec une longue marge préserve plus de parole, au prix de laisser passer plus de bruit vers le modèle.

Quand le VAD a le plus d'impact

Le VAD compte d'autant plus que l'audio contient de non-parole.

Les enregistrements longs avec des pauses importantes en profitent le plus : cours magistraux, interviews de podcast avec des pauses de réflexion, réunions avec des échanges soutenus qui laissent le canal d'un locuteur majoritairement silencieux. Ce sont aussi les enregistrements les plus susceptibles de produire du texte fantôme sans VAD, car Whisper a plus de silence à remplir.

Les mémos vocaux et la dictée en profitent parce que les motifs parole-pause-parole sont le déclencheur d'hallucination le plus net : le modèle n'a rien à quoi s'accrocher pendant la pause, alors il génère quelque chose.

Les enregistrements de terrain avec du son ambiant entre les salves de parole pertinente sont souvent inexploitables sans VAD. Le rapport entre non-parole et parole peut être très élevé dans l'audio naturaliste.

Mon avis : pour les envois grand public depuis un téléphone ou un ordinateur portable dans une pièce normale, le VAD est de la tuyauterie invisible. La transcription fonctionne ou présente des problèmes de précision dus au bruit ou à l'accent, et le VAD n'est pas le goulot d'étranglement. Les cas où le VAD change visiblement la sortie sont les enregistrements longs, les fichiers avec de fréquentes coupures de silence, et tout ce qui est enregistré dans un environnement avec un bruit de fond continu.

Si vous voulez voir comment un pipeline incluant le VAD traite votre audio spécifique, l'outil audio-vers-texte de CATT traite gratuitement les 10 premières minutes. Essayez un fichier qui a produit du texte fantôme dans d'autres outils.

Questions fréquentes

Quelle taille de trame le VAD utilise-t-il généralement ?

La plupart des systèmes VAD en production traitent l'audio par blocs de 10 à 30 ms. Les trames plus petites détectent plus vite le début de la parole mais se trompent plus souvent en conditions bruyantes. Les trames plus grandes sont plus précises mais ajoutent quelques millisecondes de latence de détection. Silero VAD a été entraîné sur des blocs de 30 ms et gère nativement des blocs plus longs. WebRTC VAD prend en charge les modes 10, 20 et 30 ms ; c'est celui de 30 ms qui est le plus utilisé dans les pipelines de transcription.

Le VAD affecte-t-il la précision de la transcription à l'intérieur des zones de parole ?

Non. Le VAD change quelles portions de l'audio parviennent au modèle, pas la façon dont le modèle les traite. Le taux d'erreur par mot du modèle sur un segment de parole donné n'est pas affecté par le fait que le VAD ait servi à localiser ce segment. Le bénéfice du VAD sur la précision est indirect : il empêche le texte halluciné dans le silence et donne au modèle des limites de segments plus propres.

Pourquoi Whisper hallucine-t-il sur le silence sans VAD ?

Whisper a été entraîné sur de l'audio issu d'Internet, principalement des transcriptions YouTube. Les vidéos YouTube se terminent souvent par des séquences de fin, de la musique d'attente et de l'audio de remplissage accompagnés de phrases comme « merci d'avoir regardé » ou « abonnez-vous à ma chaîne ». Le modèle a appris à associer ces motifs audio non parlés à ce texte. Lorsqu'il reçoit du silence ou de la musique, il puise dans ces associations et génère un texte jamais prononcé. Un VAD externe retire les trames silencieuses avant que Whisper ne les voie, éliminant ainsi le déclencheur.

Le VAD neuronal est-il toujours meilleur que le WebRTC VAD ?

Pour les pipelines de transcription, oui dans presque tous les cas. Un VAD neuronal comme Silero gère bien mieux les environnements bruyants, la musique avec voix et la réverbération que le GMM de WebRTC. WebRTC VAD a l'avantage d'un coût de calcul quasi nul et d'une empreinte réduite, ce qui en fait un bon choix pour les applications de communication vocale en temps réel où la latence est strictement contrainte et la qualité audio maîtrisée (un appel vidéo dans une pièce calme). Pour la transcription d'audio réel, l'approche neuronale vaut bien son léger surcoût.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles