
Comment gérer la musique dans la transcription (guide honnête 2026)
Summarize this article with:
La musique dans un fichier audio est l'un des rares cas où les modèles de transcription par IA échouent de manière prévisible et corrigeable. La musique chantée produit des paroles partiellement erronées. Les passages instrumentaux déclenchent du texte de remplissage halluciné ou des phrases fabriquées. Aucun grand service de transcription ne propose actuellement de fonction dédiée de détection ou de suppression de la musique ; les solutions fiables se situent donc en amont : coupez la musique avant de transcrire, ou isolez la piste vocale avec un outil de séparation de sources avant de l'envoyer à n'importe quel moteur.
La musique dans votre transcription se manifeste sous forme de deux problèmes : des pseudo-paroles illisibles là où une chanson jouait, ou du texte de remplissage halluciné sur un passage instrumental. Les deux découlent de la même cause racine, et les deux ont des solutions pratiques. L'essentiel à retenir est qu'aucun des grands moteurs de transcription, y compris Whisper, Deepgram Nova-3 ou AssemblyAI, ne dispose d'une couche vérifiée de détection de musique qui supprime automatiquement ces segments. Les solutions fiables interviennent avant la transcription, pas pendant.

Ce que votre transcription vous dit réellement
Le symptôme est presque toujours l'une de ces trois choses.
Des pseudo-paroles illisibles sur un passage chanté. Votre podcast diffuse un extrait de chanson de 30 secondes pour critique. La transcription remplit ce temps avec des paroles partielles et erronées : des mots de la chanson mélangés à des mots inventés, une ponctuation cassée et des coupures en milieu de phrase là où le modèle a perdu confiance.
Du remplissage halluciné sur de la musique instrumentale. Votre jingle d'intro est purement instrumental. La transcription produit « donc », « euh », « vous savez », voire des phrases fabriquées d'apparence cohérente. Une recherche publiée en mai 2025 a révélé que Whisper large-v3 transcrit « so » (« donc ») pour plus de 55 % des échantillons audio non parlés, et hallucine sur près de 100 % des entrées de sons environnementaux. La musique ne fait l'objet d'aucun traitement particulier.
Du charabia partiel quand la musique joue sous la parole. Votre animateur parle par-dessus une nappe musicale. La transcription capte la parole mais déforme les mots aux extrémités des phrases musicales, car le modèle essaie de concilier deux sources audio à la fois.
Comprendre lequel de ces symptômes vous avez vous indique quelle solution adopter en premier.
Pourquoi les moteurs d'IA ne résolvent pas cela automatiquement
Une hypothèse courante veut que les outils modernes « détectent et étiquettent » la musique. Ce n'est pas ce que disent les documentations des fournisseurs.
La documentation de Deepgram Nova-3 (vérifiée en juillet 2026) liste la transcription multilingue en temps réel, la personnalisation du vocabulaire et le prompting par termes clés. Aucune fonction de détection ou de suppression de la musique n'y apparaît.
La documentation d'intelligence audio d'AssemblyAI (vérifiée en juillet 2026) liste les chapitres automatiques, l'analyse de sentiment, la détection d'entités, la détection de sujets et le résumé. L'identification musicale n'apparaît pas comme une fonctionnalité.
L'étiquette « [Music] » qui apparaît dans les sous-titres automatiques de YouTube provient d'une couche de classification distincte que Google ajoute à sa chaîne de traitement, et non du décodeur de Whisper. La sortie propre de Whisper sur les segments musicaux n'est pas une étiquette propre.
Ce que Whisper fait réellement avec la musique est documenté dans ses fils de discussion GitHub et dans des recherches publiées : la liste de suppress-token du modèle lui fait sauter l'étiquetage des sons de fond comme [music], [applause] ou similaires, si bien que le décodage continue dans l'audio non parlé jusqu'à ce que le modèle hallucine de la parole. La sortie paraît plausible, ce qui la rend plus difficile à repérer que le silence ne le serait.
La détection d'activité vocale (VAD) aide mais ne résout pas cela. Le VAD supprime fiablement le silence. La musique porte son énergie dans les bandes de fréquences que le VAD traite comme de la parole, si bien que les passages musicaux passent souvent au travers du filtre intacts. WhisperX utilise le VAD par défaut et produit encore des hallucinations musicales.
Solution 1 : Couper la musique avant de transcrire
Pour une musique prévisible et structurelle (intros, outros, jingles), c'est la solution la plus rapide et la plus fiable. Vous conservez votre fichier de publication original inchangé. Vous créez une « version de transcription » séparée sans la musique, vous la transcrivez, puis vous ajoutez des marqueurs manuels dans la transcription là où se trouvait la musique.
Audacity fait cela gratuitement. Sélectionnez le segment musical, supprimez-le (ou rendez-le muet si vous voulez conserver le minutage), exportez le fichier nettoyé, transcrivez le fichier propre. Pour une intro de podcast de 10 secondes, vous faites cela une fois et vous en faites votre flux de travail permanent.
Pour du contenu avec de la musique éparpillée partout (une émission de critiques musicales, un podcast éducatif utilisant des exemples de chansons), le flux de travail ajoute une étape d'horodatage :
- Listez chaque segment musical avec son heure de début et de fin.
- Coupez chaque segment de la copie destinée à la transcription.
- Transcrivez la copie contenant uniquement la parole.
- Réinsérez les marqueurs dans la transcription aux bons horodatages : [Song: « Titre » par Artiste, 14:22-15:04].
C'est plus d'effort au départ, mais cela produit une transcription réellement exploitable pour le SEO, les notes d'émission, la recherche ou l'accessibilité.
Solution 2 : Séparer la piste vocale avec la séparation de sources
Quand la parole et la musique jouent simultanément, la découpe n'est pas possible car les deux sont mélangées. C'est le cas d'un animateur qui parle par-dessus une nappe musicale, d'un invité qui s'exprime pendant qu'une chanson joue en arrière-plan, ou d'un enregistrement réalisé dans une salle de concert.
Les outils de séparation de sources divisent un fichier audio mixte en pistes composantes.
Demucs v4 (Facebook Research, open source, aussi appelé htdemucs) sépare l'audio en voix, batterie, basse et autres instruments. Extrayez la piste vocals/other, transcrivez-la. Demucs v4 atteint 9,0 dB SDR sur les benchmarks MUSDB HQ, ce qui se traduit en pratique par une isolation de la parole raisonnablement propre. Il fonctionne via Python ou via des services cloud comme Replicate pour les équipes sans capacité GPU locale.
Spleeter (Deezer, open source) propose des modes de séparation à 2 pistes (voix, accompagnement), 4 pistes et 5 pistes. Il est plus rapide que Demucs sur CPU mais généralement coté moins performant sur les tâches de séparation musicale. Pour les scénarios de parole sur musique, l'un ou l'autre outil convient.
La séparation de sources ajoute du temps de traitement et introduit ses propres artefacts. Pour un enregistrement ponctuel avec une musique de fond importante, le gain de qualité en vaut la peine. Pour un podcast où la musique n'apparaît que dans de brefs jingles, la découpe est plus simple.
Solution 3 : Configurer Whisper auto-hébergé pour supprimer le non-parlé
Si vous faites tourner Whisper vous-même, deux paramètres réduisent (sans éliminer) les hallucinations musicales.
no_speech_threshold définit la probabilité au-delà de laquelle Whisper décide qu'un segment ne contient pas de parole et supprime la sortie. L'augmenter (vers 1,0) rend le modèle plus agressif pour abandonner les segments dont il n'est pas sûr. En contrepartie, une parole réellement faible peut aussi être abandonnée.
initial_prompt façonne les attentes du modèle avant le début du décodage. Présenter l'audio comme un podcast ou une interview décale le prior vers la parole conversationnelle. L'effet de initial_prompt ne dure que les 30 premières secondes avant d'être écrasé par le décodage des segments suivants ; il est donc plus utile pour les fichiers courts que pour l'audio long.
result = model.transcribe(
audio_file,
no_speech_threshold=0.8,
condition_on_previous_text=True,
initial_prompt="The following is a podcast interview. Music sections are not spoken content."
)
Cela réduit la sortie hallucinée sur les segments non parlés mais ne produit pas de manière fiable des étiquettes « [Music] » propres. Pour la musique chantée notamment, le modèle tentera toujours de transcrire les paroles. Le prétraitement VAD restreint l'audio aux fenêtres probablement parlées avant le décodage et constitue la plus solide des deux approches pour les gros fichiers.
Ces paramètres concernent Whisper auto-hébergé via la bibliothèque Python openai-whisper ou faster-whisper. Les API hébergées exposent moins de paramètres.
Solution 4 : Post-traiter pour retirer les passages musicaux
Si vous ne pouvez pas modifier l'audio avant la transcription, la transcription elle-même montre des signes reconnaissables de contamination musicale.
Les hallucinations musicales tendent à apparaître comme : des phrases courtes répétitives, des noms propres inhabituels, des phrases qui ne se raccordent pas sémantiquement au contenu environnant, ou des changements soudains de densité de ponctuation. Un script ou une relecture attentive peut signaler ces segments pour examen.
Remplacez les sections signalées par des marqueurs explicites :
[Intro music: 0:00-0:12]
[Song clip: 22:40-23:10]
C'est plus propre que de laisser du charabia dans une transcription que vous utiliserez pour les notes d'émission, les sous-titres ou l'indexation de recherche. Les outils de résumé en aval traiteront les paroles hallucinées comme du contenu et produiront de mauvais résumés si vous les laissez en place.
Scénarios spécifiques
Podcast avec intro et outro musicales
Coupez la musique avant de transcrire. Si vous publiez le même format à chaque épisode, créez un gabarit de version de transcription qui commence au moment où l'animateur commence à parler. Pour les flux de travail de transcription de podcasts où vous traitez plusieurs épisodes par semaine, une configuration unique fait gagner des heures.
Contenu de critique musicale ou éducatif
Vous aurez des extraits de chansons éparpillés partout. Intégrez le flux de travail de la liste d'horodatages décrit dans la solution 1 à votre processus de production. Notez l'horodatage de chaque extrait avant d'envoyer l'audio à n'importe quel outil de transcription. Après la transcription, vous ajoutez les marqueurs aux bons endroits. C'est la seule approche qui produit une transcription exacte pour ce type de contenu.
Enregistrement avec nappe musicale de fond
La séparation de sources est le bon outil si la qualité audio compte. Si la musique est à faible volume et la parole claire, un no_speech_threshold plus élevé dans Whisper auto-hébergé aide parfois. Accepter une légère perte de précision sur les mots proches des phrases musicales est raisonnable pour des usages internes. Pour la publication, séparez les pistes.
Vidéo YouTube avec bande-son musicale
Extraire l'audio d'une vidéo YouTube contenant de la musique tout du long et l'envoyer directement à un moteur de transcription produira des hallucinations importantes. La génération de transcriptions YouTube fonctionne mieux lorsque la vidéo est principalement portée par la parole. Pour le contenu YouTube riche en musique, la séparation de sources avant transcription est la voie fiable.
Office religieux ou prêche avec musique
Le prêche et la musique alternent en segments distincts. Couper les passages musicaux (hymnes, chants de louange) avant de transcrire est l'approche pratique. Ajoutez des marqueurs manuels pour chaque section musicale. Les parties parlées se transcrivent proprement.
Un flux de travail pour les créateurs de contenu riches en musique
Pour quiconque produit régulièrement du contenu avec de la musique, intégrer l'étape de coupe propre dans la chaîne de production coûte moins cher que de réparer les transcriptions après coup.
- Produisez deux versions de chaque épisode : le mix de publication (avec musique) et une version de transcription (parole seule).
- Conservez la version de transcription comme étape d'exportation séparée dans votre logiciel de montage.
- Transcrivez uniquement la version de transcription.
- Ajoutez à la main les marqueurs musicaux à la transcription finale, aux horodatages où la musique a joué.
- Utilisez la transcription propre pour les notes d'émission, le SEO, les sous-titres et la recherche.
Pour les enregistrements ponctuels, la voie de la séparation de sources (solution 2) gère les cas où vous ne pouvez pas remonter le fichier.
Pour du contenu enregistré avec une musique de fond discrète à faible volume, vérifiez la transcription à la recherche des schémas d'hallucination décrits ci-dessus et nettoyez-les manuellement. L'explication de la diarisation des locuteurs couvre un problème de précision connexe : les voix qui se chevauchent provoquent des symptômes de sortie charabia similaires dans la transcription, et le processus de diagnostic est comparable.
Si vous avez simplement besoin d'une transcription propre à partir d'un enregistrement contenant uniquement de la parole sans aucune musique, ConvertAudioToText gère le téléversement sans exiger de compte pour commencer.
FAQ
Pourquoi ma transcription contient-elle du texte absurde là où la musique jouait ?
Les modèles de transcription par IA sont entraînés à associer l'audio à des mots. Lorsque l'audio contient de la musique, surtout chantée, le modèle la traite comme de la parole et tente de la transcrire. Le résultat est des pseudo-paroles illisibles, du remplissage halluciné ou des phrases carrément fabriquées. Aucun service de transcription grand public actuel ne dispose d'une couche vérifiée de détection de musique qui supprime ces segments de manière fiable.
Le VAD (détection d'activité vocale) peut-il filtrer automatiquement la musique ?
Partiellement. Le VAD filtre bien le silence et les segments à faible énergie, mais il échoue souvent sur la musique car celle-ci porte son énergie dans les bandes de fréquences que le VAD considère comme de la parole. WhisperX, avec le VAD activé par défaut, produit encore des hallucinations sur les passages musicaux qui passent au travers. Le VAD est un point de départ utile, mais ce n'est pas une solution complète pour la musique.
Whisper affiche-t-il une étiquette [Music] pour les segments musicaux ?
Pas de manière fiable. L'étiquette [Music] que vous avez pu voir dans les sous-titres automatiques de YouTube provient d'une couche distincte que Google ajoute à sa propre chaîne ASR, et non du décodeur de Whisper. Sur la musique, la sortie propre de Whisper va des paroles hallucinées aux phrases fabriquées en passant par des mots de remplissage. Une recherche publiée en 2025 a révélé que Whisper large-v3 hallucine sur près de 100 % des audios environnementaux non parlés. La séparation de sources ou la découpe manuelle est la seule atténuation fiable.
Vaut-il la peine de transcrire les paroles d'une chanson à partir d'un enregistrement ?
Presque jamais via un moteur ASR généraliste. Le chant comporte un rythme, une hauteur et des frontières phonémiques modifiés qui perturbent les modèles entraînés sur de l'audio conversationnel. Vous obtiendrez des paroles partielles et incorrectes mêlées de mots inventés. Si vous avez réellement besoin de paroles exactes, un service spécialisé de reconnaissance de paroles ou une transcription manuelle est le bon outil. Pour la plupart des cas d'usage podcast et interview, couper le passage musical et le remplacer par un marqueur comme [Song: Titre par Artiste] donne un résultat bien plus propre.
Sources
- Vue d'ensemble des modèles et langues Deepgram (vérifié en juillet 2026) : https://developers.deepgram.com/docs/models-languages-overview
- Documentation d'intelligence audio AssemblyAI (vérifiée en juillet 2026) : https://www.assemblyai.com/docs/guides/audio-intelligence
- Calm-Whisper : réduire les hallucinations de Whisper sur le non-parlé (arXiv, 2025) : https://arxiv.org/html/2505.12969v1
- Discussion GitHub sur les hallucinations de Whisper #1606 : https://github.com/openai/whisper/discussions/1606
- Présentation de Demucs v4 / htdemucs (HuggingFace Spaces) : https://huggingface.co/spaces/abidlabs/music-separation
- Spleeter par Deezer (GitHub) : https://github.com/deezer/spleeter
- Documentation VAD de WhisperX (DeepWiki) : https://deepwiki.com/m-bain/whisperX/4.1-voice-activity-detection
- Guide initial_prompt de Whisper (blog Sotto) : https://sotto.to/blog/improve-whisper-accuracy-prompts
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.