
Comment convertir du WMA en texte : sauver les anciens fichiers audio Windows
Summarize this article with:
Les fichiers WMA (Windows Media Audio) issus d'anciens dictaphones Olympus, de l'enregistreur son Windows ou d'entretiens archivés peuvent être transcrits par n'importe quel outil IA moderne qui accepte ce format, ou convertis d'abord en MP3 avec une seule commande ffmpeg. Le seul obstacle vraiment bloquant est le DRM : les fichiers musicaux WMA achetés sur des boutiques Microsoft aujourd'hui disparues contiennent un chiffrement impossible à déchiffrer depuis l'arrêt des serveurs de licences en 2017. Les fichiers WMA de dictaphone et d'enregistrement vocal ne sont quasiment jamais protégés par DRM, donc la plupart des opérations de sauvetage se déroulent sans accroc.
La plupart des fichiers WMA issus d'anciens enregistreurs, de l'enregistreur son Windows ou d'entretiens archivés se transcrivent très bien aujourd'hui. Téléversez-les vers un outil qui accepte le WMA, ou convertissez-les d'abord en MP3 avec une seule commande ffmpeg. Le seul vrai blocage : les fichiers WMA protégés par DRM provenant de boutiques musicales disparues restent verrouillés définitivement depuis l'arrêt des serveurs de licences de Microsoft en 2017.

D'où viennent réellement les fichiers WMA
Le WMA (Windows Media Audio) a atteint son apogée entre 2000 et 2012. Si vous en avez un en 2026, il provient presque certainement d'un ensemble restreint de sources :
- Un dictaphone numérique Olympus, Sony ou Sanyo. Olympus a livré des enregistreurs réglés par défaut sur le WMA Standard jusque tard dans les années 2000, produisant des fichiers mono à 32-64 kbit/s.
- L'enregistreur son de Windows. Vista et Windows 7 enregistraient par défaut en WMA 9.2 à 96 kbit/s. Aucune autre option n'était disponible dans l'interface.
- De la musique extraite de CD avec Windows Media Player et ses réglages par défaut, qui produisait du WMA plutôt que du MP3.
- Des enregistrements de conférences téléphoniques ou de cours provenant de systèmes d'entreprise sous Windows utilisant Windows Media Encoder.
Le format a fortement décliné depuis 2012. iOS et Android ont standardisé l'AAC/M4A, et aucune application d'enregistrement majeure ne produit plus de WMA aujourd'hui. Ce que vous avez entre les mains est un héritage, et la question est toujours la même : puis-je en extraire du texte ?
Quatre codecs WMA, et pourquoi c'est important pour la transcription
L'extension .wma recouvre quatre codecs distincts empaquetés dans le conteneur ASF (Advanced Systems Format) de Microsoft. Ils se comportent de façon très différente.
WMA Standard représente 90 % des fichiers WMA. Il concurrence directement le MP3, fonctionne à 32-192 kbit/s et utilise une compression psychoacoustique. Les outils de transcription le traitent sans problème. Si votre dictaphone produisait du WMA, c'est celui-là.
WMA Pro vise l'audio multicanal haute résolution : jusqu'à 8 canaux, 24 bits de profondeur, échantillonnage à 96 kHz. Vous ne le rencontrerez pas dans un enregistreur vocal. Il est apparu principalement sur des sorties DVD commerciales. Les outils de transcription le prennent ou non en charge ; en cas de refus, convertissez d'abord en MP3.
WMA Lossless est l'équivalent du FLAC chez Microsoft. Très rare dans les enregistrements vocaux, occasionnel dans les extractions de CD. Il compresse sans perte : le contenu audio est donc parfait, mais la taille du fichier est élevée (équivalent 470-940 kbit/s). Tout outil de transcription qui traite le WMA Standard devrait traiter le Lossless.
WMA Voice est le cas particulier. C'est un codec vocal de la famille CELP, optimisé pour la voix à des débits allant jusqu'à 20 kbit/s et uniquement en mono jusqu'à 22,05 kHz. C'est le codec qu'utilisaient certains anciens systèmes de dictée téléphonique et des enregistreurs très bon marché. Les outils de transcription modernes peuvent le rejeter parce qu'il est techniquement distinct des trois autres, même si l'extension paraît identique. Si vous voyez un fichier WMA suspectement petit (moins de 5 Mo pour une heure d'audio), c'est probablement du WMA Voice. Convertissez-le en MP3 avant de le téléverser.
Le piège du DRM (à lire avant de commencer)
C'est le seul cas où la transcription est impossible sans intervention matérielle.
Les fichiers WMA achetés sur les anciennes boutiques musicales de Microsoft (MSN Music, Zune Marketplace, revendeurs PlaysForSure) étaient chiffrés avec Windows Media DRM. Microsoft a fermé définitivement ses serveurs d'acquisition de licences en mars 2017 et a retiré la prise en charge du WMDRM de Windows 10 lors de la mise à jour Anniversaire. Si vous n'avez plus de machine disposant de la licence d'origine stockée, le fichier ne peut être déchiffré par aucune méthode officiellement prise en charge. VLC affiche « Could not demux ASF stream: DRM protected streams are not supported » quand il tombe sur un tel fichier.
La bonne nouvelle pour la plupart des gens qui sauvent des archives : les dictées, entretiens et mémos vocaux n'ont jamais été protégés par DRM. Le DRM ne s'appliquait qu'aux achats de musique commerciale. Si votre WMA vient d'un dictaphone ou de l'enregistreur son, il est presque certainement propre.
Pour vérifier : essayez de lire le fichier dans VLC. S'il se lit, vous n'avez aucun problème de DRM. Si VLC affiche l'erreur de démultiplexage mais que Windows Media Player ne peut pas non plus le lire sans demander une licence, vous êtes face à un fichier verrouillé par DRM qui nécessite une machine avec une licence stockée encore valide pour effectuer une capture audio en temps réel.
Comment obtenir une transcription d'un fichier WMA
Cette section est courte parce que le processus est simple dès lors que vous connaissez le codec et le statut DRM.
Étape 1 : confirmez que le fichier se lit dans VLC. VLC gère nativement le WMA Standard et le Lossless sous Windows, macOS et Linux. S'il se lit correctement, le fichier est sain et non protégé.
Étape 2 : repérez les fichiers WMA Voice. Fichier de moins de 5 Mo par heure d'audio, ou VLC affiche le codec comme « WMAv1/WMAv2 speech » ? Convertissez en MP3 avant de téléverser vers un service de transcription.
Étape 3 : téléversez directement ou convertissez d'abord. Si votre outil de transcription accepte le WMA, téléversez-le. S'il le refuse, convertissez avec ffmpeg :
ffmpeg -i interview.wma -c:a libmp3lame -b:a 192k interview.mp3
192 kbit/s conserve toute la fidélité présente dans l'enregistrement WMA Standard d'origine. Passer plus haut n'apporte rien pour la parole.
Étape 4 : sélectionnez la langue manuellement. La détection automatique donne de moins bons résultats sur les enregistrements anciens à l'audio dégradé. Si votre archive comprend des entretiens non anglophones, choisissez explicitement la langue. Consultez le guide sur les formats audio pris en charge pour la transcription pour les notes sur la couverture linguistique selon les outils.
Étape 5 : relisez avec une prudence adaptée au format. Les vieux enregistreurs vocaux avaient des préamplis micro bruyants et des gains faibles. Comptez plutôt 90-95 % de précision que les 96-98 % d'un smartphone moderne. Portez une attention particulière aux noms propres, aux chiffres et à tout passage où l'enregistreur était à plus de 30 cm de l'orateur.
Le vrai problème des anciens enregistrements de dictée
Le codec lui-même cause rarement les échecs de transcription. Les vrais problèmes sont analogiques, pas numériques.
Niveaux d'enregistrement trop faibles. Les enregistreurs des années 2000 capturaient souvent à faible gain pour prolonger l'autonomie. Si la transcription revient presque vide, le pic audio est trop bas pour le seuil de détection de la parole. Ouvrez dans Audacity, lancez Effet > Normaliser en ciblant -1 dBFS, puis réexportez. N'appliquez pas ensuite une réduction de bruit agressive : les moteurs vocaux IA modernes gèrent mieux un bruit de fond modéré qu'un audio surtraité dont les harmoniques de la parole ont été supprimées.
Mono sur un seul canal. Presque tous les fichiers WMA de dictée sont en mono. La diarisation des locuteurs en mono fonctionne en analysant les caractéristiques vocales plutôt que la séparation des canaux, ce qui fait baisser la précision sur les entretiens à deux locuteurs. Si les étiquettes de locuteurs sont cruciales, consultez le guide diarisation des locuteurs expliquée pour savoir à quoi vous attendre et comment nettoyer le résultat manuellement.
En-têtes fragmentés. Certains fichiers WMA très anciens ont des en-têtes ASF malformés qui perturbent les outils de transcription alors même que l'audio se lit parfaitement. Si un fichier déclenche une mystérieuse « erreur de format » au téléversement alors qu'il se lit dans VLC, réemballez-le d'abord :
ffmpeg -i broken.wma -c:a copy fixed.wma
Si le réemballage échoue, forcez un réencodage complet en MP3 :
ffmpeg -i broken.wma -c:a libmp3lame -b:a 192k fixed.mp3
Scénarios courants d'archives WMA
Archives d'entretiens journalistiques
Les rédactions qui ont numérisé leurs archives de cassettes à la fin des années 2000 ont souvent opté pour le WMA parce que la plateforme Windows était la norme. Ces fichiers sont aujourd'hui inaccessibles à la plupart des outils modernes. Pour un traitement en masse, convertissez toute l'archive en MP3 avec une seule commande par lot, puis téléversez. Le guide de transcription d'entretien explique comment structurer le résultat une fois le texte obtenu.
Dictées juridiques et dossiers médicaux
Les avocats et médecins qui utilisaient des enregistreurs Olympus ou Sony avant 2012 possèdent des piles de WMA de l'ère WMA Standard en mono à 32-64 kbit/s. Sur une dictée propre, la précision atteint typiquement 92-95 % avec l'IA moderne, acceptable pour un premier jet qu'un humain relit ensuite. L'article précision de la transcription expliquée détaille ce que signifient concrètement les taux d'erreur selon les cas d'usage.
Enregistrements d'histoire familiale
Les généalogistes héritent parfois de fichiers WMA de proches qui enregistraient des histoires orales sur un portable Windows XP avec le micro intégré. Ce sont les plus difficiles : gain faible, grondement de micro, réverbération due à l'enregistrement dans une cuisine ou un salon. Un filtre passe-haut à 100 Hz dans Audacity supprime le grondement basse fréquence sans toucher à la parole, avant de lancer la transcription.
WMA face aux formats à privilégier aujourd'hui
| Format | Débit (voix) | Précision de transcription | Prise en charge par les outils |
|---|---|---|---|
| WMA Standard | 32-128 kbit/s | 90-95 % | Limitée, en déclin |
| WMA Voice | 6-20 kbit/s | 80-88 % | Faible, souvent rejeté |
| MP3 | 64-192 kbit/s | 95-97 % | Universelle |
| AAC / M4A | 32-128 kbit/s | 95-97 % | Universelle |
| FLAC | Sans perte | 96-98 % | Large |
| WAV (PCM) | Non compressé | 96-98 % | Universelle |
Si vous choisissez un format pour de nouveaux enregistrements, utilisez AAC, MP3 ou WAV. Pour du WMA existant, le codec lui-même n'est pas un problème bloquant pour les variantes Standard/Lossless ; les difficultés viennent toujours de la qualité audio source et de l'acceptation ou non du conteneur par l'outil. Si votre outil refuse, une seule commande ffmpeg convertit tout le dossier.
Pour approfondir l'interaction entre le choix du format et la précision, consultez précision de la transcription expliquée et comment convertir du MP3 en texte pour le format vers lequel convergent la plupart des fichiers WMA convertis.
Mon avis : les cas de sauvetage WMA que je rencontre sont presque toujours solubles. Le cul-de-sac du DRM prend les gens au dépourvu, mais il ne touche que les achats de musique, pas les enregistrements. Tout le reste relève d'un problème de niveau ou de mauvais codec, tous deux corrigeables dans Audacity ou ffmpeg en moins de cinq minutes.
Si vous avez besoin d'une transcription propre d'enregistrements anciens sans friction, audio vers texte chez ConvertAudioToText accepte directement les téléversements WMA Standard et Lossless.
FAQ
Peut-on transcrire du WMA sans le convertir au préalable ?
Parfois. Quelques outils de transcription modernes acceptent directement le WMA, dont l'outil audio-vers-texte de ConvertAudioToText. La plupart des outils génériques de téléversement rejettent ce format et vous demanderont de convertir d'abord en MP3, ce qui prend une seule commande ffmpeg.
Mon fichier WMA se lit dans Windows Media Player mais pas dans VLC. Est-ce le DRM ?
Très probablement oui. VLC affiche l'erreur « Could not demux ASF stream: DRM protected streams are not supported » sur les fichiers protégés. Les serveurs de licences WMDRM de Microsoft ont fermé définitivement en 2017 ; si vous n'avez plus de machine disposant d'une licence valide stockée, le fichier est pratiquement irrécupérable par toute méthode officiellement prise en charge.
Comment amplifier un audio trop faible issu d'un vieux dictaphone avant la transcription ?
Ouvrez le WMA dans Audacity et lancez Effet > Normaliser (cible autour de -1 dBFS). Cela remonte la parole au-dessus du bruit de fond sans introduire d'écrêtage. Évitez ensuite une réduction de bruit agressive : les moteurs vocaux IA modernes gèrent mieux un bruit de fond modéré qu'un audio surtraité.
La qualité audio du WMA est-elle suffisante pour une transcription par IA, ou vaut-il mieux résumer manuellement ?
Presque toujours suffisante. Le WMA Standard à 32-128 kbit/s, qui couvre toute l'époque des dictaphones, offre une fidélité suffisante pour la transcription IA moderne. Comptez plutôt 90-95 % de précision que les 96-98 % d'un enregistrement récent au smartphone, principalement à cause des vieux préamplificateurs micro, pas à cause du codec.
Sources
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How to Convert AAC to Text: Streams vs M4A Explained
AAC to text: the raw-stream vs M4A container distinction that trips tools, broadcast origins, and the reliable workflow.

How to Convert FLAC to Text: Lossless Audio Guide 2026
FLAC to text for field recordings and archival interviews: why lossless helps, half-of-WAV file sizes, and the upload workflow.