Comment convertir un AAC en texte : flux bruts vs M4A expliqués
transcriptionaudioaac

Comment convertir un AAC en texte : flux bruts vs M4A expliqués

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

L'AAC (Advanced Audio Coding) est le codec audio dominant sur les appareils Apple, YouTube et la radio numérique, mais il se cache sous deux formats d'emballage très différents : les flux ADTS bruts (.aac) et les conteneurs M4A (.m4a). Les deux se transcrivent proprement avec un moteur IA moderne, et vous n'avez pas besoin de convertir en MP3 d'abord. Savoir quel emballage vous avez, et où se situe le plancher de débit binaire pour une bonne précision, fait toute la différence entre une transcription nette et une transcription semée d'approximations.

Vous pouvez transcrire un fichier AAC directement, sans le convertir d'abord en MP3. Téléversez le fichier, choisissez la langue, et un moteur basé sur Whisper Large-v3 renvoie une transcription horodatée en moins de deux minutes pour la plupart des enregistrements. La seule chose utile à savoir d'emblée est si votre fichier est un flux ADTS brut (.aac) ou de l'AAC dans un conteneur M4A (.m4a), car cela change le comportement de certains outils, et pourquoi.

Les fichiers AAC se téléversent directement, flux bruts inclus
Les fichiers AAC se téléversent directement, flux bruts inclus

Quelle est la différence entre .aac et .m4a ?

C'est le point le plus déroutant de ce format, et il piège tous ceux qui le rencontrent pour la première fois.

Un fichier .aac est un flux binaire ADTS nu. ADTS signifie Audio Data Transport Stream. Chaque trame comporte un petit en-tête suivi des données audio compressées. Il n'y a pas de conteneur de métadonnées : pas de pochette, pas de balise titre, pas de marqueurs de chapitres. L'ADTS a été conçu pour les protocoles de streaming comme SHOUTcast et les flux de transport broadcast ; il embarque juste assez de cadrage pour permettre à un décodeur de se synchroniser en cours de flux.

Un fichier .m4a est le même codec AAC, enveloppé dans un conteneur MPEG-4. Ce conteneur ajoute des atomes de métadonnées, prend en charge les marqueurs de chapitres, et c'est le format qu'Apple a choisi pour iTunes, Apple Podcasts et les mémos vocaux de l'iPhone. C'est le même audio, simplement mieux emballé.

La confusion : les deux types de fichiers apparaissent parfois avec l'extension .aac. Les téléchargeurs YouTube utilisant yt-dlp sans options explicites peuvent produire l'un ou l'autre format. L'extension seule ne vous dit pas lequel vous avez. Lancez ffprobe yourfile.aac : cherchez container: adts (flux nu) par opposition à container: mov,mp4,m4a,3gp,3g2,mj2 (conteneur MPEG-4).

Pour la transcription, la différence pratique tient à la fiabilité. Les conteneurs M4A se chargent proprement dans tous les outils. Les flux ADTS bruts produisent occasionnellement des en-têtes illisibles pendant les premières secondes, surtout s'ils proviennent d'enregistrements de flux broadcast ou de multiplexages bâclés. Si vous obtenez une transcription partielle ou du charabia en tête depuis un fichier .aac, la solution consiste à changer de conteneur sans ré-encoder :

ffmpeg -i input.aac -c:a copy output.m4a

Cela ré-emballle exactement les mêmes bits audio dans un conteneur M4A. Aucune perte de qualité. La plupart des problèmes disparaissent.

D'où viennent réellement les fichiers AAC

Connaître la source vous dit à quoi vous attendre avant le téléversement.

Les mémos vocaux de l'iPhone s'enregistrent en .m4a contenant de l'AAC-LC à environ 64-96 kbps par défaut. Le débit varie selon le contenu : un mémo d'une personne parlant proche du micro s'encode plus efficacement qu'un enregistrement de pièce avec bruit de ventilation. Si vous avez besoin d'une meilleure précision sur des enregistrements difficiles, passez en Sans perte dans Réglages > Mémos vocaux, qui enregistre en ALAC (Apple Lossless). Pour un workflow de transcription d'entretien, consultez le guide comment transcrire un mémo vocal depuis un iPhone.

YouTube diffuse l'audio vidéo standard en AAC-LC à environ 126-128 kbps dans un conteneur M4A (le flux audio .m4a à l'intérieur de la vidéo .mp4). YouTube Music Premium monte cela à 256 kbps AAC-LC. Quand vous utilisez yt-dlp pour extraire l'audio, l'option par défaut bestaudio vous donne généralement la version M4A : yt-dlp -f bestaudio --extract-audio --audio-format m4a URL. Ce fichier se transcrit proprement. Ne le convertissez pas en MP3 en chemin, vous perdriez de la qualité sans aucun bénéfice.

Apple Music diffuse en 256 kbps AAC-LC via HLS. Le seuil des 256 kbps est bien au-dessus du palier où la précision de transcription plafonne.

La radio numérique et les flux broadcast utilisent souvent le HE-AAC (High-Efficiency AAC). Le HE-AAC v1 ajoute la Spectral Band Replication pour tirer une qualité audio correcte de 32-64 kbps. Le HE-AAC v2 ajoute le Parametric Stereo et abaisse ce plancher à 16-48 kbps. Ces deux profils sont utilisés en radio numérique DAB+ et par les webradios. Si vous avez un enregistrement issu d'un flux broadcast, vérifiez le débit avant de partir du principe que vous obtiendrez une parole nette. À 32 kbps en HE-AAC, l'intelligibilité vocale tient pour l'écoute, mais la précision de la reconnaissance vocale chute nettement sur les locuteurs accentués.

Les téléchargements de podcasts depuis Apple Podcasts sont en M4A AAC-LC, généralement 128-192 kbps. Ils se transcrivent sans aucun prétraitement.

L'audio extrait de Final Cut Pro, d'iMovie ou des exports QuickTime est de l'AAC dans un conteneur M4A. L'extension .mp4 est courante ici, mais le flux audio reste de l'AAC.

AAC vs MP3 : est-ce important pour la transcription ?

En résumé : l'AAC gagne aux bas débits, fait jeu égal au-dessus de 192 kbps, et vous ne devriez jamais ré-encoder un format avec perte vers l'autre.

L'AAC utilise un algorithme purement basé sur la MDCT, plus efficace que l'approche hybride du MP3. À 128 kbps, l'AAC-LC sonne à peu près comme du MP3 à 160-192 kbps. Pour la transcription, cette efficacité se traduit par une meilleure conservation du détail des consonnes et des sifflantes aux débits réellement utilisés par les téléphones (64-128 kbps). Un enregistrement AAC à 64 kbps d'une parole claire se transcrira mieux qu'un MP3 à 64 kbps de la même session.

À 192 kbps et au-delà, la différence de codec n'est pas audible et ne constitue pas une variable significative pour la transcription. Les deux formats alimentent très bien les moteurs de reconnaissance vocale.

Ce que vous ne devez jamais faire, c'est convertir l'AAC en MP3 (ou l'inverse) avant le téléversement. Le transcodage avec perte vers avec perte recompresse un audio déjà compressé, ajoutant une perte de génération et des artefacts d'encodage. Téléversez directement le fichier .aac ou .m4a d'origine. Les moteurs de transcription modernes, dont AssemblyAI Universal-2 et Whisper Large-v3, acceptent nativement les deux via ffmpeg en interne. Le traitement du format voisin dans M4A en texte et le guide MP3 en texte couvrent les autres conteneurs si votre projet mêle plusieurs formats.

Comment transcrire un fichier AAC

Une section pour la mécanique, car l'essentiel se résume à téléverser.

1. Localisez le fichier. Mémos vocaux iPhone : touchez Partager sur le mémo, choisissez « Enregistrer dans Fichiers », puis enregistrez dans iCloud Drive ou Sur mon iPhone. Épisodes de podcast : sous macOS, faites un clic droit dans Apple Podcasts et choisissez « Afficher dans le Finder ».

2. Téléversez-le directement. Rendez-vous sur ConvertAudioToText. Glissez-y votre fichier .aac ou .m4a. Aucune conversion nécessaire. Les deux extensions sont prises en charge, ainsi que MP3, WAV, FLAC, OGG et WMA.

3. Définissez la langue explicitement. Ne comptez pas sur la détection automatique pour les extraits de moins de 60 secondes. Elle fonctionne bien sur les fichiers longs, mais peut confondre un anglais accentué avec de l'irlandais ou du gallois sur les courts extraits.

4. Relisez le résultat. Horodatage, étiquettes de locuteurs quand l'audio comporte des voix distinctes, et options d'export (TXT, DOCX, SRT, VTT) sont inclus. Pour un mémo vocal de 30 minutes, attendez-vous à un résultat en 60 à 90 secondes environ.

L'utilisation anonyme donne droit à un aperçu de 10 minutes. Un compte gratuit ajoute 10 minutes de transcription, offertes une seule fois à l'inscription et utilisables jusqu'à 3 fichiers par jour. Le plan Pro à 9,99 $/mois supprime toutes les limites.

Les pièges de transcription spécifiques à l'AAC

Le piège des .m4r et .m4b. Les deux sont de l'audio AAC. Le .m4r est un fichier de sonnerie iPhone. Le .m4b est un livre audio avec marqueurs de chapitres. Certains outils les rejettent à cause de l'extension alors que l'audio qu'ils contiennent est de l'AAC standard. Renommez en .m4a et réessayez. Si cela échoue, ffmpeg -i input.m4r -c:a copy output.m4a ré-emballle proprement.

Les artefacts de « Améliorer l'enregistrement » des mémos vocaux. Si l'option Améliorer l'enregistrement est activée dans Réglages > Mémos vocaux, la fonction applique une égalisation automatique et une réduction de bruit dès l'enregistrement. L'audio traité paraît plus propre à l'oreille, mais peut introduire un léger flou sur les sifflantes. Pour une précision de transcription maximale sur les enregistrements importants, désactivez Améliorer l'enregistrement et placez plutôt le téléphone plus près du locuteur.

Des enregistrements mono encodés en stéréo. Beaucoup d'applications mobiles enregistrent en stéréo même quand les deux canaux sont des copies identiques d'un seul micro. Cela double la taille du fichier sans rien apporter. Si votre application le permet, réglez l'enregistrement en mono. Si vous avez déjà un fichier stéréo dont les deux canaux sont identiques, ffmpeg -i input.m4a -ac 1 output_mono.m4a le convertit sans aucune perte de qualité pour la transcription.

Le HE-AAC issu de sources broadcast. Si votre fichier provient d'un flux radio enregistré ou d'une webradio, vérifiez le profil avec ffprobe. Le HE-AAC v2 à très bas débit donnera une précision moindre sur les accents non standard ou la parole rapide. Rien ne corrige cela hormis un nouvel enregistrement à débit plus élevé, mais connaître cette contrainte aide à calibrer ses attentes.

Taille de fichier contre durée. Un enregistrement AAC de 4 heures à 128 kbps pèse environ 230 Mo. C'est un gros fichier, mais largement dans les capacités de la plupart des outils de transcription. Pour des enregistrements de plus de 4-5 heures, découpez avec ffmpeg -i long.m4a -t 3600 -c copy hour1.m4a pour travailler en morceaux gérables. Le guide des formats audio pris en charge détaille les limites de taille par outil.

Référence rapide des conteneurs

ExtensionDe quoi il s'agitSource courante
.aacFlux binaire ADTS brut, sans métadonnéesTéléchargeurs YouTube, rips de flux broadcast
.m4aAAC-LC dans un conteneur MPEG-4Mémos vocaux iPhone, Apple Podcasts
.mp4 (audio seul)AAC dans un conteneur vidéo MPEG-4Exports iMovie/Final Cut, fichiers vidéo
.m4bAAC avec marqueurs de chapitresLivres audio
.m4rSonnerie AACSonneries iPhone

Pour la transcription, toutes les lignes correspondent au même codec. Le conteneur compte pour la compatibilité des outils, pas pour la qualité audio. Si vous avez un .mp4 avec de la vraie vidéo et voulez ne transcrire que l'audio, le guide MP4 en texte couvre l'étape d'extraction.

Mon avis : pour les nouveaux enregistrements destinés à la transcription, utilisez les mémos vocaux de l'iPhone en mode M4A par défaut et gardez le téléphone à portée de bras du locuteur. Le codec est suffisamment efficace pour que 64-96 kbps AAC-LC produisent des transcriptions nettes pour une parole standard dans une pièce calme. Passez au ALAC sans perte uniquement si l'audio est difficile : accents prononcés, plusieurs locuteurs qui se chevauchent, ou bruit de fond important.

Si vous avez juste besoin d'une transcription propre sans rien installer, ConvertAudioToText accepte l'AAC et le M4A directement. Téléversez, définissez la langue, et la transcription est prête en quelques minutes.

FAQ

L'AAC offre-t-il une meilleure qualité que le MP3 pour la transcription ?

À débit binaire égal, l'AAC (profil AAC-LC) est plus efficace que le MP3 grâce à son algorithme purement basé sur la MDCT. À 128 kbps, l'AAC sonne à peu près comme du MP3 à 160-192 kbps, donc un mémo vocal AAC à 128 kbps se transcrit plus proprement qu'un enregistrement MP3 à 128 kbps du même contenu. Pour la transcription, l'avantage du codec est réel en dessous de 128 kbps ; au-dessus de ce seuil, les deux formats alimentent bien les moteurs de reconnaissance vocale.

Quelle est la différence entre un fichier .aac et un fichier .m4a ?

Les deux contiennent de l'audio encodé en AAC, mais l'emballage diffère. Un fichier .aac est un flux binaire ADTS (Audio Data Transport Stream) brut : en-têtes de trames, données audio, aucun conteneur de métadonnées. Un fichier .m4a enveloppe l'AAC dans un conteneur MPEG-4 capable de stocker pochette, titre, artiste et chapitres. Les iPhone enregistrent les mémos vocaux en .m4a ; les téléchargeurs YouTube produisent parfois des fichiers .aac ADTS nus selon l'outil et ses options.

Puis-je transcrire des fichiers AAC gratuitement sans m'inscrire ?

Oui. ConvertAudioToText accepte les fichiers AAC et M4A et fournit une transcription d'aperçu de 10 minutes sans compte. La création d'un compte gratuit vous donne 10 minutes de transcription, offertes une seule fois plutôt que chaque mois. Le plan Pro à 9,99 $/mois supprime toutes les limites.

Pourquoi mon fichier AAC affiche-t-il du texte illisible au début ?

Cela indique généralement un en-tête ADTS corrompu dans un fichier .aac brut. Essayez de le ré-emballer sans ré-encoder : lancez ffmpeg -i input.aac -c:a copy output.m4a pour placer le même flux audio dans un conteneur M4A. La plupart des moteurs de transcription gèrent la version encapsulée dans un conteneur de façon plus fiable qu'un flux ADTS nu.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles