Formats audio pris en charge, le tableau de compatibilité
transcriptionformats audiotechnique

Formats audio pris en charge, le tableau de compatibilité

BMMamane B. MoussaApril 14, 2026Updated July 2, 202614 min read

Summarize this article with:

Le tableau de compatibilité

Tous les grands outils de transcription acceptent le MP3, le WAV, le M4A et le MP4. Les différences apparaissent avec les formats moins courants, les limites de taille de fichier et les restrictions de codec. Utilisez le tableau ci-dessous pour vérifier votre format avant de téléverser, puis lisez les sections suivantes pour comprendre les cas limites qui provoquent de vraies erreurs.

FormatTypeCATTOtter.aiTurboScribeDescriptRev.comTrintFirefliesHappy ScribeAWS TranscribeOpenAI Whisper API
MP3AudioOuiOuiOuiOuiOuiOuiOuiOuiOuiOui
WAVAudioOuiOuiOuiOuiOuiOuiOuiOuiOuiOui
M4AAudioOuiOuiOuiOuiOuiOuiOuiOuiNon*Oui
FLACAudioOuiNonOuiOuiOuiNonNonOuiOuiNon
AACAudioOuiNonOuiOuiOuiOuiNonOuiNonNon
OGGAudioOuiOuiOuiNonNonNonNonOuiOuiNon
OpusAudioOuiNonOuiNonNonNonNonOuiOui (via OGG/WebM)Non
WMAAudioOuiOuiOuiNonNonOuiNonOuiNonNon
AIFFAudioNonNonOuiOuiNonNonNonOuiNonNon
MP4VidéoOuiOuiOuiOuiOuiOuiOuiOuiOuiOui
MOVVidéoOuiOuiOuiOuiOuiOuiNonOuiNonNon
AVIVidéoOuiOuiOuiNonNonOuiNonOuiNonNon
MKVVidéoOuiOuiOuiNonNonNonNonOuiNonNon
WebMVidéoOuiNonOuiNonNonNonOuiOuiOuiOui

*Le traitement par lots d'AWS Transcribe prend en charge le conteneur MP4 (qui peut transporter de l'audio AAC), mais pas les fichiers M4A autonomes, d'après leur documentation. Vérifiez votre cas d'usage précis.

Vérifié en juillet 2026. Sources listées en bas de page.

Limites de taille de fichier et de durée

C'est là que les gens sont surpris. Le support des formats compte moins que de savoir si votre fichier tient physiquement dans la limite de téléversement du service.

ServiceLimite de taille de fichierLimite de duréeRemarques
ConvertAudioToText100 MoAucune limite stricteUn quota basé sur les minutes s'applique selon le forfait
Otter.ai5 GoAucune limite annoncée3 importations gratuites à vie ; 10/mois avec Pro
TurboScribe5 Go10 heuresJusqu'à 50 fichiers en même temps avec Unlimited
Descript50 Go par projet15 heures pour la transcription automatique3 canaux audio ou plus réduits en stéréo
Rev.com2 Go (téléversement API), 5 To (URL)17 heuresTranscription juridique : 20 Go au total
Trint3 Go (recommandé)3 heures (recommandé)Les fichiers plus volumineux sont acceptés mais sujets aux erreurs
Fireflies200 Mo150 minutesLe forfait gratuit est plafonné à 100 Mo
Happy ScribeAucune limite annoncéeAucune limite annoncée31 formats audio + 16 formats vidéo
AWS Transcribe2 Go4 heuresLes fichiers doivent être dans S3 pour les traitements par lots
OpenAI Whisper API25 MoAucune limite annoncéeImpacte surtout le WAV : un WAV de 25 Mo correspond à environ 25 minutes d'audio
Deepgram (API)2 GoAucune limite annoncéePlus de 100 formats ; extraction audio depuis la vidéo
AssemblyAI (API)2,2 Go (téléversement), 5 Go (URL)10 heuresRecommande de soumettre le fichier dans son format natif

La limite de 25 Mo de l'API OpenAI Whisper est la source de confusion la plus courante. Un entretien de 2 heures en fichier WAV pèse généralement plus de 1 Go. La limite porte sur la taille du fichier, pas sur la durée, donc un MP3 de 2 heures à 96 kbps (environ 86 Mo) échouera aussi. La solution consiste à compresser à un débit binaire plus faible ou à utiliser un service adapté à la taille de votre fichier.

Outil de téléversement audio chez ConvertAudioToText
Outil de téléversement audio chez ConvertAudioToText
L'outil de téléversement de ConvertAudioToText accepte MP3, WAV, M4A, FLAC, AAC, OGG, Opus, WMA, ainsi que tous les principaux conteneurs vidéo. La limite de 100 Mo par fichier s'applique aux téléversements ; les tâches provenant d'URL (YouTube, Vimeo, liens directs) n'y sont pas soumises.

Formats audio : ce que chacun signifie vraiment

MP3

MP3 est le choix sûr par défaut. Il est accepté partout, léger, et à partir de 128 kbps, aucune perte de précision mesurable par rapport au WAV. En dessous de 64 kbps, les artefacts de compression commencent à dégrader la clarté de la parole. Les anciens messages vocaux enregistrés à 32 kbps sont les pires contrevenants.

Tailles de fichiers pratiques : environ 1 Mo par minute à 128 kbps. Un enregistrement de 2 heures pèse environ 115 Mo, ce qui dépasse la limite de l'API Whisper mais passe partout ailleurs.

WAV

Le WAV est sans perte, ce qui compte pour l'archivage, pas pour la précision de la transcription. Un WAV et un MP3 à 128 kbps du même enregistrement de parole produisent des transcriptions quasi identiques avec n'importe quel modèle d'IA moderne. La vraie différence, c'est la taille : le WAV pèse environ 10 Mo par minute en qualité CD (44,1 kHz, 16 bits stéréo).

Si vous atteignez les limites de taille de fichier, convertissez en MP3 avant l'envoi. Vous ne perdrez aucune précision.

M4A

Les mémos vocaux de l'iPhone s'exportent en M4A. Ce format utilise la compression AAC dans un conteneur MP4, plus efficace que le MP3. Les fichiers sont légèrement plus petits qu'un MP3 de qualité équivalente, et tous les principaux outils de transcription grand public le prennent en charge.

AWS Transcribe ne liste pas le M4A comme format pris en charge dans sa documentation batch ; si vous utilisez directement l'API AWS, convertissez d'abord en MP3 ou WAV. Les outils grand public (CATT, TurboScribe, Otter, Descript, Rev) le gèrent nativement.

FLAC

Le FLAC est une compression sans perte. Les fichiers sont 50 à 70 pour cent plus petits qu'en WAV tout en préservant chaque bit de l'audio original. Pour la transcription, il n'offre aucun avantage de précision par rapport à un MP3 bien encodé, mais il est utile quand vous devez archiver l'original et envoyer un seul fichier.

Tous les services ne le supportent pas : Otter.ai, Fireflies et Trint n'acceptent pas le FLAC. Vérifiez avant d'envoyer.

OGG / Opus

OGG Vorbis et Opus sont des formats open source, courants dans les enregistrements Android et les applications web. Opus en particulier est utilisé dans WebRTC (enregistrements navigateur, appels vocaux, exports Discord). La prise en charge est inégale au niveau grand public : Descript, Rev et Fireflies ne gèrent pas OGG directement. AWS Transcribe et Deepgram les traitent tous deux via leurs conteneurs respectifs.

Si votre source est un enregistrement Android en OGG, convertissez-le d'abord en MP3 pour une compatibilité maximale.

WMA

Windows Media Audio disparaît peu à peu de la production, mais on le retrouve encore dans les exports de l'ancien Enregistreur vocal Windows et les enregistrements de centres d'appels hérités. TurboScribe, Otter.ai et Trint l'acceptent ; Descript, Fireflies et Rev non.

AIFF

AIFF est le format non compressé d'Apple, généralement produit par GarageBand et Pro Tools. Les tailles de fichiers sont similaires au WAV. Seuls TurboScribe et Descript acceptent l'AIFF parmi les services de ce tableau ; si votre DAW exporte en AIFF, vérifiez votre service cible avant de téléverser.

Formats vidéo et extraction audio

Tous les services de ce tableau extraient automatiquement la piste audio de la vidéo. Pas besoin de prétraiter un fichier vidéo avant le téléversement.

MP4 fonctionne partout. MOV fonctionne sur la plupart des services grand public, mais pas sur AWS Transcribe ni Fireflies. MKV a une prise en charge limitée (CATT, Otter, TurboScribe, Happy Scribe). Si votre source est en MKV ou AVI et que vous utilisez un service qui ne le prend pas en charge, extrayez l'audio en MP3 avec FFmpeg : ffmpeg -i input.mkv -vn -ab 192k output.mp3.

Pour plus de détails sur la sortie des sous-titres à partir de fichiers vidéo, voir SRT vs VTT vs TTML : quel format de sous-titres utiliser.

Quand le format affecte la précision (et quand il ne le fait pas)

Dans presque tous les cas réels, le format n'affecte pas la précision. Les modèles modernes de transcription IA traitent les formes d'onde audio après décodage, donc le format conteneur et le codec de compression ne font aucune différence significative à des réglages de qualité normaux.

Les trois cas où le format compte vraiment :

Débit MP3 très faible (moins de 64 kbps). Les artefacts de compression dans l'audio sous 64 kbps peuvent dégrader l'intelligibilité de la parole, aussi bien pour les auditeurs humains que pour les modèles d'IA. Cela se produit dans les très vieilles archives de podcasts, les exports de messagerie vocale compressés et les flux audio très petits.

Ré-encodage multi-générations. Convertir du WAV en MP3, puis en OGG, puis de nouveau en MP3 accumule les pertes de compression et dégrade la qualité à chaque étape. Travaillez à partir du fichier source original quand c'est possible.

Fichiers corrompus ou tronqués. Un fichier partiellement téléchargé ou un enregistrement interrompu peut passer la validation de format, mais échouer en plein milieu de la transcription. Re-téléchargez ou ré-exportez la source.

Pour un aperçu plus détaillé de l'impact des fréquences d'échantillonnage et du nombre de canaux sur la précision au niveau de l'API, consultez l'article explication de la précision de transcription.

Particularités des codecs à connaître

Quelques détails précis qui provoquent des échecs silencieux :

AWS Transcribe exige le codec Opus pour l'OGG. Le service accepte les conteneurs OGG et WebM, mais uniquement avec de l'audio Opus à l'intérieur. Un fichier OGG Vorbis échouera. C'est documenté dans leurs exigences d'entrée.

Google Cloud STT exige une déclaration d'encodage. Contrairement à Deepgram, l'API de Google exige que vous spécifiiez l'encodage audio dans votre requête. Envoyer un MP3 sans déclarer MP3 dans le champ d'encodage échouera. Leur API V2 peut auto-détecter certains formats, mais pas la V1.

Audio multi-canaux (plus de 2 canaux). AWS Transcribe ne prend pas en charge l'audio avec plus de deux canaux. Descript réduit automatiquement les fichiers de 3 canaux ou plus en stéréo à l'importation. Si vous enregistrez en multi-canaux (enregistreur de conférence 4 canaux, micro ambisonique), réduisez en stéréo avant d'envoyer à tout service basé sur une API.

Encodage PCM dans les WAV. La plupart des fichiers WAV utilisent l'encodage PCM et fonctionnent partout. Les fichiers WAV avec des encodages inhabituels (GSM, ADPCM) peuvent échouer sur certains services, même si le conteneur est reconnu. Le ffprobe de FFmpeg peut vous indiquer quel encodage se trouve dans votre fichier WAV.

Pour une vue plus large sur le choix du format, de l'enregistrement à l'archivage, consultez les formats de fichiers de transcription expliqués et WAV vs MP3 pour la transcription.

Conversion vers un format pris en charge

Si vous avez un fichier dans un format non pris en charge ou si vous devez réduire sa taille avant l'envoi, l'outil audio vers texte accepte le fichier directement et gère la conversion en interne. Pour les flux de travail programmatiques, la ligne de commande ci-dessous couvre la plupart des cas :

ffmpeg -i input.anyformat -vn -ar 16000 -ac 1 -ab 64k output.mp3

Cette commande extrait l'audio, règle la fréquence d'échantillonnage à 16 kHz (suffisante pour la parole), convertit en mono et encode à 64 kbps. Cela réduit un WAV d'une heure d'environ 600 Mo à environ 30 Mo, sans perte de précision de transcription.

Si vous voulez garder l'original et juste une copie plus légère pour l'envoi, la même commande fonctionne : -ab 128k offre plus de marge et reste bien en dessous de toutes les limites de service.

Si vous avez simplement besoin d'une transcription propre sans bot de réunion ni éditeur vidéo, ConvertAudioToText accepte tous les formats de ce tableau (sauf AIFF) et traite la plupart des fichiers en moins d'une minute.

Questions fréquentes

Quel est le meilleur format audio pour la précision de transcription ?

Tout format sans perte (WAV, FLAC) ou format compressé de haute qualité (MP3 à 128 kbps ou plus, M4A en qualité standard) donnera la même précision de transcription avec n'importe quel modèle d'IA moderne. L'environnement d'enregistrement et la qualité du microphone comptent bien plus que le format audio. Gardez le WAV ou le FLAC pour l'archivage ; envoyez du MP3 pour des tailles de fichier raisonnables.

Pourquoi l'API OpenAI Whisper rejette-t-elle mon fichier alors que d'autres services l'acceptent ?

L’API Whisper impose une limite de taille de fichier de 25 Mo, bien plus basse que celle des autres services. Un MP3 d’une heure à 128 kbps pèse environ 57 Mo et sera rejeté. La solution consiste à compresser à un débit plus faible (64 kbps suffisent pour de la parole), à découper le fichier en plusieurs morceaux, ou à utiliser un service sans cette limite de 25 Mo.

Puis-je envoyer directement un fichier vidéo, ou dois-je d’abord extraire l’audio ?

Vous pouvez envoyer une vidéo directement à tous les services de ce tableau. Ils extraient automatiquement la piste audio. Le MP4 fonctionne partout ; le MOV et le MKV sont pris en charge de manière inégale par les services au niveau API comme AWS Transcribe. Si vous utilisez une API directement et que votre format vidéo ne figure pas dans la liste des formats pris en charge, extrayez d’abord l’audio avec FFmpeg.

Les enregistrements multi-canaux (son surround) fonctionnent-ils ?

La plupart des outils de transcription réduisent automatiquement le mixage en stéréo ou ne prennent explicitement pas en charge plus de deux canaux. AWS Transcribe documente une limite stricte de deux canaux. Descript réduit le mixage à l’importation. Pour des résultats fiables, convertissez tout enregistrement multi-canaux en mono ou en stéréo avant l’envoi.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles