
Formats audio pris en charge, le tableau de compatibilité
Summarize this article with:
Le tableau de compatibilité
Tous les grands outils de transcription acceptent le MP3, le WAV, le M4A et le MP4. Les différences apparaissent avec les formats moins courants, les limites de taille de fichier et les restrictions de codec. Utilisez le tableau ci-dessous pour vérifier votre format avant de téléverser, puis lisez les sections suivantes pour comprendre les cas limites qui provoquent de vraies erreurs.
| Format | Type | CATT | Otter.ai | TurboScribe | Descript | Rev.com | Trint | Fireflies | Happy Scribe | AWS Transcribe | OpenAI Whisper API |
|---|---|---|---|---|---|---|---|---|---|---|---|
| MP3 | Audio | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui |
| WAV | Audio | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui |
| M4A | Audio | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Non* | Oui |
| FLAC | Audio | Oui | Non | Oui | Oui | Oui | Non | Non | Oui | Oui | Non |
| AAC | Audio | Oui | Non | Oui | Oui | Oui | Oui | Non | Oui | Non | Non |
| OGG | Audio | Oui | Oui | Oui | Non | Non | Non | Non | Oui | Oui | Non |
| Opus | Audio | Oui | Non | Oui | Non | Non | Non | Non | Oui | Oui (via OGG/WebM) | Non |
| WMA | Audio | Oui | Oui | Oui | Non | Non | Oui | Non | Oui | Non | Non |
| AIFF | Audio | Non | Non | Oui | Oui | Non | Non | Non | Oui | Non | Non |
| MP4 | Vidéo | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui | Oui |
| MOV | Vidéo | Oui | Oui | Oui | Oui | Oui | Oui | Non | Oui | Non | Non |
| AVI | Vidéo | Oui | Oui | Oui | Non | Non | Oui | Non | Oui | Non | Non |
| MKV | Vidéo | Oui | Oui | Oui | Non | Non | Non | Non | Oui | Non | Non |
| WebM | Vidéo | Oui | Non | Oui | Non | Non | Non | Oui | Oui | Oui | Oui |
*Le traitement par lots d'AWS Transcribe prend en charge le conteneur MP4 (qui peut transporter de l'audio AAC), mais pas les fichiers M4A autonomes, d'après leur documentation. Vérifiez votre cas d'usage précis.
Vérifié en juillet 2026. Sources listées en bas de page.
Limites de taille de fichier et de durée
C'est là que les gens sont surpris. Le support des formats compte moins que de savoir si votre fichier tient physiquement dans la limite de téléversement du service.
| Service | Limite de taille de fichier | Limite de durée | Remarques |
|---|---|---|---|
| ConvertAudioToText | 100 Mo | Aucune limite stricte | Un quota basé sur les minutes s'applique selon le forfait |
| Otter.ai | 5 Go | Aucune limite annoncée | 3 importations gratuites à vie ; 10/mois avec Pro |
| TurboScribe | 5 Go | 10 heures | Jusqu'à 50 fichiers en même temps avec Unlimited |
| Descript | 50 Go par projet | 15 heures pour la transcription automatique | 3 canaux audio ou plus réduits en stéréo |
| Rev.com | 2 Go (téléversement API), 5 To (URL) | 17 heures | Transcription juridique : 20 Go au total |
| Trint | 3 Go (recommandé) | 3 heures (recommandé) | Les fichiers plus volumineux sont acceptés mais sujets aux erreurs |
| Fireflies | 200 Mo | 150 minutes | Le forfait gratuit est plafonné à 100 Mo |
| Happy Scribe | Aucune limite annoncée | Aucune limite annoncée | 31 formats audio + 16 formats vidéo |
| AWS Transcribe | 2 Go | 4 heures | Les fichiers doivent être dans S3 pour les traitements par lots |
| OpenAI Whisper API | 25 Mo | Aucune limite annoncée | Impacte surtout le WAV : un WAV de 25 Mo correspond à environ 25 minutes d'audio |
| Deepgram (API) | 2 Go | Aucune limite annoncée | Plus de 100 formats ; extraction audio depuis la vidéo |
| AssemblyAI (API) | 2,2 Go (téléversement), 5 Go (URL) | 10 heures | Recommande de soumettre le fichier dans son format natif |
La limite de 25 Mo de l'API OpenAI Whisper est la source de confusion la plus courante. Un entretien de 2 heures en fichier WAV pèse généralement plus de 1 Go. La limite porte sur la taille du fichier, pas sur la durée, donc un MP3 de 2 heures à 96 kbps (environ 86 Mo) échouera aussi. La solution consiste à compresser à un débit binaire plus faible ou à utiliser un service adapté à la taille de votre fichier.

Formats audio : ce que chacun signifie vraiment
MP3
MP3 est le choix sûr par défaut. Il est accepté partout, léger, et à partir de 128 kbps, aucune perte de précision mesurable par rapport au WAV. En dessous de 64 kbps, les artefacts de compression commencent à dégrader la clarté de la parole. Les anciens messages vocaux enregistrés à 32 kbps sont les pires contrevenants.
Tailles de fichiers pratiques : environ 1 Mo par minute à 128 kbps. Un enregistrement de 2 heures pèse environ 115 Mo, ce qui dépasse la limite de l'API Whisper mais passe partout ailleurs.
WAV
Le WAV est sans perte, ce qui compte pour l'archivage, pas pour la précision de la transcription. Un WAV et un MP3 à 128 kbps du même enregistrement de parole produisent des transcriptions quasi identiques avec n'importe quel modèle d'IA moderne. La vraie différence, c'est la taille : le WAV pèse environ 10 Mo par minute en qualité CD (44,1 kHz, 16 bits stéréo).
Si vous atteignez les limites de taille de fichier, convertissez en MP3 avant l'envoi. Vous ne perdrez aucune précision.
M4A
Les mémos vocaux de l'iPhone s'exportent en M4A. Ce format utilise la compression AAC dans un conteneur MP4, plus efficace que le MP3. Les fichiers sont légèrement plus petits qu'un MP3 de qualité équivalente, et tous les principaux outils de transcription grand public le prennent en charge.
AWS Transcribe ne liste pas le M4A comme format pris en charge dans sa documentation batch ; si vous utilisez directement l'API AWS, convertissez d'abord en MP3 ou WAV. Les outils grand public (CATT, TurboScribe, Otter, Descript, Rev) le gèrent nativement.
FLAC
Le FLAC est une compression sans perte. Les fichiers sont 50 à 70 pour cent plus petits qu'en WAV tout en préservant chaque bit de l'audio original. Pour la transcription, il n'offre aucun avantage de précision par rapport à un MP3 bien encodé, mais il est utile quand vous devez archiver l'original et envoyer un seul fichier.
Tous les services ne le supportent pas : Otter.ai, Fireflies et Trint n'acceptent pas le FLAC. Vérifiez avant d'envoyer.
OGG / Opus
OGG Vorbis et Opus sont des formats open source, courants dans les enregistrements Android et les applications web. Opus en particulier est utilisé dans WebRTC (enregistrements navigateur, appels vocaux, exports Discord). La prise en charge est inégale au niveau grand public : Descript, Rev et Fireflies ne gèrent pas OGG directement. AWS Transcribe et Deepgram les traitent tous deux via leurs conteneurs respectifs.
Si votre source est un enregistrement Android en OGG, convertissez-le d'abord en MP3 pour une compatibilité maximale.
WMA
Windows Media Audio disparaît peu à peu de la production, mais on le retrouve encore dans les exports de l'ancien Enregistreur vocal Windows et les enregistrements de centres d'appels hérités. TurboScribe, Otter.ai et Trint l'acceptent ; Descript, Fireflies et Rev non.
AIFF
AIFF est le format non compressé d'Apple, généralement produit par GarageBand et Pro Tools. Les tailles de fichiers sont similaires au WAV. Seuls TurboScribe et Descript acceptent l'AIFF parmi les services de ce tableau ; si votre DAW exporte en AIFF, vérifiez votre service cible avant de téléverser.
Formats vidéo et extraction audio
Tous les services de ce tableau extraient automatiquement la piste audio de la vidéo. Pas besoin de prétraiter un fichier vidéo avant le téléversement.
MP4 fonctionne partout. MOV fonctionne sur la plupart des services grand public, mais pas sur AWS Transcribe ni Fireflies. MKV a une prise en charge limitée (CATT, Otter, TurboScribe, Happy Scribe). Si votre source est en MKV ou AVI et que vous utilisez un service qui ne le prend pas en charge, extrayez l'audio en MP3 avec FFmpeg : ffmpeg -i input.mkv -vn -ab 192k output.mp3.
Pour plus de détails sur la sortie des sous-titres à partir de fichiers vidéo, voir SRT vs VTT vs TTML : quel format de sous-titres utiliser.
Quand le format affecte la précision (et quand il ne le fait pas)
Dans presque tous les cas réels, le format n'affecte pas la précision. Les modèles modernes de transcription IA traitent les formes d'onde audio après décodage, donc le format conteneur et le codec de compression ne font aucune différence significative à des réglages de qualité normaux.
Les trois cas où le format compte vraiment :
Débit MP3 très faible (moins de 64 kbps). Les artefacts de compression dans l'audio sous 64 kbps peuvent dégrader l'intelligibilité de la parole, aussi bien pour les auditeurs humains que pour les modèles d'IA. Cela se produit dans les très vieilles archives de podcasts, les exports de messagerie vocale compressés et les flux audio très petits.
Ré-encodage multi-générations. Convertir du WAV en MP3, puis en OGG, puis de nouveau en MP3 accumule les pertes de compression et dégrade la qualité à chaque étape. Travaillez à partir du fichier source original quand c'est possible.
Fichiers corrompus ou tronqués. Un fichier partiellement téléchargé ou un enregistrement interrompu peut passer la validation de format, mais échouer en plein milieu de la transcription. Re-téléchargez ou ré-exportez la source.
Pour un aperçu plus détaillé de l'impact des fréquences d'échantillonnage et du nombre de canaux sur la précision au niveau de l'API, consultez l'article explication de la précision de transcription.
Particularités des codecs à connaître
Quelques détails précis qui provoquent des échecs silencieux :
AWS Transcribe exige le codec Opus pour l'OGG. Le service accepte les conteneurs OGG et WebM, mais uniquement avec de l'audio Opus à l'intérieur. Un fichier OGG Vorbis échouera. C'est documenté dans leurs exigences d'entrée.
Google Cloud STT exige une déclaration d'encodage. Contrairement à Deepgram, l'API de Google exige que vous spécifiiez l'encodage audio dans votre requête. Envoyer un MP3 sans déclarer MP3 dans le champ d'encodage échouera. Leur API V2 peut auto-détecter certains formats, mais pas la V1.
Audio multi-canaux (plus de 2 canaux). AWS Transcribe ne prend pas en charge l'audio avec plus de deux canaux. Descript réduit automatiquement les fichiers de 3 canaux ou plus en stéréo à l'importation. Si vous enregistrez en multi-canaux (enregistreur de conférence 4 canaux, micro ambisonique), réduisez en stéréo avant d'envoyer à tout service basé sur une API.
Encodage PCM dans les WAV. La plupart des fichiers WAV utilisent l'encodage PCM et fonctionnent partout. Les fichiers WAV avec des encodages inhabituels (GSM, ADPCM) peuvent échouer sur certains services, même si le conteneur est reconnu. Le ffprobe de FFmpeg peut vous indiquer quel encodage se trouve dans votre fichier WAV.
Pour une vue plus large sur le choix du format, de l'enregistrement à l'archivage, consultez les formats de fichiers de transcription expliqués et WAV vs MP3 pour la transcription.
Conversion vers un format pris en charge
Si vous avez un fichier dans un format non pris en charge ou si vous devez réduire sa taille avant l'envoi, l'outil audio vers texte accepte le fichier directement et gère la conversion en interne. Pour les flux de travail programmatiques, la ligne de commande ci-dessous couvre la plupart des cas :
ffmpeg -i input.anyformat -vn -ar 16000 -ac 1 -ab 64k output.mp3
Cette commande extrait l'audio, règle la fréquence d'échantillonnage à 16 kHz (suffisante pour la parole), convertit en mono et encode à 64 kbps. Cela réduit un WAV d'une heure d'environ 600 Mo à environ 30 Mo, sans perte de précision de transcription.
Si vous voulez garder l'original et juste une copie plus légère pour l'envoi, la même commande fonctionne : -ab 128k offre plus de marge et reste bien en dessous de toutes les limites de service.
Si vous avez simplement besoin d'une transcription propre sans bot de réunion ni éditeur vidéo, ConvertAudioToText accepte tous les formats de ce tableau (sauf AIFF) et traite la plupart des fichiers en moins d'une minute.
Questions fréquentes
Quel est le meilleur format audio pour la précision de transcription ?
Tout format sans perte (WAV, FLAC) ou format compressé de haute qualité (MP3 à 128 kbps ou plus, M4A en qualité standard) donnera la même précision de transcription avec n'importe quel modèle d'IA moderne. L'environnement d'enregistrement et la qualité du microphone comptent bien plus que le format audio. Gardez le WAV ou le FLAC pour l'archivage ; envoyez du MP3 pour des tailles de fichier raisonnables.
Pourquoi l'API OpenAI Whisper rejette-t-elle mon fichier alors que d'autres services l'acceptent ?
L’API Whisper impose une limite de taille de fichier de 25 Mo, bien plus basse que celle des autres services. Un MP3 d’une heure à 128 kbps pèse environ 57 Mo et sera rejeté. La solution consiste à compresser à un débit plus faible (64 kbps suffisent pour de la parole), à découper le fichier en plusieurs morceaux, ou à utiliser un service sans cette limite de 25 Mo.
Puis-je envoyer directement un fichier vidéo, ou dois-je d’abord extraire l’audio ?
Vous pouvez envoyer une vidéo directement à tous les services de ce tableau. Ils extraient automatiquement la piste audio. Le MP4 fonctionne partout ; le MOV et le MKV sont pris en charge de manière inégale par les services au niveau API comme AWS Transcribe. Si vous utilisez une API directement et que votre format vidéo ne figure pas dans la liste des formats pris en charge, extrayez d’abord l’audio avec FFmpeg.
Les enregistrements multi-canaux (son surround) fonctionnent-ils ?
La plupart des outils de transcription réduisent automatiquement le mixage en stéréo ou ne prennent explicitement pas en charge plus de deux canaux. AWS Transcribe documente une limite stricte de deux canaux. Descript réduit le mixage à l’importation. Pour des résultats fiables, convertissez tout enregistrement multi-canaux en mono ou en stéréo avant l’envoi.
Sources
- Formats audio pris en charge par Deepgram : developers.deepgram.com/docs/supported-audio-formats (vérifié en juillet 2026)
- Exigences d'entrée d'Amazon Transcribe : docs.aws.amazon.com/transcribe/latest/dg/how-input.html (vérifié en juillet 2026)
- Documentation de l'API OpenAI Whisper : help.openai.com/en/articles/7031512-audio-api-faq (vérifié en juillet 2026)
- Encodages de Google Cloud Speech-to-Text : docs.cloud.google.com/speech-to-text/docs/encoding (vérifié en juillet 2026)
- Aide à l'importation d'Otter.ai : help.otter.ai (vérifié en juillet 2026)
- Support TurboScribe : turboscribe.ai/support (vérifié en juillet 2026)
- Types de fichiers pris en charge par Descript : help.descript.com (vérifié en juillet 2026)
- Formats de fichiers acceptés par Rev.com : support.rev.com (vérifié en juillet 2026)
- Spécifications de fichiers prises en charge par Trint : info.trint.com/knowledge/supported-file-specifications (vérifié en juillet 2026)
- Guide d'upload Fireflies : guide.fireflies.ai (vérifié en juillet 2026)
- Formats Happy Scribe : happyscribe.com/formats (vérifié en juillet 2026)
- Limites de fichiers AssemblyAI : assemblyai.com/docs/faq (vérifié en juillet 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.