
Comment convertir un MP4 en texte (téléversement direct, sans extraction nécessaire)
Summarize this article with:
La réponse rapide
Vous n'avez pas besoin d'extraire l'audio de votre MP4 avant de le transcrire. Téléversez le fichier directement dans n'importe quel outil de transcription sérieux et le serveur extrait automatiquement l'audio grâce à ffmpeg. Les seules choses à vérifier au préalable : le fichier possède-t-il réellement une piste audio et, s'il en a plusieurs, laquelle voulez-vous ?

Ce que contient réellement un MP4
MP4 est un conteneur, pas un codec. La vidéo que vous avez enregistrée la semaine dernière est probablement en H.264 ou HEVC (H.265) pour l'image, et en AAC pour l'audio. Le conteneur se contente de les regrouper avec des métadonnées de minutage, des pistes de sous-titres et des marqueurs de chapitres.
Cette distinction importe pour la transcription car le modèle de reconnaissance vocale ne voit que le flux audio, jamais la vidéo. L'outil démultiplexe le conteneur, en extrait l'audio, le rééchantillonne en mono 16 kHz (le format attendu par les modèles de type Whisper) et lance l'inférence. Rien de tout cela ne dépend du codec vidéo présent dans le fichier.
Ce qui compte, en revanche :
- AAC (le plus courant) : s'extrait proprement dans tous les outils de transcription.
- AC-3 / Dolby : présent dans les MP4 issus de ripages de diffusions TV ou de Blu-ray. Certains outils le gèrent ; d'autres imposent un transcodage en AAC au préalable.
- Opus dans un MP4 : moins courant, de plus en plus utilisé par les enregistrements capturés depuis le web. Bien pris en charge par les outils modernes, il fait parfois trébucher les anciennes chaînes de traitement.
Le codec vidéo (H.264 ou H.265) n'a aucune incidence sur la précision de la transcription.
Le problème des pistes audio multiples
C'est la défaillance silencieuse la plus courante de la transcription MP4. Un fichier MP4 peut tout à fait contenir plusieurs flux audio dans un même conteneur, et la plupart des outils de transcription se rabattent par défaut sur le flux d'index 0 sans vous le dire.
Les situations où cela se produit :
- Contenus doublés : le MP4 d'un film ou d'un documentaire peut comporter des commentaires en anglais sur la piste 0 et la langue d'origine sur la piste 1, ou l'inverse, selon la manière dont il a été assemblé.
- Enregistrements d'écran OBS : OBS en mode Sortie avancée peut enregistrer l'audio du jeu sur la piste 1 et un microphone sur la piste 2, les deux intégrés dans le même MP4. Transcrire un tel fichier avec les réglages par défaut vous donne une piste mixte unique, pas forcément celle qui contient la parole.
- Exports de conférences multilingues : certaines plateformes de webinaire intègrent une piste d'interprète en piste 2. La détection automatique sur un fichier qui débute en anglais mais contient du français en piste 2 donnera un résultat chaotique.
- Enregistrements avec commentaires : des configurations de podcast qui enregistrent un mixage brut plus une piste isolée par intervenant dans des pistes intégrées distinctes.
Pour savoir à quoi vous avez affaire avant de téléverser, exécutez ffprobe en local :
ffprobe -i video.mp4 -show_streams -select_streams a -v quiet
Cela liste chaque flux audio avec son codec, sa balise de langue et sa disposition de canaux. Si vous voyez deux flux ou plus, décidez lequel vous voulez, puis soit indiquez-le au moment du téléversement (si l'outil prend en charge la sélection de piste), soit extrayez d'abord uniquement ce flux :
ffmpeg -i video.mp4 -map 0:a:1 -c copy track2.m4a
(Remplacez 0:a:1 par l'index du flux souhaité, les index commençant à zéro.)
Enregistrements d'écran et prises de vue caméra : deux profils de qualité différents
Les deux produisent des fichiers MP4, mais ils se comportent de façon très différente en transcription.
Prises de vue caméra (téléphone, appareil hybride, camescope) : l'audio est capté par un microphone physique dans un espace physique. La qualité se dégrade avec la distance. Une interview tournée à 30 cm du micro du téléphone se transcrit avec une précision de 96 à 98 %. Une table ronde filmée à 10 mètres avec le micro d'ambiance chute à 85-90 %, parfois moins en cas d'écho marqué ou de bruit de ventilation.
Enregistrements d'écran (OBS, Loom, ScreenFlow, Camtasia, Barre de jeu Windows, Capture d'écran macOS) : la source audio est généralement un micro USB ou casque posé à quelques centimètres de la bouche de l'intervenant. C'est quasiment idéal pour la transcription. Le rapport signal/bruit est élevé, pas de réverbération de salle, un débit constant (généralement 128 à 320 kbps en AAC). Le défi n'est pas la qualité audio, mais le vocabulaire. Les enregistrements d'écran tendent à contenir de la syntaxe en ligne de commande, des noms de bibliothèques, des messages d'erreur, des raccourcis clavier et des noms de produits que les modèles de reconnaissance vocale ont rarement vus. Attendez-vous à des erreurs occasionnelles sur les termes techniques, même lorsque la précision sur les mots du quotidien dépasse 97 %.
Une différence structurelle : les enregistrements d'écran donnent souvent une piste mono ou stéréo unique, sans variation sur toute la durée du fichier. Les prises de vue caméra changent parfois de qualité en cours de fichier (l'intervenant s'éloigne du micro, pic de bruit de foule). Pour le cas caméra, un montage propre avant le téléversement vaut mieux qu'un post-traitement plus long sur la transcription.
Tailles de fichiers et quoi faire quand votre MP4 est trop volumineux
| Source | Résolution / Fréquence d'images | Taille approximative par minute |
|---|---|---|
| iPhone 16 (HEVC H.265) | 4K 30 i/s | ~350 Mo/min |
| iPhone 16 (HEVC H.265) | 1080p 30 i/s | ~60 Mo/min |
| Enregistrement cloud Zoom | 1080p (H.264, AAC 128 kbps) | ~70-120 Mo/min |
| Enregistrement d'écran OBS | 1080p 60 i/s (H.264) | ~150-400 Mo/min (selon le débit) |
| Téléphone Android (H.264) | 1080p 30 i/s | ~100-200 Mo/min |
| Webinaire exporté (compressé) | 720p H.264 | ~20-50 Mo/min |
La plupart des outils de transcription acceptent des fichiers jusqu'à 500 Mo à 2 Go. Une réunion Zoom d'une heure (~4,2 à 7,2 Go) peut dépasser ce seuil.
Vos options, par ordre d'effort :
-
Téléversez vers un outil qui accepte les fichiers volumineux via URL. Si votre MP4 est accessible par une URL (vidéo YouTube, lien de partage Loom, lien d'enregistrement cloud Zoom), évitez entièrement le téléchargement. L'outil vidéo-en-texte de ConvertAudioToText accepte les URL directes précisément pour cette raison.
-
Extrayez uniquement l'audio avant le téléversement. Un MP4 1080p d'une heure peut peser 4 Go ; l'audio AAC qui en est extrait fait environ 55 à 70 Mo. Aucune qualité n'est perdue pour la transcription, puisque vous écartez le signal vidéo, pas l'audio. La commande ffmpeg réalise une copie sans perte du flux audio :
ffmpeg -i recording.mp4 -vn -c:a copy audio.m4a -
Coupez à une rupture naturelle. Si vous avez besoin d'horodatages au niveau du mot couvrant tout l'enregistrement, découper puis recoudre manuellement les horodatages est fastidieux. L'extraction est plus simple.
Le piège HEVC
Les appareils Apple enregistrent en HEVC (H.265) par défaut depuis 2017. Les conteneurs HEVC gardent l'extension .mp4, donc le nom du fichier ne vous apprend rien. La plupart des outils de transcription actuels gèrent très bien le HEVC parce qu'ils font transiter le conteneur par ffmpeg, dont le support du HEVC est robuste. Mais quelques outils anciens ou téléverseurs fonctionnant dans le navigateur essaient de lire la vidéo côté client avant l'envoi, et les navigateurs datés ne savent pas décoder le H.265. Si vous obtenez une erreur « format non pris en charge » sur un fichier pourtant bel et bien en MP4, le codec vidéo est le suspect le plus probable.
Solution : extrayez d'abord l'audio (commande ci-dessus), ce qui produit un fichier AAC pur que n'importe quel outil accepte. Ou réencodez la vidéo en H.264 :
ffmpeg -i hevc_video.mp4 -c:v libx264 -c:a copy h264_video.mp4
C'est plus lent et le fichier résultant est plus volumineux ; préférez l'extraction audio seule si vous n'avez besoin que de la transcription.
D'où viennent ces fichiers (et à quoi faire attention)
Enregistrements cloud Zoom
Zoom encode ses enregistrements cloud en vidéo H.264 avec de l'audio AAC à environ 64-128 kbps en mono. L'audio est à bande limitée et compressé pour minimiser le stockage, ce qui signifie que les fréquences situées hors de la plage de la parole sont retirées. C'est en réalité favorable à la transcription : les hautes fréquences génératrices de bruit disparaissent et le modèle reçoit un signal vocal propre. Sur des réunions Zoom comptant un ou deux intervenants, la précision atteint typiquement 95 à 97 % sur de l'anglais clair, et baisse face à un accent marqué ou un débit rapide.
Pour un flux de travail propre à Zoom sans télécharger d'abord le MP4, le guide pour transcrire des réunions Zoom détaille l'accès au niveau de la plateforme.
Vidéos iPhone et Android
Les iPhone enregistrent dans des conteneurs MOV (H.264 ou HEVC, audio AAC) et peuvent partager en MP4 avec le même contenu à l'intérieur. Les appareils Android enregistrent directement en MP4. Dans les deux cas, le téléversement et la transcription se font sans intervention. La réserve sur la taille de fichier est bien réelle : un clip iPhone 4K 30 i/s de 10 minutes pèse environ 3,5 Go. Extrayez l'audio avant de téléverser.
Enregistrements d'écran depuis OBS
Les utilisateurs d'OBS en mode Sortie avancée ont parfois 6 pistes audio intégrées dans un seul MP4. La piste 1 est en général le mixage complet ; les pistes suivantes sont des pistes isolées par source. Si votre transcription arrive dans une langue inattendue, ou si elle transcrit l'audio du jeu au lieu de votre voix off, vous êtes sur la mauvaise piste. Servez-vous de ffprobe pour voir ce que contient le fichier, puis extrayez la piste voulue.
Pour remettre des sous-titres sur les images enregistrées après la transcription, l'outil générateur de sous-titres produit des fichiers SRT et VTT que vous pouvez réimporter dans OBS ou dans n'importe quel éditeur vidéo.
Téléchargements YouTube
Si vous avez récupéré une vidéo YouTube avec yt-dlp ou un outil similaire, le MP4 obtenu embarque l'audio à la qualité servie par YouTube, généralement 128 kbps AAC en standard et 256 kbps pour les contenus éligibles à Premium. Les deux suffisent pour la transcription. L'outil générateur de transcriptions YouTube saute entièrement l'étape de téléchargement en lisant directement l'URL.
Enregistrements de conférences et d'événements
Les exports de conférences multicaméra puisent souvent leur audio dans la sonorisation de la salle, pas dans un micro cravate porté par l'intervenant. Comptez 85 à 92 % de précision si la salle est vaste ou bruyante à cause du public. Si le fichier provient d'un prestataire qui a mixé des retours micro séparés avant l'export, la précision est meilleure. Contrôlez l'audio dans VLC ou n'importe quel lecteur avant le téléversement : si le son vous paraît sourd à l'oreille, le modèle peinera aussi.
Ce qui se passe côté serveur
Vous téléversez le MP4. Le moteur de transcription exécute ensuite quelque chose d'équivalent à :
- Inspecter le conteneur et identifier tous les flux audio.
- Extraire le flux 0 (ou le flux spécifié par l'utilisateur) vers un fichier audio temporaire. Il s'agit d'une copie sans perte :
ffmpeg -i input.mp4 -map 0:a:0 -vn -c:a copy temp.m4a. - Rééchantillonner en PCM mono 16 kHz, le format attendu par les modèles de type Whisper et Deepgram.
- Découper en fenêtres de 30 secondes avec chevauchements de 5 secondes pour la précision aux frontières.
- Exécuter l'inférence et recoudre les horodatages au niveau du mot.
- Appliquer la restauration de ponctuation, la diarisation des locuteurs (si activée) et le post-traitement.
- Supprimer le fichier temporaire.
L'étape qui consomme le plus de temps sur un gros fichier est l'étape 3 (le rééchantillonnage), surtout pour les fichiers 4K HEVC dont la lecture du conteneur est lente. Un fichier audio déjà extrait saute intégralement les étapes 1 et 2.
Si le MP4 contient une piste vidéo à fréquence d'images variable (courant dans les enregistrements d'écran produits par certaines applications), les horodatages audio restent exacts après extraction, car vous ne réencodez rien : -c:a copy préserve le minutage exact issu des horodatages du flux audio, indépendamment de la piste vidéo.
Comment téléverser : la version courte
- Ouvrez l'outil de transcription et glissez-déposez votre MP4, ou collez une URL si le fichier est hébergé.
- Vérifiez : si le fichier comporte plusieurs pistes audio et que vous ne savez pas laquelle contient la parole, extrayez d'abord la bonne avec ffprobe et ffmpeg.
- Sélectionnez manuellement la langue parlée. La détection automatique fonctionne, mais la sélection manuelle apporte 2 à 5 points de précision sur les contenus accentués ou multilingues.
- Lancez. Un enregistrement Zoom 1080p de 30 minutes revient généralement en 3 à 6 minutes.
- Relisez pour vérifier les noms propres, les termes techniques et les passages où les intervenants se sont chevauchés.
- Exportez en TXT, DOCX, SRT ou VTT selon que vous avez besoin du contenu pour lecture, édition ou sous-titrage.
Si vous voulez simplement une transcription sans créer de compte, ConvertAudioToText transcrit les 10 premières minutes d'un MP4 sans compte, et un compte gratuit ajoute 10 minutes de transcription offertes une seule fois à l'inscription, sans carte bancaire.
Questions fréquentes
Faut-il extraire l'audio d'un MP4 avant de le transcrire ?
Non. Téléversez le MP4 directement. Les services de transcription extraient l'audio côté serveur à l'aide de ffmpeg ou d'une bibliothèque équivalente. L'extraction manuelle n'est utile que si votre fichier dépasse la limite de taille du service ; dans ce cas, extraire l'audio réduit le fichier à une fraction de sa taille d'origine sans aucune perte de qualité.
Ma transcription MP4 est sortie dans la mauvaise langue. Que s'est-il passé ?
Deux causes probables. D'abord, la détection automatique a échoué sur un fichier avec une intro courte ou accentuée : définissez la langue manuellement. Ensuite, plus fréquente qu'on ne le croit, votre MP4 contient plusieurs flux audio et l'outil a transcrit le flux 0, qui est dans une autre langue que celle souhaitée. Exécutez ffprobe -i video.mp4 -show_streams -select_streams a pour lister tous les flux audio et leurs balises de langue, puis extrayez le bon.
Pourquoi ne puis-je pas téléverser ma vidéo 4K d'iPhone ? Le message indique que le fichier est trop volumineux.
L'iPhone enregistre en 4K 30 i/s à environ 350 Mo par minute en HEVC. Un clip de 10 minutes pèse environ 3,5 Go, ce qui dépasse la plupart des limites de téléversement. Exécutez ffmpeg -i input.mp4 -vn -c:a copy audio.m4a pour extraire uniquement l'audio, qui fera environ 10 à 15 Mo pour les mêmes 10 minutes. Téléversez plutôt le fichier audio.
La vidéo HEVC (H.265) contenue dans un MP4 affecte-t-elle la qualité de transcription ?
Non. Le codec vidéo est abandonné lors de l'extraction audio. HEVC ou H.264 ne change rien à la précision de la transcription. Le seul souci pratique est que certains téléverseurs basés sur le navigateur tentent de décoder la vidéo côté client avant l'envoi, et les navigateurs anciens ne savent pas décoder le H.265. Si vous rencontrez une erreur « format non pris en charge », extrayez d'abord l'audio ou réencodez la vidéo en H.264.
Mon enregistrement OBS comporte des pistes audio distinctes pour le jeu et le micro. L'outil transcrira-t-il les deux ?
La plupart des outils ne transcrivent que le flux 0, qui correspond dans une configuration OBS multipiste typique à l'audio mixte complet. Si vous voulez uniquement la piste micro (généralement le flux 1 dans la configuration par défaut d'OBS), extrayez-la avant le téléversement : ffmpeg -i recording.mp4 -map 0:a:1 -c copy mic.m4a. Transcrire la piste micro seule améliore la précision de la
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.