
Comment convertir un AVI en texte : transcrire d'anciennes vidéos
Summarize this article with:
Réponse rapide
Téléversez votre fichier AVI directement dans un outil de transcription. La plupart des outils modernes gèrent l'AVI sans aucune préconversion. Le réencodage n'est nécessaire que dans trois cas : votre outil rejette le fichier avec une erreur de codec, l'audio est en MP3 VBR (un problème d'entrelacement connu des fichiers de l'époque DivX), ou le fichier dépasse 2 Go et date d'avant l'extension OpenDML.

Ce qu'est réellement l'AVI (et pourquoi cela compte encore)
AVI signifie Audio Video Interleave. Microsoft l'a introduit en novembre 1992 dans le cadre de Video for Windows. Ce format a dominé de la fin des années 1990 au milieu des années 2000, avant d'être supplanté par le MP4 lorsque H.264 est devenu le codec standard.
L'AVI est un conteneur, pas un codec. Cette distinction est la chose la plus importante à comprendre lorsqu'on cherche à résoudre des problèmes de transcription. L'enveloppe AVI peut contenir presque toutes les combinaisons de codecs audio et vidéo imaginables, et c'est le codec audio qu'elle abrite qui détermine si la transcription fonctionne sans accroc ou nécessite une solution de contournement.
Les fichiers AVI récents sont rares aujourd'hui, mais ceux archivés sont courants. Vous possédez probablement des fichiers AVI provenant de l'une de ces sources :
- Vieux caméscopes de 1995 à 2010 (mini-DV, Hi8, caméscope DVD)
- Systèmes de vidéosurveillance et caméras de sécurité, notamment les enregistreurs DVR antérieurs à 2015
- Captures de bandes VHS ou DV réalisées au début des années 2000
- Enregistrements TV issus de cartes d'acquisition PCI (ATI All-in-Wonder, Hauppauge WinTV)
- Anciennes bibliothèques de formation en entreprise issues d'archives CD-ROM
Le problème du codec à l'intérieur du conteneur
Exécutez ffprobe yourfile.avi et examinez la ligne du flux audio avant de téléverser quoi que ce soit. Ce que vous y trouverez détermine si un téléversement direct fonctionne ou si vous devez prétraiter le fichier.
| Codec audio | Époque et source typiques | Remarques sur la transcription |
|---|---|---|
| PCM (non compressé) | AVI de caméscope DVD, premières cartes d'acquisition | Voie la plus simple. Fichiers volumineux (un AVI DV d'une heure pèse environ 13 Go), mais l'audio s'extrait sans aucune perte de qualité. |
| MP3 CBR | Fichiers AVI de l'époque DivX, 2002-2008 | Généralement correct. Le MP3 CBR à 128-192 kbit/s est bien pris en charge par tous les moteurs de reconnaissance vocale. |
| MP3 VBR | Fichiers AVI de l'époque DivX et premiers Xvid | Codec problématique. Le MP3 VBR dans un AVI enfreint la spécification d'origine : le conteneur AVI stocke des décalages en octets dans son index, et les tailles de trames variables font dériver l'audio hors synchro lors de l'extraction. Beaucoup d'outils produisent silencieusement un audio corrompu ou sautent des segments. Préconvertissez en CBR. |
| AC3 | Systèmes DVR de vidéosurveillance, rips de DVD | Pris en charge, bien que certains outils nécessitent d'abord un passage par un codec. L'AC3 de vidéosurveillance est généralement mono à 64-128 kbit/s. La voix reste intelligible, mais le bruit ambiant est important. |
| WMA | Fichiers enregistrés sous Windows, exports Windows Movie Maker | Rare en AVI mais présent. Convertissez avec ffmpeg si votre outil le refuse. |
Le codec vidéo (DivX 3, XviD, MPEG-4 ASP, Microsoft RLE) n'est presque jamais en cause, car les outils de transcription écartent immédiatement la piste vidéo. Si un outil signale une erreur de codec, le flux audio est la cause la plus probable.
Quand réencoder d'abord (et quand ne pas le faire)
Vous n'avez pas besoin de réencoder lorsque : l'audio est en PCM, AC3 ou MP3 CBR ; le fichier se lit avec le son dans VLC ; le fichier fait moins de 4 Go.
Vous devriez d'abord extraire l'audio lorsque :
- Le fichier est volumineux et vous souhaitez un téléversement plus rapide. Un AVI DV de 2 heures à 13 Go/heure devient un MP3 de 30 à 100 Mo après extraction de l'audio. C'est une différence considérable en temps de téléversement.
ffprobeindique un audio MP3 VBR. Extrayez et réencodez en CBR pour éviter toute dérive de synchronisation.- Votre outil renvoie une erreur « format non pris en charge » ou « aucun audio détecté ».
Extrayez l'audio avec une seule commande ffmpeg :
ffmpeg -i in.avi -vn -c:a libmp3lame -b:a 192k out.mp3
L'option -vn supprime le flux vidéo. La sortie est un MP3 CBR à 192 kbit/s. La plupart des moteurs de transcription l'acceptent sans broncher.
Pour une sortie optimisée pour la transcription, passez directement au WAV mono 16 kHz (le format d'entrée que chaque moteur de reconnaissance vocale gère nativement) :
ffmpeg -i in.avi -vn -acodec pcm_s16le -ac 1 -ar 16000 out.wav
La limite des 2 Go et OpenDML
La spécification AVI d'origine limite la taille des fichiers à 2 Go, car le champ de taille de bloc RIFF est un entier 32 bits. Si vous possédez un ancien fichier de caméscope DVD ou un enregistrement de carte d'acquisition datant d'avant 2000, les fichiers peuvent s'interrompre en plein enregistrement à la barre des 2 Go.
OpenDML (aussi appelé AVI 2.0) résout ce problème en chaînant plusieurs sections RIFF de 2 Go. Les fichiers produits après 1997 environ avec VirtualDub ou un logiciel compatible utilisent OpenDML et peuvent atteindre une taille arbitrairement grande. Les fichiers issus de matériel grand public plus ancien peuvent être tronqués silencieusement.
Si votre AVI s'interrompt de manière inattendue alors que l'enregistrement source était plus long, cherchez un fichier compagnon (conventions de nommage file.avi, file.000, file.001 propres à certains caméscopes), ou vérifiez si l'enregistrement a été scindé par la barrière des 2 Go.
Pas à pas : téléverser un AVI pour la transcription
Étape 1 : vérifier que le fichier se lit avec le son
Ouvrez le fichier dans VLC. Si le son se joue, la piste est intacte. Si la vidéo se lit mais que le son est muet, exécutez ffprobe in.avi et vérifiez si un flux audio est listé. Si aucun flux audio n'apparaît, le fichier n'a pas d'audio à transcrire.
Les anciens AVI présentent parfois une dérive de synchro audio/vidéo dans VLC. Il s'agit d'un problème d'index de lecture, pas d'un problème audio. La transcription lit la piste audio brute et n'est pas affectée.
Étape 2 : vérifier la présence d'un audio MP3 VBR
ffprobe in.avi affichera une ligne du type Audio: mp3, 44100 Hz, stereo, .... Si le flux indique « mp3 » et que le fichier date de 2002 à 2008, il y a de fortes chances qu'il utilise un encodage VBR. En cas de doute, préconvertissez en MP3 CBR avant le téléversement, comme montré ci-dessus.
Étape 3 : téléverser directement ou passer par l'extraction audio
Glissez le fichier dans un outil de vidéo-vers-texte. La plupart des outils modernes acceptent nativement l'AVI. Si vous avez extrait l'audio en MP3 ou WAV, téléversez plutôt ce fichier.
Étape 4 : définir la langue manuellement
La détection automatique fonctionne bien sur un audio moderne et propre, mais peut achopper sur des enregistrements AVI dégradés avec sifflement de bande, bruit de fond ou micro de mauvaise qualité. Si vous connaissez la langue, sélectionnez-la explicitement. Cela compte particulièrement pour les contenus d'archives non anglophones.
Étape 5 : relire en gardant à l'esprit les particularités de l'audio ancien
Un AVI de 60 minutes demande environ 4 à 8 minutes pour être transcrit. Les anciens enregistrements ont des plafonds de précision prévisibles :
- Narration enregistrée en studio dans un AVI : 95-98 %
- Audio de caméscope mini-DV (micro correct, faible bruit) : 90-95 %
- Audio de caméscope amateur (écho de pièce, micro médiocre) : 80-90 %
- Audio issu de VHS (sifflement de bande, bande passante de 7-10 kHz) : 75-88 %
- Audio de vidéosurveillance (micro bon marché, compression AC3, bruit ambiant) : 70-85 %
Consacrez votre temps de relecture aux noms propres, aux termes techniques propres à l'époque et à tout segment où le sifflement de bande culmine. Le modèle insère parfois des mots fantômes là où le bruit domine.
Scénarios AVI et résultats à attendre
Captures de caméscopes mini-DV et Hi8
Des caméscopes comme le Canon GL2 enregistraient sur bande mini-DV et transféraient vers l'ordinateur via FireWire (IEEE 1394) sous forme de fichiers DV-AVI bruts. Le DV-AVI contient de l'audio PCM à 48 kHz, 16 bits. C'est un audio de haute qualité. La vidéo est compressée en DV, mais l'extraction audio pour la transcription est sans perte et rapide.
Les micros montés sur caméscope de cette époque captaient le bruit de manipulation et la réverbération de la pièce, mais offraient une clarté vocale correcte à distance de conversation. Les entretiens familiaux transcrits depuis un AVI mini-DV se situent généralement entre 88 et 94 % de précision. Pour ce cas d'usage, consultez comment transcrire un enregistrement d'entretien pour des conseils de relecture.
Contenus téléchargés ou rippés de l'époque DivX
D'environ 2001 à 2007, l'AVI était le format dominant pour la vidéo partagée en ligne et pour les rips de DVD. Ces fichiers utilisaient DivX ou XviD pour la vidéo et le MP3 (souvent VBR) pour l'audio. L'audio est généralement assez propre pour être transcrit avec une précision de 90-95 %. Le principal risque est la dérive de synchro du MP3 VBR, abordée ci-dessus.
Codes FOURCC courants à cette époque : DIVX, XVID, DX50, MP43. Si ffprobe affiche l'un d'eux comme codec vidéo et que l'audio est en mp3, partez du principe que c'est du VBR et préconvertissez.
Enregistrements de vidéosurveillance et de DVR
Les DVR de sécurité d'avant 2012 environ produisent souvent des AVI avec un audio AC3 à faible débit (64-128 kbit/s, mono). Les micros de ces systèmes étaient bon marché et positionnés pour la couverture, pas pour la clarté vocale. Comptez au mieux sur une précision de 70-85 %, et traitez la transcription comme un relevé approximatif, pas comme un document faisant autorité.
Certains systèmes de vidéosurveillance écrivent un index AVI valide avec un en-tête de flux audio, mais le remplissent de silence. VLC lit la vidéo et affiche une piste audio sans erreur. L'extraction ffmpeg produit un MP3 silencieux. Si vous tombez sur ce cas, aucune donnée audio n'est récupérable ; le système n'enregistrait que la vidéo.
Formations en entreprise issues de CD-ROM
Les contenus pédagogiques et de formation en entreprise de 2000 à 2010 étaient fréquemment livrés sous forme de fichiers AVI sur CD-ROM. Ils étaient produits avec une narration en studio, des micros à condensateur et du montage. Même compressé dans un ancien AVI encodé en MPEG-4 ASP ou Indeo, l'audio est généralement propre. Comptez sur une précision de 94-98 % pour une narration professionnelle. C'est le scénario AVI où la transcription apporte le plus de valeur avec le moins d'effort de nettoyage.
Pièges spécifiques au format
Pistes audio doubles
Les caméscopes mini-DV enregistraient parfois deux canaux sous forme de deux pistes mono distinctes plutôt qu'une véritable stéréo. L'outil de transcription peut choisir la mauvaise. Si la transcription semble incomplète ou si la balance des canaux semble décalée, extrayez et inspectez chaque piste :
ffmpeg -i in.avi -map 0:a:0 -c:a copy track0.mp3
ffmpeg -i in.avi -map 0:a:1 -c:a copy track1.mp3
Téléversez celle dont l'audio est le plus propre.
Flux endommagés ou fragmentés
Les anciens fichiers AVI écrits partiellement (coupure de courant, perte de bande, plantage logiciel) ont parfois un index cassé. Le fichier se lit dans VLC (qui tolère les index défectueux), mais d'autres outils échouent. Reconstruisez le conteneur :
ffmpeg -i broken.avi -err_detect ignore_err -c copy fixed.avi
Cela réécrit l'index sans rien réencoder. Le taux de réussite est élevé pour les corruptions mineures.
Le problème du flux audio silencieux
Si votre outil renvoie « aucun audio détecté » alors que VLC joue bien le son, forcez explicitement le mappage audio :
ffmpeg -i in.avi -map 0:a -c:a libmp3lame -b:a 192k probe.mp3
Si la sortie est silencieuse, le flux n'est qu'un espace réservé constitué d'un simple en-tête, sans données. S'il contient de l'audio, l'outil échouait simplement à localiser le flux et vous pouvez téléverser probe.mp3 directement.
Remarque sur la qualité audio face au choix du codec
Le plafond de qualité audio pour la transcription est fixé au moment de l'enregistrement, pas pendant la compression. Un AVI à l'audio PCM enregistré sur le micro intégré d'un caméscope dans une pièce bruyante ne sera pas aussi bien transcrit qu'un AVI à l'audio MP3 128 kbit/s d'une narration en studio, même si le PCM est techniquement « sans perte ».
Pour les formats audio pris en charge et les compromis de qualité, le choix du codec importe moins que le rapport signal/bruit, la qualité du micro et la clarté du locuteur. Un AVI issu de VHS est limité à une bande passante d'environ 7-10 kHz par le support d'enregistrement d'origine. Aucun post-traitement ne récupère le détail vocal qui n'a jamais été capturé.
Si vous possédez des enregistrements d'archive dignes d'être conservés et que la qualité audio est médiocre, un léger filtre passe-haut coupant sous 80 Hz réduit le grondement de la ventilation et des machines sans nuire à la parole. Restez prudent avec la réduction de bruit : le sifflement de bande est un bruit large bande que les modèles de parole gèrent étonnamment bien, mais un débruitage agressif emporte le détail vocal avec le bruit.
Pour approfondir WAV contre MP3 pour la qualité de transcription, la différence pratique entre formats extraits est plus faible que ce que la plupart des gens imaginent lorsque l'audio source est déjà dégradé.
Si vous avez juste besoin d'une transcription propre d'un fichier AVI sans configuration compliquée, ConvertAudioToText accepte l'AVI directement avec une offre gratuite pour les clips courts. Les archives plus importantes nécessitent un plan payant.
Questions fréquentes
Peut-on transcrire avec précision d'anciens fichiers AVI ?
Oui, mais la précision dépend de la qualité de l'enregistrement d'origine, pas du conteneur. Une narration enregistrée en studio dans un AVI est transcrite avec une précision de 95-98 %. L'audio de vieux caméscopes dans des pièces bruyantes se situe entre 80 et 90 %. L'audio issu de VHS avec sifflement de bande se trouve en bas de cette fourchette. Le conteneur AVI lui-même ne dégrade pas la précision.
Vaut-il la peine de convertir un AVI en MP4 avant la transcription ?
Généralement non. C'est l'audio contenu dans le conteneur qui est transcrit, et le remballage en MP4 ne modifie pas l'audio. L'exception concerne les cas où votre outil de transcription refuse carrément l'AVI (souvent à cause d'un audio MP3 VBR ou d'un code FOURCC non reconnu). Dans ce cas, extraire l'audio directement avec ffmpeg est plus rapide qu'une conversion complète du conteneur.
Que faire si l'outil de transcription affiche « codec non pris en charge » ?
Le codec vidéo (DivX, XviD, Microsoft RLE) est rarement le problème, car la plupart des outils écartent de toute façon la piste vidéo. Le coupable est généralement un codec audio non standard ou un audio MP3 VBR. Exécutez : ffmpeg -i in.avi -vn -c:a libmp3lame -b:a 192k out.mp3 pour extraire l'audio vers un MP3 CBR propre, puis téléversez ce fichier.
Mon AVI se lit parfaitement dans VLC mais n'a pas d'audio dans le résultat de transcription. Pourquoi ?
Certains systèmes de vidéosurveillance et anciens outils d'encodage écrivent un en-tête de flux audio dans l'index AVI mais le remplissent de silence ou sans données. Le décodeur audio de VLC synthétise parfois un flux factice plutôt que de signaler une erreur. Vérifiez la présence réelle de données audio avec : ffmpeg -i in.avi -map 0:a -c:a libmp3lame -b:a 192k probe.mp3. Si probe.mp3 est silencieux, il n'y a pas d'audio à transcrire.
Sources
- Audio Video Interleave - Wikipédia
- Format de fichier AVI (Audio Video Interleaved) - Bibliothèque du Congrès
- Format de fichier AVI avec extensions OpenDML - Bibliothèque du Congrès
- Référence du fichier AVI RIFF - Microsoft Learn
- MP3 VBR dans AVI : audio à débit variable (VBR) détecté - Forum VideoHelp
- Minutage AVI et synchro audio - Blog VirtualDub
- Le problème des 2 et 4 gigaoctets avec les fichiers AVI - AVI-IO
- Le champ de mines des formats de fichiers CCTV - Kinesense
- Exigences audio de Whisper - SayToWords
- Comment réparer des fichiers vidéo corrompus avec FFmpeg - Stellar
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.