Comment convertir un FLV en texte : transcrire les archives de l'ère Flash (2026)
transcriptionvidéoflv

Comment convertir un FLV en texte : transcrire les archives de l'ère Flash (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

Les fichiers FLV de l'ère Flash (2003-2020) gardent une vraie valeur : archives de webinaires, vidéos de formation, captations de flux RTMP. Le plugin Flash a disparu, mais le FLV en tant que conteneur reste parfaitement lisible par ffmpeg, VLC et les outils de transcription modernes. C'est le codec audio qui compte plus que le conteneur : MP3 et AAC dans un FLV se transcrivent proprement, tandis que les codecs vocaux Nellymoser et Speex des anciens enregistrements webcam demandent une étape de conversion supplémentaire. Si votre outil refuse le FLV, une commande ffmpeg d'une seule ligne suffit à le remuxer en MP4 sans toucher à la qualité audio.

Pour obtenir une transcription d'un fichier FLV, téléversez-le directement dans un outil qui accepte ce format, ou extrayez d'abord l'audio avec ffmpeg si votre outil l'exige. L'ère Flash est révolue, mais les fichiers traversent très bien n'importe quelle chaîne de traitement moderne.

Ce qu'est le FLV et pourquoi les archives comptent encore

Le FLV (Flash Video) était le format vidéo web d'environ 2003 à 2020. Il propulsait YouTube avant le passage au HTML5, tous les premiers streams Twitch, la plupart des plateformes de webinaires avant leur migration vers le MP4, ainsi que la majorité des systèmes de formation en entreprise fonctionnant sous Adobe Flash.

Adobe a mis fin au support de Flash Player fin 2020. Les navigateurs l'ont retiré. Le web est passé à autre chose.

Les archives, non. D'importantes collections FLV dorment encore sur les stockages d'entreprise, issues de :

  • Webinaires d'avant 2014 sur WebEx, GoToMeeting et Microsoft LiveMeeting
  • Enregistrements de flux RTMP de Twitch et Periscope avant leur changement de format
  • Bibliothèques de cours construites avec Adobe Captivate et Articulate
  • Référentiels de formation interne jamais migrés vers le MP4
  • Enregistrements de serveurs de diffusion comme Adobe Media Server et Wowza

Si vous avez hérité de l'une de ces archives, le chemin vers la transcription est simple dès lors que vous connaissez la réalité des codecs.

Ce que contient réellement votre fichier FLV

Le conteneur, c'est la partie facile. C'est le codec à l'intérieur qui détermine votre méthode de travail.

Le FLV transporte la vidéo dans l'un de trois formats :

  • Sorenson Spark (basé sur H.263) : le codec Flash Video d'origine, courant avant 2005
  • VP6 : devenu le codec privilégié avec Flash Player 8 en septembre 2005
  • H.264 : ajouté dans Flash Player 9 Update 3 (décembre 2007) et utilisé jusqu'à la fin de Flash

Pour la transcription, le codec vidéo n'a aucune importance. Ce qui compte, c'est la piste audio :

  • MP3 dans un FLV : le format audio le plus répandu dans les archives FLV, se transcrit exactement comme un fichier MP3 autonome
  • AAC dans un FLV : utilisé dans les versions ultérieures de Flash Player, se transcrit proprement aux débits standards
  • Nellymoser Asao : un codec vocal propriétaire à faible bande passante intégré à Flash pour la capture micro, utilisé dans les enregistrements webcam et la VoIP primitive ; se transcrit correctement mais se dégrade aux débits plus bas
  • Speex : un codec vocal open source ajouté dans Flash Player 10 pour le streaming, optimisé pour la voix mais à faible bande passante

Lancez ffprobe yourfile.flv pour identifier précisément le codec audio de votre fichier avant de choisir une méthode.

Pas à pas : convertir un FLV en texte

Étape 1 : vérifier que le fichier se lit

Ouvrez-le dans VLC. VLC lit toutes les variantes de codecs FLV : vidéo Sorenson Spark, VP6, H.264, et tous les codecs audio y compris Nellymoser et Speex. Si VLC le lit avec le son, vous avez un fichier exploitable.

Si VLC refuse avec une erreur de lecture (et non un avis DRM), le fichier peut contenir des métadonnées tronquées provenant d'une captation RTMP interrompue en plein flux. Passez à l'étape 2 avant de transcrire.

Étape 2 : réparer les métadonnées si nécessaire

Les enregistrements de flux RTMP ont souvent des métadonnées de durée manquantes ou incorrectes. La solution tient en une seule passe ffmpeg qui copie tous les flux sans réencoder :

ffmpeg -i broken.flv -c copy -fflags +genpts fixed.flv

Cette commande reconstruit les horodatages du conteneur sans toucher aux données audio ou vidéo elles-mêmes. Appliquez-la à tout FLV signalant « impossible de déterminer la durée » ou incapable de naviguer correctement.

Étape 3 : téléverser ou extraire l'audio

Si votre outil accepte directement le FLV, téléversez tel quel. CATT accepte les fichiers FLV aux côtés des MP4, MOV, MKV et autres formats via l'outil vidéo-vers-texte.

Si votre outil exige un autre format, extrayez la piste audio. Quand l'audio est déjà en MP3 ou AAC, la copie de flux est plus rapide et sans perte :

ffmpeg -i video.flv -vn -c:a copy audio.mp3

Quand l'audio est en Nellymoser ou Speex, transcodez en MP3 :

ffmpeg -i video.flv -vn -c:a libmp3lame -b:a 192k audio.mp3

Si vous avez besoin d'une sortie MP4 complète (pour un outil qui l'exige), et que le FLV utilise la vidéo H.264, vous pouvez copier les deux pistes sans réencodage :

ffmpeg -i video.flv -c copy output.mp4

Si le FLV utilise la vidéo Sorenson Spark ou VP6, il faut un réencodage complet, plus lent :

ffmpeg -i video.flv -c:v libx264 -c:a aac output.mp4

Interface de téléversement de l'outil vidéo-vers-texte de CATT prenant en charge les anciens formats vidéo dont le FLV
Interface de téléversement de l'outil vidéo-vers-texte de CATT prenant en charge les anciens formats vidéo dont le FLV

Étape 4 : définir la langue

Indiquez la langue manuellement. Les contenus FLV anciens ont parfois un audio dégradé qui perturbe la détection automatique de la langue. Pour les contenus non anglais, définissez la langue avant le traitement plutôt que de corriger après coup.

Étape 5 : lancer la transcription

Un FLV de 60 minutes demande 3 à 6 minutes de traitement sur la plupart des services. L'extraction audio est quasi instantanée ; la transcription est la phase la plus longue.

Étape 6 : relire le résultat

L'audio des FLV anciens présente des caractéristiques qui affectent la précision :

  • Audio à faible débit (32 à 96 kbps était typique du streaming)
  • Micros de webcam et audio des participants par ligne téléphonique
  • Artefacts de coupures réseau dans les captations RTMP

Comptez 80 à 92 % de précision sur les anciens contenus de webinaires à audio mixte, et 90 à 95 % sur des FLV enregistrés en conditions professionnelles avec un micro dédié pour l'animateur.

Quand remuxer en MP4 aide vraiment (et quand ça n'aide pas)

La question revient constamment pour les archives FLV : convertir d'abord en MP4, ou transcrire directement ?

Le remux n'améliore pas la précision de la transcription. Le modèle vocal traite le codec audio, et l'enveloppe du conteneur est jetée avant le traitement. Une piste Nellymoser dans un FLV produit exactement le même résultat qu'une piste Nellymoser dans un MP4.

Le remux aide bel et bien dans deux situations concrètes :

  1. Votre outil de transcription refuse carrément le FLV. Beaucoup d'outils grand public n'acceptent que MP4, MOV, MP3 et WAV. Si c'est le cas du vôtre, un remux en copie de flux prend quelques secondes et ne coûte aucune qualité.
  2. Vous voulez vérifier que le fichier se lit avant de l'envoyer. Le MP4 se lit plus universellement dans les lecteurs multimédias et les fenêtres d'aperçu des navigateurs si vous devez confirmer le contenu avant le téléversement.

Pour un lot de plusieurs centaines de fichiers, sautez entièrement l'étape de remux et travaillez sur les originaux. Pour en savoir plus sur les méthodes propres à chaque format, consultez le guide de conversion vidéo en texte et l'article complémentaire sur les archives WMV, un autre format aux soucis d'héritage similaires.

Scénarios FLV courants

Archives de webinaires anciens

Les plateformes de 2004 à 2014 (WebEx, GoToMeeting, MS LiveMeeting, ON24) enregistraient en FLV. La qualité audio varie fortement selon la source :

  • Micro de l'animateur : généralement propre, se transcrit à 90 à 95 %
  • Audio téléphonique des participants (PSTN) : qualité téléphone 8 kHz, se transcrit à 75 à 85 %
  • Mixte animateur + participants : fait la moyenne des deux

Pour les grandes archives de webinaires, vérifiez si la plateforme a enregistré des pistes audio séparées pour l'animateur et les participants. Si c'est le cas, extrayez-les séparément, transcrivez chacune, puis fusionnez les résultats.

Captations Twitch et de streaming

Twitch utilisait RTMP avant de passer à HLS vers 2017. Les archives de streams de cette période sont en FLV. La précision varie selon la configuration audio du streameur.

Les contenus de streaming mélangent souvent musique de fond, son du jeu et effets sonores dans la piste de parole. Les modèles d'IA peuvent halluciner du texte pendant les passages musicaux. Recadrez le fichier sur les segments uniquement parlés avant le téléversement si la précision compte.

Bibliothèques de cours éducatifs

Adobe Captivate, Articulate Storyline et autres outils auteurs exportaient des modules en FLV de 2005 à 2015. La narration en voix off de ces cours est généralement enregistrée en studio avec un micro dédié. La précision atteint généralement 95 % ou plus.

Enregistrements de serveurs RTMP

Adobe Media Server (anciennement Flash Media Server), Wowza et Red5 enregistraient les flux RTMP en FLV par défaut. Ces captations présentent parfois :

  • Des métadonnées de durée manquantes ou incorrectes (à réparer avec -fflags +genpts comme montré ci-dessus)
  • De la dérive audio sur les enregistrements de plus d'une heure
  • Des images perdues ou des trous audio causés par des interruptions réseau

Réparez les métadonnées avant de transcrire. La dérive audio se corrige plus difficilement en post-traitement et affecte surtout l'alignement des horodatages plutôt que la précision de la transcription.

Archives marketing et d'entreprise

Les vidéothèques marketing d'avant 2015 existent souvent à la fois en version FLV originale et en MP4 réencodé. Si vous avez les deux, transcrivez à partir du FLV original. Le réencodage MP4 a subi une étape de compression avec perte que l'original n'a pas connue.

Points de vigilance

Enregistrements tronqués. Les captations RTMP s'interrompent parfois en pleine phrase quand le flux a lâché ou que le serveur s'est arrêté. Lisez le fichier jusqu'au bout avant de partir du principe que vous avez le contenu complet. Une transcription qui se coupe brutalement en plein milieu d'une idée est un symptôme, pas une erreur de transcription.

Double piste audio. Certains FLV de webinaires enregistrent l'animateur et les participants sur des pistes audio séparées. La plupart des outils de transcription ne traitent que la première piste. Vérifiez avec ffprobe -show_streams si votre fichier contient plus d'un flux audio, et extrayez celui dont vous avez besoin.

Points de repère intégrés et données de chat. Certains fichiers FLV issus de systèmes de webinaire intègrent le chat textuel sous forme de points de repère (cue points) dans les métadonnées. Ce n'est pas de l'audio ; ce sont des métadonnées du conteneur. La plupart des outils de transcription les ignorent. Si un outil signale des erreurs d'analyse, supprimez d'abord les métadonnées non audio :

ffmpeg -i in.flv -c copy -map 0:v -map 0:a clean.flv

Qualité Nellymoser et Speex. Ce sont tous deux des codecs vocaux opérant à bas débit. Ils se transcrivent, mais la précision chute par rapport à du MP3 ou de l'AAC à qualité de contenu équivalente. Si vous avez de l'audio Nellymoser ou Speex et que la précision est critique, transcodez d'abord en MP3 192k. Le réencodage introduit une certaine perte de génération, mais le résultat est généralement plus reconnaissable pour un modèle vocal que le flux Nellymoser brut à 5,5 kHz.

Conseils pratiques pour traiter des archives FLV par lots

Réparez d'abord tous les fichiers. Lancez une réparation des métadonnées par lot sur toute l'archive avant de transcrire quoi que ce soit :

for f in *.flv; do ffmpeg -i "$f" -c copy -fflags +genpts "fixed_$f"; done

Cela reconstruit les métadonnées du conteneur sans toucher à l'audio. Tout fichier aux métadonnées tronquées ou incorrectes devient bien formé avant d'entrer dans votre chaîne de transcription.

Progressez par ordre chronologique. Les fichiers d'une même époque et d'une même plateforme suivent des schémas de qualité audio semblables. Calibrez vos attentes sur un fichier représentatif, puis appliquez les mêmes réglages au reste.

Utilisez l'accès API pour les gros volumes. Téléverser 500 heures de fichiers d'archives un par un n'est pas envisageable. Les offres Developer et Business de CATT incluent un accès API avec webhooks, ce qui rend le traitement par lot scriptable. Consultez les coûts cachés des services de transcription avant de choisir une offre pour du travail en volume.

Évitez le prétraitement audio. L'audio des vieux FLV est déjà fortement compressé. Ajouter de la réduction de bruit, de l'égalisation ou de la normalisation par-dessus une source déjà compressée détériore souvent la précision de l'IA au lieu de l'améliorer. Téléversez l'audio source et laissez le modèle gérer.

Vérifiez l'absence de DRM avant de commencer. Les contenus FLV commerciaux de services disparus de l'ère Flash étaient parfois protégés par DRM. VLC refusera avec une erreur « contenu protégé ». Les contenus enregistrés par les utilisateurs (webinaires, formations, streams) n'ont presque jamais de DRM. Si vous tombez sur du DRM, il n'existe aucun chemin pratique vers la transcription.

Le format FLV face aux formats modernes

FormatÉpoqueCodec audio typiqueDébit courantPrécision de transcription
FLV (MP3)2003-2014MP332-128 kbps88-95 %
FLV (AAC)2009-2020AAC64-192 kbps92-97 %
FLV (Nellymoser)2003-2011Nellymoser5-64 kbps80-90 %
FLV (Speex)2008-2016Speex8-45 kbps82-92 %
MP42008 à aujourd'huiAAC96-256 kbps94-98 %
WebM2013 à aujourd'huiOpus64-192 kbps94-98 %

Un FLV contenant de la vidéo H.264 et de l'audio AAC se transcrit pratiquement à l'identique d'un MP4 doté des mêmes codecs. Le conteneur externe est écarté par la chaîne de transcription. C'est l'audio intérieur qui compte.

Si vous cherchez simplement une transcription propre d'un fichier et souhaitez éviter les étapes ffmpeg, ConvertAudioToText accepte directement le FLV : téléversez, sélectionnez la langue, et le service s'occupe de l'extraction automatiquement.

Questions fréquentes

Peut-on transcrire des fichiers FLV en 2026 alors que Flash est mort ?

Oui. Le plugin Flash des navigateurs a disparu, mais le format FLV reste pleinement pris en charge par ffmpeg, VLC et de nombreux services de transcription. Le conteneur se lit sans problème ; ce qui compte, c'est le codec audio qu'il contient. Un MP3 ou un AAC dans un FLV se transcrit exactement comme n'importe quel fichier MP3 ou AAC autonome.

Faut-il convertir un FLV en MP4 avant de transcrire ?

Uniquement si votre outil de transcription refuse carrément le FLV. Pour la qualité audio, la conversion n'apporte rien : c'est le codec audio contenu dans le conteneur que traite réellement le modèle vocal, donc remuxer le conteneur ne change rien à la précision. L'extraction audio seule avec ffmpeg est plus rapide qu'un remux complet, et les deux approches aboutissent à la même transcription.

Quand faut-il vraiment réencoder un FLV avant la transcription ?

L'audio doit être réencodé lorsque le FLV contient du Nellymoser ou du Speex, car ces codecs peuvent sonner dégradés à bas débit et certains outils les refusent. Lancez d'abord ffprobe sur le fichier pour vérifier. Si la piste audio est déjà en MP3 ou AAC, vous pouvez l'extraire avec une copie de flux (-c:a copy) et vous passer totalement du réencodage, ce qui préserve la qualité d'origine.

Que faire si mon fichier FLV est protégé par des DRM ?

Essayez d'abord de le lire dans VLC. S'il refuse avec une erreur de contenu protégé, le fichier est verrouillé par DRM. Les fichiers FLV enregistrés par des utilisateurs (webinaires, vidéos de formation, captations de flux) ont rarement de DRM. Les contenus FLV commerciaux issus de services disparus de l'ère Flash en ont parfois, et les supprimer est rarement pratique ou légal dix ans après l'arrêt du service d'origine.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles