Transcrire de l'audio avec une connexion lente : les vrais calculs de bande passante (2026)
transcriptionconnectivitéflux de travail

Transcrire de l'audio avec une connexion lente : les vrais calculs de bande passante (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202610 min read

Summarize this article with:

TL;DR

Une connexion lente bloque l'envoi, pas la transcription. Un fichier WAV de 60 minutes (~635 Mo) compressé en MP3 mono 64 kbps tombe à environ 29 Mo, réduisant le temps d'envoi de plus de 40 minutes à moins de 3 minutes sur une connexion à 2 Mbps. Quand il n'existe aucune connexion utilisable du tout, les outils Whisper locaux comme Buzz ou whisper.cpp fonctionnent entièrement sur votre machine sans internet. Les outils cloud, dont ConvertAudioToText, ont d'abord besoin de votre fichier sur leurs serveurs ; les tactiques ci-dessous existent donc pour l'y envoyer rapidement, ou pour contourner ce besoin.

Si vous avez une connexion utilisable mais lente, compressez votre audio en MP3 mono 64 kbps avant l'envoi. Un fichier de 60 minutes passe d'environ 635 Mo à environ 29 Mo, réduisant le temps d'envoi de 40 minutes à moins de 3 minutes sur une ligne à 2 Mbps. Si vous n'avez aucune connexion du tout, un outil de transcription cloud ne peut pas vous aider : utilisez plutôt Whisper en local.

Une connexion internet lente est un problème d'envoi, pas un problème de transcription. Une fois que le fichier atteint le serveur, la transcription elle-même prend les mêmes quelques minutes quel que soit votre emplacement. Tout ce qui suit porte sur l'envoi rapide du fichier, ou sur le contournement de ce besoin.

Le calcul de bande passante

Voici la réalité des tailles de fichiers selon les formats courants :

Durée audioWAV 44,1k stéréoMP3 128k monoMP3 64k mono
30 minutes~318 Mo~29 Mo~14 Mo
60 minutes~635 Mo~58 Mo~29 Mo
120 minutes~1,27 Go~115 Mo~58 Mo

À 2 Mbps en envoi, 635 Mo prennent environ 43 minutes. Le même enregistrement de 60 minutes en 64 kbps mono prend environ 2 minutes. Le moteur de transcription produit un résultat pratiquement identique sur l'un ou l'autre fichier, car il rééchantillonne de toute façon en 16 kHz mono avant traitement.

Le taux de compression du WAV vers le 64 kbps mono est d'environ 22:1. Ce n'est pas une erreur d'arrondi. Le WAV encode du PCM non compressé (44,1k stéréo 16 bits = 1 411 kbps). Un MP3 mono 64 kbps est 22 fois plus petit et reste parfaitement adapté à la transcription de parole.

Compressez avant d'envoyer

La chose la plus efficace à faire sur une connexion lente est de convertir votre audio avant de toucher au bouton d'envoi.

La commande ffmpeg :

ffmpeg -i input.wav -ac 1 -ar 16000 -b:a 64k output.mp3

Ce que fait chaque option : -ac 1 force le mono, -ar 16000 rééchantillonne en 16 kHz (le même taux qu'utilisent les moteurs de transcription), et -b:a 64k définit le débit binaire. Le fichier obtenu ne perd rien d'important pour la reconnaissance vocale.

Pour les utilisateurs Mac sans ffmpeg, QuickTime Player exporte l'audio seul via Fichier → Exporter sous → Audio uniquement, produisant un M4A compressé. Pour les utilisateurs Windows sans ffmpeg, Audacity exporte en MP3 en quelques clics via Fichier → Exporter.

Si votre source est une vidéo, extrayez d'abord l'audio. Un fichier vidéo de 60 minutes peut peser de 1 à 4 Go. Le réduire à l'audio seul avant l'envoi rapporte plus que n'importe quel ajustement de débit binaire. Avec ffmpeg :

ffmpeg -i input.mp4 -vn -ac 1 -ar 16000 -b:a 64k output.mp3

L'option -vn supprime entièrement le flux vidéo.

Pour mieux comprendre comment les différents formats d'encodage influencent les performances de la transcription cloud, consultez notre article précision de la transcription expliquée.

Outil d'envoi audio sur ConvertAudioToText, prêt à accepter un MP3 compressé
Outil d'envoi audio sur ConvertAudioToText, prêt à accepter un MP3 compressé

Profitez-en pour couper les silences

Un enregistrement de 60 minutes contient souvent 3 à 5 minutes de silence mort : la discussion précédant l'interview alors que l'enregistrement devait déjà avoir commencé, la pause pendant que quelqu'un cherche ses notes, la conclusion. L'effet « Truncate Silence » d'Audacity supprime automatiquement les pauses au-delà d'un seuil configurable. Cela réduit la taille du fichier de 5 à 8 % et diminue légèrement le temps de traitement.

C'est un gain mineur comparé à la compression de format, mais cela ne coûte rien et vaut la peine pour les fichiers de plus de 30 minutes.

Passez par le stockage cloud pour éviter totalement votre envoi

Si le fichier audio est déjà dans un stockage cloud, vous n'aurez peut-être pas besoin d'envoyer quoi que ce soit. Lorsqu'un service de transcription accepte une URL pointant vers un lien Google Drive, un partage Dropbox ou une URL présignée S3, le serveur récupère le fichier directement à des vitesses gigabit. La connexion à 2 Mbps de votre ordinateur portable n'y touche jamais.

Le flux de travail :

  1. Synchronisez le fichier audio vers Google Drive ou Dropbox depuis un appareil bénéficiant d'un meilleur internet (ou lors d'une session précédente à la maison).
  2. Copiez le lien de partage.
  3. Collez le lien dans le champ URL de l'outil de transcription au lieu d'envoyer un fichier.

C'est particulièrement utile dans les cafés où votre machine dispose de 1 Mbps alors que le centre de données de Google récupère à 1 Gbps. La transcription apparaît dans le même délai qu'une tâche normale.

Si vous souhaitez comparer plus largement les approches cloud et locales, transcription locale vs cloud détaille les compromis.

Quand l'envoi échoue sans cesse en plein fichier

Les envois interrompus sont le symptôme le plus frustrant des connexions lentes ou instables. Quelques solutions pratiques avant d'abandonner :

Passez au câble si possible. Même un Ethernet à 5 Mbps est plus stable qu'un Wi-Fi congestionné à 20 Mbps. C'est la perte de paquets sur le Wi-Fi, et non la vitesse brute, qui tue généralement les envois.

Rapprochez-vous du routeur. Les bandes 5 GHz perdent rapidement le signal à travers les murs. Si vous êtes à plus d'une pièce de distance, le 2,4 GHz est plus lent mais plus constant.

Coupez le trafic en arrière-plan. Un client de synchronisation cloud actif en arrière-plan peut consommer 80 à 90 % de la bande passante d'envoi disponible. Mettez en pause Dropbox, Google Drive ou iCloud avant de lancer l'envoi.

Recommencez après un échec. La plupart des services de transcription ne reprennent pas à partir d'un octet précis. Un envoi échoué doit redémarrer de zéro, c'est pourquoi il importe d'obtenir un fichier assez petit pour partir en une seule session.

Partagez la connexion mobile quand le Wi-Fi est franchement mauvais

Quand le Wi-Fi local est trop congestionné ou bridé pour être utile, le partage de connexion mobile le bat souvent.

Une connexion LTE typique aux États-Unis ou en Europe de l'Ouest offre 10 à 30 Mbps en envoi. La 5G sur les bandes Sub-6 GHz affiche en moyenne 15 à 50 Mbps. Les deux sont généralement plus rapides que le Wi-Fi d'hôtel ou de lieu de conférence aux heures de pointe.

Surveillez les données. Un MP3 compressé de 60 minutes à 29 Mo représente une quantité négligeable de données mobiles. Le WAV non compressé à 635 Mo, non. Compressez d'abord, puis activez le partage, et les calculs restent confortablement dans la plupart des forfaits.

Les opérateurs peuvent brider les vitesses après 5 à 15 Go d'utilisation du partage de connexion par cycle de facturation, selon le forfait. Si vous approchez de ce plafond, compressez vers le plus petit fichier exploitable avant de commencer.

Pour les flux de travail impliquant régulièrement des enregistrements terrain loin de connexions fiables, transcription en voyage propose des schémas pratiques pour découpler l'étape d'enregistrement de l'étape d'envoi.

Le plan B hors ligne : Whisper en local

Il existe une catégorie de situations où aucune compression ne sert : l'absence totale de connexion. Une zone blanche, un avion sans Wi-Fi, un endroit isolé entre deux antennes relais. Les outils de transcription cloud nécessitent un accès réseau pour recevoir votre fichier. Ils ne peuvent rien ici.

Whisper en local fonctionne entièrement sur votre machine, sans envoi ni internet. Deux options pratiques :

Buzz est une application de bureau gratuite et open source pour Windows, macOS et Linux. Elle enveloppe les modèles Whisper d'OpenAI dans une interface simple en quelques clics. Importez un fichier audio ou vidéo, choisissez un modèle, obtenez une transcription. Pas de Python, pas de terminal requis sur macOS avec l'installateur packagé.

whisper.cpp est un portage en C++ qui fonctionne sur CPU sans aucun GPU NVIDIA. Il est plus rapide que l'implémentation Python originale sur Apple Silicon (utilise Metal) et utilisable sur tout ordinateur portable moderne avec le modèle tiny ou base. Le modèle small se situe dans le point idéal pour la plupart des prises de parole : meilleure précision que base, toujours rapide sur CPU.

Mon avis : pour le cas vraiment hors ligne, Whisper en local est la seule vraie réponse. Il faut environ 5 minutes pour configurer Buzz la première fois et peut-être 10 à 15 minutes pour transcrire une heure d'audio sur le CPU d'un ordinateur portable milieu de gamme avec le modèle small. C'est plus lent qu'un outil cloud, mais cela fonctionne partout.

ConvertAudioToText gère bien le parcours par envoi et prend en charge la saisie par URL pour le flux de travail via stockage cloud décrit ci-dessus. Si vous avez ne serait-ce qu'une connexion marginale et un fichier compressé, c'est généralement plus rapide que d'exécuter Whisper en local. Si vous n'avez réellement aucune connexion, seul Whisper en local fonctionnera.

Pour une comparaison directe de ce que les approches locale et cloud gèrent chacune bien, voir transcription locale vs cloud.

Découpez les longs fichiers quand rien d'autre ne fonctionne

Quand les envois échouent systématiquement même à des tailles compressées, découpez l'audio en morceaux plus petits. Un enregistrement de 120 minutes divisé en segments de 15 minutes donne huit fichiers d'environ 7 Mo chacun en 64 kbps mono. Chaque segment s'envoie en moins d'une minute sur une connexion à 2 Mbps.

Si un segment échoue, relancez uniquement ce segment. Une fois les huit terminés, concaténez les transcriptions dans l'ordre. Les découpes audio aux points de silence se font proprement et les jointures sont invisibles dans la transcription finale.

FAQ

La compression audio en MP3 64 kbps nuit-elle à la précision de la transcription ?

Non, pas de manière significative. Les moteurs de transcription cloud rééchantillonnent l'audio en 16 kHz mono en interne avant traitement, donc ils écartent de toute façon la fidélité supplémentaire du WAV. La différence de précision entre un MP3 mono 64 kbps bien encodé et un WAV sans perte est négligeable sur une parole claire.

Puis-je transcrire de l'audio sans aucune connexion internet ?

Oui, mais uniquement avec un outil local. Les applications de bureau basées sur Whisper comme Buzz et whisper.cpp fonctionnent entièrement sur votre machine sans aucun envoi. Les services cloud ne peuvent rien faire quand vous êtes réellement hors ligne. Si le fichier audio est court, le modèle tiny ou base de Whisper sur un CPU moderne termine le travail en quelques minutes.

Quelle est la façon la plus rapide d'envoyer un gros fichier audio sur un Wi-Fi lent ?

D'abord, compressez en MP3 mono 64 kbps avec ffmpeg ou Audacity, ce qui peut réduire la taille du fichier d'un facteur 20 ou plus par rapport au WAV. Si le fichier est déjà synchronisé sur un stockage cloud (Google Drive, Dropbox), utilisez un envoi par URL plutôt qu'un envoi de fichier. Le serveur de transcription télécharge directement depuis le fournisseur cloud à grande vitesse, contournant entièrement votre lente connexion locale.

Le partage de connexion mobile est-il plus rapide que le Wi-Fi d'hôtel ou de café pour les envois ?

Souvent, oui. Une connexion LTE typique offre 10 à 30 Mbps en envoi. La 5G sur les bandes Sub-6 GHz affiche en moyenne 15 à 50 Mbps. Les deux battent généralement le Wi-Fi d'hôtel congestionné. L'arbitrage concerne les données : un envoi WAV de 60 minutes à 635 Mo peut consommer une part importante d'un forfait mobile mensuel, c'est pourquoi compresser d'abord compte même sur mobile.

Sources

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles