
Transcription en temps réel vs post-réunion : les compromis
Summarize this article with:
La transcription en temps réel diffuse les mots au fur et à mesure que les gens parlent, avec un délai de 300 à 850 ms et une précision légèrement inférieure. La transcription post-réunion (par lot) traite l'enregistrement complet une fois l'appel terminé : meilleure précision, étiquettes de locuteurs plus fiables et coût par minute moindre au niveau de l'API. Pour la plupart des cas d'usage de documentation de réunions, le mode par lot est le choix par défaut. Le streaming ne devient indispensable que pour l'accessibilité, les événements en direct ou les workflows d'assistance aux agents en temps réel.
Si votre seul livrable est un document que vous lisez après l'appel, utilisez la transcription par lot post-réunion. Elle est plus précise, moins coûteuse à exploiter et gère mieux la diarisation des locuteurs. Le streaming en temps réel est le bon choix lorsque quelqu'un doit lire les mots pendant la conversation elle-même.
Cette phrase couvre 80 % des décisions. Le reste de cet article détaille les compromis pour vous permettre de gérer les 20 % restants.
Ce que fait concrètement chaque mode
La transcription en temps réel (streaming) envoie l'audio à un modèle de reconnaissance vocale par petits fragments, généralement de 100 à 250 ms. Le modèle renvoie un texte partiel presque immédiatement, avec un délai global de bout en bout d'environ 300 à 850 ms derrière le locuteur. Les mots apparaissent à l'écran pendant que le locuteur parle.
La transcription post-réunion (par lot) s'exécute une fois l'enregistrement sauvegardé. Vous téléversez un fichier (ou un bot enregistre l'appel), et le modèle traite l'intégralité de l'audio. Un appel de 60 minutes revient généralement en 3 à 10 minutes, bien que de nombreux fournisseurs d'API renvoient les résultats en moins de 2 minutes pour des fichiers de longueur standard.
La différence architecturale compte : les modèles de streaming traitent l'audio sans savoir ce qui vient ensuite. Les modèles par lot lisent le fichier entier et peuvent utiliser le contexte futur pour corriger leurs hypothèses antérieures.
L'écart de précision
L'écart est réel et mesurable. Deepgram a publié les chiffres de WER de son modèle Nova-3 sur un benchmark de 81 heures couvrant neuf domaines : le streaming atteint un WER médian de 6,84 %, tandis que le mode par lot sur le même audio descend à 5,26 %. Soit un avantage d'environ 1,5 point de pourcentage pour le mode par lot, ce qui se traduit par moins de mots erronés par paragraphe.
L'écart se creuse sur des audios plus difficiles :
- Les accents prononcés ou les locuteurs qui se chevauchent font grimper le WER du streaming, car le modèle s'engage sur une hypothèse avant d'avoir entendu le contexte clarifiant.
- Le vocabulaire technique (noms de produits, termes médicaux, jargon juridique) est plus souvent corrigé en mode par lot, où la phrase environnante est visible.
- Whisper Large-v3, l'un des modèles open source les plus précis, a été conçu pour le traitement par lot. Son exécution en pseudo-streaming nécessite des contournements par découpage qui dégradent sensiblement la précision par rapport au traitement du fichier complet.
Pour la conformité au titre II de l'ADA, la pratique du secteur vise une précision des sous-titres supérieure à 99 %. Les systèmes automatisés en temps réel atteignent généralement 95 à 98 % sur un audio propre. Cet écart compte d'un point de vue juridique : les sous-titres en direct intégrés de Zoom affichent environ 80 à 90 % de précision en conditions réelles, bien en dessous du seuil de 99 %. L'échéance d'avril 2026 du titre II de l'ADA (pour les entités publiques de 50 000 personnes ou plus) impose des sous-titres en direct pour les sessions vidéo en direct, mais la question de la précision est distincte de l'obligation légale de les fournir.
Pour en savoir plus sur la façon dont la précision est mesurée et ce que signifient ces chiffres en pratique, l'article comprendre la précision de la transcription détaille les calculs.

L'écart de diarisation
L'étiquetage des locuteurs est plus difficile en mode streaming. Un modèle par lot voit l'enregistrement complet lorsqu'il attribue les identifiants de locuteurs, ce qui lui permet de regrouper les voix globalement. Un modèle de streaming doit deviner qui parle à chaque instant sans savoir qui prendra la parole ensuite.
En pratique, la diarisation par lot de deux locuteurs sur un enregistrement propre atteint environ 95 % de précision ou plus. La diarisation en temps réel sur le même audio chute à 80-90 %, et certains outils « corrigent rétroactivement » les étiquettes précédentes à mesure que du nouvel audio arrive. Cela signifie qu'une étiquette lue il y a 30 secondes peut changer lorsque le modèle obtient plus de contexte. Acceptable pour une transcription finale, déroutant si vous suivez le texte en direct.
L'article sur la diarisation des locuteurs explique pourquoi ce problème est difficile à résoudre sur le plan architectural en mode streaming.
Le curseur de latence
Les outils de streaming permettent d'échanger de la latence contre de la précision. La plupart proposent environ trois modes :
| Mode de latence | Délai typique | Comportement de précision |
|---|---|---|
| Faible (200-400 ms) | Les mots apparaissent presque au fil de la parole | Davantage de corrections successives, précision finale moindre |
| Moyenne (1-2 s) | Léger délai perceptible | Précision proche du mode par lot pour la plupart des locuteurs |
| Élevée (3-5 s) | Rythme lisible, impression de quasi-direct | Approche la précision du mode par lot |
Pour les sous-titres en direct sur écran de présentation, la latence moyenne est le point d'équilibre pratique. Le public lit à peu près au rythme du locuteur, les corrections sont rares et la précision est nettement meilleure qu'en mode basse latence. Pour les participants sourds qui suivent une conversation rapide, la faible latence compte plus que la précision, car manquer un mot est moins perturbant que lire un sous-titre plusieurs secondes après que le moment est passé.
Différences de coûts
Au niveau de l'API, le mode par lot est moins cher. AssemblyAI facture environ 0,15 $/h pour la transcription par lot et environ 0,45 $/h pour le streaming, soit une prime de 3x pour le temps réel. Deepgram affiche Nova-3 au même tarif nominal à la minute pour les deux modes (0,0077 $/min à l'usage), mais le streaming ajoute un coût d'infrastructure : vous maintenez une connexion WebSocket persistante pendant toute la durée de l'appel, ce qui exige plus de capacité serveur que le traitement asynchrone d'un fichier.
Pour les outils destinés aux utilisateurs finaux, la tarification est intégrée dans des paliers d'abonnement, ce qui rend le coût par mode moins visible. Mais l'économie se reflète dans les décisions produit : Otter.ai (qui propose la transcription en direct) facture à partir de 8,33 $/utilisateur/mois (Pro, annuel) pour 1 200 minutes par mois. Fireflies (qui mise sur le post-réunion) démarre à 10 $/siège/mois (Pro, annuel) avec 8 000 minutes de stockage par siège. Les deux offrent des offres gratuites.
Pour une analyse plus détaillée, consultez la comparaison des tarifs de transcription.
Tableau d'aide à la décision
| Scénario | Meilleur mode | Pourquoi |
|---|---|---|
| Notes de réunion post-appel | Par lot | Meilleure précision, diarisation et coût |
| Accessibilité pour un participant sourd | Streaming | Doit se produire pendant la conversation |
| Sous-titres en direct d'un événement public | Streaming | Le public lit en direct ; le titre II de l'ADA peut s'appliquer |
| Transcription de podcast ou d'entretien | Par lot | Le fichier existe déjà ; la précision compte |
| Coaching d'appels commerciaux (invites en temps réel) | Streaming | L'agent a besoin d'indices pendant l'appel |
| « Je veux la transcription dès que je raccroche » | Par lot (traitement rapide) | Une attente de 3 à 5 min convient généralement ; le streaming coûte plus cher sans bénéfice |
| Traduction en direct pour équipe multilingue | Streaming | La chaîne de traduction requiert le streaming en entrée |
| Archive consultable des appels enregistrés | Par lot | Qualité, diarisation et texte indexable |
Quand le temps réel est la seule option
Trois scénarios qui relèvent véritablement du seul streaming :
- Accessibilité pour un participant sourd lors d'une conversation en direct. Le texte doit apparaître pendant la réunion, pas après.
- Sous-titres en direct pour un événement public ou un webinaire. De nombreuses juridictions l'exigent désormais. Les sous-titres automatisés à 95-98 % de précision sont largement utilisés, même s'ils restent en deçà de la norme de 99 %+ pour une conformité stricte à l'ADA ; les événements à forts enjeux combinent donc souvent sous-titres automatisés et prestataire CART humain.
- Assistance ou coaching d'agent en temps réel. Un agent du support ou un commercial reçoit des suggestions, alertes ou signaux de conformité en fonction de ce que dit le client pendant l'appel. Cela ne peut pas attendre la fin de l'appel.
Pour tout le reste, le mode par lot avec traitement rapide est la valeur par défaut.
Quand le mode par lot reste le bon choix malgré la demande
Trois demandes courantes où l'on demande du temps réel alors qu'on veut en réalité du par lot rapide :
« Je veux la transcription prête quand je raccroche. » Le traitement par lot rapide renvoie généralement un appel de 60 minutes en moins de cinq minutes. C'est habituellement suffisant. Streamer le même appel en temps réel coûte plus cher et produit une transcription moins précise.
« Je veux prendre des notes à partir des sous-titres en direct. » Lire des sous-titres tout en écoutant divise votre attention. La plupart des gens trouvent plus efficace de laisser la réunion suivre son cours puis de consulter la transcription par lot ensuite, souvent en s'appuyant sur un résumé par IA pour en extraire les points clés.
« Je veux rechercher dans l'appel pendant qu'il se déroule. » Techniquement possible, mais le cas d'usage réel est presque toujours « rechercher dans l'appel après », ce qui correspond à un travail par lot sur l'enregistrement achevé.
La configuration professionnelle standard
La plupart des workflows de production combinent les deux en séquence :
- Des sous-titres en direct fonctionnent pendant la réunion, pour l'accessibilité ou comme référence en temps réel.
- La transcription par lot s'exécute sur l'enregistrement après la fin de l'appel, produisant le document de référence.
La sortie temps réel est considérée comme éphémère. La sortie par lot est celle qui est stockée, modifiée, liée et utilisée en aval dans les résumés, les actions à mener et les archives. Zoom, Google Meet et Microsoft Teams suivent tous ce schéma : sous-titres en direct pendant l'appel, fichier de transcription post-appel dans l'enregistrement sauvegardé.
Pour la transcription par lot d'appels Zoom enregistrés, de réunions Teams ou de sessions Google Meet, l'outil de transcription de réunions gère le téléversement et renvoie une transcription étiquetée sans nécessiter de bot de réunion.
Si vous avez simplement besoin d'une transcription propre à partir d'un enregistrement, ConvertAudioToText accepte directement le fichier, sans installation de bot ni accès au calendrier.
Questions fréquentes
La transcription en temps réel est-elle moins précise que le mode par lot ?
Oui, avec un écart mesurable. Le modèle Nova-3 de Deepgram affiche un WER de 6,84 % en streaming contre 5,26 % en mode par lot sur le même audio de référence, soit un écart d'environ 1,5 point de pourcentage. Sur des audios plus difficiles (accents, conversations croisées, termes techniques), cet écart se creuse, car les modèles de streaming doivent s'engager sur chaque mot sans voir la phrase qui suit.
Quel délai a la transcription en temps réel ?
La latence de bout en bout de la transcription en streaming se situe généralement entre 300 et 850 ms. La plupart des outils proposent un réglage de latence : plus elle est faible, plus les mots apparaissent vite, mais avec davantage de corrections ; une latence plus élevée (3 à 5 secondes) approche la précision du mode par lot tout en donnant toujours l'impression du direct à vitesse de lecture humaine.
La transcription par lot est-elle moins chère que la transcription en temps réel ?
Généralement oui, au niveau de l'API. AssemblyAI facture environ 3 fois plus cher le streaming que le mode par lot. Certains fournisseurs comme Deepgram affichent le même tarif nominal à la minute pour les deux modes, mais le streaming ajoute un coût d'infrastructure via des connexions WebSocket persistantes que le mode par lot évite grâce à un simple téléversement de fichier. Si vous n'avez pas besoin du texte pendant la conversation, le mode par lot est le choix le plus économique.
Zoom, Meet et Teams utilisent-ils la transcription en temps réel ou par lot ?
Les deux. Les sous-titres en direct pendant l'appel relèvent du streaming en temps réel. La transcription post-appel enregistrée avec votre enregistrement est traitée par lot après la fin de la réunion. Cette version post-appel est généralement plus précise et inclut de meilleures étiquettes de locuteurs. La plupart des plateformes de réunion considèrent la sortie par lot comme le document de référence.
Quand la transcription en temps réel est-elle légalement exigée ?
Le titre II de l'ADA (dans sa version actualisée) exige des sous-titres en direct pour les sessions vidéo en direct organisées par les entités publiques concernées, avec une échéance de conformité au 24 avril 2026 pour les entités desservant 50 000 personnes ou plus. De nombreuses juridictions ont des exigences similaires pour les événements publics et la diffusion. Les sous-titres automatisés en direct atteignent généralement 95 à 98 % de précision ; la conformité stricte à l'ADA vise 99 % ou plus, ce qui nécessite souvent un prestataire CART humain pour les événements à forts enjeux.
Sources
- Deepgram, "Introducing Nova-3": https://deepgram.com/learn/introducing-nova-3-speech-to-text-api
- Deepgram Pricing: https://deepgram.com/pricing
- AssemblyAI, "Real-Time vs Batch Transcription": https://www.assemblyai.com/blog/real-time-vs-batch-transcription
- AssemblyAI Pricing: https://www.assemblyai.com/pricing
- Otter.ai Pricing: https://otter.ai/pricing
- Fireflies Pricing: https://fireflies.ai/pricing
- Interprefy, "Closed Captions Accuracy: Zoom vs Teams": https://www.interprefy.com/resources/blog/closed-captions-accuracy-zoom-teams
- BoxCast, "ADA Title II Captioning Requirements April 2026": https://www.boxcast.com/blog/how-to-comply-with-ada-title-ii-captioning-requirements-by-april-2026
- AssemblyAI, "The 300ms Rule: Why Latency Makes or Breaks Voice AI": https://www.assemblyai.com/blog/low-latency-voice-ai
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.