
Modèles de transcription open source vs propriétaires en 2026
Summarize this article with:
En dessous d'environ 10 000 minutes par mois, une API propriétaire (Deepgram, AssemblyAI) bat généralement Whisper auto-hébergé sur le coût total une fois le GPU et le temps d'ingénierie comptés; au-delà de ce volume, la donne bascule vite. Le propriétaire gagne aussi sur la latence de streaming et la diarisation intégrée; l'open source l'emporte sur la confidentialité, le contrôle et le coût marginal nul. Beaucoup d'équipes de production utilisent les deux: une API pour le temps réel, Whisper auto-hébergé pour le traitement par lots.
Les vrais compromis
Si vous transcrivez moins de 10 000 minutes par mois, une API propriétaire bat presque toujours le self-hosting de Whisper sur le coût total. Les poids du modèle open source sont gratuits, mais le calcul GPU ne l'est pas, et le temps d'ingénierie pour le faire tourner en production ne l'est rarement non plus. Au-delà de ce volume, la donne s'inverse vite, et le cas du self-hosting devient réellement convaincant.
La question de 2026 n'est pas idéologique. Les deux écosystèmes sont matures. La réponse utile se joue sur quatre dimensions : le coût à votre volume réel, la précision sur votre audio réel, votre tolérance à la latence, et la complexité opérationnelle que votre équipe peut absorber. Ce post aborde chacune d'elles honnêtement.
Ce que chaque camp inclut réellement
Le côté open source
La pile de reconnaissance vocale open source comporte trois couches principales à connaître :
- OpenAI Whisper et ses versions successives jusqu'à Large-v3. Les poids du modèle sont sous licence MIT. Vous les exécutez sur votre propre infrastructure, ne payez que le calcul, et gardez l'audio sur vos serveurs.
- Des implémentations plus rapides comme faster-whisper (backend CTranslate2), whisper.cpp (portage C++), et MLX Whisper (Apple Silicon). Elles exécutent les mêmes poids Whisper avec un débit 4 à 6 fois supérieur et environ la moitié de la VRAM. La quantification INT8 de faster-whisper réduit encore l'utilisation de VRAM de 40 % avec une perte de précision négligeable.
- Des modèles open source adjacents : les familles Parakeet et Canary de NVIDIA NeMo, Distil-Whisper de Hugging Face (un dérivé Whisper plus rapide et plus léger), et SenseVoice pour les tâches multilingues. L'écosystème autour de Whisper est désormais une plateforme, pas juste un modèle.
Pour un regard plus approfondi sur le fonctionnement réel de l'architecture Whisper, voir Whisper Large-v3 expliqué.
Le côté propriétaire
Les API propriétaires vendent la même capacité, sans le travail de déploiement :
- Deepgram Nova-3 : actuellement parmi les plus rapides pour le traitement par lots et en streaming, facturé environ 0,0043 $ par minute pour l'audio pré-enregistré (paiement à l'usage) et 0,0048 $ par minute pour le streaming. Les tarifs annuels du plan de croissance réduisent encore les deux. Voir Explication de Deepgram Nova-3 pour une analyse détaillée.
- API Whisper d'OpenAI : hébergement de Large-v3 à 0,006 $ par minute. Intégration plus simple que toute solution auto-hébergée, avec la file d'attente plus lente et les frais généraux de planification qu'implique un hébergement géré.
- AssemblyAI Universal-2 : 0,15 $ de l'heure (0,0025 $/min) pour la transcription de base, avec des options payantes pour la diarisation (+0,02 $/h), la détection d'entités et la synthèse, facturées séparément. À noter qu'à compter du 1er juillet 2026, les tarifs régionaux ont augmenté de 10 % ; utiliser
"model_region": "global"dans les requêtes API permet d'éviter cette hausse. - AWS Transcribe : 0,024 $ par minute au niveau standard (0 à 250 000 minutes/mois), avec une baisse sur quatre paliers de volume jusqu'à 0,0078 $/min au-delà de 5 millions de minutes. Les options médicales et d'analyse d'appels coûtent plus cher.
- Google Cloud STT v2 (modèle Chirp) : 0,016 $ par minute en standard, avec un traitement par lots ou dynamique à 0,003 $ par minute pour les charges non sensibles au temps. Google facture par tranches de 15 secondes arrondies au supérieur, ce qui compte pour les clips courts.

Précision : chiffres de référence contre réalité de production
La chose la plus trompeuse dans ce domaine, c'est un simple tableau de WER sans contexte. Chaque grand système est compétitif sur les benchmarks académiques. En conditions réelles, l'écart de performance se creuse nettement.
Whisper Large-v3 atteint un taux d'erreur de mots (WER) de 2,7 % sur LibriSpeech test-clean, un jeu de données de parole lue et contrôlée. Sur des enregistrements réels et mixtes, le même modèle affiche en moyenne environ 7 à 8 % de WER, et grimpe à 17 % ou plus sur de l'audio téléphonique de mauvaise qualité. Deepgram Nova-3, dans les benchmarks de production internes de Deepgram (2 703 fichiers couvrant neuf domaines), montre un WER médian de 5,26 % en traitement par lots et de 6,84 % en streaming, même si ces chiffres publiés par le fournisseur reposent sur des jeux de données soigneusement sélectionnés.
Le contexte change la donne :
- Audio bruité ou téléphonique : Deepgram Nova-3 a ici un avantage constant. Les modèles propriétaires, entraînés massivement sur des données de centres d'appels, gèrent mieux l'audio téléphonique que Whisper, optimisé sur un corpus multilingue plus large.
- Langues peu dotées et accents variés : Whisper Large-v3, entraîné sur 680 000 heures d'audio multilingue, gère mieux les accents inhabituels et l'alternance codique que la plupart des API propriétaires. Pour comprendre pourquoi cet écart persiste, voir pourquoi l'IA peine avec les langues peu dotées.
- Audio de longue durée : Whisper a tendance à halluciner pendant les longs silences. Les API propriétaires gèrent le découpage et la détection de silence au niveau de l'infrastructure, donc ce n'est en pratique pas votre problème.
- Diarisation des locuteurs : Tous les systèmes gèrent cela de manière imparfaite. Deepgram et AssemblyAI investissent spécifiquement dans la couche de diarisation au-dessus de leurs modèles de base. Auto-héberger Whisper implique d'intégrer Pyannote ou NeMo séparément. Voir la diarisation des locuteurs expliquée pour comprendre son fonctionnement.
Mon avis : si votre audio est de qualité réunion ou podcast, clair et dans une langue courante, la différence de précision entre les options sérieuses est assez faible pour que le coût et la complexité opérationnelle guident votre décision. Si votre audio est de qualité téléphonique, accentué ou multilingue, testez tous les candidats sur un échantillon réel avant de vous engager.
Coût : Le point de bascule se situe autour de 10 000 minutes par mois
Le tableau le plus important de cet article. Coûts propriétaires vs auto-hébergés à trois volumes, sur la base du tarif pré-enregistré Deepgram Nova-3 (~0,0043 $/min) et d'un coût d'auto-hébergement réaliste sur RunPod (A100 à partir de ~1,29 $/h) :
| Volume mensuel | Deepgram Nova-3 | faster-whisper auto-hébergé |
|---|---|---|
| 1 000 minutes | ~4,30 $ | 40-80 $ (plancher GPU minimum) |
| 10 000 minutes | ~43 $ | 60-120 $ |
| 50 000 minutes | ~215 $ | 100-200 $ |
| 500 000 minutes | ~2 150 $ | 400-900 $ |
Le plancher GPU est le point clé. Une instance GPU persistante coûte de l'argent, qu'elle transcrive ou non. À faible volume, vous payez surtout pour du temps d'inactivité. À volume élevé, vous répartissez ce coût fixe sur suffisamment de travail pour que le taux effectif par minute tombe bien en dessous de toute API.
Le point de bascule dépend de l'efficacité avec laquelle vous remplissez le GPU. Avec une file d'attente et une planification par lots, un seul A100 sur faster-whisper peut traiter plusieurs centaines d'heures par jour. Si votre charge de travail le remplit, l'auto-hébergement bat tous les prix propriétaires à volume élevé. S'il reste inactif à 80 %, vous avez rendu l'avantage.
Pour la comparaison complète des prix entre services, voir comparaison des prix de transcription 2026.
Latence : là où le propriétaire a un réel avantage
Deepgram Nova-3 en streaming renvoie des transcriptions partielles en 100-300 ms. Whisper n'est pas un modèle de streaming par nature ; les approximations via whisper-streaming ou WhisperX introduisent plus de latence, typiquement 500-1500 ms pour des résultats partiels. Pour les sous-titres en temps réel, la transcription d'appels en direct ou les boucles d'agent vocal, cet écart est significatif.
Pour le travail par lots (réunions enregistrées, podcasts, entretiens), l'écart est plus réduit. Deepgram traite un fichier d'une heure en environ 2-3 minutes. Un déploiement faster-whisper bien réglé sur un A100 fait un travail similaire en 4-7 minutes. L'API OpenAI Whisper hébergée est plus lente que les deux en raison de la surcharge de file d'attente.
Si votre pipeline tourne la nuit et que personne n'attend, les différences de latence importent peu. Si des utilisateurs regardent une barre de progression, elles comptent.
La complexité opérationnelle, un coût sous-estimé
Faire tourner un déploiement Whisper en production, c'est hériter d'un ensemble de problèmes qu'une API gérée absorbe de manière invisible :
- Provisionnement GPU : les instances permanentes coûtent de l'argent au repos ; le serverless (RunPod, Modal, Replicate) ajoute de la latence de démarrage à froid.
- Pics de trafic : un afflux d'uploads frappe votre file GPU à capacité fixe, pas une API à l'échelle mondiale avec de la marge.
- Maintenance du modèle : mises à jour de dépendances, compatibilité des versions CUDA, surveillance.
- Intégration de la diarisation : Pyannote ou NeMo ont leurs propres exigences d'installation et de licence.
- Formatage et export des sorties : SRT, VTT, restauration de la ponctuation, étiquettes de locuteur. Les API propriétaires renvoient tout ça. Avec Whisper auto-hébergé, vous les construisez vous-même.
Concrètement, cela représente une à deux semaines de travail d'ingénieur au départ, puis une maintenance continue non négligeable. Pour une startup de deux personnes qui transcrit 1 000 minutes par mois, c'est un mauvais usage du temps. Pour une équipe qui transcrit 500 000 minutes par mois avec une personne dédiée à l'infra, c'est un mardi comme un autre.
Le modèle hybride
De nombreux déploiements en production routent par type de tâche plutôt que de s'engager sur un seul côté :
- API propriétaire pour le chemin par défaut. Rapide, sans maintenance, gère le trafic imprévisible.
- Auto-hébergé pour l'audio sensible à la confidentialité. Tout ce qui ne doit pas quitter votre infrastructure tourne en local.
- Auto-hébergé pour les lots à fort volume. Les jobs batch de nuit où la latence est sans importance et où le volume rend le coût par minute dominant.
Ce modèle ajoute un peu de complexité opérationnelle, mais laisse les exigences de coût et de conformité piloter chaque tâche, au lieu d'imposer un seul compromis pour toutes.
Choisissez l'open source (auto-hébergé) si :
- Vous transcrivez plus de 10 000 minutes par mois et disposez de compétences techniques pour déployer et maintenir un pipeline GPU.
- Des exigences de confidentialité empêchent l'envoi de l'audio vers des serveurs tiers.
- Vous avez besoin d'un fine-tuning par domaine : les poids de Whisper sont librement ajustables sur vos propres données labellisées.
- Vous voulez une flexibilité linguistique sans surcoût par langue via une API.
Choisissez une API propriétaire si :
- Vous voulez une transcription opérationnelle en quelques heures, pas en quelques semaines.
- Votre volume est faible à modéré et un coût GPU fixe dominerait.
- Vous avez besoin de fonctionnalités groupées : diarisation avancée, résumé, détection d'entités, modélisation thématique.
- Vous préférez qu'un fournisseur gère la fiabilité, la disponibilité et la montée en charge.
Choisissez un outil géré si :
- Vous avez besoin d'un produit fini plutôt que d'une API : téléversement, révision, export, terminé.
- Une tarification forfaitaire prévisible prime sur l'optimisation par minute.
- Vous voulez du formatage et de l'édition par-dessus la transcription sans avoir à les construire.
Si vous voulez des transcriptions propres sans monter d'infrastructure, ConvertAudioToText gère le passage du fichier au texte sans compte requis pour les fichiers courts. Il ne prétend pas être la seule option dans ce domaine, mais il s'inscrit parfaitement dans la catégorie « produit fini ».
FAQ
Whisper est-il aussi précis que Deepgram Nova-3 ?
Cela dépend du type d'audio. Sur des benchmarks académiques comme LibriSpeech, Whisper Large-v3 atteint 2,7 % de WER sur de l'anglais propre. En production sur divers types d'audio, les deux systèmes affichent 5 à 12 % de WER selon les conditions. Whisper a un avantage en précision sur les langues peu dotées et les accents ; Deepgram Nova-3 tend à surpasser sur l'audio téléphonique et les centres d'appels.
À partir de quel volume l'auto-hébergement de Whisper devient-il rentable ?
Environ 10 000 à 20 000 minutes par mois, même si le point de bascule exact dépend de l’efficacité avec laquelle vous remplissez le travail GPU. Une A100 persistante sur RunPod (~1,29 $/h) qui tourne à 80 % de capacité et transcrit 50 000 minutes par mois coûte à peu près 100 à 200 $, contre environ 215 $ au tarif de base par minute de Deepgram. En dessous de ce volume, le coût fixe du GPU domine et une API à la minute revient moins cher.
Puis-je utiliser Whisper dans un setup de streaming en temps réel ?
Pas directement : Whisper traite l’audio par segments et n’est pas un modèle de streaming natif. Des bibliothèques comme whisper-streaming et WhisperX ajoutent des approximations de streaming, mais la latence pour les résultats partiels se situe entre 500 et 1500 ms. Deepgram Nova-3 en streaming renvoie des résultats partiels en 100 à 300 ms. Pour le sous-titrage en direct ou les agents vocaux, les API de streaming propriétaires ont un avantage pratique évident.
Quelles sont les principales raisons de choisir AssemblyAI plutôt que Deepgram ?
Le tarif d’AssemblyAI (0,15 $/h en base) casse celui de Deepgram pour l’enregistrement préalable, et sa couche de post-traitement intégrée (résumé, détection d’entités, modélisation thématique, analyse de sentiment) est un vrai différenciateur. Si votre pipeline a besoin d’une sortie structurée plutôt que d’un simple transcript, AssemblyAI regroupe ce travail. Si vous avez besoin d’une vitesse maximale ou de streaming, Deepgram a l’avantage.
Est-ce que l’auto-hébergement de Whisper règle les problèmes de confidentialité ?
Oui, pour la plupart des modèles de menace pratiques. Faire tourner Whisper sur votre propre infrastructure signifie que l’audio ne quitte jamais vos serveurs. C’est important pour les enregistrements juridiques, médicaux ou autrement sensibles. La contrepartie, c’est que vous êtes responsable de la sécurité de cette infrastructure. Une API propriétaire gérée décharge la question de la confidentialité de la transcription, mais introduit ses propres accords de traitement des données à examiner.
Sources
- Page de tarification de Deepgram : https://deepgram.com/pricing
- Page de tarification d'AssemblyAI : https://www.assemblyai.com/pricing
- Tarification d'AWS Transcribe : https://aws.amazon.com/transcribe/pricing/
- Tarification de Google Cloud STT : https://cloud.google.com/speech-to-text/pricing
- Tarification de l'API OpenAI : https://openai.com/business/pricing/
- Présentation de Deepgram Nova-3 : https://deepgram.com/learn/introducing-nova-3-speech-to-text-api
- GitHub de faster-whisper : https://github.com/SYSTRAN/faster-whisper
- Tarification GPU de RunPod : https://www.runpod.io/pricing
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How AI Transcription Works: The Product Pipeline Explained (2026)
From upload to exported transcript: a clear walkthrough of every stage in the AI transcription pipeline, including VAD, ASR, diarization, post-processing, and export.

Cost Advantages of an All-in-One Speech API Like Deepgram (2026)
Honest 2026 analysis of Deepgram's all-in-one API economics: verified per-minute rates, diarization add-on costs, and when a single-vendor stack wins vs. multi-vendor stitching.