
Tarifs Deepgram Nova-3 en 2026 : 0,0043 $/min en batch, 0,0077 $ en streaming
Summarize this article with:
Deepgram Nova-3 est un modèle commercial fermé de reconnaissance vocale conçu pour le streaming à faible latence et le batch à fort volume. Il coûte environ 0,0043 $ par minute pour l'audio pré-enregistré (environ 0,26 $ de l'heure) et environ 0,0077 $ par minute en streaming, prend en charge plus de 50 langues avec changement de code en temps réel sur 10, et propose l'incitation par mots-clés pour le vocabulaire spécialisé. Ses chiffres de précision et de latence sont solides mais auto-publiés, donc testez sur votre propre audio avant de leur faire confiance. Choisissez Nova-3 pour le temps réel et les budgets de latence serrés ; choisissez Whisper quand vous avez besoin d'open source, d'auto-hébergement ou d'une couverture de 99 langues.
Deepgram a dévoilé Nova-3 en janvier 2025, en remplacement de Nova-2, son précédent modèle de reconnaissance vocale phare. Il alimente désormais une partie des outils de transcription en temps réel et à haut débit livrés en 2025 et 2026, et il opère au sein de certaines étapes du pipeline ConvertAudioToText. Cet article explique ce qu'est Nova-3, quels sont ses vrais tarifs et ses limites en 2026, et comment il se positionne face à la référence open-source, Whisper.
Je passe l'essentiel de ma semaine à router de l'audio entre différents moteurs de transcription, alors mon objectif ici est la version que j'aimerais que les éditeurs publient : les chiffres qui sont réels, ceux qui relèvent du marketing, et la frontière entre les deux.
Les chiffres d'exactitude et de latence mis en avant sont des benchmarks propres à Deepgram, pas des tests indépendants, donc prenez-les comme un point de départ et testez sur votre propre audio. Choisissez Nova-3 quand la latence en temps réel ou la facturation à la seconde compte. Choisissez Whisper quand vous avez besoin de contrôle open-source, d'hébergement autonome, ou d'une couverture des langues moins courantes.
Architecture : ce qui est réellement documenté
Deepgram n'a pas publié le nombre de paramètres, le nombre de couches, ni la variante exacte de transformer utilisée par Nova-3. C'est un modèle commercial fermé, donc l'architecture est une boîte noire. Ce que l'entreprise documente publiquement :
- C'est un modèle de bout en bout. Le même réseau gère la modélisation acoustique, la modélisation du langage et la production finale du texte, plutôt que trois étapes distinctes.
- Il est entraîné sur un vaste jeu de données audio propriétaire couvrant l'audio d'entreprise, les podcasts, les données conversationnelles et les enregistrements réels bruités.
- Il dessert à la fois les modes API en streaming (temps réel) et pré-enregistré à partir du même modèle sous-jacent.
- Il renvoie directement des horodatages au niveau du mot et des scores de confiance.
La posture d'ingénierie de Deepgram a toujours été d'optimiser la latence d'inférence et le coût par minute. Nova-3 poursuit cette ligne : son lancement l'a positionné comme un jeu sur la vitesse et la personnalisation, pas comme un pari sur l'exactitude brute.
Ce qui a changé par rapport à Nova-2
Le post de lancement de Deepgram pour Nova-3 met en avant quelques améliorations ciblées par rapport à Nova-2.
Keyterm prompting. C'est la fonctionnalité phare. Vous pouvez passer jusqu'à 100 termes clés (noms d'entreprises, noms de médicaments, jargon technique) au moment de la requête, et le modèle s'y oriente, sans réentraînement. Deepgram la présente comme la première personnalisation en libre-service de ce type dans un modèle d'IA vocale. Pour les vocabulaires spécifiques à un domaine, c'est l'ajout le plus utile.
Code-switching en temps réel. Nova-3 peut transcrire un audio qui alterne entre les langues en pleine phrase, sur 10 langues (anglais, espagnol, français, allemand, hindi, russe, portugais, japonais, italien et néerlandais) grâce au code de langue multi. Nova-2 gérait mal l'audio multilingue.
Couverture linguistique élargie. Nova-3 est sorti avec 36 langues prises en charge, et Deepgram l'a étendue au fil de 2025 à plus de 50 selon la documentation actuelle.
Moins d'hallucinations sur le silence et la musique. Les anciens modèles Deepgram produisaient parfois du texte pendant des passages uniquement musicaux ou quasi silencieux. Nova-3 intègre une détection d'activité vocale dans le pipeline qui supprime ces faux positifs. Notre article sur le fonctionnement de la détection d'activité vocale explique pourquoi cela compte.
Les chiffres de précision, lus honnêtement
C'est là que la plupart des articles se trompent, alors lisez attentivement. Chaque chiffre de précision que Deepgram publie pour Nova-3 provient des propres tests de Deepgram. Il n'y a aucun benchmark tiers neutre derrière. Voici ce que le post de lancement affirme réellement, séparé pour éviter toute confusion :
- Taux d'erreur de mots (WER) en streaming : 54,2 % inférieur à celui du concurrent le plus proche, que Deepgram ne nomme pas. WER médian de 6,84 % contre 14,92 % pour le concurrent.
- WER en batch : 47,4 % inférieur à celui du concurrent le plus proche. WER médian de 5,26 % contre environ 10 %.
- Face à Whisper spécifiquement : Deepgram affirme que Nova-3 a été préféré sur 7 des 7 langues testées, avec une préférence allant jusqu'à 8 contre 1 sur certaines, à partir d'environ 200 échantillons audio.
Le chiffre de « 54 % » concerne un concurrent non nommé, pas Whisper. La comparaison avec Whisper est un test de préférence distinct, celui de 7 sur 7. Beaucoup de publications de seconde main fusionnent les deux en « 54 % plus précis que Whisper », ce que Deepgram n'a jamais dit. Le WER dépend aussi fortement de la qualité audio, de l'accent et du domaine, donc une médiane mesurée sur son propre jeu de test ne garantit rien pour vos enregistrements d'appels.
À retenir : les chiffres de précision de Nova-3 sont de vraies affirmations issues d'un vrai benchmark, mais c'est le benchmark du fournisseur. Le seul chiffre qui compte pour votre projet est celui que vous mesurez sur votre propre audio.
Points forts en production
Là où Nova-3 justifie régulièrement sa place.
Latence en temps réel. L'API de streaming produit des transcriptions avec une latence de bout en bout comprise entre 200 et 300 millisecondes dans de bonnes conditions, comparable à Nova-2. Pour le sous-titrage en direct, les assistants vocaux et la transcription de réunions où les utilisateurs voient le texte apparaître pendant que quelqu'un parle, c'est là que Deepgram prend l'avantage sur les modèles orientés batch comme Whisper.
Facturation à la seconde. Deepgram facture par seconde d'audio traitée plutôt que d'arrondir à la minute supérieure. Sur de gros volumes de courts extraits, cette différence d'arrondi représente de vraies économies par rapport aux fournisseurs qui arrondissent.
Débit à grande échelle. L'infrastructure de Deepgram est conçue pour le traitement à haut volume. Les équipes qui transcrivent des milliers d'heures par jour rapportent un débit stable là où un déploiement auto-hébergé à locataire unique peinerait.
Keyterm prompting. En passant une courte liste de termes attendus, la précision sur les noms propres et le vocabulaire spécialisé s’améliore nettement, sans réentraînement ni traitement par lots. Notre article sur la correction des noms mal transcrits explique quand cela vaut la peine de mettre en place.
Scores de confiance bien calibrés. Nova-3 renvoie des scores de confiance au niveau du mot que vous pouvez exploiter en aval. Notre article sur les scores de confiance en transcription détaille comment les utiliser.
Points faibles connus
Là où Nova-3 montre ses limites, dit clairement.
Le modèle est fermé. Vous ne pouvez pas auto-héberger Nova-3, le faire tourner hors ligne, ni l’affiner sur vos propres données en dehors d’un contrat entreprise. Pour des exigences strictes de résidence des données ou des environnements isolés, un modèle ouvert comme Whisper est la seule option. Notre article sur la résidence des données pour la transcription couvre les cas où cette contrainte est un vrai blocage.
La couverture linguistique reste en retrait par rapport à Whisper. Nova-3 gère bien plus de 50 langues ; Whisper en couvre environ 99 avec une qualité variable. Pour des contenus dans des langues moins courantes, Whisper l’emporte souvent par défaut. Notre article sur pourquoi l’IA peine avec les langues peu dotées aborde cet écart.
Pas de grande différence sur l’audio le plus difficile. Sur un anglais propre à un seul locuteur, Nova-3 et Whisper Large-v3 arrivent proches. Dans les pires conditions (accents prononcés, audio téléphonique à faible débit, locuteurs qui se chevauchent), l’écart entre eux est mince et dépend de l’usage. Notre explication de Whisper Large-v3 traite cette comparaison.
Aucune piste d’audit publiée. Comme l’architecture et les données d’entraînement ne sont pas publiques, évaluer les biais systématiques ou les modes de défaillance implique des tests pratiques, pas la lecture d’un article. Pour la recherche ou les usages réglementés où la provenance du modèle compte, cette opacité est une vraie limite.
La diarisation n'a pas de limite de locuteurs documentée, dans un sens comme dans l'autre. La diarisation de Deepgram détecte les locuteurs sans que vous ayez à préciser un nombre à l'avance, et la documentation ne publie aucun maximum. Si vous avez vu une mention « prend en charge jusqu'à 12 locuteurs » (y compris dans une version antérieure de cet article), ce chiffre ne figure pas dans la documentation de Deepgram. Considérez le nombre de locuteurs comme quelque chose à tester sur vos propres enregistrements multipartites. Notre article sur la gestion de plusieurs locuteurs en IA couvre ce que la diarisation peut et ne peut pas faire.
Tarifs en 2026
Voici les tarifs publiés par Deepgram pour Nova-3 en mode paiement à l'usage. Les chiffres évoluent, alors vérifiez sur la page tarifaire de Deepgram avant de bâtir un budget dessus.
| Mode | Prix (Nova-3, paiement à l'usage) |
|---|---|
| Pré-enregistré (batch), monolingue | Environ 0,0043 $ par minute (~0,26 $/h) |
| Streaming, monolingue | Environ 0,0077 $ par minute (~0,46 $/h) |
Streaming multilingue (multi) | Environ 0,0058 $ par minute |
| Crédit d'inscription gratuit | 200 $, sans expiration |
| Plan Growth | À partir d'environ 4 000 $ par an, tarifs dégressifs |
Nova-3 pay-as-you-go, 2026.
Deux choses que le tarif à la minute ne dit pas. D'abord, Deepgram facture à la seconde, donc les charges de travail avec des clips courts coûtent moins cher que ne le laisse entendre le tarif à la minute. Ensuite, le crédit gratuit de 200 $ est vraiment conséquent, assez pour transcrire plusieurs centaines d'heures d'audio en batch avant de payer quoi que ce soit, ce qui en fait un vrai budget d'évaluation plutôt qu'un simple appât.
Comparaison avec les autres API
Il est à la mode de qualifier Deepgram de « moins cher ». Pour la transcription par lots en 2026, ce n’est plus vrai. Voici les tarifs de base préenregistrés, normalisés à l’heure, issus des grilles de chaque fournisseur.
| Fournisseur / modèle | Prix par lot (à l’heure) |
|---|---|
| AssemblyAI Universal-2 | 0,15 $ |
| Rev AI Reverb | 0,20 $ |
| AssemblyAI Universal-3.5 Pro | 0,21 $ |
| Deepgram Nova-3 | Environ 0,26 $ |
| OpenAI gpt-4o-transcribe | 0,36 $ |
| OpenAI gpt-4o-mini-transcribe | 0,18 $ |
Nova-3 est proposé à un prix compétitif parmi les API premium, mais ce n’est pas le plancher. AssemblyAI et le niveau IA de Rev le sous-cotent sur les tarifs de base par lots. Là où Deepgram excelle, c’est sur la latence en temps réel et la facturation à la seconde, pas sur le prix affiché. Une réserve qui fait de tout tableau comme celui-ci un simple point de départ : ce sont des tarifs de transcription de base, et certains fournisseurs (AssemblyAI le précise explicitement) facturent la diarisation des locuteurs, la synthèse et d’autres fonctions d’analyse séparément. Le tarif de base n’est donc pas votre facture totale.
Pour les créateurs solo et les petites équipes, aucune de ces API à la minute n’est de toute façon le bon achat. Dès que vous dépassez environ 40 heures d’audio par mois, un forfait illimité à tarif fixe comme CATT Pro à 9,99 $/mois bat la facturation au compteur. Notre comparatif des tarifs de transcription détaille les calculs du point de bascule.
Streaming vs batch
Nova-3 gère les deux via des endpoints distincts, et les cas d’usage sont bien différents.
Streaming
Le streaming est fait pour quand l’utilisateur voit le résultat au fur et à mesure qu’il est produit : sous-titrage en direct, transcription de réunion en temps réel, saisie pour assistant vocal, outils d’accessibilité. Une latence sous 500 millisecondes compte, et la précision absolue peut légèrement baisser parce que le modèle affiche souvent des corrections au fil du contexte. Le streaming Nova-3 renvoie des transcriptions provisoires (meilleure estimation, susceptible d’être révisée) puis des transcriptions finalisées (verrouillées) à mesure que l’audio arrive. La plupart des intégrations gèrent la bascule automatiquement.
Batch
Batch mode is for pre-recorded audio. La latence se compte en secondes pour les fichiers courts, en minutes pour les longs, et la précision est supérieure au streaming, car le modèle dispose de tout le contexte audio. La plupart des travaux de transcription standard, y compris les téléversements sur l'outil de transcription anglais CATT, se font en batch. Le temps réel est courant dans les flux de sous-titrage en direct, mais plus rare dans les outils de type « téléversez et attendez ».
La place de Nova-3 dans le pipeline CATT
ConvertAudioToText achemine chaque tâche vers le moteur qui lui correspond, sans que l'utilisateur ait à choisir. Il est important d'être honnête sur le rôle réel de Nova-3 ici, car ce n'est pas le moteur par défaut pour la plupart des tâches.

- AssemblyAI Universal est le moteur premium par défaut pour les comptes inscrits, car la sortie avec diarisation est la priorité des titulaires de compte.
- Cloudflare Whisper est le moteur gratuit par défaut pour les aperçus anonymes sur la page d'accueil, car il coûte 0 $.
- Deepgram Nova-3 est le réglage par défaut pour les enregistrements du bot de réunion, le recours avec diarisation quand AssemblyAI et Gladia sont indisponibles, une option de secours pour le niveau gratuit, et le moteur que vous obtenez si vous demandez explicitement Deepgram.
Donc Nova-3 est un vrai rouage du système, mais comme réglage par défaut du bot de réunion et comme solution de secours fiable, pas comme moteur principal pour les téléversements. L'effet pratique pour les utilisateurs : le pipeline choisit le moteur selon la langue, la durée de l'audio, le statut du compte et les besoins en fonctionnalités (diarisation, résumé), et vous obtenez la meilleure option sans avoir à décider. Le moyen le plus simple de voir la qualité du résultat est de faire passer votre propre fichier par l'outil anglais gratuit de 60 minutes.
Comment choisir entre Nova-3 et Whisper
Une petite liste de contrôle.
- La latence en temps réel est cruciale : Nova-3.
- Besoin d'un hébergement local ou hors ligne : Whisper.
- La couverture de 99 langues est essentielle : Whisper.
- Une cinquantaine de langues bien prises en charge suffit, et vous voulez une facturation à la seconde : Nova-3.
- La conformité avec un logiciel propriétaire est acceptable et vous voulez une infrastructure gérée : Nova-3.
- La conformité open-source est obligatoire : Whisper, sans hésiter.
Pour la plupart des outils de transcription en production en 2026, la réponse honnête est « utilisez les deux et acheminez les requêtes selon le besoin ». C'est ce que font ConvertAudioToText et plusieurs outils de l'espace alternatives à Otter en coulisses.
Questions fréquentes
Combien coûte Deepgram Nova-3 par minute ?
La transcription pré-enregistrée (par lots) avec Nova-3 tourne autour de 0,0043 $ par minute, soit environ 0,26 $ de l'heure, sur le tarif à l'utilisation. Le streaming coûte environ 0,0077 $ par minute, soit environ 0,46 $ de l'heure. Le streaming multilingue est à environ 0,0058 $ par minute. Deepgram facture à la seconde d'audio, et les nouveaux comptes reçoivent un crédit gratuit de 200 $ sans expiration. Les prix changent, donc vérifiez sur la page tarifaire de Deepgram avant de budgéter.
Nova-3 est-il plus précis que Whisper ?
Sur les propres benchmarks de Deepgram, Nova-3 a été préféré à Whisper sur les 7 langues testées, avec un ratio de préférence allant jusqu'à 8 contre 1 sur certaines. C'est le test de Deepgram, pas un test indépendant. En pratique, sur de l'anglais propre avec un seul locuteur, les deux sont proches, et sur l'audio le plus difficile (accents prononcés, enregistrements téléphoniques, chevauchements de parole), l'écart est mince et dépend de votre audio spécifique. Le seul chiffre qui compte est celui que vous mesurez vous-même.
Combien de langues Nova-3 prend-il en charge ?
Nova-3 a été lancé en janvier 2025 avec 36 langues, puis étendu au fil de l'année à plus de 50 selon la documentation actuelle de Deepgram. Le changement de code en temps réel, où le modèle gère un audio qui mélange les langues en plein flux, est pris en charge pour 10 langues : anglais, espagnol, français, allemand, hindi, russe, portugais, japonais, italien et néerlandais. Whisper couvre toujours plus de langues au total, environ 99, avec une qualité variable.
Puis-je auto-héberger ou exécuter Nova-3 hors ligne ?
Non. Nova-3 est un modèle commercial fermé. Vous ne pouvez pas le télécharger, l'exécuter hors ligne, ni l'affiner sur vos propres données en dehors d'un contrat d'entreprise. Si vous avez besoin d'auto-hébergement, d'un déploiement isolé ou d'un contrôle total sur vos données, un modèle ouvert comme Whisper Large-v3 est la voie à suivre.
Qu'est-ce que le prompting par mots-clés et est-ce vraiment utile ?
Le prompting par mots-clés vous permet de transmettre jusqu'à 100 termes attendus (noms d'entreprises, noms de produits, jargon médical ou juridique) avec une demande de transcription, et Nova-3 les privilégie sans réentraînement. C'est surtout utile quand votre audio regorge de noms propres ou de vocabulaire spécialisé qu'un modèle généraliste raterait. Pour une liste de noms courants, de noms de médicaments ou de termes techniques, même une courte liste de mots-clés améliore nettement la précision sur ces mots précis.
Combien de locuteurs la diarisation de Nova-3 peut-elle gérer ?
La diarisation de Deepgram détecte les locuteurs sans que vous ayez à préciser un nombre à l'avance, et la documentation ne publie aucun maximum. Les affirmations d'une limite précise comme « jusqu'à 12 locuteurs » ne figurent pas dans les docs de Deepgram. Considérez le nombre de locuteurs comme quelque chose à vérifier vous-même sur votre audio multipartite, car la qualité de la diarisation sur des enregistrements chevauchants ou très denses varie selon le moteur.
Deepgram Nova-3 prend-il en charge la transcription en streaming en temps réel ?
Oui. Nova-3 prend en charge le streaming via un endpoint WebSocket avec une latence de bout en bout comprise entre 200 et 300 millisecondes dans de bonnes conditions. Il renvoie des transcriptions provisoires qui peuvent être révisées, puis des transcriptions finales verrouillées, à mesure que davantage d'audio arrive. C'est le cas d'usage le plus fort de Nova-3 par rapport aux modèles batch-first comme Whisper.
Nova-3 est-il l'API de transcription la moins chère ?
Pas en batch. En 2026, AssemblyAI Universal-2 (0,15 $/h), Rev AI Reverb (0,20 $/h) et AssemblyAI Universal-3.5 Pro (0,21 $/h) sont tous moins chers que le tarif batch de base de Nova-3, environ 0,26 $/h. Nova-3 se démarque par sa latence en temps réel et sa facturation à la seconde plutôt que par le prix le plus bas affiché. Notez que certains fournisseurs facturent la diarisation et d'autres fonctionnalités séparément, donc les tarifs de base ne représentent pas le coût total.
Par où commencer
La façon la plus simple d'évaluer Nova-3 avec votre propre audio est de le tester via un service qui l'utilise. Le niveau gratuit CATT de 60 minutes couvre une évaluation réelle. Pour l'onboarding de Deepgram, le crédit self-service de 200 $ couvre des centaines d'heures de traitement batch Nova-3, ce qui est largement suffisant pour comparer avec votre flux de travail existant avant d'engager un budget.
Sources
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How AI Transcription Works: The Product Pipeline Explained (2026)
From upload to exported transcript: a clear walkthrough of every stage in the AI transcription pipeline, including VAD, ASR, diarization, post-processing, and export.

Open Source vs Proprietary Transcription Models 2026
Honest tradeoffs between Whisper open-source and Deepgram, AssemblyAI, and other proprietary APIs. Verified costs, accuracy ranges, and when each actually makes sense.