
Comparatif des API de transcription 2026, la matrice pour les devs
Summarize this article with:
Deepgram Nova-3 est l'option streaming la moins chère et la plus rapide pour l'anglais. AssemblyAI Universal-2 bat tout le monde sur le prix par minute en batch, tandis que Universal-3 Pro affiche le meilleur WER publié. Le gpt-4o-transcribe d'OpenAI est le choix le plus solide pour les lots multilingues. AWS Transcribe n'a de sens que si vous êtes déjà bien ancré dans l'écosystème AWS. Google Cloud STT est le moins cher de tous en batch dynamique à 0,003 $/min, mais il est lent. Choisissez selon le volume, le mélange de langues et les exigences de latence, pas selon la notoriété du nom.
Choisir la mauvaise API de transcription peut vous coûter 5 fois plus que nécessaire, vous priver de la moitié des langues dont vous avez besoin, ou vous faire développer sur une fonctionnalité qui ne marche qu'en anglais. Ce post décortique les principaux fournisseurs selon des tarifs vérifiés, des benchmarks de précision et des schémas d'intégration, pour que vous puissiez trancher en une seule lecture.
Le public visé ici, ce sont les développeurs et les équipes techniques. Si vous cherchez plutôt une comparaison côté acheteur des outils SaaS plutôt que l'intégration d'API, commencez par l'aperçu des meilleures API de reconnaissance vocale en 2026.
Comment le marché se structure en 2026
Cinq fournisseurs se partagent l'essentiel du trafic API en production : Deepgram, AssemblyAI, OpenAI (gpt-4o-transcribe), AWS Transcribe et Google Cloud STT. Chacun a une vraie niche.
Les différenciateurs clés :
- Coût par minute en batch : de $0.0025 (AssemblyAI Universal-2) à $0.016 (Google temps réel standard)
- Latence en streaming : Deepgram sous les 300ms, les autres entre 300ms et 800ms, ou pas de streaming du tout
- Couverture linguistique : OpenAI à 99+, Deepgram solide sur 10 à 30, AWS autour de 30
- Profondeur des fonctionnalités : AssemblyAI regroupe diarisation, anonymisation, détection d'entités et résumés ; les autres facturent des options ou ne les proposent pas
Les tarifs ci-dessous sont en paiement à l'usage, en batch (pré-enregistré), pour de l'audio anglais, sauf mention contraire. Vérifiés en juillet 2026 sur les pages des fournisseurs.
Analyse fournisseur par fournisseur
Deepgram Nova-3
Nova-3 est le leader de la vitesse en streaming. Le batch pré-enregistré coûte $0.0043/min (anglais, paiement à l'usage), le streaming est à $0.0077/min (standard). Le plan Growth avec un engagement annuel de $4,000+ ramène le batch à $0.0036/min. Deepgram facture à la seconde, sans arrondi.
Nova-3 Multilingue (hors anglais) tourne à $0.0092/min en batch, ce qui est plus salé. Si vous transcrivez beaucoup de volume non anglophone, vérifiez si la surcharge multilingue change la donne par rapport à OpenAI.
La diarisation a reçu une mise à jour majeure en version v2 en 2026. Deepgram rapporte une préférence de 3,3x pour la v2 par rapport à la v1 lors d'évaluations comparatives, avec les plus gros gains sur l'audio de centre de contact. Vous l'activez via diarize_model=nova-3.
Deepgram revendique un WER de 5,26% sur Nova-3 batch sur leur jeu de test de production (2 703 fichiers, neuf domaines). Langues supportées avec qualité : environ 30 pour Nova-3, avec 10 nouvelles langues monolingues européennes et d'Asie du Sud-Est ajoutées en 2026.
Crédits gratuits : 200 $ sans carte de crédit requise.
Bon pour : les agents vocaux en temps réel, les centres d'appels, toute application où la latence de streaming compte. Pas le moins cher pour du batch asynchrone à gros volume.
AssemblyAI Universal-2 et Universal-3 Pro
AssemblyAI est l'option batch vérifiée la moins chère pour l'anglais à 0,0025 $/min (0,15 $/h) sur Universal-2. Universal-3 Pro est à 0,0035 $/min (0,21 $/h) et couvre six langues avec la précision publiée la plus élevée. Notez que le tarif régional d'AssemblyAI a augmenté de 10% au 1er juillet 2026, mais vous pouvez l'éviter en ajoutant "model_region": "global" à votre requête.
Selon le benchmark d'AssemblyAI de juin 2026 (plus de 80 000 fichiers, 26 jeux de données, normalisateur de texte OpenAI), Universal-3 Pro obtient un WER de 4,5% sur l'audio anglais pré-enregistré. Deepgram Nova-3 obtient 6,66% dans le même benchmark. Ces chiffres proviennent de la propre suite de tests d'AssemblyAI, donc traitez-les comme indicatifs, pas comme un verdict neutre de tiers.
Les options additionnelles s'empilent sur le tarif de transcription de base. La diarisation des locuteurs en asynchrone ajoute 0,02 à 0,065 $/h. La rédaction PII coûte 0,08 $/h. La modération de contenu coûte 0,15 $/h. La synthèse coûte 0,08 $/h. Pour une transcription anglaise diarisée et rédigée, vous regardez environ 0,30 $/h au total.
Streaming (modèle Universal-Streaming) : 0,15 $/h, facturé selon le temps de connexion WebSocket, pas la durée audio. Une connexion ouverte pendant 60 minutes avec 30 minutes de parole facturée 60 minutes. Prévoyez cela dans les applications interactives sensibles à la latence.
Crédits gratuits : 50 $, sans carte de crédit requise.
Bon pour : les lots asynchrones à fort volume, les pipelines orientés anglais où la richesse des fonctionnalités (résumés, entités, modération) compte. Pas le meilleur choix pour le streaming multilingue.
OpenAI (gpt-4o-transcribe et gpt-4o-mini-transcribe)
Pour le traitement multilingue par lots, gpt-4o-transcribe à 0,006 $/min est l'option la plus fiable sur plus de 99 langues. La variante mini divise ce prix par deux à 0,003 $/min, avec un léger compromis sur la précision. La page tarifaire d'OpenAI liste les deux comme modèles actuels.
Pour le streaming en temps réel, gpt-realtime-whisper (sorti en mai 2026) est la voie dédiée à 0,017 $/min. Il se connecte via WebSocket et fournit des segments de transcription au fur et à mesure que l'orateur parle.
L'ancienne affirmation « l'API Whisper ne fait pas de streaming » est obsolète. Le streaming existe désormais via le chemin temps réel, mais à un tarif plus élevé que le traitement par lots.
Les limites qui persistent : l'API hébergée impose une taille de fichier maximale de 25 Mo par requête pour le traitement standard par lots. Pas de diarisation native sur gpt-4o-transcribe (une variante dédiée à la diarisation existe séparément). Pas de résumé IA natif. Pas d'éligibilité HIPAA sur l'API grand public standard.
Pour une ventilation complète des tarifs des modèles audio d'OpenAI, consultez la tarification de l'API Whisper d'OpenAI en 2026.
Bon pour : la transcription multilingue, les applications qui utilisent déjà la pile API d'OpenAI, les scénarios où la couverture linguistique prime sur le coût.
AWS Transcribe
Le tarif par lots d'AWS Transcribe à 0,006 $/min (US East, standard) est compétitif, mais il n'a de sens que si vous êtes déjà investi dans la pile AWS. Le streaming est à 0,01 $/min. Des paliers de volume s'appliquent à partir de 250 000 minutes (palier 2 : 0,0186 $/min, soit 38 % de réduction). La transcription médicale est à 0,075 $/min en lots et 0,15 $/min en streaming. Toute utilisation est facturée par incréments d'une seconde, avec un minimum de 15 secondes par requête.
La précision est en retrait par rapport à Deepgram et OpenAI sur les benchmarks comparables en audio propre. La vraie valeur, c'est l'intégration : les déclencheurs S3, le chiffrement KMS, les rôles IAM, les journaux CloudWatch et PrivateLink fonctionnent tous nativement. Pour une équipe santé qui utilise déjà Textract et Comprehend dans AWS, ces intégrations natives font gagner des semaines de travail de collage.
AWS Transcribe est éligible HIPAA (accord BAA disponible). Le vocabulaire personnalisé et les modèles de langue personnalisés existent, mais ils sont facturés en supplément.
Voir la tarification AWS Transcribe 2026 pour le détail complet par paliers de volume.
Bon pour : les architectures natives AWS, les charges de travail éligibles HIPAA, les secteurs réglementés déjà dans l'écosystème.
Google Cloud STT (Chirp 2)
Le tarif le plus attractif de Google, c'est le batch dynamique à 0,003 $/min, mais vous acceptez un délai de 24 heures. Le temps réel standard via l'API V2 est à 0,016 $/min, avec une baisse selon le volume (500 000+ minutes : 0,01 $/min). Le modèle Chirp 2 est inclus au tarif standard, sans prime, et il ajoute des horodatages au niveau du mot et une adaptation du modèle par rapport au Chirp d'origine.
Note de facturation : Google arrondit à la seconde près (pas à 15 secondes comme avec l'ancienne API V1). L'audio multicanal est facturé par canal, ce qui peut doubler votre coût sur les fichiers stéréo.
Offre gratuite : 60 minutes/mois en continu pour les comptes nouveaux et existants, plus 300 $ de crédits sur les 90 premiers jours pour les nouveaux comptes GCP.
Google Cloud STT s'associe bien avec BigQuery, Vertex AI et Pub/Sub, donc les équipes déjà sur l'infrastructure GCP profitent du même argument d'économies d'intégration que les équipes AWS.
Bon pour : les équipes natives GCP, les charges de travail qui tolèrent le traitement batch asynchrone, les applications qui ont besoin de la couverture multilingue Chirp de Google.
Comparaison des prix à des volumes batch réels
Traitement batch, audio en anglais, paiement à l'usage. CATT est un forfait mensuel fixe (pas au tarif par minute), donc il n'apparaît pas sur un axe par minute.
| Fournisseur | Modèle | $/min (batch PAYG) | $/h |
|---|---|---|---|
| AssemblyAI | Universal-2 | $0,0025 | $0,15 |
| OpenAI | gpt-4o-mini-transcribe | $0,0030 | $0,18 |
| Google Cloud | Batch dynamique (Chirp 2) | $0,0030 | $0,18 |
| Deepgram | Nova-3 (anglais) | $0,0043 | $0,26 |
| AssemblyAI | Universal-3 Pro | $0,0035 | $0,21 |
| OpenAI | gpt-4o-transcribe | $0,0060 | $0,36 |
| AWS Transcribe | Standard (US East) | $0,0060 | $0,36 |
| Google Cloud | Temps réel standard | $0,0160 | $0,96 |
Tarifs pay-as-you-go pour la transcription batch standard en anglais. Sources : pages tarifaires des fournisseurs, vérifiées en juillet 2026.
Comparaison des tarifs en streaming
Les cas d'usage en temps réel changent nettement la donne côté coûts.
| Fournisseur | Modèle | $/min (streaming) | Latence |
|---|---|---|---|
| Deepgram | Nova-3 streaming | $0,0077 | moins de 300 ms |
| AssemblyAI | Universal-Streaming | $0,0025 ($0,15/h) | ~300 ms |
| OpenAI | gpt-realtime-whisper | $0,0170 | deltas à faible latence |
| AWS Transcribe | Streaming standard | $0,0100 | ~800 ms |
| Google Cloud | V2 temps réel | $0,0160 | ~450 ms |
À noter : le streaming d'AssemblyAI est facturé au temps de connexion, pas au temps audio. Une session inactive pendant la moitié de la durée accumule quand même des frais.
Matrice des fonctionnalités

| Fonctionnalité | Deepgram | OpenAI 4o-T | AssemblyAI | AWS | |
|---|---|---|---|---|---|
| Diarisation | Oui (v2) | Limitée | Oui (+coût) | Oui | Oui |
| Streaming | Oui | Oui (voie temps réel) | Oui | Oui | Oui |
| Résumés IA | Non | Non | Oui (+coût) | Non | Non |
| Masquage des données personnelles | Oui | Non | Oui (+coût) | Oui (+coût) | Oui |
| Vocabulaire personnalisé | Oui | Limitée | Oui | Oui | Oui |
| Webhooks | Oui | Non | Oui | Via Lambda | Via Pub/Sub |
| Langues (qualité) | ~30 | 99+ | 99 (U2), 6 (U3) | ~30 | 100+ (Chirp 2) |
| Accord HIPAA BAA | Entreprise | Non | Entreprise | Oui | Oui |
| Offre gratuite | Crédit de 200 $ | Aucune carte requise | Crédit de 50 $ | 60 min/mois | 60 min/mois |
Pour un aperçu plus détaillé des modèles de tarification individuels, consultez tarification des API de transcription vocale 2026 et explication des modèles de tarification de transcription.
La matrice de décision pour les développeurs
Quelques règles de décision simples, basées sur ce qui compte vraiment :
Vous avez besoin d'un streaming sous 300 ms pour des agents vocaux ou des sous-titres en direct. Deepgram Nova-3. Rien d'autre ne rivalise avec cette latence à ce prix.
Vous voulez le coût de traitement par lots le plus bas et l'anglais est votre langue principale. AssemblyAI Universal-2 à 0,0025 $/min. Ajoutez la diarisation et vous restez sous 0,30 $/heure.
Vous avez besoin d'une couverture en 99 langues avec une précision solide. OpenAI gpt-4o-transcribe à 0,006 $/min. Les benchmarks multilingues tiennent sur plus de paires de langues que chez tout concurrent.
Vous visez une précision maximale en anglais et acceptez de payer un léger supplément. AssemblyAI Universal-3 Pro (4,5 % de WER selon leurs benchmarks de juin 2026, six langues).
Vous êtes déjà dans l'écosystème AWS et avez besoin de la conformité HIPAA. AWS Transcribe. À 0,006 $/min avec S3, KMS et IAM natifs, les économies d'intégration compensent l'écart de précision.
Vous tournez sur GCP et vos tâches ne sont pas urgentes. Le traitement par lots dynamique de Google Cloud à 0,003 $/min est difficile à battre quand un délai de 24 heures est acceptable.
Vous voulez des résumés IA et la détection d'entités en un seul appel API sans câbler un LLM séparé. AssemblyAI. Le modèle de tarification des modules complémentaires signifie que vous ne payez que pour les fonctionnalités que vous activez.
Si vous avez juste besoin de transcriptions propres sans construire d'intégration, sans inscription, et avec un délai immédiat, ConvertAudioToText gère l'audio, la vidéo, les réunions et les liens YouTube sans clé API. Le plan Business ajoute l'accès API et les webhooks pour les équipes qui intègrent à grande échelle. C'est un tarif mensuel fixe plutôt qu'un coût à la minute, donc le calcul favorise les équipes avec un volume régulier et prévisible par rapport aux charges sporadiques à faible volume.
Modèles de migration
Bascule directe pour une seule route. Remplacez un endpoint à la fois. Envoyez 10% du trafic au fournisseur candidat dans un pipeline fantôme pendant une semaine, comparez le WER sur un échantillon d'audio réel, puis basculez.
Migration pilotée par les coûts au-delà d'un seuil de volume. Si vous êtes chez un fournisseur à la minute et que les coûts grimpent, calculez vos heures audio mensuelles. Le point d'équilibre de 0,15 $/heure d'AssemblyAI Universal-2 par rapport aux alternatives plus chères est très court.
Migration pilotée par les fonctionnalités. Passer d'une API de transcription nue à AssemblyAI pour obtenir des résumés intégrés est généralement moins cher que de faire tourner une API nue plus un appel GPT-4o séparé par transcription. Faites le calcul sur vos dépenses actuelles en LLM par transcription.
Le test parallèle vaut toujours l'heure qu'il prend. Choisissez dix fichiers représentatifs parmi vos types d'audio réels (parole claire, bruitée, avec accent, multilingue), exécutez tous les candidats, comparez la sortie à une vérité terrain. Les benchmarks de laboratoire et les articles de blog des fournisseurs ne prédisent pas la précision sur votre audio spécifique.
Consultez la comparaison des API de transcription 2026 si vous voulez partager un lien permanent vers cette matrice avec votre équipe.
FAQ
Quelle API de transcription a le coût à la minute le plus bas en 2026 ?
AssemblyAI Universal-2 est l’option batch pay-as-you-go la moins chère à 0,0025 $/min (0,15 $/h). Google Cloud STT ne fait mieux que sur le mode batch dynamique (0,003 $/min), mais impose un délai de 24 heures. Deepgram Nova-3 en batch coûte 0,0043 $/min, et OpenAI gpt-4o-mini-transcribe est à 0,003 $/min pour les téléversements de fichiers standard.
Deepgram ou AssemblyAI, lequel est le plus précis ?
Selon les propres benchmarks d’AssemblyAI de juin 2026 (plus de 80 000 fichiers, normalisateur OpenAI), Universal-3 Pro affiche un WER de 4,5 % contre 6,66 % pour Deepgram Nova-3. Le chiffre publié par Deepgram lui-même est de 5,26 % de WER pour Nova-3. Ces données sont autodéclarées, donc à prendre comme des ordres de grandeur. Les deux dépassent confortablement 95 % sur de l’audio anglais propre.
Quelle API prend en charge le plus de langues ?
Le gpt-4o-transcribe d’OpenAI couvre plus de 99 langues avec une qualité raisonnable. AssemblyAI Universal-2 en couvre aussi 99. Deepgram Nova-3 prend en charge l’anglais et environ 30 langues, avec une qualité qui décline au-delà du top dix. AWS Transcribe supporte environ 30 langues, et le modèle Chirp 2 de Google Cloud en gère plus de 100 avec une qualité variable.
Quelle API de transcription est la meilleure pour le streaming en temps réel ?
Deepgram mène pour le temps réel : l’API streaming Nova-3 offre une latence sous 300 ms à 0,0077 $/min. Le gpt-realtime-whisper d’OpenAI (0,017 $/min) est plus récent et conçu pour le sous-titrage en direct et les flux d’assistant vocal. Le modèle Universal-Streaming d’AssemblyAI tourne autour de 0,15 $/h avec une latence sous la seconde. Le streaming AWS Transcribe est à 0,01 $/min et c’est le plus simple à brancher si vous vivez dans l’écosystème AWS.
Faut-il une carte de crédit pour essayer ces API ?
Deepgram offre 200 $ de crédits gratuits sans carte de crédit. AssemblyAI donne 50 $ de crédits gratuits sans carte. OpenAI exige une carte de crédit pour accéder aux clés API. AWS Transcribe propose 60 minutes gratuites par mois pendant 12 mois, mais nécessite un compte AWS et une configuration de facturation. Google Cloud offre 60 minutes gratuites par mois en continu, plus 300 $ de crédits pour les nouveaux comptes.
Quelle API de transcription est éligible HIPAA ?
AWS Transcribe (avec un Business Associate Agreement), AssemblyAI Enterprise et Google Cloud Speech-to-Text (avec un BAA) proposent tous des parcours éligibles HIPAA. Deepgram offre un BAA HIPAA pour ses clients entreprise. L'API hébergée d'OpenAI et ConvertAudioToText ne sont actuellement pas certifiées HIPAA.
Sources
- Page tarifaire Deepgram : https://deepgram.com/pricing (vérifiée en juillet 2026)
- Page tarifaire AssemblyAI : https://www.assemblyai.com/pricing (vérifiée en juillet 2026)
- Benchmarks AssemblyAI : https://www.assemblyai.com/benchmarks (mis à jour le 8 juin 2026)
- Tarifs API OpenAI : https://developers.openai.com/api/docs/pricing (vérifiés en juillet 2026)
- Tarifs Amazon Transcribe : https://aws.amazon.com/transcribe/pricing/ (vérifiés en juillet 2026)
- Tarifs Google Cloud Speech-to-Text : https://cloud.google.com/speech-to-text/pricing (vérifiés en juillet 2026)
- Introduction à Deepgram Nova-3 : https://deepgram.com/learn/introducing-nova-3-speech-to-text-api
- Annonce des modèles vocaux OpenAI : https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Speechmatics Alternative for Non-Developers: Web Transcription Without Code
Speechmatics is genuinely excellent for developers: 50 hours free per month, 56 languages, on-prem deployment. If you need a drag-and-drop web app with flat $9.99/mo pricing instead of an API, here is an honest comparison of the two.

Best Transcription Tools with API Access (2026)
Which transcription SaaS tools actually give you API keys, and on which plan? Verified pricing and plan gates for Descript, Sonix, Fireflies, Happy Scribe, AssemblyAI, and more.