
Whisper ou Google Cloud Speech-to-Text en 2026, quelle API choisir ?
Summarize this article with:
Lequel devriez-vous utiliser en 2026, OpenAI Whisper ou Google Cloud Speech-to-Text ? Si vous avez besoin de streaming en temps réel ou de diarisation des locuteurs aujourd'hui, Google l'emporte. Si vous cherchez la transcription par lots la moins chère au tarif minute avec une large couverture linguistique, Whisper gagne. Et si votre charge de travail est un traitement par lots non urgent, le niveau Dynamic Batch de Google, à environ 0,004 $ par minute, sous-cote désormais l'API Whisper elle-même.

Le reste de ce guide explique pourquoi.
La version courte
Les deux services ont évolué de manière significative depuis les derniers articles de comparaison. L'API V2 de Google et le modèle Chirp 3 ont remplacé l'ancienne structure de niveaux Standard/Enhanced. OpenAI a ajouté gpt-4o-transcribe aux côtés du toujours disponible whisper-1. Et le niveau Dynamic Batch de Google a bouleversé la comparaison des coûts d'une manière que la plupart des développeurs n'ont pas encore remarquée.
Points clés à retenir :
- Google Standard avec Chirp 3 : 0,016 $/min, inclut le streaming, la diarisation et un débruiteur intégré. Le niveau « Enhanced » séparé n'existe plus.
- API Whisper (whisper-1) : 0,006 $/min, uniquement par lots, couverture de 99 langues, pas de diarisation native.
- Google Dynamic Batch : environ 0,004 $/min, résultats sous 24 heures, pas de streaming.
- gpt-4o-mini-transcribe : 0,003 $/min, l'option hébergée la moins chère d'OpenAI, avec des contraintes de lots similaires à whisper-1.
Si vous devez trancher rapidement : uniquement par lots, sensible au coût, multilingue ? Commencez par Whisper. Besoin de temps réel ou d'un service d'entreprise géré ? Google Cloud Speech-to-Text.
Deux philosophies différentes
Avant de comparer les prix, il est utile de comprendre ce qu'est réellement chaque service.
OpenAI Whisper est un modèle open source dont les poids sont disponibles publiquement sur GitHub. Quand les développeurs disent « Whisper », ils peuvent parler du modèle open source qui tourne sur leur propre GPU, de l'endpoint API hébergé whisper-1, ou bien des modèles plus récents d'OpenAI comme gpt-4o-transcribe. Le coût, le contrôle et la charge opérationnelle diffèrent selon ces trois options.
Google Cloud Speech-to-Text est un service cloud entièrement géré. Vous envoyez de l'audio, Google le traite, vous récupérez les résultats. Le modèle sous-jacent n'est pas téléchargeable. En échange, vous obtenez un service de qualité production : streaming en temps réel, diarisation des locuteurs, couverture de plus de 100 langues avec Chirp 3, et un débruiteur intégré pour les fichiers audio bruités. La documentation officielle couvre l'ensemble des fonctionnalités.
Cette différence de philosophie influence tout le reste. Whisper échange la commodité d'un service géré contre de la flexibilité et une maîtrise des coûts. Google échange le contrôle contre du poli et de l'exhaustivité.
Comparaison Côte à Côte
| Fonctionnalité | OpenAI Whisper (API whisper-1) | Google Cloud STT (V2 / Chirp 3) |
|---|---|---|
| Prix par minute (standard) | $0.006 | $0.016 |
| Prix géré le plus bas | $0.003 (gpt-4o-mini-transcribe) | ~$0.004 (Dynamic Batch, délai de 24h) |
| Offre gratuite | $5 de crédits pour les nouveaux comptes | 60 minutes/mois en continu |
| Streaming | Non (l'endpoint whisper-1 est batch uniquement) | Oui, en temps réel avec résultats intermédiaires |
| Langues | 99 | 100+ (Chirp 3 couvre 85+ en GA/aperçu) |
| Diarisation des locuteurs | Pas de support natif | Oui (modes batch/sync ; pas en streaming sous Chirp 3) |
| Gestion de l'audio bruité | Modérée | Forte (débruiteur intégré Chirp 3) |
| Vocabulaire personnalisé | Via texte d'invite uniquement | Oui, jusqu'à 1 000 indices de phrases |
| Auto-hébergement | Oui (poids du modèle open source) | Non |
| Idéal pour | Batch sensible aux coûts, auto-hébergement, multilingue | Applications de streaming, entreprise, audio bruité |
Analyse Approfondie des Tarifs
C'est là que la comparaison a le plus évolué en 2026, et il vaut la peine d'avoir les bons chiffres.
Options OpenAI
Le endpoint whisper-1 facture un tarif fixe de 0,006 $ par minute, à la seconde près. OpenAI propose désormais aussi :
- gpt-4o-transcribe : 0,006 $/min (même tarif, avec une précision annoncée supérieure à whisper-1)
- gpt-4o-mini-transcribe : 0,003 $/min (moitié prix, adapté aux traitements par lots à plus faible enjeu)
Ces trois options sont des endpoints exclusivement par lots. OpenAI dispose bien d'un produit de reconnaissance vocale en temps réel séparé, mais à environ 0,017 $/min, il cible les applications vocales en direct avec un positionnement tarifaire très différent.
Options Google V2
L'API V2 avec Chirp 3 a simplifié la grille tarifaire de Google :
- Standard (temps réel ou par lots) : 0,016 $/min, Chirp 3 inclus sans supplément
- Dynamic Batch : environ 0,004 $/min, résultats livrés sous 24 heures
- Modèles médicaux : 0,078 $/min (dictée et conversation, non applicables à un usage général)
- Offre gratuite : 60 minutes par mois en continu, plus 300 $ de crédits GCP pour les nouveaux comptes
Le niveau Dynamic Batch est environ 75 % moins cher que le tarif standard. Cela revient à environ 0,004 $/min, soit un prix inférieur aux 0,006 $/min de l'API Whisper. Pour les archives de podcasts, la transcription de médias et toute charge de travail où l'on peut attendre une nuit, c'est l'option managée la plus rentable proposée par l'un ou l'autre des fournisseurs.
Coût à l'échelle
Tarifs vérifiés : gpt-4o-mini-transcribe 0,003 $/min, Whisper-1 0,006 $/min, Google Dynamic Batch ~0,004 $/min, Google Standard 0,016 $/min. Dynamic Batch nécessite un délai de 24 h. Google Standard inclut Chirp 3.
| Volume mensuel | Whisper-1 | Google Standard | Google Dynamic Batch |
|---|---|---|---|
| 100 heures | 36 $ | 96 $ | ~24 $ |
| 1 000 heures | 360 $ | 960 $ | ~240 $ |
À 1 000 heures par mois, Dynamic Batch permet d'économiser environ 120 $ par rapport à Whisper et 720 $ par rapport à Google Standard. La contrepartie, c'est un délai de résultats de 24 heures, ce que la plupart des traitements par lots peuvent absorber.
Pour une vue plus large des tarifs pratiqués sur le marché de la transcription, le guide comparatif des prix de transcription présente plus de fournisseurs côte à côte.
L'option auto-hébergée, la variable d'ajustement
L'auto-hébergement de Whisper introduit une structure de coûts entièrement différente. Les poids du modèle sont gratuits. Le coût, c'est le calcul GPU.
Sur AWS, une instance g5.xlarge (1x A10G, 24 Go de VRAM) tourne autour de 1 $/heure à la demande. Whisper large-v3 sur un seul A10G peut transcrire à peu près 100 fois plus vite que le temps réel, ce qui signifie qu'une heure de GPU couvre environ 100 heures d'audio. En pleine utilisation, le coût effectif par minute audio tombe bien sous la barre des 0,002 $.
Ça semble alléchant, jusqu'à ce qu'on tienne compte des temps d'inactivité. Un GPU qui tourne à 50 % d'utilisation double votre coût effectif par minute. Ajoutez la charge DevOps pour le déploiement, la surveillance et la mise à l'échelle, et le point d'équilibre par rapport à l'API Whisper se situe autour de 500 heures par mois. En dessous de ce seuil, l'API est presque toujours moins chère une fois le temps d'ingénierie pris en compte.
L'auto-hébergement a clairement du sens dans deux cas de figure : un volume supérieur à 500 heures par mois, ou des exigences de souveraineté des données où l'audio ne peut pas quitter votre infrastructure.
Le coût caché des services de transcription détaille plus en profondeur les calculs d'utilisation GPU et de frais d'infrastructure.
Précision selon la langue et le type d'audio
Les deux services obtiennent d'excellents résultats sur de l'audio anglais propre. Les différences en 2026 sont plus subtiles.
Google Chirp 3 sur audio bruité. Le modèle Chirp 3 intègre un débruiteur natif qui gère mieux le bruit de fond, les pièces réverbérantes et l'audio téléphonique que l'ancienne architecture Standard/Enhanced. Pour les appels et les enregistrements de terrain, c'est une amélioration notable, et elle est incluse au tarif standard de 0,016 $/min, sans mise à niveau de palier.
Whisper sur contenu multilingue. Whisper a été entraîné sur environ 680 000 heures d'audio multilingue couvrant 99 langues. Pour les langues moins dotées en ressources, comme le gallois, le swahili, le malais et le catalan, Whisper surpasse souvent les alternatives, car son jeu de données a été délibérément conçu pour la largeur de couverture. Google Chirp 3 prend en charge plus de 100 langues, mais seulement 24 sont en disponibilité générale complète, les autres restant en aperçu. La couverture sur le papier et la précision en pratique divergent pour ces langues en aperçu.
Face-à-face en anglais. Pour l'audio de studio propre, les podcasts et les réunions bien enregistrées, les deux services affichent des performances comparables, avec une précision au-delà de 90 % sur le taux de mots. OpenAI affirme que gpt-4o-transcribe réduit le taux d'erreur de mots par rapport à whisper-1, notamment sur la parole avec accent et l'audio difficile. Ces affirmations concordent avec les benchmarks indépendants, même si la marge varie selon le domaine.
Mon avis : lancez un pilote spécifique à votre domaine avant de vous engager. La précision sur les dépositions juridiques diffère de celle sur les appels au support client, qui diffère elle-même de celle sur les présentations en conférence. Les benchmarks publiés sont un point de départ, pas une décision d'embauche.
Pour un regard plus approfondi sur ce que signifie réellement le taux d'erreur de mots en production, voir explication de la précision de transcription.
La question du streaming
Le point de terminaison API whisper-1 ne prend pas en charge le streaming. Vous téléversez un fichier audio complet, attendez que le traitement se termine, puis recevez la transcription intégrale en une seule réponse. C'est parfait pour du contenu préenregistré, mais rédhibitoire pour tout ce qui exige des résultats en direct.
Google Cloud Speech-to-Text offre un vrai streaming en temps réel via une connexion gRPC bidirectionnelle. Vous envoyez des morceaux audio au fur et à mesure qu'ils arrivent depuis un micro ou un flux en direct, et vous recevez des résultats provisoires en quelques millisecondes pendant que Google traite chaque segment. C'est donc le choix naturel pour le sous-titrage en direct, les assistants vocaux et la transcription de réunions en temps réel.
Une précision sur Chirp 3 et le streaming : si le modèle Chirp 3 prend bien en charge la méthode StreamingRecognize, la diarisation des locuteurs sous Chirp 3 n'est actuellement disponible qu'en modes de reconnaissance par lots et synchrone. Si vous avez besoin à la fois de streaming et de diarisation, vérifiez la documentation actuelle avant de construire votre pipeline.
Whisper auto-hébergé peut s'approcher du streaming avec des outils comme faster-whisper et des segments audio qui se chevauchent, mais Whisper a été conçu comme un modèle par lots de 30 secondes. On peut contourner le problème, mais vous n'égalerez pas la latence d'un service de streaming conçu pour ça.
Si le streaming est une exigence stricte, Google Cloud Speech-to-Text est le choix pragmatique.
Auto-héberger Whisper : le bilan honnête
L'auto-hébergement vous donne une confidentialité totale des données, aucun coût à la minute, aucune limite de débit, et la possibilité d'affiner le modèle sur vos données métier. Ces avantages sont réels.
Les coûts le sont aussi :
- Instances GPU à 0,75 à 1 $ de l'heure à la demande, souvent plus
- Temps d'ingénierie pour déployer, passer à l'échelle, surveiller et mettre à jour le modèle
- Pas de diarisation, de vocabulaire personnalisé ou de streaming prêt à l'emploi
L'auto-hébergement vaut le coup quand vous traitez plus de 500 heures d'audio par mois avec une utilisation constante, ou quand votre posture de conformité (HIPAA, interprétations strictes du RGPD, contrats de défense) exige que l'audio ne quitte jamais votre infrastructure.
En dessous de 500 heures par mois, l'API Whisper ou Google Dynamic Batch sera généralement moins cher une fois les heures d'ingénierie prises en compte. Pour la plupart des startups et des équipes de taille moyenne, l'API est le bon point de départ.
Matrice de décision
| Cas d'usage | Recommandation | Pourquoi |
|---|---|---|
| Sous-titrage en direct ou sous-titres temps réel | Google Cloud STT | Le streaming avec résultats provisoires est indispensable |
| Application à commande vocale | Google Cloud STT | Un streaming à faible latence est requis |
| Archivage de podcasts ou de vidéos par lots | Google Dynamic Batch | Moins cher que l'API Whisper si un délai de 24 h est acceptable |
| Transcription par lots à bas coût (résultats rapides) | gpt-4o-mini-transcribe | 0,003 $/min, résultats à la demande |
| Contenu multilingue (plus de 50 langues) | API Whisper | La plus large couverture d'entraînement multilingue |
| Appels téléphoniques, enregistrements de terrain bruyants | Google Cloud STT | Débruiteur intégré Chirp 3 |
| Souveraineté des données requise | Whisper auto-hébergé | L'audio ne quitte jamais votre infrastructure |
| Volume élevé (plus de 500 h/mois) | Whisper auto-hébergé | Les économies justifient la charge opérationnelle à grande échelle |
| Entreprise avec pile GCP | Google Cloud STT | Intégration native avec les services GCP |
| MVP ou prototype de startup | API Whisper ou gpt-4o-mini | Tarification simple, chemin le plus rapide vers un code fonctionnel |
Si vous avez juste besoin d'une transcription propre à partir d'un fichier audio ou vidéo sans créer d'intégration API, ConvertAudioToText gère le téléversement, la transcription et l'exportation sans aucune ligne de code.
Comment décider
Passez en revue ces quatre questions.
Avez-vous besoin de streaming en temps réel ? Si oui, Google Cloud STT. Le point de terminaison whisper-1 ne le permet pas, et les solutions de streaming Whisper auto-hébergées entraînent une charge d'ingénierie considérable.
Votre traitement par lots tolère-t-il un délai de 24 heures ? Si oui, Google Dynamic Batch à environ 0,004 $/min est désormais moins cher que l'API Whisper à 0,006 $/min. L'avantage de coût de l'acteur en place s'est inversé pour les lots non urgents.
Avez-vous besoin d'une couverture multilingue solide sur plus de 90 langues ? Si oui, Whisper. Sa largeur d'entraînement pour les langues moins dotées reste inégalée par les services gérés.
La confidentialité des données est-elle une exigence légale stricte ? Si oui, Whisper auto-hébergé est la voie la plus propre.
Si aucune de ces options ne donne de réponse claire, choisissez par défaut le fournisseur qui s'intègre le mieux à votre infrastructure existante. Google s'intègre naturellement dans les environnements GCP. Whisper convient aux piles Python où les bibliothèques Hugging Face sont déjà en place. Les deux feront le travail de transcription.
Pour une ventilation complète des tarifs à la minute sur toutes les principales API, y compris Deepgram et AWS Transcribe, le guide des tarifs des API de transcription vocale couvre l'ensemble du paysage.
Questions fréquentes
OpenAI Whisper est-il plus précis que Google Cloud Speech-to-Text ?
Pour un audio anglais propre, les deux sont proches. Google Chirp 3 a un léger avantage sur les enregistrements bruités grâce à son débruiteur intégré. Pour les langues moins dotées en ressources, Whisper tend à mieux performer, car son jeu d'entraînement couvre 99 langues avec des données multilingues approfondies. La réponse honnête est la suivante : lancez un test sur 50 échantillons de votre propre audio avant de vous engager, car les facteurs spécifiques à votre domaine comptent plus que les benchmarks publiés.
Puis-je utiliser Whisper pour la transcription de réunions en direct ?
Pas avec le point de terminaison API whisper-1, qui est réservé au traitement par lots avec une limite de fichier de 25 Mo. Il faudrait auto-héberger Whisper et construire un pipeline de streaming avec des outils comme faster-whisper, ce qui ajoute une complexité d'ingénierie. Google Cloud Speech-to-Text (modèle Chirp 3) prend en charge le streaming en temps réel avec des résultats provisoires et constitue le choix le plus pratique pour la transcription de réunions en direct. OpenAI propose désormais un point de terminaison vocal en temps réel distinct, mais il est facturé environ 0,017 $ par minute, ce qui change considérablement la donne sur le plan des coûts.
Est-il moins cher d'auto-héberger Whisper que d'utiliser Google Cloud Speech-to-Text ?
À volume élevé et avec une bonne utilisation du GPU, oui. Une instance GPU exécutant Whisper large-v3 peut atteindre des coûts effectifs bien en dessous de 0,002 $ par minute. Mais le niveau Dynamic Batch de Google, à environ 0,004 $ par minute avec une exigence de traitement sous 24 heures, sous-cote désormais l'API Whisper (0,006 $/min) pour les travaux par lots non sensibles au temps, sans aucune charge d'exploitation GPU. L'auto-hébergement ne devient clairement gagnant que lorsque vous dépassez environ 500 heures par mois et que vous avez la capacité d'ingénierie pour maintenir l'infrastructure.
Est-ce que Google Cloud Speech-to-Text prend en charge la diarisation des locuteurs ?
Oui. La diarisation des locuteurs est disponible dans l'API V1 et l'API V2 avec Chirp 3. Une réserve : avec Chirp 3, la diarisation fonctionne en mode batch et synchrone (Recognize) pour environ 15 langues prises en charge, mais n'est pas encore disponible en mode streaming. Whisper n'inclut pas du tout la diarisation nativement ; vous devriez exécuter un modèle séparé comme pyannote en plus de la sortie Whisper.
Puis-je passer de Whisper à Google Cloud Speech-to-Text plus tard ?
Oui, avec un certain travail d'intégration. Les deux acceptent des formats audio standard et renvoient du texte horodaté. Les formes d'API sont différentes, les formats de réponse diffèrent, et les fonctionnalités propres à un service (vocabulaire personnalisé de Google, mode de traduction de Whisper) nécessitent une adaptation. Si vous anticipez un changement, enveloppez vos appels de transcription derrière une fine couche d'abstraction dès le départ, afin qu'un changement de fournisseur ne touche qu'un seul fichier, pas tout votre code.
Sources
- Tarifs de Google Cloud Speech-to-Text
- Tarifs de l'API OpenAI
- Documentation de Chirp 3
- Page du modèle Whisper d'OpenAI
- Détail des tarifs de Google STT (costbench.com)
- Détail des tarifs de Whisper d'OpenAI (costbench.com)
- Analyse des coûts cachés de Google STT
- Fil de discussion sur la diarisation des locuteurs dans Google STT
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Google Cloud STT Pricing 2026: $0.003–$0.016/min
Google Cloud Speech-to-Text pricing 2026: V2 real-time is $0.016/min but Dynamic Batch drops to ~$0.003/min with 24-hr turnaround. Free 60 min/month ongoing. Chirp, V1 vs V2, and volume tier math.

OpenAI Whisper API Pricing 2026: $0.003–$0.006/min
OpenAI Whisper API pricing in 2026: whisper-1 is still $0.006/min but gpt-4o-mini-transcribe cuts that to $0.003/min. Real per-hour math, file limits (25MB/25-min), and how it stacks up against Deepgram Nova-3 and AssemblyAI.