Tarifs de l'API Whisper d'OpenAI à la minute en 2026
apitranscriptionpricingopenaiwhisper

Tarifs de l'API Whisper d'OpenAI à la minute en 2026

BMMamane B. MoussaFebruary 23, 202618 min read

Summarize this article with:

L'API Whisper d'OpenAI est devenue l'un des services de transcription les plus discutés depuis son lancement, en grande partie grâce à sa tarification limpide et à la réputation du modèle open source Whisper qui la sous-tend. Mais comprendre ce que vous payez réellement, ce que vous obtenez et ce à quoi vous renoncez par rapport aux autres options demande un examen plus approfondi que ce que proposent la plupart des résumés.

Ce guide couvre tout ce qu'il faut savoir sur les tarifs à la minute de l'API Whisper d'OpenAI en 2026 : les coûts réels, les limites de taille de fichier, l'économie de l'auto-hébergement et la position de Whisper face aux alternatives payantes de Google, AWS et Deepgram.

Les tarifs de l'API Whisper en un coup d'œil

OpenAI a fait le choix de la simplicité pour la tarification de l'API Whisper. Un seul prix, un seul modèle, et aucun système de paliers compliqué à déchiffrer.

DétailValeur
Prix par minute$0.006
Prix par heure$0.36
Incrément de facturationÀ la seconde (arrondi à la seconde la plus proche)
Offre gratuiteAucune
Remises sur volumeAucune
Facturation minimaleBasée sur la durée réelle de l'audio
ModèleWhisper v3 (large-v3)

Ce tarif fixe de $0.006 par minute s'applique quel que soit le volume d'audio traité. Que vous transcriviez dix minutes d'audio par mois ou dix mille heures, le coût à la minute reste identique. OpenAI ne propose ni remises sur volume, ni tarification avec engagement, ni offre gratuite pour l'API Whisper.

Pour donner un ordre de grandeur, une heure de transcription coûte $0.36. Dix heures coûtent $3.60. Cent heures coûtent $36. Le calcul est limpide, et c'est l'un des principaux arguments de vente de Whisper pour les équipes qui veulent une facturation prévisible, sans surprise.

Vous ne payez que pour la durée réelle de l'audio contenu dans votre fichier. Si vous soumettez un enregistrement de cinq minutes, vous payez cinq minutes, quel que soit le temps de traitement de l'API. Les silences présents dans le fichier comptent malgré tout dans la durée, puisque l'API traite l'intégralité du flux audio.

Consultez la page de tarification d'OpenAI pour les derniers tarifs officiels.

Ce que vous obtenez pour $0.006 par minute

À ce niveau de prix, l'API Whisper offre un service de transcription performant, adossé à l'un des modèles de reconnaissance vocale les plus réputés au monde.

Fonctionnalités incluses

Le modèle Whisper v3 (large-v3). L'API exécute le modèle Whisper le plus grand et le plus précis d'OpenAI. Vous n'avez pas à choisir entre plusieurs tailles de modèle ni à gérer différents niveaux de précision. Chaque requête utilise le même modèle.

Plus de 57 langues prises en charge. Whisper assure la transcription dans des dizaines de langues, de l'anglais à l'espagnol en passant par le hindi, l'arabe, le japonais et bien d'autres. La couverture linguistique est l'un des points forts majeurs de Whisper. La liste complète des langues prises en charge est disponible dans le dépôt GitHub de Whisper.

Détection automatique de la langue. Si vous ne précisez pas la langue, Whisper la détecte automatiquement à partir des 30 premières secondes d'audio. Cela fonctionne bien pour la plupart des enregistrements, même si indiquer la langue lorsque vous la connaissez améliore la précision.

Horodatage au niveau du mot. L'API peut renvoyer des horodatages pour chaque mot, ce qui est utile pour la génération de sous-titres, la recherche dans l'audio et la synchronisation des transcriptions avec la vidéo.

Traduction vers l'anglais. Au-delà de la transcription, Whisper propose un mode traduction qui transcrit directement un audio non anglophone en texte anglais en une seule étape, sans recourir à un service de traduction séparé.

Ce que vous n'obtenez PAS

Comprendre les limites de Whisper est tout aussi important que de connaître ses fonctionnalités, surtout au moment de le comparer aux alternatives payantes.

Pas de transcription en streaming ni en temps réel. L'API Whisper fonctionne uniquement en mode batch. Vous téléversez un fichier audio complet et recevez la transcription intégrale une fois le traitement terminé. Il n'y a ni endpoint WebSocket, ni résultats partiels, ni capacité de sous-titrage en direct. Si vous avez besoin de transcription en temps réel pour des réunions ou des diffusions en direct, Whisper n'est pas le bon outil.

Pas de diarisation native des locuteurs. Whisper n'identifie ni n'étiquette les différents intervenants d'une conversation. La transcription arrive sous la forme d'un flux de texte unique, sans aucune indication de qui a dit quoi. Vous pouvez ajouter une diarisation tierce par-dessus, mais cela ajoute de la complexité et des coûts.

Pas de vocabulaire personnalisé ni de renforcement de mots-clés. Si votre audio contient une terminologie spécialisée, des noms de marque ou des mots rares, vous ne pouvez pas fournir de dictionnaire personnalisé pour améliorer la précision. Whisper transcrit uniquement à partir de ses données d'entraînement.

Pas d'analyse de sentiment ni de détection de sujets. L'API renvoie du texte et des horodatages. Elle n'analyse pas la tonalité émotionnelle, n'identifie pas les sujets abordés et ne fournit aucune analyse sémantique du contenu.

Pas de contrôle automatique de la ponctuation. Whisper ajoute la ponctuation automatiquement, mais vous avez peu de contrôle sur sa façon de ponctuer. Pour certaines langues, la précision de la ponctuation peut être irrégulière.

Réseau de neurones IA traitant des données audio
Réseau de neurones IA traitant des données audio

La limite de taille de fichier de 25MB

L'une des frustrations les plus fréquentes avec l'API Whisper est sa limite de 25MB par requête. Pour des enregistrements courts ou de l'audio compressé, c'est rarement un problème. Mais pour des fichiers plus longs, en particulier des fichiers vidéo ou des enregistrements à haut débit, vous atteindrez vite ce plafond.

Une limite de 25MB correspond approximativement à :

FormatDurée approximative à 25MB
MP3 à 128kbps~26 minutes
MP3 à 64kbps~52 minutes
WAV (16 bits, 16kHz mono)~13 minutes
M4A à 128kbps~26 minutes
Vidéo MP43-10 minutes (très variable)

Si vos enregistrements dépassent ces durées, il vous faut une stratégie de contournement.

Stratégie 1 : compresser avant l'envoi

L'approche la plus simple consiste à convertir votre audio dans un format compressé avant de l'envoyer à l'API. Convertir un fichier WAV en MP3 à 64kbps peut réduire la taille du fichier de 90% ou plus, tout en conservant une précision de transcription quasiment identique à l'original. Des outils comme FFmpeg réalisent cette conversion efficacement. Pour des contenus uniquement vocaux, le MP3 à 64kbps préserve toutes les informations fréquentielles dont Whisper a besoin.

Stratégie 2 : découper les fichiers longs en segments

Pour les enregistrements qui dépassent 25MB même après compression, découper le fichier en segments plus petits est l'approche standard. Le point essentiel ici est de choisir soigneusement les points de découpe. Couper au milieu d'une phrase amènera l'API à renvoyer des phrases incomplètes aux frontières des segments, et il faudra recoller les résultats intelligemment. Couper aux moments de silence naturels produit des résultats plus propres.

La plupart des bibliothèques de traitement audio savent détecter les silences dans les enregistrements et les utiliser comme points de découpe. Visez des segments entre 20 et 24MB pour garder une petite marge sous la limite.

Stratégie 3 : extraire l'audio de la vidéo

Si vous travaillez avec des fichiers vidéo, extrayez d'abord la piste audio plutôt que de téléverser la vidéo complète. Une vidéo MP4 d'une heure peut peser 500MB, alors que la seule piste audio en MP3 peut tenir sous les 30MB. Cette étape d'extraction est rapide et évite d'envoyer des données vidéo que l'API ignore de toute façon.

Stratégie 4 : utiliser un service qui s'en charge à votre place

Des plateformes comme ConvertAudioToText gèrent automatiquement le prétraitement des fichiers. Vous téléversez des fichiers de n'importe quelle taille, et la plateforme s'occupe de la compression, du découpage et du réassemblage en coulisses. Cela vous épargne le travail d'ingénierie nécessaire pour bâtir votre propre pipeline de prétraitement.

Auto-héberger Whisper : gratuit, mais pas vraiment

Puisque Whisper est open source, vous pouvez l'exécuter sur votre propre infrastructure sans rien payer à OpenAI. Les poids du modèle sont librement disponibles et le code est bien documenté. D'où une question évidente : pourquoi payer $0.006 par minute quand on peut le faire tourner gratuitement ?

La réponse tient aux coûts GPU, au temps d'ingénierie et à l'échelle.

Coûts GPU de l'auto-hébergement

Le modèle large-v3 de Whisper exige un GPU performant pour tourner à des vitesses raisonnables. Voici ce que coûtent les options les plus courantes chez les principaux fournisseurs cloud :

GPUCoût cloud (par heure)Vitesse de traitement WhisperCoût par heure d'audio
NVIDIA A100 (80GB)~$1.50 - $3.00~6-10x temps réel$0.15 - $0.50
NVIDIA A10G~$0.75 - $1.20~3-5x temps réel$0.15 - $0.40
NVIDIA T4~$0.35 - $0.50~1-2x temps réel$0.18 - $0.50
NVIDIA L4~$0.50 - $0.80~3-4x temps réel$0.13 - $0.27

La vitesse de traitement compte, car elle détermine combien d'heures d'audio vous pouvez transcrire par heure de GPU. Un A100 peut traiter un enregistrement d'une heure en six à dix minutes environ, ce qui signifie que vous pouvez transcrire à peu près six à dix heures d'audio par heure de GPU. Un T4 traite à une vitesse proche du temps réel, donc une heure de GPU produit environ une à deux heures d'audio transcrit.

Les coûts cachés

La location brute de GPU n'est qu'une partie de l'équation. Auto-héberger Whisper exige aussi :

La gestion de l'infrastructure. Il faut provisionner des serveurs, gérer la montée en charge, prévoir le basculement en cas de panne et maintenir la disponibilité. Ce n'est pas un déploiement que l'on configure une fois pour l'oublier ensuite.

La gestion des files d'attente et des tâches. Traiter de l'audio à grande échelle nécessite une file de tâches, une gestion des workers, une logique de reprise et un suivi des statuts. Vous construisez en somme l'infrastructure backend que les API managées fournissent clé en main.

Les mises à jour du modèle. Quand OpenAI publie des poids de modèle améliorés, vous devez mettre à jour votre déploiement. Tester, valider et déployer ces mises à jour prend du temps d'ingénierie.

La supervision et le débogage. Les charges de travail GPU échouent d'une manière différente des services web classiques. Erreurs de mémoire insuffisante, problèmes de pilotes et conflits de versions CUDA sont des migraines courantes.

Le stockage et le réseau. Acheminer les fichiers audio vers vos serveurs GPU et stocker les résultats engendre des coûts de bande passante et de stockage faciles à négliger.

Quand l'auto-hébergement devient rentable

L'auto-hébergement commence à avoir un sens financier lorsque vous traitez de gros volumes réguliers. Le seuil de rentabilité dépend de vos choix d'infrastructure, mais à titre indicatif :

Volume mensuelCoût API (à $0.006/min)Estimation auto-hébergementMeilleure option
Moins de 100 heures$36$150 - $400+API
100 - 500 heures$36 - $180$200 - $600API (en général)
500 - 2,000 heures$180 - $720$300 - $800Auto-hébergement (selon les cas)
Plus de 2,000 heures$720+$400 - $1,200Auto-hébergement

Ces estimations supposent que vous disposez de ressources d'ingénierie pour construire et maintenir l'infrastructure. Si vous devez recruter ou détourner des ingénieurs pour gérer un déploiement Whisper auto-hébergé, le seuil de rentabilité grimpe nettement.

Avantages et inconvénients de l'auto-hébergement

AvantagesInconvénients
Aucune facturation à la minuteEffort d'ingénierie initial conséquent
Contrôle total sur le modèle et le pipelineLes coûts GPU s'accumulent vite à faible volume
Les données restent sur votre infrastructureVous gérez la montée en charge, la supervision et les mises à jour
Prétraitement et post-traitement personnalisablesAucun SLA ni support de la part d'OpenAI
Aucune limite de taille de fichierExige une expertise GPU dans votre équipe

Whisper face aux alternatives payantes

Le prix à la minute est l'indicateur le plus visible, mais il ne raconte qu'une partie de l'histoire. Ce qui compte, c'est le coût total pour atteindre la qualité de transcription et les fonctionnalités qu'exige votre flux de travail.

Tableau comparatif des tarifs

ServicePrix par minuteDiarisation des locuteursStreamingLanguesVocabulaire personnalisé
OpenAI Whisper API$0.006NonNon57+Non
Deepgram (Nova-2)$0.0043OuiOui36+Oui
Google Cloud STT$0.016OuiOui125+Oui (expressions)
AWS Transcribe$0.024OuiOui37+Oui
Azure Speech$0.016OuiOui100+Oui
AssemblyAI$0.0065OuiOui20+Non

Ce que révèle le tableau

Whisper est bon marché, mais pas le moins cher. Le modèle Nova-2 de Deepgram passe sous Whisper à $0.0043 par minute, tout en incluant la diarisation des locuteurs, le streaming, le vocabulaire personnalisé et des fonctionnalités comme l'analyse de sentiment et la détection de sujets. Pour les applications qui ont besoin de plus qu'une transcription brute, Deepgram offre souvent un meilleur rapport qualité-prix, bien qu'il s'agisse d'un service payant. Vous pouvez en savoir plus sur la façon dont ces services se comparent dans notre comparatif des tarifs des API de speech-to-text.

Les services enterprise facturent plus cher, mais en donnent plus. Google Cloud Speech-to-Text et AWS Transcribe coûtent deux à quatre fois plus que Whisper, mais ils incluent la prise en charge du streaming, la diarisation des locuteurs, le vocabulaire personnalisé et des SLA de niveau enterprise. Pour des applications de production où chaque interruption coûte de l'argent, ces extras ont leur importance.

Les fonctionnalités manquantes ont des coûts cachés. Si vous avez besoin de diarisation avec Whisper, il faudra ajouter un service ou une bibliothèque de diarisation tiers, ce qui ajoute de la complexité, de la latence et potentiellement des coûts supplémentaires. Les « économies » liées au tarif à la minute plus bas de Whisper peuvent s'évaporer une fois pris en compte les intégrations nécessaires pour égaler ce que d'autres services incluent nativement.

Pour une comparaison détaillée entre Whisper et l'offre de Google, consultez notre analyse Whisper vs Google Cloud Speech.

Communication multilingue mondiale et traduction
Communication multilingue mondiale et traduction

Quand Whisper est le bon choix

Malgré ses limites, il existe des scénarios où l'API Whisper est sincèrement la meilleure option.

Transcription multilingue par lots

Si vous transcrivez régulièrement de l'audio dans de nombreuses langues différentes et n'avez pas besoin de résultats en temps réel, la combinaison d'une large couverture linguistique et d'un coût bas rend Whisper difficile à battre. Une entreprise de médias qui transcrit des interviews en français, en japonais et en portugais peut s'appuyer sur une seule API avec une tarification homogène pour toutes les langues. La plupart des concurrents facturent davantage pour les langues autres que l'anglais, ou en prennent moins en charge.

Petits projets à budget serré

Pour les startups, les chercheurs et les développeurs indépendants qui traitent des volumes modestes d'audio, le tarif de $0.006 par minute de Whisper maintient les coûts au plus bas. Transcrire dix heures d'audio coûte $3.60, sans aucune infrastructure à gérer. Il n'y a aucun engagement minimum, aucun abonnement et aucun coût initial au-delà de vos crédits d'API OpenAI.

Préférence pour l'open source et maîtrise des données

Les organisations qui privilégient les technologies open source peuvent utiliser l'API Whisper comme point d'entrée pratique, puis migrer plus tard vers un Whisper auto-hébergé si les volumes augmentent. Le modèle étant identique, les résultats de transcription resteront cohérents entre les deux modes de déploiement. C'est une flexibilité que les services propriétaires ne peuvent pas offrir. Pour les développeurs qui explorent les options de transcription gratuites, la disponibilité de Whisper en open source est un avantage significatif.

Transcription simple, sans extras

Si votre cas d'usage est simple, téléverser un fichier et obtenir une transcription, Whisper offre exactement cela sans vous faire payer des fonctionnalités dont vous n'avez pas besoin. Vous ne subventionnez ni un moteur de diarisation, ni une infrastructure de streaming, ni un système de vocabulaire personnalisé que vous n'utiliserez jamais.

Prototypage et développement

Whisper est un excellent choix pour construire et tester des fonctionnalités de transcription avant de s'engager sur un service plus riche en fonctionnalités (et plus cher). L'API simple, la tarification prévisible et le guide d'intégration bien documenté permettent de monter rapidement un prototype fonctionnel.

Estimer vos coûts mensuels

Pour vous aider à budgétiser, voici quelques cas d'usage courants avec une estimation des coûts mensuels via l'API Whisper.

Cas d'usageVolume mensuelCoût mensuel
Journaliste indépendant transcrivant des interviews10 heures$3.60
Petite équipe de podcast transcrivant ses épisodes20 heures$7.20
Équipe de recherche traitant des groupes de discussion50 heures$18.00
Agence de contenu transcrivant les médias de ses clients200 heures$72.00
Entreprise traitant des enregistrements d'appels1,000 heures$360.00
Numérisation d'archives médias à grande échelle5,000 heures$1,800.00

Ces coûts ne couvrent que l'utilisation de l'API Whisper. Si vous avez besoin de traitements supplémentaires comme la diarisation, la mise en forme ou la génération de sous-titres, intégrez le coût de ces services additionnels ou envisagez une plateforme comme ConvertAudioToText qui regroupe ces fonctionnalités.

Foire aux questions

Existe-t-il une offre gratuite pour l'API Whisper d'OpenAI ?

Non. OpenAI ne propose pas d'offre gratuite pour l'API Whisper. Chaque minute d'audio traitée est facturée $0.006. Les nouveaux comptes OpenAI reçoivent parfois un petit montant de crédits d'API gratuits utilisables avec Whisper, mais il s'agit d'un crédit de bienvenue ponctuel, pas d'une offre gratuite permanente. Si vous avez besoin de transcription gratuite, le modèle open source Whisper peut être auto-hébergé sans coût logiciel, mais vous devrez fournir votre propre infrastructure GPU.

Comment les tarifs de l'API Whisper se comparent-ils à l'embauche de transcripteurs humains ?

Les services de transcription humaine facturent généralement entre $1.00 et $3.00 par minute d'audio pour un délai standard, avec des tarifs plus élevés en urgence. À $0.006 par minute, l'API Whisper est environ 150 à 500 fois moins chère que la transcription humaine. Cependant, les transcripteurs humains offrent encore une meilleure précision sur les audios difficiles : enregistrements avec accents marqués, locuteurs qui se chevauchent ou bruit de fond important. Pour un audio propre avec un seul locuteur, la précision de Whisper rivalise avec la transcription humaine pour une fraction du coût.

Puis-je utiliser Whisper pour transcrire en temps réel des réunions en direct ?

Non. L'API Whisper ne prend en charge que le traitement par lots. Vous devez téléverser un fichier audio complet et attendre le retour de la transcription intégrale. Il n'y a pas d'endpoint de streaming, pas de prise en charge WebSocket, et aucun moyen de recevoir des résultats partiels pendant l'enregistrement de l'audio. Pour la transcription de réunions en temps réel, vous aurez besoin d'un service qui prend en charge le streaming, comme Deepgram, Google Cloud Speech-to-Text ou AssemblyAI.

OpenAI propose-t-il des remises sur volume pour les gros utilisateurs de l'API Whisper ?

Début 2026, OpenAI ne propose pas de remises sur volume publiquement affichées pour l'API Whisper. Le tarif de $0.006 par minute reste le même que vous traitiez une heure ou dix mille heures par mois. Les clients enterprise avec de très gros volumes peuvent éventuellement négocier une tarification sur mesure en contactant directement l'équipe commerciale d'OpenAI, mais il n'existe aucune structure de remise en libre-service.

Que se passe-t-il si mon fichier audio dépasse la limite de 25MB ?

L'API rejettera la requête avec une erreur. Vous devez réduire la taille du fichier avant l'envoi. Les approches les plus efficaces consistent à compresser l'audio en MP3 à plus faible débit, à extraire l'audio des fichiers vidéo pour éliminer les données vidéo, ou à découper les enregistrements longs en segments plus petits. La plupart des implémentations en production automatisent cette étape de prétraitement afin que les utilisateurs finaux ne rencontrent jamais directement cette limite.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles