OpenAI Whisper API: Preise pro Minute im Jahr 2026
apitranscriptionpricingopenaiwhisper

OpenAI Whisper API: Preise pro Minute im Jahr 2026

BMMamane B. MoussaFebruary 23, 202615 min read

Summarize this article with:

Die Whisper API von OpenAI hat sich seit ihrem Start zu einem der meistdiskutierten Transkriptionsdienste entwickelt – vor allem wegen ihrer unkomplizierten Preisgestaltung und des Rufs des dahinterstehenden Open-Source-Modells Whisper. Doch um zu verstehen, was Sie tatsächlich bezahlen, was Sie dafür bekommen und worauf Sie im Vergleich zu anderen Optionen verzichten, lohnt sich ein genauerer Blick, als ihn die meisten Zusammenfassungen bieten.

Dieser Leitfaden behandelt alles, was Sie über die Preise der OpenAI Whisper API pro Minute im Jahr 2026 wissen müssen – einschließlich der tatsächlichen Kosten, der Dateigrößenbeschränkungen, der Wirtschaftlichkeit von Self-Hosting und der Frage, wie sich Whisper gegenüber kostenpflichtigen Alternativen von Google, AWS und Deepgram schlägt.

Whisper API: Die Preise auf einen Blick

OpenAI hält die Preisgestaltung der Whisper API einfach. Es gibt einen Preis, ein Modell und kein kompliziertes Tarifsystem, durch das man sich kämpfen muss.

DetailWert
Preis pro Minute$0.006
Preis pro Stunde$0.36
AbrechnungstaktPro Sekunde (auf die nächste Sekunde gerundet)
Kostenloses KontingentKeines
MengenrabatteKeine
MindestgebührBasierend auf der tatsächlichen Audiodauer
ModellWhisper v3 (large-v3)

Dieser Pauschalpreis von $0.006 pro Minute gilt unabhängig davon, wie viel Audio Sie verarbeiten. Ob Sie zehn Minuten Audio pro Monat oder zehntausend Stunden transkribieren – die Kosten pro Minute bleiben gleich. OpenAI bietet für die Whisper API weder Mengenrabatte noch Preise für feste Abnahmemengen oder ein kostenloses Kontingent an.

Zur Einordnung: Eine Stunde Transkription kostet $0.36. Zehn Stunden kosten $3.60. Einhundert Stunden kosten $36. Die Rechnung ist denkbar einfach – einer der größten Pluspunkte von Whisper für Teams, die eine vorhersehbare Abrechnung ohne Überraschungen wollen.

Sie zahlen nur für die tatsächliche Audiodauer Ihrer Datei. Wenn Sie eine fünfminütige Aufnahme einreichen, zahlen Sie für fünf Minuten – egal, wie lange die API für die Verarbeitung braucht. Stille innerhalb der Datei zählt allerdings zur Dauer dazu, da die API den gesamten Audiostream verarbeitet.

Die aktuellen offiziellen Preise finden Sie auf der Preisseite von OpenAI.

Was Sie für $0.006 pro Minute bekommen

Zu diesem Preis liefert die Whisper API einen leistungsfähigen Transkriptionsdienst, der auf einem der bekanntesten Spracherkennungsmodelle der Welt basiert.

Enthaltene Funktionen

Whisper v3 (large-v3) Modell. Die API nutzt das größte und genaueste Whisper-Modell von OpenAI. Sie müssen nicht zwischen Modellgrößen wählen oder verschiedene Genauigkeitsstufen verwalten. Jede Anfrage verwendet dasselbe Modell.

Unterstützung für 57+ Sprachen. Whisper transkribiert in Dutzenden von Sprachen – von Englisch und Spanisch über Hindi und Arabisch bis hin zu Japanisch und vielen weiteren. Die Sprachunterstützung ist eine der größten Stärken von Whisper. Die vollständige Liste der unterstützten Sprachen finden Sie im Whisper GitHub-Repository.

Automatische Spracherkennung. Wenn Sie die Sprache nicht angeben, erkennt Whisper sie automatisch anhand der ersten 30 Sekunden des Audios. Das funktioniert bei den meisten Aufnahmen gut – wer die Sprache kennt und angibt, verbessert allerdings die Genauigkeit.

Zeitstempel auf Wortebene. Die API kann Zeitstempel für einzelne Wörter zurückgeben – nützlich für die Untertitelerstellung, die Audiosuche und das Abgleichen von Transkripten mit Video.

Übersetzung ins Englische. Über die Transkription hinaus bietet Whisper einen Übersetzungsmodus, der nicht-englisches Audio in einem einzigen Schritt direkt in englischen Text transkribiert – ohne dass ein separater Übersetzungsdienst nötig ist.

Was Sie NICHT bekommen

Die Grenzen von Whisper zu kennen ist genauso wichtig wie seine Funktionen – besonders beim Vergleich mit kostenpflichtigen Alternativen.

Kein Streaming und keine Echtzeit-Transkription. Die Whisper API arbeitet ausschließlich im Batch-Modus. Sie laden eine vollständige Audiodatei hoch und erhalten das komplette Transkript, sobald die Verarbeitung abgeschlossen ist. Es gibt keinen WebSocket-Endpunkt, keine Teilergebnisse und keine Live-Untertitelung. Wenn Sie Echtzeit-Transkription für Meetings oder Live-Übertragungen benötigen, ist Whisper nicht das richtige Werkzeug.

Keine native Sprechererkennung (Diarization). Whisper identifiziert oder kennzeichnet keine unterschiedlichen Sprecher in einem Gespräch. Das Transkript kommt als ein einziger Textstrom ohne jeden Hinweis darauf, wer was gesagt hat. Sie können eine Diarization-Lösung von Drittanbietern darüberlegen, was jedoch zusätzliche Komplexität und Kosten verursacht.

Kein eigenes Vokabular und kein Keyword-Boosting. Wenn Ihr Audio Fachterminologie, Markennamen oder ungewöhnliche Wörter enthält, können Sie kein eigenes Wörterbuch bereitstellen, um die Genauigkeit zu verbessern. Whisper transkribiert ausschließlich auf Basis seiner Trainingsdaten.

Keine Sentiment-Analyse und keine Themenerkennung. Die API liefert Text und Zeitstempel. Sie analysiert weder die emotionale Tonlage, noch identifiziert sie Gesprächsthemen oder liefert irgendeine semantische Analyse des Inhalts.

Keine Kontrolle über die automatische Zeichensetzung. Whisper setzt Satzzeichen automatisch, aber Sie haben nur begrenzten Einfluss darauf, wie. Bei manchen Sprachen kann die Genauigkeit der Zeichensetzung schwanken.

KI-neuronales Netzwerk verarbeitet Audiodaten
KI-neuronales Netzwerk verarbeitet Audiodaten

Das 25MB-Dateigrößenlimit

Einer der häufigsten Frustpunkte bei der Whisper API ist das Dateigrößenlimit von 25MB pro Anfrage. Bei kurzen Aufnahmen oder komprimiertem Audio ist das selten ein Problem. Bei längeren Dateien jedoch – insbesondere Videodateien oder Aufnahmen mit hoher Bitrate – stoßen Sie schnell an diese Grenze.

Ein 25MB-Limit entspricht ungefähr:

FormatUngefähre Dauer bei 25MB
MP3 mit 128kbps~26 Minuten
MP3 mit 64kbps~52 Minuten
WAV (16-Bit, 16kHz Mono)~13 Minuten
M4A mit 128kbps~26 Minuten
MP4-Video3-10 Minuten (stark schwankend)

Wenn Ihre Aufnahmen diese Längen überschreiten, brauchen Sie eine Umgehungsstrategie.

Strategie 1: Vor dem Hochladen komprimieren

Der einfachste Ansatz ist, das Audio vor dem Senden an die API in ein komprimiertes Format umzuwandeln. Die Konvertierung einer WAV-Datei in MP3 mit 64kbps kann die Dateigröße um 90% oder mehr reduzieren, während die Transkriptionsgenauigkeit praktisch identisch zum Original bleibt. Tools wie FFmpeg erledigen diese Konvertierung effizient. Bei reinen Sprachinhalten bewahrt 64kbps-MP3 alle Frequenzinformationen, die Whisper benötigt.

Strategie 2: Lange Dateien in Abschnitte aufteilen

Bei Aufnahmen, die selbst nach der Komprimierung 25MB überschreiten, ist das Aufteilen der Datei in kleinere Segmente der Standardansatz. Entscheidend ist dabei, die Schnittpunkte sorgfältig zu wählen. Wird mitten im Satz geschnitten, liefert die API an den Abschnittsgrenzen unvollständige Sätze, und Sie müssen die Ergebnisse intelligent wieder zusammenfügen. Schnitte an natürlichen Stillephasen liefern sauberere Ergebnisse.

Die meisten Audioverarbeitungsbibliotheken können Stillephasen in Aufnahmen erkennen und als Schnittpunkte nutzen. Streben Sie Abschnitte zwischen 20 und 24MB an, um einen kleinen Puffer unterhalb des Limits zu lassen.

Strategie 3: Audio aus Video extrahieren

Wenn Sie mit Videodateien arbeiten, extrahieren Sie zuerst die Tonspur, anstatt das gesamte Video hochzuladen. Ein einstündiges MP4-Video kann 500MB groß sein, während die Tonspur allein als MP3 unter 30MB liegt. Dieser Extraktionsschritt geht schnell und vermeidet das Senden von Videodaten, die die API ohnehin ignoriert.

Strategie 4: Einen Dienst nutzen, der das für Sie übernimmt

Plattformen wie ConvertAudioToText übernehmen die Dateivorverarbeitung automatisch. Sie laden Dateien beliebiger Größe hoch, und die Plattform kümmert sich im Hintergrund um Komprimierung, Aufteilung und Zusammenführung. Das erspart den Entwicklungsaufwand für eine eigene Vorverarbeitungs-Pipeline.

Whisper selbst hosten: Kostenlos, aber nicht umsonst

Da Whisper Open Source ist, können Sie es auf Ihrer eigenen Infrastruktur betreiben, ohne OpenAI etwas zu zahlen. Die Modellgewichte sind frei verfügbar, und der Code ist gut dokumentiert. Das wirft eine naheliegende Frage auf: Warum $0.006 pro Minute zahlen, wenn man es kostenlos betreiben kann?

Die Antwort liegt in den GPU-Kosten, dem Entwicklungsaufwand und der Skalierung.

GPU-Kosten beim Self-Hosting

Das large-v3-Modell von Whisper benötigt eine leistungsfähige GPU, um in angemessener Geschwindigkeit zu laufen. Hier ein Überblick, was die gängigsten Optionen bei den großen Cloud-Anbietern kosten:

GPUCloud-Kosten (pro Stunde)Whisper-VerarbeitungsgeschwindigkeitKosten pro Audiostunde
NVIDIA A100 (80GB)~$1.50 - $3.00~6-10x Echtzeit$0.15 - $0.50
NVIDIA A10G~$0.75 - $1.20~3-5x Echtzeit$0.15 - $0.40
NVIDIA T4~$0.35 - $0.50~1-2x Echtzeit$0.18 - $0.50
NVIDIA L4~$0.50 - $0.80~3-4x Echtzeit$0.13 - $0.27

Die Verarbeitungsgeschwindigkeit ist wichtig, weil sie bestimmt, wie viele Audiostunden Sie pro GPU-Stunde transkribieren können. Eine A100 verarbeitet eine einstündige Aufnahme in etwa sechs bis zehn Minuten – Sie können also pro GPU-Stunde grob sechs bis zehn Stunden Audio transkribieren. Eine T4 arbeitet näher an Echtzeit, sodass eine GPU-Stunde nur etwa ein bis zwei Stunden transkribiertes Audio liefert.

Die versteckten Kosten

Die reine GPU-Miete ist nur ein Teil der Rechnung. Whisper selbst zu hosten erfordert außerdem:

Infrastrukturverwaltung. Sie müssen Server bereitstellen, die Skalierung verwalten, Ausfallsicherheit gewährleisten und die Verfügbarkeit aufrechterhalten. Das ist kein Deployment, das man einmal aufsetzt und vergisst.

Queue- und Job-Verwaltung. Audio in großem Umfang zu verarbeiten erfordert eine Job-Queue, Worker-Verwaltung, Retry-Logik und Statusverfolgung. Sie bauen im Grunde die Backend-Infrastruktur nach, die Managed APIs von Haus aus mitbringen.

Modell-Updates. Wenn OpenAI verbesserte Modellgewichte veröffentlicht, müssen Sie Ihr Deployment aktualisieren. Das Testen, Validieren und Ausrollen von Modell-Updates kostet Entwicklungszeit.

Monitoring und Debugging. GPU-Workloads scheitern auf andere Weise als typische Webdienste. Out-of-Memory-Fehler, Treiberprobleme und CUDA-Versionskonflikte gehören zu den häufigsten Kopfschmerzen.

Speicher und Netzwerk. Audiodateien auf Ihre GPU-Server zu übertragen und Ergebnisse zu speichern verursacht Bandbreiten- und Speicherkosten, die leicht übersehen werden.

Wann sich Self-Hosting finanziell lohnt

Self-Hosting beginnt sich zu rechnen, wenn Sie große, konstante Volumen verarbeiten. Der Break-even-Punkt hängt von Ihren Infrastrukturentscheidungen ab, aber als grobe Orientierung:

Monatliches VolumenAPI-Kosten (bei $0.006/Min)Self-Hosting-SchätzungBessere Option
Unter 100 Stunden$36$150 - $400+API
100 - 500 Stunden$36 - $180$200 - $600API (meistens)
500 - 2,000 Stunden$180 - $720$300 - $800Self-Hosting (kommt darauf an)
Über 2,000 Stunden$720+$400 - $1,200Self-Hosting

Diese Schätzungen setzen voraus, dass Sie Entwicklungsressourcen haben, um die Infrastruktur aufzubauen und zu warten. Wenn Sie Entwickler einstellen oder abziehen müssen, um ein selbst gehostetes Whisper-Deployment zu betreuen, verschiebt sich der Break-even-Punkt deutlich nach oben.

Self-Hosting: Vor- und Nachteile

VorteileNachteile
Keine Gebühren pro MinuteErheblicher anfänglicher Entwicklungsaufwand
Volle Kontrolle über Modell und PipelineGPU-Kosten summieren sich bei geringen Volumen schnell
Daten bleiben auf Ihrer InfrastrukturSkalierung, Monitoring und Updates liegen bei Ihnen
Vor- und Nachverarbeitung anpassbarKein SLA und kein Support von OpenAI
Keine DateigrößenlimitsErfordert GPU-Expertise im Team

Whisper vs. kostenpflichtige Alternativen

Der Preis pro Minute ist die sichtbarste Kennzahl, erzählt aber nur die halbe Geschichte. Entscheidend sind die Gesamtkosten, um die Transkriptionsqualität und die Funktionen zu erreichen, die Ihr Workflow erfordert.

Preisvergleichstabelle

DienstPreis pro MinuteSprechererkennungStreamingSprachenEigenes Vokabular
OpenAI Whisper API$0.006NeinNein57+Nein
Deepgram (Nova-2)$0.0043JaJa36+Ja
Google Cloud STT$0.016JaJa125+Ja (Phrasen)
AWS Transcribe$0.024JaJa37+Ja
Azure Speech$0.016JaJa100+Ja
AssemblyAI$0.0065JaJa20+Nein

Was die Tabelle zeigt

Whisper ist günstig, aber nicht am günstigsten. Deepgrams Nova-2-Modell unterbietet Whisper mit $0.0043 pro Minute und bietet zugleich Sprechererkennung, Streaming, eigenes Vokabular sowie Funktionen wie Sentiment-Analyse und Themenerkennung. Für Anwendungen, die mehr als reine Transkription benötigen, liefert Deepgram oft das bessere Preis-Leistungs-Verhältnis – obwohl es ein kostenpflichtiger Dienst ist. Mehr darüber, wie sich diese Dienste vergleichen, lesen Sie in unserem Preisvergleich der Speech-to-Text-APIs.

Enterprise-Dienste kosten mehr, liefern aber auch mehr. Google Cloud Speech-to-Text und AWS Transcribe kosten zwei- bis viermal so viel wie Whisper, beinhalten dafür aber Streaming-Unterstützung, Sprechererkennung, eigenes Vokabular und SLAs auf Enterprise-Niveau. Für Produktivanwendungen, bei denen Ausfallzeiten echtes Geld kosten, zählen diese Extras.

Fehlende Funktionen haben versteckte Kosten. Wenn Sie mit Whisper Sprechererkennung benötigen, müssen Sie einen Diarization-Dienst oder eine Bibliothek von Drittanbietern hinzufügen – was Komplexität, Latenz und möglicherweise zusätzliche Kosten bedeutet. Die „Ersparnis" durch Whispers niedrigeren Minutenpreis kann sich in Luft auflösen, wenn man die Integrationen einrechnet, die nötig sind, um mit dem nativen Funktionsumfang anderer Dienste gleichzuziehen.

Einen detaillierten Vergleich zwischen Whisper und dem Angebot von Google finden Sie in unserer Analyse Whisper vs. Google Cloud Speech.

Globale mehrsprachige Kommunikation und Übersetzung
Globale mehrsprachige Kommunikation und Übersetzung

Wann Whisper die richtige Wahl ist

Trotz seiner Einschränkungen gibt es Szenarien, in denen die Whisper API tatsächlich die beste Option ist.

Mehrsprachige Batch-Transkription

Wenn Sie regelmäßig Audio in vielen verschiedenen Sprachen transkribieren und keine Echtzeitergebnisse benötigen, ist Whispers Kombination aus breiter Sprachunterstützung und niedrigen Kosten kaum zu schlagen. Ein Medienunternehmen, das Interviews auf Französisch, Japanisch und Portugiesisch transkribiert, kann eine einzige API mit einheitlichen Preisen für alle Sprachen nutzen. Die meisten Wettbewerber verlangen für nicht-englische Sprachen entweder mehr oder unterstützen weniger davon.

Budgetfreundliche Projekte im kleinen Maßstab

Für Start-ups, Forschende und einzelne Entwickler, die überschaubare Audiomengen verarbeiten, hält Whispers Preis von $0.006 pro Minute die Kosten minimal. Zehn Stunden Audio zu transkribieren kostet $3.60 – ganz ohne Infrastruktur, die verwaltet werden müsste. Es gibt keine Mindestabnahme, kein Abonnement und keine Vorabkosten über Ihre OpenAI-API-Guthaben hinaus.

Open-Source-Präferenz und Datenkontrolle

Organisationen, die Open-Source-Technologie bevorzugen, können die Whisper API als bequemen Einstiegspunkt nutzen und später, wenn die Volumen wachsen, zu selbst gehostetem Whisper wechseln. Da das Modell identisch ist, sind die Transkriptionsergebnisse über beide Betriebsmodelle hinweg konsistent. Eine Flexibilität, die proprietäre Dienste nicht bieten können. Für Entwickler, die kostenlose Transkriptionsoptionen erkunden, ist Whispers Open-Source-Verfügbarkeit ein erheblicher Vorteil.

Einfache Transkription ohne Extras

Wenn Ihr Anwendungsfall simpel ist – Datei hochladen, Transkript erhalten – liefert Whisper genau das, ohne dass Sie für Funktionen zahlen, die Sie nicht brauchen. Sie subventionieren keine Diarization-Engine, keine Streaming-Infrastruktur und kein System für eigenes Vokabular, das Sie nie nutzen werden.

Prototyping und Entwicklung

Whisper ist eine ausgezeichnete Wahl, um Transkriptionsfunktionen zu bauen und zu testen, bevor man sich auf einen funktionsreicheren (und teureren) Dienst festlegt. Die einfache API, die vorhersehbaren Preise und der gut dokumentierte Integrationsleitfaden machen es leicht, schnell einen funktionierenden Prototyp zum Laufen zu bringen.

Ihre monatlichen Kosten abschätzen

Zur Budgetplanung hier einige gängige Anwendungsfälle mit geschätzten monatlichen Kosten bei Nutzung der Whisper API.

AnwendungsfallMonatliches VolumenMonatliche Kosten
Freiberuflicher Journalist transkribiert Interviews10 Stunden$3.60
Kleines Podcast-Team transkribiert Episoden20 Stunden$7.20
Forschungsteam wertet Fokusgruppen aus50 Stunden$18.00
Content-Agentur transkribiert Kundenmedien200 Stunden$72.00
Unternehmen verarbeitet Anrufaufzeichnungen1,000 Stunden$360.00
Digitalisierung eines großen Medienarchivs5,000 Stunden$1,800.00

Diese Kosten decken nur die Nutzung der Whisper API ab. Wenn Sie zusätzliche Verarbeitung wie Sprechererkennung, Formatierung oder Untertitelerstellung benötigen, kalkulieren Sie die Kosten dieser Zusatzdienste ein – oder ziehen Sie eine Plattform wie ConvertAudioToText in Betracht, die diese Funktionen im Paket bündelt.

Häufig gestellte Fragen

Gibt es ein kostenloses Kontingent für die OpenAI Whisper API?

Nein. OpenAI bietet für die Whisper API kein kostenloses Kontingent an. Jede verarbeitete Audiominute wird mit $0.006 abgerechnet. Neue OpenAI-Konten erhalten manchmal ein kleines kostenloses API-Guthaben, das auch für Whisper verwendet werden kann – das ist jedoch ein einmaliges Startguthaben, kein dauerhaftes Gratis-Kontingent. Wenn Sie kostenlose Transkription benötigen, lässt sich das Open-Source-Modell Whisper ohne Softwarekosten selbst hosten, allerdings müssen Sie die GPU-Infrastruktur selbst bereitstellen.

Wie schneiden die Preise der Whisper API im Vergleich zu menschlichen Transkriptionsdiensten ab?

Menschliche Transkriptionsdienste verlangen für Standardlieferzeiten typischerweise zwischen $1.00 und $3.00 pro Audiominute, Expresszuschläge liegen darüber. Mit $0.006 pro Minute ist die Whisper API ungefähr 150- bis 500-mal günstiger als menschliche Transkription. Allerdings liefern menschliche Transkriptionisten bei schwierigem Audio nach wie vor höhere Genauigkeit – etwa bei Aufnahmen mit starken Akzenten, sich überlappenden Sprechern oder deutlichen Hintergrundgeräuschen. Bei sauberem Audio mit einem einzelnen Sprecher ist Whispers Genauigkeit mit menschlicher Transkription konkurrenzfähig – zu einem Bruchteil der Kosten.

Kann ich Whisper für die Echtzeit-Transkription von Live-Meetings nutzen?

Nein. Die Whisper API unterstützt nur Batch-Verarbeitung. Sie müssen eine vollständige Audiodatei hochladen und warten, bis das vollständige Transkript zurückgegeben wird. Es gibt keinen Streaming-Endpunkt, keine WebSocket-Unterstützung und keine Möglichkeit, Teilergebnisse während der Aufnahme zu erhalten. Für die Echtzeit-Transkription von Meetings benötigen Sie einen Dienst mit Streaming-Unterstützung wie Deepgram, Google Cloud Speech-to-Text oder AssemblyAI.

Bietet OpenAI Mengenrabatte für Whisper-API-Kunden mit hoher Nutzung an?

Stand Anfang 2026 bietet OpenAI keine öffentlich ausgewiesenen Mengenrabatte für die Whisper API an. Der Preis von $0.006 pro Minute ist derselbe – egal, ob Sie eine Stunde oder zehntausend Stunden pro Monat verarbeiten. Enterprise-Kunden mit sehr hohen Volumen können möglicherweise individuelle Preise aushandeln, indem sie sich direkt an das Vertriebsteam von OpenAI wenden – eine Self-Service-Rabattstruktur gibt es jedoch nicht.

Was passiert, wenn meine Audiodatei das Größenlimit von 25MB überschreitet?

Die API weist die Anfrage mit einem Fehler ab. Sie müssen die Dateigröße vor dem Hochladen reduzieren. Die wirksamsten Ansätze sind: das Audio in ein MP3-Format mit niedrigerer Bitrate komprimieren, die Tonspur aus Videodateien extrahieren, um die Videodaten loszuwerden, oder lange Aufnahmen in kleinere Abschnitte aufteilen. Die meisten Produktivimplementierungen automatisieren diesen Vorverarbeitungsschritt, sodass Endnutzer dem Limit nie direkt begegnen.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles