Whisper vs Google Cloud Speech-to-Text 2026: Welche API gewinnt?
apitranskriptionvergleichwhispergoogle-cloud

Whisper vs Google Cloud Speech-to-Text 2026: Welche API gewinnt?

BMMamane B. MoussaFebruary 23, 2026Updated July 1, 202612 min read

Summarize this article with:

Welche Lösung solltest du 2026 verwenden, OpenAI Whisper oder Google Cloud Speech-to-Text? Wenn du heute Echtzeit-Streaming oder Sprecher-Diarisierung brauchst, gewinnt Google. Wenn du die günstigste Batch-Transkription pro Minute mit breiter Sprachabdeckung benötigst, gewinnt Whisper. Und wenn dein Workload nicht dringende Batch-Verarbeitung ist, unterbietet Googles Dynamic Batch-Tarif mit etwa 0,004 $ pro Minute inzwischen sogar die Whisper-API selbst.

Eine verwaltete Pauschalpreis-Alternative zur Abrechnung pro Minute
Eine verwaltete Pauschalpreis-Alternative zur Abrechnung pro Minute

Der Rest dieses Leitfadens erklärt, warum.

Die Kurzfassung

Beide Dienste haben sich seit der letzten Runde von Vergleichsbeiträgen deutlich verändert. Googles V2-API und das Chirp 3-Modell haben die alte Standard/Enhanced-Tarifstruktur ersetzt. OpenAI hat gpt-4o-transcribe neben dem weiterhin verfügbaren whisper-1 hinzugefügt. Und Googles Dynamic Batch-Tarif hat den Kostenvergleich in einer Weise gekippt, die die meisten Entwickler noch nicht bemerkt haben.

Die wichtigsten Erkenntnisse:

  • Google Standard mit Chirp 3: 0,016 $/Minute, inklusive Streaming, Diarisierung und eingebautem Entrauscher. Es gibt keinen separaten „Enhanced“-Tarif mehr.
  • Whisper-API (whisper-1): 0,006 $/Minute, nur Batch, Abdeckung von 99 Sprachen, keine native Diarisierung.
  • Google Dynamic Batch: etwa 0,004 $/Minute, Ergebnisse innerhalb von 24 Stunden, kein Streaming.
  • gpt-4o-mini-transcribe: 0,003 $/Minute, OpenAIs günstigste gehostete Option, ähnliche Batch-Einschränkungen wie whisper-1.

Wenn du eine schnelle Entscheidung treffen willst: Nur Batch, kostenbewusst, mehrsprachig? Starte mit Whisper. Brauchst du Echtzeit oder einen verwalteten Enterprise-Dienst? Google Cloud Speech-to-Text.

Zwei unterschiedliche Philosophien

Bevor wir Preise vergleichen, hilft es zu verstehen, was jeder Dienst tatsächlich ist.

OpenAI Whisper ist ein Open-Source-Modell, dessen Gewichte öffentlich auf GitHub verfügbar sind. Wenn Entwickler „Whisper“ sagen, meinen sie damit entweder das Open-Source-Modell auf der eigenen GPU, den gehosteten whisper-1-API-Endpunkt oder eines der neueren gpt-4o-transcribe-Modelle von OpenAI. Kosten, Kontrolle und Betriebsaufwand unterscheiden sich zwischen diesen drei Optionen erheblich.

Google Cloud Speech-to-Text ist ein vollständig verwalteter Cloud-Dienst. Du sendest Audio, Google verarbeitet es, du bekommst die Ergebnisse zurück. Das zugrunde liegende Modell ist nicht herunterladbar. Dafür bekommst du einen produktionsreifen Dienst: Echtzeit-Streaming, Sprecher-Diarisierung, Chirp 3 mit Abdeckung von über 100 Sprachen und einen integrierten Denoiser für verrauschtes Audio. Die offizielle Dokumentation deckt den gesamten Funktionsumfang ab.

Dieser Unterschied in der Philosophie prägt alles andere. Whisper tauscht verwalteten Komfort gegen Flexibilität und Kostenkontrolle. Google tauscht Kontrolle gegen Ausgereiftheit und Vollständigkeit.

Vergleich im Detail

FunktionOpenAI Whisper (whisper-1 API)Google Cloud STT (V2 / Chirp 3)
Preis pro Minute (Standard)$0.006$0.016
Günstigster verwalteter Preis$0.003 (gpt-4o-mini-transcribe)~$0.004 (Dynamic Batch, 24h Bearbeitungszeit)
Kostenloses Kontingent$5 Guthaben für neue Konten60 Minuten/Monat dauerhaft
StreamingNein (whisper-1-Endpunkt nur für Batch)Ja, Echtzeit mit Zwischenergebnissen
Sprachen99100+ (Chirp 3 deckt 85+ GA/Preview ab)
Sprecher-DiarisierungNicht nativ unterstütztJa (Batch/Sync-Modi; nicht beim Streaming unter Chirp 3)
Umgang mit verrauschtem AudioMäßigStark (Chirp 3 mit integriertem Denoiser)
Benutzerdefiniertes VokabularNur über Prompt-TextJa, bis zu 1.000 Phrasen-Hinweise
SelbsthostingJa (Open-Source-Modellgewichte)Nein
Am besten geeignet fürKostenbewusste Batch-Verarbeitung, Selbsthosting, mehrsprachige InhalteStreaming-Apps, Unternehmen, verrauschtes Audio

Preisgestaltung im Detail

Hier hat sich der Vergleich im Jahr 2026 am stärksten verändert, und es lohnt sich, die Zahlen genau zu betrachten.

OpenAI-Optionen

Der whisper-1-Endpunkt kostet pauschal 0,006 $ pro Minute, abgerechnet pro Sekunde. OpenAI bietet inzwischen außerdem an:

  • gpt-4o-transcribe: 0,006 $/Min (gleicher Preis, verspricht bessere Genauigkeit als whisper-1)
  • gpt-4o-mini-transcribe: 0,003 $/Min (halber Preis, geeignet für weniger kritische Stapelverarbeitung)

Alle drei sind reine Batch-Endpunkte. OpenAI hat zwar ein separates Echtzeit-Sprachprodukt, aber mit rund 0,017 $/Min zielt es auf Live-Sprach-Anwendungen in einer ganz anderen Preisklasse ab.

Google-V2-Optionen

Die V2-API mit Chirp 3 hat Googles Preisgestaltung vereinfacht:

  • Standard (Echtzeit oder Batch): 0,016 $/Min, Chirp 3 ohne Aufpreis enthalten
  • Dynamic Batch: etwa 0,004 $/Min, Ergebnisse innerhalb von 24 Stunden
  • Medizinische Modelle: 0,078 $/Min (Diktat und Konversation, nicht für den allgemeinen Gebrauch geeignet)
  • Kostenlose Stufe: 60 Minuten pro Monat dauerhaft, plus 300 $ GCP-Guthaben für neue Konten

Die Dynamic-Batch-Stufe liegt etwa 75 % unter dem Standardsatz. Das ergibt ungefähr 0,004 $/Min, was unter den 0,006 $/Min der Whisper-API liegt. Für Podcast-Archive, Medientranskription und jede Arbeitslast, bei der man über Nacht warten kann, ist dies die kosteneffizienteste verwaltete Option, die beide Anbieter bieten.

Kosten im großen Maßstab

Kosten pro Stunde Audiotranskription (Juli 2026)
gpt-4o-mini
0,18 $/Std
Google Batch
~0,24 $/Std
Whisper-1
0,36 $/Std
Google Standard
0,96 $/Std

Verifizierte Tarife: gpt-4o-mini-transcribe 0,003 $/Min, Whisper-1 0,006 $/Min, Google Dynamic Batch ~0,004 $/Min, Google Standard 0,016 $/Min. Dynamic Batch erfordert 24-Stunden-Bearbeitung. Google Standard enthält Chirp 3.

Monatliches VolumenWhisper-1Google StandardGoogle Dynamic Batch
100 Stunden$36$96~$24
1.000 Stunden$360$960~$240

Bei 1.000 Stunden pro Monat spart Dynamic Batch grob $120 gegenüber Whisper und $720 gegenüber Google Standard. Der Haken ist ein 24-Stunden-Fenster für Ergebnisse, was viele Batch-Workloads verkraften können.

Für einen breiteren Überblick darüber, was Transkriptionsdienste am Markt verlangen, deckt der Vergleich der Transkriptionspreise mehr Anbieter nebeneinander ab.

Der Self-Hosted-Joker

Self-Hosting von Whisper bringt eine völlig andere Kostenstruktur mit sich. Die Modellgewichte sind kostenlos. Die Kosten entstehen durch GPU-Compute.

Auf AWS kostet eine g5.xlarge-Instanz (1x A10G, 24GB VRAM) etwa $1 pro Stunde on-demand. Whisper large-v3 auf einer einzelnen A10G kann mit ungefähr 100-facher Echtzeitgeschwindigkeit transkribieren, das heißt, eine GPU-Stunde deckt etwa 100 Audiostunden ab. Bei voller Auslastung liegt der effektive Kostenpunkt pro Audiominute deutlich unter $0,002.

Das klingt verlockend, bis man Leerlaufzeiten einrechnet. Eine GPU, die bei 50% Auslastung läuft, verdoppelt die effektiven Kosten pro Minute. Dazu kommen DevOps-Aufwand für Deployment, Monitoring und Skalierung, und der Break-even-Punkt gegenüber der Whisper-API liegt bei etwa 500 Stunden pro Monat. Darunter ist die API fast immer günstiger, wenn man Ingenieurszeit einpreist.

Self-Hosting ergibt in zwei Szenarien klar Sinn: bei einem Volumen über 500 Stunden pro Monat oder bei Anforderungen an Datensouveränität, wenn Audio Ihre Infrastruktur nicht verlassen darf.

Der Artikel über versteckte Kosten von Transkriptionsdiensten behandelt die Rechnung zu GPU-Auslastung und Infrastruktur-Overhead im Detail.

Genauigkeit nach Sprache und Audiotyp

Beide Dienste erzielen starke Ergebnisse bei sauberem englischem Audio. Die Unterschiede im Jahr 2026 sind nuancierter.

Google Chirp 3 bei verrauschtem Audio. Das Chirp-3-Modell enthält einen integrierten Denoiser, der Hintergrundgeräusche, hallende Räume und Telefonaudio besser verarbeitet als die bisherige Standard-/Enhanced-Architektur. Für Telefonate und Feldaufnahmen ist das eine spürbare Verbesserung, und es ist im regulären Tarif von $0,016/Minute enthalten, ohne dass ein höheres Paket nötig wäre.

Whisper bei mehrsprachigen Inhalten. Whisper wurde mit rund 680.000 Stunden mehrsprachigem Audio in 99 Sprachen trainiert. Bei Sprachen mit geringeren Ressourcen wie Walisisch, Swahili, Malaiisch und Katalanisch schlägt Whisper die Konkurrenz häufig, weil der Trainingsdatensatz bewusst auf Breite ausgelegt wurde. Google Chirp 3 deckt über 100 Sprachen ab, aber nur 24 sind vollständig allgemein verfügbar, der Rest befindet sich noch in der Vorschau. Abdeckung auf dem Papier und Genauigkeit in der Praxis weichen bei diesen Vorschau-Sprachen voneinander ab.

Englisch im direkten Vergleich. Bei sauberem Studio-Audio, Podcasts und gut aufgenommenen Besprechungen liegen beide Dienste im Bereich von über 90 Prozent Wortgenauigkeit gleichauf. OpenAI behauptet, dass gpt-4o-transcribe die Wortfehlerrate im Vergleich zu whisper-1 reduziert, besonders bei akzentuierter Sprache und schwierigem Audio. Diese Behauptungen decken sich mit unabhängigen Benchmarks, auch wenn der Abstand je nach Anwendungsbereich variiert.

Meine Einschätzung: Führen Sie vor der Entscheidung einen domänenspezifischen Pilotversuch durch. Die Genauigkeit bei juristischen Vernehmungen unterscheidet sich von der bei Kundensupport-Anrufen, und die wiederum von Konferenzpräsentationen. Veröffentlichte Benchmarks sind ein Ausgangspunkt, keine Einstellungsentscheidung.

Für einen tieferen Einblick, was Wortfehlerrate in der Praxis tatsächlich bedeutet, siehe Transkriptionsgenauigkeit erklärt.

Die Streaming-Frage

Der whisper-1-API-Endpunkt unterstützt kein Streaming. Sie laden eine vollständige Audiodatei hoch, warten auf die Verarbeitung und erhalten das komplette Transkript in einer einzigen Antwort. Das ist für vorab aufgenommene Inhalte in Ordnung, aber disqualifizierend für alles, was Live-Ergebnisse erfordert.

Google Cloud Speech-to-Text bietet echtes Echtzeit-Streaming über eine bidirektionale gRPC-Verbindung. Sie senden Audio-Chunks, sobald sie von einem Mikrofon oder Live-Stream eintreffen, und erhalten innerhalb von Millisekunden Zwischenergebnisse, während Google jedes Segment verarbeitet. Das macht es zur natürlichen Wahl für Live-Untertitelung, Sprachassistenten und Echtzeit-Transkription von Meetings.

Ein Hinweis zu Chirp 3 und Streaming: Obwohl das Chirp-3-Modell die StreamingRecognize-Methode unterstützt, ist die Sprecherdiarisierung unter Chirp 3 derzeit nur im Batch- und synchronen Erkennungsmodus verfügbar. Wenn Sie sowohl Streaming als auch Diarisierung benötigen, prüfen Sie die aktuelle Dokumentation, bevor Sie Ihre Pipeline aufbauen.

Self-hosted Whisper kann Streaming über Tools wie faster-whisper mit überlappenden Audio-Segmenten annähern, aber Whisper wurde als Batch-Modell mit 30-Sekunden-Chunks konzipiert. Sie können es umgehen, aber Sie werden die Latenz eines speziell entwickelten Streaming-Dienstes nicht erreichen.

Wenn Streaming eine harte Anforderung ist, ist Google Cloud Speech-to-Text die praktische Wahl.

Self-Hosting von Whisper: Die ehrliche Bewertung

Self-Hosting bietet vollständigen Datenschutz, keine Kosten pro Minute, keine Ratenlimits und die Möglichkeit, das Modell mit Ihren Domänendaten zu verfeinern. Diese Vorteile sind real.

Die Kosten sind ebenfalls real:

  • GPU-Instanzen für 0,75 bis 1 Dollar pro Stunde on-demand, oft höher
  • Engineering-Zeit für Bereitstellung, Skalierung, Überwachung und Updates des Modells
  • Keine Diarisierung, kein benutzerdefiniertes Vokabular und kein Streaming out of the box

Self-Hosting lohnt sich, wenn Sie mehr als 500 Stunden Audio pro Monat bei gleichbleibender Auslastung verarbeiten oder wenn Ihre Compliance-Anforderungen (HIPAA, strenge DSGVO-Auslegungen, Verteidigungsaufträge) verlangen, dass Audio Ihre Infrastruktur nie verlässt.

Unter 500 Stunden pro Monat ist die Whisper API oder Google Dynamic Batch in der Regel günstiger, wenn Sie die Engineering-Stunden einrechnen. Für die meisten Startups und mittelgroßen Teams ist die API der richtige Ausgangspunkt.

Entscheidungsmatrix

AnwendungsfallEmpfohlenWarum
Live-Untertitelung oder Echtzeit-UntertitelGoogle Cloud STTStreaming mit Zwischenergebnissen ist unerlässlich
Sprachgesteuerte AnwendungGoogle Cloud STTStreaming mit geringer Latenz erforderlich
Stapelverarbeitung von Podcasts oder VideoarchivenGoogle Dynamic BatchGünstiger als die Whisper API, wenn eine Bearbeitungszeit von 24 Stunden akzeptabel ist
Kostengünstige Stapeltranskription (schnelle Ergebnisse)gpt-4o-mini-transcribe$0.003/min, Ergebnisse auf Abruf
Mehrsprachige Inhalte (über 50 Sprachen)Whisper APIGrößte Bandbreite an mehrsprachigem Training
Telefonate, verrauschte FeldaufnahmenGoogle Cloud STTChirp 3 mit integriertem Entrauscher
Datenhoheit erforderlichSelbst gehostetes WhisperAudio verlässt nie Ihre Infrastruktur
Hohes Volumen (über 500 Stunden/Monat)Selbst gehostetes WhisperKosteneinsparungen rechtfertigen den Betriebsaufwand bei Skalierung
Unternehmen mit GCP-StackGoogle Cloud STTNative Integration über GCP-Dienste hinweg
Startup-MVP oder PrototypWhisper API oder gpt-4o-miniEinfache Preisgestaltung, schnellster Weg zu funktionierendem Code

Wenn Sie nur eine saubere Abschrift aus einer Audio- oder Videodatei benötigen, ohne eine API-Integration aufzubauen, übernimmt ConvertAudioToText Upload, Transkription und Export ohne jeglichen Code.

So entscheiden Sie

Gehen Sie diese vier Fragen durch.

Brauchen Sie Echtzeit-Streaming? Wenn ja, Google Cloud STT. Der whisper-1-Endpunkt kann das nicht, und selbst gehostete Whisper-Streaming-Lösungen bringen erheblichen technischen Aufwand mit sich.

Verträgt Ihre Stapelverarbeitung eine Bearbeitungszeit von 24 Stunden? Wenn ja, ist Google Dynamic Batch mit etwa $0.004/min inzwischen günstiger als die Whisper API mit $0.006/min. Der bisherige Kostenvorteil hat sich bei nicht dringenden Stapelaufträgen umgekehrt.

Brauchen Sie starke mehrsprachige Abdeckung für über 90 Sprachen? Wenn ja, Whisper. Seine Trainingsbreite für Sprachen mit geringeren Ressourcen ist von verwalteten Diensten weiterhin unerreicht.

Ist Datenschutz eine harte rechtliche Anforderung? Wenn ja, ist selbst gehostetes Whisper der sauberste Weg.

Falls keine dieser Optionen eine klare Antwort liefert, entscheide dich für den Anbieter, der am besten in deine bestehende Infrastruktur passt. Google integriert sich nahtlos in GCP-Umgebungen. Whisper passt zu Python-Stacks, in denen Hugging-Face-Bibliotheken bereits im Einsatz sind. Beide erledigen die Transkription zuverlässig.

Eine vollständige Aufschlüsselung der Minutenpreise aller großen APIs, einschließlich Deepgram und AWS Transcribe, findest du im Sprach-zu-Text-API-Preisvergleich, der die gesamte Landschaft abdeckt.

Häufig gestellte Fragen

Ist OpenAI Whisper genauer als Google Cloud Speech-to-Text?

Bei sauberem englischem Audio liegen beide nahe beieinander. Google Chirp 3 hat bei verrauschten Aufnahmen dank seines integrierten Denoisers einen leichten Vorteil. Bei Sprachen mit weniger Ressourcen schneidet Whisper tendenziell besser ab, da sein Trainingsdatensatz 99 Sprachen mit tiefen mehrsprachigen Daten abdeckt. Die ehrliche Antwort lautet: Führe einen Test mit 50 Beispielen deines eigenen Audiomaterials durch, bevor du dich festlegst, denn domänenspezifische Faktoren zählen mehr als veröffentlichte Benchmarks.

Kann ich Whisper für Live-Transkription von Meetings nutzen?

Nicht mit dem whisper-1-API-Endpunkt, der nur für Stapelverarbeitung ausgelegt ist und ein Dateilimit von 25 MB hat. Du müsstest Whisper selbst hosten und mit Tools wie faster-whisper eine Streaming-Pipeline aufbauen, was zusätzlichen technischen Aufwand bedeutet. Google Cloud Speech-to-Text (Modell Chirp 3) unterstützt Echtzeit-Streaming mit Zwischenergebnissen und ist die praktischere Wahl für Live-Transkription von Meetings. OpenAI bietet inzwischen zwar einen separaten Echtzeit-Sprach-Endpunkt an, aber der kostet etwa 0,017 $ pro Minute, was die Kostenrechnung deutlich verändert.

Ist es günstiger, Whisper selbst zu hosten, als Google Cloud Speech-to-Text zu nutzen?

Bei hoher Auslastung und guter GPU-Nutzung: ja. Eine GPU-Instanz mit Whisper large-v3 kann effektive Kosten von deutlich unter 0,002 $ pro Minute erreichen. Aber Googles Dynamic Batch-Tarif mit etwa 0,004 $ pro Minute und einer 24-Stunden-Bearbeitungsfrist unterbietet die Whisper API (0,006 $/Min) inzwischen für nicht zeitkritische Batch-Arbeiten, ganz ohne GPU-Betriebsaufwand. Self-Hosting lohnt sich nur dann klar, wenn Sie über etwa 500 Stunden pro Monat hinausgehen und das technische Personal haben, um die Infrastruktur zu pflegen.

Unterstützt Google Cloud Speech-to-Text Sprecher-Diarisierung?

Ja. Sprecher-Diarisierung ist sowohl in der V1 API als auch in der V2 API mit Chirp 3 verfügbar. Eine Einschränkung: Unter Chirp 3 funktioniert die Diarisierung im Batch- und synchronen Modus (Recognize) für etwa 15 unterstützte Sprachen, ist aber im Streaming-Modus noch nicht verfügbar. Whisper bietet Diarisierung von Haus aus gar nicht an; Sie müssten ein separates Modell wie pyannote zusätzlich auf die Whisper-Ausgabe anwenden.

Kann ich später zwischen Whisper und Google Cloud Speech-to-Text wechseln?

Ja, mit etwas Integrationsaufwand. Beide akzeptieren Standard-Audioformate und liefern Zeitstempel-Text zurück. Die API-Strukturen sind unterschiedlich, die Antwortformate weichen ab, und Funktionen, die nur ein Dienst bietet (Google Custom Vocabulary, Whisper-Übersetzungsmodus), müssen angepasst werden. Wenn Sie einen Wechsel in Betracht ziehen, kapseln Sie Ihre Transkriptionsaufrufe von Anfang an hinter einer dünnen Abstraktionsschicht, sodass ein Anbieterwechsel nur eine Datei betrifft, nicht Ihre gesamte Codebasis.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles