
Whisper Large-v3 erklärt: Architektur, WER und Grenzen (2026)
Summarize this article with:
Whisper Large-v3 ist OpenAIs Transformer mit 1,55 Milliarden Parametern in Encoder-Decoder-Struktur, trainiert auf 5 Millionen Stunden Audio und unterstützt 99 Sprachen unter einer freizügigen Open-Source-Lizenz. Er erreicht 2,7% WER auf LibriSpeech test-clean und senkt Fehler um 10-20% gegenüber Large-v2. Die Hauptschwächen sind Halluzinationen bei Stille, keine native Sprecherdiarisierung und schlechte Eignung für Echtzeit-Streaming. Die Turbo-Variante vom Oktober 2024 reduziert den Decoder von 32 auf 4 Schichten, senkt die Parameter auf 809 Millionen und läuft 2-5x schneller bei minimalem Genauigkeitsverlust.
Whisper Large-v3 ist OpenAIs Spracherkennungsmodell mit offenen Gewichten, veröffentlicht im November 2023. Es hat 1,55 Milliarden Parameter, unterstützt 99 Sprachen und steht im Zentrum eines großen Teils der Transkriptionstools, die 2024 und 2025 gebaut wurden. Dieser Beitrag behandelt die Architektur, die Geschichte der Trainingsdaten, verifizierte Benchmark-Zahlen und die echten Fehlerquellen, auf die du in der Produktion stoßen wirst.
Architektur: Encoder-Decoder-Transformer
Whisper ist ein Sequenz-zu-Sequenz-Transformer mit zwei Hälften, die über Cross-Attention verbunden sind.
Der Encoder wandelt rohes Audio in eine kompakte Darstellung um. Audio wird zunächst mithilfe von 128 Frequenzbins in ein Log-Mel-Spektrogramm transformiert (Large-v3 hat dies gegenüber den 80 Bins früherer Versionen erhöht). Das Spektrogramm speist einen Stapel von Transformer-Blöcken, die eine hochdimensionale Kodierung des Audioinhalts über die Zeit erzeugen. Der Encoder verarbeitet Audio in 30-Sekunden-Fenstern.
Der Decoder ist autoregressiv: Er erzeugt Ausgabetokens einzeln und achtet dabei auf die Encoder-Ausgabe sowie auf seine eigenen vorherigen Tokens. Dieser einzelne generative Prozess übernimmt Transkription, Übersetzung, Spracherkennung und Spracherkennungsaktivität über spezielle Token-Routing. Dasselbe Modell erzeugt französischen Text aus französischem Audio, englischen Text aus englischem Audio und englischen Text aus fremdsprachigem Audio, wenn es im Übersetzungsmodus läuft.
Für Large-v3 im Speziellen hat die Architektur 32 Encoder-Schichten und 32 Decoder-Schichten, eine Modellbreite von 1.280 und 20 Aufmerksamkeitsköpfe. Diese Zahlen sind unverändert gegenüber Large-v2; was sich in v3 geändert hat, waren die Trainingsdaten und die Anzahl der Mel-Bins.
Die Trainingsdaten hinter v3
Das ursprüngliche Whisper (2022) wurde mit 680.000 Stunden schwach gelabeltem Web-Audio trainiert. Large-v3 hat das erheblich erweitert.
Die v3-Trainingsmischung umfasst:
- 1 Million Stunden schwach gelabeltes Audio (menschlich transkribiert oder aus dem Web gepaart)
- 4 Millionen Stunden pseudo-gelabeltes Audio, erzeugt durch den Lauf von Large-v2 über ungelabelte Daten
Das sind insgesamt 5 Millionen Stunden, trainiert über 2 Epochen. Der Pseudo-Labeling-Ansatz, bei dem ein bestehendes Modell neue Daten annotiert, ist der Hauptgrund dafür, dass v3 im Vergleich zu v2 über ein breites Spektrum an Sprachen hinweg eine Fehlerreduktion von 10-20% zeigt. Die Qualität der Pseudo-Labels wird durch Large-v2 selbst begrenzt, was sowohl die Stärke als auch die Obergrenze dieses Ansatzes darstellt.
Die ursprüngliche Aufschlüsselung der 680.000 Stunden aus dem Paper von 2022 gibt einen Eindruck von der Sprachverteilung: ungefähr 438.000 Stunden Englisch mit englischen Transkripten, 117.000 Stunden nicht-englische Audiodaten mit Transkripten in der jeweiligen Muttersprache und 125.000 Stunden nicht-englische Audiodaten mit englischen Übersetzungen. Die letzte Kategorie ist es, die Whisper seine Übersetzungsfähigkeit direkt ab Werk verleiht.

Verifizierte WER-Benchmarks
Zahlen aus der offiziellen Modellkarte und dem Hugging Face Open ASR Leaderboard, ausgewertet auf Common Voice 15 und Fleurs.
| Benchmark | WER |
|---|---|
| LibriSpeech test-clean (gelesenes Englisch) | 2,7% |
| LibriSpeech test-other (abwechslungsreiches Englisch) | 5,2% |
| Open ASR Leaderboard Mittelwert | 7,44% |
| AMI-Korpus (Besprechungsaudio) | 15,95% |
| Hindi (ARTPARK-IISc Vaani) | 26,8% |
Reale Audiodaten, Besprechungen, Podcasts, Telefonate, Interviews, liegen typischerweise im Bereich von 8-12% WER. LibriSpeech test-clean besteht aus vorgelesenem Hörbuch-Audio mit nahezu idealen Aufnahmebedingungen, daher stellt die 2,7%-Marke die Obergrenze dar, nicht den Durchschnitt.
Zum Vergleich: Neuere Open-Source-Modelle wie NVIDIAs Parakeet und Canary schlagen Whisper inzwischen auf LibriSpeech test-clean (etwa 1,6-1,7% WER). Whisper dominante Position in der eingesetzten Software kommt von der Reife seines Ökosystems, der Sprachabdeckung und der Bandbreite an optimierten Laufzeitumgebungen, nicht von Spitzenwerten auf dem Leaderboard.
Sprachabdeckung: 99, aber ungleichmäßig
Whisper Large-v3 unterstützt offiziell 99 Sprachen, wobei Kantonesisch in v3 als neues Sprach-Token hinzugekommen ist. Die Leistung konzentriert sich stark auf die Sprachen mit den meisten Trainingsdaten.
Am besten unterstützt werden Englisch, Spanisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch und Russisch. Bei Sprachen mit weniger Ressourcen, vielen afrikanischen Sprachen und regionalen südasiatischen Sprachen kann die Fehlerrate (WER) bei 25 bis 35 Prozent oder schlechter liegen. Der obige Hindi-Benchmark (26,8 Prozent) liefert einen konkreten Datenpunkt dafür, wo selbst eine mittelmäßig gut abgedeckte Sprache bei anspruchsvollem Audiomaterial landet.
Für Anwendungsfälle mit Sprachen mit geringen Ressourcen, siehe unsere Aufschlüsselung, warum KI bei Sprachen mit geringen Ressourcen scheitert.
Was Large-v3 gegenüber Large-v2 verbessert hat
Die Architektur ist zwischen v2 und v3 im Wesentlichen gleich. Die Verbesserungen kommen von:
- Erhöhte Mel-Frequenz-Bins (128 statt 80), was dem Encoder eine feinere Frequenzauflösung gibt.
- Ein Trainingsdatensatz von 5 Millionen Stunden gegenüber den ursprünglichen 680.000 Stunden, mit Pseudo-Labeling von Large-v2.
- 10 bis 20 Prozent Fehlerreduktion über alle Sprachen hinweg, besonders bei solchen mit geringeren Ressourcen.
- Verbesserte Genauigkeit bei Zeitstempeln.
- Besserer Umgang mit Code-Switching, wenn Sprecher mitten im Satz zwischen zwei Sprachen wechseln.
Die Behauptung über reduzierte Halluzinationen, die nach der Veröffentlichung von v3 kursierte, ist teilweise korrekt: v3 halluziniert unter bestimmten Bedingungen weniger als v2, aber das Problem ist nicht gelöst. Es bleibt eine bekannte Schwäche im Produktionsbetrieb.
Die Turbo-Variante (Oktober 2024)
OpenAI hat Whisper Large-v3-Turbo im Oktober 2024 veröffentlicht. Die wichtigste Änderung ist das Beschneiden des Decoders: 32 Decoder-Schichten wurden auf 4 reduziert, wodurch die Parameteranzahl von 1,55 Milliarden auf 809 Millionen sinkt. Der Encoder bleibt unverändert.
Das Ergebnis ist eine 2- bis 5-mal schnellere Inferenz bei dem, was OpenAI als „geringfügige Qualitätseinbußen“ beschreibt. Auf NVIDIA-GPUs zeigen Messungen des Echtzeitfaktors, dass Turbo Audio deutlich schneller als in Echtzeit verarbeitet. Der Kompromiss ist, dass Turbo Übersetzungsaufgaben aus seinem Fine-Tuning ausschließt, es also nur Transkription übernimmt.
Für die meisten Produktions-Batch-Transkriptionsfälle ist Turbo jetzt die Standardwahl, wenn du die Infrastruktur kontrollierst. Der Genauigkeitsunterschied ist klein genug, dass der Durchsatzgewinn ihn normalerweise aufwiegt.
Bekannte Schwächen in der Produktion
Halluzination bei Stille. Der Decoder von Whisper erzeugt weiterhin Tokens, auch wenn keine Sprache vorhanden ist, insbesondere bei Temperatur 0. Die Ausgabe ist oft plausibel klingender Text, der nie gesprochen wurde. Der übliche Fix ist VAD (Voice Activity Detection) als Vorverarbeitung, um stille Segmente zu entfernen, bevor sie das Modell erreichen. Ein Temperatur-Fallback-Plan, der ein Tupel mit steigenden Temperaturwerten statt einer festen Zahl bereitstellt, reduziert ebenfalls Schleifen. Unser Beitrag darüber, wie VAD funktioniert, behandelt die Technik.
Keine native Sprecher-Diarisierung. Whisper erzeugt ein durchgehendes Transkript ohne Sprecherlabels. Die Standardlösung ist WhisperX, das Whisper (über das faster-whisper-Backend), erzwungene Phonem-Alignment mit wav2vec2 und pyannote.audio-Diarisierung in einer Pipeline verkettet. Jede Stufe kann auch unabhängig laufen. Mehr zur Diarisierung findest du unter Sprecher-Diarisierung erklärt.
Schlecht für Echtzeit-Streaming geeignet. Das 30-Sekunden-Verarbeitungsfenster und der autoregressive Decoder machen Streaming mit niedriger Latenz schwierig. Modelle für Streaming verwenden eine andere Architektur, typischerweise Streaming-CTC oder Chunked-Attention mit Teilhypothesen-Ausgabe. Die Nova-Serie von Deepgram ist die gängigste Alternative für Echtzeitanwendungen. Der Deepgram-Nova-3-Beitrag behandelt den Vergleich.
Kein Kontext über Chunk-Grenzen hinweg. Eine 60-minütige Audiodatei wird als 120 aufeinanderfolgende 30-Sekunden-Chunks verarbeitet. Das Modell hat keine Erinnerung an Chunk 1, wenn es Chunk 5 verarbeitet. Ein Name, Akronym oder Begriff, der früh eingeführt wird, kann später in derselben Datei inkonsistent transkribiert werden.
Spezialvokabular. Whisper hat keinen Mechanismus zur Vokabelgewichtung. Medizinische, juristische oder finanzielle Fachbegriffe, die im Training nicht häufig vorkamen, erzeugen selbst bei sauberem Audio Fehler. Für hochriskante Spezialanwendungen ist das Feintuning auf domänenspezifischen Daten die richtige Lösung.
Whisper selbst ausführen
Drei praktische Wege für die lokale Bereitstellung:
OpenAIs Referenzimplementierung (Python). Der kanonische Code, langsamste Inferenz. Nützlich zum Testen oder Debuggen des Modellverhaltens, aber nicht für Produktionsdurchsatz.
Whisper.cpp (C++). Läuft auf CPU, Apple Silicon (Metal), CUDA und Vulkan. Die beste Option für Mac-Bereitstellungen oder eingebettete Systeme. Keine Python-Abhängigkeit.
Faster-Whisper (Python, über CTranslate2). Läuft 4x schneller als die Referenzimplementierung auf NVIDIA-GPUs, mit INT8-Quantisierung, die den VRAM-Verbrauch um etwa 40% reduziert. Das ist die Standardwahl für Linux-GPU-Server.
Alle drei erzeugen identische Ausgaben aus denselben Modellgewichten. Der Unterschied liegt in Inferenzgeschwindigkeit und Ressourcenverbrauch.
Lizenz
Der Whisper-Code und die Gewichte sind unter der MIT-Lizenz im offiziellen OpenAI-GitHub-Repository veröffentlicht. Die Hugging-Face-Modellkarte listet Apache 2.0. Beides sind permissive Lizenzen, die kommerzielle Nutzung ohne Lizenzgebühren erlauben. Wenn Ihr Anwendungsfall eine bestimmte Lizenz erfordert, prüfen Sie direkt das GitHub-Repository, statt sich auf die Hugging-Face-Auflistung zu verlassen.
Wann Whisper passt und wann nicht
Whisper Large-v3 ist eine starke Standardwahl für:
- Batch-Transkription von vorab aufgenommenem Audio.
- Mehrsprachige Inhalte oder unbekannte Ausgangssprache.
- Übersetzungsaufgaben (nicht-englisches Audio in englischen Text).
- Anwendungsfälle, die ein Open-Weight-Modell erfordern, das Sie auf eigener Infrastruktur betreiben können.
Es ist die falsche Wahl für:
- Echtzeit- oder latenzarmes Streaming, verwenden Sie stattdessen ein für Streaming optimiertes Modell.
- Besprechungstranskription mit Sprecherzuordnung, fügen Sie eine Diarisierungsebene hinzu oder nutzen Sie einen Dienst, der diese bereits bündelt.
- Hochspezialisiertes Vokabular ohne Feintuning, hier ist eine Domänenanpassung erforderlich.
Für einen breiteren Vergleich von Transkriptionsansätzen und deren Kosten, siehe den Vergleich der Transkriptionspreise und die Übersicht der besten Speech-to-Text-APIs.
Wenn Sie Whisper mit Ihren eigenen Audiodateien testen möchten, ohne eine Infrastruktur aufzubauen, führt der kostenlose Tarif von ConvertAudioToText eine Whisper Large-v3-Pipeline auf hochgeladenen Audiodateien aus. Laden Sie eine Beispieldatei hoch und vergleichen Sie die Ausgabe mit Ihrem Benchmark, bevor Sie sich für einen Implementierungsweg entscheiden.
Häufig gestellte Fragen
Wie viele Parameter hat Whisper Large-v3?
Whisper Large-v3 hat 1.550 Millionen Parameter (1,55B). Die Turbo-Variante vom Oktober 2024 reduziert dies auf 809M, indem der Decoder von 32 auf 4 Schichten verkleinert wird, was eine 2- bis 5-mal schnellere Inferenz bei geringfügigen Genauigkeitseinbußen liefert.
Welche Wortfehlerrate erreicht Whisper Large-v3?
Auf LibriSpeech test-clean (gelesene englische Hörbuch-Audiodateien) erreicht Whisper Large-v3 eine WER von 2,7 %. Beim schwierigeren test-other-Split sind es 5,2 %. Die mittlere WER über den Open-ASR-Leaderboard-Benchmark-Mix liegt bei 7,44. Reale Audiodaten mit Rauschen, Akzenten oder Telefonqualität liegen typischerweise im Bereich von 8 bis 12 %.
Unterstützt Whisper Large-v3 Sprecherdiarisierung?
Nein. Whisper kennzeichnet nicht nativ, wer spricht. Der übliche Ansatz besteht darin, Whisper für das Transkript auszuführen, dann pyannote.audio separat für Sprechergrenzen zu verwenden und die beiden Ausgaben mithilfe von Wort-Zeitstempeln abzugleichen. Die WhisperX-Bibliothek bündelt diese dreistufige Pipeline in einem einzigen Werkzeug.
Warum halluziniert Whisper Text während Stille?
Whispers autoregressiver Decoder erzeugt weiterhin Tokens, auch wenn keine Sprache vorhanden ist, insbesondere bei deterministischer Dekodierung (Temperatur 0). Der zuverlässigste Fix ist die Vorverarbeitung mit Voice Activity Detection (VAD), um stille Abschnitte zu entfernen, bevor sie das Modell erreichen. Auch ein Temperatur-Fallback-Plan statt eines einzelnen festen Werts hilft, indem er bei Schleifen des Modells ein erneutes Sampling auslöst.
Was ist der Unterschied zwischen Whisper Large-v3 und Large-v3-Turbo?
Beide teilen sich denselben Encoder. Turbo reduziert den Decoder von 32 auf 4 Schichten und feinjustiert das Ergebnis, wodurch die Gesamtzahl der Parameter von 1,55B auf 809M sinkt. Der Geschwindigkeitsgewinn beträgt je nach Hardware das 2- bis 5-fache. OpenAI beschreibt den Genauigkeitsunterschied als „geringfügige Qualitätsminderung“. Turbo unterstützt keine Übersetzungsaufgaben, da bei der Feinjustierung Übersetzungsdaten ausgeschlossen wurden.
Quellen
- openai/whisper Modellkarte (GitHub)
- openai/whisper-large-v3 auf Hugging Face
- openai/whisper-large-v3-turbo auf Hugging Face
- Diskussion zur Veröffentlichung von large-v3 (GitHub)
- Diskussion zur Veröffentlichung des Turbo-Modells (GitHub)
- OpenAI Whisper MIT-Lizenz (GitHub)
- Whisper-Halluzination bei Stille (Whisper GitHub Diskussion #1606)
- WhisperX: Whisper + pyannote Diarisierungspipeline (GitHub)
- SYSTRAN/faster-whisper (GitHub)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

OpenAI Whisper API Pricing 2026: $0.003–$0.006/min
OpenAI Whisper API pricing in 2026: whisper-1 is still $0.006/min but gpt-4o-mini-transcribe cuts that to $0.003/min. Real per-hour math, file limits (25MB/25-min), and how it stacks up against Deepgram Nova-3 and AssemblyAI.

How AI Transcription Works: The Product Pipeline Explained (2026)
From upload to exported transcript: a clear walkthrough of every stage in the AI transcription pipeline, including VAD, ASR, diarization, post-processing, and export.