BMMamane B. MoussaInvalid Date17 min read

Summarize this article with:


title: "Deepgram Nova-3 Preise 2026: 0,0043 $/Minute Batch, 0,0077 $ Streaming" description: "Deepgram Nova-3 kostet 2026 0,0043 $ pro Minute für Batch und 0,0077 $ pro Minute für Streaming. Ehrliche Genauigkeit im Vergleich zu Whisper, über 50 unterstützte Sprachen, Keyterm-Prompting und wann Nova-3 günstigere Alternativen wie AssemblyAI schlägt." author: name: Mamane B. Moussa coverImage: /images/blog/deepgram-nova-3-explained.jpg updated: '2026-06-30' date: '2026-05-26' tags:

  • deepgram
  • nova
  • Spracherkennung primaryKeyword: deepgram nova-3 secondaryKeywords:
  • nova-3 Spracherkennung
  • deepgram Preise
  • Echtzeit-Transkription
  • deepgram vs whisper faqs:
  • q: Wie viel kostet Deepgram Nova-3 pro Minute? a: Nova-3 für vorab aufgenommene (Batch) Transkription kostet etwa 0,0043 $ pro Minute, also rund 0,26 $ pro Stunde, im Pay-as-you-go-Tarif. Streaming liegt bei etwa 0,0077 $ pro Minute, also rund 0,46 $ pro Stunde. Mehrsprachiges Streaming kostet etwa 0,0058 $ pro Minute. Deepgram rechnet pro Sekunde Audio ab, und neue Konten erhalten 200 $ Startguthaben ohne Ablaufdatum. Preise ändern sich, also vor der Budgetplanung auf der Deepgram-Preisseite nachsehen.
  • q: Ist Nova-3 genauer als Whisper? a: In Deepgrams eigenen Benchmarks wurde Nova-3 in allen 7 getesteten Sprachen gegenüber Whisper bevorzugt, teilweise mit einer Präferenz von 8 zu 1. Das ist Deepgrams Test, kein unabhängiger. In der Praxis sind beide bei sauberem einsprachigem Englisch nahezu gleichwertig, und bei schwierigstem Audio (starke Akzente, Telefonqualität, überlappende Sprache) ist der Unterschied klein und hängt von deinem konkreten Material ab. Die einzige Zahl, die zählt, ist die, die du selbst misst.
  • q: Wie viele Sprachen unterstützt Nova-3? a: Nova-3 startete im Januar 2025 mit 36 Sprachen und wurde bis Ende 2025 laut Deepgrams aktueller Dokumentation auf über 50 erweitert. Echtzeit-Code-Switching, bei dem das Modell Audio verarbeitet, das mitten im Stream Sprachen mischt, wird in 10 Sprachen unterstützt: Englisch, Spanisch, Französisch, Deutsch, Hindi, Russisch, Portugiesisch, Japanisch, Italienisch und Niederländisch. Whisper deckt insgesamt noch mehr Sprachen ab, etwa 99, allerdings mit schwankender Qualität.
  • q: Kann ich Nova-3 selbst hosten oder offline nutzen? a: Nein. Nova-3 ist ein geschlossenes kommerzielles Modell. Du kannst es nicht herunterladen, offline betreiben oder außerhalb eines Enterprise-Vertrags auf eigenen Daten feintunen. Wenn du Self-Hosting, eine abgeschottete Umgebung oder volle Datenkontrolle brauchst, ist ein offenes Modell wie Whisper Large-v3 der richtige Weg.
  • q: Was ist Keyterm-Prompting und hilft es wirklich? a: Keyterm-Prompting erlaubt dir, bis zu 100 erwartete Begriffe (Firmennamen, Produktnamen, medizinische oder juristische Fachbegriffe) mit einer Transkriptionsanfrage zu übergeben, und Nova-3 gewichtet sie ohne Umschulung stärker. Es hilft am meisten, wenn dein Audio voller Eigennamen oder Fachvokabular ist, das ein allgemeines Modell übersehen würde. Bei Listen mit gängigen Namen, Medikamentenbezeichnungen oder technischen Begriffen verbessert selbst eine kurze Keyterm-Liste die Genauigkeit dieser spezifischen Wörter spürbar.
  • q: Wie viele Sprecher kann Nova-3s Diarisierung verarbeiten? a: Deepgrams Diarisierung erkennt Sprecher, ohne dass du vorab eine Anzahl angibst, und die Dokumentation nennt kein Maximum. Behauptungen über eine feste Obergrenze wie „bis zu 12 Sprecher“ stehen nicht in Deepgrams Unterlagen. Behandle die Sprecherzahl als etwas, das du an deinem eigenen Mehrpersonen-Audio verifizieren musst, denn die Qualität der Diarisierung bei überlappenden oder dichten Aufnahmen variiert je nach Engine.
  • q: Unterstützt Deepgram Nova-3 Echtzeit-Streaming-Transkription? a: Ja. Nova-3 liefert Streaming über einen WebSocket-Endpunkt mit einer Ende-zu-Ende-Latenz von 200 bis 300 Millisekunden unter guten Bedingungen. Es gibt vorläufige Transkripte, die überarbeitet werden können, und dann finalisierte Transkripte, die gesperrt sind, sobald mehr Audio eintrifft. Das ist Nova-3s stärkster Anwendungsfall im Vergleich zu Batch-orientierten Modellen wie Whisper.
  • q: Ist Nova-3 die günstigste Transkriptions-API? a: Nicht bei Batch. 2026 unterbieten AssemblyAI Universal-2 (0,15 $/Std.), Rev AI Reverb (0,20 $/Std.) und AssemblyAI Universal-3.5 Pro (0,21 $/Std.) alle Nova-3s Basis-Batch-Rate von rund 0,26 $/Std. Nova-3 punktet bei Echtzeit-Latenz und sekundengenauer Abrechnung, nicht beim niedrigsten Listenpreis. Beachte, dass einige Anbieter Diarisierung und andere Funktionen separat abrechnen, Basisraten sind also nicht die Gesamtkosten. tldr: Deepgram Nova-3 ist ein geschlossenes, kommerzielles Sprach-zu-Text-Modell für latenzarmes Streaming und große Batch-Mengen. Es kostet etwa 0,0043 $ pro Minute für vorab aufgenommenes Audio (rund 0,26 $ pro Stunde) und etwa 0,0077 $ pro Minute beim Streaming, unterstützt über 50 Sprachen mit Echtzeit-Code-Switching in 10 und bietet Keyterm-Prompting für Fachvokabular. Die Genauigkeits- und Latenzzahlen sind stark, aber selbst veröffentlicht, also teste an deinem eigenen Audio, bevor du ihnen vertraust. Nimm Nova-3 für Echtzeit und enge Latenz-Budgets; nimm Whisper, wenn du Open Source, Self-Hosting oder 99-Sprachen-Abdeckung brauchst.

Deepgram hat Nova-3 im Januar 2025 als Nachfolger von Nova-2 veröffentlicht, dem bisherigen Flaggschiff-Modell für Spracherkennung. Es treibt jetzt einen Teil der Echtzeit- und Hochdurchsatz-Transkriptionstools an, die 2025 und 2026 ausgeliefert wurden, und läuft in Teilen der ConvertAudioToText-Pipeline. Dieser Beitrag erklärt, was Nova-3 ist, wie die echten Preise und Limits 2026 aussehen und wie es sich gegen den Open-Source-Standard Whisper schlägt.

Ich verbringe den Großteil meiner Woche damit, Audio zwischen Transkriptions-Engines zu routen, daher ist mein Ziel hier die Version, die ich mir von den Anbietern wünschen würde: die Zahlen, die real sind, die, die Marketing sind, und die Grenze dazwischen.

Die wichtigsten Genauigkeits- und Latenzzahlen stammen aus Deepgrams eigenen Benchmarks, nicht aus unabhängigen Quellen, also behandle sie als Ausgangspunkt und teste sie mit deinem eigenen Audio. Wähle Nova-3, wenn Echtzeit-Latenz oder Abrechnung pro Sekunde zählt. Wähle Whisper, wenn du Open-Source-Kontrolle, Self-Hosting oder Abdeckung seltenerer Sprachen brauchst.

Architektur: was tatsächlich dokumentiert ist

Deepgram hat keine Parameterzahlen, Layer-Anzahlen oder die spezifische Transformer-Variante veröffentlicht, die Nova-3 verwendet. Es ist ein geschlossenes kommerzielles Modell, die Architektur ist also eine Blackbox. Was das Unternehmen öffentlich dokumentiert:

  • Es ist ein End-to-End-Modell. Dasselbe Netzwerk übernimmt akustische Modellierung, Sprachmodellierung und finale Textproduktion, statt drei getrennter Stufen.
  • Es ist auf einem großen proprietären Audio-Datensatz trainiert, der Enterprise-Call-Audio, Podcasts, Konversationsdaten und verrauschte reale Aufnahmen umfasst.
  • Es bedient sowohl Streaming- (Echtzeit) als auch Vorabaufnahme-API-Modi aus demselben zugrunde liegenden Modell.
  • Es liefert Wort-Zeitstempel und Konfidenzwerte direkt zurück.

Deepgrams technische Ausrichtung war stets darauf optimiert, Inferenz-Latenz und Kosten pro Minute zu senken. Nova-3 setzt diese Linie fort: Der Launch positionierte es als Speed- und Anpassungs-Play, nicht als Roh-Genauigkeits-Moonshot.

Was sich gegenüber Nova-2 geändert hat

Deepgrams Ankündigungspost zu Nova-3 hebt ein paar gezielte Verbesserungen gegenüber Nova-2 hervor.

Keyterm-Prompting. Das ist die Flaggschiff-Funktion. Du kannst bei der Anfrage bis zu 100 Schlüsselbegriffe (Firmennamen, Medikamentennamen, Fachjargon) übergeben, und das Modell gewichtet sie stärker, ganz ohne Modell-Nachtraining. Deepgram nennt das die erste Self-Service-Anpassung dieser Art in einem Voice-AI-Modell. Für domänenspezifisches Vokabular ist das die nützlichste einzelne Ergänzung.

Code-Switching in Echtzeit. Nova-3 kann Audio transkribieren, das mitten im Satz zwischen 10 Sprachen wechselt (Englisch, Spanisch, Französisch, Deutsch, Hindi, Russisch, Portugiesisch, Japanisch, Italienisch und Niederländisch), über den Sprachcode multi. Nova-2 kam mit gemischtsprachigem Audio nur schlecht zurecht.

Breitere Sprachabdeckung. Nova-3 startete mit 36 unterstützten Sprachen, und Deepgram hat das bis 2025 laut aktueller Doku auf über 50 ausgeweitet.

Weniger Halluzinationen bei Stille und Musik. Ältere Deepgram-Modelle produzierten manchmal Text in reinen Musikpassagen oder fast stillen Abschnitten. Nova-3 enthält eine Sprachaktivitätserkennung in der Pipeline, die diese Fehlalarme unterdrückt. Unser Beitrag zu wie Sprachaktivitätserkennung funktioniert erklärt, warum das wichtig ist.

Die Genauigkeitsangaben, ehrlich gelesen

Hier gehen die meisten Berichte schief, also lies genau. Jede Genauigkeitszahl, die Deepgram für Nova-3 veröffentlicht, stammt aus Deepgrams eigenen Tests. Dahinter steckt kein neutraler Drittanbieter-Benchmark. Das ist, was der Ankündigungspost tatsächlich behauptet, sauber getrennt, damit nichts vermischt wird:

  • Streaming-Wortfehlerrate (WER): 54,2 % niedriger als beim zweitbesten Wettbewerber, wobei Deepgram diesen nicht nennt. Median-WER von 6,84 % gegenüber 14,92 % beim Wettbewerber.
  • Batch-WER: 47,4 % niedriger als beim zweitbesten Wettbewerber. Median-WER von 5,26 % gegenüber etwa 10 %.
  • Speziell im Vergleich zu Whisper: Deepgram gibt an, dass Nova-3 bei 7 von 7 getesteten Sprachen bevorzugt wurde, mit einer Präferenz von bis zu 8 zu 1 bei einigen, über rund 200 Audio-Samples.

Die „54 %“-Zahl bezieht sich auf einen unbenannten Wettbewerber, nicht auf Whisper. Der Whisper-Vergleich ist der separate Präferenztest mit 7 von 7. Viele Beiträge aus zweiter Hand vermischen beides zu „54 % genauer als Whisper“, was Deepgram so nie gesagt hat. Außerdem hängt die WER stark von Audioqualität, Akzent und Fachgebiet ab, daher ist der Median eines Anbieters auf seinem eigenen Testset keine Garantie für deine Anrufaufzeichnungen.

Zum Merken: Die Genauigkeitszahlen von Nova-3 sind echte Behauptungen aus einem echten Benchmark, aber es ist der Benchmark des Anbieters. Die einzige Zahl, die für dein Projekt zählt, ist die, die du an deinem eigenen Audiomaterial misst.

Stärken im Produktiveinsatz

Wo Nova-3 seinen Platz wirklich verdient.

Echtzeit-Latenz. Die Streaming-API erzeugt Transkripte mit einer Ende-zu-Ende-Latenz im Bereich von 200 bis 300 Millisekunden unter guten Bedingungen, vergleichbar mit Nova-2. Bei Live-Untertitelung, Sprachassistenten und Meeting-Transkription, wo Nutzer den Text während des Sprechens entstehen sehen, liegt Deepgram damit klar vor batch-orientierten Modellen wie Whisper.

Abrechnung pro Sekunde. Deepgram rechnet pro verarbeiteter Audiosekunde ab, statt auf die nächste volle Minute aufzurunden. Bei großen Mengen kurzer Clips macht dieser Rundungsunterschied real gespartes Geld aus, verglichen mit Anbietern, die aufrunden.

Durchsatz in großem Maßstab. Die Infrastruktur von Deepgram ist auf Hochvolumen-Verarbeitung ausgelegt. Teams, die täglich tausende Stunden transkribieren, berichten von stabilem Durchsatz, während eine selbst gehostete Single-Tenant-Bereitstellung an ihre Grenzen stoßen würde.

Keyterm-Prompting. Übergeben Sie eine kurze Liste erwarteter Begriffe, und die Genauigkeit bei Eigennamen und Fachvokabular verbessert sich spürbar, ganz ohne Nachtraining und ohne Batch-Job. Unser Beitrag zum Korrigieren falsch transkribierter Namen zeigt, wann sich der Aufwand lohnt.

Kalibrierte Konfidenzwerte. Nova-3 liefert wortgenaue Konfidenzwerte, mit denen Sie downstream arbeiten können. Unser Beitrag zu Transkriptions-Konfidenzwerten erklärt, wie Sie diese nutzen.

Bekannte Schwächen

Wo Nova-3 an Grenzen stößt, klar benannt.

Es ist geschlossen. Sie können Nova-3 nicht selbst hosten, offline betreiben oder außerhalb eines Enterprise-Vertrags auf eigenen Daten feinjustieren. Bei strengen Anforderungen an Datenresidenz oder Air-Gapped-Umgebungen ist ein offenes Modell wie Whisper der einzige Weg. Unser Beitrag zur Datenresidenz bei Transkription behandelt, wann diese Einschränkung ein harter Blocker ist.

Die Sprachabdeckung bleibt hinter Whisper zurück. Nova-3 unterstützt über 50 Sprachen gut; Whisper deckt rund 99 Sprachen mit unterschiedlicher Qualität ab. Bei Inhalten in weniger verbreiteten Sprachen gewinnt Whisper oft schon standardmäßig. Unser Beitrag dazu, warum KI mit ressourcenarmen Sprachen kämpft, beleuchtet diese Lücke.

Kein Vorsprung beim schwierigsten Audiomaterial. Bei sauberem, einsprachigem Englisch mit einem Sprecher liegen Nova-3 und Whisper Large-v3 nahe beieinander. Unter den schlechtesten Bedingungen (starke Akzente, Telefonaudio mit niedriger Bitrate, überlappende Sprecher) ist der Unterschied gering und stark vom Einsatzfall abhängig. Unser Erklärbeitrag zu Whisper Large-v3 behandelt diesen Vergleich.

Keine veröffentlichte Prüfhistorie. Da Architektur und Trainingsdaten nicht öffentlich sind, bedeutet die Bewertung systematischer Verzerrungen oder Fehlermuster praktisches Testen, nicht das Lesen eines Papers. Für Forschung oder regulierte Anwendungen, bei denen die Herkunft des Modells zählt, ist diese Undurchsichtigkeit eine echte Einschränkung.

Diarization hat keine dokumentierte Obergrenze für Sprecher, in beide Richtungen. Deepgrams Diarization erkennt Sprecher, ohne dass du vorab eine Anzahl angeben musst, und die Dokumentation veröffentlicht kein Maximum. Falls du eine Behauptung wie „unterstützt bis zu 12 Sprecher“ gesehen hast (auch in einer früheren Version dieses Beitrags), diese Zahl steht nicht in Deepgrams Dokumentation. Behandle die Sprecheranzahl als etwas, das du mit deinem eigenen Mehrparteien-Audio testen solltest. Unser Beitrag über den Umgang mit mehreren Sprechern in KI behandelt, was Diarization kann und was nicht.

Preise im Jahr 2026

Hier ist Deepgrams veröffentlichte Pay-as-you-go-Preisgestaltung für Nova-3. Die Zahlen ändern sich, also prüfe die Deepgram-Preisseite, bevor du ein Budget darauf aufbaust.

ModusPreis (Nova-3, Pay-as-you-go)
Vorab aufgezeichnet (Batch), einsprachigEtwa $0,0043 pro Minute (~$0,26/Std.)
Streaming, einsprachigEtwa $0,0077 pro Minute (~$0,46/Std.)
Mehrsprachig (multi) StreamingEtwa $0,0058 pro Minute
Kostenloses Anmeldeguthaben$200, ohne Ablaufdatum
Growth-PlanAb etwa $4.000 pro Jahr, rabattierte Tarife
Nova-3 Kosten pro Stunde nach Modus
Vorab aufgezeichnet (Batch)
~$0,26/Std.
Mehrsprachiger Stream
~$0,35/Std.
Streaming
~$0,46/Std.

Nova-3 Pay-as-you-go, 2026.

Zwei Dinge, die der Minutenpreis verschweigt. Erstens rechnet Deepgram pro Sekunde ab, daher kosten kurze Clips weniger, als der Minutenpreis vermuten lässt. Zweitens ist das $200-Guthaben wirklich großzügig, genug, um viele hundert Stunden Batch-Audio zu transkribieren, bevor du etwas zahlst. Das macht es zu einem echten Evaluierungsbudget statt zu einem Lockangebot.

Wie das im Vergleich zu anderen APIs aussieht

Es ist in Mode, Deepgram als „den günstigsten Anbieter“ zu bezeichnen. Bei Batch-Transkription im Jahr 2026 stimmt das nicht mehr. Hier sind die Basispreise für vorab aufgenommene Audiodateien, normalisiert auf pro Stunde, aus den jeweiligen Preislisten der Anbieter.

Anbieter / ModellBatch-Preis (pro Stunde)
AssemblyAI Universal-2$0,15
Rev AI Reverb$0,20
AssemblyAI Universal-3.5 Pro$0,21
Deepgram Nova-3Etwa $0,26
OpenAI gpt-4o-transcribe$0,36
OpenAI gpt-4o-mini-transcribe$0,18

Nova-3 ist unter den Premium-APIs wettbewerbsfähig bepreist, aber nicht das absolute Minimum. AssemblyAI und Revs KI-Stufe unterbieten es bei den Basis-Batch-Preisen. Wo Deepgram punktet, sind Echtzeit-Latenz und sekundengenaue Abrechnung, nicht der Listenpreis. Eine Einschränkung, die jede solche Tabelle nur als Ausgangspunkt taugt: Das sind Basis-Transkriptionspreise, und einige Anbieter (AssemblyAI sagt das ausdrücklich) berechnen Sprecher-Diarisierung, Zusammenfassungen und andere Verständnisfunktionen separat, also ist der Basispreis nicht Ihre endgültige Rechnung.

Für Solo-Kreative und kleine Teams ist keine dieser Pro-Minute-APIs ohnehin meist der richtige Kauf. Sobald Sie etwa 40 Stunden Audio pro Monat überschreiten, schlägt ein Pauschalangebot mit unbegrenzter Nutzung wie CATT Pro für $9,99/Monat die verbrauchsabhängige Abrechnung. Unser Vergleich der Transkriptionspreise führt durch die Mathematik des Umschaltpunkts.

Streaming vs. Batch

Nova-3 bedient beides über unterschiedliche Endpunkte, und die Anwendungsfälle sind klar getrennt.

Streaming

Streaming ist für Situationen, in denen der Nutzer die Ausgabe sieht, während sie entsteht: Live-Untertitel, Echtzeit-Transkription von Meetings, Sprachassistenten-Eingaben, Barrierefreiheits-Tools. Eine Latenz unter 500 Millisekunden ist entscheidend, und die absolute Genauigkeit kann leicht sinken, weil das Modell oft Korrekturen zeigt, sobald es mehr Kontext erhält. Nova-3-Streaming liefert vorläufige Transkripte (beste Schätzung, kann überarbeitet werden), gefolgt von finalen Transkripten (gesperrt), sobald mehr Audio eintrifft. Die meisten Integrationen übernehmen den Wechsel automatisch.

Batch

Batch-Modus ist für vorab aufgenommenes Audio. Die Latenz liegt bei kurzen Dateien im Sekundenbereich, bei langen im Minutenbereich, und die Genauigkeit ist höher als beim Streaming, weil das Modell den vollständigen Audiokontext hat. Der Großteil der Standard-Transkriptionsarbeit, einschließlich der Uploads im CATT-Transkriptionstool für Englisch, läuft im Batch-Modus. Echtzeit ist bei Live-Untertitelungs-Workflows üblich und bei Upload-und-Warten-Tools seltener.

Wo Nova-3 in der CATT-Pipeline steht

ConvertAudioToText leitet jeden Auftrag an die Engine weiter, die am besten passt, und der Nutzer wählt nie selbst. Es ist wichtig, ehrlich über Nova-3s tatsächliche Rolle hier zu sein, denn es ist nicht der Standard für die meisten Aufträge.

Der ConvertAudioToText-Uploader: Datei per Drag-and-Drop ablegen, live aufnehmen oder URL einfügen, die ersten 10 Minuten kostenlos
Der ConvertAudioToText-Uploader: Datei per Drag-and-Drop ablegen, live aufnehmen oder URL einfügen, die ersten 10 Minuten kostenlos

  • AssemblyAI Universal ist die Standard-Premium-Engine für angemeldete Konten, weil diarisierte Ausgabe für Kontoinhaber Priorität hat.
  • Cloudflare Whisper ist die Standard-Free-Engine für anonyme Landing-Page-Vorschauen, weil sie $0 kostet.
  • Deepgram Nova-3 ist der Standard für Meeting-Bot-Aufnahmen, der diarisierte Fallback, wenn AssemblyAI und Gladia nicht verfügbar sind, ein Fallback für die kostenlose Stufe, und die Engine, die du bekommst, wenn du explizit Deepgram anforderst.

Nova-3 ist also ein echter, tragender Teil des Stacks, aber als Meeting-Bot-Standard und zuverlässiger Fallback, nicht als primäre Engine für Uploads. Der praktische Effekt für Nutzer: Die Pipeline wählt die Engine basierend auf Sprache, Audiolänge, Kontostatus und Feature-Bedarf (Diarisierung, Zusammenfassung), und du bekommst die beste Passung, ohne zu wählen. Der sauberste Weg, die Ausgabequalität zu sehen, ist, deine eigene Datei durch das 60-minütige kostenlose englische Tool laufen zu lassen.

So entscheidest du zwischen Nova-3 und Whisper

Eine kurze Checkliste.

  • Echtzeit-Latenz ist entscheidend: Nova-3.
  • Self-Hosting oder Air-Gapped-Anforderung: Whisper.
  • Abdeckung von 99 Sprachen ist wichtig: Whisper.
  • 50 plus gut unterstützte Sprachen reichen aus, und du willst sekundengenaue Cloud-Abrechnung: Nova-3.
  • Closed-Source-Compliance ist akzeptabel, und du willst verwaltete Infrastruktur: Nova-3.
  • Open-Source-Compliance ist Pflicht: Whisper, keine Frage.

Für die meisten Produktions-Transkriptionstools im Jahr 2026 ist die ehrliche Antwort „nutze beide und route je nach Anfrage zwischen ihnen“. Genau das machen ConvertAudioToText und mehrere Tools im Bereich der Otter-Alternativen im Hintergrund.

Häufig gestellte Fragen

Wie viel kostet Deepgram Nova-3 pro Minute?

Nova-3 für vorab aufgenommene (Batch-)Transkription kostet etwa 0,0043 $ pro Minute, also ungefähr 0,26 $ pro Stunde, im Pay-as-you-go-Tarif. Streaming liegt bei etwa 0,0077 $ pro Minute, also rund 0,46 $ pro Stunde. Mehrsprachiges Streaming kostet etwa 0,0058 $ pro Minute. Deepgram rechnet pro Sekunde Audio ab, und neue Konten erhalten ein 200-$-Guthaben ohne Ablaufdatum. Preise ändern sich, also prüfe vor der Budgetplanung die Preisseite von Deepgram.

Ist Nova-3 genauer als Whisper?

In Deepgrams eigenen Benchmarks wurde Nova-3 in allen 7 getesteten Sprachen gegenüber Whisper bevorzugt, in einigen Fällen mit einem Verhältnis von bis zu 8 zu 1. Das ist Deepgrams Test, kein unabhängiger. In der Praxis sind die beiden bei sauberem englischem Einzelsprecher nahezu gleichauf, und bei den schwierigsten Audiodaten (starke Akzente, Telefonqualität, überlappende Sprache) ist der Unterschied gering und hängt von deinem konkreten Audio ab. Die einzige Zahl, die zählt, ist die, die du selbst misst.

Wie viele Sprachen unterstützt Nova-3?

Nova-3 wurde im Januar 2025 mit 36 Sprachen eingeführt und bis 2025 laut Deepgrams aktueller Dokumentation auf über 50 erweitert. Echtzeit-Code-Switching, bei dem das Modell Audio verarbeitet, das mitten im Stream Sprachen mischt, wird für 10 Sprachen unterstützt: Englisch, Spanisch, Französisch, Deutsch, Hindi, Russisch, Portugiesisch, Japanisch, Italienisch und Niederländisch. Whisper deckt weiterhin mehr Sprachen insgesamt ab, etwa 99, allerdings mit unterschiedlicher Qualität.

Kann ich Nova-3 selbst hosten oder offline ausführen?

Nein. Nova-3 ist ein geschlossenes kommerzielles Modell. Du kannst es nicht herunterladen, offline ausführen oder mit eigenen Daten feinabstimmen, außerhalb eines Unternehmensvertrags. Wenn du Self-Hosting, eine luftdichte Bereitstellung oder volle Datenkontrolle brauchst, ist ein offenes Modell wie Whisper Large-v3 der richtige Weg.

Was ist Keyterm-Prompting und hilft es wirklich?

Keyterm-Prompting erlaubt es dir, bis zu 100 erwartete Begriffe (Firmennamen, Produktnamen, medizinische oder juristische Fachbegriffe) mit einer Transkriptionsanfrage zu übergeben, und Nova-3 neigt zu diesen, ohne dass ein erneutes Training nötig ist. Es hilft am meisten, wenn dein Audio voller Eigennamen oder domänenspezifischem Vokabular ist, das ein allgemeines Modell übersehen würde. Bei einer Liste mit gängigen Namen, Medikamentennamen oder technischen Begriffen verbessert selbst eine kurze Keyterm-Liste die Genauigkeit bei diesen spezifischen Wörtern spürbar.

Wie viele Sprecher kann Nova-3s Diarisierung verarbeiten?

Deepgrams Diarisierung erkennt Sprecher, ohne dass du vorab eine Anzahl angibst, und die Dokumentation veröffentlicht kein Maximum. Behauptungen über eine spezifische Obergrenze wie „bis zu 12 Sprecher“ stehen nicht in Deepgrams Doku. Behandle die Sprecherzahl als etwas, das du bei deinem eigenen Audio mit mehreren Teilnehmern selbst verifizieren solltest, denn die Qualität der Diarisierung bei überlappenden oder überfüllten Aufnahmen variiert je nach Engine.

Unterstützt Deepgram Nova-3 Echtzeit-Streaming-Transkription?

Ja. Nova-3 unterstützt Streaming über einen WebSocket-Endpunkt mit einer Ende-zu-Ende-Latenz im Bereich von 200 bis 300 Millisekunden unter guten Bedingungen. Es liefert vorläufige Transkripte, die noch überarbeitet werden können, und anschließend finalisierte Transkripte, die gesperrt sind, sobald weitere Audiodaten eintreffen. Das ist Nova-3s stärkster Anwendungsfall im Vergleich zu Batch-First-Modellen wie Whisper.

Ist Nova-3 die günstigste Transkriptions-API?

Nicht bei Batch-Verarbeitung. Im Jahr 2026 unterbieten AssemblyAI Universal-2 (0,15 $/Std.), Rev AI Reverb (0,20 $/Std.) und AssemblyAI Universal-3.5 Pro (0,21 $/Std.) alle Nova-3s ungefähren Basis-Batch-Satz von 0,26 $/Std. Nova-3 punktet stattdessen mit Echtzeit-Latenz und sekundengenauer Abrechnung, nicht mit dem niedrigsten Listenpreis. Beachte, dass einige Anbieter Diarisierung und andere Funktionen separat abrechnen, die Basissätze also nicht die Gesamtkosten widerspiegeln.

Wo man anfängt

Der sauberste Weg, Nova-3 mit deinem eigenen Audiomaterial zu testen, ist, es über einen Dienst laufen zu lassen, der es nutzt. Die 60-minütige CATT-Testversion deckt eine echte Evaluierung ab. Für Deepgrams eigenen Onboarding-Prozess reicht das 200-Dollar-Self-Service-Guthaben für hunderte Stunden Batch-Nova-3-Verarbeitung, was mehr als genug ist, um es mit deinem bestehenden Workflow zu vergleichen, bevor du ein Budget festlegst.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles