Deepgram Nova-3の2026年価格、バッチは1分あたり$0.0043、ストリーミングは$0.0077
deepgramnova音声認識

Deepgram Nova-3の2026年価格、バッチは1分あたり$0.0043、ストリーミングは$0.0077

BMMamane B. MoussaMay 26, 2026Updated June 30, 20262 min read

Summarize this article with:

TL;DR

Deepgram Nova-3は、低遅延のストリーミングと大量のバッチ処理向けに作られたクローズドな商用音声認識モデルです。録音済み音声は1分あたり約$0.0043(1時間あたり約$0.26)、ストリーミングは1分あたり約$0.0077で、50以上の言語に対応し、10言語でのリアルタイムコードスイッチングと、専門用語向けのキータームプロンプティングを備えています。精度と遅延の数値は強いですが自己公表なので、信頼する前に自分の音声でテストしてください。リアルタイム処理や厳しい遅延要件にはNova-3を、オープンソース、セルフホスティング、または99言語のカバレッジが必要ならWhisperを選びましょう。

Deepgramは2025年1月、前世代の主力音声認識モデルであるNova-2の後継としてNova-3をリリースしました。現在、Nova-3は2025年と2026年に出荷されたリアルタイムおよび高スループット文字起こしツールの一部を支え、ConvertAudioToTextパイプラインの一部でも動作しています。この記事では、Nova-3が何なのか、2026年時点での実際の価格と制限、そしてオープンソースの定番であるWhisperとの比較について解説します。

私は週の大半を音声を文字起こしエンジン間でルーティングすることに費やしているので、ここでの目標はベンダーが公開してくれたらいいのにと思うバージョンを提示することです。つまり、現実の数字、マーケティング用の数字、そしてその境界線です。

見出しの精度とレイテンシの数値はDeepgram自身のベンチマークであり、独立したものではありません。 そのため、出発点として扱い、自分の音声でテストしてください。リアルタイムのレイテンシや秒単位の課金が重要な場合はNova-3を選び、オープンソースの制御、セルフホスティング、またはあまり一般的でない言語のカバレッジが必要な場合はWhisperを選んでください。

アーキテクチャ: 実際に文書化されている内容

Deepgramはパラメータ数、レイヤー数、Nova-3が使用する特定のトランスフォーマーバリアントを公開していません。これはクローズドな商用モデルであり、アーキテクチャはブラックボックスです。 同社が公に文書化しているのは以下の通りです。

  • エンドツーエンドのモデルです。音響モデリング、言語モデリング、最終的なテキスト生成を3つの別々の段階ではなく、同じネットワークが処理します。
  • 企業の通話音声、ポッドキャスト、会話データ、ノイズの多い実世界の録音を含む、大規模な独自音声データセットでトレーニングされています。
  • 同じ基盤モデルから、ストリーミング(リアルタイム)と録音済みAPIの両方のモードを提供します。
  • 単語レベルのタイムスタンプと信頼度スコアを直接返します。

Deepgramのエンジニアリング姿勢は、推論レイテンシと1分あたりのコストの最適化に重点を置いてきました。Nova-3もその路線を継承しており、ローンチでは生の精度を追求するのではなく、スピードとカスタマイズを売りにしていました。

Nova-2から変わった点

DeepgramのNova-3発表記事では、Nova-2からの改善点として、いくつかの狙いを定めた改良が強調されています。

キータームプロンプティング。 これが目玉機能です。リクエスト時に最大100個のキーターム(企業名、薬剤名、技術用語など)を渡すことができ、モデルはそれらに偏るように動作します。モデルの再トレーニングは不要です。Deepgramはこれを、音声AIモデルにおける同種のものとしては初のセルフサービス型カスタマイズだと述べています。ドメイン固有の語彙に対しては、これが最も有用な単一の追加機能です。

リアルタイムのコードスイッチング。 Nova-3は、文の途中で言語が切り替わる音声を、multi言語コードを使って10言語(英語、スペイン語、フランス語、ドイツ語、ヒンディー語、ロシア語、ポルトガル語、日本語、イタリア語、オランダ語)で文字起こしできます。Nova-2は混合言語の音声をうまく処理できませんでした。

より広い言語カバレッジ。 Nova-3は36の対応言語で発売され、Deepgramは2025年を通じて現在のドキュメントによると50以上に拡大しました。

無音や音楽での幻覚の減少。 旧世代のDeepgramモデルは、音楽のみやほぼ無音の区間でテキストを生成することがありました。Nova-3はパイプライン内に音声アクティビティ検出を組み込み、これらの誤検出を抑制します。この重要性については、音声アクティビティ検出の仕組みに関する記事で詳しく説明しています。

精度の主張を正直に読む

ここが多くの記事で間違っているポイントなので、注意深く読んでください。DeepgramがNova-3について公開するすべての精度数値は、Deepgram自身のテストに基づいています。 背後にある中立的な第三者ベンチマークは存在しません。以下は発表記事が実際に主張している内容で、混同されないように分けて記載します。

  • ストリーミング単語誤り率(WER):次点の競合他社より54.2%低い。ただしDeepgramはその競合名を明かしていない。中央値WERは6.84%に対し、競合は14.92%。
  • バッチWER:次点の競合他社より47.4%低い。 中央値WERは5.26%に対し、およそ10%。
  • Whisperとの直接比較:Deepgramによると、Nova-3はテストした7言語すべてで優先され、 一部では8対1の割合で好まれ、約200の音声サンプルで検証された。

「54%」という数字は、名前を伏せた競合他社との比較であり、Whisperとの比較ではない。 Whisperとの比較は、別途行われた7言語中7言語での優先テストだ。多くの二次情報では、この2つを混同して「Whisperより54%正確」としているが、Deepgramはそんなことは言っていない。また、WERは音声品質、アクセント、ドメインに大きく依存するため、ベンダーが自社のテストセットで出した中央値は、あなたの通話録音での性能を保証するものではない。

覚えておくべきこと: Nova-3の精度数値は、実際のベンチマークに基づく本物の主張だが、それはベンダー自身のベンチマークだ。あなたのプロジェクトにとって重要な唯一の数字は、自分の音声で測定したものだけだ。

本番運用での強み

Nova-3が一貫してその価値を発揮する分野。

リアルタイムのレイテンシ。 ストリーミングAPIは、良好な条件下でエンドツーエンドのレイテンシが200〜300ミリ秒の範囲で文字起こしを生成し、Nova-2と同等だ。ライブキャプション、音声アシスタント、話している間にテキストが表示されるのを見る会議の文字起こしでは、ここがDeepgramがWhisperのようなバッチ優先モデルより一歩先を行く点だ。

秒単位の課金。 Deepgramは処理した音声の秒数で課金し、1分単位に切り上げることはない。短いクリップを大量に処理する場合、この切り上げの差は、切り上げ方式のプロバイダーと比べて実際に節約できる金額になる。

スケールでのスループット。 Deepgramのインフラは大量処理向けに設計されている。1日数千時間を文字起こしするチームは、自社運用のシングルテナントデプロイでは負荷がかかる状況でも、安定したスループットを報告している。

キータームプロンプティング。 期待される用語の短いリストを渡すだけで、固有名詞やドメイン語彙の精度が目に見えて向上します。再トレーニングもバッチジョブも不要です。誤転写された名前の修正に関する記事では、この設定が有効なケースを解説しています。

適切に調整された信頼スコア。 Nova-3は単語レベルの信頼度を返し、後段の処理でそのまま活用できます。文字起こしの信頼スコアに関する記事では、その使い方を紹介しています。

既知の弱点

Nova-3が及ばない点を、率直に述べます。

クローズドなモデルです。 Nova-3をセルフホストしたり、オフラインで実行したり、エンタープライズ契約外で自社データにファインチューニングしたりすることはできません。厳格なデータ所在地要件やエアギャップ環境では、Whisperのようなオープンモデルが唯一の選択肢です。文字起こしのデータ所在地に関する記事では、この制約が決定的な障壁となるケースを扱っています。

言語カバレッジはWhisperに及びません。 Nova-3は50以上の言語をしっかりサポートしますが、Whisperは品質にばらつきがあるものの約99言語に対応します。あまり一般的でない言語のコンテンツでは、Whisperがデフォルトで勝つことが多いです。AIが低リソース言語で苦戦する理由に関する記事で、そのギャップを詳しく説明しています。

最難関の音声では差が出ません。 クリーンな単一話者の英語では、Nova-3とWhisper Large-v3はほぼ互角です。最悪の条件下(強いアクセント、低ビットレートの電話音声、話者の重なり)でも、両者の差は小さく、ユースケース次第です。Whisper Large-v3の解説でその比較を取り上げています。

公開された監査の記録がありません。 アーキテクチャとトレーニングデータが非公開のため、体系的なバイアスや障害モードを評価するには、論文を読むのではなく実地テストが必要です。モデルの出自が重要となる研究や規制対象の用途では、この不透明さが実際の制約となります。

話者分離には、文書化された話者数の上限はありません。どちらの方向にもです。 Deepgramの話者分離は、事前に人数を指定しなくても話者を検出し、ドキュメントにも最大数は記載されていません。もし「最大12話者まで対応」という記述を見かけたら(この記事の以前のバージョンも含みます)、その数字はDeepgramのドキュメントには存在しません。話者数は、ご自身の複数話者音声でテストすべき項目として考えてください。AIでの複数話者の処理に関する記事では、話者分離ができることとできないことを説明しています。

2026年の料金

以下は、Deepgramが公開しているNova-3の従量課金制料金です。料金は変動するため、予算を組む前にDeepgramの料金ページで確認してください。

モード料金(Nova-3、従量課金制)
事前録音(バッチ)、単一言語1分あたり約$0.0043(1時間あたり約$0.26)
ストリーミング、単一言語1分あたり約$0.0077(1時間あたり約$0.46)
多言語(multi)ストリーミング1分あたり約$0.0058
無料サインアップクレジット$200、有効期限なし
グロースプラン年間約$4,000から、割引料金
Nova-3 cost per hour by mode
Pre-recorded (batch)
~$0.26/hr
Multilingual stream
~$0.35/hr
Streaming
~$0.46/hr

Nova-3 pay-as-you-go, 2026.

1分あたりの料金が隠している2つのこと。 まず、Deepgramは秒単位で請求するため、短いクリップのワークロードは1分あたりの料金が示すよりも安くなります。次に、$200の無料クレジットは実質的に大きく、バッチ音声なら何百時間分もの文字起こしを無料で行えるため、お試しではなく実際の評価予算として使えます。

他のAPIとの比較

Deepgramを「最安」と呼ぶのが流行っていますが、2026年のバッチ文字起こしでは、それはもはや事実ではありません。以下は各プロバイダーの公開価格をもとに、1時間あたりに正規化した基本の録音済み音声レートです。

プロバイダー / モデルバッチ価格(1時間あたり)
AssemblyAI Universal-2$0.15
Rev AI Reverb$0.20
AssemblyAI Universal-3.5 Pro$0.21
Deepgram Nova-3約$0.26
OpenAI gpt-4o-transcribe$0.36
OpenAI gpt-4o-mini-transcribe$0.18

Nova-3はプレミアムAPIの中では競争力のある価格ですが、最安値ではありません。 AssemblyAIとRevのAI層は、基本バッチレートでこれを下回っています。Deepgramが勝るのはリアルタイムのレイテンシーと秒単位の課金であり、表示価格ではありません。ただし、このような表が単なる出発点に過ぎない理由が一つあります。これらは基本の文字起こしレートであり、一部のプロバイダー(AssemblyAIはこれを明示しています)は話者分離、要約、その他の理解機能を別途課金するため、基本レートが請求額の合計になるわけではありません。

個人クリエイターや小規模チームにとって、これらの分単位APIはそもそも通常は適切な選択肢ではありません。月に約40時間の音声を超えると、CATT Proの月額$9.99のような定額無制限プランが従量課金より有利です。当社の文字起こし価格比較で、その分岐点の計算を詳しく解説しています。

ストリーミングとバッチ

Nova-3は両方を異なるエンドポイントで提供しており、ユースケースも明確に異なります。

ストリーミング

ストリーミングは、ユーザーが出力を生成された時点で見る場合に使います。 ライブキャプション、リアルタイム会議の文字起こし、音声アシスタントの入力、アクセシビリティツールなどです。500ミリ秒未満のレイテンシーが重要で、モデルが文脈を得るにつれて修正を表示することが多いため、絶対的な精度は若干低下することがあります。Nova-3のストリーミングは、暫定トランスクリプト(最良の推測、修正される可能性あり)を返し、その後、より多くの音声が到着するにつれて確定トランスクリプト(固定)を返します。ほとんどの統合はこの切り替えを自動的に処理します。

バッチ

バッチモードは録音済み音声向けです。 短いファイルなら数秒、長いファイルなら数分のレイテンシがあり、モデルが音声全体のコンテキストを持つため、ストリーミングより精度が高くなります。標準的な文字起こし作業の大半、たとえばCATT英語文字起こしツールへのアップロードはバッチ処理です。リアルタイム処理はライブキャプションのワークフローで一般的で、アップロードして待つタイプのツールではまれです。

CATTパイプラインにおけるNova-3の位置づけ

ConvertAudioToTextは各ジョブを最適なエンジンにルーティングし、ユーザーが選ぶ必要はありません。ここでNova-3の実際の役割を正直に説明するのは重要です。なぜなら、ほとんどのジョブでデフォルトではないからです。

ConvertAudioToTextのアップローダー: ファイルのドラッグ&ドロップ、ライブ録音、URL貼り付けが可能。最初の10分間は無料
ConvertAudioToTextのアップローダー: ファイルのドラッグ&ドロップ、ライブ録音、URL貼り付けが可能。最初の10分間は無料

  • AssemblyAI Universalは、登録アカウント向けのデフォルトのプレミアムエンジンです。 アカウント保有者にとって話者分離出力が最優先だからです。
  • Cloudflare Whisperは、匿名のランディングページプレビュー向けのデフォルトの無料エンジンです。 コストが0円だからです。
  • Deepgram Nova-3は、ミーティングボット録音のデフォルトです。 AssemblyAIとGladiaが利用できない場合の話者分離対応フォールバック、無料ティアのフォールバック、そしてDeepgramを明示的にリクエストした場合に使われるエンジンでもあります。

つまりNova-3は、スタックの実質的な一部ですが、ミーティングボットのデフォルトと信頼できるフォールバックとしてであり、アップロードの主要エンジンではありません。ユーザーへの実質的な影響: パイプラインは言語、音声の長さ、アカウント状態、機能要件(話者分離、要約)に基づいてエンジンを選び、選択せずに最適な組み合わせが得られます。 出力品質を最も明確に確認する方法は、自分のファイルを60分無料英語ツールに通すことです。

Nova-3とWhisperの選び方

簡単なチェックリストです。

  • リアルタイムのレイテンシーが重要なら: Nova-3。
  • セルフホストやエアギャップ環境が必要なら: Whisper。
  • 99言語対応が重要なら: Whisper。
  • 50以上の言語対応で十分、かつ秒単位のクラウド課金が欲しいなら: Nova-3。
  • クローズドソースのコンプライアンスが許容でき、マネージド基盤が欲しいなら: Nova-3。
  • オープンソースのコンプライアンスが必須なら: Whisper、文句なし。

2026年の本番向け文字起こしツールの大半では、正直な答えは「両方使って、リクエストごとにルーティングする」です。ConvertAudioToTextや、Otterの代替ツールのいくつかは、裏でそうしています。

よくある質問

Deepgram Nova-3の1分あたりのコストは?

Nova-3の録音済み(バッチ)文字起こしは、従量課金プランで1分あたり約$0.0043、1時間あたり約$0.26です。ストリーミングは1分あたり約$0.0077、1時間あたり約$0.46。多言語ストリーミングは1分あたり約$0.0058です。Deepgramは音声の秒単位で請求し、新規アカウントには有効期限なしの$200クレジットが付与されます。価格は変動するので、予算を組む前にDeepgramの料金ページで確認してください。

Nova-3はWhisperより正確ですか?

Deepgram自身のベンチマークでは、Nova-3はテストした7言語すべてでWhisperより好まれ、一部では8対1の割合で選ばれました。ただし、これはDeepgramのテストであり、独立したものではありません。実際には、クリーンな単一話者の英語では両者はほぼ同等で、最も難しい音声(強いアクセント、電話品質の録音、重なり合う発話)では差は小さく、特定の音声に依存します。重要なのは、自分で測定した数字だけです。

Nova-3は何言語に対応していますか?

Nova-3は2025年1月に36言語でリリースされ、その後2025年にかけて拡張され、現在のDeepgramのドキュメントによると50以上に対応しています。リアルタイムのコードスイッチング(モデルが途中で言語が混ざる音声を処理する機能)は、英語、スペイン語、フランス語、ドイツ語、ヒンディー語、ロシア語、ポルトガル語、日本語、イタリア語、オランダ語の10言語でサポートされています。Whisperは依然として合計でより多くの言語(約99言語)をカバーしていますが、品質はさまざまです。

セルフホストやオフラインでのNova-3実行は可能ですか?

いいえ。Nova-3はクローズドな商用モデルです。ダウンロードしてオフラインで実行したり、エンタープライズ契約外で独自データを使ってファインチューニングしたりすることはできません。セルフホスティング、エアギャップ環境でのデプロイ、完全なデータ管理が必要な場合は、Whisper Large-v3のようなオープンモデルが適しています。

キータームプロンプティングとは何ですか?実際に効果はありますか?

キータームプロンプティングでは、文字起こしリクエストと一緒に最大100個の予想用語(会社名、製品名、医療用語や法律用語)を渡すことができ、Nova-3は再トレーニングなしでそれらに偏るように動作します。これは、音声に固有名詞や一般的なモデルが見逃しがちな専門用語が多く含まれる場合に最も効果的です。一般的な名前、薬剤名、技術用語のリストがある場合、短いキータームリストでも特定の単語の精度が顕著に向上します。

Nova-3のダイアライゼーションは何人の話者に対応できますか?

Deepgramのダイアライゼーションは、事前に人数を指定しなくても話者を検出しますが、ドキュメントには最大人数は公開されていません。「最大12話者まで」といった具体的な上限の主張はDeepgramのドキュメントにはありません。話者数は、自分で複数話者の音声で確認すべき項目です。重なりや混雑した録音でのダイアライゼーション品質はエンジンによって異なるためです。

Deepgram Nova-3はリアルタイムのストリーミング文字起こしをサポートしていますか?

はい。Nova-3はWebSocketエンドポイントを通じてストリーミングを提供し、良好な条件下でのエンドツーエンドのレイテンシは200〜300ミリ秒の範囲です。追加の音声が到着するにつれて、修正される可能性のある暫定トランスクリプトを返し、その後、確定されたトランスクリプトがロックされます。これは、Whisperのようなバッチ優先モデルと比較した場合、Nova-3の最も強力なユースケースです。

Nova-3は最も安い文字起こしAPIですか?

バッチ処理ではそうではありません。2026年現在、AssemblyAI Universal-2($0.15/時間)、Rev AI Reverb($0.20/時間)、AssemblyAI Universal-3.5 Pro($0.21/時間)はすべて、Nova-3のバッチ基本レート(およそ$0.26/時間)を下回っています。Nova-3は、最低の表示価格ではなく、リアルタイムのレイテンシと秒単位の課金で競争しています。一部のプロバイダーはダイアライゼーションやその他の機能を別途請求するため、基本レートは総コストではないことに注意してください。

どこから始めるか

Nova-3を自分の音声に対して評価する最もクリーンな方法は、それを利用するサービスを通じて実行することです。60分のCATT無料ティアは実際の評価をカバーしています。Deepgram自身のオンボーディングでは、$200のセルフサービス・クレジットで、バッチNova-3処理の数百時間分がカバーされ、予算を確定する前に既存のワークフローと比較するには十分すぎる量です。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles