2026年の音声テキスト変換API料金:Google Cloud vs AWS Transcribe vs OpenAI Whisper vs Deepgram
apitranscriptionpricingdevelopers

2026年の音声テキスト変換API料金:Google Cloud vs AWS Transcribe vs OpenAI Whisper vs Deepgram

BMMamane B. MoussaFebruary 23, 20263 min read

Summarize this article with:

2026年の音声テキスト変換API料金の全体像

音声をテキストに変換するプロダクトを作るには、音声テキスト変換APIを選ぶ必要があります。概念実証(PoC)の段階では精度とレイテンシばかりが注目されますが、スケール時の採算性を決めるのは料金です。1分あたり$0.002の差は些細に聞こえますが、月に10,000時間を処理するようになれば、その差だけで$1,200の追加コストになります。

このガイドでは、2026年の主要4プロバイダー、Google Cloud Speech-to-Text、AWS Transcribe、OpenAI Whisper API、Deepgramの音声テキスト変換API料金を詳しく解説します。各プロバイダーを実際にテストし、料金ドキュメントを精査し、複数のボリューム帯での実際のコストを計算しました。インテグレーションコードを1行も書く前に、十分な情報に基づいた判断ができるはずです。

各プロバイダーを個別に検討している方向けに、Google Cloud Speech-to-Textの料金AWS Transcribeの料金OpenAI Whisper APIの料金を深掘りした専用記事も用意しています。

料金比較の完全一覧表

2026年2月時点での、4プロバイダーすべての音声テキスト変換API料金の全容です。

機能Google Cloud STTAWS TranscribeOpenAI Whisper APIDeepgram
分単価(標準)$0.024$0.024$0.006$0.0043
分単価(拡張)$0.036$0.024(医療:$0.075)N/A(単一モデル)$0.0059(Nova-3)
無料枠月60分月60分(12か月間)なし$200クレジット
ストリーミング対応ありありなし(バッチのみ)あり
対応言語125以上100以上5736
話者識別ありありなし(後処理で対応)あり
カスタム語彙ありありプロンプト経由あり
向いている用途エンタープライズ、多言語AWSネイティブなアプリ、医療コスト重視のバッチ処理大量処理、リアルタイム

一目でわかるポイントがいくつかあります。OpenAI Whisper APIは分単価が最安の$0.006ですが、ストリーミングとネイティブな話者ダイアライゼーションがありません。Deepgramは低価格とフル機能のリアルタイム処理のバランスが最も優れています。Google CloudとAWS Transcribeは標準文字起こしではほぼ同額ですが、拡張モデルや特化型のティアでは大きく差が開きます。

音声テキスト変換APIプロバイダー間の料金比較
音声テキスト変換APIプロバイダー間の料金比較

各プロバイダーの料金モデルを理解する

Google Cloud Speech-to-Textの料金

Google Cloud Speech-to-Textは、使用する認識モデルと有効化する機能に基づく段階制の料金モデルを採用しています。

基本料金は15秒単位で切り上げて計算されます。音声クリップが16秒なら、30秒分を支払うことになります。短い音声クリップを大量に処理する場合、この切り上げはコスト計算に無視できない影響を与えます。

  • 標準認識: $0.024/分
  • 拡張認識(Chirp 2): $0.036/分
  • 医療向け文字起こし: $0.078/分
  • データロギングのオプトイン割引: 標準モデルで33%引き

無料枠として、標準認識が月60分、期限なしで利用できます。開発やテストには実際に役立ちますが、本番環境ではすぐに使い切ってしまいます。

機能ごとの追加料金は積み重なります。話者ダイアライゼーション、自動句読点、単語単位のタイムスタンプを有効にしても基本料金は変わりませんが、精度向上のために拡張版のChirp 2モデルに切り替えるとコストは50%増になります。

AWS Transcribeの料金

AWS Transcribeは、標準文字起こしの単一料金と、利用量が増えるほど安くなるボリューム割引というシンプルな料金体系です。

  • 標準文字起こし: $0.024/分
  • 月250K分超: $0.015/分
  • 月1M分超: $0.0102/分
  • 医療向け文字起こし: $0.075/分
  • 通話分析: $0.024/分(ストリーミング)、$0.012/分(通話後)

AWSは15秒単位ではなく秒単位で切り上げるため、短いクリップではGoogle Cloudよりわずかにコスト効率が良くなります。無料枠は最初の12か月間のみ月60分です。それ以降はすべての分に課金されます。

AWSが競争力を持つのはボリューム割引です。月250,000分(約4,167時間)を超えて処理する場合、料金は$0.015/分に下がり、37.5%の割引になります。月100万分を超えるとさらに$0.0102まで下がり、その規模ではほとんどの競合を下回ります。

OpenAI Whisper APIの料金

Whisperに関するOpenAIのAPI料金は、4プロバイダーの中で最もシンプルです。

  • Whisper large-v3: $0.006/分
  • 無料枠なし
  • ボリューム割引なし
  • ストリーミングなし

以上です。ティアもなく、機能ごとの追加料金もなく、選ぶべきモデルバリアントもありません。処理した音声1分あたり$0.006を支払い、入力音声の秒単位で課金されます。

注意すべきは、何が含まれていないかです。Whisper APIはバッチ処理のみで、リアルタイムのストリーミングには対応していません。ネイティブな話者ダイアライゼーションも、カスタム語彙も、単語単位の信頼度スコアもありません。音声を送ると、テキストが返ってくるだけです。多くのアプリケーションにとってはそれで十分ですが、足りない機能が必要な場合は、追加の処理レイヤーを自前で構築するか購入する必要があります。

Deepgramの料金

Deepgramの料金は、モデルと、事前録音かストリーミングかによって変わります。

  • Nova-2(事前録音): $0.0043/分
  • Nova-2(ストリーミング): $0.0059/分
  • Nova-3(事前録音): $0.0059/分
  • Nova-3(ストリーミング): $0.0065/分
  • Whisper Cloud(事前録音): $0.0048/分
  • 従量課金クレジット: 開始時に$200分無料

Deepgramの料金は、フル機能のプロバイダーの中で一貫して最安です。ストリーミング向けのプレミアムモデルNova-3でも$0.0065/分で、Google Cloudの標準モデルよりまだ安い水準です。

開始時の$200クレジットは、Nova-2の事前録音モデルで約46,500分(775時間)の音声を処理できる十分な額で、本格的な評価には最良の無料枠のひとつです。

スケール時のコスト:実際の計算

分単価は比較には便利ですが、本当に重要なのは月末に届く請求額です。一般的な本番ワークロードを代表する3つのボリューム帯での実際のコストを示します。

月100時間(スタートアップ/中小企業)

数百人のアクティブユーザーを抱える文字起こしSaaS、毎週エピソードを処理するポッドキャストネットワーク、小規模なコールセンターなどに典型的なボリュームです。

プロバイダーモデル月額コスト
Google Cloud STT標準$144.00
Google Cloud STT拡張(Chirp 2)$216.00
AWS Transcribe標準$144.00
OpenAI Whisperlarge-v3$36.00
DeepgramNova-2(事前録音)$25.80
DeepgramNova-3(事前録音)$35.40

月100時間の規模では、Deepgram Nova-2はGoogle CloudやAWSの標準より82%安いコストです。OpenAI Whisperは$36.00で2番目に安い選択肢ですが、ストリーミングとダイアライゼーションがありません。このボリュームの時点で、Deepgramとハイパースケーラーの料金差はすでに無視できません。

月1,000時間(グロースステージ)

成長中のSaaSプロダクト、中規模のコールセンター、コンテンツを大量に処理するメディア企業などです。

プロバイダーモデル月額コスト
Google Cloud STT標準$1,440.00
Google Cloud STT拡張(Chirp 2)$2,160.00
AWS Transcribe標準$1,440.00
OpenAI Whisperlarge-v3$360.00
DeepgramNova-2(事前録音)$258.00
DeepgramNova-3(事前録音)$354.00

1,000時間でも同じ傾向が続きます。Google CloudとAWSが月$1,440かかる一方、Deepgramは同じ量を$258で処理します。Google Cloud標準ではなくDeepgram Nova-2を選ぶことで、年間$14,184の節約になります。バーンレートを気にするスタートアップにとって、これは意味のある差です。

月10,000時間(エンタープライズ)

エンタープライズ規模の処理です。グローバルなコールセンター、大規模なメディアアーカイブ、コンプライアンス録音システム、数千人の開発者にサービスを提供する文字起こしAPIなどを想像してください。

プロバイダーモデル月額コスト
Google Cloud STT標準$14,400.00
Google Cloud STT拡張(Chirp 2)$21,600.00
AWS Transcribe標準(段階制)$10,620.00
OpenAI Whisperlarge-v3$3,600.00
DeepgramNova-2(事前録音)$2,580.00
DeepgramNova-3(事前録音)$3,540.00

エンタープライズ規模では、AWSのボリューム割引がようやく効き始め、料金は(割引なしの$14,400から)$10,620に下がります。それでもDeepgram Nova-2が$2,580で勝り、割引後のAWS料金と比べて月**$8,000以上**、Google Cloud標準と比べて月**$11,800以上**の節約になります。

$3,600のOpenAI Whisperは価格面では競争力がありますが、忘れないでください。ストリーミングなし、ダイアライゼーションなし、カスタム語彙なしです。月10,000時間の規模なら、これらの機能はほぼ間違いなく必要になります。

知っておくべき隠れたコスト

各プロバイダーの料金ページに載っている分単価は、話の一部にすぎません。総支出に大きく影響しうる追加コストがいくつかあります。

データ転送と下り(エグレス)料金

Google CloudAWSは、文字起こし結果を自社クラウドの外に持ち出す際のデータエグレスに課金します。アプリケーションがそのエコシステムの外で動いている場合、次の支払いを見込んでください。

  • Google Cloud: 月の最初の1TBまで$0.12/GB
  • AWS: 月の最初の10TBまで$0.09/GB
  • OpenAI: エグレス料金なし(結果はAPIレスポンスで配信)
  • Deepgram: エグレス料金なし

トランスクリプトのデータは小さい(音声1時間あたり数KB)ため、結果に対するエグレスは無視できる程度です。しかし、先に音声ファイルをクラウドストレージにアップロードする場合は、音声ファイルのインジェストと中間処理が積み重なります。CD品質の1時間のWAVファイルは約635MBです。10,000時間を処理するなら、月に約635TBの音声を取り込むことになります。

音声のストレージコスト

コンプライアンス、再処理、品質保証のために元の音声を保持する必要がある場合:

  • Google Cloud Storage: $0.020/GB・月(Standard)
  • AWS S3: $0.023/GB・月(Standard)
  • Cloudflare R2: $0.015/GB・月(エグレス料金なし)

10,000時間分の圧縮音声(128kbpsのMP3で約60TB)の場合、月額ストレージコストはプロバイダーによって$900から$1,380の範囲になります。Cloudflare R2のようにエグレス料金を課さないストレージプロバイダーを使えば、長期的には大幅な節約になります。

音声の前処理

すべてのプロバイダーがすべての音声フォーマットをネイティブに受け付けるわけではありません。元の音声が変換を要するフォーマット(動画ファイル、一般的でないコーデック、マルチチャンネル構成)の場合、次の点を織り込む必要があります。

  • 自社インフラでのFFmpeg処理時間
  • 音声の抽出と変換にかかるコンピュートコスト
  • 中間ファイル用の一時ストレージ

DeepgramとGoogle Cloudは最も幅広い入力フォーマットを受け付けます。AWS Transcribeは、音声がS3にあるか特定のフォーマットでストリーミングされる必要があります。OpenAI Whisperはほとんどの一般的なフォーマットを受け付けますが、リクエストあたり25MBのファイルサイズ制限があり、長いファイルは分割する必要があります。

SDKとインテグレーションのオーバーヘッド

Google CloudとAWSは、いずれも各社のSDK、認証のセットアップ、IAMの設定を必要とします。これは直接的な金銭コストではありませんが、これらのSDKを統合し、保守し、デバッグするエンジニアリング時間は実在します。

OpenAIとDeepgramは、HTTPリクエスト1本とAPIキーだけで呼び出せる、よりシンプルなREST APIを提供しています。小規模なチームにとって、このインテグレーションの複雑さの差は、数日分のエンジニアリング時間の節約につながります。

APIインテグレーションのための開発者ワークスペース
APIインテグレーションのための開発者ワークスペース

あなたのユースケースに最適なAPIはどれか

唯一無二の最強の音声テキスト変換APIというものは存在しません。正しい選択は、ボリューム、機能要件、既存インフラ、予算の制約によって決まります。

スタートアップ・小規模チームに最適

勝者:Deepgram

スタートアップに必要なのは、低コスト、シンプルなインテグレーション、そして契約を再交渉せずにスケールできる余地です。Deepgramはこの3つすべてを満たします。$200の無料クレジットがあれば、インテグレーションの構築とテストを十分に行う余裕があります。Nova-2の$0.0043/分なら、成長してもコストを管理可能な範囲に抑えられます。REST APIは扱いやすく、ストリーミング、ダイアライゼーション、トピック検出を追加料金なしで利用できます。

次点:OpenAI Whisper API — バッチ文字起こしだけが必要で、ストリーミングなしでもやっていける場合。機能面のオーバーヘッドがゼロで$0.006/分という料金は、シンプルさの点では他を圧倒します。

エンタープライズ・大量処理に最適

勝者:AWS Transcribe(ボリューム割引あり)またはDeepgram(エンタープライズ契約あり)

エンタープライズ規模では、話は定価から交渉価格へと移ります。AWS Transcribeは月250K分と1M分で自動的にボリューム割引が適用されるため、営業との商談なしで競争力が増していきます。すでにAWSインフラ上で運用しているなら、インテグレーションはシームレスで、クラウド間のデータ転送も回避できます。

Deepgramはカスタム価格のエンタープライズ契約を提供しており、公開されている事例によれば、非常に大きなボリュームでは分単価を$0.003未満まで下げられます。特定のクラウドプロバイダーにロックインされていないなら、Deepgramのエンタープライズティアは検討に値します。

Google Cloudは、すでにGCPに深く投資していて、言語サポートの広さ(Deepgramの36に対して125以上の言語)に価値を見出す場合に有力な選択肢になります。

多言語アプリケーションに最適

勝者:Google Cloud Speech-to-Text

プロダクトがグローバルなユーザーベースにサービスを提供し、数十の言語の音声を高精度で文字起こしする必要があるなら、Google Cloudの125以上の言語サポートは並ぶものがありません。Chirp 2モデルは、以前のモデルと比べて非英語言語での精度を大きく向上させています。

次点:OpenAI Whisperは57言語に対応し、コードスイッチング(1つの録音内に複数の言語が混在するケース)の扱いはほとんどの競合より優れています。$0.006/分という価格で、コスト効率の良い多言語向けの選択肢です。

Deepgramは36言語に対応しており、主要なグローバル言語の大半をカバーしますが、マイナーな言語や地域方言が必要な場合は不足するかもしれません。

医療・ヘルスケアに最適

勝者:AWS Transcribe Medical

AWS Transcribe Medicalは、HIPAA準拠、医療語彙、循環器科・神経科・腫瘍科・放射線科・泌尿器科向けの専門特化モデルを備えた、ヘルスケア文字起こし専用の製品です。$0.075/分と高額ですが、医療機関は通常、コストよりもコンプライアンスと精度を優先します。

次点:Google Cloudは、Healthcare APIとの統合とHIPAA対応インフラを備えた医療向け文字起こしを$0.078/分で提供しています。

OpenAI WhisperもDeepgramも専用の医療モデルは提供していませんが、Deepgramのカスタム語彙機能は医療用語を認識するように学習させることができます。

リアルタイム・ストリーミングに最適

勝者:Deepgram

Deepgramのストリーミング文字起こしは$0.0059/分(Nova-2)で、話者ダイアライゼーション、中間結果、エンドポインティングを備えながら300ms未満のレイテンシを実現します。ライブ字幕、音声アシスタント、リアルタイムの会議文字起こしのようなアプリケーションにとって、低レイテンシ・フル機能・低コストというこの組み合わせは他を寄せ付けません。

次点:Google Cloudは、幅広い言語サポートを備えた信頼性の高いストリーミングを提供しますが、Deepgramのストリーミング料金の4倍のコストがかかります。

選択肢外:OpenAI Whisper APIは、2026年2月時点でストリーミングに一切対応していません。

ConvertAudioToTextが低コストを実現している方法

ConvertAudioToTextでは、まさに上で述べた料金と機能のバランスを理由に、Deepgramのインフラ上に文字起こしパイプラインを構築しました。DeepgramのNovaモデルを使うことで、そのコスト削減分をユーザーに還元しつつ、話者ダイアライゼーション、感情分析、トピック検出、複数のエクスポート形式を提供しています。

私たちのアーキテクチャはキューベースのシステムで音声を非同期に処理するため、リクエストを効率的にバッチ化でき、不要なときに永続的なストリーミング接続を維持するオーバーヘッドを避けられます。その結果、インフラ、前処理、保守を考慮すると、APIを直接統合する場合に支払う額のほんの一部で、Deepgramの最高モデルの精度を得られるサービスになっています。

生のAPIを使いたい開発者の方は、インテグレーションの手順とコードサンプルを掲載したベスト音声テキスト変換APIガイドをご覧ください。

料金のトレンド:音声テキスト変換APIのコストはどこへ向かうのか

過去3年間で、主要プロバイダー全体の分単価は30〜50パーセント下落しました。この傾向に減速の兆しはありません。コストを押し下げている要因はいくつかあります。

モデル効率の向上。 DeepgramのNova-3やGoogleのChirp 2のような新しいアーキテクチャは、処理する音声1分あたりに必要なコンピュートリソースを減らしながら、より高い精度を達成しています。これらのモデルが成熟するにつれて、プロバイダーはその削減分の一部を顧客に還元します。

オープンソースモデルとの競争。 OpenAIがWhisperをオープンソースで公開したことで、商用プロバイダーは、Whisperにはない機能(ストリーミング、ダイアライゼーション、カスタムモデル)で価格プレミアムを正当化せざるを得なくなりました。この健全な競争圧力が、価格を下げ続けています。

ハードウェアの進歩。 より効率的な推論ハードウェア(カスタムASIC、最適化されたGPUクラスタ)への移行により、大規模に音声認識を実行する際の純粋なコンピュートコストが下がっています。

ボリュームの成長。 音声テキスト変換を統合するアプリケーション(アクセシビリティ機能、コンテンツのインデックス化、会議ツール、音声インターフェース)が増えるにつれて市場全体のボリュームが拡大し、プロバイダーはインフラコストをより多くの分数で按分できるようになります。

複数年にわたるインテグレーションを計画している方にとって、これは今日選んだAPIが時間とともに安くなる可能性が高いことを意味します。有利な料金条件を今のうちに確保し、年率10〜15パーセントのコスト低下を見込んで予算を組みましょう。

よくある質問

2026年に最も安い音声テキスト変換APIは?

$0.0043/分のDeepgram Nova-2が、フル機能の音声テキスト変換APIとしては最安です。ストリーミングやダイアライゼーションなしのバッチ文字起こしだけが必要なら、$0.006/分のOpenAI Whisper APIがボリュームコミットメントなしで最も安い選択肢です。非常に大きなボリューム(月100万分超)では、AWS Transcribeの段階制料金が$0.0102/分まで下がり、Deepgramの定価と競合する水準になります。

Google Cloud Speech-to-Textに無料枠はある?

あります。Google Cloudは、期限なしで月60分の標準認識を無料で提供しています。12か月で失効するAWS Transcribeの無料枠とは異なり、この無料枠は無期限に継続します。60分という量は開発とテストには十分ですが、意味のある本番ワークロードには足りません。

OpenAI Whisper APIは本番利用に耐える?

リアルタイムストリーミングや話者ダイアライゼーションが不要なバッチ文字起こしのワークロードであれば、Whisper APIは本番でも堅実な選択です。精度はより高価な代替手段に匹敵し、特に英語では顕著です。主な制約は、ストリーミング非対応、リクエストあたり25MBのファイルサイズ制限、そしてネイティブな話者識別がないことです。ユースケースにこれらの機能のいずれかが必要なら、追加の処理レイヤーを構築するか、別のプロバイダーを選ぶ必要があります。

月々の音声テキスト変換APIコストはどう見積もる?

月間の音声ボリュームを分単位で計算し、選んだプロバイダーとモデルの分単価を掛けます。たとえば、Deepgram Nova-2で月500時間の音声を処理する場合:500時間 x 60分 x $0.0043 = 月$129です。音声のストレージ、データエグレス(Google CloudとAWSの場合)、音声フォーマット変換に必要な前処理のコンピュートといった隠れたコストも忘れずに織り込みましょう。

アプリケーションを作り直さずに音声テキスト変換APIを乗り換えられる?

プロバイダーの切り替えには、APIインテグレーションのコード、認証、場合によっては音声前処理パイプラインの変更が必要ですが、中核のワークフロー(音声を送り、テキストを受け取る)はどのプロバイダーでも似ています。切り替えコストを最小化するには、文字起こしロジックを内部インターフェースの背後に抽象化し、アプリケーションの他の部分に手を入れずにプロバイダーを差し替えられるようにしましょう。ConvertAudioToTextのようなサービスはこの抽象化を肩代わりするため、APIインテグレーションを直接管理することなく、その時点で最良の文字起こしを利用できます。

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles