文字起こし精度の解説、99%が実際に意味するもの
文字起こし精度基礎

文字起こし精度の解説、99%が実際に意味するもの

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

ワードエラーレート(WER)は標準的な精度指標で、エラー数を参照文字数で割り、100から引いたパーセンテージで表します。「99%精度」という主張は聞こえはいいけど、実際はきれいなオーディオブックの録音から来ていることが多く、会議や電話では出ません。同じモデルでもスタジオ音声で98%を叩き出しても、ノイズやアクセントのある音声だと75〜85%まで落ちることがあります。この記事では計算方法、ベンチマークのトリック、そして各精度帯が実際にどう感じるかを説明します。

文字起こしの精度は、どのベンダーも宣伝する指標でありながら、ほとんどどのベンダーも説明しない指標です。 短く言うと、「精度」とはワードエラー率をパーセンテージに変換したもので、その数値自体と同じくらいベンチマークの出所が重要であり、アップロードするファイルがマーケティング上の主張を生んだ条件に一致することはめったにありません。

ワードエラー率が実際に測定するもの

式は次のとおりです。

WER = (置換 + 削除 + 挿入) / 参照単語の総数

3種類のエラーはそれぞれ1ポイントとして数えられます。

  • 置換。 「彼はそう言った」が「彼女はそう言った」と文字起こしされる。
  • 削除。 「レポートを送って」が「レポート送って」と文字起こしされる。
  • 挿入。 「私たちは会った」が「私たちは会ってしまった」と文字起こしされる。

1,000語の参照トランスクリプトに50のエラーがある場合、WERは5%となり、製品ページでは「精度95%」となります。計算自体は問題ありません。この数値が隠しているのは、WERがすべての単語を同一に扱うことです。「送金を承認しないでください」の「ない」が抜けるのも1ポイント、「ええと」が抜けるのも1ポイントです。あなたのワークフローへの損害は同等ではありません。

また、WERは文脈の誤りを罰しません。「two」を一貫して「to」と文字起こしするモデルは、ほとんどの音声でWERのペナルティをほとんど示しませんが、数字を解析するスクリプトは壊してしまいます。

精度の帯が実際にどう感じられるか

数字だけを見ると誤解しやすいものです。1時間のインタビュー(およそ9,000語)の場合:

精度エラー数1分あたりのエラー得られるもの
99%901.5ほぼクリーンな人間のトランスクリプト、軽いスポットチェックのみ
97%2704.5読める状態、公開前に15〜20分の編集パス
95%4507.5特に固有名詞で目立つ誤り、30〜45分の編集パス
90%90015ざっくりした参照には使えるが、大幅な編集が必要
80%1,80030ゼロから打ち直す方が速いことが多い

ほとんどの制作ワークフローでは、95%が下限で、97%以上がクリーンな音声に対する優れたAIツールの期待値です。ツールがあなたのファイルで90%を下回る場合、問題はほぼ常に音声入力側にあり、モデル側ではありません。文字起こし精度を向上させる方法の関連記事では具体的な修正方法を、背景ノイズへの対処の記事では音声準備の詳細を扱っています。

ベンチマーク数値が誤解を招く理由

ベンダーは自分たちのベンチマークを選びます。一般的なものは実際には何をテストしているのか、以下に示します。

LibriSpeech。 ボランティアが静かな部屋で読み上げたオーディオブック。モデルはここで97〜99%を記録するのが一般的です。Whisper Large-v3はクリーンなテストセットで約2.7%のWERを達成します。これはあらゆる録音にとって最良のシナリオです。

TED-LIUM。 アクセントや話者間のばらつきがあるカンファレンストーク。より難しいですが、それでも練習された発話です。GPT-4o-transcribeはここで約2.5%のWERに達し、AssemblyAI Universal-3 Proは約6.8%のWERを記録します。

CallHome / Earnings-22 / AMI。 電話での会話、決算発表、複数話者の会議。Whisper Large-v3はCallHomeで26.4%のWER、AMI会議音声で15.9%のWERを記録します。これらの数値は、実際のビジネス音声がどういうものかを反映しています。

ランディングページの数値は、ほぼ常にLibriSpeechまたはそれに類するクリーンなデータセットからのものです。Zoom通話で得られる数値は、CallHomeやAMIの数値に近く、時にはそれより悪いこともあります。

私の見解: ベンダーが「99%の精度」を謳う場合、最初に問うべき質問は「どのデータセットでの話か」です。答えられないなら、その数値は飾りだと思ってください。

独立した第三者によるベンチマークは、ベンダー内部のものよりも一貫して高いエラー率を出します。Deepgramの内部ベンチマークではNova-3が厳選したテストセットで約5〜7%のWERとされていますが、実際の多様な音声を使った第三者ベンチマークでは同じモデルが約18%のWERです。どちらも間違っていません。測定しているものが違うだけです。

個別のAPIプロバイダーの詳細な比較については、最高の音声認識API 2026の記事をご覧ください。

実際にWERを左右するもの

モデルの選択は一つの変数に過ぎません。以下の要素は、ほとんどのファイルで精度に大きな影響を与えます。

音声品質

クリーンな16kHzモノラル録音で、話者がUSBマイクに近い場合、WERは3%未満に抑えられます。同じ話者でも、騒がしい部屋でスピーカーフォンを使うと、同じモデルでWERが15-25%に跳ね上がります。実測データでもこの範囲は裏付けられています。クリーンなスタジオ音声ではトップモデルでWER 3-5%、遠距離の部屋音声では18-28%です。

具体的な原因は次の通りです。音声に対する背景ノイズが-40dBを超える場合、MP3の高圧縮(64kbpsではモデルが依存する摩擦音が失われる)、硬い壁による残響、そしてマイクからの距離です。

アクセントと方言

主にアメリカ英語で訓練されたモデルは、アメリカ英語では96%の精度を出しますが、強いアクセントのある音声では85%前後に落ちます。Whisper Large-v3はアクセントのある英語でWER 8-15%の範囲です。多言語モデルの登場でギャップは縮まりましたが、まだ埋まってはいません。

非英語の音声の場合、英語で最高評価のモデルを選ぶよりも、その言語をネイティブにサポートしているプロバイダーを選ぶ方が重要です。

専門用語

汎用モデルは、医療、法律、科学、ニッチな技術用語でつまずきます。「Encephalitis」が「in cephalitis」と認識されることがあります。ブランド名や固有名詞は、訓練データに登場する頻度が低いため特に脆弱です。

実用的な対策は3つあります。用語リストを渡せるボキャブラリブースト(ほとんどのAPIで対応)、高頻度の専門分野向けカスタムモデル、そして既知の繰り返し用語に対するターゲットを絞った置換処理です。

話者数とオーバーラップ

単一話者のモノローグが最も簡単な条件です。構造化されたインタビューでの2話者は管理可能です。3人以上、特にクロストークがある場合は、エラーが急速に積み重なります。話者分離のエラーと認識エラーが互いに重なり合います。

複数話者の会議では、トップクラスのモデルでも、音声がしっかり分離されていない限り、WERは10〜15%を見込んでください。話者分離の解説の投稿では、分離が精度にどう影響するかを詳しく説明しています。

ファイルの長さ

最近のパイプラインの多くは、長いファイルを扱うために、オーバーラップさせながら音声を30秒のウィンドウに分割します。特にWhisperは、単純な分割を行うとチャンクの境界で幻覚を起こし、音声とは無関係な流暢なテキストを生成することがあります。2024年から2025年に発表された研究では、Whisperのデコーダーにある一部のアテンションヘッドが、非音声セグメントでの幻覚の大部分を引き起こしていることが確認されました。実用的な対策は、分割前に音声アクティビティ検出を使って無音部分を取り除くことです。

信頼度スコア: わかることとわからないこと

最近の音声APIの多くは、単語またはセグメントごとに信頼度スコアを返します。信頼度0.92は、モデルがその単語が正しいと92%の確率で判断していることを意味します。

信頼度が役立つ場面:

  • 確認すべき箇所のフラグ付け。 編集者は、トランスクリプト全体を読む代わりに、低信頼度の単語に直接ジャンプできます。
  • 自動品質管理。 しきい値以下のセグメントを拒否し、別のモデルで再実行するか、人間によるレビューに回します。
  • 編集時間の見積もり。 90分のトランスクリプトで低信頼度の単語が30個ある場合、エラーが均等に散らばっている場合よりも速くレビューできます。

信頼度が役に立たない場面:

  • 正確性の証明。 モデルは幻覚を起こした単語に高い信頼度を割り当てることがあります。Whisperは最もよく挙げられる例で、無音やノイズの多い入力に対して、高い信頼度スコア付きで流暢な出力を生成します。
  • モデル間の比較。 Deepgramの0.90とWhisperの0.90は、内部スケールが異なります。同じ数値ではありません。

信頼度は、どこを見るべきかを特定するために使い、見ること自体の代わりにはしないでください。

人間による文字起こしを基準点として

訓練された人間の文字起こし担当者は、クリーンな音声で98〜99%、難しい音声で95〜97%のスコアを出します。クリーンな音声におけるAIと人間の差は、今や十分に小さく、その差がコストを正当化することは、ほとんどのユースケースではほとんどありません。

難しい音声での差は、まだ無視できません。裁判所、定性研究者、医療文書のワークフローでは、エラーが実際の結果に影響を及ぼす資料に対して、今でも人間の文字起こしを使っています。

注目すべき点: 同じファイルを文字起こしする二人の人間が、同一の文字起こしを生み出すわけではありません。難しい音声でのアノテータ間一致率は約95%で、これはその資料に対してAIでも人間でも達成できる実質的な上限を設定します。

自分のWERを測定する

自分の音声で実際に得ている精度を知りたいなら:

  1. 典型的な音声から5分のサンプルを取り、実際の作業負荷を代表するものにします。
  2. それを手作業で慎重に文字起こしします(これが参照文字起こしです)。
  3. 同じクリップをAIツールで処理します(これが仮説文字起こしです)。
  4. PythonのjiwerライブラリまたはNISTのscliteツールキットを使ってWERを計算します。

実際の音声の5分は、ベンダーのベンチマークよりも実行可能な数値を与えてくれます。目指すべき比較対象はマーケティングページではなく、自分の音声に対する自分の参照です。

有料プランにコミットする前に素早く確認したい場合は、ConvertAudioToTextの音声からテキストへのツールでサンプルをアップロードして、出力を直接確認できます。特定の音声タイプで結果が悪ければ、支払う前にそれがわかります。

WERが正しい問いではない場合

3つのユースケースのルール:

  • そのまま公開する場合(ポッドキャストのショーノート、プレスからの引用など): 97%以上を目指し、15〜20分の編集パスを計画する。公開された文字起こしで数字や名前を1つでも間違えると、そういうミスは必ず誰かの目に留まるものだ。
  • 検索インデックスやメモ取り用: 90〜92%で十分なことが多い。フィラー語や細かい言い回しの誤りは、検索クエリを壊さない。
  • 文章内で特定の箇所を引用する場合: 全体的な精度に関係なく、必ずその引用箇所を音声と照合する。全体のWERが優秀でも、1つの文が間違っていることはあり得る。

正しい精度の基準は、文字起こしが何に使われるかで決まる。製品比較でどれだけ印象的に見えるかではない。

FAQ

Word Error Rate(WER)とは何か?

WERは文字起こし精度を測る標準的な指標だ。計算式は(置換数+削除数+挿入数)を参照文字起こしの総語数で割ったもの。WER 5%は精度95%として報告される。3種類のエラーは同等にカウントされ、置換された語、脱落した語、余分な語はそれぞれ1点として扱われる。意味がどれだけ変わるかは関係ない。

ベンダーは99%の精度を謳うのに、自分のファイルはもっと悪いのはなぜか?

ベンチマークの選び方が大きく影響するからだ。ほとんどのベンダーはLibriSpeech(クリーンなオーディオブックのデータセット)での精度を引用しており、そこでは中級モデルでも97%以上を叩き出す。実際の音声、特に会議や電話、騒がしい環境では、エラー率ははるかに高くなる。Gladiaの研究者は、同じモデルがベンチマークではWER 5%を記録しながら、同等の実環境音声では25%以上になるケースを文書化している。ベンチマークの数字は嘘ではないが、あなたの数字でもない。

95%の精度は、1時間の録音で実際どう感じるのか?

1時間のインタビューはおよそ9,000語になります。95%の精度なら、それは450のエラー、つまり1分あたり約7つのミスです。テキストは読めるものの、固有名詞や専門用語がよく崩れていて、公開前に30〜45分の編集パスが必要になるでしょう。99%の精度(90エラー)なら、ほぼクリーンな人間の文字起こしに近く、軽いスポットチェックだけで済みます。

信頼スコアをエラー発見に使える?

信頼スコアは、どの単語をチェックすべきかを示すのに役立ちますが、正しさの証明にはなりません。モデルは、特にノイズの多い区間や無音区間で、幻覚の単語に高い信頼を割り当てることがあります。Whisperは特に、非音声オーディオに対して流暢に聞こえるテキストを生成することで知られています。また、あるモデルの0.9という信頼スコアは、別のモデルの0.9と同じではありません。スケールはプロバイダー間で較正されていないのです。

実際のWERをどう測る?

自分の典型的な音声の5分間のサンプルを取り、手動で文字起こしし、AIツールに通してから、PythonのjiwerライブラリまたはNISTのscliteツールキットで両者を比較します。どちらも参照トランスクリプトと仮説トランスクリプトからWERを計算します。実際の音声の5分間は、ベンダーのベンチマークよりもはるかに有用な数値を与えてくれます。

ベンダーのベンチマークではなく、自分の音声で精度をテストする
ベンダーのベンチマークではなく、自分の音声で精度をテストする

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles