音質の悪い音声を文字起こしする:何が救えるのか(2026)
文字起こし音質ノイズ除去

音質の悪い音声を文字起こしする:何が救えるのか(2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

救えるのか?

最新のAI文字起こしは、悪い音声からも人が思っている以上に多くを復元できます。 電話音質の留守番電話メッセージ、状態のまあまあ良い1990年代のカセットテープ、窓を開けたまま行ったフィールドインタビュー——これらはすべて実用になります。「救えるのか?」への率直な答えは、たいてい「はい」です。ただし大きな但し書きが一つあります。限界の下限を決めるのはエンジンの賢さではなく、ソース段階で何が記録されたかです。録音時点で本当に聞き取れなかった音声は、AIにも聞き取れません。

無料プレビューで、悪い音声が救えるかどうかすぐにわかる
無料プレビューで、悪い音声が救えるかどうかすぐにわかる

この記事では、現実的な精度の目安、実際に効果のある少数の前処理ステップ、そしてAIから人間へ引き渡すべき具体的なシナリオを取り上げます。

そもそも悪い音声を作らないための方法については、最良の結果を得るための録音環境のコツをご覧ください。背景ノイズに特化した対策については、文字起こしにおける背景ノイズへの対処法をご覧ください。

AIが意外とうまく処理できるもの

Whisper Large-v3は、電話通話、遠くのマイク、訛りのある発話、アナログ録音を含む広範でノイズの多いコーパスで学習されています。独立系ベンチマークでは、クリーンな音声での単語誤り率(WER)は約2.7%、実世界のノイズ条件下では8〜12%とされており、以前のバージョンからの大幅な改善です。

電話音質の音声(8kHz、狭帯域)。 古い留守電、保管されていたヘルプラインの録音、会議通話。狭い周波数帯域は人間が頼る手がかりの多くを失わせますが、Whisperはこの信号タイプにかなりうまく適応します。

強い訛り。 モデルは西アフリカ、南アジア、東アジア、カリブ海、ラテンアメリカなどの英語バリアントを含む世界中の英語をカバーしています。非ネイティブスピーカーに対する精度は、通常、米国英語ネイティブの数ポイント以内に収まります。

一定の背景ノイズ。 カフェの環境音、空調設備のハム音、窓外の交通騒音。時間的にあまり変化しないノイズから発話を分離するのは得意です。

防音処理されていない部屋の反響。 無垢材の床、がらんとした会議室、地下室での録音。軽度の残響は精度をそこそこ下げますが、文字起こしが使い物にならなくなることはまずありません。

状態の良い1990年代のカセットテープ。 テープヒスは定常ノイズであり、モデルがうまく扱える種類です。保存状態の良い録音は78〜88%の精度で出ることが多く、編集可能なレベルです。

AIが苦手なもの

以下は難しいケースで、「前処理で対処可能」から「人間が必要」の順に並べています:

複数人が同時に話す。 2人が言葉を被せ合うだけで精度が15〜30ポイント落ちます。狭い部屋で3人以上が重なると、本当に復元が困難です。ダイアライゼーションは誰がいつ話したかにラベルを付けられますが、発話が重なった部分で何が話されたかを再構築することはできません。

発話と同程度の音量のボーカル入りの音楽。 エンジンは歌詞を会話の一部として文字起こししたり、その下にある発話を単純に落としたりします。インストゥルメンタル(演奏のみの音楽)なら影響はずっと小さいです。

深刻に劣化したアナログソース。 大音量のテープヒス、速度のずれ、ドロップアウトのある1985年の再生回数の多いカセットは、復元しきい値を下回ることがあります。一部の区間は「不明瞭」とマークされるか、単に欠落します。

ささやき声やノイズフロア以下の音。 収録時に話者が環境音より小さかった場合、どんなエンジンでも、どれほど後処理を施しても、記録されなかった内容は取り出せません。

強い訛りと劣化した音声の組み合わせ。 それぞれ単独なら対処可能ですが、組み合わさると互いに悪化します。

実際に効果のある前処理(と、やるべきでないこと)

直感に反しますが、「音声エンハンス」の大半はAI文字起こしには害の方が大きいのです。エンジンは生の不完全な入力で学習されています。強引なクリーンアップはモデルが想定するスペクトル特性を歪めます。ただし、いくつかの特定のステップは効果があります:

音量を正規化する

録音のピークが-20dB未満だと、エンジンは扱う信号が少なすぎます。2パス方式で約-16 LUFSに正規化しましょう。これはダイナミック圧縮ではなく一貫したゲインを適用します:

# Pass 1: measure
ffmpeg -i quiet.mp3 -af loudnorm=I=-16:TP=-1.5:LRA=11:print_format=json -f null -

# Pass 2: apply (fill in measured_I, measured_TP, measured_LRA, measured_thresh from pass 1)
ffmpeg -i quiet.mp3 -af loudnorm=I=-16:TP=-1.5:LRA=11:measured_I=-28:measured_TP=-6:measured_LRA=10:measured_thresh=-38:linear=true output.mp3

シングルパスのloudnormは動的処理をその場で適用するため、ポンピングアーティファクトが発生して文字起こしの精度を損なうことがあります。重要なファイルなら、余分な一手間をかけて2パスにする価値があります。

テープの速度ずれを補正する

カセットが速すぎたり遅すぎたりして再生された場合(摩耗したデッキでよくある)、ピッチとタイミングがずれます。atempoで補正します:

# Slow down a recording that plays ~5% too fast
ffmpeg -i input.mp3 -filter:a "atempo=0.95" corrected.mp3

大きなずれ(5〜10%超)の場合は、補正が効く以上に認識を損ないます。まず聴いて判断してください。

それ以外は何もしない

AIエンジンに送る前にEQ、コンプレッション、デエッシング、残響除去をかけないでください。これらのツールは人間のリスニング向けに設計されており、音声モデル向けではありません。強めのノイズリダクション(25dB以上の除去)は子音の明瞭さも一緒に奪います。文字起こし結果は良くなるどころか悪くなります。

どうしてもノイズリダクションを試したい場合は、Audacityのノイズ除去を非常に控えめな設定(12〜18dBというデフォルト範囲ではなく8〜10dBの除去)で使って、両方のバージョンを比較してください。

マイクや部屋の選択がソース音質にどう影響するかを詳しく知りたい方は、文字起こし前に音質を改善する方法をご覧ください。

ソースタイプ別の現実的な精度目安

始める前に期待値を設定しておきましょう。以下の数字は各カテゴリの典型的な例に対するWhisper Large-v3の結果を反映しています:

ソースタイプ典型的な精度範囲編集可能?
スタジオ録音、話者1名97〜99%可、軽微な修正のみ
Zoom通話、全員が良いマイク使用94〜97%
混在ミーティング、一部スピーカーフォン88〜94%可、中程度の労力
フィールドインタビュー、ラベリアマイク、中程度のノイズ92〜96%
電話録音(8kHz)88〜93%
広い部屋の1本の遠距離マイク82〜89%可、編集多め
1990年代のカセットテープ、状態良好78〜88%可、かなりの労力
大幅に劣化したカセットテープ60〜80%境界線上
重なり合う複数話者、ノイズの多い部屋55〜75%編集する価値がないことが多い

精度90%超なら、軽いクリーンアップで公開可能なレベルです。80〜90%なら編集時間はそれなりにかかりますが、通常は人間の文字起こしより速いです。80%未満なら計算してみましょう。ファイルが短いか内容の価値が高ければ編集しましょう。長いファイルや二次的な内容なら、人間のサービスの方が総コストで安くなるかもしれません。

私の見解:80%ラインは、音声を先に聴かずにAI文字起こしに挑むのをやめるべき境界線です。それ以下なら、数分間スポットチェックすれば、編集する価値があるか、人間に任せた方が得かがわかります。

人間の文字起こし担当者に引き渡すべきとき

人間の層が正しい選択であることを示す3つの明確なサイン:

文字起こし結果の10%超に明白な誤りや不明瞭な区間がある。 その誤り密度のAIトランスクリプトの編集は、きれいな人間のトランスクリプトから作業するより時間がかかることが多いです。コスト比較が逆転します。

内容が法的または公式にセンシティブである。 法廷録音、証言調書、規制当局への証言、人事面談。AIのトランスクリプトは、公式記録の一部になる前に人間による検証が必要です。AI vs. 人間の文字起こしでこのトレードオフを詳しく説明しています。

重なりが大きい複数話者。 人間の聞き手は文脈、リズム、推論を使って重なる発話を分離します。AIのダイアライゼーションはそうしません。話者の特定が重要なものすべてにおいて、人間の層が確実な道です。

人間による文字起こしでは、Revは標準納品(12時間以内)で音声1分あたり1.99ドルを請求し、より短い納期のための特急オプションもあります。GoTranscriptは標準の1〜5日納品で音声1分あたり0.99〜1.02ドル前後から始まり、特急では大幅に上がります。どちらも従量課金で、サブスクリプションは不要です。

納期の締切なしにきれいなトランスクリプトが必要だけなら、ConvertAudioToTextの無料枠でサンプルファイルを先に試して精度を確認してから、編集に時間をかけることができます。

古いテープ録音:特有のワークフロー

デジタル化されたアナログ録音(カセット、マイクロカセット、オープンリール)には、知っておく価値のあるいくつかのパターンがあります:

テープヒスは定常ノイズ。 AIはこれを処理できます。積極的にデノイズしないこと。せいぜい中程度の1パスまで。

摩耗した機構による速度ずれ。 デジタル化したファイルを聴いてください。言葉のピッチがずれて聞こえたり、発話が明らかに速すぎたり遅すぎたりする場合は、送信前にatempoで補正します。5%速いファイルは測定可能なほど精度が落ち、10%速いファイルはほぼ判読不能な出力になります。

ワウ・フラッター。 摩耗したキャプスタンによるピッチの揺れ。最新のWhisperは軽度のフラッターを驚くほどうまく処理します。モデルは根底にある発話パターンに適応するのです。破損した機構による重度のフラッターは話が別です。

ドロップアウト(無音のギャップ)。 エンジンはこれを無音として処理し、向こう側で正常に続きます。トランスクリプトには音声のギャップに対応する空白が現れます。直す必要はありません。

短いアーカイブと長いアーカイブ。 30分のカセット1本なら:実行し、結果を確認し、必要なら人間によるチェックを検討します。大規模なアーカイブ(家族の録音、オーラルヒストリー事業、ラジオ番組の未消化分):一晩でバッチ処理し、一部のファイルには人間のレビューが必要になると受け入れます。まず精度で問題ファイルを特定してから判断しましょう。

複数チャンネルの活用

録音に複数の音声トラックがある場合(例:チャンネル1にラベリアマイク、チャンネル2にカメラのマイク)、送信前にきれいな方のチャンネルだけを抽出します:

ffmpeg -i interview.mov -map 0:a:0 -ac 1 channel1.mp3

両チャンネルをミックスすると、良い方のソースが薄まります。音声認識にとって入力が多いほど良いとは限りません。

FAQ

古いカセットテープの録音に対するAI文字起こしの精度はどのくらいですか?

適切に保存された1990年代のカセットテープでテープヒスが中程度のものであれば、Whisper Large-v3での精度は通常78〜88%の範囲に収まります。ドロップアウトが激しい場合、速度のずれが大きい場合、テープの飽和がひどい場合はさらに低下します。再生時にかろうじて聞き取れる程度に劣化したテープでは65%を下回ることもあり、その場合は人間による文字起こしの方が総合的に速く安上がりになるのが普通です。

AI文字起こしサービスに送る前に音声をクリーンアップすべきですか?

効果があるのは特定の処理だけです。録音が非常に小さい音量の場合は音量を正規化すること、アナログテープの場合は速度のずれを補正することです。強めのノイズリダクション、EQ、コンプレッション、デエッシングは、モデルが想定するスペクトル特性を歪めるため、通常は精度を下げます。無加工または軽く正規化しただけの音声を送りましょう。

人間による文字起こしサービスに追加料金を払う価値があるのはいつですか?

3つの状況があります。AIの文字起こし結果の誤り率がおよそ10%を超える場合(修正するより最初からやり直す方が速くなります)、内容に法的・公式な効力が必要な場合(証言調書、規制提出書類、人事記録など)、複数の話者の発話が大きく重なり合う場合です。発話の重なりや文脈に基づく話者の特定は、現在のAIダイアライゼーションよりも人間の文字起こし担当者の方が上手に処理します。

電話音質の録音をセグメントごとに処理すると精度は向上しますか?

場合によります。長い録音の中に非常にノイズの多い部分が1〜2箇所あって残りは比較的きれいな場合、セクションごとに分けて異なる正規化レベルで処理すると、ノイズの多い部分で改善が見られることがあります。全体が一様にノイズだらけの録音では、分割処理しても結果はほぼ変わりません。どちらにせよエンジンが見る音質は同じだからです。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles