
文字起こし前の音声品質改善:効果があること
Summarize this article with:
既存の音声をアップロード前に処理することで、問題のある録音では文字起こし精度を10〜20ポイント回復できます。チェーンは、トリミング、ノイズ除去、ノーマライズ、EQ、モノラル変換、そして書き出しです。ただし注意点として、クリーンな音声にはこれらは一切不要であり、深刻なクリッピングや強い残響のある音声も処理では救えません。エディタに触れる前に、自分のファイルが3つのうちどのカテゴリに属するかを見極めましょう。
アップロード前に音声を処理する価値があるのは、録音に明確な問題がある場合だけです。常時のハム音、不均一な音量、こもった低域、あるいは両チャンネルに同じ声が入っているステレオファイルなどです。**中程度のノイズがある録音では、フルの処理チェーンで精度を10〜20ポイント回復できます。**クリーンな音声には何の効果もありません。このガイドでは、適用すべき順序に従ってチェーンを解説し、まったくスキップすべき2つの状況についても示します。

録音時にこれらの問題を防ぐ方法については、最良の結果を得るための録音環境をご覧ください。アップロード前の処理では修復できない非常に質の悪いソース素材への対処法については、音声品質が悪い状態での文字起こしをご覧ください。
まずは3つのカテゴリに分類
オーディオエディタを開く前に、ファイルを分類しましょう。
クリーン: 通常のリスニング音量ですべての言葉がはっきり聞こえる。直接文字起こしする。処理しても効果はなく、アーティファクトが生じるおそれがある。
回復可能: 背景のハム音、スピーカーごとの音量差、こもった話し声、あるいはノイズが聞こえるものの支配的ではない小さめの録音。ここが処理チェーンが真価を発揮する場面です。
回復不能: ヘッドホンで注意深く聴いても大部分が判別できない。全体に激しいクリッピング(耳障りなパチパチという歪み)がある、ファイル全体で複数人が同時に話している、マイクが別の部屋にある、など。可能なら録り直してください。処理しても使える文字起こし結果は得られません。
明らかながら許容範囲のノイズがある録音のほとんどは、回復可能なカテゴリに入ります。
ステップ1:最初にトリミングする
音声処理を行う前に、不要なセクションをトリミングします。会議開始前の無音、「全員聞こえていますか」という前置き、末尾の空白時間などです。トリミングには2つの目的があります。第一に、ステップ2で必要になるノイズプロファイルを狂わせかねないセクションを取り除きます。第二に、ファイルが短くなるため、以降のすべてのステップの処理時間が削減されます。
トリミング用ツール: iOSのボイスメモ、Windowsの内蔵サウンドレコーダー、またはあらゆるプラットフォームで使えるAudacity。3つとも信号品質に手を加えずにシンプルなカットと書き出しが可能です。
文字起こしを「並列化」するために長い録音を細かく分割するのはやめましょう。自然なトピックの境界(20〜30分ごとの明確なポーズ)で分割するのは合理的です。5分ごとに分割すると、各境界で文脈が失われ、話者の連続性が損なわれることがあります。
ステップ2:ノイズ除去
このステップは、一定の背景ノイズを対象とします。エアコン、ファンのハム音、空調設備の低周波音、蛍光灯のブーンという音などです。これらは予測可能で一貫した周波数帯域を占めるため、定常ノイズと呼ばれます。ノイズ除去は、ノイズのみの短いセグメントをサンプリングして指紋(プロファイル)を作成し、それをファイル全体から差し引く仕組みです。
ほとんどの文字起こし準備には、Audacity(無料、audacityteam.org)で十分です。 手順は以下の通りです。
- トリミング済みのファイルをAudacityで開きます。
- 誰も話しておらず、背景ノイズだけが存在する1〜2秒の部分を見つけます。
- そのセクションを選択し、エフェクト→ノイズ除去と進み、「ノイズプロファイルを取得」をクリックします。
- ファイル全体を選択します(Ctrl+AまたはCmd+A)。
- 再びエフェクト→ノイズ除去を開きます。推奨デフォルト設定は、ノイズ除去6dB、感度6、周波数スムージング6です。最大限のノイズ除去よりも音声の保護を優先する控えめな設定です。
- 「残留」トグルを使って、除去される内容を確認します。残留音の中に話し声が聞こえる場合は、設定が強すぎます。
- プレビューし、必要なら調整してから適用します。
私の見解:まず6dBから始め、ノイズがまだ目立つ場合は3dBずつ上げてください。15dBを超えると声にロボットのようなアーティファクトが現れ始め、これは元のノイズよりも文字起こし精度を損なうことが多いです。
断続的なノイズ(犬の鳴き声、ドアがバタンと閉まる音、スマホの通知音など)には、この手法は効きません。それらが短時間で明瞭な発話に囲まれている場合は、該当箇所を手動で選択して無音化できます(Audacityでは編集→音声を無音化)。
Audacityの代替ツール:
Adobe Podcast Enhance(podcast.adobe.com/enhance)は完全にブラウザ上で動作します。Adobeアカウントがあれば無料で、1セッションあたり30分・500MBまでのファイルを処理でき、1日あたり1時間の上限があります。パラメータ調整なしでワンクリックのAIベースのノイズ除去を行います。トレードオフは制御性の低さです。得られるのはAdobeのモデルが出力する結果であって、自分で調整した結果ではありません。
iZotope RXはプロ向けの選択肢です。RX 12はElementsが99ドルから、Standardが399ドル、Advancedが1,399ドルです。文字起こし準備としては、Elementsで実際に必要なすべて(Dialogue Denoise、De-reverb、Repair Assistant)をカバーできます。Advancedティアは、文字起こし用クリーンアップ作業の枠を超えた放送やポストプロダクションのワークフローを対象としています。
ステップ3:音量をノーマライズする
音量のばらつきは2番目に多い問題です。ある話者はマイクの近くにいて、別の話者はテーブルの向こうにいる。録音の途中で音量が下がっていく。全体は問題ないのに、いくつかのセクションがほとんど聞き取れない。
ノーマライズには2種類あります。
ピークノーマライズは全体のレベルを上げて、最も大きい瞬間が目標の上限(通常-1dB)に達するようにします。Audacityでは、エフェクト→ノーマライズと進み、ピーク振幅を-1.0dBに設定します。録音全体が一貫して小さい場合はこちらが正解です。
ダイナミックレンジ圧縮は最も大きい瞬間と最も小さい瞬間の差を縮めます。小さい声の話者を持ち上げ、大きい声を抑えます。Audacityでは、エフェクト→コンプレッサーです。音量の異なる複数参加者の発話には、スレッショルド約-20dBの3:1レシオが妥当な出発点です。プレビューボタンを使って耳で確認しながら調整してください。
マイクが話者から離れていたためにファイルの音量が小さい場合は、ピークノーマライズが背景ノイズも増幅します。その場合は、先にノイズ除去(ステップ2)を行い、よりクリーンになった結果をノーマライズしてください。
コマンドラインのワークフローでは、ffmpeg-normalizeツール(pip install ffmpeg-normalize)がEBU R128ラウドネスノーマライズを1コマンドで適用します。同等の素のffmpegフィルタは以下の通りです。
ffmpeg -i input.wav -af "loudnorm=I=-16:TP=-1.5:LRA=11" output.wav
EBU R128は-16LUFSを目標とします。これはポッドキャスト納品の標準であり、文字起こし前処理の目標としても妥当です。
ステップ4:音声明瞭度のためのEQ
イコライゼーションは周波数のバランスを調整します。文字起こし準備における目的は狭いものです。発話ではないものをカットし、発話であるものを守る。
人間の音声明瞭度はおよそ300Hz〜3,400Hzの間にあります。 電話が数十年にわたって使用してきた周波数帯域であり、全レンジがなくても発話の理解には十分です。
ほとんどの録音では、3つの操作からなるEQ設定が有効です。
- 80〜100Hzのハイパスフィルタ。交通騒音、空調設備、マイクの操作音による低域のランブルをカットします。これらには発話内容が含まれていません。
- 8,000Hzのローパスフィルタ。高域のヒスノイズを減らします。発話のエネルギーの大半はこれよりはるかに下にあるため、それ以上をカットしても明瞭度への影響は最小限でノイズが除けます。
- 1,000〜3,000Hz帯を1〜3dB穏やかにブースト。ここは子音が多く含まれ、明瞭度が宿る領域です。
Audacityでは、エフェクト→フィルタカーブEQ(精密な制御用)から適用するか、カットオフの各ステップは個別にエフェクト→ハイパスフィルタおよびローパスフィルタから適用します。
EQはここで最も任意性の高いステップです。ノイズ除去とノーマライズの結果、問題なく聞き取れる録音になっていれば、EQはスキップして構いません。EQが最も役立つのは、こもった録音(高域が弱い)や低域のランブルが強い録音です。
ステップ5:モノラルに変換する
ステレオ音声は2チャンネルを持ちます。単一スピーカー、電話通話の録音、個人ポッドキャスト、インタビューの場合、通常は両チャンネルに同じ音声信号が入っています。ステレオのままにすると、文字起こし精度のメリットなしにファイルサイズが2倍になります。
モノラルに変換するとファイルサイズは半分になり、場合によっては文字起こし精度も向上します。モデルがわずかな位相差や異なる信号レベルを持ちうる2つのチャンネルではなく、1つの一貫した信号を処理するためです。
Audacityでは、トラック→ミックス→ステレオをモノラルにミックスダウンと進みます。または、コマンドラインでは以下のようにします。
ffmpeg -i input.wav -ac 1 output_mono.wav
録音の各チャンネルに本当に異なる内容が入っている場合(一部のデュアルチャンネル・インタビュー設定、ホストとゲストが別々のトラックになっている放送録音など)は、このステップをスキップしてください。そのような場合は、単純にモノラルに落とすのではなく、チャンネルを適切にミックスしてください。
ステップ6:適切なフォーマットで書き出す
処理チェーンの最後は書き出しです。フォーマットは処理後の品質ほど重要ではありませんが、いくつかのルールがあります。
WAVまたはFLACは、処理で得られたものをすべて保持します。WAVは非圧縮です。FLACは可逆圧縮で、同一品質ながら通常WAVより40〜60%小さくなります。処理済みファイルをアーカイブしたい場合や、別のツールにつなぎたい場合は、どちらかが正解です。
128kbps以上のMP3は、ファイルサイズが重要な場合のアップロードに実用的です。128kbps MP3のクリーンに処理された録音は、WAVの同じ録音とほぼ同等に文字起こしされます。128kbpsを下回ると、ASRモデルを混乱させうる可聴な圧縮アーティファクトが発生します。
非可逆フォーマット間の再エンコードは避けてください。 ソースがすでにMP3なら、MP3のまま書き出すかWAV/FLACに変換します。MP3→AAC→M4Aのような変換はしないでください。非可逆の再エンコードのたびに品質劣化が積み重なります。
ConvertAudioToTextをはじめとする文字起こしサービスでは、WAV、FLAC、MP3、M4A、その他の一般的なフォーマットのほとんどが受け付けられます。フォーマットの選択が文字起こし結果を左右することはまれで、左右するのは録音品質です。
順序付きの全チェーン
| ステップ | ツール | 適用タイミング |
|---|---|---|
| 1. トリミング | 任意のオーディオプレーヤー、Audacity | 常に |
| 2. ノイズ除去 | Audacity、Adobe Podcast Enhance、iZotope RX | 定常ノイズがあるとき |
| 3. ノーマライズ | Audacity、ffmpeg-normalize | 音量が不均一または一貫して小さいとき |
| 4. EQ | Audacity フィルタカーブEQ | ランブルやこもりが聞こえるとき |
| 5. モノラル変換 | Audacity、ffmpeg | ファイルがステレオで両チャンネルの内容が同じとき |
| 6. 書き出し | Audacity、ffmpeg | 常に、WAV/FLAC/MP3 128kbps以上で |
順序は任意ではありません。ノーマライズの前にノイズ除去を行うことで、ノイズの増幅を防ぎます。EQの前にノーマライズを行うことで、EQが安定したレベルに対して作用できます。チェーンの順序を入れ替えると結果が劣化します。
処理に時間をかける価値がないケース
努力が報われない3つの状況です。
音声がすでにクリーンである。 耳で聴いてクリアなら、直接文字起こししてください。クリーンな音声を処理すると、避けようとしているまさにそのアーティファクトを持ち込むリスクがあります。
損傷の種類が違う。 激しいクリッピング(録音レベルが高すぎたことで生じる歪んだパチパチ音)は、ノイズ除去やEQでは意味のある修復ができません。iZotope RXのDeclipモジュールは軽度のクリッピングを回復できますが、ファイル全体に及ぶ本物の単語レベルの歪みは自宅環境では回復できません。
エコーや残響が強い。 録音に焼き付いた部屋の反響は、除去が非常に困難です。De-reverbツール(iZotope RX、Adobe Auditionのアダプティブノイズリダクション)は部分的に役立ちますが、強い残響は処理の有無にかかわらず通常10〜20ポイント精度を下げます。話者が10フィート(約3メートル)離れた浴室で録ったように聞こえるなら、処理よりも録り直す方が速いです。
これらの失敗パターンに該当する録音については、次に何をすべきかを音声品質が悪い状態での文字起こしで、より適したモデルの選択といった音声以外のアプローチについては文字起こし精度を向上させる方法をご覧ください。
処理の手間なしにクリーンな文字起こし結果を得たいなら、ConvertAudioToTextを出発点として使うのが良いでしょう。アップロードして文字起こしし、編集作業に着手する前にベースラインの精度を確認できます。
背景ノイズがAI文字起こしモデルと具体的にどう相互作用するかを詳しく知りたい方は、文字起こしにおける背景ノイズへの対処をご覧ください。
よくある質問
音声処理で文字起こし精度はどれくらい向上しますか?
中程度のノイズがある録音(定常的なハム音、低音量、こもった話し声)では、フルチェーン(ノイズ除去、ノーマライズ、EQ)によって通常10〜20ポイントの精度が回復します。現在のAI文字起こしモデルはクリーンなスタジオ音声で95〜97%の精度に達し、ノイズの多い実環境の録音では60%を下回ることもあります。処理は、回復可能な音声をその範囲のクリーンな側へ引き上げます。すでにクリーンな音声では、改善はほぼゼロです。
Audacityは有料ですか?
いいえ。Audacityは無料のオープンソースソフトウェアです(audacityteam.org)。このチェーンのすべてのステップ(ノイズ除去、ノーマライズ、コンプレッション、EQ、モノラル変換、書き出し)をカバーしています。Adobe Podcast Enhanceも無料のAdobeアカウントがあれば30分までのファイルを無料で処理できます。iZotope RXはElementsティアが99ドルからで、深刻に劣化した録音を扱う場合にのみ適した選択肢です。
文字起こしの前に必ずステレオをモノラルに変換すべきですか?
必ずしもそうではありません。両チャンネルが同じ内容を持つ場合(ステレオで録音された単一スピーカー、電話通話の書き出し、ステレオ感に意味がない会議録音など)はモノラルに変換してください。ソースの左右で異なるスピーカーや楽器が入っている場合(一部のデュアルトラック・インタビュー設定など)は、ステレオのままにするか、チャンネルを適切にミックスしてください。
ノイズ除去、ノーマライズ、EQの正しい順序は何ですか?
まずノイズ除去、次にノーマライズ、その後にEQです。ノイズ除去の前にノーマライズすると背景ノイズが増幅され、きれいに除去するのが難しくなります。ノーマライズの前にEQを実行すると、EQが不安定なレベルに対して作用することになります。このガイドの順序は、各ステップが次のステップの土台となる仕組みを反映しています。
音声フォーマット(WAVとMP3)は文字起こし精度に影響しますか?
128kbps以上であれば、ほぼ影響ありません。128kbpsのクリーンに処理されたMP3は、WAVやFLACの同じ音声とほぼ同等に文字起こしされます。フォーマットが問題になるのは、非可逆フォーマット間での再エンコード(例:MP3からAAC)を避けるべき点と、圧縮アーティファクトが音声明瞭度に影響し始める128kbps未満のMP3ファイルを避けるべき点です。処理済みファイルをアーカイブする場合は、WAVまたはFLACが追加の品質劣化を防ぎます。
参考資料
- Audacity ノイズ除去マニュアル: https://manual.audacityteam.org/man/noise_reduction.html
- Adobe Podcast Enhance: https://podcast.adobe.com/en/enhance
- iZotope RX 12 料金: https://www.izotope.com/en/products/rx/pricing-options
- AssemblyAI 音声認識向けオーディオフォーマットについて: https://www.assemblyai.com/blog/best-audio-file-formats-for-speech-to-text
- AssemblyAI 文字起こし精度について: https://www.assemblyai.com/blog/how-accurate-speech-to-text
- ffmpeg-normalize: https://github.com/slhck/ffmpeg-normalize
- Sonix AI文字起こし精度の推移: https://sonix.ai/resources/ai-transcription-accuracy-trends/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.