
話者の発言重複を修正する:クロストーク区間の修復
Summarize this article with:
クロストーク区間の修復
二人が同時に話すとき、AI文字起こしエンジンは難しい音響的問題に直面します。それは、2つの音声ストリームが1つのチャンネルに混ざってしまうという問題です。 その結果は、完成した文字起こしに、意味不明な語の羅列、抜け落ちた文、あるいは話者1の言葉が話者2に帰属してしまうラベルの入れ替わりとして現れます。この記事は、事後にその文字起こしを修復する方法について扱います。次回から録音段階で発言の重複を防ぎたい場合は、それは発言の重複への対処の領域の話です。この2つの問題には、それぞれ異なるツールが必要です。
クロストーク被害の診断
修正を始める前に、被害がどこにあり、どんな種類なのかを正確に把握する必要があります。クロストークによる被害には特有の兆候があり、他の文字起こしの問題と区別できます。
文字起こしの中で、以下の症状を探します:
- 話者変更ラベルなしに二人の話者の言葉が混ざった1行の長文。通常、前後はきれいな話者帰属になっています。
- 音声では両方の声がはっきり聞こえる瞬間なのに、テキストに欠落がある。
- ラベルの入れ替わり:重複の瞬間の直後に、話題や語彙から明らかに話者1のものだとわかる文が話者2に割り当てられる。
- 全体としては正確な文字起こしの中の一箇所に、低信頼度または崩れた単語が固まっている。AssemblyAIやDeepgramなどのツールは単語ごとの信頼度スコアを表示します。一連の単語で突然0.5未満に下がるのは、信頼できる指標です。
- エンジンが挿入した
[inaudible]や[crosstalk]などの自動タグ。これはツールがその区間を諦めたことの裏付けになります。
これらの区間を体系的に特定するには:
- ツールが対応していれば、タイムスタンプ付きで文字起こしを書き出します。ほとんどの文字起こしツールでは、セグメントごとの開始時刻を含むTXTまたはSRT形式でダウンロードできます。
- 既知の自動タグ(
[inaudible]、[crosstalk]、[overlapping])を検索します。それぞれが確認済みの問題区間です。 - 単語レベルの信頼度を表示するツールの場合、信頼度が急激に下がる連続箇所を探します。
- 話者ラベルが入れ替わっている箇所の前後1分の音声を聞き直します。入れ替わりが両方の声が聞こえていた場所と一致していれば、それがクロストーク被害です。
編集を始める前に、各区間の開始と終了のタイムスタンプを書き留めておきます。整理されたリストは時間の節約になります。問題を探しながら同時に修正しようとすると、作業は遅くなります。
修復の判断:復元するか、マークするか
損傷したタイムスタンプのリストができたら、各区間をどう扱うかを決める必要があります。選択肢は二択です。
復元するのは、次のような場合:
- 慎重に聴けば、音声上で両方の声を識別できる。
- 内容が重要である。証言、重要な決定、事実の主張など。
- 各フレーズをどちらの話者のものか確信を持って帰属させられる。
[crosstalk]とマークするのは、次のような場合:
- 音声上、声が本当に切り分けられない。
- 区間が、実質に影響しない手続き的な相槌(「うん、そうだよね、わかってる…」)である。
- 復元に推測が必要になる。
標準的な表記規則は、区間の開始タイムスタンプを付けた[crosstalk 00:14:32]です。編集スタイルによっては[overlapping speech]や[talking simultaneously]を使うこともあります。どれか一つを選び、ドキュメント全体で一貫して使いましょう。タイムスタンプ付きの[crosstalk]マークは正直で、検索もできます。帰属を誤るような作為的な復元は、空白を残すより悪い結果をもたらします。
私の見解: 法的記録、ジャーナリズム記事、正式な議事録に入るものであれば、不確かな区間は復元せず、すべてマークしましょう。ポッドキャストのショーノートファイルやカジュアルなチームミーティングの要約であれば、要約だと明記しておけば、音声から大意を復元するのは通常問題ありません。
音声を参照しながらの復元パス
復元する区間については、ワークフローは以下の通りです。
ステップ1:オーディオプレイヤーで損傷したタイムスタンプを切り出します。 細かくシークできるツールを使います。VLC、Audacity、あるいは普段使っているDAWです。ループ再生をその5〜20秒だけに設定し、声を別々に聞き取れるようになるまで繰り返します。
ステップ2:まず支配的な声を聞き取ります。 ほとんどの重複には、大きいか、はっきり聞こえる話者が一人います。その声を一度で完全に書き取り、聞き取れない部分は空の括弧を残します。
ステップ3:2番目の声を聞き取ります。 2回目のパスでは、低めの、あるいは小さな信号に集中します。密閉型ヘッドフォンがあると大幅に助かります。エンジンにとっては単一のノイズストリームにしか聞こえないものも、聞き分けることを意識すれば、認識可能な二つの声に分けて捉えられることがよくあります。
ステップ4:タイムスタンプと話者ラベルを割り当てます。 二人の話者が本当に同時に話していた場合は、2つの選択肢があります。[Speaker 1 and Speaker 2 simultaneously]のような注記を付けて両方の行を続けるか、考えを最後まで述べた話者を選び、割り込みをインラインで注記します。
重複区間が5〜10個ある60分のミーティングの場合、このパスには15〜20分かかります。重要度の高いコンテンツなら、十分に見合う投資です。

ConvertAudioToTextの出力パネルには、タイムスタンプ付きの話者帰属セグメントが表示されます。これを使えば、手動の修復パスを行う前にクロストーク区間を特定できます。
より強力なエンジンでの再処理
手動作業の前に、最も状態の悪い区間を別の文字起こしエンジンで再処理してみる価値があります。エンジンによって重複への対処は異なります。支配的な声を拾ってもう一方をきれいに捨てるもの、単語を混ぜてしまうもの、区間を丸ごとスキップするものがあります。エンジンを変えることで、元のツールが落とした区間が復元されることがあります。
Deepgramの資料によると、Nova-3は「話者とマイクの距離が大きい環境、発言の重複、背景ノイズがある環境でも高い精度を維持」します。AssemblyAIの資料では、最近のモデル改善により、話者ダイアリゼーションにおいて「ノイズの多い音声や重複条件下で30%性能向上」を達成したとされています。これらは一般的な主張であり、結果はお使いの音声によって異なりますが、問題の区間を2番目のエンジンで再処理するコストは数セント程度で、20分の手動作業を節約できる可能性があります。
難しい録音で複数のエンジンを比較したい場合は、2026年版 ベスト音声認識APIで、各エンジンが何を優先しているかを解説しています。
また、ConvertAudioToTextの音声文字起こしツールを使えば、録音全体を再アップロードすることなく、特定のクリップだけを再処理できます。
救済手段としてのソース分離
重複が激しく、手動のパスがうまくいかない録音の場合、音源分離ツールで、単一の混合チャンネルから二つの声を分離できることがあります。Demucsが最も広く使われているオープンソースの選択肢です。Spleeter(Deezer)やAudioSepも代替手段です。
正直なところ:ソース分離が最も効果を発揮するのは、ピッチ帯域が異なる、はっきり区別できる二つの声の場合です。 話者が3人以上になると品質は急激に低下します。似たピッチの声が重なっている場合、出力は元の音声より悪くなることもあります。これは試して聞いてみるアプローチであり、保証された修正方法ではありません。
ワークフロー:
- 損傷したタイムスタンプだけを短いクリップとして書き出します(Audacityなら数秒でできます)。
- クリップをセパレーターにかけます。
- 分離された出力をそれぞれ独立して文字起こしします。
- 元の結果と比較します。
分離された出力の方がきれいなら、それを使います。ノイズや歪みが増えるなら、手動に戻りましょう。
クリップを人間の文字起こし業者に依頼すべきとき
AIが繰り返し失敗する少数の区間で、内容が重要な場合は、そのクリップだけをプロの人間による文字起こしサービスに依頼するのが、多くの場合最も費用対効果の高い解決策です。
現在のベンダー資料によると(2026年7月時点で確認): Revの人間による文字起こし料金は音声1分あたり1.99ドルです。GoTranscriptのインタラクティブな料金計算ツールでは、標準納期で音声1分あたり0.99〜1.02ドル程度から始まり、言語や納期によって変動します。1時間分の料金を払うのではなく、他の方法では復元できない特定のクリップの分数に対して支払うのです。
90分のミーティングからの重複クリップ5分分は、GoTranscriptの料金で約5〜10ドル、Revで約10ドルです。法的、ジャーナリズム、経営層向けのコンテンツなら、迷う余地のない判断です。カジュアルなチームの定例ミーティングなら、おそらくその価値はないでしょう。
人間のサービスへのエスカレーションを検討すべきタイミングの詳細な分析は、AI vs 人間の文字起こしを参照してください。
ダイアリゼーションの問題と真のクロストークの違い
話者帰属の問題がすべてクロストークの問題とは限りません。文字起こし上では同じように見えても、原因も修正方法も異なる2つのケースがあります。
真のクロストーク被害: 実際に音声内で二つの声が同時に重なっていたケースです。音声自体が混ざっています。エンジンには、処理するためのきれいな音源がありませんでした。
ダイアリゼーションエラー: 音声自体は問題ありません。一人の話者が話し、その後別の話者が話したのに、エンジンがラベルを間違えた、あるいは話者1に属する文を話者3に割り当てたケースです。これはラベル付けの誤りであって、内容の誤りではありません。単語は通常正しく、話者タグだけが間違っています。
ラベルを直せば単語が正しいのであれば、それはダイアリゼーションエラーです。そのワークフローについては、話者ラベルの誤りを修正するガイドを参照してください。
単語自体が崩れていたり欠落していたりするなら、それは真のクロストーク被害であり、まさにこの記事が対象とするケースです。
録音が修復不能なとき
一部の録音は、重複があまりに激しく、現実的な修復が不可能です。暖房システムが稼働する会議室で5人が互いに話し被り、天井のマイク1本で録音されたものは、その後何をしても、きれいな文字起こしにはなりません。
こうした場合の選択肢は以下の通りです。
- 部分的な文字起こしを受け入れる。復元不能なすべての区間をタイムスタンプ付きの
[crosstalk]としてマークし、欠落があることを明示した大まかな記録としてドキュメントを使用します。 - 録音全体の人間による文字起こしに料金を払う。良いヘッドフォンで聴くプロの文字起こし担当者は、どんなAI処理よりも多くを復元できますが、音響的に不可能な区間を復元することもできません。
- 今後の収録方法を変える。発言の重複への対処の記事では、Zoomでのトラックごとの録音やリモート録音プラットフォームといった、録音時の解決策を扱っています。
選択肢3が最もレバレッジの高い選択です。録音インフラを一度整備すれば、今後のすべての修復コストがなくなります。この記事で説明した修復パスは、今日手元にあるもののためのものです。
FAQ
長い文字起こしからクロストーク区間を見つけるには?
エンジンが問題のある区間に挿入する自動タグ:[inaudible]、[crosstalk]、[overlapping]、[unintelligible]などを検索します。次にタイムスタンプと照合します。文字起こしをタイムスタンプ付きのSRTまたはTXT形式で書き出し、話者ラベルの入れ替わりを探し、疑わしい箇所の周辺の音声を聞き直します。エンジンが信頼度スコアを表示する場合は、信頼度0.5未満の単語が連続している箇所を探してください。こうした箇所は、発言が重なる瞬間の周辺に集中しがちです。
テキストを復元する代わりに、いつ[crosstalk]とマークすべき?
音声上、両方の声が本当に切り分けられない場合、復元に推測が必要になる場合、記録の実質に影響しない相槌やつなぎの発言である場合は、タイムスタンプ付きで[crosstalk]とマークします。慎重に聴き比べれば両方の声を識別でき、各フレーズをどちらの話者のものか確信を持って帰属させられる場合にのみ、復元します。法務やジャーナリズムの仕事では、迷ったら推測せずマークしましょう。
別のエンジンで再処理すると、欠落したクロストーク区間を復元できる?
場合によっては可能です。エンジンによって重複への対処は異なり、支配的な声だけをきれいに拾うもの、両方を混ぜてしまうもの、その区間を丸ごとスキップするものがあります。元のエンジンが完全に落とした区間でも、別のエンジンでは部分的に出力されることがあります。30秒のクリップの処理は低コストなので、最も状態の悪い区間で試してみる価値はあります。結果はお使いの音声と二人の声の特性次第であり、保証はありません。
重複区間だけなら人間の文字起こし業者に依頼する価値はある?
重要度の高いコンテンツであれば、あります。録音全体を送る必要はありません。損傷したクリップだけを短い音声ファイルとして書き出し、それらのみを提出します。音声1分あたり約1〜2ドルの料金(RevおよびGoTranscriptの現在のベンダー資料による)であれば、問題クリップ5分分のコストは5〜10ドル程度です。良いヘッドフォンを使うプロの文字起こし担当者は、AIでの繰り返し処理よりも多くを復元できますが、最初から別々に録音されていない音響的に混ざり合った音声を分離することは、彼らにもできません。
出典
- Deepgram、"Introducing Nova-3: Setting a New Standard for AI-Driven Speech-to-Text": https://deepgram.com/learn/introducing-nova-3-speech-to-text-api (2026年7月時点で確認)
- AssemblyAI、"Using multichannel and speaker diarization": https://www.assemblyai.com/blog/multichannel-speaker-diarization (2026年7月時点で確認)
- Rev 料金ページ: https://www.rev.com/pricing (2026年7月時点で確認)
- GoTranscript 料金およびコスト見積もり: https://gotranscript.com/pricing-and-cost-estimate (2026年7月時点で確認)
- Deepgram 製品ページ、音声認識: https://deepgram.com/product/speech-to-text (2026年7月時点で確認)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.