聴覚障害者と難聴者向け文字起こし
アクセシビリティ聴覚障害難聴文字起こし

聴覚障害者と難聴者向け文字起こし

BMMamane B. MoussaMay 26, 2026Updated July 2, 20261 min read

Summarize this article with:

TL;DR

聴覚障害者や難聴者にとって良い文字起こしとは、99%の正確性、話者が変わるたびの明確なラベル、角括弧で囲んだ非言語音、そして読みやすいキャプションのタイミングを指す。AIの文字起こしは理想的な条件下で90〜97%の正確性を出すが、現実の環境、特にライブ配信では一貫して基準に届かない。実用的な流れは、AIで下書きを作り、その後、正確性、話者の特定、非言語音を人間が確認するというもの。WCAG 2.1 AAのようなコンプライアンス基準はこの水準をよく示しているが、それを満たす本当の理由は、それが実際にコンテンツを使いやすくするものだからだ。

聴覚障害(DHH)ユーザーにとって、文字起こしやキャプションファイルの品質は、美的な好みの問題ではありません。それは、コンテンツがそもそも使えるかどうかを左右します。実用的な基準は、単語レベルの精度99%、話者交代のたびに明確な識別、そして非音声の音を角括弧で囲んで記載することです。 ほとんどのAI文字起こしは、人間によるレビューなしではその基準に達しません。この記事では、DHHユーザーが実際に必要としているもの、AIが役立つ場面、そしてまだ人間の注意が必要な部分について説明します。

(実用的なガイダンスであり、法的助言ではありません。)

「DHH」の背後にある多様性

「聴覚障害(Deaf and hard of hearing)」は、非常に幅広い経験をカバーしており、各人に役立つものは異なります。

文化的にろう者であるユーザー、特にアメリカ手話(ASL)やイギリス手話(BSL)を第一言語とする人々は、英語を第二言語として読む場合があります。長くて密度の高い文字起こしは、話し言葉のASLよりも理解しにくいことがあります。このような読者には、正確さと同じくらい平易な言葉が重要です。つまり、短い文、一般的な語彙、明確な段落区切りです。長時間のコンテンツでは、手話通訳がキャプションよりもアクセスしやすいことがよくあります。

難聴のユーザーは、通常、母語並みの読み書き能力を持っていますが、騒がしい環境、低品質の録音、話者の強いアクセントや重なり合う発言があると、音声にアクセスできなくなります。キャプションと文字起こしは、クリアな音声が他の人に提供するのと同じコンテンツアクセスを彼らに与えます。

中途失聴の成人は、強い英語の読み書き能力を持っている一方で手話の流暢さがないため、手話よりもキャプションを好むことがよくあります。

既存コミュニティからの用語に関する注記:大文字の「Deaf」は文化的アイデンティティを指し、小文字の「deaf」は聴覚の医学的状態を指します。「Hearing impaired(聴覚障害者)」という表現は、ろうコミュニティでは一般的に否定的に受け取られ、避けるのが最善です。

AI文字起こしが実際に提供するもの

DHHユーザーが何を必要としているかに入る前に、AI文字起こしが何を提供するかについて正直になる価値があります。なぜなら、マーケティングは必ずしも実際の体験と一致しないからです。

ベンダーが公表するAI文字起こしの精度は、良好な条件下で通常90〜97%とされる。 しかし、査読付き研究はもっと複雑な実情を伝えている。2024年の研究では、実際の大学講義録音を使って11のASRサービスを測定したところ、ベンダー間および個々の音声サンプル間で性能に大きなばらつきが見られ、ライブキャプションに使われるストリーミングASRは、ポストプロダクションの文字起こしより著しく劣っていた。研究者らは「一般的なサービスは精度において信頼性を欠く」と結論づけ、業界が公表する主張と、DHHユーザーが実際に報告する体験との間に明確な乖離があることを明らかにした。

これはAI文字起こしに反対する議論ではない。その役割を理解するための議論だ。AIは大量の単語を高速で処理し、人間が精度のギャップを埋め、AIにはできないことを補う。

90分の講義の場合、AIによる処理は約2〜3分で完了する。ゼロからの手動文字起こしは6〜9時間かかる。AIのドラフトを人間がレビューする場合、通常2〜3時間で仕上がる。AI処理は依然として正しい出発点だ。

DHHユーザーが実際に必要とする4つのこと

DHHユーザーに本当に役立つ精度の下限

1,500語で97%の精度なら、およそ45語が誤りになる。95%なら75の誤りだ。一般的なコンテンツでは、読者は文脈から正しい意味を推測できることが多い。しかし、技術講義、医療コンテンツ、法的手続き、またはテンポの速い対話では、5%の誤りが理解を崩壊させる。

DCMPとFCCはどちらも、ポストプロダクションのキャプションの公表基準として99%の単語精度を設定しており、リアルタイムでは98.5%としている。その基準と典型的なAI出力との差こそ、人間によるレビューが存在する理由だ。

精度の測定方法とワードエラー率の実際の意味について詳しく知りたい場合は、文字起こし精度の解説を参照。

すべての話者交代での話者識別

キャプションの規約では、話者が変わるたびに話者ラベルを付ける必要があります。最初に登場したときだけではありません。一般的な形式は、行頭に「SARAH:」と置くか、インラインのマーカーとして「[Sarah]」を使う方法です。AIによる話者分離は、クリーンな音声の2者インタビューであればそれなりにうまく機能します。しかし、3人以上の話者、重なり合う発言、似た声、単一の遠距離マイクで録音された音声では苦戦します。

3人での会話で話者ラベルが欠けていると、文字起こしはほぼ使い物になりません。 誰が誰に反対しているのか読み取れず、それは対話中心の録音の核心であることが多いからです。

話者分離がどのように機能し、どこで限界を迎えるかについては、話者分離の解説をご覧ください。

キャプション必須の非音声サウンド

キャプションは視聴者が聞こえないことを前提としています。つまり、意味のある音声はすべて、発話だけでなくテキストでの等価表現が必要です。

DCMPのキャプション品質ガイドラインでは、非音声情報を含む音声の完全なテキスト表現を求めています。実際には次のようになります。

  • 理解に影響する環境音: 「[ドアがバタンと閉まる]」「[警報が鳴る]」「[群衆が歓声を上げる]」
  • 歌詞付きの音楽: シーンで中心的な役割を果たす場合は実際の歌詞を。「[音楽が流れる]」ではなく
  • インストゥルメンタル音楽: 雰囲気が物語に関連する場合、「[緊張感のある弦楽器の音楽]」や「[明るいピアノ]」
  • 口調や話し方: 言葉だけでは意味が変わってしまう場合、「[皮肉な口調]」や「[ささやき声]」

AIによる文字起こしは、非音声の注釈をほぼ生成しません。これはAIの出力とアクセシビリティ基準のキャプションの間にある最も明確なギャップの一つです。ファイル内のすべての非音声サウンドは、レビュー中に手動で追加する必要があります。

ConvertAudioToTextの字幕生成ツールがキャプションのエクスポートを示す画面
ConvertAudioToTextの字幕生成ツールがキャプションのエクスポートを示す画面

読みやすいタイミングと改行

発話の前後に表示されるキャプションは混乱を招きます。キャプションのタイミングは、音声が流れている間にテキストを表示し、話し手が止まってから約1秒以内に消えるようにすべきです。

読む速度も重要です。DCMPは成人向けコンテンツで1分間に150〜160語を基準とし、絶対上限は225語としています。FCCは、視聴者が読める速度を超えてキャプションを流さないよう推奨しています。音声が毎分160語を超える場合(早口の話し手、重なる会話、専門的または法律的な密集した表現など)、キャプションはそのまま表示するのではなく、誰も追えない速度を避けるために編集して短くする必要があります。

行の長さは、1行あたり最大32文字、画面上で同時に表示するのは最大2行です。文の自然な区切りで改行し、フレーズの途中で切らないようにします。

聴覚障害者および難聴者ユーザーと制作担当者がよく尋ねる追加の質問

AI出力に人間の編集が必要な理由

AIの文字起こしをアクセシビリティ基準のキャプションファイルに変換する手順は次の通りです。

  1. 音声からテキストなどのツールを使って文字起こしを生成します。TXTまたはVTT形式でエクスポートします。
  2. キャプションエディタ(Subtitle Edit、Aegisub、またはブラウザベースのキャプションツール)で開きます。
  3. 音声を聞きながら読み進めます。聞き間違いを修正します。固有名詞、専門用語、名前には特に注意を払います。
  4. 話し手が変わるたびに話者ラベルを追加します。
  5. 意味を持つ非音声の音は角括弧で囲んで追加します。
  6. 行の長さを確認し、文の区切りで改行します。
  7. 読む速度を確認します。キャプションブロックが時間枠に対して長すぎる場合は、削るか分割します。
  8. 最終的なVTTまたはSRTをエクスポートします。

1時間の音声または動画の場合、人間による編集作業は通常2〜3時間かかります。これはゼロから始める場合(手動キャプションで6〜9時間)よりはるかに速く、AIの下書きが話し言葉の量を確実に処理します。人間の作業は、AIが見逃すすべてを処理します。

単にクリーンな文字起こしが欲しいだけで、キャプションファイルを作る必要がないなら、ConvertAudioToText でAIドラフトを取得し、キャプションエディタに持ち込めるSRTとVTTファイルを書き出せます。

このワークフローの字幕生成側がどう見えるかについては、字幕生成ツール がSRTとVTTの両方を書き出します。

個別のキャプションファイルを超えて

ライブイベントやリアルタイムの場面では、CART(Communication Access Realtime Translation)がプロフェッショナル標準です。訓練を受けたCART提供者はステノタイプ機を使って、リアルタイムで一字一句のキャプションを生成します。CARTの精度は約98.5%に達し、これはFCCが引用するリアルタイム標準です。ライブイベント向けのAI自動キャプションは改善されてきましたが、特に騒がしい部屋、なまりがある場合、複数の話者が重なる場合には、依然として信頼性が低いままです。

法的な手続き、医療相談、政府の手続きといった高リスクの場面では、AIキャプションはCARTや資格を持つ手話通訳者の代わりにはなりません。

平易な言葉のバージョン は、英語が第二言語である聴覚障害者ユーザーに役立ちます。一般的な語彙と短い文で要約された文字起こしは、一字一句のキャプションよりもこの層に適していることがよくあります。多くのコンテンツ制作者が両方を提供しています。

標準が定めるもの

コンプライアンス要件(WCAG 2.1 AA、ADA、Section 508、欧州アクセシビリティ法)を理解する価値はありますが、これらの標準は恣意的な閾値を発明するのではなく、聴覚障害者ユーザーが必要とするものをコード化しています。99%の精度目標が存在するのは、聴覚障害者の読解に関する研究が、1%を超えるエラー率が技術的な語彙を含むコンテンツの理解を測定可能な形で低下させることを示しているからです。非音声要件が存在するのは、音の手がかりがないナラティブコンテンツは、聞こえない視聴者にとって不完全だからです。

欧州アクセシビリティ法は2025年6月28日に施行され、EU加盟国における民間セクターのサービスにも、新規コンテンツに対するキャプション義務が拡大されました。既存コンテンツには2030年までの移行期間が設けられています。これは、これまで公共セクターのみに限られていた範囲を大きく超える拡張です。

WCAG 2.1の基準とその要件の完全な解説については、WCAG準拠と文字起こしをご覧ください。ADAが特定の事業体タイプにどう適用されるかは、音声コンテンツのADA準拠を参照してください。より広い国際的な状況については、国別のアクセシビリティ法をご確認ください。

私の見解:最も一般的なアクセシビリティの失敗は、法律を知らないことではありません。それは、自動生成キャプションが「十分良い」と決めつけることです。なぜなら、単語の大部分を拾えているからという理由で。聴覚障害や難聴のユーザーにとって、テキストが音声コンテンツへの主要なアクセス手段である以上、「大部分の単語」では基準に達しません。「すべての意味」が基準なのです。人間によるレビューの工程は任意ではありません。それが本質なのです。

FAQ

キャプションは、聴覚障害や難聴のユーザーに実際に役立つためには、どのレベルの精度が必要ですか?

DCMPとFCCはどちらも、ポストプロダクションのキャプションについて99%の単語レベル精度を基準と定めており、リアルタイムでは98.5%としています。95%の精度では、1,500語の講義に約75の誤りが含まれることになり、技術的な内容の理解を損なうのに十分です。AI文字起こしは、良好な条件下では通常90〜97%に達しますが、公開された研究によると、実際の環境でのパフォーマンス、特にストリーミングキャプションでは、ベンダーが報告する数値を大幅に下回ることが分かっています。AIのドラフト後の人間によるレビューが、99%への確実な道です。

キャプションには、音声以外のどのような音を含める必要がありますか?

コンテンツの理解に意味を持つあらゆる音声、具体的には物語に影響を与える背景音(「[ドアがバタンと閉まる]」「[電話が鳴る]」)、歌詞付きの音楽、感情的または物語的に重要なインストゥルメンタル音楽(「[緊迫したバイオリンの音楽]」)、そして話者が変わるたびの話者識別が含まれます。AIツールは非音声の音をほぼ捉えることができません。これらは人間によるレビューの段階で手動で追加する必要があります。

アクセシビリティの観点で、キャプションと字幕の違いは何ですか?

キャプションは聞こえない視聴者向けに書かれており、会話、話者識別、関連する効果音、音楽の合図など、意味のあるすべての音声を含みます。字幕は、言語がわからないが聞こえる視聴者向けの会話の翻訳であり、非音声の音は省略されます。アクセシビリティにはキャプションが必要です。クローズドキャプションはオンとオフを切り替えられます。オープンキャプションは動画に恒久的に焼き付けられます。

聴覚障害のあるユーザーは、キャプションと手話通訳のどちらを好みますか?

好みは個人と状況によって異なります。多くの文化的に聴覚障害のあるユーザー、特にASLやBSLを第一言語とする人々は、長いコンテンツでは手話の方が自然で、キャプションを読むより疲れにくいと感じます。法的手続きや医療相談のような重要度の高い場面では、手話通訳者が流暢な手話使用者にとってより良いアクセスを提供します。キャプションは、中途失聴の成人や難聴のユーザーなど、テキストに慣れているより広い層に役立ちます。可能であれば、両方を提供することが最も包括的な選択肢です。

AI生成の文字起こしは、WCAG 2.1 AAのキャプション要件を満たすのに十分ですか?

それだけでは不十分です。WCAG 2.1 SC 1.2.2(レベルA)は、収録済み動画に対する同期したキャプションを要求し、SC 1.2.4(レベルAA)は、ライブ動画に対するリアルタイムのキャプションを要求しています。ガイドラインでは、キャプションは音声と同等であること、つまり非言語情報も含むことが明記されています。生のAI文字起こしをVTTに変換したものは、技術的なフォーマット要件を満たすかもしれませんが、話者ラベル、非言語音、タイミングの正確さが欠けていることがほとんどです。人間によるレビューがそのギャップを埋めます。エンティティタイプ別のコンプライアンス義務の詳細な解説については、WCAGコンプライアンスと文字起こしに関する記事をご覧ください。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles