
アクセシビリティキャプションとADAコンプライアンス、2026年版ガイド
Summarize this article with:
米国のウェブ動画では、法的基準はWCAG 2.1 AAで、すべての録画済み動画に正確で同期したキャプション(基準1.2.2、レベルA)とライブ配信にライブキャプション(1.2.4、レベルAA)が必要です。DOJの2026年4月延長後、大規模な州・地方政府は2027年4月26日まで、小規模は2028年4月26日までです。生の自動キャプションは単体で精度基準をクリアしません。監査に通るワークフローは、AI下書き、人間レビュー、タイミング確認です。
- 期限が変更されました。 司法省による2026年4月の延長後、人口5万人以上の大規模な州・地方政府は2027年4月26日まで、それより小さい自治体や特別区は2028年4月26日までとなっています。
- 自動キャプションだけでは不十分です。 この規則では、正確なキャプションが求められます。YouTubeの自動キャプションは、クリーンなスタジオ音声で約90〜95%の精度ですが、音楽やノイズが入ると60〜75%に落ち込み、その誤りは裁判所が不適合とみなします。
- 監査に耐えるワークフローは、AIによる下書き、その後の人間によるレビュー、そしてタイミングの確認です。 これはプロのキャプション制作業者が使うのと同じ形で、AIが大部分を処理し、人間が残った誤りを拾います。
このガイドでは、どの規則があなたに適用されるか、キャプションが技術的に満たすべき要件、自分でやる場合と業者に依頼する場合の正直なコスト比較、そして再現可能なワークフローについて説明します。
2026年にビデオのADAコンプライアンスが重要な理由
ウェブ動画のアクセシビリティは、ここ数年で「あれば良いもの」から、文書化された法的義務へと変わりました。2024年4月、司法省はTitle II規則を最終決定し、初めて具体的な技術基準(WCAG 2.1 AA)と、州・地方政府に対する具体的な期限を設定しました。民間セクターのADA Title III訴訟でも、キャプションのないビデオは効果的なコミュニケーションの提供の失敗と扱われています。
最も明確な前例は曖昧ではありません。全米ろう者協会対ハーバード大学および全米ろう者協会対MITの訴訟では、国内で最も著名な2つの大学が同意判決(ハーバードは2020年2月、MITは2020年7月に承認)に合意し、今後公開するオンラインコンテンツにキャプションを付けることを義務付けられました。ハーバードの訴訟では原告側弁護士費用が150万ドルを超えました。これらは差止命令による和解であり、巨額の損害賠償ではありませんでしたが、一般向けにビデオを公開する機関はキャプションを付けることが期待されるという基準を確立しました。
動画を公開していて、顧客、学生、従業員、あるいは関係者に見てもらうことを想定しているなら、2026年においてキャプションは必須の法的要件であり、仕上げのオプションではありません。 このガイドでは、適用されるルール、キャプションが満たすべき仕様、そして制作予算の4分の1を費やさずにコンプライアンスを確保できる実践的なワークフローを解説します。
あなたに適用されるルール
米国の3つの枠組みがウェブ動画のキャプションに関係しており、それぞれ適用範囲と執行メカニズムが異なります。
| 枠組み | 対象 | 参照する基準 | 執行方法 |
|---|---|---|---|
| ADA第2編 | 州および地方政府 | WCAG 2.1 AA(2024年DOJ規則) | 期限が定められたDOJ規則 |
| ADA第3編 | 公共施設、商業ウェブサイトも含むと解釈される | 裁判所はWCAGをベンチマークとして参照 | 私人による訴訟 |
| 第508条 | 連邦機関および請負業者 | WCAG 2.0 AA(参照により組み込み) | 調達および機関による審査 |
ADA第2編は、明確な期限が設定されているものです。 DOJの2024年規則ではWCAG 2.1 AAが要求され、2026年4月に同省は期限を延長する暫定最終規則を発行しました。人口5万人以上の団体は2027年4月26日まで、それより小規模な団体や特別区は2028年4月26日までとなっています。基準自体は変わっておらず、変更されたのは期限だけです。
米国外では、欧州アクセシビリティ法が2025年6月28日に発効しました。この法律は特定の技術仕様を明示していませんが、EU調和規格EN 301 549が適合性の推定基準となり、この規格は現在WCAG 2.1に追従しています(2.2への更新が進行中)。英国の2010年平等法も、英国の視聴者に対して同様の範囲をカバーしています。
複数の地域で事業を展開しているなら、WCAG 2.2 AAを作業目標にしてください。 キャプションの基準はWCAG 2.0、2.1、2.2で同一なので、2.2に準拠して構築すれば、米国の法的ハードル(2.1 AA)とEU基準の両方を同時にクリアできます。
プレーンな英語で見るキャプション要件
WCAGは、キャプションと音声説明に関わる4つのメディア基準を定義しています。レベルが重要なのは、レベルAが最低基準であり、AAが規制が指し示す水準だからです。
| 基準 | 要件 | レベル |
|---|---|---|
| 1.2.2 キャプション(収録済み) | 音声付きのすべての収録済みビデオに対する同期キャプション | A |
| 1.2.3 音声説明またはメディア代替 | 収録済みビデオに対する完全なトランスクリプトまたは音声説明 | A |
| 1.2.4 キャプション(ライブ) | 同期メディア内のライブ音声に対するライブキャプション | AA |
| 1.2.5 音声説明(収録済み) | 収録済みビデオに対する音声説明トラック | AA |
キャプション自体は、以下の技術的なポイントを満たす必要があります。
- 音声と同期していること。 キャプションは発話に合わせて表示され、遅れたり先走ったりしてはいけません。
- 話された言葉に正確であること。 すべての会話は、話者が極端にためらいがちだったり、フィラーが多い場合を除き、逐語的またはほぼ逐語的であること。
- 複数の人が話し、フレームから誰が話しているかが明らかでない場合、話者が特定されていること。
- 意味を持つ非音声の音が記載されていること。 例えば
[拍手]、[グラスが割れる音]、[不気味な音楽]など。 - 音声と同じ言語であること。 ただし、代替言語が唯一の実行可能な選択肢である場合を除きます。
よくある誤解に反して、キャプションに求められていないこと: 複数の言語である必要はなく、映画のタイトルシーケンスのようにスタイルを整える必要もなく、意味を持たない純粋なインストゥルメンタル音楽にキャプションを付ける必要もありません。
コンプライアンスにおけるクローズドキャプションとオープンキャプション
クローズドキャプション(視聴者が切り替えられる別トラック)とオープンキャプション(動画のピクセルに焼き込まれたテキスト)は、どちらも1.2.2を満たします。この選択はユーザー体験に影響しますが、コンプライアンス上の適合には影響しません。多くのアクセシビリティ支持者は、プラットフォームが対応している場合、クローズドキャプションを推奨します。視聴者がテキストのサイズを変えたり、言語を切り替えたり、スクリーンリーダーと画面上のテキストが競合する場合にオフにしたりできるからです。
オープンキャプションが適切なのは、配信先がソフトトラックを削除する場合です。TikTok、Instagram Reels、その他ほとんどのショートフォームプラットフォームは、アップロード時に外部キャプションファイルを除去するため、焼き込みが表示を保証する唯一の方法です。動画に字幕を追加するツールは、同じソースファイルから焼き込み版を生成します。完全なトレードオフについては、オープン vs クローズドキャプションの解説で全プラットフォームを詳しく説明しています。
コンプライアンス上は、公開先のプラットフォームで生き残る方を選んでください。 テキストが正確で同期していれば、どちらも基準を満たします。
自動生成キャプションだけでは不十分
ここが組織が最も間違えやすい部分です。YouTubeの自動キャプションや類似機能は、それ単独ではルールが求める正確性の基準を満たしません。
DOJのウェブガイダンスは、動画が「正確で話者を特定する同期キャプション」でアクセシブルにできると述べています。重要なのは正確という言葉です。独立したテストでは、自動キャプションの精度は、明瞭な単一話者のスタジオ音声で約90〜95パーセント、会話音声で85〜90パーセント、背景音楽やノイズが加わると60〜75パーセントに落ちます。90パーセントでも、10語に1語が間違っており、その誤りは最も重要となる箇所、つまり固有名詞、専門用語、話者の切り替わり、そして自動キャプションが完全にスキップする意味のある音声キューに集中しています。
裁判所や政府機関は一貫して、字幕が存在しても不正確であれば法律を満たさないと判断してきました。つまり、監査を通る実用的なワークフローは次のとおりです。
- 優れたAIツールでドラフトを作成する。 CATTの字幕ジェネレーターは、クリアな音声で95〜98パーセントの精度の字幕を生成し、SRT、VTT、TXT、またはASSで書き出します。
- 人間がファイルをレビューする。 固有名詞、専門用語、音声が悪いセグメントをチェックします。自動字幕がスキップするこのステップこそ、法的に差を生む部分です。
- 再生とタイミングを照合する。 字幕が音声に合わせて表示され、半行遅れになっていないことを確認します。
- 修正したファイルを公開する。
ここで正直なところを言うと、AI字幕は、当社のものも含めて、コンプライアンスを満たすにはまだ人間のレビューが必要です。 人間が目を通さずにそのまま監査対応可能だと約束するツールは、過大広告です。AIが労力の大半を省くだけで、レビューを省くわけではありません。
ライブ字幕のコンプライアンス
ライブ字幕はより難しい問題です。リアルタイムの字幕は放送前に人間のレビューを受けることができないからです。基準1.2.4では、レベルAAでライブコンテンツにも字幕が依然として求められます。2026年の一般的な慣行は、高リスクのイベントではリアルタイムの人間編集者が介在するAI字幕を使用し、ライブの精度はレビュー済みの録画より低くなることを受け入れるというものです。
録画されて再放送されるストリームの場合、再放送を公開する前に、完全な品質の字幕を付ける必要があります。 多くのチームは放送中にベストエフォートのライブ字幕を配信し、その後アーカイブ前にAIプラス人間のパイプラインに置き換えます。CATTのライブ字幕ツールはリアルタイム側をカバーし、イベント後の録画は他の録画済みビデオと同じレビューワークフローを経ます。
コンプライアンス対応字幕の実際の作り方: DIY対ベンダー
法令に準拠したキャプションを実現するには、正直な道が2つあります。それぞれ異なる組織に合うもので、唯一の正解はありません。

| アプローチ | 一般的なコスト | 納期 | 得られるもの | あなたの負担 |
|---|---|---|---|---|
| DIY:AIドラフト+社内レビュー(CATT字幕ジェネレーター、その後あなたのレビュアー) | ツール費用のみ。CATTの無料プランはサインアップ不要で10分までのファイルに対応 | 生成は数分、プラスあなたのレビュー時間(30分の動画あたりおよそ10〜15分) | レビュー済みで所有権を持つクリーンなSRT/VTT/TXT/ASS | レビューの負担はあなたにあります |
| プロのキャプション業者(Rev、3Play Media) | Rev:人間確認済みキャプションは動画1分あたり約1.99ドル。市場全体では1分あたり1〜15ドル | 数時間から数日(プランによる) | 契約上の精度保証付きキャプション(3Playは99.6パーセントを宣伝) | 監査人に提示できる業者のSLAと紙の記録 |
価格は2026年6月時点のもので変動します。予算を組む前に各業者のページを確認してください。 Revは人間確認済みキャプションを動画1分あたり1.99ドル、AIのみのキャプションを1分あたり0.25ドルで提供し、スペイン語は3.25ドルです。3Playは1分あたりの価格をスライド式に設定し、99.6パーセントの精度保証を公開しています。人間によるレビュー付きキャプションの市場全体は、納期、話者数、追加オプションに応じて1分あたり1〜15ドルの範囲です。
正直な分かれ目:DIYは安くて速く、コントロールも維持できますが、精度レビューはあなたの仕事です。業者はコストがかかる代わりに、契約上の精度保証と紙の記録を売ってくれます。これは、予算を節約するよりも調達や法的理由でそれを必要とする購入者(連邦政府の請負業者、監査に直面する大規模機関など)にとって重要です。あなたを縛る制約、つまり予算か文書化された説明責任か、どちらで選ぶかです。
音声解説、キャプションだけでは不十分
WCAG 2.2 AAでは、収録済み動画に対して音声解説も基準1.2.5で求められています。音声解説とは、視覚的な内容を全盲や弱視の視聴者向けにナレーションする別の音声トラックで、ナレーターは会話の自然な間合いに合わせて話します。
これはキャプション付けより難しく、コストもかかります。書き起こした台本と、録音するナレーターが必要だからです。プロによる従来の音声解説は、ソース動画1分あたりおよそ15ドルから30ドルが相場ですが、より軽量なワークフローなら低く抑えられます。例えばコーネル大学が公開している3Playの料金表では、標準解説が1分あたり7.50ドル、拡張解説が12ドルです。テンポが速くカット割りが多いエンタメ系は高め、企業向けや教育・情報系の動画は低めに設定されています。
重要度の低いコンテンツなら、会話と視覚的な説明の両方を含む拡張トランスクリプトで、レベルAの基準1.2.3を満たせます。これは最低限のラインです。フルAA準拠には音声解説トラックが必須となります。
よくあるコンプライアンス違反
監査で最も頻繁に指摘されるギャップは次の通りです。
- 生の自動キャプションに頼っている。 キャプションは技術的に存在するものの、精度が低すぎて裁判所が非準拠と判断するケースがあります。
- ライブ配信イベントにライブキャプションがない。 録画にはキャプションを付けるものの、生放送には付けない。これは基準1.2.4に違反します。
- 話者の識別がない。 映像だけでは誰が話しているか分からない場面で話者を区別していないキャプションは、テキスト自体が正しくても監査で不合格になります。
- 取得可能なキャプションファイルがない。 苦情や監査が入ったとき、アセットごとにキャプションファイルが必要です。ソースファイルなしでキャプションを焼き付けてしまったチームは、提出できるものが何もありません。
監査前のセルフチェック: 公開済みライブラリから動画を3本ランダムに選び、それぞれに同期したキャプション、正確なテキスト、必要な箇所の話者ラベル、非音声のサウンド表記、音声と合ったタイミングがあることを確認します。そのいずれかが失敗した場合、ライブラリの残りにも同じギャップがある可能性が高いです。
ADAコンプライアンスの実践的ワークフロー
コンプライアンスを達成し、維持するための再現可能なプロセス:
- ポリシーを文書化する。 公開するすべての動画には、公開前に人間によるレビュー済みキャプションが必要であると明記します。法的リスクのほとんどは、ポリシーの抜け穴から生じるものであり、単発のキャプション漏れからではありません。
- ツールチェーンを選ぶ。 2026年のスタックは、文字起こしまたは字幕ツールにレビューステップを加えたものです。無料の文字起こしツールでクリーンなドラフトが得られ、編集は任意のテキストエディタまたは字幕エディタで行います。
- レビューを公開プロセスに組み込む。 レビュアーは動画の作成者以外の人物にします。30分の動画の場合、キャプションの正確性をレビューするのに約10〜15分かかります。
- キャプションファイルを動画と一緒にアーカイブする。 監査や苦情が来たときに、各アセットのSRTまたはVTTが取得可能である必要があります。
- 基準を満たしていない過去のコンテンツを再キャプションする。 トラフィックの多いコンテンツと、規制プロセスから参照されているものを優先します。
今週やること
ライブラリ内のトラフィックが最も多い5本の動画を選び、無料の文字起こしツールでクリーンなドラフトを作成し、元の作成者以外の人物にキャプションをレビューしてもらい、公開します。これで、最もリスクの高いアセットがコンプライアンスに移行します。
新しいコンテンツについては、公開チェックリストにキャプションレビューのステップを追加して、何も欠落したまま出荷されないようにします。ここでのコンプライアンスは、すべての動画に対して実行するプロセスであり、一度で完了するプロジェクトではありません。 ワークフローを一度正しく構築すれば、次に公開するものにそのまま応用できます。
よくある質問
YouTubeの自動キャプションはADAコンプライアンスに適合しますか?
自分だけでやるのは無理です。ルールでは正確なキャプションが求められますが、自動キャプションはクリーンな音声で約90〜95パーセントの精度で、ノイズや複数話者がいると精度が下がります。つまり、名前、用語、話者の切り替わりといった肝心な箇所で誤りが出るのです。自動キャプションは良い下書きにはなりますが、精度の基準を満たすには人のレビューが必要です。
ADAタイトルIIが要求するWCAGバージョンは?
DOJの2024年タイトルII規則はWCAG 2.1レベルAAを採用しています。国際的に運営しているなら、WCAG 2.2 AAを目標に構築するのが安全です。キャプションの基準は2.0、2.1、2.2で同一で、2.2はEU基準も満たすからです。
ADAタイトルIIのウェブアクセシビリティの期限はいつ?
DOJの2026年4月の延長後、人口5万人以上の州・地方政府は2027年4月26日まで、それより小さい団体や特別区は2028年4月26日までです。この期限を動かした暫定最終規則は2026年4月20日に発効しましたが、WCAG 2.1 AA基準自体は変わっていません。
コンプライアンスにはオープンキャプションとクローズドキャプションのどちらが必要?
テキストが正確で同期していれば、どちらでも基準を満たします。プラットフォームが対応している場合はクローズドキャプションを使い、視聴者がサイズ変更、翻訳、オフにできるようにしましょう。TikTokやInstagram Reelsのように外部のキャプショントラックを削除するプラットフォームでは、オープン(焼き込み)キャプションを使います。
コンプライアンス対応のキャプション料金は?
AIの下書きと社内レビュー担当者で自分でやる場合、コストはツール代とレビュー時間だけです(CATTの無料枠はサインアップ不要で10分までのファイルに対応)。Revのようなプロのベンダーは、人間が検証したキャプションで動画1分あたり約1.99ドル、市場全体では納期やオプション次第で1分あたり1ドルから15ドルです。
音声解説も必要ですか?
WCAG AA に完全準拠するには、はい、基準 1.2.5 で、動画に音声では伝わらない意味のある視覚コンテンツがある場合が該当します。プロの音声解説は通常、1分あたり約15ドルから30ドルかかります。重要度の低いコンテンツであれば、視覚情報を説明する拡張トランスクリプトでレベルAの最低基準(基準 1.2.3)を満たせます。
法律は政府だけでなく民間企業にも適用されますか?
Title II の厳格な期限は州政府と地方政府に適用されます。民間企業は Title III に該当し、裁判所は商業ウェブサイトや動画を対象とみなす判決を繰り返し下しており、固定の期限ではなく個人訴訟を通じて執行されます。NAD とハーバード大学、MIT との和解は、大規模機関でそれがどのように機能するかを示しています。
1つのキャプションファイルをすべてのプラットフォームで使えますか?
はい。正確な SRT を1つ作成し、一度レビューしてから再利用します。プラットフォームが対応していればクローズドキャプショントラックとしてアップロードし、トラックを削除するプラットフォームには同じファイルを使ってオープンキャプションを焼き付けます。ソースファイルが唯一の基準点なので、修正は1か所だけで済みます。
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
Call Transcription for Customer Support QA: A Practical CATT Workflow
Use call transcription for customer support QA to review calls faster and coach agents. Upload audio or a meeting URL, get speaker labels and AI summaries.
Medical Transcription for Clinical Notes: A Practical AI Workflow for Clinicians
Learn how clinicians use AI transcription for clinical notes. A practical CATT workflow for audio upload, speaker labels, summaries, and TXT or DOCX export.