
動画に字幕を追加する方法:2026年ステップバイステップガイド
Summarize this article with:
AIツールでタイムコード付きのキャプションファイル(SRTまたはVTT)を生成し、任意のテキストエディタで誤りを修正したら、ソフトトラックとして添付する(YouTube、Vimeo)か、ショート動画向けプラットフォーム(TikTok、Instagram Reels)向けにはピクセルに焼き込みます。ほとんどの短い動画なら全体の所要時間は20分以内です。字幕の焼き込みは別工程であり、詳細は「動画への字幕焼き込み」ウォークスルーで解説しています。
**2026年に動画へ字幕を追加する作業は、3つのステップに集約されます。タイムコード付きキャプションファイルを生成し、誤りを修正し、動画の公開先に応じて添付するか焼き込むかを選ぶ。**最初のステップは以前は数時間かかりましたが、今ではAIツールが数分で処理します。2番目のステップは依然として自分の仕事ですが、きれいな音声なら短時間で済みます。3番目のステップは2つの道に分かれます。字幕プレーヤーを持つプラットフォーム向けのソフトトラックか、外部ファイルを除去するソーシャルフィード向けの焼き込みピクセルです。
このガイドでは両方の道順を解説し、公開先ごとに適切なファイル形式を紹介したうえで、YouTube、TikTok、Instagramの具体的な手順をお伝えします。
ソフト字幕と焼き込み字幕
最も重要な判断は、視聴者が字幕のオン/オフを切り替えられるかどうかです。
**ソフト字幕(クローズドキャプション)は、独立したテキストトラックまたはファイルとして動画の外側に存在します。**表示するかどうかはプレーヤーが決めます。YouTubeでは視聴者にCCボタンが見えます。自社サイトのHTML5動画プレーヤーでは、VTTファイルを添付します。検索エンジンはテキストをインデックス化できるため、動画SEOにも役立ちます。元のMP4をダウンロードされた場合、字幕は埋め込まれていないため、普通の動画プレーヤーでは表示されません。
焼き込み字幕(ハードコード字幕、オープンキャプション)は映像そのものの一部であり、書き出し時に各フレームに書き込まれます。すべてのプレーヤー、すべてのデバイス、すべての画面録画で表示されます。切り替えボタンはありません。TikTok、Instagram Reels、Twitter/Xの動画フィードはすべてミュート状態で自動再生され、多くのプラットフォームはアップロード時にソフト字幕トラックを除去するため、確実にアップロード後も残るのは焼き込みだけです。
両方が必要な動画もあります。検索インデックス化とアクセシビリティのためにYouTubeへソフトSRTをアップロードしつつ、ソーシャル用カットのために焼き込み版を書き出すのです。同じソースファイルから字幕レイヤーを有効にしたままソーシャル版をレンダリングすれば完成です。レンダリング設定の詳細は動画への字幕焼き込みの記事で解説しています。
ステップ1:AIでキャプションファイルを生成する
2026年現在最速の出発点は、動画や音声をAI文字起こしツールにアップロードし、数分でSRTまたはVTTを受け取ることです。

本格的な編集ワークフローを組まずに、きれいな字幕ファイルだけが必要なら、ConvertAudioToTextの字幕ジェネレーターがワンステップで処理し、99言語に対応してSRT、VTT、TTMLを書き出します。YouTubeのURLを貼り付けるかファイルをアップロードし、話されている言語を選んで、ファイルをダウンロードするだけです。
実際の手順は次のとおりです。
- 動画ファイル(MP4、MOV、MKV、WebMいずれも可)をアップロードするか、YouTubeのURLを貼り付けます。
- 話されている言語を選択します。複数言語が混在する録音では、主要な言語を選びます。
- 出力形式を選びます。ほとんどの用途ではSRT、自社サイトのHTML5動画にはVTT、放送局から指定があればTTMLです。
- ファイルをダウンロードし、任意のプレーンテキストエディタで開きます。
きれいな音声では、AI文字起こしは現在95〜98%の精度に達します。背景ノイズや強い訛りのある実録環境では90〜95%を見込んでください。公開前に固有名詞、専門用語、聞き間違えた語句を拾うために、音声1時間につき10〜15分を確認に充てましょう。文字起こし精度の解説では、誤りがどこに集中するのか、効率的に校正する方法について詳しく掘り下げています。
ステップ2:SRTファイルを編集する
SRT形式はプレーンテキストです。各キャプションブロックには連番、開始・終了のタイムコード、1〜2行のテキストが含まれます。
1
00:00:00,000 --> 00:00:03,500
The first caption appears here.
2
00:00:03,800 --> 00:00:07,200
The second caption follows.
読みやすさに関わるいくつかのルールがあります。
- **1行は42文字未満に収める。**これはNetflixの基準であり、モバイルを含むすべての画面サイズで機能します。
- **各ブロックは画面に1〜6秒表示する。**短すぎると誰も読み終える前に消えてしまいます。長すぎると、話者が次の話題に移った後も画面が散らかったままになります。
- **毎秒12〜20文字を目標にする。**毎秒20文字(CPS)を超えると、大半の視聴者は単語を読み飛ばし始めます。早口の話者なら短時間なら毎秒22〜25文字になることもありますが、毎秒20文字超が続くと視聴者の一部を失います。
- 行替えは自然な区切り(読点、接続詞、フレーズの境界)で行い、フレーズの途中で切らないようにします。
SRT形式そのものについては、UTF-8エンコーディングがYouTubeおよびほとんどのプラットフォームで必須です。Windowsのメモ帳で編集する場合は、BOM(バイトオーダーマーク)なしで保存してください。その他のプレーンテキストエディタは自動的に処理してくれます。
ステップ3a:ソフト字幕を添付する(YouTubeとWeb)
**YouTubeの場合は、YouTube Studio内でSRTを直接アップロードします。**対象の動画を開き、左メニューの「字幕」タブを開いて、「言語を追加」をクリックし、言語を選択してから、「字幕」列の「追加」をクリックします。「ファイルをアップロード」を選び、「タイミングあり」(SRTにはすでにタイムコードが含まれています)を選択して、ファイルを指定して保存します。
YouTubeはファイルを即座に処理し、通常1〜2分以内に公開されます。アップロードしたSRTは、プラットフォーム自身の自動生成キャプションを置き換えます。自動生成キャプションは平易な英語以外では精度が明らかに落ちます。アップロードしたキャプションはGoogleにもインデックスされるため、動画内で話されたキーワードが検索トラフィックを呼び込むこともあります。YouTube自動字幕 vs AIツールの比較記事では、訛りのある発話や技術用語における品質差を示しています。
自社サイトでは、SRTの代わりにVTTを使用します。ブラウザのネイティブなtrack要素は、VTTをネイティブ形式として扱います。
<video>
<track kind="subtitles" src="captions.vtt" srclang="en" label="English" default>
</video>
これにより、JavaScriptなしでオン/オフ切替、言語切替、基本的な位置調整が可能になります。形式の詳細については、SRT vs VTT 字幕形式で違いを解説しています。
ステップ3b:動画に字幕を焼き込む(TikTok、Instagram、ソーシャル)
TikTok、Instagram Reels、その他のショート動画プラットフォームでは、確実なのはアップロード前にテキストを動画に焼き込む方法です。両プラットフォームにはネイティブの字幕ステッカーと自動字幕機能があり、見た目は悪くありませんが、プラットフォーム独自のフォントとレイアウトに縛られます。自分で書き出した焼き込み字幕なら完全に制御でき、再シェアやクロスポストでも残ります。
一般的なワークフローは次のとおりです。
- SRTを動画編集ソフト(Premiere Pro、DaVinci Resolve、Final Cut Pro、CapCut)に読み込みます。
- スタイルを適用します。白文字、暗い背景ボックス、セーフゾーンの余白を確保して画面下三分の一に配置します。
- 字幕トラックを映像に焼き込んだ状態で動画を書き出します。
私の意見としては、3分未満の短いソーシャルクリップなら、SRTトラック1本の焼き込みで書き出し時間が増えるのは最新のマシンでも1分未満です。プラットフォームごとのフォントサイズやセーフゾーンの詳細は、TikTokとInstagramの字幕付けガイドにあります。バッチワークフロー向けのFFmpegコマンドを含む焼き込みプロセス全体については、動画への字幕焼き込みを参照してください。
CapCutに関する注意点として、自動字幕生成は無料枠で使えますが、独立したSRTファイルの書き出しにはデスクトップ版でProサブスクリプションが必要です。さらに編集するためにSRTファイル自体が必要な場合は、CapCutから書き出そうとするのではなく、まず専用ツールで生成してからCapCutに読み込むのが得策です。
動画編集ソフトの内蔵機能:使う価値がある場面
2026年には、Premiere Pro、DaVinci Resolve、Final Cut Pro、CapCutのすべてに自動字幕生成機能が搭載されています。DaVinci Resolve v21では、AI Animated Subtitlesと最大10人の話者検出が追加されました。これらは、すでにタイムラインで編集していて、アニメーション化して一括で焼き込めるスタイル付きテキストレイヤーとしてキャプションが欲しい場合に便利です。
**限界は精度です。**内蔵の字幕付けはこれらのアプリでは副次的機能であり、中核製品ではありません。実際には、専用ツールの文字起こしの方が修正箇所が少なくなる傾向があり、長尺コンテンツでは時間の節約になります。ハイブリッド手法がうまく機能します。SRTを外部で生成し、File > Importまたはキャプションパネル経由でキャプショントラックとしてエディタに読み込み、そこからスタイリングとレンダリングを行います。精度とスタイリングの制御を両方保てます。
形式リファレンス:SRT、VTT、TTML
| 形式 | 最適な用途 | スタイリング | 放送対応 |
|---|---|---|---|
| SRT | YouTube、Vimeo、編集ソフト、汎用 | なし(テキストのみ) | 不可 |
| VTT | 自社サイトのHTML5動画 | 基本的なCSS、話者ラベル | 不可 |
| TTML | 放送TV、Netflix、OTT納品 | リッチ、XMLベース | 可 |
放送局やストリーミングサービスから納品仕様書が届いたら、ほぼ確実にTTMLプロファイルのいずれか(IMSC1が一般的)が指定されています。それ以外のすべての場面では、SRTが安全なデフォルトであり、Web用途はVTTがきれいに処理します。それぞれの必須ケースについては、SRT vs VTT vs TTMLの記事で詳しく説明しています。
多言語字幕
同じ動画のフランス語版、スペイン語版、ポルトガル語版が必要な場合は、各言語をゼロから文字起こしし直すのではなく、SRTファイルを翻訳してください。タイムコード付きテキストの翻訳ではタイムコードが保持されるため、手動での再調整なしに翻訳済みキャプションが同期したままになります。1つのソース言語から複数のターゲットSRTを作るパイプライン全体については、字幕翻訳ワークフローで解説しています。
YouTubeでは、各ロケールの「言語を追加」から翻訳済みSRTをそれぞれアップロードします。YouTubeは視聴者のアカウント設定に基づいて、適切な言語を表示します。
FAQ
ソフト字幕と焼き込み字幕の違いは何ですか?
ソフト字幕(クローズドキャプション)は独立したテキストファイルまたはトラックとして存在します。視聴者はオン/オフを切り替えられ、YouTubeなどのプラットフォームは検索用にテキストをインデックス化します。焼き込み字幕(オープンキャプション、ハードコード字幕)は動画のピクセルに組み込まれており、プレーヤーの設定にかかわらず常に表示されます。YouTubeとVimeoにはソフトトラックを使用し、TikTok、Instagram Reels、アップロード時に外部キャプションファイルを除去するプラットフォームには焼き込み字幕を使用してください。
字幕ファイル形式はどれを使うべきですか?SRT、VTT、それともTTML?
SRTが万能のデフォルトです。スタイリングはできませんが、すべてのプラットフォームとエディタが対応しています。VTTは自社サイトのHTML5動画に最適で、ブラウザのtrack要素のネイティブ形式であり、基本的なCSSスタイリングと話者ラベルに対応しています。TTMLは放送TV納品や主要ストリーミングサービス(Netflix、Hulu)に必要です。YouTube、Vimeo、一般的な用途ではSRTで十分です。
AI生成字幕の精度はどのくらいですか?
クリーンなスタジオ音声では、現在のAI文字起こしツールは95〜98%の精度に達します。背景ノイズや強い訛りがある実録環境では90〜95%を見込んでください。固有名詞、専門用語、話者の重なりに誤りが集中します。音声1時間につき10〜15分の確認時間を確保し、訛りのあるコンテンツや専門性の高いコンテンツではさらに時間をかけましょう。
TikTokとInstagram ReelsはSRTファイルのアップロードに対応していますか?
部分的に対応しています。Instagramには投稿時の詳細設定にSRTアップロード欄がありますが、デバイスやアプリのバージョンによって挙動が不安定です。TikTokのネイティブな字幕アップロードはSRTを受け付けますが、表示はプラットフォーム独自のフォントとレイアウトに依存します。両プラットフォームで確実なのは、アップロード前に字幕を動画に焼き込む方法で、フォント、サイズ、位置、スタイルを完全に制御できます。
専用ツールを使わずに、動画編集ソフト内で直接字幕を追加できますか?
はい。Premiere Pro、DaVinci Resolve、Final Cut Pro、CapCutにはすべて自動字幕生成機能があります。ただし、これらのアプリでは字幕付けは副次的機能のため、品質は専用文字起こしツールより一段劣るのが一般的です。実用的なハイブリッド手法としては、専用の字幕ツールで正確なSRTを生成し、それをキャプショントラックとしてエディタに読み込み、そこからスタイリングと焼き込みを行います。なお、CapCutできれいなSRTを書き出すにはデスクトップ版で有料(Pro)サブスクリプションが必要です。
参考資料
- YouTube ヘルプ:字幕とキャプションの追加: https://support.google.com/youtube/answer/2734796
- YouTube ヘルプ:対応している字幕・クローズドキャプションファイル: https://support.google.com/youtube/answer/2734698
- Netflix 字幕スタイルガイド(subtitlesedit.com経由): https://subtitlesedit.com/blog/netflix-subtitle-style-guide-explained
- Subanana:Instagram Reelsに字幕を追加する方法(2026): https://subanana.com/en/blog/how-to-add-subtitles-instagram-reels
- GoTranscript:CapCutで自動字幕を付けてSRTを書き出す方法: https://gotranscript.com/en/blog/add-captions-subtitles-capcut-export-srt
- AssemblyAI:2026年の音声認識の精度はどのくらいか: https://www.assemblyai.com/blog/how-accurate-speech-to-text
- Larry Jordan:Final Cut Pro 11、Premiere Pro 2025、Resolve 20のキャプション機能比較: https://larryjordan.com/articles/comparing-captioning-in-final-cut-pro-11-premiere-pro-2025-resolve-20/
- W3C:TTMLプロファイル: https://www.w3.org/AudioVideo/TT/docs/TTML-Profiles.html
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.