
TikTokとInstagramの字幕付け:2026年クリエイタープレイブック
Summarize this article with:
ショート動画の現実
字幕をピクセルに焼き込んでいなければ、視聴者の相当な割合は字幕を読むことすらありません。TikTokもInstagram Reelsも、クリエイター投稿へのサイドカー字幕ファイルを受け付けていません。信頼できる選択肢は、焼き込み字幕か各プラットフォームのアプリ内ネイティブツールだけです。この記事では、どちらを選ぶべきか、プラットフォームのUIに隠れない字幕の配置場所、そして1本15分未満で完了するワークフローを解説します。
字幕が必要な理由は、単に「みんなミュートで見ているから」ではありません。その主張は厳密にはFacebookのエコシステム由来のもので、TikTokやReels固有の話ではなく、実際はもう少し複雑です。音声ありで視聴している人でも字幕を読みます。注意力が逸れたときに視聴者を引き留め、速い話し方や訛りのある発話を追いやすくし、ろう者や難聴の視聴者にとっては字幕だけが頼みの綱だからです。サードパーティの分析では、字幕付きのショートコンテンツは字幕なしと比べて視聴時間が12〜40%増えることが一貫して示されています。幅が広いのは、効果がニッチ、音声明瞭度、字幕のタイミング精度に左右されるためです。しかし方向性はソースを問わず一致しています。
焼き込みをすすめるより現実的な理由はこちらです。動画はダウンロードされて再投稿され、Storiesに共有され、DMに送られ、別のプラットフォームに投稿されます。ネイティブ字幕は動画が元の文脈を離れた瞬間に消えます。焼き込み字幕はどこへでもついていきます。
ネイティブツールvs焼き込み:実際のトレードオフ
現在、TikTokとInstagramの両方が自動字幕ツールを内蔵しています。TikTokのツールはアップロード時に自動で字幕を生成し、投稿前に編集できます。Instagram版も似ていて、Reelsエディターでステッカーとして適用します。
ネイティブツールには3つの実際的な限界があります。
精度。 TikTokの音声認識は、明瞭な標準英語であれば約80〜90%の精度です。アクセント、BGM、早口、専門用語があると低下します。公開前には必ず確認と修正が必要です。修正しないままの自動字幕は信頼性を急速に損ないます。
カスタマイズ性。 フォントの選択肢は限られ、正確な位置指定はできず、プラットフォームがUIを更新すると字幕の配置が変わることがあります。
移植性。 ネイティブ字幕はそのプラットフォーム上にしか存在しません。クロスポストするなら、外部で字幕を焼き込み、動画がどこに行っても字幕が付随するようにすべきです。
週1〜2回、単一プラットフォームに投稿するカジュアルなクリエイターなら、ネイティブツールで十分です。TikTokとInstagramに同時公開する人、フォントやアニメーションの一貫性を重視する人は、焼き込みが正しいデフォルトです。

2026年のプラットフォーム別セーフゾーン
ここは多くのチュートリアルが間違える部分です。各プラットフォームのUIはフレームの特定領域に重ねて表示され、そこに置いた字幕は部分的あるいは完全に隠れます。以下の数値は1080x1920のソース動画を前提とした概算で、現時点のアプリUIに基づきます。アプリのアップデートで変わり、デバイスによっても多少異なるため、確定前に必ず実際のアプリでプレビューしてください。
| プラットフォーム | 上部デッドゾーン | 下部デッドゾーン | 右側デッドゾーン | 安全な横帯 |
|---|---|---|---|---|
| TikTok(フィード) | 約130〜230px | 約320〜480px | 約120px | 中央寄せで約900px幅 |
| Instagram Reels | 約150〜210px | 約310〜420px | 約84〜100px | 中央寄せで約996px幅 |
| Instagram Stories | 約250px | 約250〜340px(通常投稿/広告) | 最小限 | 幅約1080px、上下は避ける |
| Instagram フィード(正方形、1080x1080) | 約80px | 約130px | 最小限 | 幅約1000px |
クロスポストする人向けの万能セーフ帯: 中央の900x1400ピクセルの矩形内にデザインしてください。これで主要プラットフォームすべての危険域を同時に回避できます。
セーフ帯内での字幕配置は、ほとんどのトーキングヘッド系コンテンツで良い結果が出る位置として、フレーム高さの上から65〜70%が挙げられます。話者の顎より下、画面下部のUIボタンより上にテキストが収まります。Bロール中心のコンテンツでは、下に視覚的な余白が残るため60%の方がうまくいきます。
TikTok特有のポイント
右側のアイコン列(いいね、コメント、シェア、音源)はおおよそy=900からy=1800にかけて、幅約120ピクセルを占めます。フレーム右端に字幕を置くと衝突する恐れがあります。字幕は水平方向に中央揃えにし、最終レンダリングはデスクトップのエディターだけでなく、必ずアプリ上で確認しましょう。
Instagram Reels特有のポイント
UIはTikTokより上部を広く覆い、Reelsヘッダー、プロフィールバー、バッテリー/時刻表示で約150〜210ピクセルになります。下部のデッドゾーンも同程度の大きさです。Instagramのセーフゾーンガイドでは、右側のエンゲージメントアイコンを避けるため、重要なテキストはフレーム幅の中央70〜80%内に収めるよう推奨されています。
Stories特有のポイント
通常のStoriesには上下に約250ピクセルのデッドゾーンがあります。広告配信では返信バーやCTAが加わり、下部のデッドゾーンは約340ピクセルまで広がります。字幕付きのStoriesでは、通常投稿と広告の両方で安全を期すため、テキストをy=270からy=1600の間に収めましょう。
ワークフロー:音声から焼き込み字幕まで
私の意見としては、プリセットさえ用意すれば、パイプライン全体は聞こえほど時間はかかりません。大量処理でも機能する手順は次のとおりです。
ステップ1:SRTを生成する。 動画または音声トラックだけを書き出し、文字起こしツールにかけます。字幕ジェネレーターなら、60〜90秒のクリップで5分未満でSRTが返ってきます。より長い素材を扱う場合は、動画文字起こしツールが動画ファイルを直接処理します。
ステップ2:文字起こしを確認する。 聞き間違えを修正します。特に名前、製品名、専門用語は要チェック。画面上の誤った字幕は、字幕がない場合よりも信頼性を傷つけます。
ステップ3:改行を調整する。 各字幕ブロックは1〜2行にします。1行はおよそ32〜40文字に収めましょう。文字の塊は、ショート動画のスクロール速度では読めなくなります。
ステップ4:字幕エディターに読み込む。 CapCut、Premiere Pro、DaVinci ResolveはいずれもSRTを問題なく読み込めます。保存済みのスタイルプリセット(フォント、色、背景ボックス、アニメーション)を適用します。CapCutの「すべてに適用」ボタンで、全字幕ブロックに一括でスタイルを反映できます。
ステップ5:焼き込んで書き出す。 字幕をサイドカーファイルではなく、動画フレームに描画した状態で書き出します。CapCutでTikTok/Reels向けコンテンツを書き出す際のデフォルト設定です。
ステップ6:スマホのアプリでプレビューする。 ミュートにして字幕だけを見ながら再生します。字幕だけで内容が追えたら成功です。目を細めたらフォントが小さすぎます。字幕がボタンに触れていたら上に移動しましょう。
60秒の動画なら、ラフ編集後のこのパイプラインは10〜15分で回ります。プリセットを保存しておけば、2本目以降は1本あたり5〜7分に縮まります。
フォント、サイズ、カラー
1080x1920のソースでのフォントサイズは、スタイルにもよりますが48〜70ピクセルです。48ピクセル未満はデスクトップモニターでは読めますが、5.5インチのスマホでは目を細める作業になります。72ピクセル超はセーフゾーンを圧迫します。
太字(ウェイト700)がショート動画の標準です。標準ウェイトのテキストは動きのある映像背景に溶けて消えます。
ショート動画のスクロール速度に耐えるフォント:
- Inter:モダンでニュートラル。細身の字形で1行により多くの文字が入ります。
- Montserrat:力強いブランド感。Interよりやや太いストローク。
- DM Sans:コンパクトな印象で、長い単語も不自然な改行なしに収まります。
- Noto Sans:英語以外のコンテンツ向け。無料フォントの中で最も広い文字体系カバー率。
筆記体フォントとセリフ体は避けましょう。サムネイルでは個性的に見えても、動いている映像では読めません。
カラー: 不透明度70〜80%の黒背景ボックスに白テキストが安全なデフォルトです。ボックスがあれば、背後で何が動いていてもコントラストが一定に保たれます。黒の縁取りのみの白テキスト(ボックスなし)は、シンプルな背景や暗い背景では機能しますが、動きの激しい映像や明るい色では破綻します。
強調のためのアクセントカラー(キーワード1語だけ黄色やブランドカラーにし、他は白)は、控えめに使えば効果的です。使いすぎると点滅のような効果が生まれ、かえって視聴維持率を下げます。
アニメーション字幕:今も効く手法
カラオケ式の単語ごとの字幕(発話に合わせて単語がハイライトされる)は、2026年半ば時点でもショート動画で最も成果を出す字幕スタイルです。この形式は、注意力が逸れても視聴者が音声を視覚的に追い続けられるようにします。CapCut、Submagic、OpusClipなどにプリセットがあり、SRTを読み込めば単語レベルのタイミングを自動適用してくれます。
単語ごとのスタイルは、2024年初頭のバイラル形態から成熟しました。2024年版は攻撃的でした。黄色のハイライト、ド派手なポップ、全単語が独立してアニメーション。現在の版はもっと控えめです。ハイライトされる単語にわずかなスケール変化(3〜5%)か色の変化を与え、周囲の単語は低コントラストで見えたまま。洗練された印象になり、古臭さはありません。
チュートリアルやBロール中心など、映像フレームが発話と同じくらい重要なコンテンツでは、静止ブロック字幕(2行、アニメーションなし)の方が良い結果になることが多いです。アニメーションが映像と競合するためです。自分のコンテンツタイプで両方試してみてください。
多市場公開のための翻訳
複数の言語市場に公開するなら、字幕ワークフローにはすでに国際化レイヤーが組み込まれています。元言語のSRTを生成し、翻訳し、言語ごとに別バージョンを焼き込むだけです。動画のピクセル(顔、Bロール、デモ)は普遍的に機能し、変わるのは字幕レイヤーだけです。
ワークフローを一度組んでしまえば、言語ごとの追加作業はわずかで、複数市場へスケールさせられます。SRT生成と元の文字起こしには、ConvertAudioToTextの字幕ジェネレーターが99言語に対応しています。字幕付きコンテンツのアクセシビリティ全般については、字幕で動画をアクセシブルにする方法が規格面を解説しています。
よくある失敗
フィードをスクロールすると、3つの失敗が頻繁に目につきます。
字幕が低すぎる。 TikTokでy=1500より下に置くと、ユーザー名、曲名、プログレスバーの裏に隠れます。必ず実際のアプリでテストしましょう。
フォントが小さすぎる。 デスクトップのエディターでは読めても、腕を伸ばした距離の5.5インチスマホでは判読不能です。迷ったら大きく。
背景とのコントラスト不足。 白い空や明るい背景の上の白テキストは見えません。汎用コンテンツでは背景ボックスか縁取りは必須です。
もうひとつ。投稿前に自動字幕を確認しないこと。 TikTokとInstagramのネイティブツールはどちらも誤字起こしをします。修正しない字幕は、ショート動画クリエイターが懸命に築こうとするプロフェッショナルな印象を損ないます。
キャプションがいつ字幕と呼ばれ、いつまったく別のものとして扱われるのかという広い文脈については、ワークフローを決める前に文字起こしとキャプションと字幕の違いを読む価値があります。また、アクセシビリティ対応が公開要件に含まれるなら、字幕で動画をアクセシブルにする方法がSNSコンテンツに適用される規格を解説しています。
FAQ
TikTokとInstagramはSRT字幕ファイルのアップロードに対応していますか?
どちらのプラットフォームも、TikTok投稿やInstagram Reelsに対してサイドカー形式の字幕ファイルを受け付けていません。選択肢は2つあります。アップロード前に動画ピクセルへ字幕を焼き込むか、アップロード後に各プラットフォームのアプリ内ネイティブ字幕ツールを使うかです。焼き込み字幕は恒久的で、クロスポストしても残ります。ネイティブ字幕はそのプラットフォーム上でしか表示されません。
2026年のTikTokにおける字幕のセーフゾーンはどこですか?
1080x1920のキャンバスでは、TikTokのUIが上部約130〜230ピクセル(おすすめトグル、プロフィールアイコン)、下部約320〜480ピクセル(ユーザー名、投稿キャプション、音源名、プログレスバー)、右端約120ピクセル(いいね・コメント・シェアのアイコン列)を覆います。中央の約900x1400ピクセルの帯がほとんどのデバイスで安全です。正確な数値はアプリのアップデートやデバイスサイズによって変わるため、公開前に必ず実際のアプリでプレビューしてください。
TikTokやInstagramのネイティブ自動字幕を使うべきか、それとも自分で焼き込むべきか?
ネイティブ自動字幕は手軽ですが、明確な限界があります。クリアな英語音声でも精度は約80〜90%で、アクセントや背景ノイズがあると低下します。カスタマイズも最小限で、字幕はそのプラットフォーム上にしか存在しません。焼き込み字幕は動画がどこに行っても残り、デザインどおりに表示され、書き出し前にスタイルやアニメーションを施せます。クロスポストするクリエイターやブランドの一貫性を重視するなら、焼き込みがより良いデフォルトです。
ショート動画の字幕ワークフローにはどれくらい時間がかかりますか?
スタイルプリセットを事前に用意していれば、60〜90秒の動画で全体のパイプライン(SRT生成、タイミング確認、スタイル適用、焼き込み、書き出し)に通常10〜15分かかります。プリセットを固めて主要プラットフォームのセーフゾーンを把握すれば、2本目以降は1本あたり5〜7分程度に短縮できます。
参考資料
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How to Transcribe an Instagram Reel: Fast Creator Workflow
Step-by-step guide to transcribing Instagram Reels: paste the URL, download the video, extract a clean SRT, and repurpose captions across TikTok, Shorts, and blog posts.

How to Transcribe a TikTok Video in 2026 (Paste the Link)
Step-by-step guide to transcribing TikTok videos for burn-in captions, cross-platform repurposing, and hook analysis. Three methods, verified specs, real workflows.