
2026年版:TikTok動画の文字起こし方法(リンクを貼るだけ)
Summarize this article with:
TikTok動画からきれいな文字起こしを得るには、ファイルをダウンロードするか(またはURLを貼り付けて)外部の文字起こしツールにかけます。TikTokの内蔵字幕は書き出せず、アクセントや専門用語で精度が落ちるためです。文字起こしは他のすべての出力への架け橋になります。ReelsやShorts向けの焼き込み字幕、ブログ記事、フック研究データベースなどです。アプリ内で撮影したTikTokは最長10分、アップロードされたファイルは最長60分になるため、長めのStudio投稿ではツール選びが重要です。
最速のルート:URLを直接受け付ける文字起こしツールにTikTokのURLを貼り付ければ、1分以内できれいな文字起こしが手に入ります。 先にファイルをダウンロードする必要がある場合は、さらに2ステップかかります。このガイドでは両方のルートに加えて、TikTok文字起こしが真価を発揮する具体的なワークフローも取り上げます。クロス投稿用の焼き込み字幕、ショート動画からロングコンテンツへの転用、そしてバズった動画からのフック分析です。

TikTokの内蔵字幕だけでは不十分な理由
TikTokは2021年に自動字幕機能を追加し、それ以来この機能は成熟してきました。アップロード時に字幕トラックを有効にすると、TikTokが動画上にレンダリングします。視聴者は表示のオン/オフを切り替えられます。
TikTok自身のサポートドキュメントと照合して確認した、実用上の限界:
- 書き出し不可。 字幕トラックはTikTok内部にあります。SRT、VTT、プレーンテキストでの書き出しは存在しません。ReelsやYouTubeで字幕が必要なら、ゼロから作り直すことになります。
- アクセント・専門用語・早口で精度が落ちる。 自動字幕はプラットフォーム側の音声認識を使っており、固有名詞、ニッチな専門用語、重なり合う話し声をよく聞き逃します。
- 編集機能が限定的。 アプリ内エディタは基本的なものにとどまります。単語単位の修正はできますが、キューのタイミングを一括で組み直したり、スタイルをプログラム的に適用したりすることはできません。
- タイミングが不安定。 キューの境界が音声のビートからずれることがあり、テンポの速いコンテンツや音楽主体のコンテンツで特に顕著です。
一度きりの個人利用であれば、TikTokの内蔵字幕で十分です。転用、研究、アクセシビリティの用途には、外部の文字起こしが適切なツールです。
ステップ1:動画ファイル(またはURL)を入手する
入力経路は3つあり、それぞれ別の状況に向いています。
自分の動画を端末に保存する
- スマートフォンで動画を開きます。
- 共有ボタン(矢印アイコン)をタップします。
- 「動画を保存」をタップします。
- 動画がTikTokのウォーターマーク付きMP4としてカメラロールにダウンロードされます。
ウォーターマークは見た目だけのもので、音声トラックへの影響はゼロです。どの文字起こしツールも、コンテナ内のAAC音声を読み取ります。ダウンロード品質は1080x1920px、9:16の縦型、ステレオAAC-LC音声です。
他の人の動画を端末に保存する
「動画を保存」ボタンはほとんどのTikTokで機能しますが、投稿者はプライバシー設定でこれを無効にできます。保存オプションが非表示になっている場合:
- スマホで画面録画する。 iOSとAndroidのどちらにも標準の画面録画機能があります。動画を再生しながら録画します。音声の忠実度は下がりますが、文字起こしは可能です。
- サードパーティのダウンローダー。 TikTokのURLを受け付けてウォーターマークなしのMP4を返すWebツールが多数あります。品質と利用規約への準拠状況は、ツールや地域によって異なります。
研究ユースケース(大量のTikTokをまとめて文字起こしするなど)では、自動化パイプラインを構築する前にTikTokの商用データ規約を確認してください。
URLを直接貼り付ける
一部の文字起こしツールはTikTokのURLを受け付け、サーバー側でダウンロードを処理します。これが一回きりの文字起こしでは最速のルートです:ファイルに触れる必要がありません。動画からテキストへの変換ツールは、対応プラットフォームでこの方式を採用しています。
大量処理の場合は、ファイルをローカルにダウンロードしてバッチで処理する方が、URLごとのリクエストよりもスケールしやすい傾向があります。
ステップ2:文字起こしを実行する
ファイルかURLが手に入ったら:
- アップロードまたは貼り付け。 ほとんどのツールはMP4を直接受け付けます。アプリ内で撮影したTikTokは最長10分です。TikTok Studio経由でアップロードされた動画は最大60分になるため、必要な長さに対応しているかツールを確認してください。
- 言語を明示的に設定する。 短いクリップでは自動検出に頼らないでください。15秒の動画では、自動検出に十分な信号が与えられません。送信前に言語を選択してください。
- 話者数を設定する。 ほとんどのTikTokは一人の話者です。画面に二人いる場合は2に設定します。
1分未満のTikTokなら数秒で文字起こしが完了します。10分のStudio投稿でも、最新の文字起こしサービスなら余裕で1分以内に仕上がります。
ステップ3:適切な書き出し形式を選ぶ
最適な形式は、次の工程によって変わります:
| 出力先 | 形式 |
|---|---|
| ブログ記事やニュースレター | TXT または DOCX |
| 焼き込み字幕付きのReels / Shorts | SRT |
| YouTubeのクローズドキャプション | SRT |
| ウェブサイト上のアクセシビリティ用文字起こし | TXT または HTML |
| フック研究データベース | TXT または JSON |
動画エディタを完全に省きたい場合は、字幕ジェネレーターがSRTから焼き込みまでの工程を担ってくれます。
クロス投稿のための焼き込み字幕ワークフロー
クリエイターがTikTokを文字起こしする最も一般的な理由は、プラットフォームネイティブの焼き込み字幕をつけてInstagram ReelsやYouTube Shortsに再投稿するためです。 TikTokのウォーターマーク付き字幕スタイルは他のプラットフォームにそのまま移植できず、特にReelsの視聴者は字幕を期待しています。字幕付きのショート動画の方が視聴時間が長くなることを、調査が一貫して示しています。
ワークフロー:
- TikTokのウォーターマーク付き字幕オーバーレイなしでTikTok動画を保存します(プラットフォームの字幕なしで元動画を撮影するか、ウォーターマークなしダウンローダーを使います)。
- 外部で文字起こしして、きれいなSRTファイルを取得します。
- SRTをCapCut、Premiere、DaVinci Resolveに読み込みます。
- 対象プラットフォームに合わせて字幕をスタイリングします:Reelsの字幕は通常、UIオーバーレイゾーンを避けるため中央寄りに配置します。TikTokの字幕はより下に配置されます。フォント、色、アニメーションはブランドごとに異なります。
- 字幕を焼き込んで1080x1920で書き出します。
- 各プラットフォームに投稿します。
CapCutは両プラットフォームの出力仕様に対応しているため、クロス投稿で最も洗練されたワークフローを提供します。自動字幕機能がドラフトを生成し、焼き込み前にそれを修正します。この手動修正のステップは実施する価値があります。CapCutはTikTok独自のツールと同じく、固有名詞や早口をよく聞き逃します。
アスペクト比やUIセーフゾーンへの配慮を含むReels向けバージョンについては、Instagram Reel文字起こしガイドが違いを詳しく解説しています。基本のステップは同じですが、字幕のスタイリングと配置が異なります。
フック分析:過小評価されている活用法
文字起こしは、TikTokのフックがなぜ効くのかを研究するための最高のツールの一つです。音声を検索可能なテキストに変換してくれるからです。
TikTokアルゴリズムに関する公開研究によると、視聴者の70%が最初の3秒以内に視聴を続けるかどうかを判断します。その3秒間を通じて高い視聴維持率を保った動画は、アルゴリズムによる配信が大幅に増えます。あの3秒の中の具体的な言葉が重要なのです。
フック研究のワークフロー:
- 自分の平均を上回る成績だった、ニッチ内のTikTokを20〜30本集めます(TikTokアナリティクスか競合分析ツールを使用)。
- 各動画を文字起こしします。
- 各文字起こしから最初の一行だけを抜き出します(フック)。
- パターンを探します:質問構造(「ご存知でしたか…」)、実績ファーストの冒頭(「…によってフォロワー1万人を獲得しました」)、パターンインタラプト、感情トリガー。
文字起こしがあれば、これらは検索可能になります。なければ、耳にした内容の記憶に頼ることになります。あれば、30個のフックをスプレッドシートに貼り付けたり、AIライティングツールに渡して視聴維持を牽引する構造を特定したりできます。
ここが、TikTokの文字起こしがInstagram Reel文字起こしワークフローと分岐する点です。Reelsの分析はビジュアルストーリーテリングと字幕配置に焦点が当たりがちです。TikTokのフック分析は根本的にテキスト的なものです。冒頭のフレーズこそがアルゴリズムへのシグナルであり、文字起こしがそれを表面化させます。
TikTokからロングコンテンツへ
YouTubeやブログへ展開するTikTokerは、TikTokを素材として使います。ワークフロー:
- 一つのトピックに関する関連TikTokをまとめて文字起こしします。
- 文字起こしを一つの下書きドキュメントに統合します。
- 読みやすさのために編集します(話し言葉は構造が緩いため、読者向けに整えます)。
- 結果をブログ記事やYouTube台本の初稿として使います。
同じ主題について60〜90秒のTikTokを10本シリーズ化すると、生の文字起こしでおよそ1,500〜2,000ワードが得られます。編集後は公開可能な記事になります。YouTubeからテキストへの方向性については、YouTube動画の文字起こし方法ガイドがチャプターマーカー付きのより長尺の動画を扱っています。
ニッチなTikTokのための語彙ブースト
専門ニッチのTikTokでは、デフォルトの音声認識モデルがブランド名や専門用語を聞き逃します。短い語彙ヒントリストで、そうしたエラーを大幅に減らせます:
- 暗号資産:
["DeFi", "Solana", "yield farming", "on-chain", "staking"] - 美容:
["retinol", "niacinamide", "Drunk Elephant", "K-beauty", "hyaluronic"] - ゲーム:
["Genshin", "Valorant", "meta", "respawn", "ranked"]
同じリストをそのニッチのすべての動画で使い回します。ニッチあたり10〜15語で、最も重要な言葉における意味のある精度向上が得られます。
文字起こしエラーの原因と修正方法をより深く知りたい場合は、文字起こし精度の解説でモデルの信頼度、話者の重なり、背景ノイズを扱っています。
大量処理や研究用途の場合は?
大量のTikTokを処理するクリエイターや研究者向けに:
- Web UIではなくAPIを使います。リクエストあたりのスループットがはるかに高く、送信をバッチ化できます。
- 対応している場合はTikTokのURLを渡し、サービス側にダウンロードを任せます。
- 自動検出ではなく、リクエストごとに言語を明示的に設定します。
- ニッチごとに語彙リストを一つ作り、使い回します。
パイプラインを構築せずにきれいな文字起こしだけが必要なら、ConvertAudioToTextがTikTokのMP4とURL入力を直接処理し、SRTとTXTの書き出しも含まれています。
よくある質問
TikTokの内蔵字幕をSRTファイルとして書き出せますか?
いいえ。TikTokの自動字幕トラックはプラットフォーム内にロックされています。アップロード中に字幕を編集することはできますが、SRTやVTTでの書き出しはありません。持ち運べる字幕ファイルを手に入れるには、動画を外部の文字起こしツールに通す必要があります。
TikTokのウォーターマークは文字起こしの品質に影響しますか?
いいえ。ウォーターマークは視覚的なオーバーレイであり、音声トラックには影響しません。MP4内のAAC音声を読み取る文字起こしツールは、ウォーターマークが見えていてもいなくても同じ結果を出します。
文字起こしが必要になるかもしれない最長のTikTok動画はどのくらいですか?
TikTokアプリ内で撮影された動画は10分までに制限されています。TikTok Studioやデスクトップのアップローダー経由でアップロードされた動画は最大60分になります。長いStudio投稿を文字起こしする場合は、その長さに対応したツールを使っているか確認してください。
投稿者がダウンロードを無効にしているTikTokはどう文字起こししますか?
投稿者がダウンロードをオフにすると、TikTokは保存ボタンを非表示にします。選択肢は画面録画(iOSとAndroidに標準搭載)、またはTikTokのURLを直接受け付けてサーバー側で動画を取得する文字起こしサービスの利用です。後者の方がシンプルで、手動での録画を避けられます。
TikTokの文字起こしはフック研究にも役立ちますか?それとも字幕専用ですか?
フック研究は最も効果的な活用法の一つです。自分のニッチで好成績だったTikTokの冒頭3秒を文字起こしすれば、記憶に頼ったものではなく実際の言葉が手に入ります。複数の文字起こしを横断して検索すれば、視聴維持を牽引する冒頭フレーズ、感情トリガー、質問構造のパターンを見つけられます。
出典
- TikTok Support, "How to download a video": https://support.tiktok.com/en/using-tiktok/exploring-videos/video-downloads
- TikTok Newsroom, "Introducing auto captions": https://newsroom.tiktok.com/en-us/introducing-auto-captions
- Sociality.io, "TikTok video length guide for 2026": https://sociality.io/blog/tiktok-video-length/
- TTS Vibes, "TikTok First 3 Seconds Hook Retention Rate Statistics": https://insights.ttsvibes.com/tiktok-first-3-seconds-hook-retention-rate/
- Teleprompter.com, "TikTok 3 Second Rule: How to Hook Viewers Fast (2026)": https://www.teleprompter.com/blog/tiktok-3-second-rule
- Blitzcut, "Auto vs Manual vs Burned-In Captions for TikTok": https://blitzcutai.com/blog/auto-captions-vs-manual-captions-tiktok
- PixFlow, "AI Automatic Captions in 2026: Premiere, CapCut, and Resolve": https://pixflow.net/blog/ai-automatic-captions-subtitles/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.