文字起こしのタイムスタンプ、いつ・どの粒度で入れるべきか
文字起こしタイムスタンプ字幕

文字起こしのタイムスタンプ、いつ・どの粒度で入れるべきか

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

どの文字起こしにもタイムスタンプが必要なわけじゃない。読むだけのメモなら不要、ポッドキャストのショーノートは段落単位のアンカーで十分、会議の証拠や質的コーディングなら文単位、字幕はキュー範囲形式(SRT/VTT)が必須、カラオケ風ハイライトやキャプション同期なら単語単位。実際のワークフローをカバーできる最小限の粒度を選ぼう。

最初に考えるべき質問は、どの粒度にするかではなく、そもそもタイムスタンプが必要かどうかです。 読むため、メモとして共有するため、または要約ツールに入力するための文字起こしには、タイムスタンプのマーカーは何の価値ももたらしません。視覚的なノイズが増え、ファイルサイズが大きくなるだけで、メリットはありません。タイムスタンプが効果を発揮するのは、オーディオの特定の瞬間に戻って移動する必要がある場合、またはテキストをビデオ表示に同期させる場合だけです。

そもそもタイムスタンプは必要か?

粒度を選ぶ前に、ここから始めましょう。

ユースケースタイムスタンプは必要か?
会議メモ(読む用)不要
インタビューから作成するブログ記事不要
AI要約の入力不要
法的または人事の証拠必要
チャプターリンク付きのポッドキャストショーノート必要
ビデオのキャプション必要
文字起こしを切ってビデオを編集する必要
質的研究のコーディング必要

ユースケースが「不要」の列に該当するなら、そこで止めてください。プレーンテキストで書き出し、アンカーは省き、ドキュメントをすっきりと保ちましょう。

4つの粒度

タイムスタンプが必要な場合、適切なレベルは、その結果をどう使うかによって決まります。

なし

時間マーカーのない、きれいな段落形式の文字起こし。読むこと、共有、テキスト処理に適しています。あらゆるダウンストリームツールがこの形式を扱えます。

段落レベル

段落または発言者ごとに1回、タイムスタンプが表示されます。

[00:00:00] スピーカー1: 番組へようこそ。今日は中小企業向けの価格設定モデルについて話します。

[00:00:18] スピーカー2: お招きいただきありがとうございます。価格設定は、こういったトピックの一つで...

最適な用途: ポッドキャストのショーノート、長文の読み物、インタビューから作成するブログ記事。すべての文にタイムスタンプを付けてページを散らかすことなく、読者はオーディオ内のおおよその位置を把握できます。

文レベル

文ごとに1つのタイムスタンプ。

[00:00:00] 番組へようこそ。
[00:00:03] 今日は価格設定モデルについて話します。
[00:00:09] ゲストは20年の経験を持っています。

最適な用途: 検索中心のレビュー、法務・人事の証言録取書、研究インタビューの質的コーディング。任意の文に移動して、実際に発言された内容を正確に検証できます。迷ったときは、文レベルのタイムスタンプが安全なデフォルトです。表示用にタイムスタンプを削除して、ソースファイルには残しておくこともできます。

単語レベル

すべてのトークンにタイムスタンプが付きます。

[00:00:00.020] Welcome [00:00:00.380] back [00:00:00.640] to [00:00:00.780] the [00:00:00.880] show.

最適な用途: 精密な動画編集、カラオケ風の単語ハイライト、検索可能な音声インデックスの構築、MLトレーニングデータ。単語レベルのタイムスタンプがあれば、長い録音から特定の引用を切り出す際に、手動で音声をスクラブする必要がありません。

精度に関する注意点が1つあります。すべての単語タイムスタンプが同じ品質というわけではありません。DeepgramなどのAPIは、別途アライメント処理をせずにネイティブの単語レベルタイムスタンプを返します。ネイティブのWhisperはセグメントレベルのタイムスタンプ(通常5〜30秒のチャンク)を出力し、各セグメント内の単語位置を補間するため、長いファイルでは誤差が蓄積されます。WhisperXのような強制アライメントツールは、文字起こし後に2回目の音素アライメント処理を実行し、クリーンな音声では単語精度を100ms未満にまで高めます。ワークフローで単語の精度が重要な場合は、使用するツールがどのようにタイムスタンプを生成するかを確認してください。

字幕キュー・レベル

キューの範囲に開始・終了タイムスタンプを設定します。通常は1キューあたり1〜7秒で、画面表示用に調整されています。

1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.

2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models.

これはSRTおよびVTT形式です。動画レンダリング用に設計されており、読むためのものではありません。SRT、VTT、TXTエクスポート形式の投稿で形式の詳細を解説していますが、覚えておくべきルールは1つだけです。SRTキューは、プラットフォームのガイドライン(Netflix、YouTube、放送)に収まるよう、約2行・1行42文字が上限です。単語のキューへのグループ化は文字起こしツールが行うもので、手動でキューを書くべきではありません。

タイムスタンプの粒度は、録音時の決定ではなく、書き出し時の決定である
タイムスタンプの粒度は、録音時の決定ではなく、書き出し時の決定である

ユースケース別のタイムスタンプ粒度

ユースケース適切なタイムスタンプレベル
文字起こしを記事として読むなし
AI要約やトピック抽出なし
ポッドキャストのショーノート段落
会議の議事録文または段落
裁判・人事の証拠記録
研究インタビュー(質的コーディング)
動画字幕(YouTube、TikTok、Reels)字幕キュー(SRT/VTT)
カラオケ風の単語ハイライト単語
動画・音声の検索インデックス構築単語
文字起こしからハイライトリールを切り出す単語
MLトレーニングデータ単語

フォーマットの慣例

一般的なフォーマットは3つあり、これらを混在させるとバグの原因になりがちです。

  • HH:MM:SS(例: 00:01:30)。シンプルで、ほとんどの段落・文レベルの文字起こしで使われます。
  • HH:MM:SS,mmm カンマ区切り(例: 00:01:30,500)。SRTの慣例です。SRTフォーマット仕様では、カンマが必須とされています。
  • HH:MM:SS.mmm ピリオド区切り(例: 00:01:30.500)。W3C WebVTT仕様では、小数区切りにピリオド(U+002E フルストップ)を使用します。これは多くのJSON APIが返す形式でもあります。

ファイルが複数のツールを経由する場合(文字起こしサービスからの書き出し、動画エディタへの取り込み、プラットフォームへのアップロード)、最初のステップで小数区切りを正規化してください。一方の形式を想定したライブラリは、もう一方の形式だと静かに失敗するか、パースエラーを投げます。

タイムスタンプの生成元

AI文字起こしでは、タイムスタンプは音声認識モデルから生成されます。重要な違いは、モデルが単語レベルのタイムスタンプをネイティブに出力するか、セグメントレベルのデータから導出するかです。

  • ネイティブな単語タイムスタンプ(Deepgramや類似のストリーミングAPI): モデルが各トークンに対して直接 (word, start_time, end_time) のタプルを返します。
  • セグメント補間(ネイティブのWhisper): モデルはセグメント境界を生成し、単語位置を推測しますが、長い録音では数百ミリ秒ずれることがあります。
  • 事後的な強制アライメント(WhisperX、aeneas、Montreal Forced Aligner): 文字起こし後に別の音素アライメント処理が単語を音声にマッピングし、100ミリ秒未満の精度を実現します。

文レベルや段落レベルのタイムスタンプは常に単語レベルのデータから集約されます。ツールは句読点や話者の切り替えによるポーズで単語をグループ化します。

人間による文字起こしでは、タイムスタンプはホットキーで手動挿入されます。段落レベルは一般的ですが、文レベルは遅くてコストがかかり、単語レベルはほぼ手作業では行われません。

よくある編集の癖

長いファイルでのドリフト

補間された単語タイムスタンプを使うツールでは、3時間の録音でファイル後半のタイムスタンプが1秒以上ずれることがあります。解決策は、無音境界で再アンカーするパイプラインを使うか、最初からネイティブな単語レベルタイムスタンプを出力するAPIを使うことです。一貫してドリフトが見られる場合は、ツールがどのタイムスタンプ方式を使っているか確認してください。

句読点のタイミング

ほとんどのツールはカンマやピリオドを直前の単語に付けるため、タイムスタンプはその単語の終わりになります。これは読む分には正しいですが、句読点の境界で音声をプログラム的に切り出すと、1つずれる問題が起きることがあります。句読点で自動クリップする際は、小さなバッファ(50〜100ミリ秒)を追加してください。

話者の切り替え境界

話者1が止まり話者2が始まる場合、話者2の最初の単語のタイムスタンプは、実際に発話が始まる時点を示します。ギャップの開始ではありません。証拠クリップや引用抽出では、話者ラベルの約0.5秒前からクリップを開始して、自然な文脈を含めてください。

フレームレートのアライメント

動画作業では、タイムスタンプをフレームレート(24、25、30、60 fps)に合わせる必要があります。00:01:30.123のようなタイムスタンプは、30 fpsでは正確にフレームに一致しません。ほとんどの動画エディタは最も近いフレームに丸めますが、通常は問題ありません。ただし、エディタ内の「クリックしてシーク」が意図したカットポイントから1フレームずれる可能性がある点は認識しておいてください。

タイムスタンプを維持したまま編集する

タイムスタンプ付きトランスクリプトを扱う上で最も難しいのは、時間アンカーを壊さずにテキストを編集することです。3つのアプローチがあります:

  1. アライメントを維持するエディタを使う。 専用のトランスクリプトツール(Otter、Descriptなど、ベンダー資料による)は、単語を削除または挿入すると自動的にタイムスタンプをシフトします。
  2. テキストを編集し、強制アライメントで再調整する。 編集したテキストに対してaeneasやMontreal Forced Alignerを元の音声に合わせて実行します。正確ですが、処理ステップが増えます。
  3. テキストを編集し、わずかなずれを受け入れる。 段落レベルのタイムスタンプでは、軽微なテキスト編集がアンカーを動かしても実質的な影響はほとんどありません。ショーノートには許容範囲ですが、法的なトランスクリプトには不適切です。

大幅な編集(ハイライト用にコンテンツの半分をカットするなど)には、タイムライン対応のエディタを使用してください。大きなカット後に単語レベルのタイムスタンプを手動で再調整するのは現実的ではありません。

ワークフロー:チャプターマーカー付きポッドキャストショーノート

一般的なポッドキャスターのワークフロー:

  1. エピソードを文レベルのタイムスタンプ付きで文字起こしする。
  2. トランスクリプトをざっと読み、5〜10個のトピックの切り替わりを選ぶ(例:「会社の始め方」「価格設定のミス」)。
  3. タイムスタンプを使ってチャプターマーカーを書く:MP3ファイルのID3v2 CHAPフレーム、M4AファイルのMP4 chplアトム、またはRSSフィードのPodcasting Index JSONチャプター形式。
  4. ショーノートをタイムスタンプ付きで公開し、トランスクリプトページへのアンカーリンクとして使う。

クリーンな出発点として、ConvertAudioToTextの/tools/audio-to-textツールは、サインアップなしでステップ1に使える文レベルのトランスクリプトを生成します。

ワークフロー:動画キャプション

YouTube、TikTok、Instagram Reels、そして放送プラットフォーム向けに:

  1. 動画を単語レベルのタイムスタンプ付きで文字起こしする。
  2. 単語を字幕キューのグループにまとめ、1〜7秒のウィンドウ内に収め、1行あたり42文字の制限を守る。
  3. 広い互換性のためにSRT(カンマ小数点)形式でエクスポートするか、Webプレイヤー向けにVTT(ピリオド小数点)形式でエクスポートする。
  4. プラットフォームにアップロードする。

各形式が必須か任意かの比較は、SRT vs VTT vs TTML形式を参照してください。

FAQ

文字起こしに常にタイムスタンプは必要ですか?

いいえ。文字起こしをドキュメントとして読む予定がある場合、会議メモとして共有する場合、または要約ツールに渡す場合は、タイムスタンプは視覚的なノイズになるだけでメリットはありません。タイムスタンプが重要になるのは、音声に戻ってナビゲートする必要がある場合や、テキストをビデオに同期させる場合です。

SRTとVTTのタイムスタンプ形式の違いは何ですか?

SRTはカンマを小数点区切りとして使用します(00:01:30,500)が、VTTはピリオドを使用します(00:01:30.500)。どちらもミリ秒を表します。この違いが問題になるのは、ツールがファイルをプログラム的に処理する場合です。一部のライブラリはカンマ形式を拒否し、他のライブラリはピリオド形式を拒否します。ツール間でファイルをパイプする場合は、早めに正規化してください。

長い録音で単語レベルのタイムスタンプがずれるのはなぜですか?

ネイティブのWhisperはセグメントレベルのタイムスタンプ(通常5〜30秒のチャンク)を出力し、各チャンク内の単語位置を補間します。小さな誤差がチャンク間で蓄積され、長いファイルの終わりには数百ミリ秒のドリフトが発生します。WhisperXのような強制アライメントツールは、文字起こし後に単語を音声の音素に再アンカーし、精度を100ミリ秒未満に引き上げます。DeepgramのようなAPIは、補間ステップなしでネイティブの単語レベルタイムスタンプを出力します。

タイムスタンプを壊さずに文字起こしを編集するにはどうすればいいですか?

アラインメントを維持できるエディタを使いましょう(専用の文字起こしツールのほとんどは対応しています)。段落単位の軽い編集なら、小さなテキスト変更でタイムアンカーがずれて問題になることはまずありません。大きなカットを行う場合は、プレーンテキストエディタではなくタイムライン対応エディタを使いましょう。大きな編集後にワード単位のタイムスタンプを手動で再調整するのは非常に時間がかかるからです。

参考資料

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles