
ポッドキャストエピソードの文字起こし方法:クリエイター向けガイド2026
Summarize this article with:
音声ファイルをアップロードするか、エピソードURLを貼り付けて文字起こしツールにかけ、言語と話者数を設定し、15分ほどの編集パスを行ったら、TXTを書き出してショーノートに、SRTを動画版に使います。マルチトラック録音(話者ごとに1ファイル)は、精度を左右する最大の要素です。トランスクリプトが手元にあれば、ショーノートもチャプターもクリップもYouTube版も、すべて同じソースファイルから生み出せます。
最短ルートは、音声ファイルを直接アップロードするか、すでに公開済みのエピソードなら公開URLを貼り付けることです。 最近の文字起こしツールの多くは両方に対応しています。言語を設定し、話者数を指定すれば、60分のエピソードのドラフトがおよそ3〜5分で手に入ります。その後そのトランスクリプトをどう活かすか——そこに本当のレバレッジがあります。

ファイルアップロード vs RSS URL:どちらを選ぶべきか
どちらの入り口でも機能します。正解は、制作プロセスのどの段階にいるかで変わります。
| 入力経路 | 向いているケース | トレードオフ |
|---|---|---|
| 音声ファイルのアップロード | 公開前のエピソード、マルチトラックの生ファイル、リリース前の編集済みMP3 | ファイルがディスク上にある必要あり。大きいファイルほど時間がかかる |
| エピソードURLの貼り付け | 公開済みのエピソード、過去アーカイブの一括処理、SpotifyやApple Podcastsの公開リンク | ファイルが公開アクセス可能であることが前提 |
| RSSフィードURL | フィードからの全エピソード自動取り込み、過去アーカイブのワークフロー | ツール側の対応はまちまち。RSSをネイティブに読めないサービスもある |
マルチトラック録音(話者ごとに別ファイル)をしているなら、ミックスダウン版ではなく各トラックを個別にアップロードしてください。話者分離の品質差は大きく、次のセクションで説明します。
公開済みエピソードの過去アーカイブをまとめて処理するなら、URLの方が速いです。ホスティングプラットフォームのエピソードページから音声URLを貼り付ければ、ダウンロードとアップロードの手順を丸ごと省けます。
ConvertAudioToText を使う場合、メインページのアップローダーは100MBまでのMP3、M4A、WAV、MP4ファイルを受け付け、URL入力欄はどのホスティングプロバイダーの公開音声リンクにも対応しています。
マルチトラック録音の利点
優れたポッドキャストのトランスクリプトと平凡なものを分ける最大の要因は、マルチトラックで録音したかどうかです。
マルチトラックとは、ホストとゲストそれぞれを独立した音声ファイルに録音することです。Riverside、Zencastr、Descript(SquadCastを買収)といったリモート録音ツールはこれがデフォルトになっています。結果として、ミックスダウンされた1つのファイルではなく、2〜3個の音声ファイルが手に入ります。
文字起こしにおいてこれが重要な理由:
- 話者分離が正確になる。 各トラックは定義上1人の話者です。ツールは音響的に声をクラスタリングする必要がなく、各トラックにラベルを付けるだけで済みます。
- クロストークの被害が1トラックで済む。 ゲストが被せて話しても、ホスト側のトラックにはきれいな音声が残っています。
- 話者ごとの精度が高く保たれる。 単一話者のきれいなトラックは、クロストークが生む曖昧さを取り除きます。ミックス音声での話者分離エラーは連鎖しがちで、1語の帰属ミスが周囲の文全体の話者を入れ替えてしまうことがあります。
- NGテイクを1トラックだけミュートできる。 片方のトラックのミスを消しても、もう片方には影響しません。
防音・吸音された部屋で専用マイクを使ったスタジオ品質の録音は、通常95〜99%の精度に達します。RiversideやZencastrでのリモート録音は92〜95%。騒がしい環境でのノートPC内蔵マイクは80〜90%まで落ちます。モデルよりも入力音声の方が効きます。精度スコアを左右する要素については、文字起こし精度の仕組み を参照してください。
対面収録の場合、マルチトラックは個別マイクを、各マイクを別チャンネルとして記録できるレコーダーに接続することで実現します。Zoom H6、Tascam DR-40、RodeCaster Pro IIはいずれも対応しています。
ワークフロー全体の流れ
1. マルチトラックで録音する
参加者ごとにローカルで録音し、後からアップロードするリモート録音ツールを使います。出力は話者ごとの音声ファイルで、通常は192kbpsのMP3か非圧縮WAVです。
対面収録では、個別マイクをマルチチャンネルレコーダーに接続し、トラック別録音を有効にします。
2. 音声を軽く編集する
冒頭と末尾の無音をカットし、明らかなミスを取り除きます。文字起こし前に編集しすぎないこと——トランスクリプトは公開される音声と一致していなければなりません。各トラックを192kbpsのMP3で書き出します。
3. アップロードまたはURLを貼り付ける
話者ごとのファイルがある場合は、個別でも一括でもアップロードできます。エピソードがすでに公開済みなら、公開音声URLを貼り付けてください。
文字起こしを実行する前に、3つ設定します:
- 言語。 必ず指定してください。イントロ音楽で始まるエピソードでは自動検出は当てになりません。
- 話者数。 実際の話者数(通常2〜3人)に設定します。
- 語彙リスト。 番組特有の繰り返し登場する用語を追加します。ゲスト名、製品名、モデルが高頻度で見ていないニッチな専門用語などです。
4. 処理を実行する
60分のエピソードは通常3〜5分で処理されます。長いファイルはほぼ線形に伸びます。60分エピソードのアップロードからダウンロードまでの一連の所要時間は、通常10分未満です。
5. 編集パス
目標は音声1時間につき15分です。 1.5倍速で再生しながらテキストを流し読みします:
- 固有名詞、数値、意味が変わってしまう誤りを修正します。
- フィラーワードを1つずつ追わないこと。多くのポッドキャストはクリーン逐語で公開しており、これはAIツールが自動で処理します。「えー」を全部探すのは、研究や法務目的で厳密な逐語起こしが必要な場合を除き、時間の無駄です。
話者分離 の出力では、話者ラベルを一度通しで確認し、ファイル前半の入れ替わりを修正します(序盤の帰属ミスは後まで残りがちです)。
6. 書き出す
1回の文字起こしから、複数の出力へ:
- TXTまたはDOCX — ショーノートページ用。
- SRT — 動画版(YouTube、TikTokクリップ、Reels)用。
- VTT — RSSのトランスクリプトタグ用(詳細は後述)。
- JSON — 下流ツール用。
7. トランスクリプトを公開する
トランスクリプトをポッドキャストサイト上の専用ページに公開し、エピソードページからリンクします。こうすると、エピソードが扱うすべてのトピック——ゲスト名、製品名、リスナーが検索しそうな質問への回答——がインデックス可能なテキストになります。音声ファイルだけでは、検索エンジンはそのどれにもアクセスできません。
トランスクリプトからショーノートを作る
トランスクリプトがそのまま納品物になることは少なく、多くの番組は構造化されたショーノートとセットにします。エピソード概要、チャプターのタイムスタンプ、引用、紹介リンクなどです。
全文トランスクリプトがあれば、ショーノートの完全な下書きにかかるのは20〜30分で、60〜90分にはなりません。すでに手元にあるのは:
- 1段落のエピソード概要(このエピソードが何についてのものか、最も明快な一文を抜き出す)。
- トピックラベル付きのタイムスタンプ5〜10個(会話の転換点を見つける)。
- SNS向けの引用3〜5個。聞き直さずにトランスクリプトから選べます。
- リソースリスト:ゲストが言及したすべてのURLや本。
SEOの観点では、タイムスタンプの羅列だけでなく、ショーノートに最低300〜600語分のインデックス可能なコンテンツを目指しましょう。全文トランスクリプトが最強の形です。キーワードを含んだ数千語のテキストで、リスナーが検索でき、Googleにもインデックスされます。このワークフローを軸にしたツール比較は ポッドキャストに最適な文字起こしツール 2026年版 を参照してください。
チャプターマーカー
チャプターマーカーはリスナー体験を向上させるだけでなく、プラットフォームSEOにも効きます。2026年時点で、米国で最も使われているポッドキャスト発見プラットフォームはシェア33%のYouTubeで、26%のSpotify、14%のApple Podcastsを上回っています。YouTubeの発見アルゴリズムがチャプターに反応する様子は、検索エンジンが見出しに反応するのに似ています。
Apple PodcastsとSpotifyはどちらもアプリ内でチャプターマーカーを表示します。リスナーは長いエピソードの移動や、聴く前にトピックをプレビューするのに使っています。
60分のインタビュー番組の典型的なチャプターリストは、1章5〜15分の5〜10章構成です。1分未満の細かいチャプターは、プレイヤーの中で雑然とした印象になります。
チャプターはポッドキャストホスティングプラットフォーム経由で追加します。Transistor、Buzzsprout、Megaphoneをはじめ主要ホストの多くは、タイムスタンプとタイトルを貼り付けでもファイルアップロードでも受け付けます。BuzzsproutはMP3のID3v2タグに埋め込んだチャプターにも対応しています。
Podcasting 2.0のトランスクリプトタグ
ポッドキャストのRSSフィードを配信しているなら、各エピソードへの podcast:transcript タグ追加は30秒の設定で済む、十分に価値のある作業です。 2026年半ば時点で、このタグに対応しているのは33のポッドキャストプレイヤーで、Apple Podcasts(iOS 17.4以降)、Pocket Casts、AntennaPodなどが含まれます。SpotifyはJSONとVTT形式を受け付けます。
基本のタグは次のような形です:
podcast:transcript
url="https://example.com/transcripts/ep42.vtt"
type="text/vtt"
language="en"
サイレントに失敗する原因は2つあります。URLがHTTPSであること、そしてMIMEタイプが正しく設定されていること(CDNはしばしばデフォルトで application/octet-stream になります)。ホスティングプラットフォームがタグをネイティブ対応している場合(TransistorとBuzzsproutは両方対応)、手動で追加するよりそちらを使いましょう。
VTTは最も幅広いアプリで動く形式です。文字起こしツールからVTTを書き出し、他のエピソード素材と同じ場所にホストしてください。
トランスクリプトの再利用
テキストが手元にあれば、追加フォーマット1つあたりの限界コストは低くなります:
- YouTube版。 SRT書き出しを使い、エピソードの動画版(カメラ映像か静止画の波形画像)と同期させてアップロードします。YouTubeは今や米国で主要なポッドキャスト発見プラットフォームであり、後回しにすればリーチを捨てることになります。逆方向の手順は YouTube動画の文字起こし方法 を参照してください。
- メールニュースレター。 200語程度の要約と、トランスクリプトから直接抜いたハイライト引用2〜3個。
- LinkedInやXのスレッド。 ゲストインタビューの良い引用は、軽い導入文をつけて単独投稿にすると刺さります。
- オーディオグラム。 30〜60秒のハイライトを選び、字幕を焼き込んだ波形動画を生成して、ショート動画プラットフォームに投稿します。
- 記事版。 各エピソードをもとに編集した記事を音声と併せて公開する番組もあります。記事は検索流入を、音声はダウンロードを獲得し、互いに補強し合います。
トランスクリプトがあれば、各フォーマットとも5〜20分で作れます。なければ、それぞれ聞き直しが必要です。
ほとんどのポッドキャスターが時間をロスする場面
繰り返し現れる3つのパターン:
- 文字起こし前にミックスダウンしてしまう。 マルチトラックで録音したなら、マルチトラックのまま文字起こしを。話者分離の品質差は即座に、目に見える形で現れます。
- 出力形式ごとに何度も文字起こしする。 1回だけ文字起こしし、TXT・SRT・VTTを同じジョブから書き出します。
- フィラーワードを手動で編集する。 最新の文字起こしツールのクリーン逐語モードはこれを自動で処理します。厳密な逐語起こしに特別な理由がない限り、手動のフィラー編集はほぼ時間の無駄です。
クイックセットアップチェックリスト
| 項目 | やること |
|---|---|
| 収録 | マルチトラック、話者ごとに別々の音声 |
| マイク | USBまたはXLR、話者の近くに設置、防音・吸音された部屋で |
| 入力経路 | 話者ごとのファイルをアップロード、または公開エピソードURLを貼り付け |
| 設定 | 言語を指定、話者数を指定、語彙リストを渡す |
| 編集 | 1時間につき15分、固有名詞と意味に集中 |
| 書き出し | TXTはショーノート用、SRTは動画用、VTTはRSSトランスクリプトタグ用 |
| 公開 | トランスクリプトを専用ページに置き、エピソードページからリンク。RSSに podcast:transcript タグを追加 |
FAQ
ポッドキャストのエピソードを文字起こしすると、本当にSEOに効果がありますか?
はい。検索エンジンがインデックスするのはテキストであって音声ではありません。エピソードと一緒に全文トランスクリプトを公開すれば、そのエピソードで扱われたすべてのトピック、ゲスト名、製品への言及、答えた質問がGoogleで検索可能になります。トランスクリプトがなければ、音声コンテンツは検索からは見えません。ショーノートだけ(200〜300語)では内容が薄く、全文トランスクリプトは1エピソードあたり数千語分のインデックス可能なコンテンツを追加します。
音声ファイルをアップロードするのと、エピソードURLを貼り付けるのはどちらが良いですか?
どちらでも同じトランスクリプトが得られます。ファイルの直接アップロードは、公開前のエピソードや、別々に管理したいマルチトラックファイルに向いています。URLの貼り付けは、すでに公開ホストされている過去エピソードの処理が速く、ダウンロードと再アップロードの手順をまるごと省けます。
AIによるポッドキャスト文字起こしで期待できる精度はどのくらいですか?
精度は主に音声品質で決まり、特定のツールによる違いではありません。静かな部屋で専用マイクを使ったスタジオ品質の録音は95〜99%に達します。RiversideやZencastrなどのリモート録音は通常92〜95%です。騒がしい環境でのノートPC内蔵マイクは80〜90%まで下がります。マルチトラック録音(話者ごとに別ファイル)は、ミックスダウンした1ファイルよりも常に話者分離の精度が高く、クロストークによる誤りも少なくなります。
生成されたトランスクリプトは編集が必要ですか?
軽い編集パスをする価値はあります。目標は音声1時間につき15分で、1.5倍速で再生しながらテキストを流し読みします。固有名詞、数値、意味が変わってしまった箇所に集中しましょう。フィラーワードまでは追わなくて大丈夫です。番組スタイルが厳密な逐語起こしを求めるのでない限り、クリーン逐語モードが自動で処理します。
podcast:transcript RSSタグとは何ですか?使うべきですか?
Podcasting 2.0拡張タグの一種で、トランスクリプトファイルをRSSのエピソード項目に直接リンクさせます。2026年半ば時点で33のポッドキャストアプリが対応しており、Apple Podcasts(iOS 17.4以降)、Pocket Casts、Spotifyなどが含まれます。ホスティングプラットフォーム(Transistor、Buzzsproutなど)がタグを書いてくれるなら、1エピソードあたり約30秒で追加できます。互換性を最も広げるにはVTT形式を使いましょう。ファイルURLはHTTPSである必要があり、そうでないとApple Podcastsは黙ってスキップします。
出典
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.