インタビューポッドキャストのワークフロー:収録、文字起こし、プロモーション
ポッドキャストインタビューポッドキャストワークフロー

インタビューポッドキャストのワークフロー:収録、文字起こし、プロモーション

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

週次公開のペースに耐えられるインタビューポッドキャストのワークフローは、ブッキング、準備、収録、ポストプロダクション、公開、プロモーションの6つの段階で構成されます。RiversideやSquadCastのようなプラットフォームでのリモート収録では、話者ごとに分かれたトラックが得られ、これが正確な話者ラベル付きのクリーンな文字起こしの基盤となります。ブッキング時に署名するリリースフォームが編集権を守ります。文字起こしが残りすべてを牽引します。ショーノート、プルクォート、クリップ、プロモーション素材です。ソロホストの場合、合計で週10〜18時間を見込んでください。

週次公開を持続できるインタビューポッドキャストのワークフローは、その場しのぎの決定の寄せ集めではなく、6段階のシステムです。 段階とは、ブッキング、準備、収録、ポストプロダクション、公開、プロモーションです。各段階を明示的に計画するホストは、3つの段階を即興でこなすホストよりも多くの頻度で、より少ないストレスで公開できます。

話者ラベル付きのインタビュー文字起こしはワークフローの背骨です
話者ラベル付きのインタビュー文字起こしはワークフローの背骨です

6つの段階の概要

  1. ゲストの探索とアウトリーチ。 ゲストを見つけてブッキングします。
  2. 収録前の準備。 リサーチ、質問の作成、ブリーフィング。
  3. 収録。 音声品質を守るプラットフォームでのインタビュー本番。
  4. ポストプロダクション。 編集、話者ラベル付き文字起こし、ショーノート。
  5. 公開。 アップロード、エピソードページ、配信。
  6. プロモーション。 プルクォート、クリップ、SNS投稿、ゲスト素材パック。

各段階が次の段階を支えます。弱い準備は弱い収録を生みます。弱い収録は弱い文字起こしを生みます。弱い文字起こしは弱いプロモーションを生みます。システム全体の強さは、最も遅い段階によって決まります。

ステージ1:ゲストの探索とアウトリーチ

新しいインタビューポッドキャストで最もよくある失敗パターンは、12エピソード目までにゲストのパイプラインが枯渇することです。

機能するパイプラインには3つの流れがあります。受信リクエストは、ゲストやその広報チームからあなたに届きます。新しい番組では、最初の25〜50エピソードは受信がほぼゼロと考えてください。直接アウトリーチは、初年度以上にわたってゲスト獲得の大部分を占めます。ゲストを見つけてメールを送ります。過去のゲストからの紹介は、最終的に最強の流れになりますが、それは番組が20〜50エピソード公開されてからです。

アウトリーチのテンプレート次第で、返信が来るかどうかが決まります。成果を出すテンプレートと無視されるテンプレートを分けるのは、次の3つです。

この人物である具体的な理由。 「ぜひ出演してほしい」では不十分です。代わりにこう書きます。「Xに関するあなたの最近の記事は、Yについて第31エピソード以来リスナーから寄せられている質問と直接重なっています。その交点を深掘りしたいのです。」

具体的な依頼内容。 特定の週にRiversideで45分収録、候補となる3つの時間枠を添える。スケジュール調整をワンステップの決断にします。

オーディエンスのシグナルと実績。 リスナー層の概要と最近の注目ゲストについて1〜2文。誇張せずに信頼性を示します。

テンプレートが練れていれば、コールドアウトリーチの返信率は15〜35%になります。著名なゲストでは低く、あなたのオーディエンスがまさにその専門家のターゲット層であるニッチな分野では高くなります。

ステージ2:収録前の準備

45〜60分のインタビューには、2〜4時間の準備を見込みます。 この作業があるかないかで、ゲストがすすめたくなるエピソードと、ただ耐えているだけのエピソードが分かれます。

ゲストの直近1年間の仕事を読むか視聴します。著書、論文、最近のポッドキャスト出演、公開記事などです。探すのはキャリア全体の軌跡ではなく、今何を考えているのかです。

15〜25個の質問を作り込みます。すべて使うことはありません。余裕のある量があれば、会話が自然に向かう先についていきながらも、足場を失いません。

反論・突っ込む場面を少なくとも2つ見つけます。意見が異なる質問、具体例を掘る質問、反対意見を引き出す質問です。こうした場面が、リスナーが繰り返し引用したくなる言葉を生みます。

24時間前にゲストへ短いブリーフを送ります。 形式、おおよそのトピック、必要な事務連絡です。期待値を設定し、口数の少ないゲストがより備えた状態で臨む助けになります。

この段階を終える前に、ゲストのリリースフォームに署名してもらいます。リリースにより、収録されたエピソード、クリップ、プロモーション用の引用に対する完全な編集権をあなたが保持することが確定します。ゲストは最終成果物を確認・承認する権利を放棄します。リリース条項を含むメッセージへの返信でゲストが「同意します」と書けば、ほとんどの番組では法的に十分です。会話の前にこれを済ませておけば、プロモーション用に鋭いゲストの発言を引用したいときに、ポストプロダクション段階で気まずさが生じません。

ステージ3:インタビュー番組の収録品質

リモート収録の品質は、ソロ番組よりもインタビュー番組の方が重要です。ゲストの環境はコントロールできないからです。重要なのはプラットフォームそのものよりも、録音アーキテクチャです。

各参加者の音声をそれぞれのデバイス上にローカル録音するプラットフォームを使います。Riverside、SquadCast、Zencastrはいずれも対応しています。ローカル録音なら、どちらか一方でインターネット接続が切れてもファイルは破損しません。話者ごとのトラックが別々に得られます。あなたの声のクリーンなファイル1つ、ゲストの声のクリーンなファイル1つです。この分離こそが、編集者と文字起こしサービスが話者を正確に区別できる理由です。

プラットフォーム話者ごとのローカルトラック内蔵文字起こし動画オプション
Riversideあり(24bit/48kHz WAV)あり(Proプラン)最大4K
SquadCastあり(プログレッシブアップロード)なし(Descriptにバンドル)あり
Zencastrあり(16bit/48kHz WAV)あり最大4K

Zoomの音声はカジュアルな収録には許容範囲ですが、デフォルトでは圧縮されたモノラルです。ゲストがZoomにこだわる場合は、Zoomのオーディオ設定で「オリジナルのサウンド」を有効にし、ヘッドホンの着用を頼んでください。結果を文字起こしする方法については、ポッドキャストエピソードの文字起こしガイドが基本の仕組みを扱っています。

ゲストには、ヘッドホンの使用、静かな部屋、可能であれば有線接続を依頼します。 静かな部屋でイヤホンを使うゲストの方が、エアコンの効いた部屋でUSBマイクを使うゲストよりも良く聞こえます。この依頼は当日ではなく、収録前のブリーフに入れておきます。

本番の会話を始める前に、2分間の音声テストを行います。レベル、背景ノイズ、クリッピングの確認と修正には120秒しかかかりません。無視すると、ポストプロダクションで1時間のクリーンアップ代になります。

文字起こし精度に影響する具体的な設定については、クリアな文字起こしのためのマイクのコツをご覧ください。

ステージ4:話者ラベル付きポストプロダクション

ポストプロダクションは、ほとんどのインタビュー番組がボトルネックになる場所であり、文字起こしが可能性を変える場所でもあります。

まず音声を編集し、それから文字起こしします。 60分の生の会話は、言い淀み、繰り返し部分、冷静に考えると成立しない内容を取り除くと、通常45〜50分の最終音声になります。編集前に文字起こしすると、削除する予定の素材まで文字起こしすることになります。

編集済みの音声を文字起こしサービスにアップロードします。話者分離を有効にします。クリーンな2話者収録であれば、最新の話者分離は大多数の場合に正しく話者ラベルを割り当てます。主な失敗パターンは発話の重なりです。ホストとゲストが同時に話すと、帰属は不完全になります。これはサービスの限界ではなく物理的な限界です。良い収録習慣は重なりを大幅に減らします。帰属の仕組みと弱点の技術的な解説は、話者分離の解説をご覧ください。

ミーティングボットや別プラットフォームのサブスクリプションなしで、正確な話者ラベル付きのクリーンな文字起こしだけが必要なら、ConvertAudioToTextは45分のインタビュー音声を数分で処理します。全文を無料でコピーできるほか、7日間トライアルを開始すればTXT、SRT、VTT形式で書き出せます。無料プランには文字起こし10分が含まれ、毎月補充されるのではなく登録時に一度付与されます。月額9.99ドルのProプランなら、ファイル書き出し付きで無制限の音声を処理できます。

ショーノートを書く前に、文字起こしを使ってプルクォートを特定します。 ラベル付きの文字起こしがあれば素早くできます。ゲストの発言行だけを走査し、一文でまとまる洞察、意外な統計、その人しか使わない表現を探します。これらは次のものになります。

  • ショーノートの見出しまたは小見出し
  • SNS用グラフィック2〜3枚
  • ゲスト自身のオーディエンスに共有してもらうための引用カード
  • プロモーションメールのフック

ショーノートの完全なワークフローについては、ポッドキャストのショーノートを自動で作成する方法がプロセスを詳しく解説しています。

最も強いクリップの選定とトリミングについては、SNS向けポッドキャストクリップが選定基準とフォーマットの判断を扱っています。

AI支援ツールを使った場合のポストプロダクション合計時間:2〜4時間。使わない場合:6〜10時間。

ステージ5:公開

公開は機械的な作業ですが、文字起こしがSEOとして機能するかどうかを左右します。

音声をポッドキャストホスティングサービスにアップロードします(Buzzsprout、Transistor、Castos、Captivate、Podbeanが標準的です)。エピソードページには、構造化されたショーノートと全文の文字起こしを掲載します。エピソードページ上の文字起こしは、ゲストの具体的な言葉を検索エンジンにインデックス可能にし、聴くのではなく読むリスナーにもアクセス可能にします。古いエピソードから引用を引きたいときの恒久的な参照元にもなります。

YouTubeにクロスポストする場合、ポッドキャストワークフローで作ったチャプターマーカーとショーノートはそのまま流用できます。

ステージ6:ゲスト素材を使ったプロモーション

エピソードの公開日は、プロモーションにおいて最も効果の高い瞬間です。 受動的な投稿ではなく、ローンチとして扱います。

公開当日:エピソード告知の個人SNS投稿、リンクと短い感謝を添えたゲストへのメール、このエピソードから特に恩恵を受ける3〜5人へのダイレクトメッセージ。

公開1〜7日目:SNSクリップを2〜4本、プラットフォームごとにずらして公開します。少なくとも1本はテキストベースにします。ほとんどのプラットフォームでは、テキスト投稿は動画とは異なる形で拡散されるからです。

公開日前にゲスト素材パックを作成します。 ゲストが手間なく共有できるすぐ使えるキットには、名前と番組ロゴ入りのプルクォート画像1枚、オーディオグラムクリップ1本(最も強い60秒セグメント)、長さの異なる事前作成のSNSキャプション2〜3本を含めます。独自のオーディエンスを持つゲストは、手間のかからないものを共有します。ファイル2つとコピペ用キャプションのキットは20分で組み立てられ、ゲストの人脈からのエピソード発見を安定して促進します。

公開前にプルクォートをゲストへ送ります。承認のためではなく、事前連絡としてです。「プロモーションで使う引用はこちらです。公開前に文脈が欠けているものがあれば教えてください。」これは関係構築の慣行であり、編集権の譲歩ではありません。署名済みのリリースのもとで編集権はあなたが保持します。事前連絡があれば、ゲストのオーディエンスが引用をリプライで送りつけてきたときに初めて、文脈から切り離された引用をゲストが知るという気まずい状況を防げます。

公開7〜14日目:ニュースレターでの言及。番組に信頼性のある関連コミュニティへのクロスプロモーション。

文字起こしを活かしたコンテンツ収益化の長期戦略については、ポッドキャスト文字起こしの収益化が、エピソードアーカイブを土台にした収益経路を扱っています。

週次インタビューポッドキャストの時間予算

段階週あたりの推定時間
ゲストの探索とアウトリーチ2〜4時間
収録前の準備2〜4時間
収録(セットアップ含む)1〜2時間
ポストプロダクション2〜4時間
公開1時間
プロモーション2〜3時間
合計10〜18時間

ソロホストにとって、これは相当な副次的コミットメントです。10〜12時間の水準なら持続可能です。18時間になると、生活のどこかが圧迫されます。総時間を減らす最大のレバーは、まとめ収録(1回の収録セッションで2本収録)と、AI支援のポストプロダクション(文字起こしとショーノート下書きを数時間ではなく数分で)です。

パートタイムの編集者を雇うのが経済的に成立するのは、通常、番組の収益化方法にもよりますが月間リスナー1,000〜5,000の水準からです。その閾値に達する前は、外注コストが番組の収益を上回ることが普通です。

インタビューポッドキャストの勢いを殺す3つのパターン

ゲスト準備の省略。 準備不足のまま臨むホストは、心地よいが忘れられるインタビューを生みます。エピソードをすすめたくなる質問は、ゲストの最近の仕事を読むことから生まれます。

編集での完璧主義。 90%の仕上がりを超えると、わずかな改善のために何時間も費やすことになります。公開日の遅延は、追いかけていた1時間のクリーンアップよりも大きな損失です。

プロモーションを任意扱いにすること。 誰にも発見されない強いエピソードは、多くの人に聴かれる良いエピソードより劣ります。制作にかける時間に見合ったプロモーションの時間を確保します。

これらすべての段階をつなぐ文字起こしレイヤーの全体像については、ポッドキャスターのための文字起こし:完全ガイドが、収録からプロモーションまで文字起こしワークフローがどうつながるかを解説しています。

私の見方:私が月間リスナー1万人に達するのを見てきたインタビュー番組は、音声品質だけでそこに到達したわけではありません。毎週公開し続けながら徐々に改善していくシステムを築いていました。上記のワークフローがそのシステムであり、文字起こしはその結合組織です。

よくある質問

インタビューポッドキャストにはどのリモート収録プラットフォームを使うべきですか?

Riverside、SquadCast、Zencastrはいずれも、各参加者の音声をそれぞれのデバイス上にローカル録音し、別々のトラックとしてアップロードします。このローカル録音モデルにより、インターネット接続が切れてもファイルが破損しません。ほとんどのインタビューポッドキャスターにとって、3つのうちどれでも十分に機能します。SquadCastはDescriptのサブスクリプションに無料でバンドルされています。Zencastrは同じプラットフォーム内でホスティングとRSS配信も提供します。動画公開が番組にとって重要であれば、RiversideのProプラン(年払いで月額24ドル)には4K動画と無制限の文字起こしが含まれています。

話者分離は2人のインタビューでもうまく機能しますか?

クリーンな2人収録であれば、最新の話者分離は大多数の場合に正しく話者ラベルを割り当てます。主な失敗パターンは発話の重なりです。ホストとゲストが同時に話すと、文字起こしも話者帰属も不完全になります。どの文字起こしサービスを選ぶかよりも、良い収録習慣(返答前に一拍置く、静かな部屋を使う)の方が重要です。詳細な解説は、話者分離の解説の記事をご覧ください。

ゲストのリリースフォームは必要ですか?

はい。ブッキング後、収録日より前に署名するリリースフォームにより、ホストが完全な編集権を保持することが確定します。ゲストは最終エピソード、クリップ、SNS用の引用を確認・承認する権利を放棄します。署名済みのリリースがない場合、ゲストはあなたの編集やプロモーションの方法について異議を唱えることができます。リリース条項を含むシンプルなメールにゲストが書面で同意すれば、ほとんどの番組では法的に十分です。

エピソード1本あたりのポストプロダクションにはどれくらい時間がかかりますか?

AI支援の文字起こしとショーノート生成を使えば、エピソード1本あたり2〜4時間を見込んでください。おおよそ、音声編集に1時間、文字起こしと書き出しに5分、ショーノート、プルクォートの選定、クリップの特定に1〜2時間です。AIツールなしでは、同じ作業に6〜10時間かかります。最大の時短レバーは文字起こしです。45分のエピソードは数分で処理でき、打ち込むのに何時間もかかりません。

ポッドキャストの編集者はいつ雇うべきですか?

パートタイムの編集者やプロデューサーを雇う経済性は、通常、月間リスナー数1,000〜5,000の水準から成立し始めます(番組の収益化方法によります)。その閾値に達する前は、外注コストが番組の収益を上回ることが多いです。有用な中間ステップは、1回の収録セッションで2本をまとめて収録することです。これにより、セットアップとスケジューリングの固定オーバーヘッドを半減でき、人員を増やさずに済みます。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles