BMMamane B. MoussaInvalid Date2 min read

Summarize this article with:


title: "2026年版、Xスペース(旧Twitterスペース)の文字起こし方法" description: "2026年におけるX(旧Twitter)スペースの文字起こし方法。リプレイでできること、ホストとして音声をキャプチャする方法、文字起こしのワークフローを解説。" date: "2026-05-26" updated: "2026-07-01" author: name: "Mamane B. Moussa" tags: ["文字起こし", "ツイッタースペース", "音声"] primaryKeyword: "ツイッタースペースを文字起こし" secondaryKeywords: ["Xスペースを文字起こし", "ツイッタースペースのトランスクリプト", "Xスペースの録音", "スペースの文字起こし"] coverImage: "/images/blog/how-to-transcribe-twitter-space.jpg" tldr: "Xスペースにはネイティブの文字起こし機能がない。ライブ中はキャプションが出るけど、終わった瞬間に消えちゃう。文字起こしをするにはまず音声が必要で、ホストならXのデータアーカイブから取得できる(24時間待ちになることも)。リスナーには公式のダウンロード手段がない。ファイルさえ手に入れれば文字起こしツールがなんとかしてくれるけど、複数話者がいるスペースは普通のポッドキャストより編集が大変。" faqs:

  • q: "Xスペースに文字起こしのエクスポート機能はある?" a: "ないよ。Xにはスペース中の自動キャプション機能があるけど、保存されずにセッションが終わると消える。2026年半ば時点で、Xにネイティブの文字起こしやエクスポート機能は存在しない。"
  • q: "Xスペースの録音はどのくらい残る?" a: "最新版のXアプリ(iOS 9.15+またはAndroid 9.46+)を使っているホストの場合、録音はホストが削除するまで無期限に保存される。古いバージョンのアプリを使っているホストや、2022年6月のポリシー変更前に録音されたものは30日で期限切れになる。迷ったら30日以内にダウンロードしておくのが安心。"
  • q: "リスナーはXスペースの録音をダウンロードできる?" a: "公式のXインターフェースからはできない。リスナーはホストにファイルを頼むか、リプレイ再生中にシステム音声をキャプチャするか、サードパーティのスクレイピングツールを試すしかない。ただ、そういうツールはXの利用規約に違反する可能性があるし、動作も不安定。"
  • q: "なぜスペースの話者分離はポッドキャストより難しいの?" a: "スペースは全話者が単一の音声トラックに混ざるけど、ポッドキャストはよく話者ごとに別チャンネルで録音される。単一のミックストラックだと、話者分離モデルはチャンネル分離の助けなしに、音響的な特徴だけで重なる声を区別しなきゃいけない。さらに5〜10人の話者間でマイク品質がバラバラで、頻繁に話者が交代するから、エラー率が一気に上がるんだ。

X Spaces はトランスクリプトを保存しない。 ライブの自動キャプションはセッション中に画面に表示されるが、スペースが終了すると消えてしまう。トランスクリプトを手に入れるには、音声をキャプチャして、それを文字起こしツールに通すという、別々の2つのステップが必要だ。この記事では、その両方を正直に解説する。

キャプチャしたスペース音声は他のファイルと同じように文字起こしされるキャプチャしたスペース音声は他のファイルと同じように文字起こしされる

実際に扱うもの

スペースはライブ音声ルームだ。ホストが1人以上、ステージ上のスピーカーは最大10人、リスナーは招待されない限り発言できない。セッションが終了すると、Xは音声をサーバー側に保持する。誰も保持しないのはトランスクリプトだ。

録音に関する重要な事実:

  • ステージ上のすべての音声(ホストと招待されたスピーカー)が録音される。
  • リスナーの音声は決して録音されない。
  • ビデオはなし、スピーカーごとのチャンネルもなし、すべての音声が単一トラックにミックスされる。
  • ライブキャプションはその場で生成され、保存されない。

この単一トラック、複数スピーカーのミックスが、スペースを通常のポッドキャストより文字起こししにくくしている理由だ。

ステップ1: 音声ファイルを取得する

ホストの場合

公式の方法は、Xのデータアーカイブツールを通る。クイックダウンロードボタンはない。3点メニューから直接音声をエクスポートする方法もない。

  1. X(ウェブまたはアプリ)を開き、設定とプライバシー に移動する。
  2. アカウント をタップし、次に データのアーカイブをダウンロード をタップする。
  3. アーカイブをリクエスト をクリックして確認する。
  4. アーカイブの準備ができると、Xからメールが届く。これには24時間以上かかる場合がある。
  5. アーカイブを解凍し、data > spaces_media に移動する。
  6. 録音は .tsファイル(AACオーディオを含むMPEGトランスポートストリーム)としてそこにある。

.tsファイルを文字起こしツールが取り込める形式に変換するには、次を実行する:

ffmpeg -i space-recording.ts space.mp3

これは音声コンテンツに対してロスレスだ。MP3で問題ない。アップロードツールが受け付けるなら、.tsのままでも構わない。

保持に関する注意点:更新済みのXアプリ(iOS 9.15以降、Android 9.46以降)のホストは、削除するまで録音を無期限に保存できます。あなたや共同ホストが古いアプリバージョンを使っている場合、30日間の有効期限が適用されます。不明な場合は30日以内にダウンロードしてください。

スピーカー(ホスト以外)の場合

共同ホストやゲスト向けの内蔵ダウンロードオプションはありません。現実的な方法は、ホストに頼むことです。ほとんどのホストは、Spaceが終了する前に頼めば、アーカイブファイルを共有したりMP3を送ってくれたりします。セッション直後に、その場の勢いが冷めないうちに連絡するのが、最も確実な保証です。

リスナーの場合

これは最も難しいケースで、明確な答えはありません。Xはリスナー向けの公式ダウンロードを提供していません。

あなたの選択肢を、信頼性の高い順に並べます:

  1. ホストに直接頼む。 これが依然として最も簡単でクリーンな方法です。ほとんどのホストは、頼めばファイルを共有してくれます。
  2. リプレイ中にシステム音声を録音する。 Xでリプレイを再生しながら、OBS、Audacity、またはシステム音声に設定したスクリーンレコーダーで出力をキャプチャします。すでに圧縮された音声を再キャプチャするため、若干劣化したコピーになりますが、文字起こしには通常十分です。
  3. サードパーティのダウンロードツール。 SpacesDownや類似のスクレイパーなどのツールは、公開されたSpace録音を取得できます。品質はさまざまで、これらのツールは文書化されていないX APIの動作に依存しており、一部はXの認証クッキーが必要です。また、Xの利用規約に違反する可能性もあります。公開放送されたコンテンツについては、自己責任で使用してください。

文字起こしが必要なSpacesに参加する場合、定番のアドバイスは、イベント開始前にホストに連絡して、後で録音を共有してくれるかどうか尋ねることです。

ステップ2:ファイルの文字起こし

音声を入手したら、文字起こしのワークフローは他の音声ソースと同じです。

  1. ファイルをアップロードする。 ConvertAudioToTextは、アカウント登録なしで10分未満のファイルならM4A、MP3、TS形式に対応しています。それより長いSpacesは有料プランが必要です。
  2. 話者数を明示的に設定する。 これはSpacesでは非常に重要です。ホスト全員と、ステージに登場したゲスト全員を数えてください。ホスト2人とゲスト4人のSpaceなら、話者数は6人です。自動検出は、複数話者が混在する音声では精度が低くなります。
  3. 語彙リストを追加する。 全話者の名前と、言及された製品名、専門用語、略語を入れてください。10〜20語のリストで、それらの単語の精度が有意に向上します。
  4. 実行する。 60分のSpaceは通常、3〜5分で処理されます。

英語以外のSpaceや、2言語間でコードスイッチングが発生するSpaceについては、話者ダイアライゼーションの解説の記事で、混合言語音声の扱い方を確認してください。

追加ツールなしでクリーンな文字起こしだけが必要な場合は、ConvertAudioToTextの音声文字起こしツールで、アップロードから文字起こしまでをワンステップで処理できます。

Spacesにおけるダイアライゼーションの問題

ダイアライゼーション、つまり誰が何を言ったかをラベル付けするプロセスは、他の音声形式よりもSpacesで顕著に難しくなります。その理由は次の通りです。

  • 単一の混合トラック。 全話者が1つの音声チャンネルを共有します。RiversideやZencastrで録音されたポッドキャストのように、各話者に個別のトラックがある場合と比較してください。
  • 話者数の多さ。 5人から10人が一般的です。話者が増えるほど、モデルが声のクラスタを混同する余地が大きくなります。
  • マイク品質のばらつき。 あるホストはスタジオ用USBマイク、別のホストはスピーカーフォンを使用。音響的な指紋が一貫しません。
  • 短い登場時間。 リスナーがステージに招待され、45秒話してから退出するケース。ダイアライザーは信頼できるプロファイルを構築するための音声がほとんどありません。
  • 重なり合う発話。 活発なSpacesでは頻繁にクロストークが発生します。単一トラック上の重なり音声は分離が困難です。

実用的な期待値:5人スピーカーのSpaceでのダイアライゼーションには誤りが含まれる。 2〜3人で、お互いに被せず話す経験豊富なスピーカーなら、通常はきれいに仕上がる。しかし、ゲストが多い大規模なSpaceでは、手動での修正を前提に計画しよう。

編集パス

X Spacesの文字起こしは、スタジオ収録のポッドキャストよりも編集が必要だ。信頼できるパターンは次の通り:

  • 最初の5分を読みながら聞く。 パターンが90分全体に広がる前に、冒頭でスピーカーラベルが正しいか確認する。
  • 一般的なラベルはすぐに置き換える。 Speaker 2が「マーカスです」と自己紹介したら、文書全体で「Speaker 2」を検索して置換する。
  • 短時間のゲストに注意する。 リスナーがステージに上げられて短いセグメントで話す場合、ダイアライザーが既存のスピーカーと統合してしまうことがよくある。その切り替わり部分を重点的にチェックしよう。
  • 固有名詞を修正する。 ブランド名、人名、製品名。会話音声では、AIの文字起こしが一貫して間違えやすい箇所だ。
  • 聞き取れない部分は推測せずにマークする。 角括弧で[聞き取れず]と記す方が、もっともらしい誤った単語を入れるより誠実だ。

5人スピーカーの60分Spaceは、徹底的な編集に通常30〜45分かかる。比較すると、同程度のポッドキャストなら15分だ。

比較:X Spaces vs ポッドキャストの文字起こし

項目ポッドキャストX Space
音質通常は高い(スタジオ環境)ばらつきあり(様々なデバイス)
スピーカー数通常1〜3人通常2〜10人
トラック構成マルチトラックまたはスピーカー別が多い常に単一のミックストラック
録音の入手方法ホストから直接ファイルXデータアーカイブ、24時間以上の待機
リスナーのダウンロード該当なし公式には利用不可
ダイアライゼーションの難易度簡単から中程度中程度から難しい
1時間あたりの編集時間約15分30〜45分

両方のフォーマットを制作しているなら、Spacesの編集時間はおよそ2倍を見込んでおこう。

そもそもなぜSpaceを文字起こしするのか

最も一般的な理由は次の通り:

コンテンツの再利用。 ライブ会話をニュースレター、ハイライトのスレッド、ブログ記事に変換するためにSpacesを主催する人々。トランスクリプトがその原材料となる。

引用とジャーナリズム。 Spaceを取材し、正確な帰属が必要な記者たち。タイムスタンプ付きのトランスクリプトは、防御可能な記録となる。

参照と検索。 90分のリプレイの中で特定の瞬間を見つけるのに、音声を早送りするのは時間がかかる。検索可能なトランスクリプトなら即座にできる。

アクセシビリティ。 コンテンツをテキスト形式で欲しい聴覚障害者や難聴のフォロワーたち。

参照や検索に使う長時間のSpacesには、音声から会議議事録を作成するワークフローがうまく当てはまる。トランスクリプトを要約ステップに通して、主要な引用、テーマ、アクション項目を抽出するのだ。

法的注意事項

X Spacesは公開の音声会話である。個人的な使用のために公開Spaceを文字起こしすることは、一般的に問題ない。トランスクリプトを再公開したり、引用を商業的に使うのは別の話だ。

  • 話し手は自分の言葉に著作権を持つ。
  • ジャーナリズム目的の引用はフェアユースに該当するが、文脈を無視した引用は責任を生じさせる可能性がある。
  • 話し手の声や名前の商業的使用は、通常許可が必要だ。

内部参照用の使用には、特別な考慮事項は適用されない。

FAQ

X Spacesには組み込みのトランスクリプトエクスポート機能がありますか?

いいえ。XはSpace開催中にライブの自動キャプションを提供するが、保存されず、セッション終了時に消える。2026年半ば時点で、Xにはネイティブのトランスクリプトやエクスポート機能はない。

X Spacesの録音はどのくらい利用可能ですか?

現在のXアプリバージョン(iOS 9.15+またはAndroid 9.46+)を使用しているホストの場合、録音はホストが削除するまで無期限に保持される。古いアプリバージョンのホスト、および2022年6月のポリシー変更前に作成されたすべての録音は、30日後に期限切れとなる。不明な場合は、30日以内にダウンロードすること。

リスナーはX Spacesの録音をダウンロードできますか?

公式のXインターフェース経由ではありません。リスナーはホストにファイルを頼むか、リプレイ再生中にシステムオーディオをキャプチャするか、サードパーティのスクレイピングツールを試すことができます。ただし、そうしたツールはXの利用規約に違反する可能性があり、信頼性もまちまちです。

なぜSpacesのダイアリゼーションはポッドキャストより難しいのか?

Spacesは全話者を1つのオーディオトラックにミックスする一方、ポッドキャストは多くの場合、話者ごとに別々のチャンネルで録音されます。単一のミックストラックでは、ダイアリゼーションモデルはチャンネル分離の助けなしに、純粋に音響的な指紋だけで重なる声を分離しなければなりません。さらに、5〜10人の話者間でのマイク品質のばらつきや頻繁な話者交代が加わると、エラー率は急速に上昇します。

出典

  • Xデータアーカイブのダウンロード: ytechb.comやmaestra.aiを含む複数の検証済みガイドで確認済み。Xのヘルプドキュメントとも整合
  • X Spacesの無期限録音ポリシー(iOS 9.15+ / Android 9.46+): x.com/XSpacesのアナウンスおよびgrecrecorder.comでの裏付け記事
  • アーカイブされたSpacesの.tsファイル形式: Simon WillisonのSpaces録音エクスポートに関するTIL、ryusei.ioでも裏付け
  • FFmpegによる.tsからMP3への変換: 標準のFFmpegドキュメントとコミュニティガイドで検証済み
  • ライブキャプションはセッション後に保存されない: vocap.ioの2026年ガイドと複数のサードパーティ文字起こしツールの説明で確認済み

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 30 minutes free, no account.

Related Articles