
ユーザーインタビューの文字起こし:UXRワークフローガイド
Summarize this article with:
ユーザーインタビューで文字起こしを省略すると、分析統合は記憶に残った印象的な引用ではなく頻出パターンに偏ってしまう。このガイドでは、録音、24時間以内の文字起こし、オープンコーディング、テーマ統合、引用に裏付けられた報告まで、発見の全ループを扱う。料金モデルとUXリサーチへの適合性で6つのツールを比較し、トランスクリプトで注目すべきポイント(逐語表現、ワークフローの説明、感情を示す言葉)や、多言語リサーチ、参加者プライバシーの基本にも触れる。
文字起こしを省略するUXリサーチャーは、ユーザーが実際に言ったことではなく、自分が覚えている内容によって統合結果を形作ってしまう。 3回目のインタビューで印象的なコメントをした参加者が支配的な声になり、より静かだが一貫したシグナルを繰り返した7人のユーザーは薄れていく。再設計を導くはずだったパターンは、誰も書き留めなかったために見落とされる。
トランスクリプトはそれを修正する。記憶に残った文ではなく、頻度と正確さで重み付けして、ユーザーが言ったことを分析できるようにする。
この記事では、プロダクトディスカバリーにおける1対1のユーザーインタビューに特化したワークフローを扱う。参加者管理、リサーチリポジトリ、チーム分析ツールを含む完全なリサーチプログラムを立ち上げる場合は、より広いリサーチオプス視点の関連記事「UXリサーチの文字起こし」を参照してほしい。ここでは、録音から報告までのインタビューそのものに焦点を当てる。
UXRインタビューのループ
ほとんどのプロダクトディスカバリープロジェクトは、数週間で5〜12件のインタビューを実施する。実践に耐える手順は次のとおりだ。
計画する。 開始前にディスカッションガイドを標準化する。半構造化インタビューであっても、参加者間でトランスクリプトを比較できるよう一貫した骨組みが必要だ。自由形式の会話は、インタビューごとに扱う内容が異なるため、コーディングしにくいトランスクリプトを生む。
録音する。 Zoom、Google Meet、Microsoft Teamsでのリモートセッションでは、内蔵の録画機能で十分だ。対面セッションでは、スマートフォンやノートPCのマイクでも1対1なら十分対応できる。グループセッション(フォーカスグループ、共同デザイン)では、USB会議用マイクが精度を大幅に向上させ、文字起こしツールの話者分離が重要になる。
24時間以内に文字起こしする。 口調や文脈の記憶はすぐに薄れる。会話が新鮮なうちに同日中に録音をアップロードすれば、レビュー中にAIの誤りをより確実に発見できる。
タグ付けとコーディング。 各トランスクリプトを読み、リサーチクエスチョンに照らして該当箇所をマークする。トランスクリプト1本あたりの最初のパスには、集中した読みが30〜45分かかる。
統合する。 全インタビューのコーディング後に、横断的なパターンを構築する。ここがトランスクリプトの価値が最も発揮される場面で、再構成された要約ではなく、ユーザー間の実際の発言を比較できる。
報告する。 逐語的な引用を報告に盛り込む。成果物の信頼性はエビデンスの具体性にかかっている。
10インタビューのプロジェクトでは、文字起こし処理がバックグラウンドで進む一方で、集中作業は全体で約20時間かかる。トランスクリプトがない場合、同じプロジェクトは約12時間で済むが、成果物は明確に弱くなる。

トランスクリプトを読むときに注目すべきこと
トランスクリプトには、特にフラグを立てる価値のある数種類のシグナルが含まれる。
逐語的なユーザー言語。 参加者が製品、ワークフロー、問題を説明する際に実際に使う言葉。これは社内チームの言葉と大きく異なることが多い。インターフェースやマーケティングにユーザーの言葉を取り入れると、チームが最初に使っていた専門用語よりもほぼ常に優れた成果を生む。
ワークフローの説明。 参加者が現在のプロセスを段階的に説明するとき、その順序自体が摩擦を明らかにする。正確な移行、迂回、回避策が、デザインが介入できる場所を示す。
比較表現。 「[他のツール]みたいだけど…」や「XはできるけどYはできない」など。これらはユーザーが製品を頭の中でどう分類しているかを示し、アンケートではこれほど正確に引き出せない情報だ。
感情を示す言葉。 「イライラする」「面倒だ」「満足だ」「やっと」。感情的な言葉は優先度の高い瞬間を示す。ライブメモはこれらを実質的でないとして除外しがちだが、トランスクリプトは確実に捉える。
ストーリー。 参加者が自社製品や競合製品の利用について具体的なエピソードを語るとき、その物語には動機、順序、感情的反応、回避策という文脈が濃縮されている。定量データでは示せないパターンが見つかるのがストーリーだ。
実際のコーディング手順
コーディングはトランスクリプトがリサーチ結果に変わる工程だ。専門ソフトなしでも通用する軽量な方法は次のとおり。
ラウンド1:オープンコーディング。 各トランスクリプトを読み、リサーチクエスチョンに関係しそうな箇所をすべてフラグする。該当箇所を括り、1行のタグを書く。
ラウンド2:テーマの統合。 トランスクリプトを2〜3本処理すると、タグがまとまり始める。目にしている内容の大半をカバーする5〜12のテーマを定義する。
ラウンド3:再コーディング。 統合したテーマを全トランスクリプトに適用する。複数のタグが付く箇所があっても問題ない。
ラウンド4:統合。 テーマごとに、全インタビューからタグ付けされた箇所を集める。各テーマ内のパターンがリサーチ結果になる。
NVivoやAtlas.tiのような正式なツールはこの一部を自動化するが、学習曲線が急だ。20件未満のプロダクトディスカバリープロジェクトの大半では、共有Googleドキュメントや基本的なスプレッドシートで十分機能する。価値はソフトウェアではなく、方法の規律にある。
特にトランスクリプトが必要な調査手法
一部の手法は、完全なテキスト記録があって初めて正しく機能する。
Jobs-to-be-Doneインタビュー。 JTBDはタイムラインベースの質問で、あるソリューションから別のソリューションへ切り替えた瞬間をマッピングする。そのタイムラインを正確に再構成するには、聞き直すだけでなく読み直すことが必要だ。
日記調査。 参加者は1週間を通して音声メモを録音する。各エントリーを文字起こしすることでコーパスを分析可能にし、参加者横断で繰り返されるテーマを検索できる。
コンテクスチュアル・インクワイアリー。 リサーチャーは参加者を実際の作業環境で観察する。作業中に参加者が話した内容のトランスクリプトと、何をしていたかについてのフィールドノートを組み合わせると、どちらか単独よりも豊かな成果物になる。
思考発話付きカードソーティング。 思考発話のナレーションこそがデータであり、トランスクリプトなしでは分析できない。
コンセプトテスト。 デザインコンセプトを見せ、数分間にわたる参加者の反応を記録する。トランスクリプトがあれば、評価尺度には現れない、ためらいや矛盾した反応も含め、参加者間の反応を詳細に比較できる。
UXリサーチのボリュームに合わせたツール比較
適切なツールは、インタビューの構成によって異なる。1人で単発のディスカバリーセッションを行うのか、チームで四半期に30件以上のインタビューを一括処理するのか。
| ツール | 料金モデル | 確認済み価格 | リサーチへの適合性 |
|---|---|---|---|
| Otter.ai | シート単位のサブスクリプション | 無料(月300分)/Proは年払いで月額$8.49/席 | ライブ会議のキャプチャに強い。無料枠はインポート制限あり |
| Happy Scribe | AI利用分付きサブスクリプション | Basic 月額€17(AI120分)/Pro 月額€29(600分) | 分単位課金モデルは大量一括処理に不向き |
| Rev(AI) | 段階制サブスクリプション | Essentials 年払いで月額$25.49/席(5,000分) | 精度は堅実。$1.99/分で人間による文字起こしも選択可 |
| Descript | シート単位+メディア分数 | Hobbyist 年払いで月額$16/席/Creator $24 | 動画編集も可能。ハイライトリールを作るなら価値あり |
| Fireflies.ai | シート単位、会議ボット中心 | 無料(ストレージ制限あり)/Pro 年払いで月額$10/席 | チーム会議向けで、ファイルアップロード型のリサーチ一括処理向きではない |
| Trint | シート単位、ジャーナリズム寄り | Starter 約$80/席/月/Advanced 約$100/席/月 | Starterのファイル上限(月7件)がリサーチスプリントを制約 |
| ConvertAudioToText | 定額月額 | $9.99/月で無制限。初回10分無料+7日間Proトライアル | 会議ボットなし。ファイルアップロード型のバッチ調査に強く、試用にサインアップ不要 |
私の見解では、四半期に8〜12件のインタビューを実施するリサーチャーにとって、定額無制限モデルは1件あたりのコストが積み上がらない唯一の選択肢だ。OtterやFirefliesのような会議ボットツールは、カレンダーエコシステム内でのライブキャプチャに最適化されており、セッション後に録音ファイルをアップロードするワークフローとは異なる。
割増料金を払う価値がある唯一のケースは、人間による文字起こしだ。Revの人間によるレビューは1分あたり$1.99で、技術用語の聞き間違いがリサーチ結果を損なうような重要性の高い作業に適している。各60分の10インタビュープロジェクトでは$1,194になる。これは、リサーチが指名された役員が成果物を確認するような主要なプロダクト決定に直接関わる場合に妥当な金額だ。それぞれがコストに見合うタイミングのより詳しい内訳は、「AIと人間による文字起こしの比較」を参照してほしい。
ツール間の料金モデル比較や1時間あたりのコストについては、「文字起こし料金比較」と「1時間あたりの文字起こしコスト」の記事がより深く掘り下げている。
多言語ユーザーリサーチ
製品がグローバルなユーザーベースを対象とする場合、英語のみのリサーチは非英語話者を体系的に過小評価することになる。非英語インタビューの文字起こしは、多くのチームが壁にぶつかる地点だ。
ワークフローは同じだが、文字起こしの後に1ステップ追加する。分析チームの中で元の言語を読めないリサーチャーのために、英語への機械翻訳を実行する。元言語のトランスクリプト(正しい言い回しでの直接引用用)と英語翻訳(チーム横断のパターン分析用)の組み合わせによって、忠実性とアクセス性の両方が得られる。
AI文字起こしツールは非英語の精度に大きなばらつきがある。言語ファミリーだけでなく、必要な特定の言語変種に対応しているか確認すること。メキシコスペイン語、カナダフランス語、西アフリカフランス語は文字起こしモデルでの挙動が異なる。
手動で文字起こししてから翻訳するのではなく、音声を直接翻訳したい場合は、「音声テキスト化ツール」が99言語に対応し、話者分離も備えている。
ステークホルダー向け報告でのトランスクリプト活用
トランスクリプトに基づくリサーチプロセスが、具体的な理由でより優れた報告を生み出す。
逐語的な引用は要約よりも説得力が高い。 同じ摩擦点を説明するスライド上の実際のユーザー引用が3つあれば、「ユーザーはチェックアウトフローに不満を示した」という言い方とは説得力が違う。具体性こそが議論の核になる。
頻度の主張が防御可能になる。 「10人中8人がXに言及した」は「ユーザーは頻繁にXに言及した」よりも強い主張だ。トランスクリプトのアーカイブがあれば、数えて検証できる。
詳細なエビデンスをオンデマンドで提示できる。 ステークホルダーが結果に疑問を持ったとき、該当箇所を即座に引き出せる。「私のメモを信じてほしい」ではなく「ユーザーがこう言った」という会話になる。
トランスクリプトはリサーチライブラリへと蓄積する。 プロジェクトをまたいでアーカイブは資産になる。新しいチームメンバーはオンボーディング中に過去のトランスクリプトを確認できる。半年後に新たな疑問が生じたとき、再分析も可能だ。
参加者のプライバシー
ユーザーリサーチのインタビューには個人データが含まれる。標準的な実践は次のとおり。
- 日程調整時またはリクルートスクリーナーで録音の明示的な同意を得る
- 各セッションの開始時に口頭で確認する
- 長期の関与や有償参加者には書面による同意書を使う
- 削除リクエストに応じる。ほとんどの参加者は求めないが、選択肢は存在する必要がある
- GDPRまたは類似の制度では、最初のインタビュー前に処理の法的根拠を文書化する
企業参加者や機微な主題を扱うリサーチプロジェクトでは、文字起こしベンダーがアップロードされたファイルで学習せず、要求に応じてデータ処理契約を提供できることを確認すること。
よくある質問
60分のユーザーインタビューの文字起こしとコーディングにはどのくらい時間がかかりますか?
AIによる文字起こしは処理に5〜10分かかる。その後のコーディングには、オープンコーディングを行う経験豊富なリサーチャーで、トランスクリプト1本あたり30〜45分の集中した読みが必要になる。統合とは別に、文字起こしとコーディングの工程としてインタビュー1件につきおおよそ1時間を見積もるとよい。
元の言語で文字起こしすべきですか、それとも先に翻訳すべきですか?
まず元の言語で文字起こしし、その言語を読めないチームメンバーのために機械翻訳を実行する。元言語のトランスクリプトは、直接引用のための話者の言い回しや感情的ニュアンスを保ち、翻訳はパターン分析のために幅広いチームが内容へアクセスできるようにする。元言語版を省略してはいけない。
ユーザーインタビューの文字起こしを人間に依頼するのはどのような場合に理にかないますか?
音質が悪い場合、AIモデルが苦手とする強いアクセントの話者がいる場合、あるいは引用の聞き間違いが提案内容を損なうほどリサーチの重要性が高い場合、人間による文字起こしはコストに見合う。Revは現在、人間によるレビューに1分あたり$1.99を請求する。各60分の標準的な10インタビュープロジェクトでは$1,194になるため、ほとんどのUXチームはAI文字起こしを使い、不確かな箇所だけを手動レビュー用にフラグする。
ユーザーインタビューの文字起こしと一般的なUXリサーチの文字起こしの違いは何ですか?
ユーザーインタビューの文字起こしは、1対1の発見的会話に焦点を当てる。個々の参加者から逐語的な言葉、ワークフローの説明、比較表現を捉える。一般的なUXリサーチの文字起こしは、ユーザビリティテスト、フォーカスグループ、日記調査、参加者管理などのリサーチオプスのワークフローも対象にする。個々のインタビュー分析ではなく、完全なリサーチプログラムを立ち上げる場合は、より広いリサーチオプス視点の関連記事「UXリサーチの文字起こし」を参照してほしい。
出典
- Otter.ai 料金ページ: https://otter.ai/pricing (2026年7月確認)
- Happy Scribe 料金ページ: https://www.happyscribe.com/pricing (2026年7月確認)
- Rev.com 料金ページ: https://www.rev.com/pricing (2026年7月確認)
- Descript 料金ページ: https://www.descript.com/pricing (2026年7月確認、検索による検証)
- Fireflies.ai 料金ページ: https://fireflies.ai/pricing (2026年7月確認、検索による検証)
- Trint 料金: https://app.trint.com/plans (2026年7月確認、検索による検証)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.