2時間の会議を速攻で文字起こしする方法(正直なワークフロー)
文字起こし会議生産性

2時間の会議を速攻で文字起こしする方法(正直なワークフロー)

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

高速ルート

圧縮済みの音声ファイルをアップロードすれば、2時間の会議でも検索可能で話者ラベル付きの文字起こしが、アップロード時間を含めて合計10〜15分で手に入ります。この見積もりは、録音を事前にM4AまたはMP3に変換している前提です。その手順を飛ばして、一般的な家庭用回線で2 GBのMP4をアップロードすると、アップロードだけで15〜20分かかることもあります。以下のワークフローは、そのギャップを埋めるように設計されています。

2時間の会議が特別なケースである理由

ほとんどの文字起こしツールは、短いクリップや30〜60分の会議を想定して作られています。2時間になると、次の3つのことが変わります。

ファイルサイズが膨らむ。 2時間のZoom MP4ビデオ録画は、1.5〜2.5 GBに達することがあります。これは文字起こしの問題ではなく、アップロードの問題です。同じ会議の音声トラックをM4Aで保存すると、通常は80〜150 MBです。

話者分離が難しくなる。 声で話者を分けるエンジンは、4〜6人程度までならうまく機能します。クロストーク、電話でのダイヤルイン、または6人以上の参加者が加わると、一部の話者ラベルを手動で修正する必要が出てきます。これは普通のことで、忙しい通話ではターンの約5%を修正するつもりでいてください。

会議ごとの上限が完全にブロックすることがある。 例えばOtter.aiのProプランは、各会話を90分に制限しています(otter.ai/pricing、2026年7月確認)。2時間の会議はこの上限を超えるため、Businessプラン($19.99/ユーザー/月)が必要です。チームがOtter Proを使っていて、2時間のセッション全体を文字起こしする必要がある場合、アップグレードに費用を払うか、ファイルを分割するかのどちらかです。

ツール比較: 長時間会議への対応

ツール会議ごとの上限(有料エントリー層)ボットがライブ参加可能かおおよその価格(エントリー有料)
Otter.ai Pro90分あり$8.33/ユーザー/月(年間)
Otter.ai Business4時間あり$19.99/ユーザー/月(年間)
Fireflies.ai Pro上限の記載なしあり$10/ユーザー/月(年間)
Rev(人間による)上限なしなし(アップロード)$1.99/分(2時間で約$240)
ConvertAudioToText Proファイルごとの上限なしなし(アップロード)$9.99/月(無制限)

ツール選びがここで最も重要です。ライブ参加型のボットが必要なら、Otter BusinessかFirefliesが主な選択肢になります。すでに録音があって文字起こしだけが必要なら、ファイルごとの上限がないアップロード型ツールの方が、この用途では速くて安上がりです。

ConvertAudioToTextの文字起こしツール
ConvertAudioToTextの文字起こしツール

ステップバイステップのワークフロー

ステップ1: アップロード前にファイルを圧縮する

これが、できる変更の中で最も効果の高いものです。アップロード前に動画録画を音声に変換しましょう。

Macでは、QuickTime > ファイル > オーディオを書き出すでM4Aが保存されます。Windowsでは、VLCの変換/保存で数分でMP3かM4Aに変換できます。どちらも無料です。得られるものは、元の動画より10〜20倍小さいファイルで、文字起こし品質は落ちません(エンジンは音声トラックしか使わないからです)。

150 MBのM4Aは、一般的なブロードバンド接続で約1〜3分でアップロードできます。それが作業の目安となる時間枠です。

ステップ2: 話者検出を有効にする

送信前に話者分離をオンにしてください。処理時間は約15〜30秒増えますが、出力は区別のないテキストの壁から、次のような形に変わります。

[話者1] Q3の数字はどうなってる?
[話者2] 消費者向けは12%減、企業向けは8%増です。
[話者1] 企業向けの詳細を教えて。

後から「話者1」を実際の人物名に変更しますが、発言の位置は自動で割り振られます。2時間の取締役会議では、この属性情報が文字起こしを実際に使えるものにする鍵です。話者分離の仕組みについては、話者分離の解説ガイドで詳しく説明しています。

ステップ3: 送信して待つ

クラウドベースのバッチ文字起こしは、リアルタイムよりはるかに速く音声を処理します。商用STTエンジンは、音声品質とサーバー負荷にもよりますが、2時間のファイルを通常4〜8分で処理します。ファイルを送信して、コーヒーを飲んで、戻ってきてください。プログレスバーを見ている必要はありません。

正直な注意点をひとつ。この時間の目安は音声の品質が良いことを前提にしています。背景ノイズが多い録音、電話回線品質のダイヤルイン、強い残響がある場合は、どのエンジンを使っても処理に時間がかかり、エラーも増えます。

ステップ4: AIテンプレートでアクションアイテムを抽出する

2時間の会議の生の文字起こしは、欠席した人に渡すには長すぎます。この長さの文字起こしの価値はテキストそのものではなく、そこから引き出す情報にあります。

ほとんどのAI文字起こしツールには要約テンプレートが備わっています。探すべきものは次の通りです。

  • 会議議事録: 決定事項、アクションアイテム、各項目の担当者。
  • エグゼクティブサマリー: 何が起きたかを200〜300語でまとめたダイジェスト。
  • 決定ログ: 「決定した」場面のすべてを、その周辺の文脈とともに記録。

これらは完成した文字起こしに対して実行され、数分ではなく数秒で完了します。

ステップ5: スクロールではなくセクションで移動する

一般的な話速での2時間の文字起こしは、およそ18,000〜22,000語になります。これを直線的に読むのではなく、検索して使うものです。まともなツールならどれもタイムスタンプ検索に対応しています。文書を共有する前に、主要なトピックのブロックとおおよそのタイムスタンプ(「0:00 - 四半期レビュー、42:00 - 製品ロードマップ、1:18:00 - 予算協議」など)を冒頭のコメントとして追加しておきましょう。そうすれば、文字起こしは延々とスクロールする壁ではなく、ナビゲート可能な文書になります。

話者ラベルが間違って出たときの対処法

6人以上の声が入る2時間の会議は、最も難しいケースです。実用的な修正方法は3つあります。

音声ストリームを別々に録音する。 Zoomのローカル録音には「各参加者に別々の音声ファイルを録音する」オプションがあります(設定 > 録画、デスクトップアプリのみ)。各参加者の音声が個別のトラックに記録されれば、エンジンが声のプロファイルで話者を推測する必要がなくなります。大人数で発言が多い会議には、これが現時点で最善の対策です。

チャットにアンカーノートを残す。 会議中に「Maya が今参加」「Vikram に戻る」といった短いチャットメッセージを打っておこう。文字起こしには自動で反映されないが、後で話者ラベルを手動で振り直す際に使えるタイムスタンプの目印になる。

エディタで一括リネームする。 高機能な文字起こしエディタなら、「Speaker 3」の全出現箇所を選択して一括で名前を変更できる。1発話ずつ直すより、その方法を使おう。

分離の仕組みをもっと詳しく知りたい場合は、話者分離の解説を参照。

検索可能なアーカイブという副産物

長い会議を毎回文字起こしする最大のメリットは、即時の要約ではない。6か月後に「あの機能、Q3に出すって決めたっけ、Q4だっけ?」と誰かが聞いてきたとき、年間の全トランスクリプトを検索して、その話が出た正確な瞬間を見つけられることだ。

トランスクリプトを組織の記憶として扱うチームは、「決めたはずだと思ってたけど...」という言い争いをしなくなる。確認のコストは録画の見直しからキーワード検索に変わる。音声から議事録を作成するでは、体系的に運用する場合の長期アーカイブのワークフローを扱っている。

長い会議でAI文字起こしを使うべきでないケース

2時間の会議でも、ごく一部は人間による文字起こしが適切だ。法的な宣誓供述、人事調査、規制関連の証言、証拠の連鎖が重要な手続きでは、人間による検証と、場合によっては認定文字起こしが必要になる。AIと人間の文字起こし比較で、そうしたケースの判断基準を解説している。

通常の戦略会議、役員会、製品レビュー、全社集会なら、AIが正解だ。クリーンな音声なら精度は高く、納期も速く、コストは人間の代替手段の数分の一だ(2時間のファイルでRevの現在の料金$1.99/分、2026年7月時点で$240以上)。

無料プランについての注意

無料のAI文字起こしプランは、2時間のファイルを一度に処理できないケースがほとんどです。ConvertAudioToTextの無料プランは、サインアップ時に10分の文字起こしが一回だけ使えて、1ファイルあたり10分の上限があります。ツールを試すには十分ですが、2時間の録音には足りません。OtterのBasicプランは会話を30分に制限しています。Firefliesの無料ティアはストレージを800分に制限し、要約にはAIクレジットの上限がかかります。

定期的な長い会議の文字起こしには、有料プランは選択肢ではなく基本です。私の見解では、ほとんどのチームが元を取れるのは、「何を決めたっけ?」と誰かが尋ね、録画を再生し直す代わりに検索で答えを得た最初の会議の時点です。

ライブボットなしで長い会議のクリーンな文字起こしだけが必要なら、ConvertAudioToTextは月額$9.99からで、有料プランにはファイルごとの時間制限がありません。カレンダーには参加できませんが、任意の長さのファイルをアップロードして文字起こしするワークフローはしっかり対応します。

よくある質問

2時間の会議の文字起こしには実際どれくらい時間がかかりますか?

合計時間はアップロード速度とファイル形式によります。2時間の会議をM4A(およそ80〜150MB)で保存した場合、一般的なブロードバンド接続ならアップロードに1〜3分かかります。クラウド文字起こしは、音声品質とサーバー負荷に応じて4〜8分かかります。圧縮音声の経路なら、合計で10〜15分を見込んでください。元のビデオファイル(1.5〜2.5GB)をアップロードする場合、処理が始まる前にアップロードだけで15〜20分かかることもあります。

8人以上の参加者がいる会議で話者ラベルは機能しますか?

話者分離は4〜6人を超えると精度が落ちます。特にクロストークがある場合です。一部のラベルは手動で割り当て直す必要があると想定してください。最善の対策は、Zoomの「参加者ごとに個別の音声ファイルを録音する」オプション(ローカル録画、デスクトップアプリ)です。個別の話者トラックがあれば、エンジンはラベルをはるかに正確に割り当てます。参加者が多く、会話が重なる会議では、手動での修正を計画に入れておきましょう。

2時間の会議をファイル分割せずに処理できるAI文字起こしツールは?

会議ごとの上限が設定されているツールには、Otter.ai Pro(90分の上限、otter.ai/pricing参照)があります。会議ごとの時間制限がないツールには、Otter Business(4時間の上限)、Fireflies Pro、そしてConvertAudioToText Proのようなアップロード型ツールがあります。Revのような人力サービスには時間制限がありませんが、1分あたりの料金がかかります(2026年7月時点で約$1.99/分、rev.com/pricing参照)。

2時間の役員会議に人力文字起こしは価値がある?

ほとんどの会議では、めったにありません。クリーンな音声に対するAI文字起こしは、戦略会議、取締役会、製品レビューに十分な精度があります。人力文字起こしは1分あたり$1.99以上かかり(Revの現在の公開料金による)、2時間のファイルで約$240、納期は12〜24時間です。この長さで人力文字起こしがコストに見合うのは、法的手続き、人事調査、または認定精度と証拠保全が求められる状況だけです。それ以外の場合は、AIワークフローで10〜15分以内に同等の結果が得られ、コストはほんの一部です。詳細な比較はAIと人力の文字起こしをご覧ください。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles