音声文字起こしとは?2026年版・やさしく解説する完全ガイド
文字起こし音声基礎知識

音声文字起こしとは?2026年版・やさしく解説する完全ガイド

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

音声文字起こしは、録音を書き言葉に変えるものです。最新のAIサービスなら1時間のファイルを数分で処理でき、クリアな音声では95〜98%の精度に達します。ほぼ完璧な精度が求められる法務・医療・コンプライアンスの場面では、人手による文字起こしが依然として第一の選択肢です。このガイドでは、仕組み、主な出力タイプ、精度を上下させる要因、そして支払額の目安を解説します。

音声文字起こしとは、録音された話し言葉をテキストに変換するプロセスです。ポッドキャストのエピソードの下に表示される文字起こし、YouTube動画の字幕、Zoom通話の議事録を目にしたことがあれば、すでに文字起こしの出力に触れています。この記事では、文字起こしとは実際に何なのか、主要なスタイルの違い、精度に影響する要素、そして余計なコストをかけずに方法を選ぶポイントを解説します。

何が文字起こしとみなされるのか

最もシンプルに言えば、文字起こし(トランスクリプト)とは、話し言葉をテキストで表現したものです。人間のリスナーかAIモデルが音声ファイルを処理し、発話された言葉を識別して、順番に書き留めます。出力は、ひとかたまりのテキストでも、話者ラベル付きの台本形式の文書でも、タイムコード付きの字幕ファイルでも構いません。

処理は2段階で行われます。まず、システムが音を言語として認識します。これを音声認識、または自動音声認識(ASR)と呼びます。次に、認識された言葉を読める形に整形します。句読点や大文字・小文字の処理、つなぎ言葉(フィラー)や言い直し、間(ま)の扱いなどの判断です。

技術的な仕組みの詳細については、AI文字起こしの内部動作の解説をご覧ください。多くの用途では、入力と出力を理解していれば十分です。

2つの主要スタイル:逐語文字起こしとクリーン文字起こし

逐語(ちくご)文字起こしは、「えー」「あのー」といったつなぎ言葉、繰り返し、言い直し、笑い声まで、発話されたすべての言葉をそのまま記録します。 法的な証言採録、質的調査、そして「何を言ったか」と同じくらい「どう言ったか」が重要になるあらゆる場面で必須となります。

クリーン(インテリジェント)文字起こしは、つなぎ言葉や言い直しを取り除き、意味が変わらない範囲で文法を整え、読みやすい文書を作ります。ポッドキャスター、ジャーナリスト、学生の大多数が求めているのはこちらです。出来上がるのは、磨き上げられたインタビュー記事のような文章であり、速記者の生のメモではありません。

逐語文字起こしとクリーン文字起こしの違いの詳しい解説では、非ネイティブスピーカーとのインタビュー、フォーカスグループ、つなぎ言葉のパターン自体がデータになる調査録音といったエッジケースも扱っています。

文字起こし結果に含まれるテキスト以外の要素

最新の文字起こしツールは、単なる生テキスト以上のものを出力します。サービスや録音内容によりますが、次のようなものが得られます。

  • 話者ラベル:誰が何を言ったかを識別します(話者1、話者2、または一度タグ付けすればその人の名前)。
  • タイムスタンプ:単語、文、段落レベルで付与され、元の音声にすぐ戻れます。
  • 句読点と大文字・小文字:抑揚と言語モデルに基づいて自動的に付加されます。
  • 要約とトピックタグ:文字起こし結果の上に大規模言語モデルが生成します。
  • センチメント(感情)マーカー:一節がポジティブ、ニュートラル、ネガティブのどれかを示します。

話者ラベルの有無は、文字起こしの読みやすさを根本的に変えます。ラベルなしの2人のインタビューはほとんど読むに耐えませんが、ラベルがあれば脚本のように読めます。この背後にある技術はダイアリゼーション(話者分離)と呼ばれます。話者ダイアリゼーションの仕組みでは、クラスタリングとセグメンテーションのプロセスをより詳しく説明しています。

音声はどこから来るのか

文字起こしは理論上はフォーマットに依存しませんが、実践ではフォーマットに敏感です。 最もクリーンな入力は専用の録音から得られます。USBマイクで収録したポッドキャスト、MP4で録画したZoom通話、静かな部屋でのボイスメモなどです。一方、最も汚い入力になりがちなのは、スピーカーフォンでの電話、マイク1本を3人で共有する会議室、ホール後方から録音したライブイベントなどです。

文字起こしツールが受け付ける一般的なファイル形式は、音声ではMP3、WAV、M4A、FLAC、OGG、AAC、動画ではMP4、MOV、WebM、MKVです。動画ファイルを提出すると、ツールはまず音声トラックを抽出します。

どのフォーマットが最適か、その理由については、文字起こしに対応した音声フォーマットのガイドをご覧ください。

録音からテキストへ:全体像をひと画面で
録音からテキストへ:全体像をひと画面で

精度はどう測られるか

標準的な指標は単語誤り率(WER)です。文字起こし結果の中で間違っていた単語の割合を示します。 WERが5%ということは、100単語中5単語が誤り、つまり精度95%ということです。

この数字は常に動くターゲットです。独立系ベンチマークによると、2026年の最先端モデルはスタジオ品質の録音でおおよそ2〜5%のWER、ノイズ、強い訛り、話者の重なりがある難しい音声では10〜20%のWERを達成しています。精度を下げる要因は以下の通りです。

  • 背景ノイズ:音楽、交通音、空調(HVAC)のハム音。
  • 強い地域的な訛り(現代のモデルでは5年前ほどの問題ではなくなりましたが、それでも無視できません)。
  • 話者同士の発話の重なり。
  • 専門分野の語彙:医療用語、法律用語、ニッチな専門用語。
  • 低い録音ビットレート、または強い圧縮によるアーティファクト(音声の劣化)。

詳しい内訳は文字起こし精度の解説にあります。

AI文字起こし vs 人手による文字起こし

2026年においても両方は存在しており、それぞれに明確な役割があります。

AI文字起こし人手による文字起こし
速度音声1時間あたり数分音声1時間あたり4〜6時間
精度(クリアな音声)95〜98%99%以上
精度(ノイズあり/複雑)85〜94%98〜99%
費用(一般消費者向け)月額10ドルからの定額プラン。従量課金は1分0.07〜0.25ドルから音声1分あたり1.50〜1.99ドルから(Rev調べ、2026年7月確認)
最適な用途会議、ポッドキャスト、講義、調査、アクセシビリティ法廷での証言採録、医療の口述筆記、放送用キャプション

私の見方:日常的なコンテンツのほとんどにとって、AI文字起こしが正しいデフォルト選択です。かつて普通の録音に人手の文字起こしを正当化させていた精度差は、ほぼ埋まりました。残る差は、99%以上の精度が好みの問題ではなく必須要件となる法務、医療、コンプライアンスの分野です。

主要サービスのコストと精度の詳細な比較は、AI vs 人手の文字起こし文字起こし料金比較をご覧ください。

文字起こし結果でできること

テキストが手に入れば、活用の幅は一気に広がります。

  • 検索。 すべての言葉が検索対象になります。2時間のインタビューもCtrl+Fで探せる問題になります。
  • 引用。 記事、SNS投稿、研究論文のために正確な言葉を引き出せます。
  • 再利用。 ポッドキャストのエピソードをブログ記事、メールニュースレター、動画台本に転換できます。
  • アクセシビリティ。 聴覚障害のある読者・聴衆のために文字起こしとキャプションを提供できます。動画コンテンツではWCAG 2.1によりキャプションが義務付けられており、ポッドキャストのような音声のみのコンテンツでは、単体の文字起こしがアクセシビリティの標準です。
  • コンプライアンス。 録音された通話の書面記録を、それが法的要件となっている業界向けに生成できます。
  • 翻訳。 一度話し言葉がテキストになれば、機械翻訳でスペイン語版やフランス語版を作るのは簡単です。

よく使われるエクスポート形式

文字起こし結果は、いくつかの標準形式で提供されます。

  • TXT: プレーンテキスト。タイムスタンプなし。読んだり文書に貼り付けたりするのに最適。
  • SRT: SubRip字幕形式。行ごとのタイムスタンプ付き。YouTube、Vimeo、事実上すべての動画編集ソフトで利用可能。
  • VTT: WebVTT。ブラウザベースのキャプション向けHTML5標準。SRTにはない基本的なスタイリングに対応。
  • JSON: 機械可読。単語レベルのタイムスタンプと信頼度スコア付き。文字起こし結果を基盤に開発する開発者向け。
  • DOCX / PDF: 話者ラベル付きの整形済み文書。議事録や公開用インタビュー文字起こしとして利用可能。

どれを選ぶかは、出力を何に使うかによります。YouTube動画にはSRTかVTT。ブログ記事にはTXTかDOCX。開発者連携にはJSON。字幕形式の違いについては、SRT vs VTT vs TTMLの解説をご覧ください。

無料 vs 有料

ほとんどのプラットフォームでは、短いファイルを無料で文字起こしできます。無料プランは通常、ファイル長に上限があり、AI要約は含まれず、エクスポート形式も制限されます。有料プランでは、より長いファイル、一括処理、フルのエクスポートオプション、要約やトピック抽出などのAI機能が解放されます。

料金モデルは利用量によって異なります。定額プラン(ベンダーの公式資料によると、TurboScribeの無制限プランは年払いで月額10ドル)は大量利用のユーザーに向いています。Otter.aiのような会議特化型ツールはシート単位で課金され、年払いの場合は1ユーザーあたり月額8.33ドルから、月1,200分が含まれます。Descriptは文字起こしを動画編集とともにメディア分数としてバンドルしており、年払いで1ユーザーあたり月額16ドルからです。

会議ボットや動画編集ソフトがバンドルされていない、きれいな文字起こしだけが必要なら、ConvertAudioToTextでは、アカウント登録なしでファイルをアップロードして文字起こしを受け取れます。

時間が経つにつれて実際のコストを押し上げる要因の内訳は、文字起こしサービスの隠れたコスト無料 vs 有料の文字起こしをご覧ください。

FAQ

音声文字起こしとは何ですか?

音声文字起こしとは、録音から話し言葉を取り出してテキストに変換するプロセスです。入力は音声または動画ファイルで、出力は選択した形式に応じて、テキスト文書、字幕ファイル、または構造化データファイルになります。

2026年のAI文字起こしの精度はどのくらいですか?

話者が1人で背景ノイズのないクリアな音声では、主要なAIサービスは95〜98%の精度に達します。訛り、話者の重なり、低ビットレートがあるノイズの多い録音では、精度は85〜94%の範囲に下がります。人手による文字起こしは一貫して99%以上ですが、コストも時間もはるかに大きくなります。

逐語文字起こしとクリーン文字起こしの違いは何ですか?

逐語文字起こしは、つなぎ言葉、言い直し、笑い声を含め、発話されたすべての言葉をそのまま記録します。クリーン文字起こしはそれらを取り除き、洗練された読みやすい文書を作ります。法務や調査の場面では通常逐語が求められ、ポッドキャスター、ジャーナリスト、学生の大多数はクリーンを好みます。

話者ダイアリゼーションとは何ですか?

話者ダイアリゼーションとは、録音の中で誰がいつ話したかを特定するプロセスです。音声を声ごとに分割し、各部分に話者タグ(話者1、話者2、またはカスタム名)を付けます。ダイアリゼーションがないと、複数人数の文字起こしはラベルのないテキストのひとかたまりになってしまいます。

どんなファイル形式を文字起こしできますか?

ほとんどの文字起こしサービスは、音声ではMP3、WAV、M4A、FLAC、OGG、AACを、動画ではMP4、MOV、WebM、MKVを受け付けます。動画ファイルは、まず音声トラックを抽出して処理されます。精度を最も左右するのはコンテナ形式ではなく、その音声トラックの品質です。

AIの代わりに人手の文字起こしを使うべきなのはいつですか?

精度が法的または臨床的に求められる場合には人手による文字起こしを使います。裁判所への提出書類、診療記録、放送用キャプション、一字一句正確である必要がある公刊研究などです。会議、ポッドキャスト、インタビュー、講義、コンテンツの再利用であれば、AI文字起こしで十分な精度があり、はるかに速く安価です。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles