
2026年版 音声をテキストに変換する方法:4つの手法を徹底比較
Summarize this article with:
2026年現在、音声をテキストに変換する道は4つあります。自分でタイピングする(最も遅い)、音声入力で読み上げ直す、WhisperのようなローカルAIモデルを実行する、あるいはオンラインツールや人間によるサービスにアップロードする。ほとんどの録音では、オンラインAIツールが最も速くて安価な出発点になります。手動と人間によるサービスは、一語一句の正確さが求められる機密性の高いコンテンツや法的に重要なコンテンツでは依然として有利です。
音声をテキストに変換するには、4つの異なる道があります。自分でタイピングする、音声入力で読み上げ直す、自分のマシンでローカルAIモデルを実行する、あるいはオンラインツールまたは人間によるサービスにアップロードする。どれを使うべきかは、録音の長さ、求める精度、プライバシー要件、予算によって変わります。
方法1:手動文字起こし
手動文字起こしは、他のすべての方法が測定基準とする原点です。 聞いて、打つ。ソフトウェア費用なし、プライバシーの心配なし、書式は完全に自由。
手順はシンプルです:
- 再生速度調整に対応したメディアプレーヤーで音声を開きます(たとえばVLCは再生を0.75倍速に落とせます)。
- その横でテキストエディターを開きます。
- 5〜10秒ずつ聞いて、一時停止し、聞こえた内容をタイプします。
- 聞き取りに自信のない単語があれば、巻き戻します。
- 最後まで到達したら、全体を通して校正します。
正直なところ、コストは時間です。業界データによれば、経験豊富なタイパーでも音声1時間につき4〜6時間のタイピングが必要で、初心者ならさらに長くかかります。30分のインタビューなら、午後の2〜3時間が消えます。手動文字起こしが合理的なのは、音声を第三者に送れない短い機密性の高い録音で、一語一句正確であることが求められる場合です。
方法2:音声入力(ディクテーション)
音声入力は文字起こしとは別物です。 録音を聞きながらタイプするのではなく、音声をマイクに向かって読み上げ直し、音声認識エンジンがそれをリアルタイムで書き取ります。結果として、どこにもファイルをアップロードせずに文字起こしが得られます。
Googleドキュメントの音声入力(ツールメニュー、無料)は、明瞭な発話ならうまく処理でき、およそ90〜95%の精度に達します。Appleの音声入力はmacOSとiOSでシステム全体で機能します。WindowsにもWin+Hで使える内蔵の音声入力があります。Dragon NaturallySpeaking Professional Individualは約699ドルで今も入手可能で、より高い精度を必要とする医療・法務の専門家向けですが、一般向けのDragon Homeエディションは販売終了しました。
音声入力が最も活きるのは、短い台本を読み返すときや、記憶をもとに何かをナレーションするときです。録画済みのインタビューの場合、スピーカーから音声を流しながら一緒に読み上げることになり、すぐに気まずくなります。ライブのナレーションやメモ取りには、堅実なゼロコストの選択肢です。
方法3:ローカルAI文字起こし(セルフホスト)
自分のハードウェアでOpenAI Whisperを実行するのは、無料で、プライベートで、驚くほど正確です。 公開されているベンチマークによれば、large-v3モデルはクリーンな英語音声でおよそ2.7%の単語誤り率、ノイズや多彩な訛りを含む実世界の録音では8〜12%前後を記録しています。これはほとんどの商用AIサービスと同等の水準です。
代償となるのはセットアップの手間です。Python、数ギガバイトのディスク容量、依存関係のインストールに耐える忍耐が必要です。最新のGPUは処理時間を劇的に短縮します。性能の良いコンシューマーGPUなら、Whisperは1時間の音声を数分で処理します。CPUのみでは、リアルタイム並みかそれ以上の時間を見込んでください。
この道は開発者、研究者、そしてデータを自分のマシンから外に出せない人に向いています。それ以外の人にとっては、オンラインツールがほぼ同等の精度で30秒で使い始められる以上、セットアップコストを払う価値はありません。
方法4:オンライン文字起こしツール
AI搭載型も人間スタッフ型も、オンラインツールはあなたが別のことをしている間に裏側で重い処理を担ってくれます。 2026年の大多数のユースケースにおいて、これが正しい選択です。
AI搭載のオンラインツール
ファイルをアップロードする(またはURLを貼り付ける)と、サービスがクラウドで処理し、数分で文字起こしが手に入ります。クリアな音声での精度は、主要エンジン全体で90〜96%です。ほとんどのツールは数十の言語と、TXT、SRT、VTTといった一般的なエクスポート形式に対応しています。
ほとんどのサービスに無料枠がありますが、月間利用量に上限があります。月に数時間を超える処理が必要なら、有料サブスクリプションか従量課金が妥当です。主要ツールが実際にいくら請求するのかを並べた内訳は、文字起こし料金比較をご覧ください。
人間による文字起こしサービス
99%以上の精度が求められる録音には、Rev、GoTranscript、TranscribeMeが訓練を受けた人間の文字起こし担当者を擁し、一語一句見直します。支払額の目安は以下の通りです:
- TranscribeMe: 音声1分あたり0.79ドルから(初稿を人間が編集、精度は約95〜98%、営業日1日で納品)
- Rev: 人間による文字起こしは音声1分あたり1.99ドルから。AI限定プランはサブスクリプションでさらに低価格から
- GoTranscript: 分単位の料金は納期と分量によって変動。実際の見積もりは公式の料金計算ツールで直接確認を
特急納品、逐語スタイル、複数話者は料金を押し上げます。大量の案件には、多くのサービスがボリューム割引を用意しています。

4つの方法の比較
| 方法 | 速度 | 典型的な費用 | 精度 | 向いている用途 |
|---|---|---|---|---|
| 手動タイピング | 非常に遅い(実時間の4〜6倍) | 無料(自分の時間) | 非常に高い | 短く機密性の高い録音 |
| 音声入力 | リアルタイム(1倍) | 無料〜699ドル(Dragon) | 高い(90〜95%) | ライブナレーション、短い読み返し |
| ローカルAI(Whisper) | GPUなら高速、CPUでは低速 | 無料 | 高い(90〜95%) | プライバシー重視、技術志向のユーザー |
| オンラインAIツール | 非常に速い(数分) | 無料枠〜低額サブスク | 高い(90〜96%) | ほとんどの日常的なユースケース |
| 人間によるサービス | 遅い(12時間〜5日) | 0.79〜2.00ドル/分 | 非常に高い(99%以上) | 法務、医療、逐語記録 |
ステップバイステップ:オンラインAIツールへのアップロード
このウォークスルーではConvertAudioToTextの音声文字起こしツールを使用しますが、手順は類似のオンラインサービスにもほぼそのまま当てはまります。
ステップ1:ファイルを準備する。 話者が1人で背景ノイズが少ないクリアな音声は、必ずよりきれいな文字起こしを生みます。録音に大きなノイズがある場合は、先にノイズ除去ツールに通しましょう。対応フォーマットはMP3、WAV、M4A、FLAC、OGGをはじめ、その他の一般的な音声形式のほとんどです。動画ファイルも扱えます。ツールが音声トラックを自動的に抽出します。
ステップ2:アップロードまたはURLを貼り付け。 ファイルをアップロードエリアにドラッグするか、クリックして選択します。開始にアカウントは不要なので、登録するかどうか決める前に実際のファイルで試せます。ファイルの処理はすぐに始まります。
ステップ3:言語を選択。 録音で話されている言語を選びます。ツールは自動検出を含む99以上の言語に対応しているので、わからない場合は推測せず自動検出に任せましょう。
ステップ4:文字起こしを開始。 クリックして開始します。30分未満のファイルは通常2分以内に文字起こしが返ってきます。それより長いファイルは比例して時間がかかりますが、放置して待てます。
ステップ5:確認と編集。 出力を読み通して誤りを修正します。特に固有名詞、ブランド名、AIが聞き違えやすい専門用語に注意を。音質が落ちている箇所には念入りに目を通しましょう。
ステップ6:エクスポート。 必要な形式でダウンロードします。コピーペースト用のプレーンTXT、字幕用のSRTまたはVTT、有料プランではDOCX/PDF。字幕制作では、SRT・VTT・TTML形式の比較ガイドを参考に適切な形式を選びましょう。
会議ボットや連携機能を必要とせず、きれいな文字起こしだけが欲しいなら、ConvertAudioToTextはアカウント登録なしで対応します。無料ユーザーは登録時に1回限りの文字起こし10分が付与され、ProおよびBusinessプランで上限が撤廃されます。
方法を問わず結果を良くするためのコツ
入手できる最高の音声から始める。 話者の口元から15〜30cmの距離に置いた専用マイクは、どのソフトウェア選択よりも大きな差を生みます。背景ノイズ、硬い表面からの残響、低い録音レベルは、どの方法でも精度を下げます。
明瞭な発話を促す。 インタビューや会議を録音し、文字起こしすると分かっているなら、事前に話者へ伝えておきましょう。適度なペースで話す、発言を重ねない、文と文の間で区切る。このひとつの準備だけで、AIの精度は意味のあるレベルで向上します。
コンテンツの種類に合った道具を選ぶ。 複数話者の会議文字起こしには、話者ダイアリゼーション対応のツールが単語を話者ごとに自動で振り分け、編集時間を大幅に節約します。ポッドキャストやインタビューの作業では、バッチアップローダーがリアルタイムの音声入力ツールを上回ります。インタビュー固有のアドバイスは、インタビュー録音の文字起こし方法のガイドをご覧ください。
必ず校正する。 エラーのない方法は存在しません。公開、共有、引用の前に、校正の工程をワークフローに組み込みましょう。
主なユースケース
ポッドキャスターとコンテンツ制作者。 テキストの文字起こしがあれば、検索エンジンがあなたの発言をインデックスできます。各エピソードとともに全文の文字起こしを公開すると、そのエピソードが扱うトピックで上位表示されやすくなります。文字起こしは追加の労力を最小限に抑えつつ、ブログ記事、SNS投稿、メールニュースレターへの転用も可能です。そのワークフローに合わせたツールのおすすめは、2026年のポッドキャストに最適な文字起こしをご覧ください。
学生と研究者。 講義やインタビューの録音は、文字起こしされれば検索可能な学習教材になります。ここでAIツールが好都合なのは、学生は多くの場合、限られた予算で何時間もの音声を素早く処理する必要があるからです。
ビジネスパーソン。 会議の文字起こしは、決定事項、アクションアイテム、文脈を検索できる記録として残します。チーム全員が後から文字起こしを検索でき、一人の手書きメモに頼らずに済みます。定例会議については、音声から議事録を作成する方法をご覧ください。
ジャーナリストとライター。 インタビューの全文文字起こしがあれば、正確な引用を抜き出し、発言源を発言した瞬間まで遡って確認するのが簡単になります。公開する引用に求められる精度を満たすには、AI出力の丁寧な校正か、録音が雑音だらけの場合は人間によるサービスが妥当です。
よくある質問
2026年のAI音声文字起こしの精度はどのくらいですか?
最新のAI文字起こしは、クリアな話者1人の音声に対して90〜96%の精度に達します。背景ノイズ、強い訛り、話者の重なり、専門用語の多さがあると精度は低下します。日常の録音、議事録メモ、ポッドキャストの文字起こしなら、この精度でも簡単な校正を挟めば十分使えます。同じ素材であれば、プロの人間の文字起こし担当者は一貫して99%を上回ります。
無料で音声をテキストに変換できますか?
はい。複数のオンラインツールが短いファイル向けの無料枠を提供しています。ConvertAudioToTextは登録時に10分の無料文字起こし時間を付与します(毎月ではなく1回限り、クレジットカード不要)。Googleドキュメントの音声入力はライブディクテーションとして無料で使えます。OpenAI Whisperをローカルで実行するのも、技術的な環境があれば無料です。手動文字起こしに必要なのは自分の時間だけです。
文字起こしできる音声フォーマットは何ですか?
ほとんどのオンラインツールはMP3、WAV、M4A、FLAC、OGG、WMA、AACに対応しています。MP4、MOV、WebMなどの動画フォーマットも受け付け、音声トラックを自動的に抽出できるものも多くあります。ファイルサイズの上限は各ツールのドキュメントで確認してください。無料枠に上限を設けているサービスもあります。
1時間の音声の文字起こしにはどれくらい時間がかかりますか?
AI文字起こしなら、1時間の音声は通常2〜5分で処理されます。手動文字起こしは経験豊富なタイパーでも平均4〜6時間かかり、初心者ならさらに長くなります。人間による文字起こしサービスは、標準納期で12〜24時間以内に納品されるのが一般的で、特急オプションは割増料金になります。
人間による文字起こしに費用を払う価値があるのはどんなときですか?
精度が法的にも職業的にも譲れない場合、たとえば供述調書、医療のディクテーション、逐語的な法廷記録などでは、人間による文字起こしのコストに見合う価値があります。また、音質が非常に悪い場合、複数の話者が頻繁に重なる場合、専門用語が多すぎてAIエンジンが体系的な誤りを犯すような場合にも有効です。費用はサービスと納期によって異なりますが、おおむね音声1分あたり0.79〜2.00ドルを見込んでおきましょう。
音声をどこにもアップロードせずにローカルで文字起こしできますか?
はい。OpenAI Whisperはオープンソースで、完全に自分のマシン上で実行できます。large-v3モデルはクリアな英語音声でおよそ95%の精度を達成します。GPUがあれば処理は大幅に速くなりますが、CPUでも実行可能です(ただし速度は遅くなります)。この方法は、プライバシー要件のため音声をクラウドサービスに送れない人に向いています。
出典
- Revの料金(2026-07-02確認):https://www.rev.com/pricing
- TranscribeMeの料金(2026-07-02確認):https://www.transcribeme.com/transcription-services/
- GoTranscriptの料金(2026-07-02確認):https://gotranscript.com/pricing-and-cost-estimate
- ConvertAudioToTextの音声ツール(2026-07-02確認):https://convertaudiototext.com/tools/audio-to-text
- WhisperのWERベンチマーク:https://vexascribe.com/how-accurate-is-whisper
- 手動文字起こしの所要時間データ:https://www.rev.com/resources/how-long-does-it-take-to-transcribe-audio-video
- Dragon一般向け版の販売終了と音声入力の代替手段:https://usevoicy.com/blog/best-dictation-software-2026
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.