
2026年に無料でオンライン音声をテキスト化する方法
Summarize this article with:
2026年でも音声をオンラインで無料テキスト化することは可能ですが、ブラウザベースのツールには必ず上限があります。アップロード制限、月間分数の割り当て、録音ごとの最大時間など、細かい注記に紛れて見落としやすいものばかりです。登録不要で一番速いのは、ファイルをアップロードできて数分でプレーンテキストの書き起こしを返してくれるブラウザベースのツールです。長尺や継続的な作業なら、始める前に各ツールの実際の無料上限を把握しておくことで、文字起こしの途中で有料プランへの誘導に阻まれるストレスを避けられます。
音声ファイルをブラウザベースの文字起こしツールにアップロードすれば、無料で数分以内にプレーンテキストの書き起こしが手に入ります。 デスクトップソフトもAPIキーもサブスクリプションも不要です。ただし落とし穴として、無料のオンラインツールには必ず上限があります。月間分数の上限、録音ごとの制限、ファイルインポートの割り当て——最悪のタイミングで発動しがちなものばかりです。このガイドでは、正直な無料の進め方、各ツールが実際に許容している範囲、そして1円もかけずに最高の精度を得る方法を解説します。
最速の無料ルート:アップロードして文字起こし
ワークフローはブラウザベースのツールすべてで共通です:
ステップ1:音声ファイルを準備する。 まず形式を確認します。ほとんどの無料ツールはMP3、WAV、M4A、FLAC、OGG、AACに対応しています。一般的でない形式の場合は、無料のオーディオコンバーターでMP3に変換してください。精度を左右する最大の要素はどのツールを使うかではなく音声品質そのものなので、背景音が大きい録音はアップロード前に簡単なノイズ除去をしておきましょう。
ステップ2:ファイルをアップロードして言語を選択する。 ツールのページに移動し、ファイルをドラッグして、録音の主要な言語を選びます。わからない場合は、自動検出機能を備えたツールがほとんどです。言語設定は重要です。言語が混在する音声はどんな音声モデルにとっても最も難しいケースの一つなので、一部だけ別の言語が混ざっていても、優勢な言語を設定してください。
ステップ3:処理を待つ。 ブラウザベースのツールはクラウド上でAIモデルを実行します。処理時間はファイルの長さとサーバーの負荷に依存します。10分の録音なら通常1〜3分ほどで結果が返ってきますが、無料プランではピークタイムの待ち行列でそれより長くなることもあります。正確な所要時間を予測する確実な方法はありません。この幅は現実的なものです。
ステップ4:校正してエクスポートする。 完璧な初稿を出力するツールは存在しません。固有名詞、専門用語、音質が落ちた箇所の修正に数分かかることは想定しておきましょう。用途に応じてプレーンテキスト、SRT、VTT形式でダウンロードできます。

「無料」の本当の意味:知っておくべき上限
文字起こしツールのランディングページにある「無料」という言葉には、実質的な制約が隠れていることがよくあります。始める前に確認すべきポイントは以下の通りです。
月間分数の割り当て。 Otter.aiは月300分ですが、1セッション30分の上限と生涯合計3回というファイルインポート制限に達するまでは太っ腹に聞こえます。Nottaは月120分ですが、1録音あたり最大3分という制限があり、短いボイスメモ以上の長さには事実上使えません。
1日あたりの制限。 TurboScribeは異なるアプローチを採っています:1日3回の文字起こし、それぞれ最大30分。つまり1日90分の音声で、日常的な利用には十分すぎることもあります。文字起こしには無料アカウントが必要です。
一回限りのプレビュー。 Happy Scribeの無料版は10分間のトライアルです。品質評価には十分ですが、継続作業には不向きです。エクスポートには透かしが入ります。
登録不要プレビュー+その後の上限。 ConvertAudioToTextはアカウント作成なしで最大10分まで文字起こしできます。このプレビューの後、無料アカウントを作るとさらに10分の文字起こし時間が加算されます。これは毎月補充されるのではなく、登録時に一度だけ付与され、1日3ファイル×各10分で使えます。今すぐ1本の録音を手間なく文字起こししたい場合に適したツールですが、継続的に使える持続的な無料枠ではありません。
完全に無制限のセルフホスト。 OpenAIのWhisperモデルはオープンソースで、ローカルで無料で実行できます。GPUがあればリアルタイムの何倍もの速度で文字起こしでき、CPUでも遅いだけで1分あたりの費用は無料のままです。セットアップにはコマンドライン、Python、FFmpegが必要です。これに抵抗がなければ、文字通り無制限に使えます。
無料文字起こしツール比較表
| ツール | 無料上限 | アカウント要否 | エクスポート形式 | 備考 |
|---|---|---|---|---|
| OpenAI Whisper(セルフホスト) | 無制限 | 不要 | TXT, SRT, VTT, JSON | Python+CLIセットアップが必要。インストール後はオフライン動作 |
| TurboScribe | 1日3ファイル(各最大30分) | 必要(無料アカウント) | TXT, SRT, DOCX | ブラウザ系では最も寛大な無料枠 |
| Otter.ai | 月300分 | 必要 | TXT(無料プラン) | 1セッション30分上限。ファイルインポートは生涯3回まで。英・仏・西のみ |
| Notta | 月120分 | 必要 | TXT | 実質的な制限は1録音3分の上限 |
| ConvertAudioToText | 登録不要プレビュー10分。無料アカウント作成時にさらに10分付与(1回限り) | プレビューは不要 | TXT, SRT, VTT(有料) | 登録なしで即開始。書き起こしのコピーは無料、ファイル出力には有料プランが必要 |
| Happy Scribe | 10分トライアル | 必要 | 透かし付き | プレビューのみ。継続利用には不向き |
| Googleドキュメントの音声入力 | 無制限 | 必要(Googleアカウント) | DOCX | ライブ音声入力のみ。ファイルアップロード不可。インターネット接続必須 |
順序について:WhisperとTurboScribeが上位にあるのは、あらゆるワークフローに最適だからではなく、無料容量が最も大きいからです。
無料プランで精度を上げるコツ
クリーンな単一話者の音声なら、最新のAIモデルで95〜99%の精度に達します。複数話者が重なるノイズの多い録音では、80%を下回ることもあります。精度幅の大部分を決めるのは、選ぶツールではなく音声品質です。
専用マイクを使う。 入門用のUSBマイクでも、ノートPC内蔵マイクより劇的に良い結果が出ます。後で文字起こしする予定のコンテンツを録音するなら、ちゃんとしたマイクへの投資は価値があります。
静かな場所で録音する。 扇風機やエアコンは切りましょう。ソファやカーテンなどの柔らかい家具は残響を吸収します。ソースがクリーンなほど、後の修正は減ります。
自然なペースで話す。 最新のモデルは会話音声で学習されています。不自然にゆっくり話したり、過剰に発音を丁寧にしたりしても効果はなく、書き起こし結果がぎこちなくなることも多いです。
可能なら一度に一人が話す。 複数話者の音声は無料プランが最も苦手とする領域です。録音に複数の話者がいる場合は、話者分離機能を備えたツールを探しましょう。話者分離はしばしば有料プラン限定になっている点に注意してください。無料プランでは全音声が単一話者としてラベルされることがよくあります。
無料文字起こしで十分なケース
最も一般的なユースケースでは、無料文字起こしで十分です:
学生。 講義の録音や調査面接は通常90分未満です。アップロード前に30分ごとに分割すれば、ほとんどの無料プランで問題なく処理できます。書き起こしテキストは検索可能で、聴き直すより早く学習に使えます。
ポッドキャスター。 ショーノート、引用文、エピソード概要に完全な文字起こしは必要ありません。関連する抜粋なら無料枠で処理できます。エピソード全体の文字起こしは音声コンテンツをインデックス可能にすることでSEOに有利ですが、無料上限を継続的に超えるようになったら、音声をテキストに変換するツールのように有料プランでより長いファイルを扱うことになります。
フリーランス。 短いクライアント通話の要約や週1回のミーティングなら、ほとんどの無料の月間割り当てに余裕で収まります。
コンテンツクリエイター。 1本の録音をブログ記事、SNSキャプション、メール下書きに転用する場合、必要なのは音声のごく一部分です。このワークフローは無料文字起こしで十分カバーできます。
無料文字起こしでは足りないケース
無料プランには現実的な限界があります。頻繁に上限に当たるなら、正直なところ、上限管理に費やす時間のほうが有料文字起こしよりも高くつきます。
長尺録音。 30分を超えるファイルは、セグメントを手動で繋ぎ合わせるか、有料プランが必要です。1時間の音声ファイルの場合は、有料処理のほうが格段に手間が少なくなります。
バッチ処理。 複数ファイルをまとめて文字起こしするには、有料の自動化が必要です。従量制と無制限の料金モデルではここが大きく異なり、最適な選択は処理量次第です。
複数話者の録音。 パネルディスカッション、インタビュー、チームミーティングで誰が何を言ったかを特定するには、有料の話者分離が役立ちます。無料プランでは話者ラベル自体が省略されることが多いです。
機密性の高い音声。 プライバシーポリシーはプロバイダーによって異なります。録音に機密情報が含まれる場合は、アップロード前にクラウド型ツールの保持・保存ポリシーを必ず確認してください。音声の保持は様々です。処理後に削除するプロバイダーもあれば、無期限にアーカイブするところ、ユーザーが保持設定を選べるところもあります。思い込みではなく、必ずプロバイダーの現在のポリシーを読んでください。
筆者の見解
2026年に単発の文字起こしで本当に手間ゼロなのは、登録不要のブラウザアップロードです:CATTの10分プレビューは短めの作業に最も実用的です。継続的な無料利用なら、TurboScribeの1日3ファイル制限がブラウザツールの中で最も寛大な構造化された無料枠で、130以上の言語にも対応しています。ターミナル操作に慣れていて静かなマシンがあるなら、セルフホストのWhisperが唯一完全に上限のない選択肢です。
表面上は太っ腹に見えても、隠れた実質的制約を持つツールは少なくありません:Nottaの1録音3分の上限は、月間分数の総量に関係なく、実際のミーティングには事実上使い物になりません。Otterの生涯3回のファイルインポートは、ボットによるライブ録音ではなく既存の録音をアップロードするなら、あっという間に尽きます。始める前に、自分のワークフローにどの制約が効くのか把握しておきましょう。
無料枠では足りなくなったら、文字起こしコストの内訳と無料vs有料の比較が次の一読におすすめです。
よくある質問
無料のオンライン文字起こしは正確ですか?
最新のAI文字起こしは、無料でも有料でも、クリアな単一話者の音声に対して95〜99%の精度に達します。基本となる音声モデルはプラン間で同一であることが多いです。ノイズの多い録音、話者が重なる場面、強い訛り、専門用語では精度が下がり、80%を下回ることもあります。精度幅の大部分を左右するのは価格帯ではなく音声品質です。有料プランではカスタム語彙や音声前処理が追加され、難しい録音で役立つことがありますが、クリーンな音声での差は小さいです。
講義全体を無料で文字起こしできますか?
各ツールの録音あたりの上限によります。TurboScribeは1ファイル最大30分までで、1日3ファイルです。講義がそれより長い場合は、録音を30分ごとのセグメントに分割してそれぞれ文字起こしします。Otter.aiは1セッション最大30分です。60〜90分の講義全体を1つのファイルで文字起こししたい場合は、有料プランかセルフホストのWhisperのほうがすっきりした選択肢になります。
無料の文字起こしツールは私の音声を保存しますか?
保存・保持ポリシーはプロバイダーによって異なり、時間とともに変わります。処理後に音声を削除するサービスもあれば、監査や再処理のために保持するサービス、ユーザー自身が削除を管理できるサービスもあります。機密性の高い録音をアップロードする前に、必ずそのツールの最新のプライバシーポリシーを確認してください。ポリシーに関する判断を第三者の要約に頼らないでください。
無料文字起こしで使える音声フォーマットは?
ブラウザベースの無料ツールのほとんどはMP3、WAV、M4A、FLAC、OGG、AACに対応しています。多くはMP4やMOVなどの動画フォーマットも受け付け、音声トラックを自動的に抽出します。WMA対応はまちまちです。迷ったらまずMP3に変換しましょう。
無料の文字起こしは英語以外の言語に対応していますか?
はい、ほとんどのツールが複数言語に対応していますが、対応言語の充実度はプランによって異なります。TurboScribeの無料版は130以上の言語に対応。ConvertAudioToTextは自動検出付きで99以上の言語に対応しています。Otter.aiの無料プランは英語、フランス語、スペイン語のみ。Nottaの無料プランは30以上の言語ライブラリ全体を含みますが、1録音3分の上限があります。Googleドキュメントの音声入力は100以上の言語に対応していますが、ライブ音声入力専用で、ファイルアップロードはできません。
出典
- Otter.ai無料プランの詳細:https://tldv.io/blog/otter-pricing/(2026年7月確認)
- Notta無料プランの詳細:https://tldv.io/blog/notta-ai-review/(2026年7月確認)
- TurboScribeのプラン概要:https://thetoolsverse.com/tools/turboscribe(2026年7月確認)
- Happy Scribeの無料枠:https://help.happyscribe.com/en/articles/6906232-plans-and-pricing(2026年7月確認)
- Googleドキュメントの音声入力の制限:https://support.google.com/docs/answer/4492226(2026年7月確認)
- AI文字起こし精度ベンチマーク:https://www.plainscribe.com/blog/transcription-accuracy-benchmark-2026(2026年7月確認)
- ConvertAudioToTextの無料枠と言語数:https://convertaudiototext.com/(2026年7月確認)
- OpenAI Whisperセルフホスト概要:https://www.digitalapplied.com/blog/local-speech-to-text-whisper-self-hosted-transcription-2026(2026年7月確認)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.