
音声入力で文字起こし:あらゆるデバイスで音声をテキストに変換する方法
Summarize this article with:
音声をテキストに変換する技術は今や非常に信頼性が高くなり、何百万人もの人々が日常的に、意識すらせずに使っています。運転中にテキストメッセージを音声で入力したり、歩きながらスマホにメモを吹き込んだり、音声コマンドでウェブ検索をしたり。しかし、こうしたちょっとした用途を超えて、音声入力は本格的な生産性ツールにもなります。メールの作成、文書の下書き、録音の文字起こし、コンテンツ制作など、活用の幅は広いのです。
現在、主要なデバイスとOSのすべてに音声入力機能が標準搭載されており、ブラウザベースのAIツールの精度はプロの人力文字起こしに匹敵するレベルにまで達しています。本ガイドでは、iPhone、Android、Windows、Mac、ブラウザという、あなたが使う可能性のあるすべてのプラットフォームで音声をテキストに変換する方法を解説します。
音声テキスト変換の仕組み
デバイス別の手順に入る前に、音声テキスト変換には根本的に異なる2つのタイプがあることを理解しておくと役立ちます。
リアルタイム音声入力(ディクテーション)
キーボードのマイクアイコンをタップして話し始めたときに起こるのがこれです。デバイスが話した内容をリアルタイムでテキストに変換します。次のような用途に最適です。
- メッセージ、メール、メモの作成
- フォームや検索ボックスへの入力
- タイピングできない状況でのハンズフリー文字入力
リアルタイム音声入力はすべての最新デバイスに標準搭載されており、新しいOSではオフラインでも動作します。
音声ファイルの文字起こし
こちらは、録音済みの音声ファイル(ボイスメモ、ポッドキャスト、インタビュー、会議の録音)を後からテキストに変換したい場合です。これには音声入力とは別のツール、通常は音声ファイルを処理してテキストの文字起こしを返すAI文字起こしサービスが必要です。
本ガイドでは両方のタイプを扱います。
iPhoneで音声をテキストに変換する
iPhoneの音声入力機能は成熟しており、iOSのリリースごとに大きく進化してきました。
音声入力(リアルタイムのボイスタイピング)
有効にする方法:
- 設定 から 一般、キーボード の順に開きます。
- 音声入力 をオンにします。
- 音声入力の言語を選択します。
使い方:
- 文字入力ができる任意のアプリ(メッセージ、メモ、メールなど)を開きます。
- キーボードの マイクアイコン をタップします。
- 話し始めます。話した言葉がリアルタイムでテキストとして表示されます。
- もう一度マイクアイコンをタップすると音声入力が終了します。
iPhoneの音声入力のコツ:
- 句読点は声に出して言います。「こんにちは 読点 お元気ですか 疑問符」と言うと「こんにちは、お元気ですか?」となります。
- 「改行」や「改段落」と言えば改行が入ります。
- iOS 17以降では音声入力とタイピングを同時に行えます。音声入力中もキーボードが表示されたままなので、中断せずに修正できます。
- デバイスのメイン言語であればオフラインでも音声入力が使えます(iOS 16以降)。つまり機内モードでも動作し、音声がAppleのサーバーに送信されることもありません。
制限事項:
- 音声入力には時間制限があります(ほとんどのアプリで1セッションあたり約60秒。ただし最近のiOSバージョンでは延長されています)。
- 強いなまり、背景ノイズ、専門用語があると精度が低下します。
- 録音済み音声の長時間の文字起こしには適していません。
iPhoneで音声ファイルを文字起こしする
録音済みの音声(ボイスメモ、インタビュー、講義)をテキストに変換するには:
- 標準機能(iOS 18以降): メモアプリとボイスメモアプリに文字起こし機能が搭載されました。ボイスメモで録音すると、文字起こしが自動的に生成されます。
- ブラウザ利用: Safariを開いて音声テキスト変換にアクセスします。音声ファイルをアップロードすれば、数分で文字起こしが得られます。スマホ内のどんな音声ファイルにも対応します。
Androidで音声をテキストに変換する
Androidは初期の頃から音声認識を提供しており、Googleの音声技術は世界トップクラスです。
音声入力(Google音声入力)
有効にする方法:
- 設定 から システム、言語と入力、画面キーボード の順に開きます。
- Gboard(Googleキーボード)がデフォルトのキーボードとして選択されていることを確認します。
- Gboardでは音声入力がデフォルトで有効になっています。
使い方:
- 任意のテキスト入力欄を開きます。
- Gboardキーボードの マイクアイコン をタップします。
- 話し始めます。テキストがリアルタイムで表示されます。
- もう一度マイクをタップするか、自動停止を待ちます。
Androidの音声入力のコツ:
- Googleの音声認識は英語に対して非常に高精度で、100以上の言語に対応しています。
- 句読点は自然に発声します。「ピリオド」「カンマ」「感嘆符」「疑問符」など。
- 「改行」「改段落」で書式を整えられます。
- Pixelスマートフォン(および一部のSamsungデバイス)では、言語パックをダウンロードすれば完全オフラインで音声入力が動作します。
Googleレコーダーアプリ
Googleレコーダーアプリ(Pixelスマートフォンにプリインストール、他のAndroidデバイスでも利用可能)は、あらゆるプラットフォームを通じて最高クラスの無料文字起こしツールの1つです。
機能:
- 録音と同時にリアルタイムの文字起こしを生成。
- 音声の再生に合わせて文字起こし内の単語をハイライト表示。
- 文字起こし内のテキスト検索が可能。
- オフラインで動作。
- 音声ファイルをインポートして文字起こしすることも可能。
講義や会議の文字起こしに使う手順:
- Googleレコーダーを開きます。
- 録音ボタンをタップして録音を開始します。
- 文字起こしがリアルタイムで表示されるのを確認します。
- 終わったら録音を保存します。音声と文字起こしの両方が保存されます。
- 文字起こしをテキストとして共有またはエクスポートします。
Androidで音声ファイルを文字起こしする
Googleレコーダーで録音していないファイルについては、Chromeを開いて音声テキスト変換を使えば、ブラウザ上で直接アップロードして文字起こしできます。
Windowsで音声をテキストに変換する
Windowsには、標準の音声入力から強力なAI文字起こしまで、複数の選択肢があります。
音声入力(Windows 11)
Windows 11には、システム全体で使える音声入力機能が標準搭載されています。
起動方法:
- Windowsキー + H を押して音声入力を開きます。
- 画面上部に小さなマイクのオーバーレイが表示されます。
- 話し始めます。カーソルのある位置にテキストが入力されます。
- もう一度 Windowsキー + H を押すか、マイクをクリックすると停止します。
設定とカスタマイズ:
- 音声入力ツールバーの歯車アイコンをクリックすると設定にアクセスできます。
- 自動句読点 を有効にすると、Windowsがピリオド、カンマ、疑問符を自動的に追加します。
- 音声入力はあらゆるアプリケーションで動作します。Word、メモ帳、メール、ブラウザのテキスト欄などで使えます。
コツ:
- 最良の結果を得るには、ノートPC内蔵マイクではなくヘッドセットや専用マイクを使いましょう。
- 音声入力は複数言語に対応しています。Windowsの設定の 時刻と言語 で入力言語を変更できます。
- 「それを削除」「すべて選択」「最後に移動」などの音声コマンドで、キーボードに触れずに編集できます。
Windows音声認識(レガシー)
従来のWindows音声認識機能(設定 > アクセシビリティ > 音声認識)は、テキスト入力だけでなくOS全体をより包括的に音声操作できます。アプリを開いたり、ボタンをクリックしたり、メニューを音声で操作したりできます。ただし、純粋な音声入力としては、新しい音声入力(Win+H)の方が高速で高精度です。
Windowsで音声ファイルを文字起こしする
Windowsで録音済み音声ファイルを文字起こしするには:
- Microsoft Word(Microsoft 365): Wordのトランスクリプト機能(ホーム > ディクテーション > トランスクリプト)は、アップロードした音声ファイルを処理し、話者ラベル付きの文字起こしを生成できます。Microsoft 365のサブスクリプションが必要です。
- ブラウザベースのツール: 任意のブラウザで音声テキスト変換にアクセスすれば、ソフトをインストールせずに音声ファイルを文字起こしできます。
Macで音声をテキストに変換する
macOSにはすべてのアプリケーションで使える音声入力が標準搭載されており、音声ファイルの文字起こしにはブラウザベースのツールも利用できます。
音声入力(macOS)
有効にする方法:
- システム設定(古いmacOSバージョンではシステム環境設定)を開きます。
- キーボード に進みます。
- 下にスクロールして 音声入力 をオンにします。
- 言語とショートカットキー(デフォルトはFnキーを2回押す)を選択します。
使い方:
- 任意のテキスト欄にカーソルを置きます。
- Fnキーを2回(または設定したショートカットを)押します。
- マイクのインジケーターが表示されます。話し始めましょう。
- もう一度Fnを押すか、完了をクリックすると音声入力が終了します。
Macの音声入力のコツ:
- Apple SiliconのMac(M1以降)では、対応言語の音声入力はデバイス上で処理されます。つまりオフラインでも動作し、音声がAppleのサーバーに送信されません。
- 新しいmacOSバージョンでは音声入力を長時間続けられます(従来の60秒制限は撤廃されました)。
- 標準的な句読点コマンドが使えます。「ピリオド」「カンマ」「改段落」「感嘆符」など。
- 音声入力しながらキーボードやトラックパッドも同時に使えます。音声入力中でも他の入力方法がロックされることはありません。
Macで音声ファイルを文字起こしする
- 標準機能: macOSには音声ファイルをネイティブに文字起こしする機能はありません(音声入力はリアルタイムのみ)。
- ブラウザ利用: SafariまたはChromeで音声テキスト変換にアクセスし、録音ファイルをアップロードして文字起こしできます。
- ローカルツール: オープンソースのWhisperモデルはMac上でローカル実行できます。MacWhisperは、Whisperモデルを使いやすいインターフェースで提供する人気のMacネイティブアプリです。
ブラウザで音声をテキストに変換する
ブラウザベースの音声テキスト変換ツールは、ウェブブラウザとインターネット接続があればどんなデバイスでも動作します。プラットフォームを問わず、インストール不要で、多くの場合最も柔軟な選択肢です。
リアルタイム録音と文字起こしには
オンラインボイスレコーダーを使えば、ブラウザ上で直接音声を録音し、そのまま文字起こしできます。アプリのインストールは不要です。次のような場合に便利です。
- ソフトをインストールできない共用PCや職場のPCを使っている場合
- シンプルな「録音して文字起こし」のワークフローが欲しい場合
- Chromebookなど、ネイティブアプリのサポートが限られたデバイスを使っている場合
既存の音声ファイルの文字起こしには
音声テキスト変換とオーディオテキスト変換は、あらゆる形式の音声ファイルのアップロードに対応し、高精度な文字起こしを返します。これらのツールは高度なAIモデルを使用しており、特に次のような場合、デバイス標準の音声入力よりも高い精度を発揮します。
- 長時間の録音(講義、インタビュー、会議)
- 背景ノイズのある音声
- 複数の話者がいる場合
- 専門用語が多い場合
Google Docsの音声入力
Google Docsには音声入力機能が組み込まれています。
- Googleドキュメントを開きます。
- ツール から 音声入力 を選択します(またはCtrl+Shift+S / Cmd+Shift+Sを押します)。
- マイクアイコンをクリックして話し始めます。
ドキュメントに直接音声入力できる優れた無料の選択肢ですが、Chromeブラウザとインターネット接続が必要です。
適切な方法の選び方
簡単な判断ガイドを示します。
標準の音声入力を使うべき場合:
- メッセージ、メール、短いメモを入力するとき
- 話しながらリアルタイムでテキストが欲しいとき
- 音声の録音データが不要なとき
- 内容が会話的で、専門性が高くないとき
音声ファイルの文字起こしを使うべき場合:
- 録音済みのファイル(講義、会議、インタビュー、ポッドキャスト)があるとき
- 録音が数分を超える長さのとき
- 話者ラベル付きの高精度な結果が必要なとき
- 文字起こしを編集、検索、共有したいとき
専用の録音アプリを使うべき場合:
- 音声の録音と文字起こしの両方が欲しいとき
- 画面を見られない環境で録音する必要があるとき
- 録音中にリアルタイムで文字起こしを確認したいとき
音声テキスト変換の精度を上げるには
どのデバイスやツールを使うにせよ、次の習慣で精度が向上します。
はっきり話す
これは、不自然なほどゆっくり、あるいは大声で話すという意味ではありません。次のことを意味します。
- もごもご話さず、単語を最後まではっきり発音する
- 文末で声が小さくならないようにする
- 文と文の間に短い間を置き、アルゴリズムが正しく区切れるようにする
背景ノイズを減らす
騒がしい環境では音声認識の精度が大きく低下します。最新のノイズキャンセリングアルゴリズムでも、騒がしいカフェや工事の音を完全には補正できません。可能な限り静かな部屋を使うか、口元に近いマイク(内蔵マイク付きイヤホンなど)を使って、自分の声を拾い周囲の音を遮断しましょう。
良いマイクを使う
音声入力を日常的に使うなら、ベーシックな外付けマイクへの投資でも精度面で大きな見返りがあります。$20のUSBマイクでも、音声入力においてはどんなノートPCの内蔵マイクより優れています。
自分の語彙を学習させる
一部のプラットフォームでは、カスタムの単語やフレーズを追加できます。専門用語(医療用語、法律用語、製品名など)を日常的に使うなら、デバイスの辞書や文字起こしツールのカスタム語彙に追加することで認識精度が向上します。
プライバシーに関する注意点
音声テキスト変換を使う際は、音声データの行き先に注意しましょう。
- デバイス上での処理(新しいiPhone、Apple SiliconのMac、Pixelスマートフォン、Windows 11で利用可能)では、音声はデバイス内に留まります。クラウドには何も送信されません。
- クラウドベースの処理 では、音声がリモートサーバーに送信されて文字起こしされます。ほとんどのブラウザベースのツールや古いデバイスの音声入力機能がこれに該当します。
- 機密性の高い音声(医療記録、法的手続き、機密のビジネス会議)をアップロードする前に、サードパーティの文字起こしツールのプライバシーポリシーを確認しましょう。
よくある質問
最も精度の高い音声テキスト変換の方法は?
リアルタイムの音声入力では、Appleのデバイス上音声入力(iPhoneおよびApple SiliconのMac)とGoogleの音声入力がいずれも優秀で、クリアな英語の発話に対して95%を超える精度を達成しています。録音済み音声ファイルの文字起こしでは、音声テキスト変換のようなAIツールが通常最も高い精度を発揮します。音声を複数回処理でき、スマートフォン上で動くものより大規模なモデルを使えるためです。
音声テキスト変換はオフラインで使える?
はい、ほとんどの最新デバイスで使えます。iPhone(iOS 16以降)、Apple SiliconのMac、Pixelスマートフォン、Windows 11はいずれも、主要言語のオフライン音声入力に対応しています。オフラインモードでは小規模なモデルを使うため、クラウド処理よりも精度がわずかに低くなる場合があります。音声ファイルの文字起こしツールは、一般的にインターネット接続が必要です。
音声入力で句読点を入れるには?
句読点を声に出して言います。主要な音声入力システムはすべて次を認識します。「ピリオド」(.)、「カンマ」(,)、「疑問符」(?)、「感嘆符」(!)、「コロン」(:)、「セミコロン」(;)、「引用開始」/「引用終了」(" ")、「改行」、「改段落」。多くのシステムは「ダッシュ」「ハイフン」「三点リーダー」にも対応しています。
音声テキスト変換はプロの執筆に使えるレベル?
音声テキスト変換は初稿作成のツールとして非常に優れています。多くのプロのライター、ジャーナリスト、コンテンツクリエイターが初稿を音声で口述し、その後画面上で編集しています。重要なのは、音声入力を完成品を作るツールではなく、下書きツールとして扱うことです。自由に口述してから、明瞭さ、構成、正確さの観点で編集しましょう。プロ向けの録音(インタビュー、会議、口述メモ)の文字起こしについては、AI文字起こしツールが、最小限の手直しで編集に取りかかれるレベルの出力を生成します。
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
Focus Group Transcription for UX Researchers: Turn Multi-Speaker Audio Into Usable Evidence
A practical guide to focus group transcription for UX and insights teams. See how CATT handles speaker labels, timestamps, AI summaries, and clean export.
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.