音声テキスト変換ソフト

音声テキスト変換ソフト、あてずっぽうなしで

音声・動画ファイルをアップロードするか、録音へのリンクを貼り付けてください。99言語で話者ラベルとタイムスタンプ付きの文字起こしに加え、要約・アクションアイテム・きれいな書き出しが得られます。どのファイルも最初の10分はアカウントなしで無料です。

ファイルをアップロードせずに口述したいですか? ブラウザでライブ音声入力を試す

どのファイルも最初の10分はアカウントなしで無料。無料アカウントは文字起こし10分(1回かぎり)。Proは無制限で、年額換算$9.99/月から。

音声をテキストに変換する手順

  1. 1
    音声を用意するMP3・WAV・M4A・MP4・MOV・WebMのファイルをアップロードするか、録音への公開リンクを貼り付けます。動画からは音声を自動で抽出するので、事前の変換は不要です。
  2. 2
    話されている言語を指定する開始前に言語を選んでください。先に指定しておくと、モデルが推測せずに正しい音の体系に最適化できます。言語違いの文字起こしはほとんどここが原因です。99言語に対応し、出力はその言語本来の文字で行われます。
  3. 3
    読んで、直して、書き出す文字起こしは話者ラベルとタイムスタンプ付きで届きます。閲覧とコピーは無料です。有料プランではTXT・PDF・DOCX・SRT・VTT・JSONでのダウンロードに加え、AI要約・アクションアイテム・決定事項が使えます。

受け取れるもの

録音全体を通して、誰がいつ話したかを分ける話者ラベル
単語単位のタイムスタンプ。該当箇所へ飛べるので、引用は常に検証できます
99言語に対応し、ローマ字表記ではなくその言語本来の文字で出力
インタビュー・ポッドキャスト・講義・会議・研究向けに調整した11種類のAIテンプレート
文字起こしから抽出したアクションアイテム・決定事項・すぐ送れるメール草案。文字起こしと同じ言語で書かれます
本物のエディター。単語を直し、コメントを残し、バージョン履歴を保てます

実測した精度

宣伝用の数字ではなく、自社で測った数値を公開しています。公開データ6ファイル(LibriSpeechのクリーンな音声、OpenSLR 70のナイジェリア訛り英語、AMIコーパスの4人会議)を用いた測定では、本番環境の製品の単語誤り率は平均6.43%でした(測定日:July 24, 2026)。発話が重なる会議音声はクリーンな音声よりはるかに難しく、レポートでは最も成績の悪かったファイルも含め、1ファイルずつ内訳を示しています。

ベンチマーク全文を読む

文字起こしについての利用者の声

How easy it makes working with other tools, it's speed and it's efficiency. The interface is well coded and visually appealing. This is an incredible tool.
David E. · Marketing Manager
Best transcription tool I've ever used. The accuracy is amazing and the turnaround time is incredibly fast. Highly recommend!
Emily K. · Journalist
The multilingual support is what sold me. Transcribes French and Spanish recordings just as well as English.
Sofia G. · Translator

同じエンジンをAPIで

音声認識を自社プロダクトに組み込む場合、DeveloperプランとBusinessプランではREST APIを利用できます。ダッシュボードでキーを作成し、ファイルまたはURLを送信して結果をポーリングすると、タイムスタンプと話者ラベル付きの文字起こしを取得できます。Webhookによる通知はBusinessプランに含まれます。

API対応プランを見る

よくある質問

音声のテキスト化は無料ですか?
どのファイルでも最初の10分はアカウントなしで無料で文字起こしされます。無料アカウントでは文字起こし10分が追加されます(補充ではなく1回かぎりの付与で、1日最大3ファイル・各10分までのペースで使えます)。テキストの閲覧とコピーは無料のままで、ファイルのダウンロードと長さの制限解除は年額換算$9.99/月からの有料プランに含まれます。
音声認識の精度はどれくらいですか?
ツールよりも音声の状態にはるかに左右されます。マイクが近いクリーンな音声では、実測の単語誤り率は約1%です。発話が重なる4人の会議では20%を超えます。単一の数字を挙げるのではなく、精度ベンチマークのページでテストセット全体を公開しています。固有名詞、専門用語、背景雑音に重なった発話は見直しが必要だと考えてください。
どの言語に対応していますか?
99言語に対応し、文字起こしはその言語本来の文字で書かれます。アラビア語はアラビア文字、ヒンディー語はデーヴァナーガリー、日本語はかなと漢字です。アップロード前に言語を選んでください。AI要約とアクションアイテムは英語に翻訳されるのではなく、文字起こしと同じ言語で生成されます。
動画の音声も変換できますか?
はい。MP4・MOV・WebM・MKVをアップロードすれば音声トラックを自動で抽出するので、事前に動画を変換する必要はありません。ファイルをアップロードする代わりに、録音への公開リンクを貼り付けることもできます。
誰が話しているか判別できますか?
はい。すべての文字起こしで話者ダイアライゼーションが動作し、声を分けて「話者1」「話者2」のようにラベル付けします。実名までは分からないため、エディターで一度名前を変更すると、そのラベルが文字起こし全体に反映されます。
そのあと音声はどうなりますか?
無料プランのファイルは7日以内に削除されます。有料プランでは保持期間を選べます(既定は30日、無期限に保持することも可能)。また、どのファイルもいつでも自分で削除できます。

最初の録音をテキストにしましょう

インストール不要、カードも不要。最初の10分は当社が負担します。

文字起こしを始める