WMAをテキストに変換する方法:古いWindows音声ファイルの救出
文字起こし音声WMA

WMAをテキストに変換する方法:古いWindows音声ファイルの救出

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

古いオリンパスのレコーダー、Windowsサウンドレコーダー、アーカイブされたインタビュー由来のWMA(Windows Media Audio)ファイルは、この形式を受け付ける最新のAIツールでそのまま文字起こしできるほか、ffmpegコマンド1行で先にMP3へ変換してから処理することもできます。唯一の絶対的な障害はDRMです。すでに閉鎖したMicrosoftのストアで購入したWMA音楽ファイルには暗号化がかかっており、ライセンスサーバーが2017年に停止したため、もはや復号できません。ボイスレコーダーや口述録音のWMAファイルがDRM保護されていることはまずないため、ほとんどの救出作業は問題なく完了します。

古いレコーダー、Windowsサウンドレコーダー、アーカイブ済みインタビュー由来のWMAファイルの大半は、今日でも問題なく文字起こしできます。 この形式を受け付けるツールにアップロードするか、ffmpegコマンド1行で先にMP3へ変換してください。ただ一つ、絶対に越えられない壁があります。閉鎖した音楽ストア由来のDRM保護付きWMAファイルは、Microsoftのライセンスサーバーが2017年に停止したため、永久にロックされたままです。

DRM保護されていないWMAは、他の音声ファイルと同じようにアップロードして文字起こしできます
DRM保護されていないWMAは、他の音声ファイルと同じようにアップロードして文字起こしできます

WMAファイルは実際どこから来るのか

WMA(Windows Media Audio)は2000年から2012年にかけて最盛期を迎えました。2026年の今これをお持ちなら、その出所はごく限られたいくつかのいずれかである可能性が極めて高いです:

  • オリンパス、ソニー、三洋電機製のデジタルボイスレコーダー。オリンパスは2000年代のかなり後まで、初期設定がWMA Standardのレコーダーを出荷し続け、32〜64 kbpsモノラルのファイルを生成していました。
  • Windowsサウンドレコーダー。VistaとWindows 7は、デフォルトで96 kbpsのWMA 9.2として録音を保存しました。UIには他の選択肢がありませんでした。
  • デフォルト設定のWindows Media PlayerでCDからリッピングした楽曲。デフォルトではMP3ではなくWMAで書き出されました。
  • Windows Media Encoderを使用していたWindowsベースの企業システムによる会議通話や講義の録音。

この形式は2012年以降急激に衰退しました。iOSとAndroidはAAC/M4Aで標準化され、今日、主要な録音アプリでWMAを出力するものはありません。あなたが持っているのはレガシー資産であり、問いは常に「ここからテキストを取り出せるか?」です。

4つのWMAコーデックと、文字起こしにとっての意味

.wmaという拡張子は、MicrosoftのASF(Advanced Systems Format)コンテナに格納された4つの異なるコーデックを指します。それぞれの挙動はまったく異なります。

WMA StandardはWMAファイルの90%を占めます。MP3と直接競合し、32〜192 kbpsで動作する心理音響圧縮方式です。文字起こしツールは問題なく処理できます。ボイスレコーダーがWMAを作っていたなら、これを作っていました。

WMA Proは高解像度マルチチャンネルオーディオ向けです。最大8チャンネル、24ビット深度、96 kHzサンプリング。ボイスレコーダーでこれに出会うことはありません。主に市販DVDのリリースで使われました。文字起こしツールが対応しているとは限らず、拒否されたら先にMP3へ変換してください。

WMA LosslessはMicrosoft版FLACに相当します。音声録音では非常にまれで、CDリッピングに時折見られます。可逆圧縮なので音声内容は完全ですが、ファイルサイズは大きくなります(470〜940 kbps相当)。WMA Standardを処理できる文字起こしツールなら、Losslessも処理できるはずです。

WMA Voiceは一風変わった存在です。CELP系の音声特化コーデックで、最大20 kbpsのビットレート、モノラル専用、最大22.05 kHzに最適化されています。一部の古い電話口述システムや非常に安価なレコーダーが採用していたコーデックです。拡張子は同じに見えても技術的には他の3つとは別物であるため、最新の文字起こしツールは拒否する場合があります。1時間の音声なのに不自然に小さい(5 MB未満)WMAファイルを見かけたら、おそらくWMA Voiceです。アップロード前にMP3へ変換してください。

DRMの落とし穴(始める前に必ず読んでください)

これは、ハードウェアによる介入なしには文字起こしが不可能になる、唯一のケースです。

Microsoftのかつての音楽ストア(MSN Music、Zune Marketplace、PlaysForSure対応販売店)で購入したWMAファイルは、Windows Media DRMで暗号化されていました。Microsoftは2017年3月にライセンス取得サーバーを完全に停止し、Anniversary UpdateでWindows 10からWMDRMのサポートを削除しました。元のライセンスが保存されたマシンをもう持っていない場合、そのファイルはサポートされているどの方法でも復号できません。該当ファイルに遭遇すると、VLCは「Could not demux ASF stream: DRM protected streams are not supported」を表示します。

アーカイブ救出を行うほとんどの人にとって朗報です。口述録音、インタビュー、ボイスメモがDRM保護されることは決してありませんでした。 DRMが適用されていたのは市販音楽の購入のみです。WMAがレコーダーやサウンドレコーダー由来なら、ほぼ確実に無保護です。

確認するには、VLCで再生を試みてください。再生できればDRMの問題はありません。VLCがdemuxエラーを表示し、かつWindows Media Playerもライセンスを求めるプロンプトなしには再生できない場合は、生存しているライセンスを持つマシンでリアルタイムの音声キャプチャを行う必要がある、DRMロックされたファイルだということです。

WMAファイルから文字起こしを取得する方法

コーデックとDRMの状態が分かれば手順は単純明快なので、このセクションは短めです。

ステップ1:VLCで再生できることを確認する。 VLCはWindows、macOS、LinuxでWMA StandardとLosslessをネイティブに扱えます。クリアに再生できれば、ファイルは健全で無保護です。

ステップ2:WMA Voiceファイルを見分ける。 音声1時間あたり5 MB未満のファイル、またはVLCでコーデックが「WMAv1/WMAv2 speech」と表示される場合は?文字起こしサービスにアップロードする前にMP3へ変換してください。

ステップ3:直接アップロードするか、先に変換する。 文字起こしツールがWMAを受け付けるなら、そのままアップロードします。拒否される場合は、ffmpegで変換します:

ffmpeg -i interview.wma -c:a libmp3lame -b:a 192k interview.mp3

192 kbpsなら、元のWMA Standard録音に含まれる忠実度をすべて保持できます。音声においてそれ以上上げるメリットはありません。

ステップ4:言語を手動で選択する。 自動検出は、劣化した音声の古い録音では精度が落ちます。アーカイブに英語以外のインタビューが含まれるなら、言語を明示的に指定してください。各ツールの言語対応に関する注記は、文字起こし対応の音声フォーマットのガイドを参照してください。

ステップ5:フォーマット固有の注意を払って校正する。 古いボイスレコーダーは、ノイズの多いマイクプリアンプと低いゲイン設定を抱えていました。精度は、最新スマートフォンの96〜98%ではなく90〜95%と見込みましょう。固有名詞、数値、そしてレコーダーが話者から30 cm以上離れていた箇所には特に注意を払ってください。

古い口述録音の本当の問題点

文字起こしの失文字起こしの失敗の原因がコーデックそのものであることはまれです。実際の問題はデジタルではなくアナログ側にあります。

録音レベルが低い。 2000年代のレコーダーは、バッテリー寿命を延ばすために低ゲインで録音することがよくありました。文字起こし結果がほぼ空白で返ってくるなら、音声ピークが音声検出のしきい値に対して低すぎます。Audacityで開き、エフェクト > ノーマライズで目標値-1 dBFSを指定して再書き出ししてください。その後に強力なノイズ除去は適用しないでください。音声の倍音を削ぎ落とした過剰処理の音声よりも、最新のAI音声エンジンは中程度の背景ノイズの方がうまく扱えます。

シングルチャンネルのモノラル。 口述録音のWMAファイルはほぼすべてモノラルです。モノラルでの話者分離(ダイアライゼーション)は、チャンネル分離ではなく声の特徴の分析によって機能するため、2人の話者がいるインタビューでは精度が落ちます。話者ラベルが重要な場合は、何を期待すべきか、出力を手動でどう整えるかについて話者ダイアライゼーション徹底解説のガイドを参照してください。

断片化したヘッダー。 ごく古いWMAファイルの中には、ASFヘッダーが不正な形式で、音声は正常に再生できるのに文字起こしツールを混乱させるものがあります。アップロード時に原因不明の「format error」が出るのにVLCでは再生できるファイルは、まず再ラップしてください:

ffmpeg -i broken.wma -c:a copy fixed.wma

再ラップが失敗する場合は、MP3への完全な再エンコードを強制します:

ffmpeg -i broken.wma -c:a libmp3lame -b:a 192k fixed.mp3

よくあるWMAアーカイブのシナリオ

ジャーナリズムのインタビューアーカイブ

2000年代後半にカセットアーカイブをデジタル化した報道機関は、Windowsプラットフォームが標準だったことから、WMAに行き着くことがよくありました。これらのファイルは今や、最新のツールの多くでは扱えません。一括処理の場合は、バッチコマンド1回でアーカイブ全体をMP3に変換してからアップロードします。テキストを入手した後の出力の構造化については、インタビュー文字起こしガイドがカバーしています。

法律関連の口述筆記と医療記録

2012年以前にオリンパスやソニーのレコーダーを使っていた弁護士や医師は、32〜64 kbpsモノラルのWMA Standard時代のWMAファイルを大量に抱えています。クリーンな口述筆記での精度は最新AIで通常92〜95%。人が後から校正する初稿としては許容範囲です。文字起こし精度の徹底解説の記事では、エラー率がユースケースごとに実務上どういう意味を持つかを分解して説明しています。

家族史の録音

家系図研究家は、内蔵マイクを備えたWindows XPノートPCで口述歴史を録音していた親族から、WMAファイルを受け継ぐことがあります。これが最も難しいケースです。低ゲイン、マイクのランブル、台所やリビングでの録音による残響。文字起こしを実行する前に、Audacityで100 Hzのハイパスフィルターを適用すると、音声に影響を与えることなく低周波のランブルを除去できます。

WMAと、今日使うべきフォーマットの比較

フォーマットビットレート(音声)文字起こし精度ツール対応
WMA Standard32〜128 kbps90〜95%限定的、減少傾向
WMA Voice6〜20 kbps80〜88%低い、拒否されがち
MP364〜192 kbps95〜97%万能
AAC / M4A32〜128 kbps95〜97%万能
FLACロスレス96〜98%広範
WAV (PCM)非圧縮96〜98%万能

新規録音用にフォーマットを選ぶなら、AAC、MP3、またはWAVを使ってください。既存のWMAについては、Standard/Lossless系のどのバリアントでもコーデック自体が障害になることはありません。問題は常に、元の音声の品質と、ツールがコンテナを受け入れるかどうかにあります。受け入れない場合でも、ffmpegコマンド1行でディレクトリ全体を変換できます。

フォーマット選択が精度にどう関わるかを詳しく知りたい方は、文字起こし精度の徹底解説、および変換後のWMAファイルの大半がなるフォーマットについてはMP3をテキストに変換する方法を参照してください。

私見:私が目にするWMA救出ケースは、ほぼ常に解決可能です。DRMの袋小路は人を不意打ちにしますが、それは音楽購入だけに降りかかるもので、録音には関係ありません。それ以外はすべて、レベルの問題かコーデックの誤りの問題であり、どちらもAudacityかffmpegで5分未満で修正できます。

古い録音からストレスなくクリーンな文字起こしを得たいなら、ConvertAudioToTextの音声文字起こしツールが、WMA StandardとLosslessのアップロードを直接受け付けています。

FAQ

変換せずにWMAを直接文字起こしできますか?

場合によります。ConvertAudioToTextの音声文字起こしツールをはじめ、WMAを直接受け付ける最新の文字起こしツールはいくつかあります。汎用的なアップロード型ツールの多くはこの形式を拒否し、まずMP3への変換を求めてきます。変換はffmpegコマンド1行で済みます。

WMAファイルがWindows Media Playerでは再生できるのにVLCでは再生できません。DRMのせいですか?

ほぼ間違いなくそうです。保護されたファイルに対し、VLCは「Could not demux ASF stream: DRM protected streams are not supported」というエラーを出します。MicrosoftのWMDRMライセンスサーバーは2017年に停止したため、有効なライセンスが保存されたマシンをもう持っていない場合、そのファイルはサポートされているどの方法でも事実上復元できません。

古いボイスレコーダーの小さな音声を、文字起こし前に大きくするにはどうすればいいですか?

AudacityでWMAを開き、エフェクト > ノーマライズ(目標値は約-1 dBFS)を実行します。クリッピングを発生させずに、音声をノイズフロアより上まで引き上げられます。その後の強力なノイズ除去は避けてください。最新のAI音声エンジンは、過剰処理された音声よりも中程度の背景ノイズの方がうまく扱えます。

WMAの音質はAI文字起こしに十分ですか?それとも手動で要約すべきでしょうか?

ほぼ常に十分です。32〜128 kbpsのWMA Standardはボイスレコーダー全盛期全体をカバーしており、最新のAI文字起こしに必要な忠実度を備えています。精度は、新しいスマートフォン録音で得られる96〜98%ではなく90〜95%程度と見込んでください。主な原因はコーデックではなく古いマイクプリアンプです。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles