
WMVをテキストに変換する方法:レガシーWindows動画
Summarize this article with:
クイックアンサー
WMVファイルを、その形式を直接受け付ける文字起こしツールにアップロードしてください。 ほとんどの場合、事前変換は不要です。ツールがファイルを拒否した場合は、ffmpeg -i video.wmv -vn -c:a libmp3lame -b:a 192k audio.mp3 を実行して音声を抽出し、そのMP3をアップロードします。唯一の大きな障害はDRMです。VLCでファイルを開いたときに「DRM protected streams are not supported」と表示された場合は、先に進む前に下記のDRMセクションを読んでください。
WMVとは何か、そしてなぜ今も手元にあるのか
WMV(Windows Media Video)は、1990年代後半から2000年代初頭にかけてのMicrosoftの動画形式です。ASF(Advanced Systems Format)コンテナ内でWMA音声と映像ストリームを組み合わせ、XP、Vista、7時代のMicrosoft Windows Mediaスタックの中核を成していました。
今日WMVファイルを持っている場合、ほぼ確実に以下のいずれかの出所です。
- 2003年から2014年までの企業研修ライブラリ。 ほとんどの企業はMP4に切り替える前にWMVを標準としており、多くは古いアーカイブを移行しませんでした。
- 古いウェビナー録画。 Webexはローカル録画を独自のWRF形式で保存し、共有用にWMVに変換していました。ARF(クラウド録画)もWMVとしてエクスポートできました。GoToWebinarもこの期間の大部分でWMV出力をデフォルトにしていました。
- Windowsムービーメーカーの書き出し。 XPとVistaに同梱されていたバージョンは、WMVまたはDV-AVIにしか書き出せませんでした。デフォルトはWMVでした。
- 学術講義のキャプチャ。 2004年から2012年までの大学の録画システムは、Panoptoが機関標準になる前にWMVでアーカイブされることがよくありました。
- Microsoft Stream Classicのエクスポート。 Stream Classicは2024年2月15日に廃止され、多くの組織が移行期間中にコンテンツをWMVファイルとしてダウンロードしました。
現代のWindowsはもはやWMVを優先しません。Microsoftは2015年頃にMP4へ移行し、この形式は新しいコンテンツでは事実上引退しています。しかし、それらの年のアーカイブされたWMVコンテンツは、ほとんど文字起こしされていません。
DRMの注意点:最初にこれを確認してください
文字起こしに時間を費やす前に、ファイルがDRM保護されていないことを確認してください。
ファイルをVLCで開いてください。音声付きで再生されれば、そのまま進めて問題ありません。VLCが「DRM protected streams are not supported」のようなエラーを表示した場合、ファイルはロックされています。
MicrosoftのPlaysForSure DRMは、購入したコンテンツをMicrosoftのサーバーに保持されたライセンスキーに紐付けていました。それらのサーバーは、MicrosoftがMSN Musicを廃止してZune Marketplaceに移行した2008年に停止しました。再生を許可するためにそれらのライセンスサーバーを必要とするファイルは、合法的に購入した場合でも、現在は永続的にアクセスできません。
ユーザーが作成したWMVファイルは決してDRM保護されていません。WMV自体には組み込みのDRMはなく、保護はASFコンテナ層に存在し、MSN Musicのようなストアから購入した商用コンテンツにのみ適用されていました。自分で録画したもの、ムービーメーカーから書き出したもの、ウェビナープラットフォームから受け取ったものはすべてクリーンです。
コンシューマー向けストアではなく企業ライセンスシステムからのDRMロックされたファイルがある場合は、IT部門に連絡してください。エンタープライズDRMシステム(Windows Rights Management Servicesなど)は、まだ稼働している可能性のある独自のキー基盤を持っています。
WMVの中身
WMVファイルはASFコンテナを使用します。典型的な内容は以下の通りです。
- 映像: WMV9(コーデックメタデータではWMV3とも呼ばれる)、または2000年代初頭のファイルの古いWMV1/WMV2バリアント
- 音声: WMA Standard、通常32〜192 kbps、高品質な制作では時々WMA Pro
文字起こしには音声トラックだけが重要です。映像コーデックは無関係です。
処理前に任意のWMVファイルを検査するには:
ffprobe yourfile.wmv
ストリーム一覧を確認します。Stream #0:1: Audio: wmav2(または類似のWMAバリアント)のエントリがあるはずです。映像ストリームのみで音声ストリームがない場合は、文字起こしするものがありません。
ステップバイステップ:WMVをテキストに変換する
ステップ1:ファイルが再生されることを確認する
VLCで開きます。音声が正常に再生されれば、進めます。DRMエラーが表示された場合は、上記のDRMセクションを読んでください。映像のみが再生され音声がない場合は、次を実行します:
ffprobe -show_streams -select_streams a yourfile.wmv
結果が空の場合は音声トラックが存在しません。WMAコーデックを示す結果が返ってきた場合は、音声は存在しますが、抽出にはコーデックのフォールバックが必要かもしれません。
ステップ2:音声品質の問題をチェックする
古いアーカイブのWMVファイルには、よく以下のものがあります:
- 低ビットレート音声(32 kbps WMA)。 聞き取れますが、圧縮が目立ちます。128 kbpsと比べると精度は数パーセント低下しますが、内容はまだ使えます。
- モノラル音声。 この時代の企業ナレーション録音では一般的です。文字起こしの問題ではありません。
- Windowsムービーメーカーのエンコードの癖。 一部のツールはムービーメーカーがヘッダーを書き込む方法を嫌います。FFmpegは問題なく処理します。
これらはいずれも文字起こしを妨げません。精度の余白に影響するだけで、文字起こしが可能かどうかには影響しません。
ステップ3:文字起こしツールにアップロードする
ConvertAudioToTextの動画文字起こしツールはWMVファイルを直接受け付けます。事前変換せずにファイルをドラッグしてください。

選択したツールがWMVを拒否する場合は、ffmpegで1つのコマンドで音声を抽出します:
ffmpeg -i video.wmv -vn -c:a libmp3lame -b:a 192k audio.mp3
-vnフラグは映像ストリームを完全に削除します。出力されるMP3は通常、元のファイルサイズのごく一部になり、アップロードが大幅に速くなります。
ffmpegがデコードに苦労する古いWMV1/WMV2ファイルの場合:
ffmpeg -i in.wmv -c:v libx264 -c:a libmp3lame -b:a 192k out.mp4
これによりファイル全体をMP4に再エンコードし、すべての最新ツールが受け付けます。
ステップ4:言語を手動で指定する
古いWMVコンテンツでは自動検出の信頼性が低くなります。低ビットレートの圧縮WMA音声は、言語検出が依存する音響指紋を劣化させるためです。実行前に言語を明示的に設定してください。
ステップ5:文字起こしを実行する
60分のWMVは通常3〜5分で処理されます。音声抽出フェーズは高速で、文字起こしに時間がかかります。
精度は録音タイプによって異なります:
- 専用マイクによる企業ナレーション:90〜95%
- ルームオーディオによる会議録画:80〜90%
- ウェビナーの視聴者電話参加音声:70〜85%
ステップ6:確認してエクスポートする
WMV時代の録画には共通の精度の落とし穴があります:マイクから遠い話者、空調の背景ノイズ、低ビットレートWMA圧縮のわずかに金属的な音質。録画時代の固有名詞、製品名、日付、技術用語に細心の注意を払ってください。
アーカイブにはTXT、編集にはDOCX、変換した動画にキャプションを付ける予定ならSRT/VTTとしてエクスポートします。
WMV文字起こしの実践的なヒント
アップロード前に静かな音声をブーストする。 多くの古いWMVは低い入力ゲインで録音されています。Audacityで開き、トラックを選択して、「エフェクト > 音量と圧縮 > 増幅またはノーマライズ」を適用します。常に-25 dBFSを下回る音声は音声検出でスキップされる可能性があります。
緩やかなハイパスフィルターを適用する。 古いオフィス録音には100 Hz未満の空調のゴロゴロ音がよくあります。80〜100 Hzのハイパスフィルターは、音声周波数に触れずにそのゴロゴロ音を除去します。Audacityでは:「エフェクト > EQとフィルター > ハイパスフィルター」で80 Hzにカットします。
ノイズ除去は軽めに保つ。 低ビットレートのWMA圧縮はすでに音声の詳細を削っています。強力なノイズ除去は残りわずかなものを取り除いてしまいます。10〜15%のノイズリダクション設定が、より積極的なものより安全です。
長いアーカイブはセグメントに分割して処理する。 4時間のトレーニング動画は30分単位に分割する方が良いです。確認可能なチャンクが得られ、残りのバッチを処理する前に品質の問題を発見できます。
最初に品質テストを実行する。 アーカイブ内で最も品質の低いファイルを取り、5分間のサンプルを文字起こしします。それによって、コレクション全体を実行する前に前処理が必要かどうかがわかります。
よくあるWMVシナリオ
企業研修アーカイブ
典型的なシナリオ:組織が2005年から2013年にかけて録画した数百時間のWMVトレーニング動画を持っています。文字起こしすることで、検索可能なコンテンツ、アクセシビリティ準拠(クローズドキャプションとテキスト代替)、および素材を最新の形式に再利用する能力が解放されます。
バッチ処理には、ファイルごとのツールではなくAPIアクセスまたは無制限プランが必要です。従量制APIはプロバイダーによって音声1分あたり約0.006〜0.02ドルかかります。数百時間の場合、無制限サブスクリプションの方がほぼ常に経済的です。
レガシーウェビナー録画
2005年から2014年にかけてWMVに変換されたWebexのWRFおよびARF録画は、音声品質が非常にばらつきます。ホストの音声(発表者の専用マイクから)は通常90〜95%で文字起こしされます。電話ダイヤルインによる視聴者の発言は70〜85%に低下します。電話回線の音声は8 kHzでサンプリングされるためで、これは最新の音声認識モデルが期待する16 kHzの半分です。複数の参加者が電話ブリッジで話したQ&Aセクションでは手動のクリーンアップが必要になると予想してください。
学術講義録画
2004年から2012年までの大学のキャプチャは、講師がラベリアマイクを着けていればよく文字起こしされますが、天井設置のルームマイクでは精度が落ちます。講義コンテンツでは、タイムスタンプ付きセグメンテーションがテキストの壁よりも有用なので、タイミングを保持するエクスポートオプションや、セグメント間をジャンプできるツールを探してください。
個人アーカイブ
XP/Vista時代のホーム録画、家族イベント、学校プロジェクトは、元の録音セットアップによって極めてばらつきがあります。静かな部屋で内蔵マイク付きカムコーダーなら85〜90%の精度が得られるかもしれません。騒がしいリビングのテーブルに置いたカメラなら65〜75%かもしれません。期待値を管理し、それに応じて確認時間を予算化してください。
文字起こしにおけるWMVと最新形式の比較
| 形式 | 時代 | コンテナ | 音声コーデック | 期待される精度 |
|---|---|---|---|---|
| WMV | 2000〜2015年 | ASF | WMA 32〜192 kbps | 70〜95%(ソースにより変動) |
| MP4 (H.264) | 2008年〜現在 | ISO BMFF | AAC 96〜256 kbps | 90〜98% |
| WebM | 2013年〜現在 | EBML | Opus 64〜192 kbps | 90〜98% |
| MKV | 2002年〜現在 | Matroska | 各種 | 音声トラックによる |
| AVI | 1995〜2010年 | RIFF | PCM/MP3/AC3 | 変動(レガシー素材が多い) |
私の見解:WMVとMP4が混在するアーカイブを処理する場合は、まずMP4ファイルから始めて精度のベースラインを確立してください。次に、そのベースラインを使って、WMVコンテンツに取り組む際のレビュー期待値を調整します。WMVは常に数ポイント低くなります。
よくあるエラーと修正方法
「コーデックがサポートされていません」
古いWMVファイルはWMV1またはWMV2を使用しています。MP4に変換します:
ffmpeg -i in.wmv -c:v libx264 -c:a libmp3lame -b:a 192k out.mp4
音声のみを抽出する場合は、-c:v libx264を-vnに置き換えます。
VLCまたは文字起こしツールでのDRMエラー
上記のDRMセクションを参照してください。ユーザーが作成したファイルは決してDRM保護されていません。企業アーカイブのファイルでこのエラーが表示された場合は、アーカイブを最初に作成した人に、それが保護されたことがあるかどうか確認してください。
音声が同期していない
一部の古いWMVファイルは可変フレームレートを持ち、動画再生中に音声ドリフトを引き起こします。これは表示レンダリングの問題であり、音声トラックの問題ではありません。文字起こしツールは音声ストリームを直接読み取るため、影響を受けません。
文字起こしの最初の数秒が欠けている
WMVエンコーダーはファイルの先頭に低レベルの無音をパディングすることがあります。再保存する前に、Audacityで最初の数秒を増幅またはトリミングしてください。
ファイルが大きすぎてアップロードできない
古いWMVは通常コンパクトです(標準品質で1時間あたり200 MB未満の場合が多い)。もし大きい場合は、おそらくWMV HDコンテンツです。まず音声を抽出してサイズを劇的に削減します:
ffmpeg -i in.wmv -vn -c:a copy audio.wma
その後、WMAファイルをアップロードするか、ツールがWMAを受け付けない場合はMP3に変換します。
文字起こしが完全に空
ffprobe -show_streams -select_streams a yourfile.wmvを実行します。音声ストリームが表示されない場合、ファイルには文字起こしする音声トラックがありません。この時代の一部の画面録画キャプチャは、ファイルサイズを削減するために映像のみを保存していました。
よくある質問
WMVの文字起こしは正確ですか?
はい、元の音声品質が妥当であれば正確です。スタジオナレーション付きの企業研修コンテンツは通常90〜95%の精度で文字起こしされます。電話回線で参加者が参加した古いウェビナー録画は75〜85%に低下することがあります。レガシーコンテンツでは、特に複数の話者が劣化した電話音声で話したQ&Aセクションで、確認と編集の時間を確保してください。
文字起こしの前にWMVをMP4に変換すべきですか?
文字起こしの品質のためではありません。音声内容はどちらでも同一なので、先にMP4に変換しても結果は向上しません。文字起こしツールがWMVを完全に拒否する場合のみ変換してください。その場合、ffmpegによる音声のみの抽出は、完全な動画変換よりも速く、はるかに小さいアップロードファイルを生成します。
WMVを無料で文字起こしできますか?
はい。ConvertAudioToTextはWMVファイルを直接受け付け、サインアップ時に10分間の無料文字起こしを提供します。これは毎月ではなく一度だけ付与されます。企業アーカイブのバッチ処理には、月額9.99ドルのProプランで上限が完全に撤廃されます。
WMVファイルがDRM保護されている場合はどうすればよいですか?
DRMロックされたWMVファイルは直接文字起こしできません。MicrosoftのPlaysForSureライセンスサーバーは2008年に停止したため、ファイルがMSN Musicや他の廃止されたストアからのものである場合、DRMを再認証できず、コンテンツは事実上アクセス不能です。Windowsムービーメーカー、画面録画、企業カメラからのユーザー作成WMVファイルは決してDRM保護されていません。
出典
- Windows Media Video - Wikipedia
- Windows Media DRM - Wikipedia
- Microsoft PlaysForSure - Wikipedia
- Stream Classicの廃止発表 - Microsoft Tech Community
- WRF2WMV Converter - Webexヘルプ
- ASFフォーマットの概要 - Microsoft Learn
- FFmpegで動画から音声を抽出する - Shotstack
- ffprobeドキュメント - FFmpeg
- 増幅とノーマライズ - Audacityマニュアル
- ConvertAudioToTextの料金
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.