
FLACをテキストに変換する方法:ロスレスオーディオガイド2026
Summarize this article with:
クイックアンサー
FLACをネイティブに受け付ける文字起こしツールにファイルをアップロードし、言語を選択して実行するだけです。WAVと同等の精度を、およそ半分のファイルサイズで得られるため、先にMP3へ変換する理由はありません。このガイドの残りの部分では、FLACの内部構造が何を意味するのか、そして実務上どこでワークフローがつまずくのかを解説します。

FLACとは実際何か(そしてアーキビストが使う理由)
FLACはFree Lossless Audio Codec(フリーロスレスオーディオコーデック)の略です。ロスレス圧縮であり、デコードした際に非圧縮WAVとビット単位で同一のファイルになります。 音声データは一切捨てられません。このフォーマットは可変レートのエントロピー符号化を使用するため、静かな部分や単純なパッセージほど高い圧縮率になります。無音が多く周波数成分が比較的狭い話し言葉の録音では、FLACは通常WAVファイルサイズの50%程度にまで圧縮されます。
この計算は具体的に重要です。CD品質のステレオ音声(44.1kHz、16bit)1時間分は、WAVでおよそ600MBになります。同じ内容をFLACにすると300MB前後におさまります。音声は楽曲よりもはるかに狭い周波数帯域に収まるため、特に圧縮効率が良いのです。
フィールドレコーダーや放送機器では、今もWAVが主流フォーマットです。Zoom H6はWAV/MP3で録音し、Sound Devices MixPreは32bit WAVで録音し、Tascamのポータブル機の多くもWAVで録音します。FLACが登場するのはアーカイブ段階です。大学図書館のオーラルヒストリー(口述歴史)プログラム、ジャーナリズム団体、公共ラジオのアーカイブでは、長期保存のためにWAVマスターをFLACへ変換するのが日常的です。ロスレスの忠実度と50%のサイズ削減という組み合わせは、他の追随を許しません。ハイレゾ配信プラットフォーム(Tidal、Qobuz)も24bit/96kHzのFLACを提供しており、音楽と音声が混在するコンテンツの多くはここに存在します。
ドライブ上にFLACがある場合、その由来はほぼ確実に次の3つのいずれかです。アーカイブ目的で変換されたWAVマスター、ロスレス品質のまま保存されたCDリップ、あるいはハイレゾのストリーミングダウンロードです。
FLACが文字起こし精度に与える影響
FLACとWAVは同一の音声データを持つため、ベースラインとなる文字起こし精度も同一です。 IBM Watsonの音声フォーマット調査によると、MP3はWAVやFLACよりも約10%多くのエラー(高い単語誤り率)を生み出します。64kbpsのOgg Opusでは約2%の劣化が見られます。これらの数値は複数のエンジンで一貫しています。非可逆コーデックによる高周波数情報の欠落が、認識モデルが依存する音的な手がかりを奪ってしまうからです。
実用面での影響が最も顕著に現れるのは、難しい素材です。小さな声の話者、強い訛り、重なり合う発話、背景ノイズのある録音などです。128kbpsのMP3は、「s」「sh」「t」といった歯擦音が存在する8〜16kHz帯を薄めてしまいます。FLACはその帯域をそのまま保持します。クリーンでマイク至近のインタビューでは違いは見えませんが、騒がしい部屋でのフィールド録音では、編集時間を大幅に節約できることがあります。
アーキビストにとってより本質的なポイントはこうです。録音にアーカイブ価値があるとわかっていたからこそロスレスマスターに投資したのであれば、FLACのまま文字起こしすることがその投資を正当なものにします。アップロード前にMP3へ変換するのは、方向性として間違っています。
FLACにできないことについても触れておきます。FLACは悪い録音を良くしてはくれません。FLACはソースにあるものをそのまま保存するだけです。元のマイキングが悪かったり、部屋の残響が強かったりすれば、その問題は書き起こしにも反映されます。ロスレス圧縮は、最初から記録されなかった情報を復元することはできないのです。
押さえておきたいコーデックとコンテナの仕組み
FLACはコーデックでありコンテナでもあります。MP3コンテナの中に格納されるMP3や、M4AやMP4コンテナに包まれるAACとは異なり、.flacファイルは圧縮済み音声とメタデータの両方を直接保持します。このシンプルさは実用的です。コーデックとコンテナの不整合は起きず、除去すべき映像トラックもなく、通常のケースではDRM層を気にかける必要もありません。
文字起こし精度に関係する仕様は以下の通りです:
サンプルレート。 CDリップ由来のFLACファイルは通常44.1kHzです。フィールドレコーダーからの変換は48kHzが一般的です。ハイレゾダウンロードは96kHzや192kHzのこともあります。いずれも問題なく動作します。文字起こしエンジンは内部で16kHzにリサンプリングするため、48kHzを超える分はアップロード帯域の無駄になります。
ビット深度。 16bitと24bitはどちらも一般的で、どちらも機能します。ビット深度が影響するのはダイナミックレンジとファイルサイズであって、エンジンが関心を持つ周波数内容ではありません。
チャンネル数。 モノラルとステレオが標準です。FLACは最大8チャンネルをサポートするため、5.1chや7.1chのファイルも存在し得ます(多くは映画音声のリップ由来)。これらはアップロード前にミックスダウンが必要です(詳細は後述)。
可変ビットレートが標準。 FLACは本質的にVBRです。ビットレートは音声の複雑さに応じてファイル内で変動します。1時間のスピーチFLACでは平均700〜900kbpsを示すこともありますが、この数値はMP3のビットレートのように固定されているものではありません。品質の判断基準にファイルのビットレートを使わないでください。代わりにビット深度とサンプルレートを見てください。
古いエンコーダーのブロックサイズ。 バージョン1.3.0以前でエンコードされたFLACファイルは、非標準のブロックサイズを使用していることがあり、一部のツールが「unsupported codec(未対応のコーデック)」エラーで拒否します。音声自体は破損していません。ffmpeg -i in.flac -c:a flac out.flacで再エンコードすれば、現行仕様のFLACになります。この操作でも音声はロスレスのまま保たれます。
手順:FLACファイルを文字起こしする
まずファイルを確認する。 ffprobe yourfile.flacを実行するか(FFmpegのインストールに含まれています)、オーディオソフトでファイルプロパティを確認します。サンプルレート、ビット深度、チャンネル数を確認しましょう。所要時間は10秒ですが、後々の思わぬトラブルを防げます。
変換せずに直接アップロードする。 FLACをネイティブに扱えるツールなら、パイプライン全体を通じてロスレスの利点が保たれます。アップロード前にMP3へ変換しても、得るものは何もありません。最新のツールはFLACを問題なく受け付けるからです。アーカイブ済みインタビューやフィールド録音のクリーンな書き起こしが必要な場合は、非圧縮ソースに同じワークフローを適用する方法としてWAVをテキストに変換する方法も参照してください。
ファイルが非常に大きい場合(4時間の24bit/96kHzステレオFLACは、圧縮後でも4GB近くになることがあります)、先に16bit/44.1kHzへダウンサンプリングするか、チャンクに分割してください。正確なffmpegコマンドは、後述のトラブルシューティングのセクションを参照してください。
言語を手動で選択する。 自動検出は長くて明瞭な録音ではそこそこ機能しますが、短いクリップや訛りのある発話では、手動で言語を選択することで精度が2〜5ポイント向上します。多くのエンジンは50〜99言語をサポートしています。
固有名詞と専門用語を出力結果で確認する。 人名や地名、専門用語、数字は、フォーマットを問わず最も多いエラーのカテゴリです。文字起こし後に軽く通しで確認すれば、その大部分を拾えます。
必要な形式でエクスポートする。 編集やアーカイブ用にはTXTまたはDOCX。FLACが動画から抽出されたもので、書き起こしを字幕として使う場合はSRTまたはVTTを選びます。
ソフトウェアをインストールせずに試したい場合は、ConvertAudioToTextがFLACを直接受け付けます。変換ステップは不要です。
よくあるFLACソースとそれぞれの注意点
フィールドレコーダー由来のWAV→FLACアーカイブ
最もよくあるソースです。ジャーナリストがZoom H6で90分のインタビューをWAVで録音し、長期保存のためにFLACへ変換したものです。これらのファイルは通常48kHz/24bitのステレオです。きれいに文字起こしされますが、頻繁に起こる厄介ごとがひとつあります。レコーダーを二人の間に置いたため、ステレオ録音では左チャンネルにインタビュアー、右チャンネルに対象者が入っていることがあるのです。話者ダイアライゼーション対応のツールなら、両方の話者を検出してラベル付けできるはずです。うまくいかない場合は、先にモノラルへミックスダウンしてください(ffmpeg -i in.flac -ac 1 out.flac)。
インタビューディスク・オーラルヒストリーのCDリップ
図書館やラジオのアーカイブが、インタビュー集をCDで配布したり、CD品質のFLACダウンロードとして公開したりすることがあります。これらは44.1kHz/16bitで、最も一般的なFLAC仕様であり、事前準備なしでそのまま使えます。注意すべき点はひとつ、トラック境界です。CDが質問ごとやセグメントごとにトラック分割されていた場合は、20個の短いファイルを個別に提出するのではなく、アップロード前にトラックを連結しておくと、正確なタイムスタンプ付きの連続した書き起こしが得られます。
ハイレゾ配信のダウンロード(Tidal、Qobuz)
24bit/96kHzや24bit/192kHzのFLACを配信するプラットフォームから入手するファイルは、文字起こしに必要なサイズの2〜3倍あります。96kHzの1時間のハイレゾステレオFLACは、およそ2GB(WAV相当)から1GB前後に圧縮されます。しかし、その解像度に文字起こし上のメリットはありません。音声は8kHz以下に収まっており、エンジンはどのみち16kHzへリサンプリングします。ffmpeg -i in.flac -ar 44100 -sample_fmt s16 out.flacで事前に16bit/44.1kHzへダウンサンプリングすれば、精度を損なうことなくアップロード時間を大幅に削減できます。
音声セグメントを含む音楽ポッドキャストやコンサート録音
音楽ポッドキャスト、音楽例を含む講義録、MCの紹介が入ったコンサート録音は、ホストが音楽を保存したいがためにFLACで届きます。音声セクションは普通に文字起こしされます。問題は非音声セクションです。Whisperや類似のモデルは、長いインストゥルメンタルパッセージや無音の間に、もっともらしいテキストを幻覚(ハルシネーション)として生成することがあります。対策は、アップロード前に音声部分だけにファイルをトリミングするか、非音声領域を自動的にスキップする音声アクティビティ検出(VAD)搭載のツールを使うことです。このワークフローの詳細については、ポッドキャストに最適な文字起こしツールを参照してください。
文字起こしにおけるFLACと他フォーマットの比較
| フォーマット | ロスレス | 1時間ステレオのファイルサイズ | WAV比の文字起こし精度 | 最適な用途 |
|---|---|---|---|---|
| FLAC | はい | 約300MB | 同等(ベースライン) | アーカイブ、ジャーナリズム、CDリップ |
| WAV(16bit/44.1kHz) | はい(非圧縮) | 約600MB | ベースライン | スタジオ、放送、フィールド録音 |
| MP3 320kbps | いいえ | 約144MB | 約1〜2%劣る | カジュアルな配布 |
| MP3 128kbps | いいえ | 約58MB | 約10%劣る | ストリーミング、ボイスメモ |
| Ogg Opus 64kbps | いいえ | 約29MB | 約2%劣る | 圧縮音声、ポッドキャスト |
私の見解:FLACをお持ちなら、FLACのまま文字起こししてください。WAV比50%のサイズ削減はタダで手に入り、精度は同一です。変換に意味があるのは、使用予定のツールがFLACを拒否する場合だけで、そういうケースはますます稀になっています。フォーマット全般の比較やAPIレベルでの意味については、文字起こしでサポートされる音声フォーマットと文字起こしにおけるWAV vs MP3を参照してください。
FLAC文字起こしで問題が起きたとき
ファイルが大きすぎてアップロードできない。 4時間の24bit/96kHzステレオFLACは4GB近くになることがあります。選択肢は2つです。30分ごとのチャンクに分割する:ffmpeg -i in.flac -f segment -segment_time 1800 -c copy out_%03d.flac。または、ファイル全体を先に16bit/44.1kHzへダウンサンプリングする:ffmpeg -i in.flac -ar 44100 -sample_fmt s16 out.flac。ダウンサンプリング版は1時間あたり600MB未満になり、文字起こし精度の損失はありません。
音楽中や無音中に幻覚テキストが発生する。 非音声のオーディオを受け取ると、モデルはもっともらしいテキストをでっち上げることがあります。アップロード前にFLACを音声セクションのみにトリミングするか、VAD前処理を実行してそれらの領域を自動的にスキップするツールを選んでください。
話者ラベルが入れ替わる、または欠落する。 ステレオFLACでチャンネルごとに話者が分かれている場合によく起こります。ダイアライゼーションを明示的に要求してみてください。それでもダメなら、先にモノラルへミックスダウンして、ダイアライザーがチャンネル分離からの推測ではなく合成信号をもとに動作するようにします。
「unsupported codec」エラーが出る。 古いFLACファイル(バージョン1.3.0以前のエンコーダー)は非標準のブロックサイズを使用しています。再エンコードしてください:ffmpeg -i in.flac -c:a flac out.flac。再エンコード後も音声はビット単位で同一です。品質劣化はありません。
ファイルインスペクターでビットレートがおかしく見える。 FLACは設計上可変レートです。700kbpsや1,100kbpsという読み取り値は正常であり、問題を示すものではありません。重要なのはビット深度とサンプルレートであって、VBRのビットレート平均ではありません。
FAQ
文字起こしにおいて、FLACはMP3より優れていますか?
はい、測定可能な差があります。IBM Watsonの音声フォーマットに関する調査では、MP3はWAVやFLACと比べて約10%多くの文字起こしエラーが発生することがわかりました。この差は、小さな声の話者、強い訛り、ノイズの多い録音で最も大きくなります。すでにFLACをお持ちなら、そのままFLACで文字起こししてください。先にMP3へ変換すると、モデルが活用できたはずの周波数情報が失われます。
FLACを無料で文字起こしできますか?
はい。ConvertAudioToTextは、FLACファイルの最初の10分をまったくの登録なしで文字起こしできます。さらに無料アカウントを作成すると、サインアップ時に一度だけ付与される10分の文字起こし時間が追加されます。より長いファイルや継続的な利用量がある場合は、有料プランでこの上限を解除できます。
文字起こしエンジンは24bitのFLACを受け付けますか?
はい。最新のエンジンは、ソースのビット深度やサンプルレートに関係なく、内部で音声を16kHzのモノラルにリサンプリングします。24bit/96kHzのファイルでも問題なく動作します。主な難点はアップロード時間です。FLAC圧縮前の状態でおよそ1時間あたり2GBになるため、非常に大きなハイレゾファイルは転送に時間がかかります。
FLACに複数のオーディオトラックがある場合はどうすればよいですか?
FLACは最大8チャンネルまでサポートしています。ほとんどの話し言葉の録音はモノラルかステレオなので、事前準備なしでそのまま処理できます。5.1chや7.1chのファイルをお持ちの場合は、まずffmpegでモノラルにミックスダウンしてください(ffmpeg -i in.flac -ac 1 out.flac)。サラウンドミックスでは、通常センター(中央)チャンネルに会話が収められています。
出典
- IBM Watson Speech Services: "Why the Audio Compression Format Impacts the Speech-to-Text Transcription Accuracy", https://medium.com/ibm-data-ai/why-the-audio-compression-format-impacts-the-speech-to-text-transcription-accuracy-84da6438024c
- OpenAI Whisper GitHub repository and format documentation, https://github.com/openai/whisper
- Zoom H6 product manual (WAV/MP3 format specs), https://zoomcorp.com/media/documents/E_H6.pdf
- Sound Devices MixPre-3 II product page, https://www.sounddevices.com/product/mixpre-3-ii/
- FLAC Wikipedia specification page, https://en.wikipedia.org/wiki/FLAC
- University of Pittsburgh Oral History Toolkit: File Formats, https://pitt.libguides.com/oralhistorytoolkit/formats
- AssemblyAI: Best audio file formats for speech-to-text, https://www.assemblyai.com/blog/best-audio-file-formats-for-speech-to-text
- Colin Crawley Audio File Size Calculator, https://www.colincrawley.com/audio-file-size-calculator/
- FFmpeg segment muxer guide, https://www.samgalope.dev/2024/11/11/audio-segmentation-a-simple-guide-to-splitting-long-audio-files-with-ffmpeg/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.