
ベトナム語の文字起こし:6つの声調と本当の精度
Summarize this article with:
ベトナム語の文字起こしは、多くのラテン文字使用言語よりも難しい。正書法が6つの声調を重ねるダイアクリティカルマークとして符号化しており、記号を一つ落とすだけで単語の意味が完全に変わるからだ。北部ベトナム語(ハノイ標準)はAIのカバレッジが最も高く、中部ベトナム語(フエ、ダナン)は現在のモデルにとって最も難しい方言である。Deepgram Nova-2とNova-3、OpenAI Whisper、AssemblyAI Universalはいずれもベトナム語対応をうたっているが、北部以外の音声に対する精度はフランス語やスペイン語より一段低い。正確でダイアクリティカルマーク付きのベトナム語文字起こしが必要なら、ベトナム語対応を明示しているツールを選び、言語コードを手動で設定し、中部方言の音声ではハノイ標準の録音よりも多くの修正編集を見込んでおくこと。
ベトナム語の文字起こしをきれいに仕上げるには、声調記号を正しく出すことが不可欠です。 ダイアクリティカルマークを一つ落とすだけで単語が変わります。「ma」(幽霊)、「má」(母)、「mà」(しかし)、「mả」(墓)、「mã」(馬)、「mạ」(稲の苗)は、同じ音節の声調記号だけで区別される6つの異なるベトナム語です。これは書式の問題ではなく意味の問題であり、AIシステムにとってベトナム語の文字起こしが見かけ以上に難しい理由です。

このガイドでは、正書法、地域方言のギャップ、2026年時点で実際にベトナム語に対応しているエンジン、それぞれに期待できることを解説します。
6声調システムと、ダイアクリティカルマークが意味を担う理由
ベトナム語はチュ・クオック・グー(chữ Quốc Ngữ)という、20世紀初頭に完成したラテン文字ベースの文字で書かれます。6つの音素的声調を、重ねるダイアクリティカルマークのシステムで符号化しています。記号のない音節は平らな声調(ngang)を持ち、他の5つの声調にはそれぞれ専用の記号が付きます。
6つの声調:
- ngang(平ら、無標):「a」、例:ma(幽霊)
- sắc(高く上がる):「á」、例:má(母)
- huyền(低く下がる):「à」、例:mà(しかし)
- hỏi(下がって上がる):「ả」、例:mả(墓)
- ngã(声門閉鎖を伴って下がって上がる):「ã」、例:mã(馬)
- nặng(低く下がって重い、下に点):「ạ」、例:mạ(稲の苗)
正書法は、母音の質を示すダイアクリティカルマークが声調記号の上に重なると、さらに密になります。ベトナム語には7つの修正母音があります:ă、â、ê、ô、ơ、ư、đ。「ă」のような母音は6つの声調すべてを取ることができ、ắ、ằ、ẳ、ẵ、ặのような形を生みます。Unicodeはこれらを正規化形式C(NFC)の合成済みコードポイントで表現します。これは文字起こし出力にとって重要です。合成済みコードポイントではなく分解された結合文字を返すツールは、画面上は正しく見えても、後段のテキスト処理で問題を起こすテキストを生成する可能性があります。
文字起こしの観点で重要なのは、声調記号は任意の句読点ではないということです。アクセントのないラテン文字だけを返す文字起こしは下書きではなく、誤ったテキストです。
エンジン対応:Tier-1言語より薄い
ベトナム語は主要エンジンで対応言語として挙げられています:
- OpenAI Whisper(large-v3モデルを含む):対応言語セットにベトナム語(vi)を記載。
- Deepgram Nova-2およびNova-3:バッチおよびストリーミングエンドポイントで
viをサポート。 - AssemblyAI Universal:ベトナム語を含み、話者ダイアライゼーションも利用可能。
「対応」の意味はエンジンによって異なります。AssemblyAIのドキュメントでは、ベトナム語を「Good accuracy」帯に位置づけており、これは単語誤り率(WER)が10%超から25%と定義されています。比較として、英語はWER 10%未満です。ベトナム語は学習データの面で低リソース言語であり、特に標準的でない音声では、フランス語、スペイン語、ドイツ語よりも精度が有意に低いと正直に期待すべきです。
Otter.aiはベトナム語に対応していません。2026年時点の対応言語は、英語、スペイン語、フランス語、ドイツ語、日本語、中国語(簡体字)です。ベトナム語のOtter精度を掲載しているツールは数字をでっち上げています。
エンジン対応が言語によってどう変わるか広く見るには、AIが低リソース言語で苦戦する理由を参照してください。
北部・南部・中部:学習データのギャップ
ベトナムには主に3つの地域方言グループがあり、AIのカバレッジは均等ではありません。
北部ベトナム語(ハノイ標準)
これはニュースメディア、公教育、政府関連コンテンツを支配する方言であり、ベトナム語文字起こしの学習データの最大部分を占めています。北部ベトナム語では6つの声調が音響的に明確に区別されます。AIの精度はハノイ標準の音声で最も高くなります。VTVのフォーマルな放送コンテンツやハノイを拠点とする話者のフォーマルなビジネス音声を文字起こしする場合、AIが処理するために作られた方言を扱っていることになります。
南部ベトナム語(ホーチミン市、メコンデルタ)
南部ベトナム語の大きな違いは、hỏi/ngãの融合です。南部では、両方の声調が、北部でngãを区別する声門閉鎖を伴わない単純な低く下がる声調として実現されます。書き言葉では依然として両方の声調記号をそれぞれの位置で使い分ける必要がありますが、AIがそれらを割り当てる助けとなる音響的な区別は崩れています。南部ベトナム語の精度は一般に北部ベトナム語より低く、特にảとãの区別で顕著です。ベトナム語ASRデータセットに関する研究でも、南部ベトナム語は北部や中部ベトナム語と比べて学習コーパスで過少代表であることが記録されており、問題をさらに深刻にしています。
中部ベトナム語(フエ、ダナン、クアンチ)
中部ベトナム語は現在のAIシステムにとって最も難しい方言です。北部ベトナム語では統合された子音の区別(tr/ch、s/x、d/gi/r)を保持しています。声調の実現は北部・南部の標準形と異なり、AIが主に学習した方言にはない劇的なピッチの下降や息もれ声を含みます。フエ方言は、ほとんどの学習データに存在しない語彙も保持しています:「mô」は「đâu」(どこ)、「răng」は「sao」(なぜ)。中部ベトナム語の音声では、他のどの地域変種よりも多くの後編集を見込んでください。
ダイアクリティカルマークと正書法エンコーディング:何が問題になり得るか
ベトナム語の文字は記号の重ね合わせを伴うため、実際にはUnicode表現が重要です。「ộ」(下にnặngの点が付いた母音ô)のような文字は、NFC正規化では単一の合成済みコードポイント(U+1ED9)です。分解されたシーケンス(o + 結合サーカムフレックス + 結合下点)を返すエンジンは、NFCを期待するエディタ、データベース、書き出しパイプラインで問題を引き起こす可能性があります。エンジンを評価する際は、既知のベトナム語の文章でテストし、画面表示だけでなく生の出力の正規化形式を確認してください。
2つ目の実務的な問題として、古いツールにはエンコーディング問題を避けるためにダイアクリティカルマークを完全に除去し、プレーンASCII出力を返すものがあります。これは文字起こしではなく、音声的なヒントにすぎません。ベトナム語コンテンツに使うエンジンは、デフォルトでダイアクリティカルマーク付きの出力を返す必要があります。
コードスイッチング:ビジネスとテックにおけるベトナム語と英語
ベトナム語と英語のコードスイッチングは、ベトナムのテックおよびビジネスの会話に広く浸透しています。「Tôi đang work on a project mới」のような文はスタートアップ環境では日常的であり、このパターンはベトナムのオフィスコミュニケーションやディアスポラコミュニティに関する社会言語学研究で十分に記録されています。切り替えが起きるのは、英語の技術語彙(email、deadline、meeting、server)に自然なベトナム語の対応語がないか、文脈上英語の方が速いためです。
文字起こしにとって、これは二言語問題を生みます。エンジンは、同じ発話内でベトナム語部分にはベトナム語のダイアクリティカルマークを、英語の挿入部分には標準英語を処理する必要があります。ベトナム語対応を明示している最近のエンジンは、ベトナム語を自動検出しようとする英語中心のツールよりも概ねこれをうまく処理します。発話レベルの言語検出は混在音声では頻繁に失敗するからです。
混在言語の音声を扱うコツについては、多言語コードスイッチングの文字起こしを修正するを参照してください。
1975年以前に教育を受けた年配のベトナム語話者には、特にフランスのディアスポラコミュニティやサイゴン時代の専門的文脈にいた高齢者の間で、ベトナム語とフランス語のコードスイッチングもあります。このコンテンツの量は少なく、ベトナム語とフランス語の混在へのエンジン対応はあまり検証されていません。
ベトナム語文字起こしを改善する実践的なコツ
- 言語コードを明示的に
viに設定する。混在コンテンツのチャンネルでは、自動検出が特に短い音声クリップで中国語や他の東南アジア言語にデフォルトすることがあります。 - 背景雑音なしで録音する。ベトナム語の声調は音節全体にわたるピッチ曲線として実現されます。雑音はピッチ検出を直接低下させ、声調の復元を低下させます。これは非声調言語よりもベトナム語で重要です。
- ツールがカスタム語彙に対応している場合は、アップロード前に名前や地名の語彙リストを提供する。正しいダイアクリティカルマーク付きのベトナム語の人名・地名(Hà Nội、TP HCM、Đà Nẵng、Nguyễn Văn An)は、局所的に曖昧な文字起こし判断のアンカーをエンジンに与えます。
- ダイアクリティカルマークの出力をすぐに確認する。ベトナム語の文字起こしの最初の段落で、声調記号の欠落や誤りがないか、残りに依存する前にチェックしてください。
- 中部ベトナム語の音声ではより多くの修正を見込む。ハノイ標準のコンテンツと比べて、フエやダナンの話者の録音では3〜5回の追加編集パスを計画してください。
言語や方言をまたいだAI精度の広い解説は、文字起こし精度の解説を参照してください。
ベトナム語文字起こしツールの比較
以下の表は、2026年7月時点のベンダーサイトで確認した価格に基づいています。精度は、これらの製品についてベンダーがベトナム語固有のWERベンチマークを公開していないため、捏造したパーセンテージではなく定性的に説明しています。
| ツール | ベトナム語対応 | 無料枠 | 開始価格 |
|---|---|---|---|
| Whisperベースのツール(例:CATT) | 対応(viサポート) | 10分無料、1回限り | 月額$9.99から(無制限) |
| Deepgram(API) | 対応(Nova-2およびNova-3) | 従量課金 | 従量課金、ボリューム階層 |
| AssemblyAI(API) | 対応(話者ダイアライゼーション付き) | 従量課金 | 従量課金 |
| Happy Scribe | 対応(AI文字起こし) | 10分トライアル | 月額€17から、120分 |
| Sonix | 対応(54言語に記載) | 30分トライアル | $10/時間(PAYG)または$22/シート/月 + $5/時間 |
| Otter.ai | 非対応 | 300分/月 | $16.99/月(英語・スペイン語・フランス語のみ) |
分単位およびサブスクリプションの文字起こしコストの完全な内訳は、2026年 文字起こし料金比較を参照してください。ベトナム語コンテンツがポッドキャストや継続シリーズ向けなら、2026年 ポッドキャスト向け最適な文字起こしでワークフロー上の考慮事項を解説しています。
実際にベトナム語文字起こしを使っているのは誰か
米国のベトナム系ディアスポラのコンテンツクリエイター(特にカリフォルニア州リトル・サイゴン。東南アジア外で最大のベトナム人コミュニティ)は、ベトナム語のポッドキャスト、インタビューコンテンツ、家族アーカイブ録音を制作しています。ディアスポラのオーディエンスにとって、ダイアクリティカルマークの忠実性が重要なのは、書き出された出力が標準ベトナム語として読める必要があるからであり、声調記号を落とすと見た目だけでなくテキストの意味が変わるからです。
ベトナムのニュースルームは、紙媒体やデジタル媒体のインタビュー記事化を加速するために文字起こしを使っています。ベトナムの教育者は、公開教材のために講義を文字起こししています。共通しているのは、これらのユースケースすべてがASCII近似ではなくダイアクリティカルマーク付きの出力を必要としていることです。
複数話者のベトナム語コンテンツでダイアライゼーションがどう機能するか広く見るには、話者ダイアライゼーションの解説を参照してください。
会議ボット機能が不要で、クリーンなベトナム語文字起こしが必要なら、ConvertAudioToTextはベトナム語に対応し、適切なダイアクリティカルマーク付き出力と自分の音声でテストできる無料枠を提供しています。
よくある質問
AI文字起こしはベトナム語の声調記号を保持しますか?
エンジンによります。WhisperやDeepgram Nova-2/3のように、正しくダイアクリティカルマーク付きのベトナム語テキストで学習されたエンジンは、出力に声調記号を返します。対応言語が少数に限られるエンジン(たとえばOtterはベトナム語にまったく対応していません)では処理できません。アップロード前に、そのツールがベトナム語を対応言語として明記しているか必ず確認してください。
AIが文字起こしするのが最も難しいベトナム語の地域方言はどれですか?
中部ベトナム語、特にフエ方言が最も難しいです。声調の実現がAIの学習データを支配する北部標準と異なり、北部では統合された子音の区別(tr/ch、s/x、d/gi/r)を保持し、多くの学習コーパスに存在しない語彙(mô、răng)を使います。中部ベトナム語では、ハノイ標準やホーチミン市の録音よりも明らかに多くの誤りが出ると想定してください。
南部ベトナム語のホイ声調とガー声調の融合は文字起こしエラーの原因になりますか?
なり得ます。南部ベトナム語では、ホイ声調(なめらかに下がって上がる)とガー声調(声門閉鎖を伴って下がって上がる)はほぼ同じように発音されます。音声を音声学的に処理するエンジンは、音響信号が両者を区別しなくなっているため、誤った声調記号を書く可能性があります。正書法では両方の声調を使い分けるため、十分に学習されたエンジンなら語彙的文脈に基づいて適用すべきですが、これは既知の弱点です。
ベトナム語と英語のコードスイッチングは文字起こし品質にどう影響しますか?
最近のエンジンは概ね妥当に処理します。ベトナム語部分はダイアクリティカルマーク付きのベトナム語で返り、英語の挿入部分は英語で返ります。問題は、ベトナムのテックやビジネスの会話ではコードスイッチングが極めて一般的なため、エンジンのベトナム語モデルが弱いとコードスイッチ発話がエラー率をさらに押し上げることです。英語中心の多言語自動検出だけに頼らず、ベトナム語対応を明示しているエンジンを使ってください。
ベトナム語の文字起こしで最も重要なファイル形式と音質は何ですか?
声調言語では、形式よりも音質が重要です。ベトナム語の声調記号は、音節全体にわたる上昇、下降、声門閉鎖を伴う微妙なピッチ曲線に依存しています。背景雑音とマイクの品質は声調の復元を直接低下させます。静かな環境で録音し、可能なら専用マイクを使い、44.1 kHz以上で音声を書き出してください。一般的な形式(MP3、M4A、WAV、FLAC)は主要エンジンで問題なく動作します。
Sources
- Deepgramのモデルと言語に関するドキュメント: https://developers.deepgram.com/docs/models-languages-overview
- AssemblyAI対応言語に関するドキュメント: https://www.assemblyai.com/docs/supported-languages
- Otter.ai対応言語ヘルプ記事: https://help.otter.ai/hc/en-us/articles/360047247414-Supported-languages
- Happy Scribe料金ページ: https://www.happyscribe.com/pricing
- Sonix料金ページ: https://sonix.ai/pricing/detailed-pricing-and-features
- ベトナム語音韻論、Wikipedia: https://en.wikipedia.org/wiki/Vietnamese_phonology
- ベトナム語アルファベット、Wikipedia: https://en.wikipedia.org/wiki/Vietnamese_alphabet
- 南部ベトナム語の声調、SVFF: https://svff.online/blog/southern-vietnamese-tones-explained
- ベトナム語ASR再訪、arXiv 2025: https://arxiv.org/html/2603.14779v1
- オフィス文脈におけるベトナム語と英語のコードスイッチング: https://stdjssh.scienceandtechnology.com.vn/index.php/stdjssh/article/view/690
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.