タイ語文字起こしガイド:文字体系、声調、そしてASRの現実(2026年版)
文字起こしタイ語言語

タイ語文字起こしガイド:文字体系、声調、そしてASRの現実(2026年版)

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

タイ語の文字起こしは、最新の商用エンジンであれば中央タイ語(バンコク標準語)に対して良好に機能しますが、文字体系の仕組み、声調の曖昧さ、スペースなしの分かち書きは、汎用ツールでは対応にばらつきが出る課題です。iApp Technologyのようなタイ語特化エンジンは、方言コンテンツにおいてベースのWhisperを上回る性能を発揮します。地域変種(ラーンナー、イーサーン、南部タイ語)は明確に難易度が高く、主要な欧米プラットフォームの多くも精度が下がることを認めています。本ガイドでは、2026年のタイ語コンテンツに向けた言語の仕組み、正直なエンジンベンチマーク、実践的なワークフローを解説します。

タイ語の文字起こしは、最新の商用エンジンなら中央タイ語の音声の大半で問題なく機能します。しっかりサポートされたツールから得られる出力は、声調記号が保たれた正しいタイ文字です。そこにたどり着くには、他の東南アジアの主要言語とは組み合わさり方がまったく異なる、3つの言語固有の特性を理解する必要があります。すなわち、単語間にスペースがない文字体系、明示的な声調記号と子音クラスの両方で符号化される5声調システム、そして敬意を示す助詞がすべての発話の性格を変えるレジスター(丁寧さの階層)システムです。

タイ文字:エンジンが処理しなければならないもの

タイ文字(อักษรไทย)は左から右へ書くアブギダで、44の子音字、15の基本母音記号、4つの声調記号を持ち、単語間にスペースがありません。 母音記号は子音の土台に対して上、下、前、後ろ、あるいは周囲に付きます。声調記号は子音の積み重ねの上に置かれます。これはラテンアルファベットとは、ASRにとって重要な点で異なります。

「ご飯が食べたい」というような文は、「ผมอยากกินข้าว」という一続きの文字列として書かれます。エンジンは、正しい順序で、正しい母音の位置と正しい声調記号を伴ってUnicodeのタイ文字を出力しなければなりません。出力をローマ字化するツール("phom yak gin khao")は、音韻的には推測できてもタイ語読者には使えないテキストを生成します。ネイティブスクリプトでの出力は、真剣なタイ語ワークフローにとって最低限の要件です。

タイ語の子音は3つのクラス(高・中・低)のいずれかに属し、クラスが、明示的な声調記号が適用される前の音節のデフォルトの声調を決めます。明示的な声調記号(マイエーク ่、マイトー ้、マイトリー ๊、マイチャッタワー ๋)は、そのクラスの規則の中でさらに声調を修飾します。この層状のシステムにより、声調は部分的に構造的で、部分的に明示的になります。これは、声調記号が常に母音のダイアクリティカルマークである中国語のような声調言語とは異なる点です。

5声調システムとASR

タイ語には5つの声調があります:中声調、低声調、下降声調、高声調、上昇声調。音節の声調は単なるダイアクリティカルマークではなく、子音クラス、母音の長さ、音節構造、そして明示的な声調記号の相互作用によって決まります。 「ข้าว」(khâo、米)と「เข้า」(khâo、入る)は同じように聞こえます。意味は周囲の文脈と文字の構成から得られます。

ASRにとって、これは弁別の問題を生みます。エンジンはピッチの軌跡を聞き取り、それを正しい声調を持つ文字シーケンスに一致させなければなりません。クリーンなスタジオ音声では、最新のエンジンは標準的な中央タイ語に対してこれをうまく処理します。ノイズの多い音声、話者が重なる状況、あるいは声調が弱められるくだけた話し方では、声調を持つ文字の選択ミスが起きやすくなります。

良いニュースは、商用エンジンがネイティブのタイ文字を出力する場合、出力する文字に対して声調記号は正しく表示されるということです。問題になるのは、文字自体が正しいかどうかであって、記号が正しく付けられているかどうかではありません。

分かち書き:複合する問題

単語間にスペースがないことは、タイ語をスペース区切りの言語よりも後処理が難しくする構造的な課題です。 ASRシステムは、音素を認識し、それをタイ文字にマッピングし、単語の境界がどこに落ちるかを判断することを同時に行わなければなりません。

誤りは2方向で複合します。エンジンが音節を聞き間違えると、有効な単語の終わりの位置が変わる文字シーケンスを選んでしまうかもしれません。分かち書きが誤っていると、下流のツール(スペルチェック、キーワード抽出、検索インデックス作成)が誤ったトークン単位で動作してしまいます。

標準的なタイ語の文章にもスペースは使われますが、それは句(フレーズ)の境界を示すものであって、単語の境界ではありません。句の中では単語がつながって続きます。読者は文脈と言葉の知識に頼って正しく解析します。エンジンは、大量のタイ語コーパスで訓練された音響モデリングと言語モデルの事前確率を組み合わせて、このプロセスを再現します。

読み物や公開用途では、通常のタイ語テキストのように見える出力が得られます。スペースを入れない慣習は、タイ語読者が期待するものだからです。NLPの下流タスク(検索インデックス作成、感情分析、言語処理パイプライン)では、明示的な単語境界マーカーが必要で、それには文字起こし出力にPyThaiNLPのようなタイ語分かち書きツールを適用する必要があります。

レジスターと敬意を示す助詞

タイ語にはフォーマルなレジスターシステムがあり、その一部は文末の敬意助詞で表されます。男性は文末にครับ(khráp)を使い、女性は平叙文ではค่ะ(khâ、下降声調)、疑問文ではคะ(khá、高声調)を使います。これらの助詞を省略すると、文脈によっては話し言葉がカジュアル、さらには失礼なレジスターに変わります。 フォーマルで対外的なタイ語コンテンツには、ほぼ必ずこれらが含まれます。

文字起こしにおいて、これらの助詞が重要なのは、頻繁に現れ(丁寧な話し方では1分に何度も)、それ自身の声調の区別を持つためです。ค่ะとคะは声調と文脈だけで違い、間違った方はレジスターの誤りになります。フォーマルなタイ語コーパスで訓練されたエンジンはこれらをうまく処理します。タイ語の訓練データが薄いエンジンは、混乱させたり落としたりする可能性があります。

技術系やビジネスのタイ語には、タイ語の発音に音韻的に適応された大量の英語借用語が含まれます。「schedule」はタイ語の音韻に適応した形になり、ブランド名はタイ文字で表記されるか、話者次第で英語のまま残されます。最新のエンジンは一般的にコードスイッチングをかなりうまく処理します。タイ語の単語はタイ文字で、英語の挿入は英語で返ってきます。ワークフローに決める前に、自分の特定の音声でこれを確認してください。

タイ語音声の文字起こし準備完了
タイ語音声の文字起こし準備完了

方言の現実

中央タイ語(バンコク標準語。メディア、教育、政府で使用)は、ほとんどのエンジンが訓練を受け、最も良い性能を発揮する変種です。3つの主要な地域変種は明確に異なります:

北部タイ語(ラーンナー/カムムアン):独立した言語として分類されることもあります。異なる声調体系と独自の語彙を持ちます。ラーンナー特化のASR向けの訓練データは限られています。2026年初頭に発表された研究(MDPI Applied Sciences)は、中央タイ語で訓練された汎用エンジンの性能が悪いために、北部タイ語方言の音声認識システムを特別に開発しました。

東北部タイ語(イーサーン):ラオ語に近縁です。タイ語特化モデルであるTyphoon ASRのベンチマーク結果では、専用モデルでもイーサーン語コンテンツで文字エラー率がおよそ10〜11%です。汎用の欧米商用エンジンはおそらくさらに悪いでしょう。イーサーン語とラオ語の類似性は、自動言語検出がイーサーン語の録音をラオ語と誤分類する原因にもなります。

南部タイ語(パックタイ):中央タイ語とは異なる声調の輪郭を持ちます。話者人口が少ないため、ほとんどのモデルで訓練データが少なくなっています。

地域方言コンテンツについては、正直な基準はこうです。中央タイ語は良好。地域変種はまちまちで、ワークフローに決める前に短いサンプルでテストすべきです。これは低資源アフリカ言語のような規模の訓練データ不足の問題ではなく(その比較については、AIが低資源言語で苦戦する理由を参照)、十分に代表されていない多数派を伴う方言乖離の問題です。

2026年の主要エンジンのタイ語対応

以下の表は、ベンダーのドキュメントと独立したベンチマークからの検証済みの最新情報を反映しています。あなたの特定の音声に対するツールごとの精度の割合は掲載していません。実際の精度を決めるすべての変動要因(音質、方言、ドメイン、話者数)をカバーする単一のベンチマークが存在しないためです。

ツールタイ文字出力タイ語サポートモデル無料枠料金モデル
Deepgram Nova-3ありNova-3(DeepgramによればNova-2比で69%のWER削減)限定的な無料枠従量課金(1分単位)、ボリューム階層
AssemblyAI Universal-2ありUniversal-2(同社ドキュメントでは「良好な精度」の10〜25% WER階層)限定的従量課金(1分単位)
iApp Technology(タイ語特化)ありiApp ASR Pro(Common Voice 17で91.23%の単語精度)60無料クレジットクレジット制:1〜2 IC/分
Nottaあり非公開(58言語モデル)月120分、録音は最大3分Pro月額13.99ドル、無料プラン0ドル
Otter.aiなし非対応月600分(英語のみ)Pro月額8.33ドル(年間契約)
ベースWhisper large-v3あり18〜26% CER(独立ベンチマークでTier-3)セルフホストのみコンピューティングコスト

表の内容についていくつか補足します:

Otterはタイ語に対応していません。ワークフローがOtterに依存している場合、タイ語コンテンツには別のツールが必要です。

iApp Technologyは、標準データセット上で公表された精度ベンチマークを持つタイ語特化プロバイダーです。クレジット制の料金(基本1 IC/分、Proで2 IC/分。大量購入レートでおよそ53〜107バーツ/時間、7%のVAT別)は、タイ国内での大量のタイ語専門利用に適したモデルです。新規アカウントには60無料クレジットが付与されます。

DeepgramのNova-3によるタイ語拡張は最新の改善で、ストリーミングモードでNova-2比69%の相対的なWER削減を謳っています。ストリーミングはより厳しいベンチマークなので、絶対的な出発点が高かったとしても、この改善は本物です。

ベースのWhisper large-v3は、タイ語で18〜26% CERと独立にベンチマークされており、英語と比べると有意な劣化です。ファインチューニングされたタイ語Whisper変種(Typhoon Whisper large-v3など)は、適切なデータキュレーションを行えば標準ベンチマークで4〜6% CERに到達できますが、必要なのはファインチューニング済みモデルであって、ベースモデルではありません。

料金面でのエンジン比較をもっと広く見たい場合は、音声認識API料金比較をご覧ください。

タイ語コンテンツのための実践的ワークフロー

言語を明示的に設定する:常にタイ語(th、またはAPIに応じてth-TH)を指定してください。自動検出はイーサーン語/ラオ語の混同を招きやすく、独自のエラー率を持つ処理ステップを追加します。

ツールが許す範囲で固有名詞のコンテキストを提供する:タイ人の名前、バンコクの地区名、タイ企業名、県名は、ほとんどのエンジンでタイ文字として文字起こしされます。プラットフォームが用語集やキーワードプロンプトをサポートしている場合は、頻繁に登場する名前を登録しておいてください。ローマ字の文脈で現れるタイ人名(例:引用しているメール内)は、レビューのパスが必要な場合があります。

技術系・科学系のタイ語の場合:多くの用語は英語借用語で、タイ語話者はタイ語の音韻で発音します。エンジンはこれらをタイ語音韻化されたタイ文字で返すことも、英語で返すことも、一貫せず返すこともあります。用語のレビューは標準的な実践です。

複数のタイ語話者とのインタビューの場合:商用エンジンでの、フォーマルな2話者のタイ語における話者ダイアライゼーションの精度は妥当な水準です。発話が重なるカジュアルな会話や、イーサーン語・南部タイ語の話者はより難しくなります。ダイアライゼーションの品質が重要なら、マイクを分けて録音することを検討してください。インタビューのワークフローについて詳しくは、インタビュー録音の文字起こし方法をご覧ください。

SRT字幕の場合:タイ語のUnicodeはYouTube、Vimeo、その他の最新の動画プラットフォームで正しく表示されます。文字起こしツールからSRTをエクスポートして、直接アップロードしてください。字幕ジェネレーターは出力ファイル内のタイ文字を処理します。改行位置は自動で、タイ語のフレーズ構造に従います。

ポッドキャストのショーノートの場合:タイ語のAI要約出力はツールによって大きく異なります。タイ語の文字起こし上で要約を実行するツールは、要約モデルがタイ語をサポートしていれば、タイ語のチャプターマーカーや引用を抜き出せます。タイ語を文字起こしできるのに要約は英語のみというツールもあるため、これは特にテストする価値があります。ポッドキャスト固有のワークフローについては、ポッドキャストに最適な文字起こしをご覧ください。

私の見解:ほとんどのタイ語コンテンツ制作業務では、選択肢はタイ語特化プロバイダー(iApp。タイ国内での大量の専門タイ語向け、クレジット制料金、既知のベンチマーク)と多言語商用API(Deepgram Nova-3またはAssemblyAI Universal-2。多言語ワークフロー向け、または同じパイプラインで英語などの言語も必要な場合に有利)のどちらかです。18〜26% CERのベンチマークを考えると、ベースのWhisper単体は本番のタイ語文字起こしに適したツールではありません。

API統合や会議ボットのセットアップなしにクリーンなタイ語の文字起こしが必要な場合は、ConvertAudioToTextがタイ語の音声ファイルを直接処理し、ネイティブスクリプトで出力します。

FAQ

Otter.aiはタイ語の文字起こしに対応していますか?

いいえ。Otterが文字起こしできるのは英語、スペイン語、フランス語、ドイツ語、日本語、中国語のみです。2026年半ばの時点で、タイ語はOtterのどのプランでもサポートされていません。

タイ語のASR出力で単語の境界が欠けることがあるのはなぜですか?

タイ語は単語間にスペースを入れずに書きます。そのためASRエンジンは、音声認識の上に分かち書き(単語分割)のステップを適用する必要があります。誤りは複合的に重なります。聞き間違えた音節があると、トークナイザーが境界を置く位置がずれ、誤った境界は単語の意味を変えてしまいます。十分に訓練されたエンジンは標準タイ語をうまく処理しますが、訓練量の少ないエンジンは手動での修正が必要な連続した文字列を出力しがちです。

AIエンジンは文字起こし出力でタイ語の声調記号を保持しますか?

ネイティブのタイ文字で出力する商用エンジンは、一般的に声調記号を保持します。音声的な表記ではなくUnicodeのタイ文字を直接生成するためです。リスクがあるのは、ツールがタイ文字ではなくローマ字化された転写を出力する場合で、その表記では声調情報が完全に失われ、タイ語読者にとって役に立ちません。

北部タイ語やイーサーン語といった地域方言の場合、タイ語の文字起こしの精度はどのくらいですか?

中央タイ語より大幅に精度が低くなります。研究ベンチマークによると、イーサーン語のASRは専用モデルでも文字エラー率がおよそ10〜11%であり、北部タイ語(ラーンナー)は訓練データのプールが限られているため、ほとんどのエンジンは主に中央タイ語で訓練されています。バンコク標準語と比べると、地域変種では精度が5〜15ポイント低いと想定してください。

AI文字起こしエンジンはタイ語をどの言語と混同しやすいですか?

最も多い混同先はラオ語です。タイ語とラオ語は文字体系が大きく似ており、音韻面でも重なりがあります。自動検出では、ラオ語に近縁の東北部タイ語(イーサーン語)の録音をラオ語として誤判定することがあります。タイ語のコンテンツには、自動検出ではなく必ず言語を明示的にタイ語に設定してください。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles