インドネシア語文字起こし:標準語とジャカルタ口語の違い
文字起こしインドネシア語バハサ・インドネシア言語

インドネシア語文字起こし:標準語とジャカルタ口語の違い

BMMamane B. MoussaMay 26, 2026Updated July 2, 20262 min read

Summarize this article with:

TL;DR

インドネシア語(バハサ・インドネシア)は、2026年時点でAI文字起こしの対応が比較的充実しているアジア言語の一つです。ラテン文字を使い、標準的な音韻が比較的一貫していることがその理由です。精度上の主なリスクは地域アクセントではなく、書き言葉としての標準インドネシア語(バハサ・バク)と、ポッドキャストやVlog、カジュアルなインタビューの大半で話される都市部の口語(バハサ・ガウル)との間にあるレジスターのギャップです。もう一つの落とし穴は自動検出です。両言語が1972年の統一表記法を共有しているため、モデルがインドネシア語とマレー語を混同することがあります。これを避けるには、言語コードを明示的に設定してください。Deepgram Nova-3は2026年1月にインドネシア語サポートを追加し、Whisperはすべてのモデルサイズで対応しています。

AI文字起こしはバハサ・インドネシアにうまく対応できるのか?

はい、インドネシア語は2026年時点でAI文字起こしの対応が比較的充実している非ヨーロッパ言語の一つです。その理由は構造的なものです。バハサ・インドネシアはダイアクリティカルマークのないラテン文字を使用し、アジア言語としては比較的単純な音素目録を持ち、1972年のEYD改革以降、標準表記が一貫しています。現在、主要なASRエンジンはすべて対応しています。

とはいえ、「対応している」と「あなたの音声で正確である」は同じことではありません。この差はほぼ完全にレジスター(語域)の問題であり、エンジンの選択の問題ではありません。

精度を本当に左右するのは標準語と口語のギャップ

多くの人が尋ねる精度の質問は「何パーセントか?」です。より有用な質問は「どのインドネシア語か?」です。

バハサ・バク(正式な書き言葉の標準語)は、ニュース放送、政府の場面、大学の講義、ビジネスレポートに登場するものです。モデルは主にこのレジスターで訓練されています。読み上げられ、クリーンで、音韻的に予測可能です。

バハサ・ガウル(ジャカルタ発の口語で、全国メディアとソーシャルプラットフォームを通じて広まったもの)は別物です。同じ文でもまったく違って見えます:

標準語(baku)口語(gaul)
Saya(私)Gua / Gue / Gw
Anda(あなた)Lu / Lo
Sudah(すでに)Udah
Habis(終わった)Abis
Terima kasih(ありがとう)Makasih
Menanyakan(尋ねる、正式な接尾辞)Nanyain(-kanが-inに置き換わる)
Mengambil(取る、正式な接頭辞)Ngambil(nge-への短縮)

語彙にとどまらず、バハサ・ガウルは意味を変えずに文の感情的トーンを調整するモーダル助詞を加えます:dong(確信)、sih(カジュアルな強調)、deh(決めつけ)、lah(和らげ)、kok(懐疑的な聞き手への説得)。これらを大量に見たことのないモデルは、削除してしまうか、内容語と誤読してしまいます。

インドネシア語ASRに関する研究では、話し方スタイルのばらつきがノイズやアクセントよりも精度に大きく影響することが確認されており、自発的な口語音声は読み上げられた正式な音声よりも測定可能なほど高い単語誤り率を生み出します。あなたのコンテンツがポッドキャスト、Vlog、カジュアルなインタビュー、スタートアップチームの録音であるなら、宣伝で見かける標準語レジスターのベンチマーク数値は上限値として扱い、典型的な結果とは考えないでください。

バハサ・インドネシア向けAI音声文字起こしツール
バハサ・インドネシア向けAI音声文字起こしツール

インドネシア語とマレー語の混同問題

**精度が重要であれば、言語をインドネシア語に明示的に設定することは必須です。**その理由は以下の通りです。

インドネシア語とマレー語は相互に理解可能で、同じ表記体系を共有しています。1972年のインドネシア・マレーシア正書法改革(インドネシアではEYD(Ejaan yang Disempurnakan)、マレーシアではERB(Ejaan Rumi Bersama)として知られる)は、両言語の綴りを統一しました。1972年以前は、同じ音をわずかに異なるラテン文字で表記していました。インドネシア語ではtjdjが使われていましたが、現代の表記ではcjです。

その結果、自動検出モデルは両言語で非常に似た響きの音声を、ほぼ同一の表記と照合して処理するため、インドネシア語(id)ではなくマレー語(ms)を選んでしまう可能性が実際にあります。そうなると、文字起こし結果はインドネシア語ではなくマレー語の語彙パターンを使う可能性があり、これは意味のある違いです。

よく訓練されたモデルが両者を区別するのに実際役立つ相違は、借用語から来ています。インドネシア語は植民地時代にオランダ語から多くを取り入れました:kantor(事務所、オランダ語kantoorから)、televisi(テレビ、オランダ語televisieから)、polisi(警察、オランダ語politieから)。マレーシアのマレー語は同じ概念を英語から借用しました:pejabat(事務所)、televisyen(テレビ)、polis(警察)。また、インドネシア語の音韻は語末の/a/を保持しますが、マレー半島のマレー語はそれをシュワーに弱化させます。

実務的には、使用するどの文字起こしツールでも言語コードをidに設定してください。これほど近い言語ペアにとって、自動検出は利便性のための機能であって精密ツールではありません。

エンジンの対応状況:2026年に確認済みのインドネシア語サポート

3つの主要ASRプロバイダーが、現行の本番モデルでのインドネシア語サポートを確認しています:

Whisper(OpenAI): インドネシア語(id)はLarge-v3を含むすべてのモデルサイズで、Whisperのサポート言語リストに含まれています。Whisperの多言語トレーニングにはインドネシア語が含まれていました。このモデルは標準的なインドネシア語をうまく処理します。研究によると、インドネシア語データセットでWhisper Mediumをファインチューニングするとエラー率が大幅に減少し、ベースモデルが口語および自発的な音声について有意な余地を持っていることが示されています。

Deepgram Nova-3: Deepgramは2026年1月にNova-3へインドネシア語(id)を追加しました。「マレー語の語根、英語の借用語、地域的な抑揚が融合したハイブリッド言語で、多言語環境でよく使われる」と説明しています。2026年3月の更新版Nova-3 Multilingualリリースでは、サポート対象言語全体でバッチ単語誤り率が約34%相対的に減少したと報告されました。Nova-3にはリクエストあたり最大100個のドメイン固有用語に対するキータームプロンプティングが含まれており、誤文字起こしされがちなインドネシアのブランド名、地名、専門用語を注入するのに直接役立ちます。

AssemblyAI: インドネシア語はAssemblyAIのUniversalモデルがサポートする99言語に含まれています。

これらのエンジンが他の言語や料金プランでどう比較されるかをより広く見るには、2026年版 音声認識API料金の内訳をご覧ください。

インドネシア語と英語のコードスイッチング

インドネシアのテック、スタートアップ、ビジネスコンテンツでは、英語がインドネシア語の文に日常的に混ざりますが、最新のASRエンジンはこれをかなりうまく処理します。「Kita perlu push ke production sebelum meeting」や「Dia bikin konten untuk social media」のような文は、インドネシア語部分はインドネシア語で、英語の借用部分は英語で出力されます。Deepgram Nova-3は、インドネシア語向け機能として多言語コードスイッチングを明示的に挙げています。

より難しいケースは、ジャワ語やスンダ語が混ざったインドネシア語で、中部ジャワ、東ジャワ、西ジャワからの非公式な音声でよく見られます。2026年時点で、ジャワ語もスンダ語も主要ASRエンジンの本番サポート言語ではないため、それ以外はインドネシア語の会話にこうした単語が現れると、モデルは別の言語として認識するのではなく、音韻的に推測します。この種の混合言語コンテンツには、人間によるポスト編集が必要になる可能性が高いです。

密接に関連する東南アジア言語の言語固有の精度事情については、タガログ語・フィリピノ語文字起こしガイドをご覧ください。

インドネシア語対応文字起こしツールの比較

以下の表は2026年半ば時点で確認済みの機能と料金を反映しています。精度の数値は特記なければベンダーの自己申告であり、最良のケースの主張として扱うべきです。

ツールインドネシア語対応料金モデルコードスイッチングインドネシア語での要約
Sonixあり(全プラン)従量課金$10/時間、Coreは月額$25からありなし(英語のみ)
Happy Scribeあり(AI+人間)AIは月額EUR17から(120分)、人間はEUR1.75/分から記載なしなし
Otter.aiなし無料(300分)、Proは月額$8.33からなしなし
AssemblyAIあり(Universalモデル)分単位の従量課金、ボリューム階層制あり(多言語モデル)なし

Sonixは30分の無料トライアルを提供しています。Happy Scribeは10分の無料トライアルを提供し、インドネシア語のAI精度を約85%と公表しており、重要なコンテンツについては99%の精度を謳う人間によるレビューオプションもあります。Otterはインドネシア語をまったくサポートしていません。会議の文字起こしでよく推薦されるツールだけに、注目に値する事実です。

時間単位の従量課金ではなく定額で無制限の文字起こしが必要な場合は、ConvertAudioToTextが月額$9.99でインドネシア語を提供しています(無料プランでは10分の無料枠、登録時に1回付与されます)。

これらおよびその他のサービスを横断した完全な料金比較については、2026年文字起こし料金比較をご覧ください。

地域アクセント:実際に重要なこと

ジャワ語の影響を受けたインドネシア語(中部・東ジャワ)、スンダ語の影響を受けたインドネシア語(バンドゥンと西ジャワ)、バリ語の影響を受けたインドネシア語、東インドネシアのインドネシア語(マルク、パプア)はいずれも、正式なジャカルタのインドネシア語とは異なる音韻パターンをもたらします。母音の扱い、子音連結、イントネーションの輪郭、話す速さが異なります。

実際の影響はこのリストが示唆するよりも小さいのです。というのも、これらの話者は通常、地域の母語ではなく共通言語としてバハサ・インドネシアを使っているからです。レジスターはしばしばgaulよりもbakuに近く、これはモデルにとって有利に働きます。東インドネシアの変種(マルク、パプア)は訓練分布から最も乖離しており、最高のエラー率を示すでしょう。地域ごとのサブモデルは不要です。標準のidモデルがすべてを処理しますが、周辺部では精度が低下します。

先のポイントに戻ると、より大きな変数は、話者がどこ出身かではなく、正式なインドネシア語を使っているか口語を使っているかです。

重複形:特有の解析上の課題

インドネシア語は複数形や強調形を作るために形態論的な重複(reduplication)を使います。Rumahは家を意味し、rumah-rumahは家々を意味します。Sapiは牛を意味し、sapi-sapiは牛たちを意味します。これは標準的な書き言葉のインドネシア語であり、テキストではハイフンが明示されているため、表示レベルではうまく処理されます。

ASRの課題は、話し言葉における重複が吃音のように聞こえる場合です。インドネシア語ASRに関する論文は、「sa-sa-sapi」(吃音の形)と「sapi-sapi」(有効な重複語)を区別するには韻律的な認識が必要だと指摘しています。現在のモデルは常にこれを正しく処理できるとは限りません。

特定の音韻的特徴がなぜ音声認識エンジンに問題を引き起こすのかを深く知りたい場合は、AIが低リソース言語に苦戦する理由文字起こし精度の解説をご覧ください。

インドネシア語音声の話者分離

正式な2人の話者によるインドネシア語インタビューは、きれいな話者分離になりやすい傾向があります。正式な場面でのインドネシア語の会話規範には明確な話者交代が含まれており、これは話者の分離に大きく役立ちます。発話が大きく重なるカジュアルなポッドキャストやグループディスカッションは難しく、これはインドネシア語固有の問題ではありません。

オーディオタイプごとの話者分離の仕組みについて詳しくは、話者分離の解説をご覧ください。

より良いインドネシア語文字起こしのための実践的なヒント

  1. 言語をidに明示的に設定してください。インドネシア語とマレー語のどちらもあり得る場合は、自動検出に頼らないでください。
  2. バハサ・ガウルが多いコンテンツでは、より高いエラー率を想定し、ポスト編集の工程を見込んでおいてください。静かな場所でのクリアな音声は、他のどの単一要因よりも効果的です。
  3. インドネシアのブランド名、人名、製品用語にはキータームプロンプティング(利用可能な場合)を使ってください。GojekTokopediaTraveloka、インドネシアの州名や都市名は、正式な音声で訓練されたモデルにとって分布外であることが多いです。
  4. それ以外はインドネシア語の文字起こしに現れるジャワ語やスンダ語の単語は、手動レビュー用にフラグを立ててください。モデルは音韻的に推測します。
  5. ポッドキャストのショーノートやチャプターマーカーについては、ツールがまず英語に翻訳するのではなく、インドネシア語で出力を生成することを確認してください。ソース言語に関係なく要約を英語で行うツールもあります。

よくある質問

AI文字起こしはバハサ・ガウル(ジャカルタ口語)にもうまく対応できますか?

標準インドネシア語ほど確実ではありません。バハサ・ガウルは代名詞が異なり(saya/Andaの代わりにgua/luを使う)、音節を省略または短縮し(sudah→udah、habis→abis、terima kasih→makasih)、-kan/-iの代わりに-in接尾辞を使い、さらにsih、dong、deh、lahといった標準語に直接対応するものがない助詞を重ねます。ほとんどのモデルは主にフォーマルな読み上げ音声で訓練されているため、自発的な口語音声ではエラー率が高くなります。実用的な対策は、クリアな音声と明示的な言語選択です。

AIモデルはインドネシア語とマレー語を混同しますか?

はい、実際に起こり得ます。原因は構造的なものです。両言語は同じラテン文字、同じ1972年のEYD統一表記法、重なり合う語彙を共有しています。異なるのは借用語の出所(インドネシア語はkantorやtelevisiなどのオランダ語を取り入れ、マレーシアのマレー語は英語の同等語を取り入れた)と、語末母音の発音(インドネシア語は完全な/a/を保つのに対し、マレー半島のマレー語はシュワーに弱化させる)です。言語を指定せずに音声を送信すると、自動検出がid(インドネシア語)ではなくms(マレー語)を選んでしまうことがあります。必ず言語をインドネシア語に明示的に設定してください。

AIはインドネシア語と英語のコードスイッチングに対応できますか?

主要なモデルはかなりうまく対応しています。インドネシアのテックやビジネスの会話では、英語の用語がインドネシア語の文に日常的に混ざります。たとえば「Kami perlu deploy ke production sebelum meeting」や「Dia bikin konten untuk social media」のような文です。Deepgram Nova-3は多言語コードスイッチングを明示的にサポートしており、Whisperの多言語トレーニングもこのパターンをカバーしています。インドネシア語の単語はインドネシア語で、英語の用語は英語で出力されます。ジャワ語やスンダ語といった現地言語とのコードスイッチングはより難しく、それら自体は本番環境でサポートされている言語ではないためです。

文字起こしの観点で、バハサ・バクとバハサ・ガウルはどう違いますか?

バハサ・バクはニュース、政府、教育で使われる正式な標準インドネシア語で、ほとんどのASRモデルが訓練されているレジスターです。バハサ・ガウルは、非公式な会話、ソーシャルメディア、ポッドキャスト、多くのYouTubeコンテンツを支配する都市部の口語レジスターです。両者は代名詞(saya対gua)、形態論的な接尾辞(-kan対-in)、短縮形(sudah対udah)、そして命題内容を変えずに文のトーンを調整するモーダル助詞(dong/sih/deh/lah/kok)が異なります。文字起こしにおいては、同じスタジオで撮影されたカジュアルなVlogよりも、ニュース映像の方が通常きれいな結果になるということです。

出典

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles