
ヨルバ語文字起こし:声調、発音区別符号、そしてこれからの道筋
Summarize this article with:
2026年時点のヨルバ語文字起こしは厄介な中間地帯にあります。Whisperにトークンは存在し、コミュニティによる600時間超の新規音声データと活発な学術研究がありますが、未ファインチューニングのモデルでは単語誤り率(WER)が依然として100%を超え、適切な声調記号付き出力も大規模には未解決です。「部分的な対応」と「本番対応可能」の間の隔たりは現実的で、測定可能なものです。コミュニティの取り組み(NaijaVoices、ÌròyìnSpeech、Masakhane)がこの差を縮めており、ファインチューニング済みチェックポイントはWERを50〜60%台まで押し下げました。放送グレードにはまだ届かないものの、これは確かな進歩です。本記事では、ヨルバ語が技術的に難しい理由、研究の到達点、そして今日取れる正直な回避策を解説します。
ヨルバ語はアフリカで最も話者の多い言語の一つです。ナイジェリア南西部、ベナン、トーゴに約5,000万人の話者を抱え、英国、米国、ブラジルにも大きなディアスポラがあります。文字起こしへの需要は確かなものです。ヨルバ語のNollywoodチャンネルはYouTubeで1日あたり数百万回視聴されており、ヨルバ語のポッドキャストは主要プラットフォームのどこでも増えています。それにもかかわらず、2026年半ばの時点で、ヨルバ語の文字起こしは居心地の悪い位置にあります。主要なASRエンジンの技術的な対象範囲内ではあるものの、本番利用に耐えるほどの精度はないのです。
これは、その理由、研究がどこまで到達したのか、そして今日実際に何ができるのかについての率直な記録です。
三声調システムは単なる脚注ではない
ヨルバ語は、発音だけでなく意味そのものを直接決める形で声調を持つ言語です。 この言語は3つのレジスタ声調を使います:
- 高声調——鋭アクセントで表記:á
- 低声調——重アクセントで表記:à
- 中声調——無標記
古典的な例:ọ́kọ̀(高低)は「夫」、ọ̀kọ̀(低低)は「鍬(くわ)」、ọkọ̀(中低)は「乗り物」を意味します。話される違いはピッチであり、書かれる違いは発音区別符号です。記号を取り去れば、意味は崩壊します。
声調記号以外にも、標準ヨルバ語は開母音と硬口蓋歯茎音に対して下点(サブドット)の発音区別符号を使います:ẹ(開いたe、「pet」のような音)、ọ(開いたo、「off」のような音)、ṣ(英語の「sh」に近い音)。声調記号はさらにこれらの上に重ねられます:ẹ́、ẹ̀、ọ́、ọ̀。この正書法は1875年に宣教師と現地の学者らが組織したラゴス会議で標準化され、その規格は今日まで保たれてきました。
本番品質のヨルバ語文字起こしは、すべての発音区別符号を保持しなければなりません。記号のない文字起こしは技術的には読めるものの、意味情報が欠落しています。英語の法律文書から句読点を剥ぎ取るのに等しいのです。
なぜASRは特に声調の発音区別符号につまずくのか
問題は単なる「低リソース」ではありません。アーキテクチャ上の問題です。
ACLで発表された2026年の研究では、現在のTransformerベースのASRモデルは、声調記号を除去したヨルバ語テキストの方が、完全に発音区別符号付きのテキストよりむしろ低い誤り率を出すことが分かりました。 著者らはこれを3つの要因に帰しています:トークン化の挙動(ほとんどのトークナイザーは欧州の文字体系向けに設計されており、発音区別符号付き文字を予測不能な仕方で分割する)、事前学習データにおける声調の音響的手がかりの表現不足、そして基盤モデルの目的関数に声調モデリングが存在しないこと。
これは直感に反する発見です。モデルが単に声調をマーキングできていないのではなく、訓練中に参照テキスト内の記号の存在によって積極的に混乱させられていることを意味します。ヨルバ語の文字起こしをきちんと解決するには、より多くのヨルバ語音声を追加するだけでなく、声調の発音区別符号がどうトークン化されるかを再考する必要があります。
このパターンが複数の低リソース声調言語に共通して現れる理由については、AIが低リソース言語に苦戦する理由をご覧ください。
数字の現在地
NaijaVoicesデータセット論文(Interspeech 2025)は、未ファインチューニングのモデルにおけるヨルバ語ASRの最も明快な公開ベンチマークを提供しています:
| モデル | ベースラインWER(ヨルバ語) | ファインチューニング後 |
|---|---|---|
| Whisper Small | 319.90% | 58.10% |
| Whisper Large | 106.23% | (個別報告なし) |
| MMS Base | 100%超 | 51.65% |
| XLSR Multilingual | 100%超 | 65.14% |
WERが100%を超えるというのは、モデルが参照単語数より多くの単語誤りを生み出すことを意味します。通常はハルシネーションテキストやフレーズの繰り返しによるものです。106%というベースラインのWhisper Largeは、クリーンなヨルバ語音声に対して本質的にノイズを出力している状態です。
本当に興味深いのはファインチューニング後の結果です。NaijaVoicesでWhisper Smallをファインチューニングすると、誤り率は約260ポイント低下します。劇的な改善ですが、58%というWERは、実用レベルの英語で典型的な15%未満の範囲からは依然としてほど遠く、「劇的に良くなった」と「人間の審査なしで使える」の間の隔たりは依然として大きいままです。
これらの誤り率が他の言語やサービスと比べてどうなのかについては、文字起こし精度の解説をご覧ください。

方言の分断が状況をさらに悪化させる
標準ヨルバ語のASRは、悪いとはいえ、方言に対しては測定可能な差でまだ上回っています。
ゼロショット設定でMMSとSeamlessM4Tを検証した研究では、標準ヨルバ語と地域方言の間に平均12ポイントのWER差があることが分かりました。 具体的な数字は、標準ヨルバ語72.50 WER、Ifẹ̀方言85.38、Ìlàjẹ方言83.79です。
ヨルバ語には少なくとも5つの地域グループがあり、北西部(オヨ、オグン)、北東部(クワラ)、中部、南西部、南東部それぞれに音韻的・語彙的・子音面の違いがあります。オグン州周辺で話されるイジェブ方言には、標準の書き言葉には現れない子音交替や母音の区別が記録されています。ラゴスのニュース朗読音声で訓練されたモデルは、エキティやオンドで録音されたインタビューを大幅な精度低下なしに処理することはできません。
1方言あたりわずか800件の訓練データで方言適応型のファインチューニングを行ったところ、研究者らは約20ポイントのWER削減を達成しました。少量のデータでも状況は動きますが、誰かがまず方言固有の音声を収集しラベル付けしなければならないことに変わりはありません。
ラゴスの話し言葉におけるコードスイッチング
都市部ラゴスのヨルバ語は、1文の中で1つの言語にとどまりません。話者は句の途中でヨルバ語、英語、ナイジェリア・ピジンの間を行き来します。ある文はヨルバ語で始まり、途中に英語の専門用語を挿入し、ピジンの表現で締めくくるかもしれません。話者にとってはそれがすべて文法的に一貫しています。
2025年のACLのヨルバ語・英語コードスイッチングに関する論文では、バイリンガル話者140名による自然発話のコードスイッチング音声120時間を収めたYECS Corpusで単一言語ASRモデルをファインチューニングすると、コードスイッチング音声で20%超のWER削減を達成したことが報告されています。 その一方で、標準ヨルバ語でも競争力のある性能を維持しました。単一言語のファインチューニング済みモデルは多言語の代替案より計算コストが安く、それでもギャップの大部分を埋めました。
実務上の要点:汎用の多言語モデルは、コードスイッチング音声の英語部分を部分的には処理できるものの、ヨルバ語部分と切り替わりの部分ではつまずきます。フォーマルで話者が一人、発音区別符号付きのヨルバ語で録音されたコンテンツは、会話調のラゴス音声よりうまく文字起こしされます。それはラゴスのヨルバ語が「不正確だから」ではなく、ASRモデルが前者で訓練され後者で訓練されていないからです。
コードスイッチングが各言語の精度に与える影響について詳しくは、非ネイティブ英語話者のための文字起こしをご覧ください。
コミュニティのデータセット整備:現状にあるもの
ヨルバ語のリソース事情は5年前より良くなっています。現在、いくつかの具体的なデータセットが公開されています:
ÌròyìnSpeech(LREC 2024):ボランティア80名の話者による完全に発音区別符号付きのヨルバ語音声42時間。ニュースと創作から収集されています。CC-BY-4.0で公開されており、商用のモデル訓練に使用できます。発音区別符号付きの参照テキストがあるため、特に声調マーキングの研究に役立つ点が注目に値します。
NaijaVoices(Interspeech 2025):1,768名の話者によるヨルバ語音声606.94時間。複数のナイジェリアの言語をカバーする1,800時間のデータセットの一部です。現在最大のオープンなヨルバ語音声コーパスです。話者の多様性は、方言カバレッジに向けた重要な一歩です。
YECS Corpus:人口統計学的に多様なバイリンガル話者140名による高品質のヨルバ語・英語コードスイッチング音声120時間。検証済みの音声・テキストペア99,930件。コードスイッチング問題のために特別に設計されたものです。
Masakhane(30のアフリカ諸国から1,000名以上が参加する草の根のアフリカNLPコミュニティ)は、十分に代表されていない5言語のために500時間の音声を収集するという2025年の目標を掲げています。ヨルバ語がその対象群に含まれるかは、本稿執筆時点で公には確認されていませんが、同団体は以前からベンチマークやデータセットの取り組みを通じてヨルバ語NLPの活動を支援してきました。
全体像としては、複数のコレクションを合わせると700時間超のオープンなヨルバ語音声が現在存在します。これはファインチューニングにとって十分に使える土台です。もはや制約はデータの欠如ではなく、音声と完全に発音区別符号付きの参照文字起こしとの整合性、そして大規模で方言バランスの取れたカバレッジの欠如です。
本番グレードのヨルバ語対応に実際に必要なもの
軽い編集で実用的になる文字起こしに必要な85〜90%の精度帯にヨルバ語を到達させるには、以下のすべてが同時に実現する必要があります:
-
声調を考慮したトークン化。 現在のモデルは、発音区別符号付きのヨルバ語の文字を「基底文字+結合記号」ではなく1単位として扱うトークナイザーで再訓練またはファインチューニングされる必要があります。これは事前学習の問題であり、単なるファインチューニングのパッチではありません。
-
大規模な発音区別符号付き参照データ。 ニュース分野のデータ(ÌròyìnSpeechが提供するもの)は始まりにすぎません。会話調で方言多様なデータが大規模にあることで、ラボ性能と実世界の音声の間のギャップが埋まります。
-
コードスイッチング処理の組み込み。 特にラゴスのコンテンツについては、ヨルバ語・英語の切り替わりを最小化すべき誤りとして扱うモデルは、研究者やジャーナリストが文字起こししたい実際の素材で常に期待通りの性能を出せません。
-
方言カバレッジ。 方言で12ポイントのWERペナルティがあるということは、標準ヨルバ語で凡庸なモデルが地域の話し言葉では実際にはダメだということです。訓練データにおけるより幅広い話者の多様性は必須であり、任意ではありません。
2026年の研究状況を見ると、4つの領域すべてが同時に取り組まれているようです。データセットの土台自体がボトルネックだった3年前より良い状況です。
今日ある選択肢の比較
| アプローチ | ヨルバ語対応 | 声調記号 | コードスイッチング | 状況 |
|---|---|---|---|---|
| Whisper Large-v3(既製) | 部分的(言語コード「yo」) | 不安定、しばしば脱落 | 弱い | WER 100%超、本番対応不可 |
| ファインチューニング済みWhisperチェックポイント | 向上中 | 発音区別符号付き訓練データで改善 | 訓練セット次第 | ファインチューニング後WER約58% |
| MMS(Meta、ファインチューニング済み) | 向上中 | Whisperよりヨルバ語の記号を尊重 | 限定的 | ファインチューニング後WER約51% |
| 専門のヨルバ語ASRサービス | あり(一部) | 専門ツールでは良好 | 限定的 | 様々、各自で要確認 |
| 人間による文字起こし | あり | 完全 | 完全 | 正確だが時間と費用がかかる |
関連する比較については、2026年の最高の音声認識APIをご覧ください。
2026年の実践的な推奨事項
今すぐヨルバ語の音声を文字起こしする必要がある場合:
調査・ドラフト用途: 言語コード「yo」を指定して、Whisperまたはファインチューニング済みチェックポイントにルーティングするAPI経由で送信してください。出力は部分的に正しいヨルバ語テキストになり、声調記号が抜けたりハルシネーション部分が混じったりすることがよくあります。流暢なヨルバ語話者によるレビューパスを予算に組み込んでください。特に固有名詞、地名、声調で意味が変わる用語には注意が必要です。
フォーマル・法務・放送用途: AIのみによるヨルバ語文字起こしはまだそこまで達していません。資格を持つヨルバ語文字起こし担当者による人間の文字起こしが引き続き正確な道です。AIの出力は、文字起こし担当者の作業負荷を減らすための大まかな初稿として使い、完成品として使わないでください。
ヨルバ語が厳密には不要な西アフリカ系コンテンツ: ハウサ語文字起こしは今日、本番レベルの精度で動作しています。多くのナイジェリアのクリエイターは両言語で活動しており、言語を選べるコンテンツなら、現時点ではハウサ語の方がきれいな選択肢です。
私見では、ヨルバ語は「モデルがこの言語の存在を知らない」という段階から「モデルが認識できる何かを出力する」段階へと閾値を越えました。そこから本番対応可能までのギャップは依然として大きいものの、2025〜2026年の研究の勢いとデータ量は、このギャップが埋まるだろうことを示すこれまでで最良のシグナルです。ただし今日の正直な答えは、AIエンジンが出力するヨルバ語の文字起こしはすべて、知識のある人間がループに入る必要がある、ということです。
会議ボットや複雑な統合なしにきれいな文字起こしだけが必要なら、ConvertAudioToTextはAPI経由でヨルバ語に対応しており、編集用の生出力を提供します。これは出発点であって、この言語の完成されたソリューションではありません。
FAQ
Whisperはヨルバ語に対応していますか?
Whisperは言語コード「yo」としてヨルバ語を含んでおり、large-v3以来そうなっています。しかし名目上の対応は実質的な対応ではありません。ファインチューニング前のWhisper Largeでのヨルバ語のベースラインWERは100%を超え、正しい単語よりも誤りの単語の方が多いという意味です。NaijaVoicesデータセットでファインチューニングした後、Whisper Smallは約58%のWERまで低下しますが、改善とはいえ放送や法務の品質からは依然としてほど遠い水準です。
ヨルバ語はなぜ他のアフリカ言語よりも音声認識がうまくいかないのですか?
3つの重なり合う理由があります。第一に、ヨルバ語はピッチが単語の意味を変える三声調言語であり、現在のASRトークナイザーは発音区別符号を前提に設計されていません。2026年のACLの研究では、モデルは完全に発音区別符号付きのテキストよりも、声調記号を除去したテキストの方で実際に低い誤り率を出すことが分かっています。発音区別符号そのものがトークン化を壊すためです。第二に、ヨルバ語には測定可能な音韻差を持つ少なくとも5つの地域方言グループがあり、標準ヨルバ語で訓練されたモデルはIfẹ̀やÌlàjẹなどの方言でおよそ12ポイントのWER差を示します。第三に、都市部ラゴスの話し言葉は文中で英語と激しくコードスイッチングし、ほとんどのモデルはどちらか一方の言語は扱えても、混合は扱えません。
ヨルバ語音声のコミュニティデータセットにはどのようなものがありますか?
2026年半ば時点で、いくつかの実証済みのデータセットがあります。ÌròyìnSpeech(LREC 2024発表)はボランティア80名の話者による完全に発音区別符号付きのヨルバ語42時間を含み、CC-BY-4.0で公開されています。NaijaVoices(Interspeech 2025)は1,768名の話者によるヨルバ語音声606時間を加え、現時点で最大のオープンセットです。YECS Corpusはバイリンガル話者140名による自然発話のヨルバ語・英語コードスイッチング音声120時間を提供しています。コミュニティNLP団体のMasakhaneは、十分に代表されていない5つのアフリカ言語のために500時間を収集する2025年の目標を掲げており、ヨルバ語がその対象です。
ヨルバ語の文字起こしツールは今すぐ使うべきですか、それとも待つべきですか?
大まかな下書きと手作業の編集で許容できるカジュアルな調査やコンテンツの場合、言語コード「yo」でWhisperを使うことは今日、有効な出発点になります。流暢な話者による完全な編集パスを計画に入れてください。特に声調記号と固有名詞についてです。放送、法務、正式な出版ワークフローの場合、精度はまだ足りていません。コンテンツが許すなら、ハウサ語文字起こしは現在本番レベルの精度で動いており、西アフリカのコンテンツワークフローとの重なりも大きくカバーします。
出典
- Tone in Yoruba ASR: Evaluating the Impact of Tone Recognition on Transformer-Based ASR Models (ACL 2026)
- ÒWE-Voice: Evaluation of Monolingual and Multilingual ASR Using Yoruba Proverb Speech (AfricaNLP 2026)
- Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects (EMNLP 2024)
- The NaijaVoices Dataset (Interspeech 2025)
- ÌròyìnSpeech: A Multi-purpose Yorùbá Speech Corpus (LREC 2024)
- Fine-Tuning Monolingual ASR for Yoruba-English Code-Switching (CALCS 2025)
- Automatic Speech Recognition for African Low-Resource Languages: A Systematic Review (2025)
- Masakhane コミュニティ
- ヨルバ語 - Wikipedia
- OpenAI Whisper トークナイザー - GitHub
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.