
ケニアとタンザニア向けスワヒリ語文字起こし、2026年に使えるもの
Summarize this article with:
スワヒリ語は、ラテン文字表記、話者数の多さ、学習データの増加のおかげで、ほとんどのアフリカ言語よりAI文字起こしツールの対応が充実している。標準的なタンザニアのスワヒリ語(キスワヒリ・サニフ)が最も精度が高く、英語のコードスイッチングが混じるケニアの都市部スワヒリ語もほぼ同等に処理できる。一方、シェング語が多用された音声は最も難しく、手動での確認が必要になる。Happy Scribe、Trint、Google Cloud STTなどがスワヒリ語に対応しているが、方言やコードスイッチングへの精度はツールによって差がある。
スワヒリ語は、総話者数で見るとアフリカで最も広く話されている言語です。東アフリカと中央アフリカで、母語話者と第二言語話者を合わせて2億人以上の話者がいます。2025年11月には、ユネスコ総会の第7番目の公用語となり、アラビア語、中国語、英語、フランス語、ロシア語、スペイン語に加わりました。文字起こしの観点から言えば、この規模は重要です。話者が多ければ、オンライン上の音声も増え、研究投資も増え、サハラ以南の他の多くの言語よりも優れた学習データが得られるからです。
2026年にスワヒリ語の文字起こしが機能するかという短い答えは、はい、標準スワヒリ語と放送スワヒリ語については機能します。シェン語(スラング混じりの都市部方言)については、粗い部分を覚悟してください。
スワヒリ語が他のアフリカ言語より文字起こししやすい理由
スワヒリ語を、リソースの少ない他のアフリカ言語から際立たせる構造的な利点が3つあります。
ラテン文字で、発音記号なし。 スワヒリ語は完全に標準ラテンアルファベットで書かれ、声調記号や特殊文字、右から左への表記もありません。どの文字起こしエンジンの出力も、エンコーディングの問題なくあらゆるテキスト環境で正しく表示されます。
話者数の多さが学習データを押し上げる。 スワヒリ語の音声コンテンツは、他のほとんどのアフリカ言語よりも公開されているものが多くあります。研究者は、微調整されたモデルを使ってCommon Voiceのスワヒリ語で3.24%の単語誤認識率を達成しています。一方、同じクリーンなベンチマーク音声で、リソースの少ない多くの言語では25%以上のWER(単語誤認識率)が出ています。この差は、利用可能なラベル付きデータの量に完全に依存しており、スワヒリ語は周辺言語よりもその恩恵を大きく受けています。
標準化。 タンザニアの国家機関が推進する正式な標準語である「キスワヒリ・サニフ」は、ASRモデルに一貫した音韻論と語彙の基準を与えています。事実上の書き言葉の標準がない言語は、モデル化が難しくなります。
とはいえ、実際の音声はCommon Voiceとは違う。実用的な観点での文字起こし精度の解説で言えば、ベンチマーク上の明瞭な読み上げ音声と、雑音が混じる自然な会話は、まったく別のタスクだ。
ケニアのスワヒリ語とタンザニアのスワヒリ語:ASRに何が変わるか
ほぼすべての基盤はタンザニアのスワヒリ語だ。 主にダルエスサラームで標準化されたKiswahili sanifuは、国営メディア(TBC、ITV)が使い、学校で教えられ、ほとんどの学習コーパスが参照するものだ。音声がタンザニアのニュースルームのインタビューや公式スピーチなら、現在のスワヒリ語ASRの得意分野で作業していることになる。
ケニアの標準スワヒリ語は、KTNやCitizen TVで聞かれるものだが、ほぼ同等の性能だ。違いは実在するが劇的ではない。ケニアの話者は、音韻的に適応させるよりも英語の借用語をそのまま使う傾向が強く、母音の質も英語の影響でわずかにずれる。ASRエンジンは、コードスイッチングが予測可能なため、これを処理できる。
沿岸部のスワヒリ語(モンバサ、ザンジバル、古いKiungujaやKingare方言)は、アラビア語の語彙を多く含む。これは何世紀にもわたるオマーン貿易からの歴史的影響だ。これらのアラビア語由来の単語は語彙として確立され、学習データにも登場するため、沿岸部の音声は通常問題にならない。エラーが見られる場合、それは沿岸部以外のコンテンツでは過小評価されている、専門的なアラビア語由来の語彙に集中する傾向がある。
ウガンダのスワヒリ語は特殊なケースだ。ほとんどの都市部で母語ではなく簡略化された接触言語として話されており、Kiswahili sanifuからより大きく逸脱する。慎重に扱い、本番ワークフローに組み込む前にテストすべきだ。
Sheng語の問題
シェンは単にスワヒリ語の方言ではありません。ナイロビのイーストランズ地区で生まれ、今ではケニアの若者文化全体に広がる、クレオールに似た都市型社会方言です。その名前は頭字語で、スワヒリ語と英語を組み合わせ、さらにギクユ語、ドホロ語、カンバ語からの借用が多量に加わっています。
シェンがASRにとって本当に難しい理由:
- 標準的な正書法がない。同じスラング語が、トレーニングデータに登場する場合でも、5通りの綴りで現れることがある。
- 語彙の進化が速い。2年前に使われていた用語はすでに古く、新しいものが絶えず作られている。
- 3言語間の切り替え。標準的なコードスイッチングは2言語間で行われますが、シェンは1文の中で3つから4つの言語を行き来できます。
「Niko stuck na hii project, na deadline ni next week, lakini bado niko on track」のような文は、英語部分が一般的な高頻度語なので扱いやすいです。しかし、ギクユ語の語根や最近のスラングに依存するヘビーなシェンは、現在どのエンジンもうまく処理できないエラーを生み出します。コンテンツがシェン中心なら、手動レビューの工程を計画に入れてください。
一部のアフリカ言語変種がAIシステムにとって構造的に難しい理由の背景については、AIが低リソース言語に苦戦する理由を参照してください。
バントゥ語の形態論: 静かなASRの課題
ツールのレビューでめったに議論されない点があります。スワヒリ語の名詞クラスシステムは、英語中心のASRモデルがうまく扱うよう設計されていない組み合わせの複雑さを生み出します。 スワヒリ語には15以上の名詞クラスがあり、それぞれが動詞、形容詞、所有格、指示詞に独自の一致接頭辞を引き起こします。単一の動詞語根は、法の母音の前に、主語一致、時制、目的語一致、派生接尾辞を担うことができます。
これは文字起こしにとって重要な点です。なぜなら、モデルはインド・ヨーロッパ語族に並行するものがない語境界や接頭辞・接尾辞の構造を正しく割り当てなければならないからです。標準的なきれいなスワヒリ語は、形態パターンが規則的でトレーニングデータに十分に反映されているため、問題なく処理できます。しかし、話者が接頭辞の形を省略したり変形させたりする自発的な発話は、正しくデコードするのがより困難です。
2026年にスワヒリ語に対応しているツール
Happy Scribe は、この比較の中で最も明確にスワヒリ語に最適化された消費者向けツールです。AIによるスワヒリ語文字起こしの精度は約85%と自己報告されており、単一の録音内でのスワヒリ語と英語のコードスイッチングも検出します。人間による文字起こしは、ネイティブのスワヒリ語校正者による99%の精度で利用可能です。料金は月額€17(ベーシック、AI利用120分)から月額€89(ビジネス、AI利用6,000分)までの段階制で、追加分は1分あたり€0.20です。
Trint は、翻訳サポートとともに、40以上の対応文字起こし言語の中にスワヒリ語を挙げています。
Google Cloud Speech-to-Text は、V1とChirp搭載のV2の両方のAPIでスワヒリ語に対応しています。料金は分単位の従量制で、現在標準ティアでは1分あたり約$0.016、非リアルタイム作業向けのDynamic Batchオプションでは1分あたり約$0.004です。毎月60分の無料ティアもあります。GoogleのAPIにはスワヒリ語のAI要約はバンドルされておらず、要約には別途LLMの呼び出しが必要です。
AssemblyAI Universal-2 は、中程度の精度ティア(内部ベンチマークでWERが25%超から50%以下)でスワヒリ語に対応しています。これは、正式なベンチマークが示すよりも大幅に低い精度を意味し、多様な音声ベースにおける実際の自発的な発話を反映しています。AssemblyAIのUniversal-3 Proはより限られた言語セットに焦点を当てており、現時点ではスワヒリ語は含まれていません。
Otter.ai はスワヒリ語に対応していません。英語、スペイン語、フランス語、ドイツ語、日本語、中国語(簡体字)のみをカバーしています。
Deepgram Nova-3 は現在、スワヒリ語をサポート言語に含めていません。

| ツール | スワヒリ語サポート | コードスイッチング | スワヒリ語でのAI要約 | 料金モデル |
|---|---|---|---|---|
| Happy Scribe | あり(AI+人間) | あり、自動検出 | あり | 月額€17から |
| Trint | あり | 未指定 | 未指定 | サブスクリプション |
| Google Cloud STT | あり(V1+V2) | 限定的 | なし(別途LLM) | 従量制、約$0.016/分 |
| AssemblyAI Universal-2 | あり(中程度のティア) | 未指定 | 未指定 | 従量制(分単位) |
| Otter.ai | なし | 該当なし | 該当なし | 該当なし |
| Deepgram Nova-3 | なし | 該当なし | 該当なし | 該当なし |
私見ですが、標準的なスワヒリ語コンテンツなら複数のツールが使えて、違いはAI要約が必要か、人間によるフォールバックが要るか、定額制が好みかという点に絞られます。Shengが多用された音声の場合、現行のどのツールでもレビューパスを省くことはできません。
スワヒリ語文字起こしワークフローの構築
どのツールを使う場合でも当てはまる実用的なポイントをいくつか挙げます。
言語を明示的に設定する。 自動検出は、コードスイッチングの多いケニアのスワヒリ語を英語と誤認したり、別のバントゥー語としてタグ付けしたりすることがあります。sw(スワヒリ語)を指定すれば、モデルが事前に正しい語彙に固定されます。
固有名詞用の用語集を用意する。 ケニアやタンザニアの地名、人名、ブランド名は、音声的に書き起こされて修正が必要になるケースがよくあります。ほとんどのプロ向けツールはカスタム語彙や用語集リストに対応しているので、それを活用しましょう。
Shengが多いセクションは分割する。 録音にフォーマルなスワヒリ語のパートとShengが濃いパートが混在している場合、別々のジョブとして処理し、Shengのセクションは手動で編集した方が精度が上がることがあります。
話者分離は、構造化された会話で最も効果を発揮します。 標準的なスワヒリ語による正式な2者インタビューなら、精度よく分離できます。一方、電話音声や背景ノイズが混ざり、3人以上が話すラジオの電話参加型番組では、文字起こしテキスト自体の精度が高くても、ラベル付けのエラーが増える傾向にあります。
詳細な話者分離の解説、特に非英語音声での複数話者対応に何を期待すべきかについては、そのガイドで仕組みの基本を説明しています。
関連ワークフローへのクロスリンク
スワヒリ語に加えて他のアフリカ言語の文字起こしが必要な場合は、ナイジェリア向けハウサ語文字起こしガイドとアフリカ言語向け最適な文字起こしツールを参照してください。訓練データの不足がアフリカ全土での精度にどう影響するかを理解するには、AIが低リソース言語で苦戦する理由が参考になる投稿です。
ポッドキャスト向けのワークフローで、エピソードにスワヒリ語と英語が混在する場合は、ポッドキャスト向け最適な文字起こしガイドが、ファイル形式の選択、話者ラベルの設定、字幕の書き出しをカバーしています。
ミーティングボットやサブスクリプションの席数管理なしで、クリーンなスワヒリ語の文字起こしだけが必要なら、ConvertAudioToTextはあらゆる音声・動画形式に対応し、分単位の課金なしで月額$9.99のProプランで利用でき、文字起こしテキストに加えてSRTやVTT形式の書き出しも生成します。
FAQ
Whisperはスワヒリ語に対応していますか?
はい。スワヒリ語はWhisperの言語リストにある99言語のうちの1つです。標準スワヒリ語は明瞭な読み上げ音声では良好な結果を出しますが、自発的な発話、頻繁なコードスイッチング、シェン語(Sheng)が入ると誤り率が大幅に上がります。専門的なファインチューニングを用いた学術ベンチマークでは、Common Voiceスワヒリ語でWER 4%未満を達成していますが、一般的なWhisperを実世界の音声に使うと、特に非標準的な発話では誤り率の幅が広がります。
ケニアのスワヒリ語とタンザニアのスワヒリ語では、文字起こしにどんな違いがありますか?
タンザニアのスワヒリ語(Kiswahili sanifu)は、学校や放送メディアで使われる標準形で、母音の発音が明瞭で語彙も保守的です。標準スワヒリ語のテキストと音声で訓練されたAIエンジンは、この変種で最も良い性能を発揮します。一方、ケニアのスワヒリ語は英語とのコードスイッチングが多く、地域的な音韻の影響も加わるため複雑さは増しますが、現在のツールで十分対応できる範囲内です。ナイロビの都市クレオールであるシェン語は最も難しく、語彙の進化が速く標準的な正書法もないからです。
スワヒリ語に対応している文字起こしツールはどれですか?
Happy Scribe、Trint、Google Cloud Speech-to-Textはすべてスワヒリ語に対応しています。Happy ScribeはAIによるスワヒリ語の文字起こしで約85%の精度を自称しており、人間による文字起こしは99%の精度を提供しています。Trintは40以上の言語リストにスワヒリ語を含めています。Google Cloud STTはV1とV2の両APIでスワヒリ語をサポートしています。Otter.aiはスワヒリ語に対応しておらず(6言語のみ)、Deepgram Nova-3も現時点ではサポート言語にスワヒリ語を挙げていません。
スワヒリ語と英語のコードスイッチングは精度にどう影響しますか?
軽度から中程度のコードスイッチング、ケニアの標準的なメディアでよく見られるタイプは、Whisperのような多言語モデルでかなりうまく処理されます。英語の単語はラテン文字で転写され、通常のスワヒリ語の正書法と一貫しているため、出力は自然に読めます。しかし、ヘビーなシェンは別です。急速に進化するスラングと、スワヒリ語、英語、ナイロビの現地語(ギクユ語、ドホロ語、カンバ語)の3方向の混交により、現在のどのASRシステムにとっても本当に難しく、手動でのレビューパスが必要になることを想定すべきです。
出典
- AssemblyAI対応言語のドキュメント
- Happy Scribeのスワヒリ語文字起こしページ
- Happy Scribeの料金
- Trint対応言語のヘルプセンター
- Google Cloud Speech-to-Text対応言語(V2)
- Google Cloud Speech-to-Textの料金
- Otter.ai対応言語のヘルプセンター
- Deepgramのモデルと言語の概要
- OpenAI Whisperの言語リスト(Hugging Face)
- 低リソース言語スワヒリ語ASR向け継続事前学習(arxiv 2603.11378)
- ユネスコがキスワヒリ語を総会の公用語として承認
- アフリカ連合がスワヒリ語を公用語として採用
- ケニアにおけるシェン語とコードスイッチング(ケンブリッジ)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Arabic Transcription: MSA vs Dialects in ASR (2026 Guide)
How diglossia shapes Arabic speech-to-text accuracy. MSA vs Egyptian, Gulf, Levantine, and Maghrebi dialects: WER data, engine support, and script mechanics explained.

Best Transcription for African Languages in 2026: Honest Rankings
Which engines actually support Swahili, Hausa, Yoruba, Amharic, Wolof, and Zulu in 2026? Verified support matrices, honest WER context, and the tools that genuinely work.