
アムハラ語文字起こし:ゲエズ文字とエンジンの現実
Summarize this article with:
アムハラ語は、いくつかの主要ASRエンジンで書類上は対応言語ですが、サポート品質には劇的な差があります。AssemblyAIのUniversal-2モデルは、ベンダー自身が「Fair accuracy(普通の精度)」という警告付き(WER 50%超)でカバーしています。Google CloudのChirpファミリーとAWS Transcribeはどちらもam-ETに対応していますが、Whisper large-v3はクリーンなアムハラ語音声で100%超の文字エラー率が報告されており、深刻なハルシネーションや挿入動作を示しています。正確なフィデル文字の出力が仕事の要となるなら、大幅な編集工程を見込むか、アムハラ語優先のワークフローには研究レベルのエチオピア向けモデルを検討してください。
アムハラ語は約3,200万人の母語話者を持ち、エチオピア連邦政府の公用語です。AI文字起こしにおいて、正確に処理するのが最も難しいセム系言語の一つです。**核心的な問題は、ツールがアムハラ語を無視していることではありません。対応を謳うツールの多くが、マーケティングが示唆する内容よりはるかに劣るパフォーマンスしか出せないことです。**この記事では、主要な各エンジンがアムハラ語で実際にどう動くのか、なぜフィデル文字が特有の失敗モードを生み出すのか、そして2026年の実用的なワークフローがどうなるのかを解説します。
ゲエズ文字と、それがASRを特別な形で壊す理由
アムハラ語はゲエズ文字(アムハラ語ではフィデルと呼ばれます)で書かれます。フィデルはアルファベットではなく、音節文字です。33の基本文字のそれぞれが子音と母音のペア全体を表し、各基本文字には7つの母音変化形があり、日常的に使われるだけで200以上の異なる文字になります。音節ሀ(ha)はሁ(hu)、ሂ(hi)、ሃ(haa)、ሄ(he)、ህ(子音のみ)、ሆ(ho)へと変化します。1文字の誤置換は綴りの間違いではなく、単語全体のエラーになるのです。
**これが、同等の学習データ量でもゲエズ文字の言語がラテン文字の言語より構造的に高い単語エラー率を示す理由です。**アフリカ諸言語間でASRを比較した研究では、テスト条件が他の点で揃えられていても、ゲエズ文字の言語は最良のファインチューニングWER平均約43.5%に対し、ラテン文字のアフリカ諸言語は約36.2%であることが分かっています。文字体系そのものがペナルティの一部であり、データ不足だけが原因ではないのです。
文字体系レベルの3つの特徴が、アムハラ語を特に難しくしています:
**ジェミネーション(子音重複)は書き言葉では見えません。**話されるアムハラ語では、子音の長さは音韻的な特徴です。aläは「彼は言った」、alläは「〜がある」を意味します。しかし文字はどちらも区別しません。フィデル出力を目指すASRシステムは、音声と文字のマッピングだけからジェミネーションを推論できず、ほとんどのモデルが扱えるよう訓練されていない音韻論的な文脈が必要です。
**複数の文字が同じ音を共有しています。**haグループ、aグループ、saグループには、現代アムハラ語の発音で音声学的に同一の文字が含まれます。モデルが同じ音を聞いたとき、どのフィデル文字を書くべきか推測しなければなりません。同音異字の曖昧さは、音素認識が正確でも誤差の下限を作ってしまいます。
**唇音化した子音は複数文字のシーケンスを使います。**アムハラ語の20の唇軟口蓋音と18の唇音化された字形は、2〜3の子音・母音音節の組み合わせで表されます。これらのシーケンスを明示的に処理しないモデルは、断片化した、あるいは誤った出力をしがちです。
これらのパターンがアフリカの低リソース言語全般に見られる背景については、AIが低リソース言語で苦戦する理由をご覧ください。
主要エンジンが実際にサポートしている範囲
以下の比較は、2026年7月時点で確認済みのドキュメントに基づいています。
| エンジン | アムハラ語対応 | 言語コード | 精度ティア | 備考 |
|---|---|---|---|---|
| Google Cloud STT | 対応 | am-ET | 非公開 | Chirp、Chirp 2、Chirp 3モデル |
| AWS Transcribe | 対応 | am-ET | 非公開 | バッチおよびストリーミング |
| AssemblyAI | 対応(Universal-2のみ) | am | Fair(WER 50%超) | Universal-3 Proには非搭載 |
| Whisper large-v3 | 名目上対応 | am | 低い | ベンチマークでCER 100%超が報告 |
| Deepgram Nova-2/Nova-3 | 非対応 | なし | なし | 対応言語リストに不在 |
| Ethio-ASR(研究) | 対応 | am | WER約30%(報告値) | オープンな研究モデル、WAXALコーパス |
**Google Cloud Speech-to-Text(am-ET)**はChirpモデルファミリーで利用可能で、自動句読点機能にも対応しています。Googleはアムハラ語の言語別精度ベンチマークを公表していないため、自分の特定の音声タイプでの品質は独自にベンチマークする必要があります。
**AWS Transcribe(am-ET)**はバッチとストリーミングの両方の文字起こしに対応していますが、アムハラ語ではカスタム言語モデル、PII編集、Call Analyticsといった高度な機能には対応していません。ベースラインの文字起こし経路です。
AssemblyAIのUniversal-2モデルは、アムハラ語の精度ティアを公表している唯一の主要商用APIです。同社はこれを「Fair accuracy(普通の精度)」に分類しており、単語エラー率50%超を意味します。出力品質が重要なワークフローにとっては重大なハンディキャップです。AssemblyAIの他のほとんどの言語をカバーする上位のUniversal-3 Proモデルには、執筆時点でアムハラ語は含まれていません。
Whisper large-v3は対応言語の中にアムハラ語を挙げていますが、ベンチマーク結果は違う物語を語ります。FLEURSのクリーンなアムハラ語音声に対して、Whisper large-v3の文字エラー率が100%超との報告があり、参照テキストに含まれる文字よりも多くの文字を挿入・繰り返し・ハルシネーションしていることを意味します。これはおそらく、限られたアムハラ語学習データと、フィデル文字の割り当てに関するモデルの苦手さによって悪化したハルシネーションパターンです。Whisper large-v2は同じ程度にはこの退行を共有していません。アムハラ語データセット(FLEURS、Mozilla Common Voice、ドメイン固有コーパス)で特化して学習されたファインチューニング版Whisperは、有意に良い性能を示します。2025年3月の論文「Whispering in Amharic」は、同音異字の正規化とFLEURS併用学習がベースモデルよりWERを大幅に削減することを示しています。
Deepgram(Nova-2とNova-3)は対応言語リストにアムハラ語を含んでいません。どちらのモデル階層もこの言語をカバーしていません。
これらのエンジン間での価格設定と機能の深さの違いを広く見るには、文字起こし価格比較とAWS Transcribe価格ガイドをご覧ください。

エチオピアにおけるアムハラ語:現実のユースケース
アムハラ語文字起こしへの需要は現実のものであり、特定のセクターに集中しています。ユースケースを理解することが、どのツールが適切かを左右します。
**エチオピア放送公社(EBC)**は、首都アディスアベバに拠点を置く同国最古最大の放送局です。主な放送言語はアムハラ語で、オロモ語、ソマリ語、ティグリニャ語、アファル語も追加でカバーしています。EBCコンテンツを扱うジャーナリスト、研究者、メディア監視者は、アムハラ語ASRの課題のすべてに直面します。複数話者のニュースルームのアムハラ語、地域のアクセント、技術用語と政治用語、速い話速です。
連邦政府の文書業務はアムハラ語で行われます。法的手続き、政策文書、公式会議は、記録保存、アクセシビリティ、アーカイブのために文字起こしが必要なアムハラ語音声を生み出します。ここでの精度基準は高く、「Fair accuracy」やWER 50%超の出力は、大規模なレビューなしには使えません。
**エチオピア離散民(ディアスポラ)**は、家族やコミュニティのコンテンツ(インタビュー、ポッドキャスト録音、宗教番組、文化イベント)の文字起こし需要を生み出しています。こうした音声には、アムハラ語と英語(米国・欧州のディアスポラコミュニティ)またはアムハラ語とアラビア語(湾岸・中東のコミュニティ)のコードスイッチングが含まれがちです。コードスイッチングはあらゆる単一言語モデルを混乱させます。
調査とジャーナリズムは、エチオピアの政治・社会イベントを追跡する中で、インデックス化と翻訳が必要なアムハラ語音声をますます多く生み出しています。エチオピアで活動する学術機関や国際NGOは、この問題に日常的に直面しています。
関連するアフリカ言語の文字起こしワークフローについては、ケニアとタンザニアのスワヒリ語文字起こし、ナイジェリアのハウサ語文字起こし、そしてアフリカ言語に最適な文字起こしの概観ガイドが、それぞれ異なる言語の角度から同じASR品質の状況を扱っています。
今日の実用的なアムハラ語ワークフロー
この精度事情を踏まえると、本番品質のアムハラ語文字起こしには、どのエンジンを使っても人手による編集工程が必要です。問題は、どのエンジンが最良の出発点を与えてくれるかです。
Google CloudまたはAWSのインフラを使っているなら、まずそれらのネイティブなアムハラ語エンドポイントから始めましょう。モデル移植の手間なくフィデル文字の出力が得られ、既存のクラウドパイプラインにも統合できます。スケールする前に、実際の音声の5〜10分のサンプルでベンチマークしてください。
既知の精度下限を持つAPIエンドポイントが必要なら、AssemblyAIのUniversal-2モデルが最も透明性の高い商用オプションです。精度ティアを宣言しており、推測で選ぶ必要がありません。WER 50%超という分類は、使用前に流暢なアムハラ語話者がすべてのトランスクリプトをレビューすることを計画に入れるべきことを意味します。
自前のインフラを運用していてファインチューニングの時間があるなら、FLEURSとCommon Voiceのアムハラ語データを合わせて学習したWhisper-smallモデルは、アムハラ語において市販のままのlarge-v3モデルを上回ります。WAXALコーパスで5つのエチオピア言語にわたって学習されたEthio-ASR研究モデルは、研究ベースラインとして平均WER約30%を示しています。
**どんな出力でも確認すべき一つのこと:**モデルがラテン文字への転写ではなくフィデル文字を出力していることを確認してください。「እና አለ」の代わりに「ena alle」を受け取ったら、その出力はアムハラ語読者には使えず、精度の問題だけでなく文字生成の失敗を意味します。
同じ録音に複数のアフリカ言語が含まれるワークフローや、アムハラ語と英語が混在する場合、今日利用できるすべてのエンジンでコードスイッチングの精度は単一言語のアムハラ語性能より弱いことに注意してください。これは設定の問題ではなく、未解決の研究課題です。
他の音声ファイル用の文字起こしツールが必要なら、ConvertAudioToTextが幅広い言語を高い精度で処理します。アムハラ語に関しては正直に言えば、レビュー工程なしで本番グレードの出力を届けるツールは今日存在せず、どのエンジンを選んでも、それはワークフローと予算に組み込むべきギャップです。
研究の動向
アムハラ語ASRは2022年から2026年にかけて大きく前進しましたが、その大部分は商業投資ではなく学術・研究の努力によるものです。注目すべき3つの進展があります:
Ethio-ASRプロジェクト(2026年3月)は最新の多言語エチオピアASR研究で、WAXALコーパスを使用してアムハラ語に加えティグリニャ語、オロモ語、シダモ語、ウォライタ語をカバーしています。言語族に焦点を当てることで、OmniASRのようなより大型の多言語モデルを少ないパラメータで上回っています。この種のモデルは、研究が成熟すれば商用APIに組み込まれる可能性が高いでしょう。
MetaのMassively Multilingual Speech(MMS)プロジェクトは、1,100言語の音声認識モデルでアムハラ語をカバーしています。MMSはHugging Faceでオープンソースのチェックポイントとして入手可能です。本番利用には洗練されていませんが、アムハラ語を含む低リソース言語で利用できる最も広範なカバレッジの選択肢の一つです。
GoogleのChirp 3モデルは、複数のリージョンでam-ET対応のアムハラ語を含むようになりました。Chirp 3はGoogleの最新の音声基盤モデルであり、アムハラ語の追加は、以前のGoogle STT提供になかったこの言語への商業投資を示唆しています。
傾向は好意的ですが、「対応リストに載っている」と「レビューなしで本番対応」の間のギャップは、2026年のアムハラ語では依然として大きいままです。それを踏まえた計画を立ててください。
よくある質問
Whisperはアムハラ語に対応していますか?
Whisperは99以上の対応言語の中にアムハラ語を挙げていますが、実際のパフォーマンスは低いです。研究ベンチマークでは、クリーンなアムハラ語音声に対するWhisper large-v3の文字エラー率が100%超と報告されており、モデルが正しく文字起こしする量よりも多くの文字を挿入・繰り返し・ハルシネーションしていることを意味します。ファインチューニングされたWhisper派生モデル(FLEURSとCommon Voiceのアムハラ語データで学習)は有意に良い結果を出しますが、ベースモデルは本番環境のアムハラ語文字起こしには信頼できません。
Google Cloud Speech-to-TextやAWS Transcribeはアムハラ語を処理できますか?
両方ともアムハラ語に対応しています。Google Cloud Speech-to-TextはChirp、Chirp 2、Chirp 3モデルでam-ETをサポートしています。AWS Transcribeはバッチとストリーミングの両方の文字起こしでam-ETをサポートしています。ただしいずれのサービスもアムハラ語固有の精度数値を公表していないため、ワークフローに組み込む前に、自分の音声の代表的なサンプルでベンチマークすべきです。
なぜフィデル文字はラテン文字の言語よりもアムハラ語ASRを難しくするのですか?
フィデルは各文字が子音と母音のペア全体を表す音節文字です。つまり、1文字でも誤置換されると部分的な綴りの間違いではなく、完全な単語エラーとしてカウントされます。さらに、アムハラ語の表記法ではジェミネーション(意味を区別する重複子音。alä「彼は言った」とallä「〜がある」のような例)が表記されず、複数の異なるフィデル文字が同じ発音を共有しています(haグループ、aグループ、saグループ)。これらの曖昧さが、ラテン文字の言語では同じ割合で直面しない形でASRのエラーを悪化させます。
現在利用できる最も精度の高いアムハラ語ASRの選択肢は何ですか?
研究モデルのEthio-ASRは、WAXALコーパスを使ってアムハラ語と他の4つのエチオピアの言語で共同学習され、2026年3月のベンチマークで平均WER約30%を達成しており、これは学術界の最先端です。商用サービスの中では、AssemblyAIのUniversal-2モデルがアムハラ語をサポートしており、この言語について公開された精度ティアを持つ唯一の主要APIですが、「Fair accuracy(普通の精度)」(WER 50%超)としてフラグ付けされています。精度が重要な本番ワークフローでは、現行のどの商用エンジンでも大幅な人手による編集工程を見込むべきです。
出典
- Google Cloud Speech-to-Text 対応言語: https://docs.cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- AWS Transcribe 対応言語: https://docs.aws.amazon.com/transcribe/latest/dg/supported-languages.html
- AssemblyAI 対応言語: https://www.assemblyai.com/docs/supported-languages
- Deepgram モと言語の概要: https://developers.deepgram.com/docs/models-languages-overview
- "Whispering in Amharic: Fine-tuning Whisper for Low-resource Language"(arXiv 2503.18485): https://arxiv.org/abs/2503.18485
- "Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages"(arXiv 2603.23654): https://arxiv.org/abs/2603.23654v1
- エチオピア放送公社の概要: https://statemediamonitor.com/2026/04/ethiopian-broadcasting-corporation-ebc/
- Hugging Face上のMeta MMS アムハラ語TTS: https://huggingface.co/facebook/mms-tts-amh
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.