
Amharisch-Transkription: Ge'ez-Schrift und die Realität der Engines
Summarize this article with:
Amharisch wird auf dem Papier von mehreren großen ASR-Engines unterstützt, aber die Qualität dieser Unterstützung variiert dramatisch. AssemblyAIs Universal-2-Modell deckt es ab – mit einer vom Hersteller ausgewiesenen Warnstufe „Fair accuracy“ (über 50 % WER). Google Clouds Chirp-Familie und AWS Transcribe führen beide am-ET, doch Whisper large-v3 zeigt auf sauberem Amharisch-Audio berichtete Zeichenfehlerraten von über 100 %, was auf schwerwiegendes Halluzinierungs- oder Einfügeverhalten hindeutet. Wenn Ihre Arbeit von korrekter Fidel-Ausgabe abhängt, planen Sie einen erheblichen Nachbearbeitungsdurchgang ein oder ziehen Sie forschungsnahe äthiopische Modelle für Workflows mit Amharisch als Primärsprache in Betracht.
Amharisch hat rund 32 Millionen Muttersprachler und ist die Arbeitssprache der äthiopischen Bundesregierung. Für die KI-Transkription gehört es zu den schwierigsten semitischen Sprachen überhaupt. Das Kernproblem ist nicht, dass Tools Amharisch ignorieren – es ist, dass die Tools, die Unterstützung behaupten, häufig weit schlechter abschneiden, als ihr Marketing suggeriert. Dieser Beitrag geht durch, was jede große Engine tatsächlich mit Amharisch anstellt, warum die Fidel-Schrift spezifische Fehlermuster erzeugt und wie praktikable Workflows 2026 aussehen.
Die Ge'ez-Schrift und warum sie ASR anders zum Scheitern bringt
Amharisch wird in der Ge'ez-Schrift geschrieben, im Amharischen Fidel genannt. Fidel ist keine Buchstabenschrift; es ist eine Silbenschrift. Jedes der 33 Basiszeichen steht für ein vollständiges Konsonant-Vokal-Paar, und jedes Basiszeichen hat sieben vokalische Variantenformen – insgesamt mehr als 200 verschiedene Zeichen im alltäglichen Gebrauch. Die Silbe ሀ (ha) wird zu ሁ (hu), ሂ (hi), ሃ (haa), ሄ (he), ህ (der Konsonant allein) und ሆ (ho). Eine einzelne Zeichensubstitution ist kein Schreibfehler: Es ist ein kompletter Wortfehler.
Deshalb weisen Sprachen in Ge'ez-Schrift strukturell höhere Wortfehlerraten auf als Sprachen in lateinischer Schrift – bei vergleichbaren Trainingsdatenmengen. Vergleichende Forschung zu ASR über afrikanische Sprachen hinweg hat ergeben, dass Sprachen in Ge'ez-Schrift im Durchschnitt rund 43,5 % best-feinjustierte WER erreichen gegenüber rund 36,2 % bei afrikanischen Sprachen in lateinischer Schrift – selbst wenn die Testbedingungen sonst identisch sind. Die Architektur der Schrift ist Teil der Strafe, nicht nur Datenknappheit.
Drei Merkmale auf Ebene der Schrift machen Amharisch besonders schwer:
Gemination ist in der Schrift unsichtbar. Im gesprochenen Amharisch ist die Konsonantenlänge phonemisch bedeutungsunterscheidend: alä bedeutet „er sagte“, allä bedeutet „es gibt“. Die Schrift markiert keines von beiden. Ein ASR-System, das Fidel-Ausgabe erzeugen soll, kann die Gemination nicht allein aus der Zuordnung Audio–Zeichen ableiten; es braucht phonologischen Kontext, auf dessen Verarbeitung die meisten Modelle nicht trainiert sind.
Mehrere Zeichen teilen sich denselben Laut. Die ha-Gruppe, die a-Gruppe und die sa-Gruppe enthalten jeweils Zeichen, die im modernen gesprochenen Amharisch phonetisch identisch sind. Hört ein Modell dasselbe Phon, muss es raten, welches Fidel-Zeichen es schreiben soll. Homophon-Mehrdeutigkeit erzeugt eine Fehleruntergrenze, selbst wenn die Phonemerkenning korrekt ist.
Labialisierte Konsonanten verwenden Mehrfach-Zeichenfolgen. Zwanzig labiovelare und achtzehn labialisierte Grapheme des Amharischen werden als Kombinationen aus zwei oder drei Konsonant-Vokal-Silben dargestellt. Modelle, die diese Sequenzen nicht explizit behandeln, neigen dazu, fragmentierte oder falsche Ausgaben zu produzieren.
Für Kontext, warum diese Muster bei afrikanischen Low-Resource-Sprachen auftreten, siehe warum KI bei ressourcenarmen Sprachen Schwierigkeiten hat.
Was die großen Engines tatsächlich unterstützen
Der folgende Vergleich basiert auf geprüfter Dokumentation mit Stand Juli 2026.
| Engine | Amharisch-Unterstützung | Sprachcode | Genauigkeitsstufe | Anmerkungen |
|---|---|---|---|---|
| Google Cloud STT | Ja | am-ET | Nicht veröffentlicht | Chirp-, Chirp-2- und Chirp-3-Modelle |
| AWS Transcribe | Ja | am-ET | Nicht veröffentlicht | Batch und Streaming |
| AssemblyAI | Ja (nur Universal-2) | am | Fair (über 50 % WER) | Nicht auf Universal-3 Pro |
| Whisper large-v3 | Nominal | am | Schlecht | CER laut Benchmarks über 100 % |
| Deepgram Nova-2/Nova-3 | Nein | n/a | n/a | Nicht in der Liste unterstützter Sprachen |
| Ethio-ASR (Forschung) | Ja | am | ca. 30 % WER (berichtet) | Offenes Forschungsmodell, WAXAL-Korpus |
Google Cloud Speech-to-Text (am-ET) ist über die Chirp-Modellfamilie verfügbar und umfasst Unterstützung für automatische Interpunktion. Google veröffentlicht keine sprachspezifischen Genauigkeits-Benchmarks für Amharisch; die Qualität bei Ihrem konkreten Audiotyp müssen Sie also eigenständig benchmarken.
AWS Transcribe (am-ET) unterstützt sowohl Batch- als auch Streaming-Transkription, bietet für Amharisch jedoch keine erweiterten Funktionen wie eigene Sprachmodelle, PII-Schwärzung oder Call Analytics. Es ist ein Baseline-Transkriptionsweg.
AssemblyAIs Universal-2-Modell ist die einzige große kommerzielle API, die eine Genauigkeitsstufe für Amharisch veröffentlicht. Sie stuft es als „Fair accuracy“ ein, was einer Wortfehlerrate von mehr als 50 % entspricht. Das ist ein erheblicher Nachteil für jeden Workflow, bei dem die Ausgabequalität zählt. Das höherstufige Universal-3-Pro-Modell, das die meisten anderen Sprachen bei AssemblyAI abdeckt, enthält Amharisch zum Zeitpunkt dieses Artikels nicht.
Whisper large-v3 führt Amharisch unter seinen unterstützten Sprachen, aber die Benchmark-Ergebnisse erzählen eine andere Geschichte. Die Forschung hat für Whisper large-v3 auf sauberem Amharisch-Audio aus FLEURS berichtete Zeichenfehlerraten von über 100 % gefunden – das Modell fügt also mehr Zeichen ein, wiederholt oder halluziniert mehr, als der Referenztext enthält. Vermutlich handelt es sich um ein Halluzinationsmuster, das durch begrenzte Amharisch-Trainingsdaten verschärft wird und an der Schwierigkeit des Modells mit der Fidel-Zeichenzuordnung liegt. Whisper large-v2 zeigt diese Regression nicht im selben Maße. Feingetunte Whisper-Varianten, die speziell auf Amharisch-Datensätzen trainiert wurden (FLEURS, Mozilla Common Voice sowie domänenspezifische Korpora), schneiden deutlich besser ab. Die Arbeit „Whispering in Amharic“ von März 2025 zeigt, dass Homophon-Normalisierung und kombiniertes FLEURS-Training die WER gegenüber dem Basismodell signifikant senkt.
Deepgram (Nova-2 und Nova-3) führt Amharisch nicht in seiner Liste unterstützter Sprachen. Keine der beiden Modellstufen deckt die Sprache ab.
Für einen breiteren Blick darauf, wie Preisgestaltung und Funktionsumfang zwischen diesen Engines variieren, siehe den Transkriptions-Preisvergleich und den AWS-Transcribe-Preis-Leitfaden.

Amharisch in Äthiopien: Die Anwendungsfälle in der Praxis
Die Nachfrage nach Amharisch-Transkription ist real und konzentriert sich auf bestimmte Sektoren. Welches Tool passend ist, ergibt sich aus dem jeweiligen Anwendungsfall.
Die Ethiopian Broadcasting Corporation (EBC) ist der älteste und größte Sender des Landes mit Sitz in Addis Abeba. Ihre Hauptsprache ist Amharisch, ergänzt durch Berichterstattung auf Oromo, Somali, Tigrinya und Afar. Journalisten, Forschende und Medienbeobachter, die mit EBC-Inhalten arbeiten, stehen vor der vollen Amharisch-ASR-Herausforderung: Newsroom-Amharisch mit mehreren Sprechern, regionalen Akzenten, technischem und politischem Vokabular sowie schnellem Sprechtempo.
Die Dokumentation der Bundesregierung erfolgt auf Amharisch. Gerichtsverfahren, politische Dokumente und offizielle Sitzungen erzeugen Amharisch-Audio, das für Protokollierung, Barrierefreiheit und Archivierung transkribiert werden muss. Die Genauigkeitsanforderung ist hier hoch, und „Fair accuracy“-Ausgaben oder Ergebnisse mit über 50 % WER sind ohne erhebliche Überarbeitung nicht brauchbar.
Die äthiopische Diaspora erzeugt Nachfrage nach Transkription von Familien- und Community-Inhalten: Interviews, Podcast-Aufnahmen, religiöse Sendungen, Kulturveranstaltungen. Dieses Audio enthält oft Codeswitching zwischen Amharisch und Englisch (Diaspora-Gemeinschaften in den USA und Europa) oder zwischen Amharisch und Arabisch (Gemeinschaften am Golf und im Nahen Osten). Codeswitching stört jedes einsprachige Modell.
Forschung und Journalismus, die äthiopische politische und soziale Ereignisse verfolgen, produzieren zunehmend Amharisch-Audio, das indexiert und übersetzt werden muss. Akademische Institutionen und internationale NGOs, die in Äthiopien tätig sind, sehen sich mit diesem Problem regelmäßig konfrontiert.
Für verwandte Workflows zur Transkription afrikanischer Sprachen behandeln die Schwester-Guides zu Swahili-Transkription in Kenia und Tansania, Hausa-Transkription in Nigeria und der breitere Überblick beste Transkription für afrikanische Sprachen dieselbe ASR-Qualitätslandschaft aus unterschiedlichen Sprachperspektiven.
Wie ein praktischer Amharisch-Workflow heute aussieht
Angesichts dieser Genauigkeitslage erfordert ein Amharisch-Transkript in Produktionsqualität einen manuellen Nachbearbeitungsdurchgang – egal welche Engine Sie nutzen. Die Frage ist, welche Engine Ihnen den besten Ausgangspunkt liefert.
Wenn Sie auf Google-Cloud- oder AWS-Infrastruktur arbeiten, beginnen Sie mit diesen nativen Amharisch-Endpunkten. Sie liefern Ihnen Fidel-Ausgabe ohne Portierungsaufwand und lassen sich in bestehende Cloud-Pipelines integrieren. Benchmarken Sie an einer 5- bis 10-minütigen Stichprobe Ihres tatsächlichen Audios, bevor Sie skalieren.
Wenn Sie einen API-Endpunkt mit bekannter Genauigkeitsuntergrenze brauchen, ist AssemblyAIs Universal-2-Modell die transparenteste kommerzielle Option: Es deklariert seine Genauigkeitsstufe, und Sie müssen nicht raten. Die Einstufung mit über 50 % WER bedeutet: Planen Sie ein, dass jede Transkription vor der Verwendung von fließend Amharisch sprechenden Personen gegengelesen wird.
Wenn Sie Ihre eigene Infrastruktur betreiben und Zeit zum Feintuning haben, übertrifft ein Whisper-small-Modell, feingetunt auf kombinierten FLEURS- und Common-Voice-Amharisch-Daten, das fertige large-v3-Modell für Amharisch. Das Ethio-ASR-Forschungsmodell, auf dem WAXAL-Korpus über fünf äthiopische Sprachen trainiert, zeigt als Forschungsbaseline rund 30 % durchschnittliche WER.
Eine Sache sollten Sie bei jeder Ausgabe prüfen: Stellen Sie sicher, dass das Modell Fidel-Schrift erzeugt und keine lateinische Umschrift. Wenn Sie „ena alle“ statt „እና አለ“ erhalten, ist die Ausgabe für amharische Leser unbrauchbar und stellt ein Versagen der Skriptgenerierung dar – nicht nur ein Genauigkeitsproblem.
Bei Workflows, die mehrere afrikanische Sprachen in derselben Aufnahme involvieren oder Amharisch mit Englisch kombinieren, gilt zu beachten: Die Codeswitching-Genauigkeit ist heute auf jeder verfügbaren Engine schwächer als die einsprachige Amharisch-Leistung. Das ist ein offenes Forschungsproblem, kein Konfigurationsproblem.
Wenn Sie ein Transkriptionstool für andere Audiodateien brauchen, bewältigt ConvertAudioToText ein breites Spektrum an Sprachen mit hoher Genauigkeit. Bei Amharisch speziell ist die ehrliche Position: Kein Tool liefert heute Ausgaben in Produktionsqualität ohne einen Review-Schritt – und diese Lücke sollten Sie in Ihren Workflow und Ihr Budget einplanen, ganz gleich, welche Engine Sie nutzen.
Die Forschungsentwicklung
Amharisch-ASR hat zwischen 2022 und 2026 spürbare Fortschritte gemacht – vor allem durch akademische und Forschungsanstrengungen statt durch kommerzielle Investitionen. Drei Entwicklungen sind beobachtenswert:
Das Ethio-ASR-Projekt (März 2026) ist die aktuellste mehrsprachige äthiopische ASR-Arbeit; es deckt Amharisch neben Tigrinya, Oromo, Sidaama und Wolaytta ab und nutzt das WAXAL-Korpus. Es schlägt größere mehrsprachige Modelle wie OmniASR mit weniger Parametern, indem es sich auf die Sprachfamilie konzentriert. Solche Modelle werden wahrscheinlich in kommerzielle APIs einfließen, wenn die Forschung reift.
Metas Massively Multilingual Speech (MMS)-Projekt deckt Amharisch in seinem Speech-to-Text-Modell für 1.100 Sprachen ab. MMS ist als Open-Source-Checkpoint auf Hugging Face verfügbar. Es ist nicht für den Produktionseinsatz poliert, aber es ist eine der breitesten Abdeckungsoptionen für ressourcenarme Sprachen inklusive Amharisch.
Googles Chirp-3-Modell enthält jetzt Amharisch mit am-ET-Unterstützung in mehreren Regionen. Chirp 3 repräsentiert Googles neuestes Foundation-Modell für Sprache, und die Aufnahme von Amharisch deutet auf kommerzielle Investitionen in die Sprache hin, die früheren Google-STT-Angeboten fehlten.
Der Trend ist positiv, aber die Lücke zwischen „als unterstützt gelistet“ und „produktionsreif ohne Review“ bleibt für Amharisch 2026 groß. Planen Sie entsprechend.
Häufige Fragen
Unterstützt Whisper Amharisch?
Whisper führt Amharisch unter seinen mehr als 99 unterstützten Sprachen, aber die Leistung in der Praxis ist schlecht. Forschungsbenchmarks zeigen für Whisper large-v3 auf sauberem Amharisch-Audio berichtete Zeichenfehlerraten von über 100 % – das Modell fügt also mehr ein, wiederholt oder halluziniert, als es korrekt transkribiert. Feingetunte Whisper-Varianten (trainiert auf FLEURS- und Common-Voice-Amharisch-Daten) schneiden deutlich besser ab, doch das Basismodell ist für produktive Amharisch-Transkription nicht verlässlich.
Können Google Cloud Speech-to-Text oder AWS Transcribe Amharisch verarbeiten?
Beide unterstützen Amharisch. Google Cloud Speech-to-Text unterstützt am-ET auf seinen Modellen Chirp, Chirp 2 und Chirp 3. AWS Transcribe unterstützt am-ET sowohl für Batch- als auch für Streaming-Transkription. Keiner der beiden Dienste veröffentlicht amharischspezifische Genauigkeitswerte; benchmarken Sie daher an einer repräsentativen Stichprobe Ihres Audios, bevor Sie sich auf einen Workflow festlegen.
Warum macht die Fidel-Schrift Amharisch-ASR schwieriger als bei Sprachen in lateinischer Schrift?
Fidel ist eine Silbenschrift, bei der jedes Zeichen ein vollständiges Konsonant-Vokal-Paar kodiert. Eine einzelne falsche Zeichensubstitution zählt damit als kompletter Wortfehler, nicht als partieller Schreibfehler. Hinzu kommt, dass die amharische Orthographie keine Gemination markiert (gedoppelte Konsonanten, die Bedeutungen unterscheiden, etwa alä „er sagte“ gegenüber allä „es gibt“), und mehrere unterschiedliche Fidel-Zeichen dieselbe Aussprache teilen (die ha-Gruppe, die a-Gruppe, die sa-Gruppe). Diese Mehrdeutigkeiten verstärken ASR-Fehler in einem Ausmaß, wie es Sprachen in lateinischer Schrift nicht in gleicher Weise erleben.
Welche Amharisch-ASR-Option ist heute die genaueste?
Das Forschungsmodell Ethio-ASR, gemeinsam auf Amharisch und vier weiteren äthiopischen Sprachen trainiert und dabei auf das WAXAL-Korpus gestützt, erreichte in den Benchmarks von März 2026 eine berichtete durchschnittliche WER von rund 30 % – der akademische Stand der Technik. Unter den kommerziellen Diensten unterstützt AssemblyAIs Universal-2-Modell Amharisch und ist die einzige große API mit einer veröffentlichten Genauigkeitsstufe für diese Sprache, weist sie jedoch als „Fair accuracy“ aus (über 50 % WER). Für Produktions-Workflows, bei denen Genauigkeit kritisch ist, sollten Sie bei jeder aktuellen kommerziellen Engine mit einem erheblichen manuellen Nachbearbeitungsdurchgang rechnen.
Quellen
- Von Google Cloud Speech-to-Text unterstützte Sprachen: https://docs.cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Von AWS Transcribe unterstützte Sprachen: https://docs.aws.amazon.com/transcribe/latest/dg/supported-languages.html
- Von AssemblyAI unterstützte Sprachen: https://www.assemblyai.com/docs/supported-languages
- Deepgram-Überblick über Modelle und Sprachen: https://developers.deepgram.com/docs/models-languages-overview
- „Whispering in Amharic: Fine-tuning Whisper for Low-resource Language“ (arXiv 2503.18485): https://arxiv.org/abs/2503.18485
- „Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages“ (arXiv 2603.23654): https://arxiv.org/abs/2603.23654v1
- Überblick zur Ethiopian Broadcasting Corporation: https://statemediamonitor.com/2026/04/ethiopian-broadcasting-corporation-ebc/
- Meta MMS Amharic TTS auf Hugging Face: https://huggingface.co/facebook/mms-tts-amh
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.