Arabische Transkription: MSA vs. Dialekte in ASR (Leitfaden 2026)
transkriptionarabischsprachen

Arabische Transkription: MSA vs. Dialekte in ASR (Leitfaden 2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

Arabisch ist eine diglossische Sprache: Modernes Standardarabisch (MSA) und regionale Dialekte teilen ein Schriftsystem, weichen aber stark in Wortschatz und Phonologie ab, was sehr unterschiedliche Genauigkeitsprofile für KI-Transkription ergibt. Deepgram Nova-3 ist die einzige große API, die alle 17 arabischen Dialektcodes als benannte Parameter unterstützt. Whisper large-v3 verarbeitet MSA gut, aber die Wortfehlerraten steigen bei Dialekten deutlich, besonders bei Maghreb-Arabisch. Die meisten Verbraucher-Meeting-Tools (Otter.ai, Fireflies) unterstützen Arabisch gar nicht. Wenn Sie saubere arabische Transkripte ohne komplexes API-Setup brauchen, verarbeitet ConvertAudioToText MSA und die wichtigsten Dialekte mit RTL-Ausgabe inklusive.

Arabische Spracherkennung ist schwieriger als in fast jeder anderen Sprache, und der Grund dafür ist Diglossie. Die meisten Sprachen haben eine gesprochene Form, die sich einigermaßen auf eine geschriebene Form abbilden lässt. Arabisch hat zwei: Modernes Standardarabisch (MSA), das in formellem Schreiben, Nachrichtensendungen und religiösen Kontexten verwendet wird, und eine Vielzahl regionaler Dialekte (Ägyptisch, Golf, Levante, Maghreb, Irakisch und mehr), die Muttersprachler im Alltag tatsächlich sprechen. Sie teilen sich dasselbe 28-Buchstaben-Alphabet, unterscheiden sich aber so stark in Wortschatz und Phonologie, dass ein Marokkaner und ein Kuwaiter, die vom Dialekt ins MSA wechseln, ungefähr mit dem Registerwechsel zwischen formellem akademischem Englisch und einem lokalen Kreol vergleichbar sind. Für KI-Transkription entsteht dadurch eine abgestufte Genauigkeitslandschaft, bei der die Variante, die du hast, bestimmt, welche Engine du verwendest und wie viel Überprüfung du einplanen musst.

Arabische Transkriptionsgenauigkeit unterscheidet sich stark zwischen MSA und Dialekten
Arabische Transkriptionsgenauigkeit unterscheidet sich stark zwischen MSA und Dialekten

Das Diglossie-Problem: Warum „Arabisch“ kein einheitliches ASR-Ziel ist

MSA ist niemandes Muttersprache, aber jeder gebildete arabische Sprecher versteht es. Es ist die Sprache von Al Jazeera- und Al Arabiya-Sendungen, Universitätsvorlesungen, offiziellen Regierungsdokumenten und Freitagspredigten in den meisten Moscheen. Die Schrift ist vollständig standardisiert. Die Phonologie ist konsistent. Trainingsdaten gibt es reichlich.

Regionale Dialekte sind eine andere Herausforderung. Sie teilen die Schrift, aber nicht die Wortschatz- oder Aussprachekonventionen. Marokkanisches Darija und saudisches Najdi-Arabisch sind in natürlicher gesprochener Form gegenseitig unverständlich, ein Einheimischer aus Riad und einer aus Casablanca würden standardmäßig auf MSA zurückgreifen, um zu kommunizieren, oder auf Französisch oder Englisch, falls einer von beiden es beherrscht. Das bedeutet, dass ASR-Engines, die auf einem Dialekt trainiert wurden, bei einem anderen unvorhersehbar versagen.

Die Forschungsliteratur bestätigt die Lücke. Studien, die Whisper-Modelle mit dialektalem Arabisch testen, berichten über Wortfehlerraten im Bereich von 25 bis 50 Prozent für Dialekte, während saubere MSA-Rundfunkrede bei etwa 15 bis 20 Prozent WER liegt. Whisper large-v3 produziert bei dialektalem Input manchmal englische Übersetzungen statt arabischer Transkriptionen, ein Artefakt seines mehrsprachigen Trainings, das das mittlere Modell in bestimmten dialektlastigen Szenarien besser handhabt. Diese Zahlen stammen aus begutachteten ASR-Benchmarks, nicht aus Marketingmaterial der Anbieter, behandelt sie als Richtwerte und nicht als exakte Angaben für eure spezifischen Audio-Bedingungen.

Modernes Hocharabisch: Wo die Genauigkeit am stärksten ist

MSA ist das einfachste Arabisch für KI-Transkription. Rundfunkartiges Audio, Nachrichtensprecher, skriptete Präsentationen, formelle Reden, erreicht die niedrigsten Wortfehlerraten aller arabischen Varietäten bei allen großen Engines. Wenn eure Inhalte von Nachrichtenagenturen, akademischen Vorlesungen, religiösen Predigten im formellen Register oder offiziellen Regierungserklärungen stammen, könnt ihr mit KI-Output rechnen, der dem entspricht, was ihr bei europäischen Sprachen bekommen würdet.

Die Schriftsystem-Mechanik spielt hier zu euren Gunsten. MSA folgt kodifizierten orthografischen Regeln. Die Hamza-Platzierung (über Alef, unter Alef, auf Waw, auf Ya oder eigenständig) ist in formellem Schreiben standardisiert, auch wenn Engines manchmal uneins darüber sind, welche Form sie ausgeben. Die Buchstabenkombinationen sind vorhersehbar. Wortgrenzen sind klar.

Eine orthografische Anmerkung, die beeinflusst, wie Sie die Ausgabe lesen: Tashkeel (die diakritischen Zeichen, die kurze Vokale anzeigen: Fatha, Kasra, Damma, Sukun, Schadda) werden in der standardarabischen Schrift fast immer weggelassen. Zeitungsartikel, wissenschaftliche Arbeiten und Geschäftskorrespondenz kommen ohne sie aus. KI-Transkription folgt dieser Konvention. Die Ausgabe ist unvokalisertes Arabisch, genau wie Sie es in jeder professionellen arabischen Publikation lesen würden. Wenn Sie vokalisierte Ausgabe für Koran-Inhalte oder Sprachlernmaterialien benötigen, ist dafür ein separater Nachbearbeitungsschritt erforderlich.

Die RTL-Darstellung wird auf der Anzeige- und Exportebene gehandhabt. Eine korrekt konfigurierte SRT- oder DOCX-Datei kennzeichnet die Textrichtung, sodass Textverarbeitungsprogramme und Untertitel-Player sie richtig rendern. Wenn Arabisch in Ihrem Untertitel-Player spiegelverkehrt erscheint, liegt das Problem am Player, nicht an der Transkriptdatei.

Ägyptisches Arabisch: Der am besten unterstützte Dialekt

Ägyptisches Arabisch hat die meisten Trainingsdaten aller arabischen Dialekte, vor allem weil Ägypten seit Jahrzehnten den arabischsprachigen Film-, Fernseh- und Musikmarkt dominiert. Al Masri (Kairoer Ägyptisch) ist in der gesamten arabischen Welt weithin verständlich. Eine ägyptische Seifenoper ist für einen Jordanier oder Bahrainer verständlich, was für marokkanisches Darija nicht gilt.

Für die automatische Spracherkennung bedeutet das eine bessere Genauigkeit als bei jedem anderen Dialekt. Städtische Kairoer Sprache liegt am oberen Ende der Skala; ländliche oberägyptische Dialekte mit stärkerer pharyngaler Konsonantenvariation liegen weiter unten. Ägyptisches Arabisch enthält auch türkische, französische und englische Lehnwörter, die lange genug stabil waren, dass die Modelle sie korrekt verarbeiten.

Wenn Ihre Inhalte auf Ägyptisch-Arabisch sind, Podcasts, Callcenter-Aufnahmen, YouTube-Kommentare, Interviewaufnahmen aus Ägypten, haben Sie die günstigsten Dialektbedingungen aller nicht-MSA-Varianten.

Golf-Arabisch: Erhebliche Variation innerhalb der Gruppe

Golf-Arabisch umfasst Saudi-Arabien, die VAE, Katar, Kuwait, Bahrain und Oman. Die Unterschiede innerhalb des Golf-Arabischen sind erheblich. Das Nadjdi-Arabisch (Zentral-Saudi-Arabien) unterscheidet sich deutlich vom Hidschazi-Arabisch (West-Saudi-Arabien), und beide weichen vom Emiratischen oder Omanischen ab. Das ist für die Transkription relevant: Ein generisches Modell für „Golf-Arabisch" kann manche Untervarianten besser verarbeiten als andere.

Geschäftsinhalte aus den VAE und Katar wechseln häufig zwischen Arabisch und Englisch, besonders in Tech, Finanzen und Unternehmenskommunikation. Deepgram Nova-3 bietet benannte Dialektcodes für jedes Golf-Land (ar-AE, ar-SA, ar-QA, ar-KW), sodass du Audio an das nächstgelegene regionale Akustikmodell weiterleiten kannst, statt an ein generisches Arabisch-Modell. Ob das in der Praxis einen spürbaren Genauigkeitsunterschied macht, hängt davon ab, wie stark dialektal die Sprache ist und wie viel Hocharabisch (MSA) sie enthält.

Levantinisches Arabisch: Code-Switching mit Französisch und Englisch

Levantinisches Arabisch umfasst Syrien, Libanon, Jordanien und Palästina. Beiruter Libanesisch ist die sprachlich komplexeste levantinische Variante für ASR, weil es Arabisch frei mit Französisch mischt, manchmal mitten im Satz, und auch mit Englisch. Ein libanesischer Tech-Podcast kann innerhalb eines einzigen Sprecherbeitrags zwischen Arabisch, Französisch und Englisch wechseln. Das ist weder ungewöhnlich noch informell, sondern die natürliche Kommunikationsweise gebildeter libanesischer Sprecher.

Aktuelle ASR-Engines verarbeiten Code-Switching an Satzgrenzen besser als innerhalb von Sätzen. Wenn auf einen arabischen Satz ein französischer folgt, meistern die Modelle den Übergang ordentlich. Wenn ein einzelner Satz arabische Verben, französische Substantive und englische Markennamen enthält, sinkt die Ausgabequalität. Whisper kommt mit etwas mehrsprachigem Wechsel zurecht, dank seines mehrsprachigen Trainings, aber die Genauigkeit reicht nicht aus, um bei stark code-geswitchten libanesischen oder algerischen Inhalten auf eine Überprüfung zu verzichten.

Forschung zu Benchmarks für Arabisch-Englisch Code-Switching berichtet eine WER (Word Error Rate) im Bereich von 24 bis 50 Prozent über code-geswitchte Korpora, was unterstreicht, warum die Überprüfungszeit für diesen Inhaltstyp nicht verhandelbar ist.

Maghrebinisches Arabisch: Der schwierigste Fall in der arabischen ASR

Marokkanisches, algerisches und tunesisches Arabisch (zusammen Darija genannt) ist die schwierigste arabische Varietät für jede große ASR-Engine. Drei Faktoren wirken zusammen und erzeugen diese Schwierigkeit:

Erstens hat Darija massiv Berber-Vokabular (Tamazight) übernommen. Marokkanisches Darija verwendet Tamazight-Wörter für Alltagsgegenstände und Handlungen, die keine arabische Entsprechung haben. Diese tauchen schlicht nicht in den Trainingsdaten für MSA oder östliche Dialekte auf.

Zweitens ist Darija phonologisch komprimiert. Kurze Vokale, die im MSA vorkommen, werden in natürlicher schneller Sprache komplett weggelassen, was Konsonantencluster erzeugt, die in anderen arabischen Varietäten ungewöhnlich sind.

Drittens ist Code-Switching mit Französisch in Marokko, Algerien und Tunesien allgegenwärtig. Das ist kein gelegentliches Entlehnen, sondern strukturell. Eine algerische Sprecherin kann französische Verben verwenden, die mit arabischer Morphologie im selben Satz konjugiert werden. Für eine Engine, die entscheiden muss, ob sie arabische Schrift oder lateinische Zeichen ausgibt, schafft das eine grundlegende Ambiguität.

Die Daten zur gegenseitigen Verständlichkeit zeigen die Asymmetrie: Sprecher aus Ägypten, dem Golf und der Levante können natürlicher Darija-Sprache generell nicht folgen. Maghrebinische Sprecher können durch Medieneinfluss östlicher Dialekte typischerweise ägyptisches und levantinisches Arabisch besser verstehen. Dieselbe Asymmetrie zeigt sich in der Abdeckung der ASR-Trainingsdaten.

Wenn Ihr Audio marokkanisches oder algerisches Darija ist, planen Sie einen erheblichen Überprüfungsdurchgang ein. Das ist kein Versagen der Tools, sondern ein Datenabdeckungsproblem, an dem die Forschungsgemeinschaft aktiv arbeitet.

Welche Engines unterstützen tatsächlich arabische Dialekte

Die großen Engines unterscheiden sich erheblich darin, wie explizit sie die Variation arabischer Dialekte adressieren.

Deepgram Nova-3 ist bei der Unterstützung von Dialekten am explizitesten. Arabisch kam mit Nova-3 dazu (Nova-2 unterstützte kein Arabisch). Nova-3 bietet 17 benannte Dialektcodes, die alle wichtigen regionalen Gruppen abdecken: ar für allgemeines Arabisch, dazu ar-AE, ar-SA, ar-QA, ar-KW für die Golfstaaten; ar-SY, ar-LB, ar-PS, ar-JO für die Levante; ar-EG, ar-SD für die Nilregion; ar-MA, ar-DZ, ar-TN für den Maghreb; sowie ar-IQ, ar-TD, ar-IR für mesopotamische und periphere Varianten. Deepgram gibt an, bei dialektlastiger Sprache eine um bis zu 40 Prozent niedrigere Wortfehlerrate (WER) als konkurrierende Systeme zu erzielen, wobei die genauen Referenzwerte für jeden Dialekt nicht granular öffentlich gemacht werden. Keyterm Prompting funktioniert über alle Dialekte hinweg und erlaubt es, zur Laufzeit Fachterminologie einzuspeisen, was bei Eigennamen, Markennamen und technischem Vokabular hilft.

AssemblyAI Universal-3 Pro unterstützt Arabisch in 99 Sprachen und behandelt Dialektvariationen automatisch, ohne dass ein spezifischer Dialektcode nötig ist. Die Dokumentation zum Universal-2-Modell stuft Arabisch in die Genauigkeitskategorie „10-25 % WER“ ein. Universal-3 Pro ist neuer und liefert bessere Ergebnisse, allerdings veröffentlicht AssemblyAI keine WER-Werte pro Dialekt. Sprecherdiarisierung wird unterstützt. Einen breiteren Vergleich findest du in den besten Speech-to-Text-APIs 2026.

Speechmatics gibt eine Wortfehlerrate von 4,5 % bei Arabisch an und übertrifft damit Google, OpenAI Whisper, AssemblyAI und Deepgram in den eigenen Benchmarks (mit 35 Prozent weniger Fehlern als der nächste Konkurrent bei Arabisch-Englisch-Code-Switching-Aufgaben). Abgedeckt werden MSA, Ägyptisch, Levante, Golf und Maghreb. Die Preise sind nicht öffentlich einsehbar; für die Evaluierung bietet Speechmatics 40 Stunden kostenlose Transkription pro Monat an.

OpenAI Whisper (large-v3) verarbeitet MSA gut, zeigt aber bei Dialekten eine Verschlechterung der WER. Forschungsarbeiten berichten für Whisper-large-v3 eine WER von etwa 30-32% bei dialektlastigen arabischen Testmengen, mit gelegentlichen Halluzinationen, bei denen das Modell englische Übersetzungen ausgibt, statt zu transkribieren. Das Medium-Modell schneidet bei bestimmten arabischen Dialekt-Benchmarks manchmal besser ab als large-v3, was kontraintuitiv ist, aber dokumentiert wurde. Siehe OpenAI Whisper API Preise 2026 für den Kostenkontext.

Google Cloud STT unterstützt Arabisch und mehrere Varianten. Die Standard-V2-Transkription kostet $0.016 pro Minute. Google veröffentlicht keine öffentlichen, dialektspezifischen Genauigkeits-Benchmarks.

Otter.ai unterstützt kein Arabisch. Die unterstützten Sprachen sind Englisch, Spanisch, Französisch, Deutsch, Japanisch und Chinesisch (vereinfacht). Wenn Ihre Meetings oder Interviews auf Arabisch stattfinden, ist Otter nicht das richtige Werkzeug. Für einen breiteren Vergleich von Meeting-Transkriptionstools und deren Sprachgrenzen, siehe beste Transkription für Zoom 2026.

EngineArabische DialektcodesMSA-GenauigkeitDialektgenauigkeitArabische Preise
Deepgram Nova-317 benannte CodesStarkBeste ihrer Klasse laut AnbieterMengenbasiert, Volumenstufen
AssemblyAI Universal-3 Proar (Auto-Dialekt)StarkGut (10-25% WER-Bereich)Pro Minute abgerechnet
SpeechmaticsAlle großen DialekteBehauptet 4.5% WERDeckt Maghrebi, Golf abNicht öffentlich; 40 Std. kostenlos
OpenAI Whisper large-v3ar (keine Dialektcodes)Gut30-50% WER bei Dialekten$0.006/Min. über API
Google Cloud STTar + VariantenGutStandardunterstützung$0.016/Min. Standard
Otter.aiNicht unterstütztN/AN/AN/A

Praktische Arbeitsabläufe nach Inhaltstyp

Transkription arabischer Nachrichten (MSA-Rundfunkaudio) ist der klarste Gewinn für KI: Das Audio ist sauber, das Register ist formell, und jede größere Engine liefert gute Ergebnisse. MSA-Interviewaudio von Sendern wie Al Jazeera, Reuters Arabic oder BBC Arabic folgt einer vorhersehbaren Phonologie, und die Ausgabe braucht nur leichte Nachbearbeitung.

Arabische Podcasts variieren enorm je nach Moderationsregion und Zielgruppe. Ein ägyptischer Kulturpodcast und ein marokkanischer Comedy-Podcast unterscheiden sich akustisch und lexikalisch so stark, dass die Genauigkeit beim einen wenig über den anderen aussagt. Teste vor der Stapelverarbeitung mit einer kurzen Beispielsequenz aus deinem tatsächlichen Inhalt, bevor du dich auf eine Engine festlegst.

Religiöse Inhalte (Koranrezitation, Freitagspredigten) fallen in zwei Kategorien. Koranrezitation ist MSA in einem spezifischen tadschwid-phonologischen Stil, der sich so deutlich abhebt, dass allgemeine Modelle Schwierigkeiten haben können, obwohl es technisch gesehen MSA ist. Standardpredigten in formellem MSA transkribieren gut. Predigten im lokalen Dialekt (häufig in Moscheen des Maghreb) unterliegen denselben Genauigkeitseinschränkungen wie jedes andere Darija-Audio.

Akademische Interviews und Aufnahmen für qualitative Forschung sind der Bereich, in dem Sprecher-Diarisierung für Arabisch am wichtigsten ist. Mehrsprachige Aufnahmen in einem formellen Forschungskontext, strukturierte Interviews, Fokusgruppen profitieren von der Diarisierung, selbst wenn der Dialekt nicht MSA ist.

Wenn du nur saubere arabische Transkripte brauchst, ohne eine API-Pipeline aufzubauen, übernimmt ConvertAudioToText MSA und gängige Dialekte, inklusive RTL-Ausgabe. Der kostenlose Tarif umfasst 10 Transkriptionsminuten, die einmalig bei der Anmeldung vergeben werden, nicht monatlich. Der Pro-Plan kostet $9.99 pro Monat und eignet sich für arabische Podcaster, Forscher und Journalisten, die konstantes Volumen ohne minutengenaue Abrechnungskomplexität brauchen.

Fünf Tipps speziell für arabisches Audio

Set the language explicitly. Auto-Erkennung funktioniert für Arabisch, ist aber langsamer und verwechselt gelegentlich maghrebinisches Arabisch mit Amazigh oder Hausa, weil komprimierte Sprache akustisch ähnlich klingt. Wenn du ar explizit angibst, oder wo unterstützt einen Dialektcode, überspringst du den Erkennungsschritt.

Provide a proper noun glossary. Arabische Personennamen haben viele gültige Transkriptionskonventionen, und derselbe Name kann im selben Transkript als Ibrahim, Ibrahem oder Ebrahim auftauchen. Wenn dein Inhalt wiederkehrende Namen enthält, verankert ein Glossar oder eine Schlüsselbegriffsliste die Ausgabe.

Check the hamza and alef output if it matters. Die Engines sind sich uneinig, welche Alef-Form sie für initiales hamzatiertes Alef verwenden (Alef mit Hamza darüber vs. einfaches Alef). Bei formellen Dokumenten, wo orthografische Konsistenz zählt, fängt ein Normalisierungsschritt durch einen arabischen Textnormalisierer diese Varianten ab.

Record close-mic for emphatic and pharyngeal consonants. Arabisch hat pharyngale Frikative (Ayin, Ghain) und emphatische Konsonanten (Sad, Dad, Tad, Dhad), die akustische Energie tragen, die in Umgebungsgeräuschen leicht verloren geht. Nahmikrofonaufnahmen bewahren diese Unterschiede; entfernte oder Telefonqualität verwischt sie, was die Wortfehlerrate erhöht, egal welche Engine du nutzt.

For Darija, triangulate. Lass einen 2-minütigen Testclip durch zwei verschiedene Engines laufen und vergleiche. Da die Trainingsdatenabdeckung für Maghrebinisch je nach Engine variiert, ist die beste Leistung für deinen spezifischen Subdialekt und dein Thema im Voraus nicht vorhersagbar.

FAQ

Kann KI arabische Dialekte genau transkribieren oder nur MSA?

Die Genauigkeit variiert erheblich je nach Dialekt. MSA aus Rundfunkquellen erzielt die niedrigsten Wortfehlerraten bei allen Engines. Ägyptisches Arabisch ist der am besten unterstützte Dialekt, dank reichlicher Trainingsdaten aus ägyptischem Film und Fernsehen. Maghrebinisches Arabisch (marokkanisches, algerisches Darija) produziert durchweg die höchsten Fehlerraten, wegen des starken Berbervokabulars und des französischen Code-Switchings, mit dem die meisten Modelle nicht trainiert wurden.

Warum verursacht marokkanisches Darija so viele Transkriptionsfehler?

Marokkanisches Darija (und in geringerem Maße algerisches Arabisch) lässt in der Alltagssprache die meisten kurzen Vokale weg, übernimmt massiv Vokabular aus dem Tamazight (Berberisch) und wechselt mitten im Satz ins Französische. Für ASR-Modelle, die hauptsächlich mit MSA- und ägyptischen Daten trainiert wurden, bedeutet diese Kombination ungewohnte Phonotaktik, unbekannte Lexeme und einen Wechsel zwischen arabischer und lateinischer Schrift, alles gleichzeitig. Planen Sie bei Darija-Audio einen gründlicheren Überarbeitungsdurchgang ein.

Enthält die arabische Transkriptionsausgabe diakritische Zeichen (Tashkeel)?

Nein, standardmäßig nicht. Die übliche arabische Schrift, sei es in Nachrichtenartikeln, Geschäftsdokumenten oder akademischen Arbeiten, verzichtet vollständig auf diakritische Zeichen. Muttersprachler leiten die Vokale aus dem Kontext ab. Die KI-Transkription folgt dieser Konvention, daher ist die Ausgabe ein unvokalisiertes Arabisch, wie man es bei Al Jazeera oder in einem Uni-Lehrbuch lesen würde. Vokalisierte Ausgabe (etwa für Korantexte oder Sprachlernmaterialien) erfordert einen separaten Nachbearbeitungsschritt und ist kein Standardmerkmal von ASR-Pipelines.

Unterstützen Otter.ai oder Fireflies Arabisch?

Otter.ai unterstützt kein Arabisch. Die unterstützten Sprachen sind Englisch, Spanisch, Französisch, Deutsch, Japanisch und Chinesisch (vereinfacht). Fireflies ist ebenfalls auf englischsprachige Arbeitsabläufe ausgelegt. Wenn Ihr Meeting oder Ihr Interview auf Arabisch stattfindet, brauchen Sie einen speziellen Transkriptionsdienst, der Arabisch ausdrücklich als unterstützte Sprache angibt.

Welche Engine eignet sich am besten für Golf-Arabisch und Levantinisches Arabisch im Geschäftskontext?

Deepgram Nova-3 bietet die expliziteste Unterstützung auf Dialektebene, mit benannten Codes für jedes Golf-Land (ar-AE, ar-SA, ar-QA, ar-KW) und jedes Levante-Land (ar-SY, ar-LB, ar-PS, ar-JO). So kannst du gezielt das regionale akustische Modell ansteuern. AssemblyAI Universal-3 Pro unterstützt ebenfalls Arabisch und übernimmt die Dialektvariation automatisch, ohne dass ein Dialektcode nötig ist. Speechmatics verspricht hohe Genauigkeit bei Arabisch und deckt die ägyptischen, Golf-, Levante- und Maghreb-Varianten ab.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles