
Wolof-Transkription: Wo die Unterstützung 2026 steht
Summarize this article with:
Wo die Wolof-Unterstützung steht
Wolof wird 2026 von den meisten gängigen KI-Transkriptionstools nicht unterstützt, und die Tools, die Unterstützung behaupten, liefern hohe Fehlerraten. Whisper Large-v3, das die meisten Dienste antreibt, die mit breiter Sprachabdeckung werben, enthält Wolof in seiner 99-Sprachen-Liste überhaupt nicht. Auch Deepgram Nova-3 und AssemblyAI Universal führen Wolof nicht auf. Für den Großteil der Wolof-Inhalte besteht der praktikable Weg 2026 nicht darin, auf native Unterstützung zu warten, sondern zu verstehen, warum die Lücke existiert, und den Französisch-Track-Workaround zu nutzen, der bei urbanem Dakar-Audio funktioniert.
Das ist kein Mangel der Tools bei den Sprachen, auf denen sie aufgebaut wurden. Es ist ein Trainingsdatenproblem: Die größten öffentlichen Wolof-Sprachkorpora, darunter der ALFFA-Projektdatensatz und die OpenSLR-Wolof-Sammlung, umfassen etwa 5 bis 55 Stunden transkribierten Audiomaterials. Common Voice hat überhaupt kein Wolof-Korpus. Die englischen Trainingsdaten für Whisper gehen in Hunderttausende Stunden. Die Datenlücke erklärt die WER-Lücke.
Was die Forschung tatsächlich zeigt
Eine Studie aus dem Jahr 2025 zu Wolof-ASR („Speech Language Models for Under-Represented Languages: Insights from Wolof“, arXiv:2509.15362) ist der klarste veröffentlichte Benchmark zur aktuellen Lage. Die Studie kuratierte 860 Stunden hochwertiges spontanes Wolof-Audio, führte das Pretraining von HuBERT damit fort und integrierte den daraus entstandenen Speech-Encoder in ein Wolof-Sprachmodell. Selbst mit diesem gezielten Aufwand lagen die Wolof-ASR-Ergebnisse unter mehrsprachigen Trainingsbedingungen im Bereich von rund 68–72 % WER. Das ist eine Wortfehlerrate – im Schnitt ist also etwa jedes dritte Wort falsch.
Zum Vergleich: Whisper Large-v3 erreicht auf Englisch- und Französisch-Benchmarks eine WER unter 5 %. Wolof liegt nicht in derselben Liga.
Meine Einschätzung: Jeder Dienst, der 2026 für Wolof eine WER unter 15 % bewirbt, ohne einen verifizierten Benchmark zu nennen, sollte man skeptisch lesen. Die akademische Evidenz deutet je nach Datensatz und Methode auf einen Bereich von 30–70 % WER hin.
Die zwei Tools, die Wolof tatsächlich listen
Google Cloud Speech-to-Text V2 unterstützt Wolof (wo-SN) in seiner dokumentierten Sprachliste. Das ist echte, verifizierte Unterstützung auf API-Ebene. Wie es um die Qualität steht, ist eine andere Frage. Google veröffentlicht keine WER-Benchmarks pro Sprache, und Wolof zählt nicht zu den Sprachen, die Google qualitativ hervorhebt. Es nutzt ein V2-Standardmodell mit minutengenauer, verbrauchsabhängiger Abrechnung (die ersten 60 Minuten kostenlos, danach 0,004 $ pro 15 Sekunden zum Standardtarif). Das sind grob 0,016 $ pro Minute bzw. rund 0,96 $ pro Stunde zu Basistarifen, mit sinkenden Preisen bei höherem Volumen. Der Funktionsumfang für Wolof in V2 ist rudimentär: Transkription, keine Sprecherdiarisierung und kein ausgefeiltes Confidence-Scoring.
ElevenLabs Scribe führt Wolof unter seinen 99 unterstützten Sprachen auf. Die eigene Benchmark-Seite pro Sprache ordnet Wolof der WER-Stufe „Moderat“ zu, mit rund 40,7 % WER für Scribe v1. Das ist deutlich besser als der aktuelle akademische Referenzpunkt, bedeutet aber weiterhin im Schnitt 4 Fehler auf 10 Wörter. Bei Scribes Preisen von 0,22 $ pro Stunde über die API (0,40 $ pro Stunde im Pay-as-you-go-Verfahren) ist die Wolof-Transkription erschwinglich, doch für alles Formelle braucht die Ausgabe erhebliche Nachbearbeitung. Scribe mit 40 % WER schlägt HuBERT mit 68–72 % WER, was den Skalierungsvorteil aus ElevenLabs' größerem Trainingskorpus widerspiegelt.
Keines der beiden Tools liefert publikationsreife Wolof-Transkripte ohne einen Korrekturdurchgang.
Die urbane Wolof-Realität: Französisch macht die Hälfte des Signals
Linguisten, die die Sprache Dakars untersuchen, beschreiben städtisches Wolof als Kontaktvarietät, die so gründlich mit dem Französischen durchsetzt ist, dass reines Wolof oder reines Französisch in lockeren Dakar-Gesprächen ungewöhnlich genug ist, um aufzufallen. Das ist kein Codeswitching im traditionellen Sinne eines Wechsels zwischen zwei Codes. Forscher haben die urbane Dakar-Sprache als dritten Code charakterisiert, der manchmal „Dakarois“ genannt wird und in dem Wolof-Grammatik und französischer Wortschatz innerhalb einzelner Äußerungen gemeinsam auftreten.
Ein repräsentativer Satz könnte lauten: „Damay dem au bureau, mais avant ñu warna passer chez le marabout.“ Etwa die Hälfte des lexikalischen Inhalts dieses Satzes ist Französisch.
Bei Aufnahmen dieser Art erfasst die Transkription über den Französisch-Track den Großteil der Inhalte korrekt. Die grammatikalischen Partikel, Pronomen und Verben des Wolof kommen falsch oder leer heraus, aber die französischen Substantive, Verben und Phrasen, die den Großteil des propositionalen Gehalts tragen, werden korrekt transkribiert. Das Ergebnis ist ein hybrides Transkript, dessen grammatikalisches Gerüst eine Bearbeitung durch Wolof-Kundige braucht, dessen Inhaltswörter aber stimmen.
Das ist keine perfekte Lösung. Aber es ist die ehrliche. Wenn Ihr Audio Dakar-Radio, städtische Interviews oder senegalesische Podcast-Inhalte mit gebildeten und zweisprachigen Sprechern ist, liefert Ihnen die Französisch-Track-Transkription schneller einen brauchbaren ersten Entwurf, als es eine native Wolof-Transkription mit 40–70 % WER täte.
Wenn Sie ein sauberes, französischbasiertes Transkript senegalesischen Audios brauchen, geht das Audio-zu-Text-Tool von ConvertAudioToText präzise mit Französisch um und erfasst wolof-französisch codeswitchende Sprache ohne die Verwirrung der Engine, die entsteht, wenn man einen Sprachcode erzwingt, auf dem das Modell nie trainiert wurde.
Gambisches Wolof: ein eigenes Dialektproblem
Gambisches und senegalisches Wolof tragen getrennte ISO-639-3-Codes (wof bzw. wol) und weichen im Wortschatz spürbar voneinander ab. Da Gambia eine ehemalige britische Kolonie ist, entlehnt gambisches Wolof aus dem Englischen, wo senegalisches Wolof aus dem Französischen entlehnt. Der natürliche Codeswitch eines gambischen Wolof-Sprechers geht ins Englische, nicht ins Französische.
Die praktische Konsequenz: Der Französisch-Track-Workaround, der bei urbanem Dakar-Inhalt hilft, funktioniert bei gambischem Wolof-Inhalt nicht. Ein Satz gambischen Wolofs mit englischen Entlehnungen würde bei einem französischen Modell genauso danebengehen wie bei einem Wolof-Modell. Für gambisches Wolof lautet die ehrliche Antwort 2026 manuelle Transkription, wobei KI nur für die englischdominanten Passagen eingesetzt wird.
Beide Dialekte sind sich in der gesprochenen Form gegenseitig verständlich, unterscheiden sich aber in ihren orthografischen Konventionen und ihrem Lehnwortbestand. Wolof-ASR-Trainingsdaten sind überwiegend senegalesisch, daher schneiden selbst Tools wie ElevenLabs Scribe, die Wolof-Unterstützung behaupten, bei gambischem Input schlechter ab.
Schrift und Orthografie
Die offizielle lateinische Orthografie für Wolof in Senegal wurde 1974 per Regierungsverfügung standardisiert, mit dem Centre de linguistique appliquée de Dakar (CLAD) als maßgeblicher Instanz. Das Alphabet umfasst:
- Ñ für den palatalen Nasallaut (wie im spanischen ñ)
- Ŋ für den velaren Nasallaut
- À, É, Ë, Ó als Vokale mit Diakritika
- Geminaten (verdoppelte Konsonanten) für die Länge: kk, bb, tt
Eine parallele arabisch-basierte Schrift, Wolofal, existiert und hatte historisch religiöse Verwendung, wurde jedoch nie formell per Regierungsverfügung übernommen. Digitale Wolof-Inhalte nutzen heute fast ausschließlich die lateinische Orthografie.
KI-Transkriptionsausgaben in Wolof sollten die lateinische Schrift erzeugen. Wenn Sie Ausgaben von Google STT oder ElevenLabs Scribe prüfen, kontrollieren Sie, ob ñ korrekt dargestellt wird und ob Geminaten erhalten bleiben statt zusammenzufallen. Das sind häufige Fehlerquellen bei Ausgaben ressourcenarmer afrikanischer Sprachen.

Vergleich der Wolof-Transkriptionsoptionen 2026
| Tool | Wolof gelistet | Tatsächliche WER | Anmerkungen |
|---|---|---|---|
| Whisper Large-v3 | Nein | N/A | Nicht in der Sprachliste |
| AssemblyAI Universal | Nein | N/A | Nicht gelistet |
| Deepgram Nova-3 | Nein | N/A | Nicht gelistet |
| Google STT V2 | Ja (wo-SN) | Nicht veröffentlicht | Basis-V2-Modell, verbrauchsbasiert |
| ElevenLabs Scribe | Ja | ca. 40,7 % WER | Scribe-v1-Benchmark, Stufe „Moderat“ |
| Menschliche Transkription | N/A | Nahe 0 % | Langsam, benötigt Wolof-Französisch-Zweisprachigkeit |
Die Tabelle zeigt einen Markt ohne produktionsreife Option. Eine „moderate“ WER von 40 % bedeutet grob 4 falsche Wörter pro 10 Wörtern – eine erhebliche Nachbearbeitungslast für den professionellen Einsatz.
Für einen breiteren Blick darauf, wie ressourcenarme afrikanische Sprachen gegen aktuelle ASR-Modelle abschneiden, siehe den Beitrag warum KI bei ressourcenarmen Sprachen schwächelt. Die Wolof-Lage ist kein Einzelfall: Ähnliche Lücken bestehen bei Hausa, Amharisch und mehreren anderen Sprachen mit zig Millionen Sprechern, aber dünnen digitalen Text- und Audiokorpora.
Was Wolof-Podcaster und Journalisten jetzt tun sollten
Die Wolof-Podcast-Szene wächst. Wolof Tech auf Spotify und Apple Podcasts behandelt Technologie auf Wolof. Das Projekt „Xam sa démb, xam sa tey“ hat 50 Folgen mit Wolof- und Französisch-Geschichtsinhalten in Partnerschaft mit dem Nationalarchiv Senegals veröffentlicht. Akademische Forscher nutzen Feldaufnahmen, um die mündliche Überlieferung zu erforschen.
Für diese Produzenten hängt der praktikable Workflow 2026 vom Inhaltstyp ab:
Urbane Wolof-Französisch-Podcasts (Dakar-Publikum): Auf Französisch transkribieren. Die Ausgabe prüfen, dann die grammatikalischen Elemente des Wolof manuell ergänzen. Nach dem Korrekturdurchgang als SRT für Untertitel exportieren. Das ist langsamer als ideal, liefert aber brauchbare Ergebnisse.
Formelles oder ländliches Wolof (minimal Französisch): ElevenLabs Scribe mit ausgewähltem Wolof verwenden und Zeit für einen vollständigen Korrekturdurchgang einplanen. Bei 40 % WER als ersten Entwurf behandeln, nicht als Transkript. Bei wichtigen Archivaufnahmen ist ein zweisprachiger menschlicher Transkribent die ehrlichere Wahl.
Gambisches Wolof: Menschliche Transkription oder Englisch-Track für englischdominante Passagen nutzen. Kein KI-Tool liefert speziell für gambische Inhalte brauchbare Wolof-Ausgaben.
Journalistische Nutzung: Senegalesische Journalisten, die auf Französisch schreiben, müssen oft Zitate aus Interviews auf Wolof herausziehen. Der Französisch-Track-Ansatz erfasst die französischen Passagen korrekt. Wolof-Zitate, die exakt wiedergegeben werden müssen, erfordern manuelle Transkription.
Für Inhalte, die primär Französisch mit Wolof-Einschüben sind, zeigt der Beitrag beste Transkription für afrikanische Sprachen, welche Engines die französisch-afrikanische Akzentlandschaft am genauesten handhaben.
Was sich ändern wird (und wann)
Die 2025 veröffentlichte Forschung hat messbare Fortschritte gemacht. Das kuratierte 860-Stunden-Wolof-Korpus und das HuBERT-basierte Speech-Language-Modell aus arXiv:2509.15362 zeigen, dass gezieltes Pretraining die Wolof-WER vom akademischen Referenzpunkt in einen besser handhabbaren Bereich bewegt. ElevenLabs Scribe mit 40,7 % WER ist für sich genommen bereits eine bedeutende Verbesserung gegenüber der Lage von Wolof-ASR vor zwei Jahren.
Der nächste Schritt, der die praktische Landschaft verändern würde, wäre, dass einer der großen gehosteten Anbieter (Deepgram, AssemblyAI, OpenAI) ein Wolof-fähiges Modell trainiert und es in Produktionsgröße ausrollt. Keiner davon hat dies angekündigt. Der Beitrag der Wolof-Community zu Common Voice und ähnlichen öffentlichen Korpora würde diesen Zeitplan beschleunigen, da kommerzielle ASR-Labore diese Datensätze als Benchmarks und Trainingssignale nutzen.
Bis dahin lautet die ehrliche Antwort: Wolof-Transkription ist 2026 ein Problem, das entweder ungenaue KI oder manuelle menschliche Arbeit bedeutet, und der Französisch-Track-Workaround ist der praktischste Weg für die Inhalte, die die meisten Nutzer tatsächlich haben.
FAQ
Unterstützt Whisper Large-v3 Wolof?
Nein. Wolof ist nicht in der Sprachliste von Whisper Large-v3 enthalten. Das Modell unterstützt 99 Sprachen, und die afrikanischen Sprachen, die es abdeckt, umfassen Swahili, Yoruba, Hausa, Amharisch, Somali, Afrikaans, Lingala und Shona – aber nicht Wolof. Jeder auf Whisper basierende Dienst hat daher keine Wolof-Unterstützung.
Welche KI-Tools unterstützen die Wolof-Transkription 2026 tatsächlich?
Google Cloud Speech-to-Text V2 führt Wolof (Sprachcode wo-SN) in seiner dokumentierten Sprachunterstützung auf. ElevenLabs Scribe listet Wolof ebenfalls, mit einem veröffentlichten Benchmark von etwa 40,7 % Wortfehlerrate. Beide Optionen existieren, aber keine liefert saubere Ergebnisse ohne einen Korrekturdurchgang. Kein größeres Meeting-Bot- oder Team-Kollaborations-Tool (Otter, Fireflies, Trint, Descript) listet Wolof-Unterstützung.
Warum ist die Wolof-ASR-Genauigkeit so viel schlechter als bei Französisch oder Englisch?
Mangel an Trainingsdaten. Die größten öffentlichen Wolof-Sprachdatensätze haben je nach Projekt 55 bis 860 Stunden Audio. Das ASR-Training für Englisch umfasst Hunderttausende Stunden. Common Voice, das größte mehrsprachige Crowdsourcing-Korpus, hat keine Wolof-Sammlung. Ohne Trainingsdaten generalisieren Modelle schlecht auf die Wolof-Phonologie, die Tonmuster und den spezifischen Lautbestand der Sprache.
Was ist der Französisch-Codeswitching-Workaround und wann kommt er zur Anwendung?
Städtische Wolof-Sprecher in Dakar produzieren Sprache, die stark mit dem Französischen durchmischt ist – so sehr, dass Forscher sie als eigene Kontaktvarietät beschreiben. Stammt Ihr Audio von gebildeten Dakar-Sprechern, transkribiert die Einstellung der Transkriptionssprache auf Französisch sämtliche französischen Inhalte korrekt (oft die Mehrheit des lexikalischen Inhalts) und erzeugt leere oder verstümmelte Ausgaben für die grammatikalischen Partikel des Wolof. Der entstehende Entwurf muss bei den Wolof-Elementen nachbearbeitet werden, hält den propositionalen Gehalt aber genau fest. Dieser Workaround gilt nicht für ländliches senegalesisches Wolof oder gambisches Wolof, wo der Nicht-Wolof-Anteil Englisch statt Französisch ist.
Quellen
- Von Google Cloud Speech-to-Text V2 unterstützte Sprachen: https://cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- ElevenLabs-Scribe-Wolof-Benchmark-Seite: https://elevenlabs.io/speech-to-text/wolof
- ElevenLabs-Scribe-Preise: https://elevenlabs.io/pricing/api
- OpenAI-Whisper-Sprachliste (tokenizer.py): https://github.com/openai/whisper/blob/main/whisper/tokenizer.py
- arXiv: Speech Language Models for Under-Represented Languages: Insights from Wolof (2509.15362): https://arxiv.org/abs/2509.15362
- Wolof-Orthografie und Standardisierung (Janga Wolof): https://jangawolof.org/wolof-orthography-a-guide-to-writing-the-wolof-language/
- Forschung zum Codeswitching im urbanen Wolof (ResearchGate): https://www.researchgate.net/publication/254333661_Two_Codes_or_One_The_Insiders'_View_and_the_Description_of_Codeswitching_in_Dakar
- Wolof-Sprecher und Dialektgeografie (Wikipedia): https://en.wikipedia.org/wiki/Wolof_language
- Von AssemblyAI unterstützte Sprachen: https://assemblyai.com/docs/Concepts/supported_languages
- Wolof-Tech-Podcast (Spotify): https://open.spotify.com/show/6repqMDxu0d5eq7U3BaZFq
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.