
Transcription du wolof : où en est le support en 2026
Summarize this article with:
Où en est le support du wolof
Le wolof n’est pas pris en charge par la plupart des outils grand public de transcription par IA en 2026, et ceux qui revendiquent ce support affichent des taux d’erreur élevés. Whisper Large-v3, qui alimente la plupart des services vantant une large couverture linguistique, n’inclut pas du tout le wolof dans sa liste de 99 langues. Deepgram Nova-3 et AssemblyAI Universal ne le listent pas non plus. Pour la majorité des contenus en wolof, la voie pratique en 2026 ne consiste pas à attendre un support natif, mais à comprendre pourquoi cet écart existe et à utiliser la solution de contournement par la piste française, efficace pour l’audio dakarois urbain.
Ce n’est pas une déficience des outils pour les langues sur lesquelles ils ont été conçus. C’est un problème de données d’entraînement : les plus grands corpus publics de parole en wolof, dont le jeu de données du projet ALFFA et la collection OpenSLR dédiée au wolof, vont d’environ 5 à 55 heures d’audio transcrite. Common Voice ne dispose d’aucun corpus en wolof. Les données d’entraînement en anglais de Whisper se chiffrent en centaines de milliers d’heures. Cet écart explique l’écart de WER.
Ce que montre réellement la recherche
Un article de 2025 sur l’ASR du wolof (« Speech Language Models for Under-Represented Languages: Insights from Wolof », arXiv:2509.15362) constitue le benchmark publié le plus clair sur l’état des lieux. L’étude a constitué 860 heures d’audio spontané en wolof de haute qualité, poursuivi le pré-entraînement de HuBERT sur ces données et intégré l’encodeur vocal résultant dans un modèle de langage wolof. Même avec cet effort dédié, les résultats ASR en wolof se situaient dans la fourchette d’environ 68 à 72 % de WER dans des conditions d’entraînement multilingue. Il s’agit d’un taux d’erreur par mot : en moyenne, environ 1 mot sur 3 sort faux.
À titre de comparaison, Whisper Large-v3 atteint moins de 5 % de WER sur les benchmarks anglais et français. Le wolof n’est pas dans la même catégorie.
Mon avis : tout service annonçant un WER inférieur à 15 % pour le wolof en 2026 sans citer un benchmark vérifié doit être lu avec scepticisme. Les données académiques pointent vers une fourchette de 30 à 70 % de WER selon le jeu de données et la méthode.
Les deux outils qui listent réellement le wolof
Google Cloud Speech-to-Text V2 prend en charge le wolof (wo-SN) dans sa liste documentée des langues. Il s’agit d’un support réel et vérifié au niveau de l’API. La qualité est une autre question. Google ne publie pas de benchmarks WER par langue, et le wolof ne fait pas partie des langues mises en avant par Google pour leur qualité. Il utilise un modèle standard V2 avec une tarification décomptée à la minute (gratuit pour les 60 premières minutes, puis 0,004 $ par tranche de 15 secondes à l’échelle standard). Cela représente environ 0,016 $ par minute, soit près de 0,96 $ par heure aux tarifs de base, avec une baisse en volume. Le support fonctionnel du wolof dans V2 reste basique : la transcription, sans diarisation ni scoring avancé de confiance.
ElevenLabs Scribe liste le wolof parmi ses 99 langues prises en charge. Leur propre page de benchmark par langue classe le wolof dans le palier « Modéré » de WER, à environ 40,7 % de WER pour Scribe v1. C’est nettement mieux que la référence académique actuelle, mais cela signifie toujours 4 erreurs pour 10 mots en moyenne. Au tarif de Scribe de 0,22 $ par heure via API (0,40 $ par heure en paiement à l’usage), la transcription du wolof est abordable, mais la sortie exigera une édition substantielle pour tout usage formel. Scribe à 40 % de WER surpasse HuBERT à 68-72 % de WER, ce qui reflète le bénéfice d’échelle tiré du corpus d’entraînement plus vaste d’ElevenLabs.
Aucun des deux outils ne produit de transcriptions en wolof prêtes à publier sans une passe de relecture.
La réalité du wolof urbain : le français représente la moitié du signal
Les linguistes qui étudient la parole dakaroise décrivent le wolof urbain comme une variété de contact si profondément mélangée au français que croiser du wolof pur ou du français pur dans une conversation informelle à Dakar est assez inhabituel pour être remarqué. Ce n’est pas de l’alternance codique au sens traditionnel d’une alternance entre deux codes. Les chercheurs ont caractérisé la parole urbaine dakaroise comme un troisième code, parfois appelé « dakarois », dans lequel la grammaire wolof et le vocabulaire français coexistent au sein d’un même énoncé.
Une phrase représentative pourrait être : « Damay dem au bureau, mais avant ñu warna passer chez le marabout. » Environ la moitié du contenu lexical y est français.
Pour les enregistrements de ce type, transcrire sur la piste française capture correctement la majorité du contenu. Les particules grammaticales, pronoms et verbes wolof sortent faux ou vides, mais les noms, verbes et expressions français portant l’essentiel du contenu propositionnel sont transcrits avec précision. Le résultat est une transcription hybride qui exige une édition par quelqu’un sachant lire le wolof sur l’ossature grammaticale, mais dont les mots de contenu sont justes.
Ce n’est pas une solution parfaite. C’est la solution honnête. Si votre audio est une radio dakaroise, des entretiens urbains ou des contenus de podcasts sénégalais avec des locuteurs éduqués et bilingues, la transcription sur piste française vous donnera un premier jet exploitable plus vite qu’une transcription native du wolof à 40-70 % de WER.
Si vous avez besoin d’une transcription propre à dominante française d’un audio sénégalais, l’outil audio-vers-texte de ConvertAudioToText traite le français avec précision et capture la parole en alternance codique wolof-français sans la confusion moteur qu’entraîne l’imposition d’un code de langue sur lequel le modèle n’a pas été entraîné.
Le wolof gambien : un problème dialectal distinct
Le wolof gambien et le wolof sénégalais portent des codes ISO 639-3 distincts (wof et wol respectivement) et divergent sensiblement dans leur vocabulaire. La Gambie étant une ancienne colonie britannique, le wolof gambien emprunte à l’anglais là où le wolof sénégalais emprunte au français. L’alternance codique naturelle d’un locuteur de wolof gambien se fait vers l’anglais, non vers le français.
Conséquence pratique : la solution de contournement par la piste française, utile pour les contenus urbains dakarois, ne fonctionne pas pour les contenus en wolof gambien. Une phrase de wolof gambien avec des emprunts à l’anglais échouerait aussi lamentablement sur un modèle français que sur un modèle wolof. Pour le wolof gambien, la réponse honnête en 2026 est la transcription manuelle, l’IA n’étant utilisée que pour les passages à dominante anglaise.
Les deux dialectes sont mutuellement intelligibles à l’oral, mais diffèrent dans leurs conventions orthographiques et leur inventaire d’emprunts. Les données d’entraînement ASR du wolof sont massivement sénégalaises ; même des outils comme ElevenLabs Scribe qui revendiquent le support du wolof performeront donc moins bien sur des entrées gambiennes.
Écriture et orthographe
L’orthographe latine officielle du wolof au Sénégal a été normalisée en 1974 par décret gouvernemental, le Centre de linguistique appliquée de Dakar (CLAD) faisant autorité. L’alphabet comprend :
- Ñ pour la nasale palatale (comme le ñ espagnol)
- Ŋ pour la nasale vélaire
- À, É, Ë, Ó comme voyelles diacritées
- Consonnes géminées (doublées) pour la longueur : kk, bb, tt
Une écriture parallèle d’inspiration arabe, le wolofal, existe et a connu un usage religieux historique, mais n’a jamais été officiellement adoptée par décret gouvernemental. Le contenu numérique en wolof aujourd’hui utilise presque exclusivement l’orthographe latine.
La sortie de transcription IA en wolof doit produire l’écriture latine. Si vous relisez une sortie de Google STT ou d’ElevenLabs Scribe, vérifiez que le ñ s’affiche correctement et que les consonnes géminées sont préservées plutôt que fusionnées. Ce sont des modes de défaillance courants sur les sorties de langues africaines peu dotées en ressources.

Comparer les options de transcription du wolof en 2026
| Outil | Wolof listé | WER réel | Notes |
|---|---|---|---|
| Whisper Large-v3 | Non | N/A | Absent de la liste des langues |
| AssemblyAI Universal | Non | N/A | Non listé |
| Deepgram Nova-3 | Non | N/A | Non listé |
| Google STT V2 | Oui (wo-SN) | Non publié | Modèle V2 basique, facturation décomptée |
| ElevenLabs Scribe | Oui | ~40,7 % de WER | Benchmark Scribe v1, palier « Modéré » |
| Transcription humaine | N/A | Proche de 0 % | Lente, exige un bilingue wolof-français |
Le tableau révèle un marché sans option de qualité production. Un WER « Modéré » à 40 % signifie environ 4 mots erronés pour 10 mots, soit une lourde charge d’édition pour un usage professionnel.
Pour un panorama plus large de la situation des langues africaines peu dotées en ressources face aux modèles ASR actuels, consultez l’article pourquoi l’IA peine avec les langues peu dotées en ressources. La situation du wolof n’est pas unique : des écarts similaires existent pour le haoussa, l’amharique et plusieurs autres langues comptant des dizaines de millions de locuteurs mais des corpus numériques de texte et d’audio minces.
Ce que les podcasteurs et journalistes en wolof doivent faire maintenant
La scène des podcasts en wolof grandit. Wolof Tech sur Spotify et Apple Podcasts traite de technologie en wolof. Le projet « Xam sa démb, xam sa tey » a publié 50 épisodes de contenus historiques en wolof et en français en partenariat avec les Archives nationales du Sénégal. Des chercheurs universitaires utilisent des enregistrements de terrain pour étudier la tradition orale.
Pour ces producteurs, le flux de travail pratique en 2026 dépend du type de contenu :
Podcasts wolof-français urbains (audience dakaroise) : transcrivez sur le français. Relisez la sortie, puis complétez manuellement les éléments grammaticaux wolof. Exportez en SRT pour les sous-titres après la passe d’édition. C’est plus lent que l’idéal, mais cela produit un résultat exploitable.
Wolof formel ou rural (français minimal) : utilisez ElevenLabs Scribe avec le wolof sélectionné et prévoyez une passe d’édition complète. À 40 % de WER, considérez-le comme un premier jet, pas comme une transcription. Pour les enregistrements d’archives importants, un transcripteur humain bilingue est le choix le plus honnête.
Wolof gambien : recourez à la transcription humaine ou à la piste anglaise pour les passages à dominante anglaise. Aucun outil d’IA ne produit de sortie wolof exploitable spécifiquement pour les contenus gambiens.
Usage journalistique : les journalistes sénégalais écrivant en français ont souvent besoin d’extraire des citations d’entretiens en wolof. L’approche par piste française capture fidèlement les passages français. Les citations wolof devant être reproduites exactement exigent une transcription manuelle.
Pour les contenus principalement en français avec insertions wolof, l’article la meilleure transcription pour les langues africaines détaille quels moteurs gèrent le plus précisément le paysage des accents franco-africains.
Ce qui va changer (et quand)
Les recherches publiées en 2025 ont permis des progrès mesurables. Le corpus wolof de 860 heures constitué et le modèle de langage vocal fondé sur HuBERT issus de arXiv:2509.15362 montrent qu’un pré-entraînement dédié fait passer le WER du wolof de la référence académique à une fourchette plus exploitable. ElevenLabs Scribe à 40,7 % de WER constitue en soi une amélioration significative par rapport à la situation de l’ASR du wolof il y a deux ans.
La prochaine étape susceptible de changer le paysage pratique serait que l’un des grands fournisseurs hébergés (Deepgram, AssemblyAI, OpenAI) entraîne un modèle capable de traiter le wolof et le déploie à l’échelle de la production. Aucun d’eux ne l’a annoncé. La contribution de la communauté wolophone à Common Voice et à des corpus publics similaires accélérerait ce calendrier, car les laboratoires commerciaux d’ASR utilisent ces jeux de données comme références et signaux d’entraînement.
D’ici là, la réponse honnête est : la transcription du wolof en 2026 relève d’une IA à faible précision ou d’un travail humain manuel, et la solution de contournement par la piste française est la voie la plus pratique pour les contenus que possèdent réellement la plupart des utilisateurs.
FAQ
Whisper Large-v3 prend-il en charge le wolof ?
Non. Le wolof ne figure pas dans la liste des langues de Whisper Large-v3. Le modèle prend en charge 99 langues, et parmi les langues africaines couvertes figurent le swahili, le yoruba, le haoussa, l’amharique, le somali, l’afrikaans, le lingala et le shona, mais pas le wolof. Par conséquent, aucun service construit sur Whisper ne propose le wolof.
Quels outils d’IA prennent réellement en charge la transcription du wolof en 2026 ?
Google Cloud Speech-to-Text V2 liste le wolof (code de langue wo-SN) dans son support documenté des langues. ElevenLabs Scribe liste également le wolof, avec un benchmark publié affichant environ 40,7 % de taux d’erreur par mot. Les deux options existent, mais aucune ne produit une sortie propre sans une passe de relecture. Aucun outil majeur de bot de réunion ou de collaboration d’équipe (Otter, Fireflies, Trint, Descript) ne liste le wolof.
Pourquoi la précision de l’ASR du wolof est-elle bien inférieure à celle du français ou de l’anglais ?
La rareté des données d’entraînement. Les plus grands jeux de données publics de parole en wolof comptent entre 55 et 860 heures d’audio selon le projet. L’entraînement ASR pour l’anglais se chiffre en centaines de milliers d’heures. Common Voice, le plus grand corpus participatif multilingue, ne dispose d’aucune collection en wolof. Sans données d’entraînement, les modèles généralisent mal à la phonologie du wolof, à ses schémas tonaux et à l’inventaire sonore spécifique de la langue.
En quoi consiste la solution de contournement par l’alternance codique avec le français, et quand s’applique-t-elle ?
Les locuteurs du wolof urbain à Dakar produisent une parole fortement mélangée au français, au point que les chercheurs la décrivent comme une variété de contact distincte. Si votre audio provient de locuteurs dakarois éduqués, régler la langue de transcription sur le français transcrira correctement tout le contenu français (souvent majoritaire dans le contenu lexical) et produira une sortie vide ou altérée pour les particules grammaticales wolof. Le brouillon obtenu nécessite une édition des éléments wolof, mais capture fidèlement le contenu propositionnel. Cette solution ne s’applique ni au wolof rural sénégalais ni au wolof gambien, où la langue non-wolof est l’anglais plutôt que le français.
Sources
- Langues prises en charge par Google Cloud Speech-to-Text V2 : https://cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Page de benchmark wolof d’ElevenLabs Scribe : https://elevenlabs.io/speech-to-text/wolof
- Tarification d’ElevenLabs Scribe : https://elevenlabs.io/pricing/api
- Liste des langues d’OpenAI Whisper (tokenizer.py) : https://github.com/openai/whisper/blob/main/whisper/tokenizer.py
- arXiv : Speech Language Models for Under-Represented Languages: Insights from Wolof (2509.15362) : https://arxiv.org/abs/2509.15362
- Orthographe et normalisation du wolof (Janga Wolof) : https://jangawolof.org/wolof-orthography-a-guide-to-writing-the-wolof-language/
- Recherche sur l’alternance codique du wolof urbain (ResearchGate) : https://www.researchgate.net/publication/254333661_Two_Codes_or_One_The_Insiders'_View_and_the_Description_of_Codeswitching_in_Dakar
- Locuteurs de la langue wolof et géographie dialectale (Wikipédia) : https://en.wikipedia.org/wiki/Wolof_language
- Langues prises en charge par AssemblyAI : https://assemblyai.com/docs/Concepts/supported_languages
- Podcast Wolof Tech (Spotify) : https://open.spotify.com/show/6repqMDxu0d5eq7U3BaZFq
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription for African Languages in 2026: Honest Rankings
Which engines actually support Swahili, Hausa, Yoruba, Amharic, Wolof, and Zulu in 2026? Verified support matrices, honest WER context, and the tools that genuinely work.
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.