
Transcription en haoussa : prise en charge par les moteurs, écriture et précision en 2026
Summarize this article with:
La réponse courte
Le haoussa dispose en 2026 d'une transcription IA prête pour la production, mais offerte par une poignée de moteurs seulement. Whisper Large-v3 et les modèles Chirp de Google Cloud s'en chargent. AssemblyAI le liste mais signale une précision « correcte » (taux d'erreur de mots supérieur à 50 % sur de l'audio typique). Le reste des grands outils grand public — Otter, Trint, Descript — ne prend tout simplement pas en charge le haoussa. Si votre audio est en haoussa, le choix du moteur est la première décision à prendre.
Pourquoi la transcription en haoussa compte dès maintenant
Le haoussa compte environ 50 millions de locuteurs de langue maternelle et 30 millions de personnes supplémentaires qui l'utilisent comme seconde langue, concentrés dans le nord du Nigeria et au Niger, avec des communautés importantes au Ghana, au Cameroun, au Tchad et au Soudan. C'est la langue véhiculaire dominante du Sahel. En mars 2025, le Niger a fait du haoussa sa langue officielle, remplaçant le français. Ce changement amplifie la demande d'outils numériques en haoussa dans l'administration, les médias et l'éducation.
Kannywood, l'industrie cinématographique en haoussa basée à Kano, produit environ 50 films par mois pendant les hautes saisons et emploie plus de 30 000 personnes. Des diffuseurs internationaux comme BBC Hausa, Deutsche Welle Hausa et Voice of America Hausa maintiennent des services dédiés au haoussa. Le volume de contenu est bien réel. Les outils, eux, ne l'étaient pas jusqu'à récemment.
Boko vs Ajami : la question de l'écriture
Avant de transcrire, il est utile de savoir quel système d'écriture s'applique à votre contenu.
Le boko est l'écriture à base latine et la norme moderne. Les journaux nigérians, les contenus numériques, les transcriptions radiodiffusées et la plupart des supports éducatifs utilisent le boko. Il comprend quatre caractères qui n'existent pas dans l'alphabet latin standard :
- ɓ : implosive bilabiale (distincte du « b » anglais simple)
- ɗ : implosive alvéolaire (distincte du « d » anglais simple)
- ƙ : occlusive vélaire éjective sourde (distincte du « k » anglais simple)
- ʼy : approximante palatale glottalisée
Ces caractères ne sont pas décoratifs. Remplacer un « b » simple par « ɓ » change le sens du mot. Un moteur qui produit des lettres latines simples pour ces sons génère une transcription dégradée.
L'ajami est la tradition en écriture arabe, utilisée historiquement pour les textes religieux, le savoir islamique et la littérature haoussa classique. L'ajami n'a pas de système orthographique normalisé entre les scripteurs, ce qui le rend beaucoup plus difficile à modéliser. Les moteurs de transcription IA sont entraînés principalement sur le boko, donc l'audio majoritairement en ajami (récitations dévotionnelles soufies, anciens manuscrits islamiques lus à voix haute) produira des résultats peu fiables quel que soit le moteur utilisé. Si votre contenu est en ajami, considérez l'IA comme un simple premier jet approximatif.
Whisper Large-v3, qui alimente ConvertAudioToText, produit le boko standard, y compris ɓ, ɗ et ƙ. Google Cloud STT via Chirp cible également la locale ha-NG. Vérifiez le résultat de tout autre outil sur un court extrait contenant ces caractères avant de valider votre flux de travail.

Phonologie du haoussa : ce qui le rend difficile pour la reconnaissance vocale
Le haoussa est une langue tonale avec trois contrastes de hauteur : haut, bas et descendant. Le ton marque la fonction grammaticale et le sens lexical, mais le haoussa écrit standard n'utilise pas de diacritiques tonals. C'est en réalité parfait pour la transcription : les locuteurs n'écrivent pas les marques tonales, et les moteurs de transcription non plus. Le résultat sera un texte sans indication tonale, ce qui est exactement ce qu'attend un lecteur haoussa.
Le problème plus coriace est l'inventaire des consonnes. Le haoussa possède 32 consonnes, dont des contrastes entre occlusives simples, palatalisées et labialisées, ainsi que les séries implosive et éjective. Ce sont des phonèmes qui distinguent les mots. La rareté des données d'entraînement amplifie le risque : Mozilla Common Voice dispose d'environ 10 heures de haoussa validées, et même des corpus organisés plus vastes comme NaijaVoices n'en rassemblent qu'environ 600 heures. Comparez cela aux milliers d'heures disponibles pour l'anglais ou le français, et l'écart de précision apparaît structurel, et non comme un bug logiciel.
De plus, la longueur des voyelles est distinctive en haoussa : les voyelles brèves et longues portent des sens différents. Les moteurs entraînés sur des données limitées en haoussa peuvent rater les distinctions de longueur, particulièrement dans la parole informelle ou rapide.
Quels moteurs prennent en charge le haoussa (honnêtement)
| Moteur | Prise en charge du haoussa | Niveau de précision | Notes |
|---|---|---|---|
| Whisper Large-v3 | Oui | Intermédiaire pour les langues africaines | Sortie boko incluant ɓ ɗ ƙ |
| Google Cloud STT (Chirp 3) | Oui, ha-NG | Non publiée | API, configuration développeur requise |
| AssemblyAI Universal-2 | Oui | « Correcte » (WER signalé supérieur à 50 %) | Précision attendue plus faible |
| Deepgram Nova-3 | Pas de haoussa confirmé | S/O | Absent de la liste des langues prises en charge |
| Otter.ai | Non | S/O | 6 langues seulement |
| Trint | Non confirmé | S/O | Pas de haoussa dans la liste vérifiée des langues |
| Descript | Non | S/O | Outillage centré sur l'anglais |
| Rev | Non | S/O | Relecture humaine possible ; pas l'IA |
Mon avis : la catégorie « précision correcte » auto-déclarée par AssemblyAI est honnête mais décourageante. Pour du contenu en haoussa où vous avez besoin d'une sortie boko propre avec les consonnes à crochet intactes, Whisper Large-v3 est le choix pratique compte tenu de ce qui est publiquement vérifiable. Le Chirp 3 de Google Cloud mérite d'être testé si vous avez accès à l'API, mais il demande plus de configuration qu'un outil de transcription grand public.
Pour un aperçu plus large de la façon dont les moteurs se comparent sur les langues moins courantes, voir pourquoi l'IA peine avec les langues à faibles ressources.
Précision selon le type d'audio
La précision de Whisper Large-v3 sur le haoussa est inférieure à celle obtenue sur l'anglais, le français ou même l'arabe, car le corpus d'entraînement est plus petit. Ordres de grandeur attendus selon les conditions audio :
- Journal ou radio en haoussa enregistrés en studio (NTA Hausa, service DW Hausa) : 85 à 90 %.
- Discours politique formel ou sermon du vendredi sur un audio propre : 82 à 88 %.
- Podcast en haoussa, deux locuteurs, bruit minimal : 78 à 85 %.
- Haoussa urbain nigérian avec alternance codique vers l'anglais : proche de la plage ci-dessus ; Whisper gère raisonnablement le mélange.
- Enregistrements de terrain avec bruit ambiant (marchés, événements en plein air) : 65 à 78 %. Le bruit de fond nuit davantage à la précision du haoussa qu'à celle de l'anglais, car le modèle dispose de moins de marge pour compenser.
- Haoussa du Niger (dialecte nigérien, proche du kananci mais au vocabulaire distinct) : 78 à 85 %, sans réglage particulier.
Il sagit d'estimations fondées sur les facteurs acoustiques et de données d'entraînement évoqués ci-dessus, et non de benchmarks publiés. Aucun classement public d'ASR pour le haoussa ne suit ces conditions spécifiques. Considérez-les comme des plages de planification, pas des garanties, et testez toujours un extrait sur votre contenu réel avant de vous engager dans un flux de travail à gros volume.
Dialectes : Kano, Sokoto, Zaria, Niger
Aux fins de transcription, le haoussa standard est le kananci, le dialecte de Kano. C'est la norme de diffusion, la norme éducative, et ce qu'utilise la plupart des contenus numériques en haoussa.
Le sakkwatanci (dialecte de Sokoto) est la variété occidentale, considérée comme classique dans la tradition littéraire haoussa. Il présente des traits conservateurs qui divergent du kananci sur le plan du vocabulaire et de certaines formes phonologiques.
Le zazzaganci (dialecte de Zaria) est une variété méridionale présentant des différences de marquage du genre et de traitement des voyelles.
Le haoussa du Niger est proche du kananci, mais partage certains recoupements avec le sakkwatanci. Depuis l'adoption du haoussa comme langue officielle par le Niger en 2025, la demande de transcription des contenus gouvernementaux et médiatiques produits à Niamey ne cesse de croître. Les différences dialectales sont réelles mais n'empêchent pas l'intercompréhension, et un modèle entraîné principalement sur des données de haoussa nigérian traitera le haoussa du Niger avec une réduction de précision modeste.
Aucun moteur grand public actuel ne propose de réglage fin par dialecte haoussa. Si votre audio provient d'une région spécifique et que la précision sur un extrait de test ne répond pas à vos besoins, fournir un glossaire du vocabulaire distinctif local est la solution la plus pratique.
Alternance codique avec l'anglais
Le haoussa urbain nigérian à Kano, Kaduna et Abuja mélange librement l'anglais, surtout dans les contenus business, tech et jeunesse :
"Ina son kawo wani idea, but kafin in fara, mu yi short break."
Whisper produit les segments haoussa en boko et les segments anglais en anglais standard. Ce mélange reflète la façon dont ces locuteurs écrivent réellement, ce qui est exactement ce que vous voulez pour les notes de podcast, les descriptions YouTube ou les légendes sur les réseaux sociaux. Aucune configuration particulière n'est nécessaire.
Le haoussa rural et le haoussa du Niger contiennent beaucoup moins d'anglais. Cet audio reste en boko du début à la fin, ce qui fonctionne également correctement.
Flux de travail pratique pour le contenu en haoussa
Pour les producteurs de Kannywood, les monteurs radio et les journalistes, voici la séquence qui fonctionne :
- Enregistrez dans l'environnement le plus silencieux disponible. Le bruit ambiant extérieur dégrade la précision du haoussa davantage que celle des langues à fortes ressources, car le modèle dispose de moins de marge pour compenser.
- Définissez explicitement la langue de transcription sur le haoussa. La détection automatique peut confondre le haoussa avec l'arabe (en raison d'emprunts lexicaux partagés et de schémas intonatifs similaires) ou avec d'autres langues d'Afrique de l'Ouest sur des enregistrements bruités.
- Importez via l'outil audio vers texte. Pour le contenu vidéo, y compris les extraits de Kannywood et les interviews YouTube, l'outil vidéo vers texte gère l'extraction automatiquement.
- Activez les étiquettes de locuteurs si vous avez plus d'un locuteur. Attendez-vous à une diarisation fiable sur un audio propre à deux locuteurs, et moins fiable sur une radio à appels avec plusieurs voix qui se chevauchent.
- Ajoutez un glossaire de noms propres avant la relecture : noms de personnes haoussa (qui existent en de nombreuses variantes orthographiques), noms de lieux nigérians et nigériens, et tout nom de marque ou d'organisation figurant dans votre contenu.
- Relisez en ciblant spécifiquement les consonnes à crochet. Un écart comme « barka » face à « ɓarka » change le sens. C'est là que le plafond de précision lié aux faibles ressources se manifeste en pratique.
- Exportez en SRT pour les sous-titres YouTube ou en TXT pour la rédaction d'articles.
Pour la distribution Kannywood en particulier, les sous-titres SRT en haoussa élargissent l'audience vers la diaspora et vers les locuteurs de haoussa au Ghana et au Cameroun, qui peuvent ne pas saisir tout le vocabulaire du dialecte de Kano à la vitesse du film.
Usage par les ONG et le secteur du développement
Les organisations actives dans le nord du Nigeria, au Niger, au Tchad et dans l'ensemble du Sahel mènent fréquemment des entretiens de terrain en haoussa. Un agent de santé communautaire expliquant la résistance à la vaccination, un agriculteur décrivant ses échecs de récoltes, un commerçant de marché parlant de l'impact du prix du carburant : c'est ce type de contenu où la transcription en haoussa a le plus de valeur institutionnelle, et où la qualité audio constitue souvent le plus grand défi.
Pour les enregistrements de terrain des ONG, acceptez que la précision sera inférieure à celle d'un audio de qualité broadcast et prévoyez du temps pour la relecture a posteriori. La transcription reste tout de même bien plus rapide à relire qu'un fichier audio brut, même avec 75 % de précision. Les flux de travail multilingues associant le haoussa à l'anglais, au français et à l'arabe sont entièrement pris en charge dans le même abonnement.
La place de CATT
Si vous avez simplement besoin d'une transcription haoussa propre sans configuration d'API ni infrastructure cloud, ConvertAudioToText fait tourner Whisper Large-v3 avec sortie boko et étiquettes de locuteurs. Le forfait gratuit couvre 10 minutes de transcription, offertes une seule fois à l'inscription plutôt que chaque mois. L'offre Pro, à 9,99 $/mois, est illimitée et couvre le haoussa ainsi que toutes les autres langues prises en charge. Pour les journalistes et producteurs de podcasts travaillant à la fois en haoussa et en anglais, cela signifie qu'un seul abonnement couvre tout.
Pour comprendre comment la tarification API à la minute se compare aux outils à tarif fixe, voir comparaison des prix de transcription 2026.
Questions fréquentes
Quels moteurs de transcription IA prennent en charge le haoussa en 2026 ?
Whisper Large-v3 (utilisé par ConvertAudioToText) et Google Cloud Speech-to-Text via les modèles Chirp prennent tous deux en charge le haoussa. AssemblyAI liste également le haoussa avec son modèle Universal-2, mais le classe dans la catégorie « précision correcte », ce qui signifie des taux d'erreur de mots supérieurs à 50 % sur de l'audio typique. Otter.ai, Trint et Descript ne prennent pas du tout en charge le haoussa.
La transcription en haoussa restitue-t-elle l'écriture boko avec les bonnes consonnes à crochet ?
Cela dépend du moteur. Whisper Large-v3 produit l'écriture boko standard (à base latine) et gère les marqueurs implosifs et éjectifs ɓ, ɗ et ƙ. Si un outil renvoie des « b », « d », « k » simples au lieu des formes à crochet, il efface des distinctions phonologiquement significatives qui changent le sens des mots en haoussa.
Comment l'alternance codique entre haoussa et anglais affecte-t-elle la transcription ?
Les locuteurs du haoussa urbain nigérian à Kano, Kaduna et Abuja mélangent fréquemment l'anglais dans leurs conversations en haoussa. Whisper gère bien cela en pratique : les mots haoussa reviennent en écriture boko et les mots anglais en anglais. Le résultat reflète la façon dont ces locuteurs écrivent réellement, ce qui est utile pour les contenus de podcasts et de réseaux sociaux. L'audio en haoussa rural ou nigérien, avec peu d'anglais, présente une alternance codique négligeable et reste en boko du début à la fin.
Le haoussa est-il une langue tonale et cela affecte-t-il la transcription IA ?
Oui. Le haoussa possède trois contrastes de hauteur tonale : ton haut, ton bas et ton descendant. Le ton change le sens et la catégorie grammaticale. Le haoussa écrit standard ne note pas les tons avec des diacritiques (en dehors des textes linguistiques spécialisés), donc la sortie de transcription ne sera pas non plus marquée tonalement, ce qui est normal et attendu. Le principal risque pour la précision vient des consonnes implosives et éjectives, pas des tons, car celles-ci sont notées à l'écrit et peuvent être perdues par un moteur mal calibré.
Sources
- Fiche modèle OpenAI Whisper Large-v3 : huggingface.co/openai/whisper-large-v3
- Langues prises en charge par AssemblyAI (paliers de précision Universal-2) : assemblyai.com/docs/supported-languages
- Langues prises en charge par Google Cloud Speech-to-Text V2 (ha-NG, modèles Chirp) : cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Langues prises en charge par Otter.ai : help.otter.ai
- Le Niger adopte le haoussa comme langue officielle (mars 2025) : globalvoices.org
- HausaNLP : état des lieux, défis et orientations futures (2025) : arxiv.org/abs/2505.14311
- Vue d'ensemble de la langue haoussa : en.wikipedia.org/wiki/Hausa_language
- Données sur l'industrie de Kannywood : wifitalents.com/kannywood-industry-statistics
- Étude des ressources vocales pour le haoussa (NaijaVoices, heures CommonVoice) : arxiv.org/pdf/2605.22828
- Notes sur l'orthographe boko du haoussa : r12a.github.io/scripts/latn/ha.html
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.