
Transcription de l'amharique : écriture guèze et réalité des moteurs
Summarize this article with:
L'amharique est une langue officiellement prise en charge par plusieurs grands moteurs ASR, mais la qualité de ce support varie énormément. Le modèle Universal-2 d'AssemblyAI le couvre avec un avertissement « précision passable » noté par le fournisseur (WER supérieur à 50 %). La famille Chirp de Google Cloud et AWS Transcribe prennent toutes deux en charge am-ET, mais Whisper large-v3 affiche des taux d'erreur par caractère rapportés supérieurs à 100 % sur de l'audio amharique propre, signe d'un comportement sévère d'hallucination ou d'insertion. Si votre travail dépend d'une sortie Fidel correcte, prévoyez une passe de relecture importante ou envisagez des modèles éthiopiens de niveau recherche pour des flux axés sur l'amharique.
L'amharique compte environ 32 millions de locuteurs natifs et est la langue de travail du gouvernement fédéral éthiopien. Pour la transcription par IA, c'est l'une des langues sémitiques les plus difficiles à traiter correctement. Le problème central n'est pas que les outils ignorent l'amharique, c'est que les outils qui prétendent le prendre en charge performent souvent bien pire que leur marketing ne le laisse entendre. Cet article passe en revue ce que chaque grand moteur fait réellement avec l'amharique, pourquoi l'écriture Fidel crée des modes de défaillance spécifiques, et à quoi ressemblent les flux de travail pratiques en 2026.
L'écriture guèze et pourquoi elle casse l'ASR différemment
L'amharique s'écrit en écriture guèze, appelée Fidel en amharique. Fidel n'est pas un alphabet ; c'est un syllabaire. Chacun des 33 caractères de base représente une paire consonne-voyelle complète, et chaque caractère de base possède sept formes variantes vocaliques, soit plus de 200 caractères distincts en usage courant. La syllabe ሀ (ha) devient ሁ (hu), ሂ (hi), ሃ (haa), ሄ (he), ህ (la consonne seule) et ሆ (ho). Une seule substitution de caractère n'est pas une faute d'orthographe : c'est une erreur de mot entier.
C'est pourquoi les langues à écriture guèze affichent structurellement des taux d'erreur par mot plus élevés que les langues à écriture latine, à volumes de données d'entraînement comparables. Des recherches comparant l'ASR entre langues africaines ont constaté que les langues à écriture guèze atteignent en moyenne environ 43,5 % de WER après affinage optimal, contre environ 36,2 % pour les langues africaines à écriture latine, même lorsque les conditions de test sont par ailleurs identiques. L'architecture de l'écriture fait partie de la pénalité, pas seulement la rareté des données.
Trois caractéristiques propres à l'écriture rendent l'amharique particulièrement difficile :
La gémination est invisible à l'écrit. En amharique parlé, la longueur des consonnes est phonémique : alä signifie « il a dit », allä signifie « il y a ». L'écriture ne marque ni l'une ni l'autre. Un système ASR cherchant à produire une sortie Fidel ne peut pas déduire la gémination du seul appariement audio-caractère ; il lui faut un contexte phonologique que la plupart des modèles ne sont pas entraînés à gérer.
Plusieurs caractères partagent le même son. Le groupe ha, le groupe a et le groupe sa contiennent chacun des caractères phonétiquement identiques dans l'amharique moderne parlé. Quand un modèle entend le même phone, il doit deviner quel caractère Fidel écrire. L'ambiguïté homophone crée un plancher d'erreurs même quand la reconnaissance des phonèmes est exacte.
Les consonnes labialisées utilisent des séquences multi-caractères. Vingt graphèmes labiovélaires et dix-huit graphèmes labialisés de l'amharique sont représentés sous forme de combinaisons de deux ou trois syllabes consonne-voyelle. Les modèles qui ne gèrent pas explicitement ces séquences ont tendance à produire une sortie fragmentée ou erronée.
Pour comprendre pourquoi ces schémas apparaissent dans l'ensemble des langues africaines à faibles ressources, consultez pourquoi l'IA peine avec les langues à faibles ressources.
Ce que les grands moteurs prennent réellement en charge
La comparaison ci-dessous repose sur la documentation vérifiée à juillet 2026.
| Moteur | Support amharique | Code langue | Niveau de précision | Notes |
|---|---|---|---|---|
| Google Cloud STT | Oui | am-ET | Non publié | Modèles Chirp, Chirp 2, Chirp 3 |
| AWS Transcribe | Oui | am-ET | Non publié | Par lots et en streaming |
| AssemblyAI | Oui (Universal-2 uniquement) | am | Passable (WER supérieur à 50 %) | Pas sur Universal-3 Pro |
| Whisper large-v3 | Nominal | am | Médiocre | CER rapporté supérieur à 100 % sur benchmarks |
| Deepgram Nova-2/Nova-3 | Non | n/a | n/a | Absent de la liste des langues prises en charge |
| Ethio-ASR (recherche) | Oui | am | ~30 % de WER (rapporté) | Modèle de recherche ouvert, corpus WAXAL |
Google Cloud Speech-to-Text (am-ET) est disponible sur la famille de modèles Chirp et inclut la ponctuation automatique. Google ne publie pas de benchmarks de précision spécifiques aux langues pour l'amharique ; la qualité sur votre type d'audio spécifique devra donc être évaluée indépendamment.
AWS Transcribe (am-ET) prend en charge la transcription par lots et en streaming, mais ne prend pas en charge les fonctionnalités avancées comme les modèles de langue personnalisés, le masquage des données personnelles (PII) ou Call Analytics pour l'amharique. C'est un chemin de transcription de base.
Le modèle Universal-2 d'AssemblyAI est la seule grande API commerciale à publier un niveau de précision pour l'amharique. Elle le classe « précision passable », soit un taux d'erreur par mot supérieur à 50 %. C'est un handicap considérable pour tout flux où la qualité de sortie compte. Le modèle Universal-3 Pro, de niveau supérieur, qui couvre la plupart des autres langues chez AssemblyAI, n'inclut pas l'amharique au moment de la rédaction.
Whisper large-v3 liste l'amharique parmi ses langues prises en charge, mais les résultats des benchmarks racontent une autre histoire. Des recherches ont trouvé des taux d'erreur par caractère rapportés supérieurs à 100 % pour Whisper large-v3 sur de l'audio amharique propre issu de FLEURS, ce qui signifie que le modèle insère, répète ou hallucine plus de caractères que le texte de référence n'en contient. Il s'agit probablement d'un schéma d'hallucination exacerbé par des données d'entraînement amhariques limitées et par la difficulté du modèle à attribuer les caractères Fidel. Whisper large-v2 ne présente pas cette régression au même degré. Les variantes de Whisper affinées, entraînées spécifiquement sur des jeux de données amhariques (FLEURS, Mozilla Common Voice et corpus spécialisés), performent nettement mieux. L'article de mars 2025 « Whispering in Amharic » montre que la normalisation des homophones et l'entraînement combiné sur FLEURS réduisent significativement le WER par rapport au modèle de base.
Deepgram (Nova-2 et Nova-3) n'inclut pas l'amharique dans sa liste de langues prises en charge. Aucun des deux niveaux de modèles ne couvre la langue.
Pour un aperçu plus large de la façon dont les tarifs et la profondeur des fonctionnalités varient selon ces moteurs, consultez la comparaison des prix de transcription et le guide tarifaire AWS Transcribe.

L'amharique en Éthiopie : les cas d'usage concrets
La demande de transcription amharique est réelle et concentrée dans des secteurs précis. Comprendre le cas d'usage détermine quel outil convient.
L'Ethiopian Broadcasting Corporation (EBC) est le plus ancien et le plus grand diffuseur du pays, basé à Addis-Abeba. Sa langue de diffusion principale est l'amharique, avec une couverture supplémentaire en oromo, somali, tigrigna et afar. Les journalistes, chercheurs et observateurs des médias travaillant sur les contenus de l'EBC font face à tout le défi de l'ASR amharique : de l'amharique de rédaction avec plusieurs locuteurs, des accents régionaux, du vocabulaire technique et politique, et des débits de parole rapides.
La documentation du gouvernement fédéral se fait en amharique. Les procédures judiciaires, les documents de politique publique et les réunions officielles génèrent de l'audio amharique qui doit être transcrit pour la tenue des registres, l'accessibilité et l'archivage. Le seuil de précision exigé ici est élevé, et des sorties « précision passable » ou avec un WER supérieur à 50 % ne sont pas exploitables sans relecture substantielle.
La diaspora éthiopienne crée une demande de transcription de contenus familiaux et communautaires : interviews, enregistrements de podcasts, programmes religieux, événements culturels. Cet audio tend à inclure de l'alternance codique entre amharique et anglais (communautés de la diaspora aux États-Unis et en Europe) ou entre amharique et arabe (communautés du Golfe et du Moyen-Orient). L'alternance codique perturbe tout modèle monolingue.
La recherche et le journalisme suivant les événements politiques et sociaux éthiopiens produisent de plus en plus d'audio amharique nécessitant indexation et traduction. Les institutions académiques et les ONG internationales opérant en Éthiopie sont régulièrement confrontées à ce problème.
Pour des flux de transcription d'autres langues africaines, les guides apparentés sur la transcription du swahili au Kenya et en Tanzanie, la transcription du haoussa au Nigeria et l'aperçu plus général des meilleures transcriptions pour les langues africaines couvrent le même paysage de qualité ASR sous différents angles linguistiques.
À quoi ressemble aujourd'hui un flux de travail amharique pratique
Compte tenu du paysage de précision, une transcription amharique de qualité production exige une passe d'édition humaine quel que soit le moteur utilisé. La question est de savoir quel moteur offre le meilleur point de départ.
Si vous êtes sur une infrastructure Google Cloud ou AWS, commencez par ces points de terminaison amhariques natifs. Ils vous donnent une sortie Fidel sans aucun coût de portage de modèle, et ils s'intègrent aux pipelines cloud existants. Faites un benchmark sur un échantillon de 5 à 10 minutes de votre audio réel avant de passer à l'échelle.
Si vous avez besoin d'un point de terminaison API avec un seuil de précision connu, le modèle Universal-2 d'AssemblyAI est l'option commerciale la plus transparente : il déclare son niveau de précision, et vous n'avez pas à deviner. La classification « WER supérieur à 50 % » signifie qu'il faut prévoir qu'un locuteur d'amharique courant relise chaque transcription avant utilisation.
Si vous exploitez votre propre infrastructure et avez le temps d'affiner, un modèle Whisper-small affiné sur des données amhariques combinées de FLEURS et Common Voice surpasse le modèle large-v3 standard pour l'amharique. Le modèle de recherche Ethio-ASR, entraîné sur le corpus WAXAL couvrant cinq langues éthiopiennes, affiche environ 30 % de WER moyen comme référence de recherche.
Une chose à vérifier dans toute sortie : confirmez que le modèle produit bien l'écriture Fidel, et non une translittération latine. Si vous recevez « ena alle » au lieu de « እና አለ », la sortie est inutilisable pour les lecteurs amhariques et constitue un échec de génération d'écriture, pas seulement un problème de précision.
Pour les flux impliquant plusieurs langues africaines dans le même enregistrement, ou l'amharique combiné à l'anglais, notez que la précision en alternance codique sur tous les moteurs disponibles aujourd'hui est inférieure aux performances amhariques monolingues. C'est un problème de recherche ouvert, pas une question de configuration.
Si vous avez besoin d'un outil de transcription pour d'autres fichiers audio, ConvertAudioToText traite un large éventail de langues avec une bonne précision. Pour l'amharique spécifiquement, la position honnête est qu'aucun outil ne délivre aujourd'hui une sortie de qualité production sans étape de relecture, et c'est un manque que vous devez intégrer à votre flux de travail et à votre budget, quel que soit le moteur utilisé.
La trajectoire de la recherche
L'ASR amharique a progressé de manière significative entre 2022 et 2026, largement grâce à l'effort académique et de recherche plutôt qu'à l'investissement commercial. Trois développements méritent d'être suivis :
Le projet Ethio-ASR (mars 2026) est le travail ASR multilingue éthiopien le plus récent, couvrant l'amharique aux côtés du tigrigna, de l'oromo, du sidaama et du wolaytta à partir du corpus WAXAL. Il bat des modèles multilingues plus grands comme OmniASR avec moins de paramètres en se concentrant sur la famille de langues. Des modèles de ce type seront probablement intégrés aux API commerciales à mesure que la recherche mûrira.
Le projet Massively Multilingual Speech (MMS) de Meta couvre l'amharique dans son modèle speech-to-text de 1 100 langues. MMS est disponible sous forme de checkpoint open source sur Hugging Face. Il n'est pas abouti pour un usage en production, mais c'est l'une des options de couverture les plus larges disponibles pour les langues à faibles ressources, dont l'amharique.
Le modèle Chirp 3 de Google inclut désormais l'amharique avec le support am-ET dans plusieurs régions. Chirp 3 représente le dernier modèle de fondation de Google pour la parole, et son inclusion de l'amharique suggère un investissement commercial dans cette langue, absent des offres Google STT antérieures.
La tendance est positive, mais l'écart entre « listé comme pris en charge » et « prêt pour la production sans relecture » reste large pour l'amharique en 2026. Planifiez en conséquence.
Questions fréquentes
Whisper prend-il en charge l'amharique ?
Whisper liste l'amharique parmi ses plus de 99 langues prises en charge, mais ses performances réelles sont médiocres. Les benchmarks de recherche montrent des taux d'erreur par caractère rapportés supérieurs à 100 % pour Whisper large-v3 sur de l'audio amharique propre, ce qui signifie que le modèle insère, répète ou hallucine davantage qu'il ne transcrit correctement. Les variantes de Whisper affinées (entraînées sur les données amhariques de FLEURS et Common Voice) performent nettement mieux, mais le modèle de base n'est pas fiable pour une transcription amharique en production.
Google Cloud Speech-to-Text ou AWS Transcribe peuvent-ils gérer l'amharique ?
Tous deux prennent en charge l'amharique. Google Cloud Speech-to-Text prend en charge am-ET sur ses modèles Chirp, Chirp 2 et Chirp 3. AWS Transcribe prend en charge am-ET pour la transcription par lots comme en streaming. Aucun des deux services ne publie de chiffres de précision spécifiques à l'amharique ; vous devriez donc faire un benchmark sur un échantillon représentatif de votre audio avant de vous engager dans un flux de travail.
Pourquoi l'écriture Fidel rend-elle l'ASR amharique plus difficile que pour les langues à écriture latine ?
Fidel est un syllabaire où chaque caractère encode une paire consonne-voyelle complète. Cela signifie qu'une seule substitution erronée de caractère compte comme une erreur de mot entière, et non comme une simple faute d'orthographe partielle. De plus, l'orthographe amharique ne marque pas la gémination (les consonnes doublées qui distinguent des sens, comme alä « il a dit » face à allä « il y a »), et plusieurs caractères Fidel distincts partagent la même prononciation (le groupe ha, le groupe a, le groupe sa). Ces ambiguïtés amplifient les erreurs d'ASR d'une manière que les langues à écriture latine ne subissent pas au même rythme.
Quelle est l'option ASR amharique la plus précise disponible aujourd'hui ?
Le modèle de recherche Ethio-ASR, entraîné conjointement sur l'amharique et quatre autres langues éthiopiennes à partir du corpus WAXAL, a atteint un WER moyen rapporté d'environ 30 % lors des benchmarks de mars 2026, ce qui représente l'état de l'art académique. Parmi les services commerciaux, le modèle Universal-2 d'AssemblyAI prend en charge l'amharique et est la seule grande API à publier un niveau de précision pour cette langue, même s'il l'étiquette « précision passable » (WER supérieur à 50 %). Pour les flux de production où la précision est critique, attendez-vous à une passe d'édition humaine importante avec n'importe quel moteur commercial actuel.
Sources
- Langues prises en charge par Google Cloud Speech-to-Text : https://docs.cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Langues prises en charge par AWS Transcribe : https://docs.aws.amazon.com/transcribe/latest/dg/supported-languages.html
- Langues prises en charge par AssemblyAI : https://www.assemblyai.com/docs/supported-languages
- Vue d'ensemble des modèles et langues Deepgram : https://developers.deepgram.com/docs/models-languages-overview
- « Whispering in Amharic: Fine-tuning Whisper for Low-resource Language » (arXiv 2503.18485) : https://arxiv.org/abs/2503.18485
- « Ethio-ASR: Joint Multilingual Speech Recognition and Language Identification for Ethiopian Languages » (arXiv 2603.23654) : https://arxiv.org/abs/2603.23654v1
- Présentation de l'Ethiopian Broadcasting Corporation : https://statemediamonitor.com/2026/04/ethiopian-broadcasting-corporation-ebc/
- Meta MMS TTS amharique sur Hugging Face : https://huggingface.co/facebook/mms-tts-amh
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.