Transcripción de amárico: la escritura ge'ez y la realidad de los motores
transcripciónamáricoetiopíalenguas africanas

Transcripción de amárico: la escritura ge'ez y la realidad de los motores

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

El amárico figura como idioma soportado sobre el papel en varios motores ASR importantes, pero la calidad del soporte varía drásticamente. El modelo Universal-2 de AssemblyAI lo cubre con una advertencia de "precisión regular" según el propio proveedor (más del 50 % de WER). La familia Chirp de Google Cloud y AWS Transcribe incluyen ambos am-ET, pero Whisper large-v3 muestra tasas de error de caracteres reportadas por encima del 100 % en audio limpio en amárico, lo que indica un comportamiento grave de alucinación o inserción. Si tu trabajo depende de una salida correcta en fidel, planifica una ronda significativa de edición o considera modelos etíopes de grado investigador para flujos de trabajo centrados en el amárico.

El amárico tiene alrededor de 32 millones de hablantes nativos y es el idioma de trabajo del gobierno federal etíope. Para la transcripción con IA, es una de las lenguas semíticas más difíciles de transcribir correctamente. El problema central no es que las herramientas ignoren el amárico, sino que las herramientas que dicen admitirlo suelen rendir mucho peor de lo que su marketing sugiere. Esta publicación repasa qué hace realmente cada motor importante con el amárico, por qué la escritura fidel crea modos de fallo específicos y cómo son los flujos de trabajo prácticos en 2026.

La escritura ge'ez y por qué rompe el ASR de forma distinta

El amárico se escribe en escritura ge'ez, llamada fidel en amárico. Fidel no es un alfabeto; es un silabario. Cada uno de los 33 caracteres base representa un par completo consonante-vocal, y cada carácter base tiene siete formas variantes vocálicas, lo que da más de 200 caracteres distintos en uso cotidiano. La sílaba ሀ (ha) se convierte en ሁ (hu), ሂ (hi), ሃ (haa), ሄ (he), ህ (la consonante sola) y ሆ (ho). Una sola sustitución de carácter no es un error ortográfico: es un error de palabra entera.

Por eso las lenguas con escritura ge'ez muestran tasas de error de palabra estructuralmente más altas que las lenguas con alfabeto latino con volúmenes comparables de datos de entrenamiento. Investigaciones que comparan el ASR entre lenguas africanas han encontrado que las lenguas con escritura ge'ez promedian alrededor del 43,5 % de mejor WER tras ajuste fino, frente a alrededor del 36,2 % para las lenguas africanas con alfabeto latino, incluso cuando las condiciones de prueba están igualadas en lo demás. La arquitectura de la escritura es parte de la penalización, no solo la escasez de datos.

Tres características a nivel de escritura hacen que el amárico sea particularmente difícil:

La geminación es invisible en la escritura. En el amárico hablado, la duración de la consonante es fonémica: alä significa «dijo», allä significa «hay». La escritura no marca ninguna de las dos. Un sistema ASR que intenta producir salida en fidel no puede inferir la geminación solo a partir del mapeo audio-carácter; necesita contexto fonológico para el que la mayoría de los modelos no está entrenado.

Varios caracteres comparten el mismo sonido. El grupo ha, el grupo a y el grupo sa contienen cada uno caracteres fonéticamente idénticos en el habla moderna del amárico. Cuando un modelo escucha el mismo sonido, tiene que adivinar qué carácter fidel escribir. La ambigüedad homófona crea un suelo de error incluso cuando el reconocimiento de fonemas es preciso.

Las consonantes labializadas usan secuencias de varios caracteres. Veinte grafemas labiovelares y dieciocho labializados del amárico se representan como combinaciones de dos o tres sílabas consonante-vocal. Los modelos que no manejan estas secuencias explícitamente tienden a producir salidas fragmentadas o incorrectas.

Para contexto sobre por qué estos patrones aparecen en las lenguas africanas de bajos recursos, consulta por qué la IA tiene dificultades con las lenguas de bajos recursos.

Lo que realmente admiten los principales motores

La comparación siguiente se basa en documentación verificada a julio de 2026.

MotorSoporte de amáricoCódigo de idiomaNivel de precisiónNotas
Google Cloud STTam-ETNo publicadoModelos Chirp, Chirp 2, Chirp 3
AWS Transcribeam-ETNo publicadoPor lotes y streaming
AssemblyAISí (solo Universal-2)amRegular (más del 50 % de WER)No está en Universal-3 Pro
Whisper large-v3NominalamDeficienteCER reportado por encima del 100 % en benchmarks
Deepgram Nova-2/Nova-3Non/dn/dNo está en la lista de idiomas soportados
Ethio-ASR (investigación)am~30 % de WER (reportado)Modelo abierto de investigación, corpus WAXAL

Google Cloud Speech-to-Text (am-ET) está disponible en la familia de modelos Chirp e incluye soporte de puntuación automática. Google no publica benchmarks de precisión específicos por idioma para el amárico, así que la calidad con tu tipo concreto de audio es algo que tendrás que medir por tu cuenta.

AWS Transcribe (am-ET) admite transcripción tanto por lotes como en streaming, pero no admite funciones avanzadas como modelos de lenguaje personalizados, eliminación de PII ni Call Analytics para el amárico. Es una vía de transcripción básica.

El modelo Universal-2 de AssemblyAI es la única API comercial importante que publica un nivel de precisión para el amárico. Lo clasifican como "precisión regular", lo que significa una tasa de error de palabra superior al 50 %. Eso es un lastre considerable para cualquier flujo de trabajo donde la calidad de la salida importa. El modelo de nivel superior Universal-3 Pro, que cubre la mayoría de los demás idiomas de AssemblyAI, no incluye el amárico al momento de escribir esto.

Whisper large-v3 incluye el amárico entre sus idiomas soportados, pero los resultados de los benchmarks cuentan otra historia. La investigación ha encontrado tasas de error de caracteres reportadas por encima del 100 % para Whisper large-v3 en audio limpio en amárico de FLEURS, lo que significa que el modelo inserta, repite o alucina más caracteres de los que contiene el texto de referencia. Es probablemente un patrón de alucinación exacerbado por los limitados datos de entrenamiento en amárico y la dificultad del modelo para asignar caracteres fidel. Whisper large-v2 no comparte esta regresión en el mismo grado. Las variantes de Whisper ajustadas, entrenadas específicamente con conjuntos de datos en amárico (FLEURS, Mozilla Common Voice y corpora específicos de dominio), funcionan notablemente mejor. El artículo de marzo de 2025 "Whispering in Amharic" muestra que la normalización de homófonos y el entrenamiento combinado con FLEURS reducen significativamente el WER respecto al modelo base.

Deepgram (Nova-2 y Nova-3) no incluye el amárico en su lista de idiomas soportados. Ninguno de los dos niveles de modelo cubre el idioma.

Para una visión más amplia de cómo varían los precios y la profundidad de funciones entre estos motores, consulta la comparativa de precios de transcripción y la guía de precios de AWS Transcribe.

Interfaz de la herramienta de voz a texto de CATT mostrando la subida de audio y la selección de idioma
Interfaz de la herramienta de voz a texto de CATT mostrando la subida de audio y la selección de idioma

El amárico en Etiopía: los casos de uso reales

La demanda de transcripción en amárico es real y se concentra en sectores específicos. Entender el caso de uso determina qué herramienta es apropiada.

La Ethiopian Broadcasting Corporation (EBC) es la emisora más antigua y grande del país, con sede en Adís Abeba. Su principal idioma de emisión es el amárico, con cobertura adicional en oromo, somalí, tigriña y afar. Periodistas, investigadores y monitores de medios que trabajan con contenido de la EBC enfrentan todo el desafío del ASR en amárico: amárico de redacción con múltiples hablantes, acentos regionales, vocabulario técnico y político, y ritmos de habla rápidos.

La documentación del gobierno federal se realiza en amárico. Los procesos legales, los documentos de política y las reuniones oficiales generan audio en amárico que necesita transcripción para registro, accesibilidad y archivo. El listón de precisión aquí es alto, y las salidas con "precisión regular" o con más del 50 % de WER no son utilizables sin una revisión considerable.

La diáspora etíope genera demanda de transcripción de contenido familiar y comunitario: entrevistas, grabaciones de pódcast, programación religiosa, eventos culturales. Este audio suele incluir alternancia de códigos entre amárico e inglés (comunidades de la diáspora en EE. UU. y Europa) o entre amárico y árabe (comunidades del Golfo y Medio Oriente). La alternancia de códigos desestabiliza cualquier modelo monolingüe.

La investigación y el periodismo que siguen los acontecimientos políticos y sociales etíopes producen cada vez más audio en amárico que necesita indexación y traducción. Las instituciones académicas y las ONG internacionales que operan en Etiopía enfrentan este problema con regularidad.

Para flujos de trabajo relacionados de transcripción en lenguas africanas, las guías hermanas sobre transcripción de suajili en Kenia y Tanzania, transcripción de hausa en Nigeria y la visión general más amplia de la mejor transcripción para lenguas africanas cubren el mismo panorama de calidad de ASR desde distintos ángulos lingüísticos.

Cómo es hoy un flujo de trabajo práctico para el amárico

Dado el panorama de precisión, una transcripción en amárico con calidad de producción requiere una pasada de edición humana independientemente del motor que uses. La pregunta es qué motor te da el mejor punto de partida.

Si estás en infraestructura de Google Cloud o AWS, empieza con esos endpoints nativos de amárico. Te dan salida en fidel sin sobrecoste de portabilidad de modelos, y se integran en canalizaciones de nube existentes. Haz pruebas con una muestra de 5 a 10 minutos de tu audio real antes de escalar.

Si necesitas un endpoint de API con un suelo de precisión conocido, el modelo Universal-2 de AssemblyAI es la opción comercial más transparente: declara su nivel de precisión y no estás adivinando. La clasificación de más del 50 % de WER significa que debes planificar que un hablante fluido de amárico revise cada transcripción antes de usarla.

Si gestionas tu propia infraestructura y tienes tiempo para hacer ajuste fino, un modelo Whisper-small afinado con datos combinados de FLEURS y Common Voice en amárico supera al modelo large-v3 de serie para el amárico. El modelo de investigación Ethio-ASR, entrenado con el corpus WAXAL en cinco lenguas etíopes, muestra alrededor del 30 % de WER promedio como línea base de investigación.

Una cosa que comprobar en cualquier salida: confirma que el modelo produce escritura fidel, no transliteración latina. Si recibes "ena alle" en lugar de "እና አለ", la salida es inservible para los lectores de amárico y representa un fallo de generación de escritura, no solo un problema de precisión.

Para flujos de trabajo que involucren varias lenguas africanas en la misma grabación, o amárico combinado con inglés, ten en cuenta que la precisión con alternancia de códigos en todos los motores disponibles hoy es menor que el rendimiento monolingüe en amárico. Es un problema abierto de investigación, no un tema de configuración.

Si necesitas una herramienta de transcripción para otros archivos de audio, ConvertAudioToText maneja una amplia gama de idiomas con buena precisión. Para el amárico en concreto, la posición honesta es que hoy ninguna herramienta entrega resultados de grado de producción sin un paso de revisión, y esa es una brecha que deberías incorporar a tu flujo de trabajo y presupuesto, sea cual sea el motor que uses.

La trayectoria de la investigación

El ASR del amárico ha avanzado notablemente entre 2022 y 2026, en gran parte gracias al esfuerzo académico y de investigación más que a la inversión comercial. Tres desarrollos merecen atención:

El proyecto Ethio-ASR (marzo de 2026) es el trabajo más actual de ASR multilingüe etíope, que cubre el amárico junto con tigriña, oromo, sidaama y wolaytta usando el corpus WAXAL. Supera a modelos multilingües más grandes como OmniASR con menos parámetros al enfocarse en la familia lingüística. Modelos como este probablemente se incorporarán a APIs comerciales a medida que la investigación madure.

El proyecto Massively Multilingual Speech (MMS) de Meta cubre el amárico en su modelo de voz a texto de 1.100 idiomas. MMS está disponible como checkpoint de código abierto en Hugging Face. No está pulido para uso en producción, pero es una de las opciones de cobertura más amplias disponibles para lenguas de bajos recursos, incluido el amárico.

El modelo Chirp 3 de Google ahora incluye el amárico con soporte de am-ET en varias regiones. Chirp 3 representa el último modelo fundacional de Google para voz, y su inclusión del amárico sugiere inversión comercial en el idioma que estaba ausente en las ofertas anteriores de STT de Google.

La tendencia es positiva, pero la brecha entre "listado como soportado" y "listo para producción sin revisión" sigue siendo amplia para el amárico en 2026. Planifica en consecuencia.

Preguntas frecuentes

¿Whisper admite el amárico?

Whisper incluye el amárico entre sus más de 99 idiomas soportados, pero su rendimiento real es deficiente. Los benchmarks de investigación muestran tasas de error de caracteres reportadas por encima del 100 % para Whisper large-v3 en audio limpio en amárico, lo que significa que el modelo inserta, repite o alucina más de lo que transcribe correctamente. Las variantes de Whisper ajustadas (entrenadas con datos de FLEURS y Common Voice en amárico) funcionan notablemente mejor, pero el modelo base no es fiable para la transcripción de amárico en producción.

¿Pueden Google Cloud Speech-to-Text o AWS Transcribe manejar el amárico?

Ambos incluyen el amárico. Google Cloud Speech-to-Text admite am-ET en sus modelos Chirp, Chirp 2 y Chirp 3. AWS Transcribe admite am-ET tanto para transcripción por lotes como en streaming. Ninguno de los dos servicios publica cifras de precisión específicas para el amárico, así que deberías hacer pruebas con una muestra representativa de tu audio antes de comprometerte con un flujo de trabajo.

¿Por qué la escritura fidel hace que el ASR del amárico sea más difícil que en lenguas con alfabeto latino?

Fidel es un silabario en el que cada carácter codifica un par completo consonante-vocal. Esto significa que una sola sustitución errónea de carácter cuenta como un error de palabra completo, no como un error parcial de ortografía. Además, la ortografía del amárico no marca la geminación (consonantes dobladas que distinguen significados, como alä "dijo" frente a allä "hay"), y varios caracteres fidel distintos comparten la misma pronunciación (el grupo ha, el grupo a, el grupo sa). Estas ambigüedades agravan los errores del ASR de maneras que las lenguas con alfabeto latino no enfrentan al mismo ritmo.

¿Cuál es la opción de ASR para amárico más precisa disponible hoy?

El modelo de investigación Ethio-ASR, entrenado conjuntamente en amárico y otras cuatro lenguas etíopes usando el corpus WAXAL, logró un WER promedio reportado de alrededor del 30 % en los benchmarks de marzo de 2026, lo que representa el estado del arte académico. Entre los servicios comerciales, el modelo Universal-2 de AssemblyAI admite el amárico y es la única API importante con un nivel de precisión publicado para este idioma, aunque lo marca como "precisión regular" (más del 50 % de WER). Para flujos de producción donde la precisión es crítica, espera una ronda significativa de edición humana con cualquier motor comercial actual.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles