
Transcripción en hausa: soporte de motores, escritura y precisión en 2026
Summarize this article with:
La respuesta corta
El hausa cuenta con soporte de transcripción por IA de nivel producción en 2026, pero solo de un puñado de motores. Whisper Large-v3 y los modelos Chirp de Google Cloud lo manejan. AssemblyAI lo incluye en su lista, pero marca la precisión como "regular" (tasa de error de palabras superior al 50% en audio típico). El resto de las principales herramientas de consumo —Otter, Trint, Descript— simplemente no admiten el hausa en absoluto. Si tu audio está en hausa, la elección del motor es la primera decisión.
Por qué importa ahora mismo la transcripción en hausa
El hausa tiene unos 50 millones de hablantes nativos y 30 millones más que lo usan como segunda lengua, concentrados en el norte de Nigeria y Níger, con comunidades significativas en Ghana, Camerún, Chad y Sudán. Es la lengua comercial dominante del Sahel. En marzo de 2025, Níger convirtió el hausa en su idioma oficial, reemplazando al francés. Ese cambio amplifica la demanda de herramientas digitales en hausa en gobierno, medios y educación.
Kannywood, la industria cinematográfica en hausa con sede en Kano, produce alrededor de 50 películas al mes en temporadas altas y emplea a más de 30.000 personas. Emisoras internacionales como BBC Hausa, Deutsche Welle Hausa y Voice of America Hausa mantienen servicios dedicados en hausa. El volumen de contenido es real. Las herramientas, hasta hace poco, no lo eran.
Boko frente a Ajami: la cuestión de la escritura
Antes de transcribir, ayuda saber qué sistema de escritura aplica a tu contenido.
Boko es la escritura basada en el alfabeto latino y el estándar moderno. Los periódicos nigerianos, el contenido digital, las transcripciones de emisiones y la mayoría del material educativo usan boko. Incluye cuatro caracteres que no existen en el latín estándar:
- ɓ: implosiva bilabial (distinta de la "b" inglesa simple)
- ɗ: implosiva alveolar (distinta de la "d" inglesa simple)
- ƙ: oclusiva velar eyectiva sorda (distinta de la "k" inglesa simple)
- ʼy: aproximante palatal glotalizada
No son decorativos. Cambiar una "b" simple por "ɓ" altera el significado de la palabra. Un motor que devuelve letras latinas simples para estos sonidos produce una transcripción con pérdida de información.
Ajami es la tradición en escritura árabe, usada históricamente para textos religiosos, erudición islámica y literatura clásica hausa. Ajami carece de un sistema ortográfico estandarizado entre escritores, lo que dificulta mucho su modelado. Los motores de transcripción por IA se entrenan predominantemente con boko, así que el audio con mucho ajami (recitación devocional sufí, manuscritos islámicos antiguos leídos en voz alta) producirá resultados poco fiables sin importar qué motor uses. Si tu contenido está en ajami, trata la IA solo como un primer borrador aproximado.
Whisper Large-v3, que impulsa ConvertAudioToText, produce boko estándar, incluidos ɓ, ɗ y ƙ. Google Cloud STT vía Chirp también apunta a la configuración regional ha-NG. Comprueba la salida de cualquier otra herramienta con un clip corto que contenga estos caracteres antes de comprometerte con un flujo de trabajo.

Fonología del hausa: qué lo hace difícil para el ASR
El hausa es una lengua tonal con tres contrastes de tono: alto, bajo y descendente. El tono marca función gramatical y significado léxico, pero el hausa escrito estándar no usa diacríticos tonales. Eso, de hecho, está bien para la transcripción: los hablantes no escriben marcas tonales, y los motores de transcripción tampoco. La salida será texto sin marcas tonales, que es lo que espera un lector de hausa.
El problema más difícil es el inventario consonántico. El hausa tiene 32 consonantes, incluidos contrastes entre oclusivas simples, palatalizadas y labializadas, además de las series implosivas y eyectivas. Son fonemas que distinguen palabras. La escasez de datos de entrenamiento amplifica el riesgo: Mozilla Common Voice tiene unas 10 horas validadas de hausa, e incluso conjuntos curados más grandes como NaijaVoices incluyen alrededor de 600 horas. Compáralo con los miles de horas del inglés o el francés, y verás que la brecha de precisión es estructural, no un fallo de software.
Además, la duración vocálica del hausa es contrastiva: las vocales breves y largas llevan significados distintos. Los motores entrenados con datos limitados de hausa pueden pasar por alto las distinciones de duración, especialmente en habla informal o rápida.
Qué motores admiten el hausa (con honestidad)
| Motor | Soporte de hausa | Nivel de precisión | Notas |
|---|---|---|---|
| Whisper Large-v3 | Sí | Gama media para lenguas africanas | Salida en boko incl. ɓ ɗ ƙ |
| Google Cloud STT (Chirp 3) | Sí, ha-NG | No publicado | API, requiere configuración de desarrollo |
| AssemblyAI Universal-2 | Sí | "Regular" (>50% de WER señalado) | Precisión esperada más baja |
| Deepgram Nova-3 | Sin hausa confirmado | N/D | No figura en la lista de idiomas admitidos |
| Otter.ai | No | N/D | Solo 6 idiomas |
| Trint | Sin confirmar | N/D | Sin hausa en la lista verificada de idiomas |
| Descript | No | N/D | Herramientas centradas en el inglés |
| Rev | No | N/D | Los revisores humanos podrían servir; la IA no |
Mi opinión: la categoría de "precisión regular" autoinformada por AssemblyAI es honesta pero desalentadora. Para contenido en hausa donde necesitas una salida limpia en boko con las consonantes con gancho intactas, Whisper Large-v3 es la opción práctica dado lo que es verificable públicamente. El Chirp 3 de Google Cloud merece una prueba si tienes acceso a la API, pero requiere más configuración que una herramienta de transcripción de consumo.
Para una visión más amplia de cómo se comparan los motores en lenguas menos comunes, consulta por qué la IA tiene dificultades con las lenguas de bajos recursos.
Precisión según el tipo de audio
La precisión de Whisper Large-v3 en hausa es menor que su precisión en inglés, francés o incluso árabe, porque el corpus de entrenamiento es más pequeño. Expectativas aproximadas según las condiciones del audio:
- Noticias o radio en hausa grabadas en estudio (NTA Hausa, servicio DW Hausa): entre 85 y 90 por ciento.
- Discurso político formal o sermón del viernes en audio limpio: entre 82 y 88 por ciento.
- Pódcast en hausa, dos hablantes, ruido mínimo: entre 78 y 85 por ciento.
- Hausa urbano nigeriano con alternancia de código al inglés: cerca del rango anterior; Whisper maneja la mezcla razonablemente bien.
- Grabaciones de campo con ruido ambiental (mercados, eventos al aire libre): entre 65 y 78 por ciento. El ruido de fondo perjudica la precisión del hausa más que la del inglés, porque hay menos capacidad del modelo para recuperarse de él.
- Hausa de Níger (dialecto nigerino, cercano al kananci pero con vocabulario distinto): entre 78 y 85 por ciento, sin necesidad de ajustes especiales.
Son estimaciones basadas en los factores acústicos y de datos de entrenamiento mencionados arriba, no benchmarks publicados. Ninguna clasificación pública de ASR para hausa registra estas condiciones específicas. Trátalas como rangos orientativos para planificar, no como garantías, y prueba siempre un clip con tu contenido real antes de comprometerte con un flujo de trabajo de gran volumen.
Dialectos: Kano, Sokoto, Zaria, Níger
El hausa estándar para fines de transcripción es el kananci, el dialecto de Kano. Es el estándar de radiodifusión, el estándar educativo y lo que usa la mayoría del contenido digital en hausa.
El sakkwatanci (dialecto de Sokoto) es la variedad occidental, considerada clásica en la tradición literaria hausa. Tiene rasgos conservadores que divergen del kananci en vocabulario y algunas formas fonológicas.
El zazzaganci (dialecto de Zaria) es una variedad meridional con diferencias en la marcación de género y el tratamiento de las vocales.
El hausa de Níger es cercano al kananci pero comparte cierto solapamiento con el sakkwatanci. Tras la adopción del hausa como idioma oficial de Níger en 2025, crece la demanda de transcripción de contenidos gubernamentales y mediáticos producidos en Niamey. Las diferencias dialectales son reales pero no impiden la inteligibilidad mutua, y un modelo entrenado principalmente con datos de hausa nigeriano manejará el hausa de Níger con una reducción modesta de precisión.
Ningún motor de consumo actual ofrece un ajuste de selector para el dialecto hausa. Si tu audio procede de una región específica y la precisión en un clip de prueba no satisface tus necesidades, aportar un glosario de vocabulario localmente distintivo es la solución más práctica.
Alternancia de código con el inglés
El hausa urbano nigeriano en Kano, Kaduna y Abuya mezcla inglés con libertad, especialmente en contenido empresarial, tecnológico y juvenil:
"Ina son kawo wani idea, but kafin in fara, mu yi short break."
Whisper produce los segmentos en hausa en boko y los segmentos en inglés en inglés estándar. La mezcla refleja cómo escriben realmente estos hablantes, que es exactamente lo que quieres para notas de pódcast, descripciones de YouTube o leyendas de redes sociales. No se necesita configuración especial.
El hausa rural y el hausa de Níger incluyen mucho menos inglés. Ese audio permanece en boko de principio a fin, lo cual también funciona correctamente.
Flujo de trabajo práctico para contenido en hausa
Para productores de Kannywood, editores de radio y periodistas, esta es la secuencia que funciona:
- Graba en el entorno más silencioso disponible. El ruido ambiental exterior degrada la precisión del hausa más que la de lenguas con muchos recursos, porque el modelo tiene menos margen para compensar.
- Establece explícitamente el idioma de transcripción en hausa. La detección automática puede confundir el hausa con el árabe (debido a préstamos compartidos y patrones de entonación) o con otras lenguas de África Occidental en grabaciones ruidosas.
- Sube el archivo mediante la herramienta de audio a texto. Para contenido de vídeo, incluidos clips de Kannywood y entrevistas de YouTube, la herramienta de vídeo a texto gestiona la extracción automáticamente.
- Activa las etiquetas de hablante si tienes más de uno. Espera que la diarización sea fiable en audio limpio de dos hablantes y menos fiable en radio de participación telefónica con varias voces superpuestas.
- Añade un glosario de nombres propios antes de la revisión: nombres personales hausa (que tienen muchas variantes ortográficas), topónimos nigerianos y nigerinos, y cualquier nombre de marca u organización que aparezca en tu contenido.
- Revisa específicamente las consonantes con gancho. Una discrepancia como "barka" frente a "ɓarka" cambia el significado. Aquí es donde el techo de precisión de las lenguas de bajos recursos se manifiesta en la práctica.
- Exporta a SRT para subtítulos de YouTube o TXT para redacción de artículos.
Para la distribución de Kannywood en particular, los subtítulos SRT en hausa amplían el alcance a audiencias de la diáspora y a hablantes de hausa en Ghana y Camerún que quizá no capten todo el vocabulario del dialecto de Kano a velocidad de película.
Uso en ONG y sector de desarrollo
Las organizaciones que trabajan en el norte de Nigeria, Níger, Chad y el Sahel en general realizan con frecuencia entrevistas de campo en hausa. Un agente comunitario de salud explicando la resistencia a la vacunación, un agricultor describiendo pérdidas de cosechas, un comerciante de mercado hablando del impacto del precio del combustible: este contenido es donde la transcripción en hausa tiene mayor valor institucional, y donde la calidad del audio suele ser el mayor desafío.
Para grabaciones de campo de ONG, acepta que la precisión será menor que la de audio de calidad de radiodifusión y reserva tiempo para la revisión posterior. La transcripción sigue siendo dramáticamente más rápida de revisar que un archivo de audio sin procesar, incluso con un 75 por ciento de precisión. Los flujos de trabajo multilingües que incluyen hausa junto con inglés, francés y árabe están totalmente admitidos en el mismo plan.
Dónde encaja CATT
Si solo necesitas una transcripción limpia en hausa sin configuración de API ni infraestructura en la nube, ConvertAudioToText ejecuta Whisper Large-v3 con salida en boko y etiquetas de hablante. El plan gratuito cubre 10 minutos de transcripción, otorgados una sola vez al registrarte en lugar de cada mes. El plan Pro, 9,99 $/mes, es ilimitado y cubre el hausa junto con todos los demás idiomas admitidos. Para periodistas y productores de pódcast que trabajan tanto en hausa como en inglés, eso significa que un solo plan lo cubre todo.
Para contextualizar cómo se compara el precio por minuto de las API frente a las herramientas de tarifa plana, consulta comparación de precios de transcripción 2026.
Preguntas frecuentes
¿Qué motores de transcripción con IA admiten el hausa en 2026?
Whisper Large-v3 (usado por ConvertAudioToText) y Google Cloud Speech-to-Text mediante los modelos Chirp admiten ambos el hausa. AssemblyAI también lista el hausa bajo su modelo Universal-2, pero lo sitúa en la categoría de "precisión regular", lo que significa tasas de error de palabras superiores al 50% en audio típico. Otter.ai, Trint y Descript no admiten el hausa en absoluto.
¿La transcripción del hausa produce escritura boko con las consonantes con gancho correctas?
Depende del motor. Whisper Large-v3 produce escritura boko estándar (basada en el alfabeto latino) y maneja los marcadores implosivos y eyectivos ɓ, ɗ y ƙ. Si una herramienta devuelve "b", "d" o "k" simples en lugar de las formas con gancho, está eliminando distinciones fonológicamente significativas que cambian el significado de las palabras en hausa.
¿Cómo afecta la alternancia de código entre hausa e inglés a la transcripción?
Los hablantes urbanos de hausa nigeriano en Kano, Kaduna y Abuya mezclan frecuentemente inglés en la conversación en hausa. Whisper maneja esto bien en la práctica: las palabras en hausa vuelven en escritura boko y las palabras en inglés en inglés. La salida refleja cómo escriben realmente estos hablantes, lo cual resulta útil para contenido de pódcast y redes sociales. El audio en hausa rural o de Níger, con poco inglés, muestra una alternancia de código insignificante y permanece en boko de principio a fin.
¿Es el hausa una lengua tonal y afecta eso a la transcripción con IA?
Sí. El hausa tiene tres contrastes de tono: alto, bajo y descendente. El tono cambia el significado y la categoría gramatical. El hausa escrito estándar no marca el tono con diacríticos (fuera de textos lingüísticos especializados), así que la salida de la transcripción tampoco estará marcada tonalmente, lo cual es normal y esperable. El mayor riesgo de precisión proviene de las consonantes implosivas y eyectivas, no del tono, ya que esas sí se marcan en la escritura y pueden omitirse con un motor mal calibrado.
Fuentes
- Ficha del modelo OpenAI Whisper Large-v3: huggingface.co/openai/whisper-large-v3
- Idiomas admitidos por AssemblyAI (niveles de precisión de Universal-2): assemblyai.com/docs/supported-languages
- Idiomas admitidos por Google Cloud Speech-to-Text V2 (ha-NG, modelos Chirp): cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Idiomas admitidos por Otter.ai: help.otter.ai
- Níger adopta el hausa como idioma oficial (marzo de 2025): globalvoices.org
- HausaNLP: estado actual, desafíos y direcciones futuras (2025): arxiv.org/abs/2505.14311
- Panorama de la lengua hausa: en.wikipedia.org/wiki/Hausa_language
- Datos de la industria de Kannywood: wifitalents.com/kannywood-industry-statistics
- Encuesta de recursos de voz para hausa (horas de NaijaVoices, CommonVoice): arxiv.org/pdf/2605.22828
- Notas sobre la ortografía boko del hausa: r12a.github.io/scripts/latn/ha.html
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription for African Languages in 2026: Honest Rankings
Which engines actually support Swahili, Hausa, Yoruba, Amharic, Wolof, and Zulu in 2026? Verified support matrices, honest WER context, and the tools that genuinely work.
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.