
Mejores transcripciones para lenguas africanas en 2026: rankings honestos
Summarize this article with:
Las herramientas de transcripción más populares soportan pocas o ninguna lengua africana. En 2026, la vía más fiable para suajili, hausa, yoruba, amárico, afrikáans y zulú pasa por modelos basados en Whisper o pipelines específicos de cada proveedor, cada uno con límites reales de precisión. El wólof y decenas de otras lenguas de África occidental y central siguen sin resolverse con los modelos generalistas, y solo quedan los ajustes finos especializados o la transcripción humana como opciones viables. El Sahara v2 de Intron (57 lenguas, hecho en Nigeria) es el avance más relevante de 2026 para la voz en lenguas africanas, aunque su precio de API no está publicado. Este post mapea qué soporta cada motor importante, lengua por lengua, sin inflar las cifras de precisión.
La mayoría de las herramientas de transcripción que dicen "más de 100 idiomas compatibles" no funcionan en la práctica con las lenguas africanas. El estado real de la transcripción de lenguas africanas en 2026 es este: un puñado de motores cubren los idiomas más hablados del continente con una precisión aceptable (no excelente), una startup nigeriana está haciendo el trabajo más interesante, y decenas de lenguas siguen sin resolverse de forma efectiva con los modelos de IA.
Este artículo traza el panorama real. Cada afirmación de compatibilidad que aparece aquí se ha contrastado con la documentación oficial de los proveedores.
Por qué las lenguas africanas son difíciles para la transcripción con IA
Los modelos de reconocimiento de voz mejoran con datos de entrenamiento. Whisper large-v3, el modelo abierto más capaz para transcripción multilingüe, se entrenó con unas 680.000 horas de audio, pero el yoruba y el hausa juntos aportaron menos de 600 horas de ese total. El wolof contribuyó aún menos.
La consecuencia se ve en los benchmarks. En la evaluación multilingüe FLEURS:
- Suajili: aproximadamente 34% de WER (tasa de error de palabra)
- Afrikáans: aproximadamente 32% de WER
- Yoruba: aproximadamente 49% de WER
- Wolof: prácticamente imposible de transcribir con Whisper base (tasas de error superiores al 100% en el benchmark)
Para contextualizar, el inglés se sitúa por debajo del 5% de WER en el mismo benchmark. Un 34% de WER en suajili significa que, de media, aproximadamente una de cada tres palabras es incorrecta. Eso es usable con una revisión posterior competente. Un 49% de WER en yoruba es marginal. El wolof, a nivel del modelo base, necesita un ajuste fino especializado.
Estos son los números reales. Cualquier herramienta que afirme una precisión del 85-92% en wolof con un modelo de propósito general no está citando una fuente verificable.
Quién soporta qué: la matriz de compatibilidad de 2026
La tabla siguiente muestra qué motores listan formalmente lenguas africanas concretas en su documentación, verificada a julio de 2026. "Batch" significa solo carga de archivos; "Streaming" significa tiempo real. Una celda vacía indica que la lengua no aparece listada.
| Idioma | Whisper large-v3 | AWS Transcribe | Google Chirp 3 | Azure STT | AssemblyAI Univ-2 | Intron Sahara v2 | |---|---|---|---|---|---|---|---| | Suajili | Sí | Batch+Stream (5 locales) | Vista previa | GA (sw-KE, sw-TZ) | Sí (WER moderado) | Sí | | Afrikáans | Sí | Batch+Stream | GA | GA | No aparece | Sí | | Amárico | Sí | Batch+Stream | Vista previa | GA | Sí (WER aceptable) | Sí | | Zulú | Sí | Batch+Stream | Vista previa | GA | No aparece | Sí | | Hausa | Sí | Solo Batch | Vista previa | No aparece | Sí (WER aceptable) | Sí | | Yoruba | Sí | No aparece | Vista previa | No aparece | Sí (WER aceptable) | Sí | | Wólof | Requiere ajuste fino | Solo Batch | Vista previa | No aparece | No aparece | Sí | | Xhosa | Sí | No aparece | Vista previa | No aparece | No aparece | Sí | | Somalí | Sí | Batch+Stream | No aparece | GA | Sí (WER aceptable) | No aparece | | Kinyarwanda | Sí | Solo Batch | No aparece | No aparece | No aparece | Sí | | Luganda | Sí | Batch+Stream | No aparece | No aparece | No aparece | Sí | | Igbo | No aparece | No aparece | No aparece | No aparece | No aparece | Sí | | Twi / Akan | No aparece | No aparece | No aparece | No aparece | No aparece | Sí |
Fuentes: tabla de idiomas de AWS Transcribe (docs.aws.amazon.com/transcribe), documentación de Google Cloud Chirp 3, soporte de idiomas de Azure Speech (Microsoft Learn), documentación de idiomas compatibles de AssemblyAI, página de producto de Intron Sahara v2. Todo verificado en julio de 2026.

Desglose Motor por Motor
Whisper large-v3 (a través de la API de OpenAI o autoalojado)
Whisper es la columna vertebral de la mayoría de la transcripción de idiomas africanos que funciona en 2026. La API alojada de OpenAI cobra $0.006/minuto por gpt-4o-transcribe o $0.003/minuto por gpt-4o-mini-transcribe. Autoalojarlo con faster-whisper o whisper.cpp elimina el coste por minuto a cambio de una mayor complejidad de configuración.
La distribución de precisión es desigual. El suajili y el afrikáans están en territorio "utilizable". El hausa y el amárico son viables para contenido no crítico. El yoruba es marginal. El wólof no se puede transcribir de forma fiable con el modelo base.
Una capacidad importante: Whisper maneja el cambio de código (cuando los hablantes mezclan idiomas, un patrón común en contenido nigeriano, senegalés y keniano) mejor que la mayoría de las alternativas.
Ideal para: suajili, amárico y acentos africanos de inglés. Investigadores que alojan sus propios sistemas por privacidad. Cualquiera que ya pague por acceso a la API de OpenAI y necesite un respaldo multilingüe. Consulta precios de la API de OpenAI Whisper en 2026 para ver el panorama completo de costes.
Intron Sahara v2 (el destacado de 2026)
El avance más significativo en transcripción de idiomas africanos en 2026 es un modelo creado en Lagos, no en Silicon Valley. Intron lanzó Sahara v2 en marzo de 2026, entrenado con 50.000 horas de audio de más de 40.000 hablantes en 30 países africanos, grabado en entornos reales: clínicas, tribunales, centros de llamadas y mercados.
Sahara v2 admite 57 idiomas, incluyendo explícitamente hausa, yoruba, suajili, wólof, igbo, twi, kinyarwanda, luganda, zulú, xhosa, shona, pidgin y más. Incluye el primer modelo ASR bilingüe suajili-inglés del mundo, diseñado para el cambio de código entre ambos idiomas, y cubre más de 500 variantes de acentos africanos del inglés.
Mi opinión: esta es la herramienta que investigaría primero para cualquier aplicación de producción en idiomas africanos. La calidad de los datos de entrenamiento (grabaciones del mundo real, no textos religiosos) se adapta mejor a los casos de uso que la mayoría de la gente tiene realmente. La advertencia honesta: Intron no publica precios. El acceso a la API está disponible, pero hay que contactar con su equipo.
Ideal para: yoruba, igbo, twi, kinyarwanda y otros idiomas que los modelos generales manejan mal. Despliegues de producción donde la calidad de los datos de entrenamiento importa.
AWS Transcribe
AWS Transcribe ha construido silenciosamente una de las listas de idiomas africanos más amplias de cualquier proveedor de la nube, incluyendo wolof y hausa (ambos solo por lotes), suajili en cinco variantes locales de país, afrikáans, amárico, somalí, zulú, kinyarwanda y luganda.
El precio parte de $0.024/minuto (nivel 1, hasta 250.000 minutos al mes) y baja según el volumen. La precisión va por detrás de las herramientas basadas en Whisper para la mayoría de estos idiomas porque usa un modelo subyacente distinto, y no hay datos publicados de WER para lenguas africanas. Para un desglose completo de costes, consulta precios de AWS Transcribe en 2026.
Ideal para: desarrolladores que ya están en el ecosistema AWS y necesitan trabajos por lotes en un abanico de idiomas de África oriental y meridional. El soporte multi-variante del suajili (Kenia, Tanzania, Uganda, Burundi, Ruanda) es un diferenciador real.
Google Cloud Speech-to-Text (Chirp 3)
El modelo Chirp 3 de Google añadió afrikáans (GA), suajili, amárico, hausa, yoruba, wolof, xhosa y zulú, aunque la mayoría están en estado de vista previa (Preview) más que en GA. El precio es de aproximadamente $0.016/minuto en tiempo real y $0.004/minuto para procesamiento por lotes dinámico.
La designación de vista previa implica que los SLA de producción no se aplican. En el caso del wolof en particular, "Preview" en un modelo de propósito general no garantiza que se haya cerrado la brecha de precisión; significa que la función existe. Evalúa con muestras reales antes de comprometerte.
Ideal para: idiomas de África oriental y meridional (suajili, afrikáans) donde el modelo ha tenido más tiempo de desarrollo y está en GA. Con cautela con los idiomas en vista previa para uso en producción.
Azure Speech Service
Azure soporta afrikáans, amárico, suajili (Kenia y Tanzania), somalí y zulú en estado GA. Hausa, yoruba y wolof no están listados. El precio es de aproximadamente $0.0167/minuto para transcripción estándar en tiempo real o $0.003/minuto para lotes.
La lista de lenguas africanas es más limitada que la de AWS o Google, pero las lenguas que sí incluye están en fase GA, no en vista previa. La diarización (separación de hablantes) es un complemento de pago a 0,30 $/hora en tiempo real, o va incluida gratis en el procesamiento por lotes.
Ideal para: suajili, amárico, afrikáans y zulú en despliegues dentro del ecosistema de Azure. No es la primera opción para lenguas de África Occidental.
AssemblyAI
El modelo Universal-2 de AssemblyAI incluye suajili (precisión moderada, nivel de WER del 25-50 %), hausa (aceptable, por encima del 50 % de WER), amárico (aceptable), yoruba (aceptable), somalí (aceptable), shona (aceptable) y lingala (aceptable). El wólof no aparece en la lista. Los precios parten de 0,15 $/hora (0,0025 $/minuto) para el modelo Universal-2, con 50 $ en créditos gratis al registrarse.
Los niveles de WER que publica AssemblyAI son honestos: "aceptable" con más del 50 % de WER significa que necesitarás una corrección posterior considerable. Para hausa y yoruba en concreto, Intron Sahara v2 probablemente supere a AssemblyAI por un margen notable, dado su conjunto de datos de entrenamiento, aunque aún no se han publicado comparativas directas de referencia.
Ideal para: desarrolladores que quieren una sola API que cubra lenguas africanas junto con inglés y lenguas europeas en el mismo flujo de trabajo. Consulta las mejores APIs de voz a texto en 2026 para una comparativa más amplia.
La realidad de los recursos limitados: lenguas que la IA aún no puede transcribir
Varias categorías amplias de lenguas africanas siguen siendo prácticamente irresolubles para los modelos generales de IA en 2026:
Sin cobertura por parte de los grandes proveedores:
- Bambara y lenguas mandé (Mali, Burkina Faso, Guinea)
- La mayoría de las lenguas nilo-saharianas (Sudán del Sur, Etiopía, Sudán)
- La mayoría de las lenguas bantú de África Central fuera de las principales (el lingala es la excepción notable gracias a AssemblyAI)
- Dialectos del fula o fulani en toda África Occidental (Intron Sahara v2 lista el fulani como lengua compatible; otros proveedores no lo hacen)
El modelo MMS (Massively Multilingual Speech) de Meta cubre nominalmente 1.100 idiomas, pero se entrenó principalmente con grabaciones de textos religiosos y con menos de 50 horas de datos para muchas lenguas africanas. Es de código abierto y gratuito para autoalojar, pero la precisión en idiomas de bajos recursos no es viable para producción sin un ajuste fino significativo.
Para investigadores de campo, periodistas y ONG que trabajan con estas lenguas, la respuesta honesta es: la transcripción humana o la participación de lingüistas comunitarios sigue siendo necesaria. La IA te lleva a la línea de salida, no a la meta, en la larga cola de los idiomas africanos.
Para patrones similares en otra región desatendida, el artículo sobre las mejores herramientas de transcripción para idiomas asiáticos cubre dinámicas comparables de bajos recursos.
Un flujo de trabajo práctico para audio en lenguas africanas
El patrón que funciona de forma consistente:
- Empieza por la calidad del audio. Las grabaciones limpias importan más en lenguas africanas que en inglés porque los modelos tienen menos datos de entrenamiento para compensar el ruido. Un buen micrófono y un ruido de fondo mínimo no son opcionales para idiomas con precisión marginal como el yoruba.
- Usa Whisper large-v3 (vía API de OpenAI o autoalojado) como base para suajili, amárico y afrikáans. Para hausa y yoruba, compáralo con AssemblyAI usando una muestra antes de comprometerte.
- Para lenguas de África occidental a gran escala, evalúa Intron Sahara v2.
- Para contenido con cambio de código (suajili-inglés, hausa-inglés, francés-yoruba), deja que la herramienta lo detecte automáticamente en lugar de dividir el archivo. Tanto Whisper como Sahara v2 manejan audio en idiomas mezclados.
- Reserva presupuesto para una revisión posterior con hablantes nativos. Para lenguas africanas con calificación de precisión aceptable, la transcripción con IA te lleva al 50-70% del camino. La revisión humana cierra la brecha para contenido publicable o con consecuencias legales.
If your content is in English with African accents rather than an African language proper, standard tools perform much better. Intron's 500+ African-English accent coverage is particularly useful for call-center and broadcast applications where content is English but spoken by African speakers.
For uploads of audio files in any of the supported languages without a bot or meeting integration, ConvertAudioToText's audio-to-text tool handles file uploads directly and returns structured output with speaker labels, useful when you just need a clean starting transcript before a human review pass.
Frequently Asked Questions
Which African languages does Whisper large-v3 actually support well?
Swahili and Afrikaans have published WER scores on the FLEURS benchmark (roughly 34% and 32% respectively), which is usable with clean audio and a post-edit pass. Hausa and Amharic are in the model's language list. Yoruba scores around 49% WER (marginal). Wolof has an extremely high error rate on FLEURS, meaning base Whisper essentially cannot transcribe it reliably without fine-tuning. Specialized fine-tuned models like CAYTU/Whosper on Hugging Face address Wolof specifically.
Does AWS Transcribe support African languages?
Yes, more than most people realize. AWS Transcribe supports Afrikaans, Amharic, Hausa (batch only), Kinyarwanda, Luganda, Somali, Swahili (Kenya, Tanzania, Uganda, Burundi, Rwanda), Wolof (batch only), and Zulu (batch and streaming) per their official language table. Accuracy lags behind Whisper-based tools for most of these because it uses a different underlying model, but the coverage list is surprisingly broad.
What is the best tool for Hausa or Yoruba transcription in 2026?
Para el hausa, las herramientas basadas en Whisper (incluido el modelo Universal-2 de AssemblyAI, que también lista el hausa) son las opciones más accesibles. Ambas califican el hausa con una precisión de aceptable a moderada, es decir, utilizable pero no pulida. AWS Transcribe lista el hausa para trabajos por lotes. Para el yoruba, Whisper large-v3 tiene alrededor de un 49% de WER, y AssemblyAI también lo califica con precisión aceptable. Para obtener resultados de calidad profesional, es necesaria una revisión posterior realizada por un hablante nativo en ambos idiomas, independientemente de la herramienta.
¿Existe una herramienta diseñada específicamente para el reconocimiento de voz en lenguas africanas?
Sí. Intron, una startup de IA con sede en Lagos, lanzó Sahara v2 en marzo de 2026 con soporte para 57 idiomas, incluidos hausa, yoruba, suajili, wólof, igbo, twi, kinyarwanda, zulú, xhosa, shona, luganda, pidgin y más. Se entrenó con 50.000 horas de habla africana real procedente de 30 países. El acceso a la API está disponible para desarrolladores y empresas, aunque los precios no se publican y requieren contactar directamente con Intron.
¿Qué lenguas son prácticamente irresolubles con la transcripción por IA actual?
Muchas lenguas africanas siguen sin tener una vía viable de transcripción por IA en 2026. Esto incluye la mayoría de las lenguas bantúes de África Central, el bambara y muchas lenguas manding de África Occidental, las lenguas nilo-saharianas y la mayoría de los idiomas con menos de 50 horas de datos de entrenamiento disponibles. El modelo MMS de Meta cubre más de 1.100 idiomas en teoría, pero se entrenó principalmente con textos religiosos y tiene una precisión muy baja en estas lenguas de cola larga. Para la investigación de campo en idiomas con pocos recursos, la transcripción humana sigue siendo la única opción fiable.
Fuentes
- Idiomas compatibles con AWS Transcribe: https://docs.aws.amazon.com/transcribe/latest/dg/supported-languages.html (consultado en julio de 2026)
- Idiomas compatibles con Google Cloud Chirp 3: https://docs.cloud.google.com/speech-to-text/docs/models/chirp-3 (consultado en julio de 2026)
- Soporte de idiomas de Azure Speech Service: https://learn.microsoft.com/en-us/azure/ai-services/speech-service/language-support (consultado en julio de 2026)
- Idiomas compatibles y niveles de WER de AssemblyAI: https://www.assemblyai.com/docs/supported-languages (consultado en julio de 2026)
- Lanzamiento de Intron Sahara v2: https://www.itnewsafrica.com/2026/03/intron-launches-voice-ai-for-africa-with-24-languages/ (marzo de 2026)
- Página de producto de Intron Sahara v2: https://www.intron.io/sahara-v2/ (consultado en julio de 2026)
- Precios de transcripción de audio de OpenAI: https://developers.openai.com/api/docs/pricing (consultado en julio de 2026)
- Precios de AssemblyAI: https://www.assemblyai.com/pricing (consultado en julio de 2026)
- Precios de AWS Transcribe: https://aws.amazon.com/transcribe/pricing/ (consultado en julio de 2026)
- Discusión sobre WER de Whisper large-v3 en FLEURS: https://github.com/openai/whisper/discussions/1762 (consultado en julio de 2026)
- Ajuste fino de CAYTU/Whosper para wolof: https://huggingface.co/CAYTU/whosper-large-v2 (consultado en julio de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Hausa Transcription: Engine Support, Script, and Accuracy in 2026
Hausa transcription: tones, boko script context, Nigeria and Niger media use, and honest engine support in 2026.

Wolof Transcription: Where Support Stands in 2026
Wolof ASR support honestly: very low-resource, French code-switching dominates urban speech, and the workarounds that exist.