
Por qué la IA falla con las lenguas de bajos recursos: una mirada honesta en 2026
Summarize this article with:
La transcripción con IA funciona bien para lenguas de altos recursos como el inglés, el español o el mandarín porque los modelos se entrenan con cientos de miles de horas de audio etiquetado. Para las lenguas de bajos recursos, esos datos apenas existen, y la brecha de precisión no es un fallo, sino una consecuencia estadística. Las lenguas tonales, las escrituras no latinas y el cambio de código complican aún más el problema. En 2026, Meta Omnilingual ASR, Google Chirp 3 y proyectos comunitarios de datos como NaijaVoices están reduciendo la brecha, pero para muchas lenguas africanas e indígenas, la transcripción de calidad profesional aún está a varios años de distancia.
La transcripción por IA funciona casi perfectamente en tu grabación en inglés y produce algo prácticamente ilegible con el mismo contenido en yoruba. Ambos hablantes se expresaron con la misma claridad; el problema no es el audio. El problema es que el modelo nunca tuvo suficiente yoruba del que aprender.
Esa brecha tiene un nombre: el problema de los idiomas con pocos recursos. Este artículo explica por qué existe, cuáles son los mecanismos técnicos y dónde se está cerrando realmente la brecha en 2026.
Qué significa "pocos recursos" en la práctica
En la investigación del reconocimiento de voz, un idioma con pocos recursos es aquel que tiene datos de entrenamiento etiquetados limitados: audio grabado emparejado con transcripciones precisas. El umbral exacto varía según el contexto de investigación, pero las categorías prácticas en 2026 son más o menos así:
- Alto nivel de recursos: cientos de miles de horas de audio etiquetado. Inglés, mandarín, español, francés, alemán, portugués, árabe, japonés, coreano. Los modelos entrenados aquí alcanzan una precisión de nivel de producción con tasas de error de palabra (WER) por debajo del 5% en audio limpio.
- Nivel medio de recursos: decenas de miles de horas. Italiano, neerlandés, vietnamita, tailandés, indonesio, polaco, turco, ucraniano. Los modelos de producción alcanzan un WER en el rango del 8-15%, suficiente para una transcripción fiable de un primer borrador.
- Bajo nivel de recursos: unos pocos miles de horas o menos. Suajili, hausa, wólof, bengalí, tamil, urdu, filipino. Las tasas de error son lo bastante altas como para que sea necesaria la revisión humana antes de publicar una transcripción.
- Muy bajo nivel de recursos o sin soporte: menos de 1.000 horas de audio transcrito, a veces menos de 100. La mayoría de las lenguas africanas, muchas lenguas indígenas y cientos de idiomas regionales más pequeños en todo el mundo. Algunos de ellos no estaban soportados por ningún modelo ASR hasta finales de 2025.
Estas categorías cambian con cada gran lanzamiento de modelo. OpenAI señaló que 20 de los 99 idiomas compatibles con Whisper large-v3 no tenían ningún dato de entrenamiento, lo que significa que las predicciones para esos idiomas son esencialmente extrapoladas, no aprendidas.
Por qué los datos de entrenamiento son el verdadero cuello de botella
Los modelos de voz aprenden a partir de ejemplos. Con suficientes grabaciones emparejadas con transcripciones precisas, el modelo aprende qué sonidos componen cada palabra, cómo varían esos sonidos entre hablantes, edades y acentos, y cómo el contexto desambigua palabras que suenan parecido.
La brecha es aritmética. Los modelos de voz en inglés tienen acceso a conjuntos de entrenamiento que se miden en millones de horas. El yoruba quizá tenga unos pocos cientos de horas de audio etiquetado disponible públicamente. Un modelo entrenado con un millón de horas de un idioma y cien horas de otro no producirá resultados equivalentes, sin importar lo sofisticada que sea la arquitectura.
Esto no es malicia ni una decisión de diseño deliberada. Refleja dónde existía audio digital a gran escala cuando se reunieron estos conjuntos de datos: la infraestructura de radiodifusión, las plataformas de pódcast, los audiolibros y los datos de asistentes de voz se inclinan fuertemente hacia un puñado de idiomas dominantes.
El benchmark FLEURS lo hace concreto. FLEURS evalúa modelos de voz en 102 idiomas con datos paralelos. Whisper large-v3 logra un WER medio del 7,4% en FLEURS, pero esa cifra destacada oculta la varianza. Para el pastún, las evaluaciones publicadas muestran que Whisper large-v3 supera el 89% de WER. Para idiomas como el amárico y el yoruba, el WER puede superar el 100% debido a un modo de fallo específico: el modelo genera una salida que suena plausible pero estructuralmente incorrecta con el mismo número de tokens de palabra, produciendo más errores que palabras.
Para conceptos de precisión explicados con más profundidad, consulta explicación de la precisión en transcripción.
Por qué los idiomas tonales agravan el problema
El mandarín, el vietnamita, el tailandés, el yoruba, el igbo y otros idiomas tonales añaden una capa de dificultad más allá de la escasez de datos. En estos idiomas, el contorno tonal de una sílaba cambia el significado de la palabra. La misma secuencia de consonante y vocal pronunciada con tono ascendente significa algo distinto de la misma secuencia pronunciada con tono descendente.
El tono es más difícil de modelar que los fonemas por varias razones. Varía de forma continua según el tipo de hablante, la emoción y el énfasis. Es sensible al ruido de fondo. Y los propios datos de entrenamiento suelen ser inconsistentes: los diacríticos tonales en el yoruba escrito, por ejemplo, marcan el tono en la ortografía, pero la calidad de los datos de entrenamiento y las convenciones de marcado tonal varían mucho según la fuente.
Un artículo de 2026 en el taller LoResLM evaluó Whisper y MMS-1B de Meta en yoruba y descubrió que los resultados favorecían sistemáticamente los datos sin marcado tonal frente a los datos con marcado tonal. Esto es contraintuitivo hasta que te das cuenta de que el modelo aprendió de más ejemplos sin marcado tonal, por lo que rinde mejor cuando la salida no requiere una generación precisa del tono. La implicación es que incluso cuando el modelo produce texto, es probable que esté eliminando o generando incorrectamente los diacríticos que aportan significado en la lengua.
Para ver más de cerca cómo se desarrolla esto en una lengua concreta, consulta Transcripción en yoruba: evaluación honesta.
Por qué las escrituras no latinas generan fricción adicional
La mayor parte del texto de entrenamiento de la IA, no solo las transcripciones de audio sino todo el texto que estos modelos han visto jamás, se inclina fuertemente hacia las lenguas con alfabeto latino. Cuando un modelo aprende a generar escrituras no latinas como el ge'ez (amhárico), el árabe, el devanagari o el tailandés, necesita capacidad de aprendizaje separada para los sistemas de caracteres, las reglas de segmentación de palabras y las convenciones de generación de texto.
Para las lenguas no latinas de altos recursos (mandarín, árabe, japonés, ruso, coreano), esto no supone un problema porque la ingente cantidad de datos de entrenamiento lo compensa. Para las lenguas no latinas de bajos recursos (amhárico, tigriña, jemer, cingalés), el desafío se agrava: escasez de datos de audio de entrenamiento más escasez de datos de texto de entrenamiento para la escritura.

El amhárico usa la escritura ge'ez, uno de los sistemas de escritura más antiguos que sigue en uso activo, con 276 caracteres distintos. Un modelo que aprende amhárico está aprendiendo a la vez un sistema fonológico poco común y un inventario de caracteres inusual a partir de ejemplos limitados. Consulta transcripción en amhárico: estado en Etiopía 2026 para ver cómo se ve esto en la práctica.
Por qué el cambio de código agrava aún más el problema
Muchas lenguas de bajos recursos se hablan en contextos de intenso cambio de código: los hablantes alternan entre la lengua local y una lengua dominante regional o colonial a nivel de frase o de palabra. Wolof-francés, hausa-inglés, tagalo-inglés, yoruba-inglés, hindi-inglés.
Los modelos de IA entrenados con datos monolingües se comportan de forma predeciblemente mala aquí. Cuando el modelo encuentra un segmento ambiguo, recurre por defecto a la lengua de altos recursos. Una conversación en wolof-francés puede salir casi por completo en francés, con frases en wolof transcritas fonéticamente de forma incorrecta o alucinadas como palabras francesas. Un intercambio en hausa-inglés puede colapsar al inglés.
Los modelos entrenados con datos de cambio de código manejan esto mejor, pero los corpus de entrenamiento con cambio de código siguen siendo limitados para la mayoría de los pares de lenguas. El conjunto de datos NaijaVoices (más de 1.800 horas, más de 5.000 hablantes de hausa, igbo y yoruba, publicado en 2025) es uno de los esfuerzos recientes más significativos para abordar esto en las lenguas nigerianas. Consulta transcripción con cambio de código hindi-inglés para ver un caso donde la situación ha mejorado sustancialmente.
Dónde se está produciendo realmente el progreso en 2026
La brecha es real. También se está cerrando, en parte gracias a mejores arquitecturas de modelos y en parte a un serio trabajo de recopilación de conjuntos de datos.
Meta Omnilingual ASR (noviembre de 2025)
Meta lanzó Omnilingual ASR el 10 de noviembre de 2025, con cobertura para más de 1.600 idiomas, incluidos unos 500 que nunca antes habían sido compatibles con ningún sistema de ASR. El modelo más grande (7B parámetros) logra tasas de error de carácter inferiores al 10 en el 78% de esos idiomas. El sistema es de código abierto y puede ampliarse a otros idiomas mediante aprendizaje en contexto con muy pocos ejemplos emparejados. El corpus de entrenamiento incluye el Omnilingual ASR Corpus, creado con African Next Voices, la Fundación Mozilla y socios académicos, con grabaciones de hablantes nativos para 350 idiomas poco representados.
Esta es la expansión más significativa de cobertura lingüística en ASR jamás publicada. El matiz es que un CER inferior a 10 en el 78% de 1.600 idiomas todavía deja un 22% con tasas de error más altas, y la precisión en producción para los idiomas con menos recursos sigue estando muy por debajo de lo que experimentan los usuarios de inglés.
Google Chirp 3 (2025) y la iniciativa de los 1.000 idiomas
El Universal Speech Model (USM) de Google sustenta la familia de APIs de voz Chirp. Chirp 3, lanzado en 2025, se entrena con 12 millones de horas de audio en más de 300 idiomas y añade soporte de streaming y una mejor precisión multilingüe. El objetivo de investigación a largo plazo de Google es un sistema que cubra 1.000 idiomas; USM se planteó como el primer hito hacia esa meta.
Conjuntos de datos comunitarios: Common Voice y Lacuna Fund
Mozilla Common Voice v26.0, lanzado en junio de 2026, cubre 294 idiomas con 21.594 horas validadas repartidas en 131 idiomas. Cada hora nueva de audio validado en hausa, kinyarwanda o luganda es combustible para futuras versiones de modelos. Lacuna Fund ha financiado la creación de conjuntos de datos para más de 29 idiomas africanos en varias rondas de financiación; el conjunto NaijaVoices (hausa, igbo, yoruba) fue uno de los resultados.
Estos conjuntos de datos importan porque los modelos solo pueden ser tan buenos como los datos con los que se entrenan. Cada grabación que un hablante nativo aporta a Common Voice se puede usar directamente como dato de entrenamiento.
Preentrenamiento autosupervisado
El cambio arquitectónico más importante para las lenguas de bajos recursos es el aprendizaje autosupervisado: los modelos se preentrenan con grandes cantidades de audio bruto y sin etiquetar en la lengua objetivo, aprendiendo la estructura fonológica general antes de ajustarse con los pocos datos etiquetados disponibles. wav2vec 2.0 y HuBERT establecieron este enfoque. AfriHuBERT (presentado en Interspeech 2025) lo aplica específicamente a lenguas africanas, logrando un WER inferior al 60% en afrikáans, hausa y suajili sin los requisitos de datos etiquetados de los sistemas anteriores.
El preentrenamiento autosupervisado reduce de forma efectiva la cantidad de datos etiquetados necesarios para alcanzar un nivel de precisión dado. Esto no elimina el problema de los datos de entrenamiento, pero sí reduce cuántos datos etiquetados se necesitan para arrancar.
Modelos ajustados por lengua específica
Los modelos más pequeños ajustados para una sola lengua suelen superar a los modelos multilingües generales en esa lengua concreta. Los investigadores han ajustado Whisper específicamente para amárico, pastún, galés y otras lenguas de bajos recursos, con mejoras de precisión significativas frente al modelo multilingüe base. Estos modelos están disponibles en Hugging Face y otros repositorios, aunque su despliegue en producción sigue requiriendo una evaluación frente a tu dominio de contenido específico.
El estado real para los usuarios en 2026
Si trabajas en una lengua de altos recursos (inglés, español, francés, portugués, alemán, árabe, mandarín, japonés, coreano, hindi, vietnamita, indonesio, ruso, italiano, neerlandés, polaco, turco), la transcripción con IA funciona con calidad de producción para la mayoría de los casos de uso.
Si trabajas con un idioma de bajos recursos pero en mejora (suajili, hausa, yoruba, wólof, bengalí, tamil, urdu, filipino), la transcripción por IA actual produce un primer borrador utilizable, pero planifica una pasada de revisión. La precisión depende en gran medida de la claridad del hablante, las condiciones del audio y el dominio. Prueba con audio representativo antes de montar un flujo de producción en torno a cualquier herramienta. Para contexto sobre este grupo de idiomas, herramientas de transcripción para idiomas africanos cubre lo que hay disponible hoy.
Si trabajas con un idioma de muy bajos recursos (la mayoría de los idiomas africanos restantes, muchas lenguas indígenas de América y el Pacífico, y lenguas regionales más pequeñas en todo el mundo), la respuesta honesta a mediados de 2026 es: la transcripción por IA te da un punto de partida aproximado como mucho. Planifica la transcripción manual como el núcleo de tu flujo, con la IA como paso de preprocesado para reducir el problema de la página en blanco.
Si quieres probar la transcripción por IA con tu audio sin comprometerte a un plan de pago, ConvertAudioToText ofrece acceso gratuito para probar tu contenido concreto antes de decidir si la precisión cubre tus necesidades.
Qué Pueden Hacer los Usuarios Hoy
Contribuir a conjuntos de datos de voz abiertos. Mozilla Common Voice acepta grabaciones de hablantes nativos en cualquier idioma compatible. Cada grabación alimenta directamente el futuro entrenamiento de modelos.
Exigir transparencia a los proveedores de IA. Cuando una herramienta de transcripción afirma que admite tu idioma, pide datos de precisión sobre contenido representativo. Algunas herramientas listan idiomas que apenas soportan. La tasa de error por palabra varía enormemente según el dominio, el hablante y el acento dentro de un mismo idioma.
Construir tu flujo en torno a la precisión que realmente obtienes. Para idiomas de bajos recursos, planifica tiempo de edición. Usa la salida de la IA como primer borrador, no como transcripción final. Contrasta las citas importantes con el audio de origen.
Track model releases. The pace of low-resource language improvement accelerated in the second half of 2025 (Omnilingual ASR, Chirp 3, NaijaVoices). Languages that had no support in 2024 may have experimental support in 2026.
Test fine-tuned alternatives. For some low-resource languages, community fine-tuned models on Hugging Face outperform the base Whisper multilingual model. Search for your language before defaulting to off-the-shelf options.
Where This Goes from Here
The structural problem, that training data quality and quantity in 2026 is radically unequal across languages, is not going away in the next year. But the rate of change is faster than it has ever been. Meta's Omnilingual ASR alone added ASR support for 500 previously unsupported languages in a single release.
My read: production-quality transcription for the current low-resource tier (Swahili, Hausa, Wolof) is achievable within two years as NaijaVoices-trained models and fine-tuned multilingual systems mature. For the deepest resource gaps, first-draft quality for most major unserved languages is likely within three to five years, assuming the community dataset work continues.
The gap is not permanent. But it is real, and pretending otherwise does not serve the speakers who need these tools most.
FAQ
What is a low-resource language in AI terms?
A low-resource language is one with limited labeled training data available for AI models. In speech recognition, this typically means fewer than a few thousand hours of transcribed audio. The threshold is not fixed and shifts as dataset collection efforts grow, but the working definition is: not enough data to train a model to production accuracy without special techniques like self-supervised pre-training or fine-tuning from a multilingual base model.
Why does Whisper perform so poorly on Yoruba and similar tonal African languages?
Dos problemas se agravan mutuamente. Primero, el yoruba tiene muy pocos datos de entrenamiento en comparación con el inglés o el francés. Segundo, el yoruba es una lengua tonal donde el contorno de la entonación cambia el significado de las palabras, y las marcas tonales en la forma escrita son esenciales para desambiguar. Whisper se entrenó con datos donde la ortografía tonal es inconsistente, lo que produce transcripciones excesivamente segmentadas con tasas de error por palabra superiores al 100% en los puntos de referencia publicados. Esto no es un fallo del diseño del modelo, sino un fallo en la cantidad y calidad de los datos de entrenamiento.
¿Es utilizable hoy Meta Omnilingual ASR para lenguas con pocos recursos?
Meta lanzó Omnilingual ASR en noviembre de 2025 como código abierto. Cubre más de 1.600 lenguas, incluidas aproximadamente 500 que nunca antes habían sido compatibles con ningún sistema de ASR. El modelo de 7B logra tasas de error por carácter inferiores a 10 en el 78% de esas lenguas. El modelo puede ampliarse a lenguas adicionales mediante aprendizaje en contexto con muy pocos ejemplos. Sin embargo, las tasas de error para las lenguas con menos recursos siguen siendo altas en comparación con el nivel del inglés, y el despliegue en producción requiere una evaluación en tu dominio específico y en tus condiciones de audio.
¿Qué es el punto de referencia FLEURS y por qué importa para evaluar lenguas con pocos recursos?
FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) es un punto de referencia de habla multilingüe que abarca 102 lenguas con unas 12 horas de datos paralelos por lengua. Se usa ampliamente para comparar modelos de ASR en cuanto a diversidad lingüística. Whisper large-v3 alcanza una tasa media de error por palabra del 7,4% en FLEURS, pero esa media oculta una variación enorme: algunas lenguas con pocos recursos superan el 50% o incluso el 90% de WER, por lo que el desglose por lengua resulta mucho más informativo que el dato principal.
¿Qué puedo hacer hoy si necesito transcribir en una lengua con pocos recursos?
Primero, prueba antes de comprometerte con cualquier herramienta: sube una muestra representativa y comprueba la precisión con tu contenido, tu hablante y tus condiciones acústicas específicas. Segundo, planifica una pasada de edición manual como parte de tu flujo de trabajo para cualquier resultado por debajo del 85% de precisión. Tercero, plantéate contribuir con grabaciones a Mozilla Common Voice, que añade directamente datos de entrenamiento para futuros modelos. Cuarto, para contenido en lenguas africanas, comprueba si existe un modelo ajustado específicamente para esa lengua (por ejemplo, los modelos entrenados con NaijaVoices para hausa, igbo y yoruba). Quinto, sigue de cerca los lanzamientos de modelos: Omnilingual ASR y Chirp 3 añadieron cobertura significativa en 2025, y el ritmo de mejora se está acelerando.
Fuentes
- Artículo de OpenAI Whisper y WER de FLEURS por idioma: openai.com/research/whisper
- Anuncio de Meta sobre ASR omnilingüe (noviembre de 2025): ai.meta.com/blog/omnilingual-asr-advancing-automatic-speech-recognition
- Blog de investigación de Google USM y Chirp: research.google/blog/universal-speech-model-usm-state-of-the-art-speech-ai-for-100-languages
- Mozilla Common Voice v26.0 (junio de 2026): community.mozilladatacollective.com/common-voice-23-0-live-on-mozilla-data-collective
- Artículo del conjunto de datos NaijaVoices (Interspeech 2025): arxiv.org/abs/2505.20564
- Tono en ASR yoruba (LoResLM 2026): aclanthology.org/2026.loreslm-1.14
- Modelo autosupervisado AfriHuBERT (Interspeech 2025): isca-archive.org/interspeech_2025/alabi25_interspeech.pdf
- Conjuntos de datos de PNL africanos de Lacuna Fund: lacunafund.org/datasets/language
- Descripción del benchmark FLEURS y evaluación de Whisper: vexascribe.com/how-accurate-is-whisper
- Benchmark WER de FLEURS para Whisper en pastún: aclanthology.org/2025.chipsal-1.20
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.