
Transcripción en wolof: dónde está el soporte en 2026
Summarize this article with:
Dónde está el soporte para el wolof
El wolof no cuenta con soporte en la mayoría de las herramientas de transcripción con IA en 2026, y las que dicen ofrecerlo producen tasas de error elevadas. Whisper Large-v3, el modelo que impulsa la mayoría de los servicios que publicitan una amplia cobertura de idiomas, no incluye el wolof en absoluto en su lista de 99 idiomas. Deepgram Nova-3 y AssemblyAI Universal tampoco lo incluyen. Para la mayoría del contenido en wolof, el camino práctico en 2026 no es esperar el soporte nativo, sino entender por qué existe esta brecha y usar la alternativa de la vía francesa, que funciona con audio urbano de Dakar.
Esto no es una deficiencia de las herramientas respecto a los idiomas para los que fueron creadas. Es un problema de datos de entrenamiento: los corpus públicos de habla wolof más grandes, incluido el conjunto de datos del proyecto ALFFA y la colección de OpenSLR para wolof, van desde unas 5 hasta 55 horas de audio transcrito. Common Voice no tiene ningún corpus en wolof. Los datos de entrenamiento en inglés de Whisper alcanzan cientos de miles de horas. Esa brecha explica la brecha de WER.
Lo que la investigación realmente muestra
Un artículo de 2025 sobre ASR en wolof ("Speech Language Models for Under-Represented Languages: Insights from Wolof," arXiv:2509.15362) es el punto de referencia publicado más claro sobre el estado actual de las cosas. El estudio recopiló 860 horas de audio espontáneo en wolof de alta calidad, continuó el preentrenamiento de HuBERT con esos datos e integró el codificador de voz resultante en un modelo de lenguaje para el wolof. Incluso con ese esfuerzo dedicado, los resultados de ASR en wolof se situaron en el rango de aproximadamente 68-72 % de WER bajo condiciones de entrenamiento multilingüe. Eso es una tasa de error por palabra: en promedio, aproximadamente 1 de cada 3 palabras sale mal.
A modo de comparación, Whisper Large-v3 logra menos del 5 % de WER en las pruebas de inglés y francés. El wolof no pertenece a ese nivel.
Mi opinión: cualquier servicio que publique un WER inferior al 15 % para el wolof en 2026 sin citar una prueba verificada debe leerse con escepticismo. La evidencia académica apunta al rango de 30-70 % de WER según el conjunto de datos y el método.
Las dos herramientas que realmente incluyen el wolof
Google Cloud Speech-to-Text V2 admite el wolof (wo-SN) en su lista documentada de idiomas. Se trata de soporte real y verificado a nivel de API. La calidad es otra cuestión. Google no publica puntos de referencia de WER por idioma, y el wolof no está entre los idiomas que Google destaca por su calidad. Usa un modelo estándar V2 con facturación por minuto (gratis los primeros 60 minutos y luego $0,004 por cada 15 segundos a escala estándar). Son aproximadamente $0,016 por minuto o unos $0,96 por hora a tarifas base, con descuentos por volumen. El soporte de funciones para el wolof en V2 es básico: transcripción, sin diarización ni puntuaciones avanzadas de confianza.
ElevenLabs Scribe incluye el wolof entre sus 99 idiomas compatibles. Su propia página de pruebas por idioma sitúa al wolof en el nivel de WER "Moderado", con aproximadamente 40,7 % de WER para Scribe v1. Es notablemente mejor que la línea base académica actual, pero sigue significando 4 errores por cada 10 palabras de media. Con la tarifa de Scribe de $0,22 por hora vía API ($0,40 por hora en modalidad de pago por uso), la transcripción en wolof es asequible, pero la salida necesitará una edición considerable para cualquier uso formal. Scribe con un 40 % de WER supera a HuBERT con un 68-72 % de WER, lo que refleja el beneficio de escala del corpus de entrenamiento más amplio de ElevenLabs.
Ninguna de las dos herramientas produce transcripciones en wolof listas para publicarse sin una pasada de revisión.
La realidad del wolof urbano: el francés es la mitad de la señal
Los lingüistas que estudian el habla de Dakar describen el wolof urbano como una variedad de contacto tan mezclada con el francés que encontrarse con wolof puro o francés puro en una conversación casual en Dakar resulta lo bastante inusual como para llamar la atención. No se trata de un cambio de código en el sentido tradicional de alternar entre dos códigos. Los investigadores han caracterizado el habla urbana de Dakar como un tercer código, a veces llamado "dakarois", en el que la gramática del wolof y el vocabulario francés coexisten dentro de una misma emisión.
Una frase representativa podría ser: "Damay dem au bureau, mais avant ñu warna passer chez le marabout." Aproximadamente la mitad del contenido léxico ahí es francés.
Para grabaciones de este tipo, transcribir por la vía francesa captura correctamente la mayor parte del contenido. Las partículas gramaticales, los pronombres y los verbos del wolof salen mal o en blanco, pero los sustantivos, verbos y frases en francés que llevan la mayor parte del contenido proposicional se transcriben con exactitud. El resultado es una transcripción híbrida que necesita, en su estructura gramatical, edición de alguien que sepa wolof, pero que tiene bien colocadas las palabras de contenido.
No es una solución perfecta. Es la honesta. Si tu audio es radio de Dakar, entrevistas urbanas o contenido de pódcast senegalés donde los hablantes son personas instruidas y bilingües, la transcripción por la vía francesa te dará un primer borrador utilizable más rápido de lo que lo daría la transcripción nativa en wolof con un 40-70 % de WER.
Si necesitas una transcripción limpia en francés de audio senegalés, la herramienta de audio a texto de ConvertAudioToText maneja el francés con precisión y capta el habla con cambio de código wolof-francés sin la confusión del motor que provoca forzar un código de idioma con el que el modelo no fue entrenado.
El wolof gambiano: un problema dialectal aparte
El wolof gambiano y el senegalés llevan códigos ISO 639-3 separados (wof y wol, respectivamente) y difieren de forma significativa en su vocabulario. Como Gambia es una antigua colonia británica, el wolof gambiano toma préstamos del inglés donde el wolof senegalés los toma del francés. El cambio de código natural de un hablante de wolof gambiano es hacia el inglés, no hacia el francés.
La implicación práctica: la alternativa de la vía francesa que ayuda con el contenido urbano de Dakar no funciona con contenido en wolof gambiano. Una frase de wolof gambiano con préstamos del inglés fallaría igual de mal en un modelo francés que en un modelo wolof. Para el wolof gambiano, la respuesta honesta en 2026 es la transcripción manual, usando la IA solo para los pasajes dominados por el inglés.
Ambos dialectos son mutuamente inteligibles en el habla, pero difieren en sus convenciones ortográficas y en su inventario de préstamos. Los datos de entrenamiento de ASR en wolof son abrumadoramente senegaleses, así que incluso herramientas como ElevenLabs Scribe que afirman tener soporte de wolof rendirán peor con entradas gambianas.
Escritura y ortografía
La ortografía latina oficial para el wolof en Senegal se estandarizó en 1974 mediante decreto gubernamental, con el Centre de linguistique appliquée de Dakar (CLAD) como organismo autoridad. El alfabeto incluye:
- Ñ para la nasal palatal (como la ñ española)
- Ŋ para la nasal velar
- À, É, Ë, Ó como vocales con diacríticos
- Consonantes geminadas (dobles) para marcar duración: kk, bb, tt
Existe un sistema paralelo de escritura basado en el árabe, el wolofal, con uso histórico religioso, pero nunca fue adoptado formalmente por decreto gubernamental. El contenido digital en wolof hoy usa casi exclusivamente la ortografía latina.
Las transcripciones con IA en wolof deberían producir escritura latina. Si revisas resultados de Google STT o ElevenLabs Scribe, comprueba que la ñ se renderiza correctamente y que las consonantes geminadas se conservan en lugar de colapsarse. Estos son modos de fallo habituales en la salida de lenguas africanas con pocos recursos.

Comparación de las opciones de transcripción en wolof en 2026
| Herramienta | ¿Incluye wolof? | WER real | Notas |
|---|---|---|---|
| Whisper Large-v3 | No | N/D | No aparece en la lista de idiomas |
| AssemblyAI Universal | No | N/D | No aparece |
| Deepgram Nova-3 | No | N/D | No aparece |
| Google STT V2 | Sí (wo-SN) | No publicado | Modelo básico V2, facturado por consumo |
| ElevenLabs Scribe | Sí | ~40,7 % de WER | Prueba de Scribe v1, nivel "Moderado" |
| Transcripción humana | N/D | Cercano al 0 % | Lenta, requiere bilingüe wolof-francés |
La tabla muestra un mercado sin ninguna opción con calidad de producción. Un WER "Moderado" del 40 % significa aproximadamente 4 palabras incorrectas por cada 10, lo que supone una carga de edición pesada para uso profesional.
Para una visión más amplia de cómo les va a las lenguas africanas con pocos recursos frente a los modelos actuales de ASR, consulta el artículo por qué la IA tiene dificultades con las lenguas con pocos recursos. La situación del wolof no es única: existen brechas similares para el hausa, el amárico y varias otras lenguas con decenas de millones de hablantes pero con corpus digitales de texto y audio escasos.
Qué deberían hacer ahora los podcasters y periodistas en wolof
La escena de pódcasts en wolof está creciendo. Wolof Tech en Spotify y Apple Podcasts cubre tecnología en wolof. El proyecto "Xam sa démb, xam sa tey" ha publicado 50 episodios de contenido histórico en wolof y francés en colaboración con los Archivos Nacionales de Senegal. Investigadores académicos usan grabaciones de campo para estudiar la tradición oral.
Para estos productores, el flujo de trabajo práctico en 2026 depende del tipo de contenido:
Pódcasts urbanos wolof-francés (audiencia de Dakar): Transcribir por la vía francesa. Revisar la salida y luego rellenar manualmente los elementos gramaticales del wolof. Exportar como SRT para subtítulos después de la pasada de edición. Es más lento de lo ideal, pero produce resultados utilizables.
Wolof formal o rural (mínimo francés): Usar ElevenLabs Scribe con wolof seleccionado y presupuestar una pasada completa de edición. Con un 40 % de WER, trátalo como un borrador, no como una transcripción. Para grabaciones de archivo importantes, un transcriptor humano bilingüe es la opción más honesta.
Wolof gambiano: Usar transcripción humana o la vía inglesa para los pasajes dominados por el inglés. Ninguna herramienta de IA produce salida utilizable de wolof específicamente para contenido gambiano.
Uso periodístico: Los periodistas senegaleses que escriben en francés suelen necesitar extraer citas de entrevistas en wolof. El enfoque de la vía francesa capta con exactitud los pasajes en francés. Las citas en wolof que requieren reproducción exacta exigen transcripción manual.
Para contenido principalmente en francés con inserciones en wolof, el artículo la mejor transcripción para lenguas africanas cubre qué motores manejan con mayor exactitud el panorama de acentos francoafricanos.
Qué cambiará (y cuándo)
La investigación publicada en 2025 ha logrado avances medibles. El corpus curado de 860 horas en wolof y el modelo de lenguaje de habla basado en HuBERT de arXiv:2509.15362 demuestran que el preentrenamiento dedicado mueve el WER del wolof desde la línea base académica hacia un rango más manejable. ElevenLabs Scribe con un 40,7 % de WER es en sí mismo una mejora significativa respecto a dónde estaba el ASR en wolof hace dos años.
El siguiente paso que cambiaría el panorama práctico sería que uno de los grandes proveedores alojados (Deepgram, AssemblyAI, OpenAI) entrene un modelo capaz de procesar wolof y lo despliegue a escala de producción. Ninguno lo ha anunciado. Que la comunidad wolof contribuya a Common Voice y a corpus públicos similares aceleraría ese calendario, ya que los laboratorios comerciales de ASR usan esos conjuntos de datos como referencias y señales de entrenamiento.
Hasta entonces, la respuesta honesta es: la transcripción en wolof en 2026 es un problema de IA de baja precisión o de transcripción humana manual, y la alternativa de la vía francesa es el camino más práctico para el contenido que la mayoría de los usuarios realmente tiene.
Preguntas frecuentes
¿Whisper Large-v3 admite el wolof?
No. El wolof no figura en la lista de idiomas de Whisper Large-v3. El modelo admite 99 idiomas, y entre las lenguas africanas que cubre están el suajili, el yoruba, el hausa, el amárico, el somalí, el afrikáans, el lingala y el shona, pero no el wolof. Como consecuencia, ningún servicio construido sobre Whisper ofrece soporte de wolof.
¿Qué herramientas de IA admiten realmente la transcripción en wolof en 2026?
Google Cloud Speech-to-Text V2 incluye el wolof (código de idioma wo-SN) en su soporte de idiomas documentado. ElevenLabs Scribe también incluye el wolof, con una prueba publicada que muestra aproximadamente un 40,7 % de tasa de error por palabra. Ambas opciones existen, pero ninguna produce una salida limpia sin una pasada de revisión. Ninguna herramienta importante de bots de reuniones o de colaboración en equipo (Otter, Fireflies, Trint, Descript) incluye soporte de wolof.
¿Por qué la precisión del ASR en wolof es mucho peor que en francés o inglés?
Escasez de datos de entrenamiento. Los mayores conjuntos de datos públicos de habla wolof tienen entre 55 y 860 horas de audio según el proyecto. El entrenamiento de ASR en inglés alcanza cientos de miles de horas. Common Voice, el mayor corpus multilingüe colaborativo, no tiene ninguna colección en wolof. Sin datos de entrenamiento, los modelos generalizan mal ante la fonología del wolof, sus patrones tonales y el inventario de sonidos específico de la lengua.
¿Qué es la alternativa del cambio de código al francés y cuándo aplica?
Los hablantes de wolof urbano en Dakar producen un habla fuertemente mezclada con el francés, hasta el punto de que los investigadores la describen como una variedad de contacto distinta. Si tu audio proviene de hablantes instruidos de Dakar, configurar el idioma de transcripción en francés transcribirá correctamente todo el contenido en francés (frecuentemente la mayoría del contenido léxico) y producirá una salida en blanco o ilegible para las partículas gramaticales del wolof. El borrador resultante necesita editar los elementos en wolof, pero captura el contenido proposicional con exactitud. Esta alternativa no aplica al wolof rural senegalés ni al wolof gambiano, donde el código no wolof es el inglés y no el francés.
Fuentes
- Idiomas compatibles de Google Cloud Speech-to-Text V2: https://cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages
- Página de pruebas de ElevenLabs Scribe para wolof: https://elevenlabs.io/speech-to-text/wolof
- Precios de ElevenLabs Scribe: https://elevenlabs.io/pricing/api
- Lista de idiomas de OpenAI Whisper (tokenizer.py): https://github.com/openai/whisper/blob/main/whisper/tokenizer.py
- arXiv: Speech Language Models for Under-Represented Languages: Insights from Wolof (2509.15362): https://arxiv.org/abs/2509.15362
- Ortografía y estandarización del wolof (Janga Wolof): https://jangawolof.org/wolof-orthography-a-guide-to-writing-the-wolof-language/
- Investigación sobre el cambio de código en el wolof urbano (ResearchGate): https://www.researchgate.net/publication/254333661_Two_Codes_or_One_The_Insiders'_View_and_the_Description_of_Codeswitching_in_Dakar
- Hablantes de la lengua wolof y geografía dialectal (Wikipedia): https://en.wikipedia.org/wiki/Wolof_language
- Idiomas compatibles de AssemblyAI: https://assemblyai.com/docs/Concepts/supported_languages
- Pódcast Wolof Tech (Spotify): https://open.spotify.com/show/6repqMDxu0d5eq7U3BaZFq
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription for African Languages in 2026: Honest Rankings
Which engines actually support Swahili, Hausa, Yoruba, Amharic, Wolof, and Zulu in 2026? Verified support matrices, honest WER context, and the tools that genuinely work.
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.