
Transcripción de hindi y el problema del Hinglish (2026)
Summarize this article with:
El problema real: tu audio en hindi seguramente es Hinglish
La mayoría del audio en hindi actual no es hindi puro. Una frase de un pódcast de negocios podría sonar así: «Aaj meeting mein hum decide kiya ki next quarter mein hum launch karenge, but pricing strategy abhi finalize nahi hui hai». Es una sola frase, con siete palabras en hindi y siete en inglés, dicha de un solo respiro. El motor de IA tiene que determinar, palabra por palabra, si debe emitir caracteres devanagari o latinos.

Esta es la dificultad central de la transcripción del hindi en 2026. No es un problema de precisión en el sentido habitual. Es un problema de cambio de escritura superpuesto a un problema de cambio de idioma. Los motores que lo manejan bien producen resultados legibles y naturales. Los que no, producen o bien texto completamente en devanagari (con palabras inglesas transliteradas de forma torpe), o bien una transcripción que elimina el hindi por completo y trata todo como inglés.
Esta guía cubre cómo manejan esto en la práctica los principales motores, verificado a partir de documentación e informes de desarrolladores, no de pruebas de rendimiento hechas en laboratorio.
Devanagari: lo que exige esta escritura
El hindi se escribe en devanagari, un abugida con 47 caracteres primarios (14 vocales y 33 consonantes). Los caracteres se escriben de izquierda a derecha. Su rasgo distintivo es el shirorekha, una barra horizontal que recorre la parte superior de cada carácter y une visualmente las letras dentro de las palabras.
Varios mecanismos son importantes para la transcripción:
Matras (signos vocálicos): Las vocales suelen escribirse como diacríticos unidos a la consonante anterior, no como caracteres independientes. Un modelo que maneja bien las consonantes pero coloca mal las matras produce devanagari ilegible.
Consonantes conjuntas (samyukta vyanjan): Cuando dos consonantes se encuentran sin vocal intermedia, se fusionan en una sola ligadura. «ज्ञान» (conocimiento) es una consonante conjunta. Equivocarse con ellas es señal de que el modelo no fue entrenado con datos suficientes de devanagari.
Puntos nukta: Un punto debajo de una consonante indica un sonido extranjero ajeno al hindi de origen sánscrito. «ज़» (za), «क़» (qa) y «फ़» (fa) usan nuktas y aparecen con frecuencia en el hindi influido por el urdu y en préstamos del inglés transliterados.
Eliminación del schwa: En el hindi hablado, la vocal breve «a» (schwa) al final de una sílaba suele eliminarse. «राम» se pronuncia «Raam», no «Raama». Los motores de transcripción que no modelan la eliminación del schwa producen resultados fonémicamente incorrectos.
Para obtener una transcripción correcta del hindi, todo esto debe salir bien. Si tu herramienta devuelve «main aapka shukriya ada karta hoon» en hindi romanizado en lugar de «मैं आपका शुक्रिया अदा करता हूँ», tienes una herramienta que en realidad no está procesando el hindi.
Hinglish: escala y mecánica del cambio de código
Más de 350 millones de indios urbanos usan Hinglish con regularidad, según reportajes de The New York Times. Una investigación del IIT de Delhi encontró que el uso del Hinglish creció un 2% anual entre 2022 y 2024. Alrededor del 83% de los hablantes de hindi mezclan palabras en inglés en su discurso en algún grado.
El cambio de código en el Hinglish no es aleatorio. Hay patrones constantes:
- Los sustantivos y los términos técnicos pasan primero al inglés. «Budget», «deadline», «meeting», «strategy» permanecen en inglés incluso en un discurso fuertemente dominado por el hindi.
- Los verbos permanecen en hindi con más frecuencia, pero los verbos ingleses se adaptan al hindi: «launch karna», «finalize karna», «decide kiya».
- El cambio a nivel de oración es común en los registros formales, donde un hablante puede iniciar una idea en hindi y cerrarla en inglés.
- La mezcla a nivel de palabra domina el habla informal, las redes sociales y los diálogos de Bollywood.
El resultado es que ningún código de idioma describe por completo lo que está haciendo el hablante. Configurar language=hi te da salida en devanagari, pero puede no manejar correctamente las partes en inglés. Configurar language=en elimina el hindi por completo. Configurar language=multi es la decisión correcta en los motores que lo admiten, aunque el comportamiento varía.
Consulta cómo afecta el cambio de código a los flujos de transcripción para un tratamiento más amplio de estos problemas técnicos.
Cómo gestiona el Hinglish cada motor
OpenAI Whisper (large-v3)
Whisper large-v3 es el modelo multilingüe más conocido y maneja bien el hindi puro cuando configuras explícitamente language=hi. Con contenido en Hinglish, su comportamiento es consistente pero no ideal para la mayoría de los casos de uso: el modelo transcribe los préstamos del inglés y las frases en inglés del cambio de código a escritura devanagari. Así, «next quarter mein launch karenge» puede regresar como «नेक्स्ट क्वार्टर में लॉन्च करेंगे», con «next quarter» transliterado a devanagari en lugar de conservarse en alfabeto latino.
No existe un parámetro oficial para solicitar a Whisper salida en Hinglish con escritura mixta. La solución alternativa de la comunidad es el modelo Whisper-Hinglish ajustado por Trelis Research, que introduce un token |mixedcode| que activa la mezcla devanagari-latina, pero esto no está en la API estándar.
Un riesgo adicional: con detección automática, los modelos base de Whisper a veces confunden el hindi con el urdu (ambos idiomas están estrechamente emparentados y comparten una forma hablada). El urdu usa escritura nastaliq, lo que haría tu transcripción ilegible para una audiencia de hindi. Con Whisper, configura siempre language=hi explícitamente.
Deepgram Nova-3
Nova-3 admite el hindi (hi) de forma nativa. Para audio en hindi puro, es la oferta más sólida de Deepgram para este idioma.
Para Hinglish, Nova-3 ofrece un modo multilingüe aparte (language=multi) que admite el cambio de código hindi-inglés entre 10 idiomas. En este modo, Nova-3 emite de forma natural la elección de escritura del hablante: palabras en hindi en devanagari, palabras en inglés en latino. El modelo fue entrenado con datos reales de cambio de código, no con mezclas sintéticas. Este es, arquitectónicamente, el enfoque correcto.
En la práctica, hay informes de desarrolladores sobre casos en que Nova-3 multi identifica erróneamente el hindi como español en algunas grabaciones de Hinglish, lo que provoca fallos significativos de transcripción. Parece ser un problema de fiabilidad en la detección de idioma del modelo multilingüe, no un problema fundamental de arquitectura. La alternativa que algunos desarrolladores han encontrado es volver a Nova-2 o Nova-1 con el código de idioma hi, aceptando la limitación de una salida completamente en devanagari.
Deepgram también publicó el marco BRIDGE, que analiza específicamente por qué las métricas WER estándar fallan con las lenguas indias, señal de que piensan seriamente en este problema. Consulta Deepgram Nova-3 explicado para más detalles sobre la arquitectura del modelo.
AssemblyAI Universal-3
El modelo Universal-3 de AssemblyAI admite 99 idiomas con cambio de código automático y diarización de hablantes. El hindi figura como idioma compatible. AssemblyAI amplió el hindi para incluir específicamente la diarización de hablantes (junto con chino, japonés, coreano y vietnamita), lo que significa que el contenido en hindi y Hinglish con varios hablantes se etiqueta correctamente.
En Universal-3 Pro, el hindi cae en la categoría de «precisión buena», que AssemblyAI define como un WER de 10-25%. No es lo mejor de su clase, pero funciona. La diarización de AssemblyAI mantiene la identidad del hablante a través de los cambios de idioma, de modo que un pódcast donde un presentador habla más hindi y otro más inglés también se etiqueta correctamente.
Google Cloud STT (Chirp)
El modelo Chirp de Google Cloud admite más de 125 idiomas y usa precios medidos por minuto. El hindi es compatible. Para el cambio de código, la recomendación histórica de Google ha sido configurar language_codes para incluir tanto hi-IN como en-IN, lo que permite al modelo procesar audio mixto, aunque la consistencia de salida con Hinglish varía.
Casos de uso directos de API (Deepgram, AssemblyAI)
Si estás construyendo un flujo de trabajo, tanto Deepgram como AssemblyAI ofrecen APIs REST con soporte de hindi. Los precios de la API de Deepgram y el modelo de pago por uso de AssemblyAI se comparan a fondo en el resumen de precios de las APIs de voz a texto.
Tabla comparativa de motores
| Motor | Hindi puro | Modo Hinglish | Escritura de salida con Hinglish | Diarización |
|---|---|---|---|---|
| Whisper large-v3 | Fuerte | Sin modo dedicado | Todo en devanagari (palabras inglesas transliteradas) | No nativa |
Deepgram Nova-3 (hi) | Fuerte | No | Todo en devanagari | Sí |
Deepgram Nova-3 (multi) | N/D | Sí | Mixta (devanagari + latino) | Sí |
| AssemblyAI Universal-3 | Buena (WER de 10-25%) | Cambio de código automático | Mixta | Sí (mejorada en 2026) |
| Google Cloud Chirp | Buena | Parámetro multilenguaje | Mixta | Sí |
Mi opinión: para contenido en Hinglish donde quieres una salida legible con escritura mixta, Deepgram Nova-3 multi es la mejor opción arquitectónica cuando la detección de idioma funciona correctamente. Para audio en hindi puro con requisitos estrictos de devanagari, Whisper large-v3 con language=hi explícito es confiable. AssemblyAI es la mejor elección cuando la prioridad es la diarización a través de los cambios de idioma.
Acentos regionales del hindi y precisión
La India tiene decenas de acentos regionales del hindi, cada uno con patrones fonéticos distintos que los motores de IA manejan de manera diferente:
Hindi de Delhi/NCR (urbano, con mucha mezcla de inglés): Es el mejor representado en los datos de entrenamiento. Es lo más cercano a lo que se prueba en los benchmarks.
Hindi de Bombay (Bambaiya): La fonología marati influye en las consonantes retroflejas y la longitud vocálica. «Bhai» se convierte en un marcador social distintivo. La precisión es menor que la del hindi de Delhi, pero razonable en los motores principales.
Hindi influido por Lucknow/Awadhi: Fonología más formal, tratamiento distinto de la «l» frente a la «r», vocabulario de registro elevado. Por lo general, se maneja bien.
Hindi influido por el bhojpuri (Bihar, este de Uttar Pradesh): El hindi influenciado por el bhojpuri es bastante diferente fonológicamente. Sus patrones de retención del schwa difieren del hindi estándar. La precisión baja notablemente.
Hindi del sur de la India (con fuerte acento tamil, telugu o canarés): La transferencia fonológica desde las lenguas dravídicas es significativa. Se ven afectadas las distinciones entre consonantes retroflejas y dentales. Esta es la categoría que más necesita revisión posterior en cualquier motor.
Sobre el contenido específico en bhojpuri, magahi, maithili, marwari o awadhi como idiomas (no acentos): son idiomas distintos, no acentos regionales del hindi. Transcribirlos con un modelo de hindi producirá resultados degradados y no es un caso de uso admitido en ningún motor importante.
Registros de formalidad y a qué afectan
El hindi tiene dos niveles honoríficos que afectan la conjugación verbal, los pronombres y el vocabulario:
- Aap (आप): el «usted» formal de tercera persona, usado con mayores y desconocidos
- Tum (तुम): intermedio, usado con iguales
- Tu (तू): íntimo, usado con amigos cercanos y niños (o como insulto hacia extraños)
Estas distinciones afectan el vocabulario alrededor de los verbos (करते हैं frente a करते हो frente a करता/करती है) y generan textos de transcripción diferentes. Un motor de transcripción que normalice estas distinciones a una única forma pierde significado social.
De manera más práctica: el habla formal (noticias, conferencias, discursos) y el habla informal (notas de voz de WhatsApp, pódcasts casuales) tienen proporciones de Hinglish muy diferentes. El habla formal tiende al hindi puro u a oraciones completas en inglés. El habla informal es la de mayor densidad de Hinglish.
Casos de uso reales de la transcripción de hindi
Los creadores indios de pódcasts y YouTube son el caso de uso de mayor volumen. La escena de pódcasts de India figura entre las de mayor crecimiento global. Los presentadores alternan entre hindi e inglés dentro de los episodios y a veces dentro de las mismas oraciones. La necesidad práctica son notas de programa y marcadores de capítulos legibles que coincidan con cómo lee realmente la audiencia, es decir, Hinglish con escritura mixta.
Las redacciones en hindi que transcriben discursos políticos y entrevistas en panel necesitan salida en devanagari que pase directamente a artículos en hindi. Aquí importa la diarización de hablantes, porque los programas de panel tienen de 3 a 6 hablantes.
Atención al cliente y centros de llamadas que procesan llamadas de clientes en hindi o Hinglish necesitan salida en alfabeto latino (o devanagari, según el sistema CRM) y etiquetas de hablante que distingan al agente del cliente. Este es un caso de uso de aprendizaje automático en crecimiento, con empresas que ajustan modelos específicamente con Hinglish de centros de llamadas.
La transcripción legal y académica en hindi formal necesita devanagari preciso con manejo correcto de matras y consonantes conjuntas, ya que el resultado suele incorporarse a registros oficiales.
El contenido educativo (clases, videos de formación) abarca todo el espectro, desde hindi puro hasta Hinglish, dependiendo de la institución y la materia.
Si solo necesitas una transcripción limpia sin construir un flujo propio, la herramienta de audio a texto de ConvertAudioToText maneja el hindi con salida en devanagari y mezcla de Hinglish. El plan gratuito cubre 10 minutos de transcripción, otorgados una sola vez al registrarte y no cada mes, suficiente para probar tu audio concreto antes de comprometerte.
Consejos que de verdad importan para el audio en hindi
Configura el idioma explícitamente. No confíes en la detección automática para el hindi. El idioma es fonológicamente parecido al urdu, y algunos detectores automáticos envían erróneamente el audio en hindi al urdu, produciendo salida en escritura nastaliq que resulta ilegible para quienes leen devanagari.
Elige tu modo según la necesidad de salida. Si tu sistema posterior solo necesita devanagari, usa language=hi y acepta la transliteración del Hinglish totalmente en devanagari. Si necesitas salida legible con escritura mixta, usa un modo multilingüe.
Usa vocabulario personalizado para nombres propios indios. Los nombres personales indios tienen enorme variación ortográfica: «Priya» frente a «Priyaa», «Suresh» frente a «Suresh Kumar». Los topónimos difieren de sus versiones romanizadas. Un glosario ayuda considerablemente.
El ruido de fondo es un problema real en el audio indio, especialmente en contenidos grabados en mercados al aire libre, oficinas concurridas o entornos callejeros. Esto afecta por igual a todos los motores y es la palanca de precisión más grande fuera de la elección del motor.
No uses modelos de hindi para contenido en bhojpuri o marwari. El modelo hará su mejor esfuerzo y fracasará. Son idiomas separados.
Comparación de herramientas para flujos de trabajo en hindi
| Herramienta | Plan gratuito | Precio de pago | Manejo del Hinglish | Resumen de IA en hindi |
|---|---|---|---|---|
| ConvertAudioToText | 10 minutos gratis, una sola vez | $9.99/mes ilimitado | Escritura mixta | Sí (Hinglish) |
| Otter.ai | 300 min/mes | $8.33/mes anual (1,200 min) | Solo latino | Solo inglés |
| Sonix | Ninguno (prueba) | $10/hora o $5/hora + $22/usuario/mes | Nativo | No |
| Google Cloud STT | 60 min/mes (Chirp) | Medido por minuto | Parámetro multilenguaje | No |
Nota sobre Otter: el plan gratuito de 300 minutos es generoso, pero Otter transcribe audio en hindi solo en alfabeto latino y genera resúmenes en inglés independientemente del idioma del audio. Para los creadores indios que publican contenido para audiencias de habla hindi, eso es un desajuste de flujo de trabajo, no una limitación menor.
Los costos ocultos de los servicios de transcripción cubren qué vigilar más allá de los precios de portada, incluidas las tarifas por puesto y las limitaciones de exportación.
Preguntas frecuentes
¿Transcribe Whisper el Hinglish en escritura mixta?
No por defecto. Cuando configuras language=hi, Whisper transcribe todo en devanagari, incluidas las palabras inglesas y los préstamos lingüísticos. Palabras en inglés como «meeting» aparecen como «मीटिंग». No existe un parámetro estándar de la API para cambiar esto. Un modelo ajustado por la comunidad (Whisper-Hinglish de Trelis Research) añade un modo de cambio de código, pero no forma parte de la API oficial de Whisper.
¿Cuál es la diferencia entre el hindi y el Hinglish para efectos de transcripción?
El hindi es la lengua estándar, escrita en devanagari, con vocabulario derivado del sánscrito para los registros formales. El Hinglish es hindi hablado que mezcla palabras y frases en inglés dentro de las oraciones, lo que obliga al motor a decidir palabra por palabra en qué escritura debe emitir el resultado. La dificultad es que no existe una regla fija: «meeting» puede aparecer legítimamente como «मीटिंग» o como «meeting» en un documento en hindi, según el estilo editorial de cada publicación. Esta ambigüedad explica por qué la transcripción del Hinglish varía tanto entre motores.
¿Pueden los motores de IA manejar los acentos del sur de la India en hindi?
Sí, pero la precisión disminuye en comparación con el hindi de Delhi o Bombay. La transferencia fonológica desde las lenguas dravídicas (tamil, telugu, canarés, malayalam) hacia el hindi produce patrones de consonantes retroflejas y longitudes vocálicas distintos de la distribución de entrenamiento de la mayoría de los modelos de hindi. Espera más trabajo de revisión en ese tipo de contenido, independientemente del motor que uses.
¿Está disponible la diarización de hablantes para contenido en hindi?
Sí, en Deepgram Nova-3, AssemblyAI Universal-3 y Google Cloud STT. AssemblyAI amplió específicamente la diarización de hablantes en hindi durante 2025-2026. Las entrevistas formales de dos personas suelen producir una diarización mejor que los debates de varios participantes con habla superpuesta, algo cierto para todos los idiomas, no solo para el hindi.
¿Cómo transcribo audio en bhojpuri o marwari?
No puedes usar de forma fiable un modelo de transcripción de hindi para contenido en bhojpuri, marwari, magahi o maithili. Son idiomas separados con fonología propia. Ningún motor comercial importante incluye el bhojpuri como idioma compatible a mediados de 2026. Si necesitas transcripción de bhojpuri, el camino práctico es la transcripción humana realizada por un especialista. Usar un modelo de hindi producirá, en el mejor de los casos, un resultado parcial y lleno de errores.
Fuentes
- Resumen de modelos e idiomas de Deepgram: https://developers.deepgram.com/docs/models-languages-overview
- Documentación de cambio de código multilingüe de Deepgram: https://developers.deepgram.com/docs/multilingual-code-switching
- Entrada del blog de Deepgram sobre Nova-3 Multilingual: https://deepgram.com/learn/nova-3-multilingual-major-wer-improvements-across-languages
- Discusión de GitHub de Deepgram sobre Nova-3 hindi-inglés: https://github.com/orgs/deepgram/discussions/1208
- Documentación de idiomas compatibles de AssemblyAI: https://www.assemblyai.com/docs/supported-languages
- Anuncio de Universal-3 Pro de AssemblyAI: https://www.assemblyai.com/blog/introducing-universal-3-pro
- Precios de Otter.ai: https://otter.ai/pricing
- Precios de Sonix: https://sonix.ai/pricing
- Precios de ConvertAudioToText: https://convertaudiototext.com/pricing
- Discusión sobre la escritura del hindi en Whisper: https://github.com/openai/whisper/discussions/1662
- Modelo Whisper-Hinglish ajustado: https://trelis.substack.com/p/whisper-hinglish
- Datos sobre la prevalencia del Hinglish: https://www.gan.studio/blog/posts/the-prevalence-of-hinglish-in-urban-india-a-data-driven-exploration
- OriserveAI Whisper-Hindi2Hinglish: https://github.com/OriserveAI/Whisper-Hindi2Hinglish
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.