Transcripción del vietnamita: seis tonos, precisión real
transcripciónvietnamitaidiomas

Transcripción del vietnamita: seis tonos, precisión real

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

La transcripción del vietnamita es más difícil que la de la mayoría de los idiomas con alfabeto latino porque su ortografía codifica seis tonos distintos mediante diacríticos superpuestos, y un solo signo omitido cambia por completo el significado de la palabra. El vietnamita del norte (estándar de Hanói) recibe la mejor cobertura de IA; el vietnamita central (Hué, Da Nang) es el dialecto más difícil para los modelos actuales. Deepgram Nova-2 y Nova-3, OpenAI Whisper y AssemblyAI Universal incluyen el vietnamita entre sus idiomas compatibles, pero la precisión con audio no norteño se sitúa en un nivel inferior al del francés o el español. Si necesitas transcripciones limpias y con diacríticos del vietnamita, elige una herramienta que indique explícitamente su compatibilidad con este idioma, configura manualmente el código de idioma y reserva más tiempo de posedición para el audio del dialecto central que para grabaciones con el estándar de Hanói.

Obtener una transcripción limpia del vietnamita significa obtener las marcas tonales. Si omites un diacrítico, cambias la palabra: «ma» (fantasma), «má» (madre), «mà» (pero), «mả» (tumba), «mã» (caballo) y «mạ» (brote de arroz) son seis palabras vietnamitas distintas diferenciadas únicamente por la marca tonal sobre la misma sílaba. No es un problema de formato, sino de significado, y es la razón por la que la transcripción del vietnamita resulta más difícil de lo que parece a primera vista para los sistemas de IA.

La salida en vietnamita incluye todos los diacríticos tonales
La salida en vietnamita incluye todos los diacríticos tonales

Esta guía aborda la ortografía, la brecha entre dialectos regionales, qué motores admiten realmente el vietnamita en 2026 y qué esperar de cada uno.

El sistema de seis tonos y por qué los diacríticos son fundamentales

El vietnamita se escribe en chữ Quốc Ngữ, un sistema de escritura basado en el alfabeto latino que se consolidó a principios del siglo XX. Codifica seis tonos fonémicos mediante un sistema de diacríticos superpuestos: la sílaba sin marca lleva el tono llano (ngang) y los otros cinco tonos reciben cada uno una marca específica.

Los seis tonos:

  • ngang (llano, sin marca): «a» como en ma (fantasma)
  • sắc (agudo ascendente): «á» como en má (madre)
  • huyền (grave descendente): «à» como en mà (pero)
  • hỏi (descenso y ascenso): «ả» como en mả (tumba)
  • ngã (descenso con corte glotal): «ã» como en mã (caballo)
  • nặng (grave descendente pesado, punto debajo): «ạ» como en mạ (brote de arroz)

La ortografía se vuelve más densa cuando los diacríticos de calidad vocálica se superponen a las marcas tonales. El vietnamita tiene siete vocales modificadas: ă, â, ê, ô, ơ, ư y đ. Una vocal como «ă» puede llevar cualquiera de los seis tonos, lo que produce formas como ắ, ằ, ẳ, ẵ, ặ. Unicode las representa en forma precompuesta bajo la Forma de Normalización C, algo importante para la salida de transcripción: una herramienta que devuelva caracteres combinantes descompuestos en lugar de puntos de código precompuestos puede generar texto que se ve correcto en pantalla pero falla en procesos posteriores de tratamiento del texto.

A efectos de transcripción, lo esencial es que las marcas tonales no son puntuación opcional. Una transcripción que devuelve letras latinas sin tildes no es un borrador: es el texto equivocado.

Compatibilidad de los motores: menor que la de los idiomas de primer nivel

El vietnamita figura como idioma compatible en los principales motores:

  • OpenAI Whisper (incluido el modelo large-v3): incluye el vietnamita (vi) en su conjunto de idiomas compatibles.
  • Deepgram Nova-2 y Nova-3: ambos incluyen vi con soporte tanto en puntos de conexión por lotes como de streaming.
  • AssemblyAI Universal: incluye el vietnamita, con diarización de hablantes disponible.

Lo que significa «compatible» varía. La documentación de AssemblyAI sitúa el vietnamita en la banda de «buena precisión», que define como tasas de error de palabra superiores al 10 % y hasta el 25 %. Para comparar, el inglés se sitúa por debajo del 10 % de WER. El vietnamita es un idioma con menos recursos en términos de datos de entrenamiento, y la expectativa honesta es que la precisión con el vietnamita sea considerablemente menor que con el francés, el español o el alemán, especialmente con audio no estándar.

Otter.ai no admite el vietnamita. Sus idiomas compatibles, a fecha de 2026, son inglés, español, francés, alemán, japonés y chino (simplificado). Cualquier herramienta que publique cifras de precisión de Otter para el vietnamita está inventando números.

Para una visión más amplia de cómo varía la compatibilidad de los motores entre idiomas, consulta por qué la IA tiene dificultades con los idiomas con pocos recursos.

Norte, sur y centro: la brecha en los datos de entrenamiento

Vietnam tiene tres grandes grupos de dialectos regionales, y la cobertura de IA es desigual entre ellos.

Vietnamita del norte (estándar de Hanói)

Es el dialecto que domina los medios de comunicación, la educación formal y los contenidos gubernamentales, y representa la mayor parte de los datos de entrenamiento para la transcripción del vietnamita. Los seis tonos son acústicamente claramente distinguibles en el vietnamita del norte. La precisión de la IA es máxima con el audio en el estándar de Hanói. Si transcribes contenidos formales de radio o televisión de VTV o discurso empresarial formal de hablantes afincados en Hanói, estás trabajando con el dialecto para el que la IA fue diseñada.

Vietnamita del sur (Ciudad Ho Chi Minh, delta del Mekong)

La principal diferencia del vietnamita del sur es la fusión hỏi/ngã. En el sur, ambos tonos se realizan como un simple tono descendente grave sin la interrupción glotal que distingue ngã en el norte. La lengua escrita sigue exigiendo ambas marcas tonales en sus respectivas posiciones, pero la distinción acústica que ayuda a una IA a asignarlas ha desaparecido. La precisión con el vietnamita del sur suele ser menor que con el del norte, en particular para distinguir ả y ã. Las investigaciones sobre conjuntos de datos de ASR vietnamita también han documentado que el vietnamita del sur está infrarrepresentado en los corpus de entrenamiento en comparación con el del norte e incluso con el del centro, lo que agrava el problema.

Vietnamita central (Hué, Da Nang, Quảng Trị)

El vietnamita central es el dialecto más desafiante para los sistemas de IA actuales. Conserva distinciones consonánticas que el vietnamita del norte ha fusionado, incluidas tr/ch, s/x y d/gi/r. Sus realizaciones tonales difieren tanto de las formas estándar del norte como del sur, con caídas de tono drásticas y una cualidad de voz aspirada ausentes del dialecto con el que la IA aprendió principalmente. El dialecto de Hué también conserva vocabulario ausente de la mayoría de los datos de entrenamiento: «mô» por «đâu» (dónde), «răng» por «sao» (por qué). Reserva más tiempo de posedición para el audio en vietnamita central que para cualquier otra variedad regional.

Diacríticos y codificación ortográfica: qué puede salir mal

Como los caracteres vietnamitas implican superposición, la representación Unicode importa en la práctica. Un carácter como «ộ» (la vocal ô con el punto del nặng debajo) es un único punto de código precompuesto (U+1ED9) bajo la normalización NFC. Los motores que devuelven la secuencia descompuesta (o + circunflejo combinante + punto debajo combinante) pueden causar problemas en editores, bases de datos y canalizaciones de exportación que esperan NFC. Al evaluar un motor, pruébalo con un pasaje vietnamita conocido e inspecciona la salida bruta para verificar la forma de normalización, no solo el resultado mostrado en pantalla.

Un segundo problema práctico: algunas herramientas antiguas eliminan por completo los diacríticos para evitar problemas de codificación y devuelven salida ASCII plana. Eso no es una transcripción, sino una pista fonética. Cualquier motor que uses para contenido en vietnamita debe devolver salida diacritizada de forma predeterminada.

Alternancia de códigos: vietnamita-inglés en los negocios y la tecnología

La alternancia de códigos entre vietnamita e inglés está muy extendida en el habla tecnológica y empresarial vietnamita. Frases como «Tôi đang work on a project mới» son habituales en entornos de startups, y el patrón está bien documentado en investigaciones sociolingüísticas sobre la comunicación de oficina vietnamita y las comunidades de la diáspora. El cambio ocurre porque el vocabulario técnico en inglés (email, deadline, meeting, server) no tiene un equivalente vietnamita natural o simplemente resulta más rápido en contexto.

Para la transcripción, esto crea un problema de dos idiomas: el motor debe manejar los diacríticos vietnamitas en las partes en vietnamita y el inglés estándar en las inserciones, dentro de la misma emisión. Los motores modernos que admiten explícitamente el vietnamita suelen gestionarlo mejor que las herramientas dominadas por el inglés que intentan detectar el vietnamita automáticamente, porque la detección de idioma a nivel de emisión falla con frecuencia en el habla mixta.

Para consejos sobre cómo manejar audio en varios idiomas, consulta cómo corregir la alternancia de códigos multilingüe en las transcripciones.

Entre los hablantes vietnamitas mayores educados antes de 1975 también existe la alternancia de códigos entre vietnamita y francés, en particular en la comunidad de la diáspora en Francia y entre residentes mayores de contextos profesionales de la época de Saigón. El volumen de estos contenidos es menor, y la compatibilidad de los motores con la mezcla vietnamita-francés está menos probada.

Consejos prácticos para mejorar la transcripción del vietnamita

  1. Configura explícitamente el código de idioma en vi. La detección automática en canales con contenido mixto a veces opta por defecto por el chino u otros idiomas del sudeste asiático, especialmente en clips de audio cortos.
  2. Graba sin ruido de fondo. Los tonos del vietnamita se realizan como contornos de tono que abarcan toda la sílaba. El ruido degrada directamente la detección de tono, lo que degrada la recuperación de los tonos. Esto importa más para el vietnamita que para los idiomas no tonales.
  3. Proporciona una lista de vocabulario con nombres y lugares antes de subir el archivo si tu herramienta admite vocabulario personalizado. Los nombres personales y topónimos vietnamitas (Hà Nội, TP HCM, Đà Nẵng, Nguyễn Văn An) con los diacríticos correctos dan al motor un ancla para decisiones de transcripción localmente ambiguas.
  4. Verifica de inmediato la salida de diacríticos. Revisa el primer párrafo de cualquier transcripción en vietnamita en busca de marcas tonales ausentes o incorrectas antes de fiarte del resto.
  5. Espera más correcciones en el audio en vietnamita central. Planifica de 3 a 5 pasadas de edición adicionales en grabaciones de hablantes de Hué o Da Nang en comparación con contenidos en el estándar de Hanói.

Para una guía más amplia sobre la precisión de la IA entre idiomas y dialectos, consulta precisión de la transcripción explicada.

Comparación de herramientas de transcripción del vietnamita

La tabla siguiente se basa en precios verificados de los sitios de los proveedores a julio de 2026. La precisión se describe de forma cualitativa, no como porcentajes inventados, porque ningún proveedor publica benchmarks de WER específicos para el vietnamita de estos productos.

HerramientaCompatibilidad con vietnamitaPlan gratuitoPrecio inicial
Herramientas basadas en Whisper (p. ej., CATT)Sí, vi compatible10 minutos gratis, una sola vezDesde 9,99 $/mes (ilimitado)
Deepgram (API)Sí, Nova-2 y Nova-3Pago por usoMedido, niveles por volumen
AssemblyAI (API)Sí, con diarizaciónPago por usoMedido
Happy ScribeSí, transcripción con IAPrueba de 10 minutosDesde 17 €/mes, 120 min
SonixSí, incluido en 54 idiomasPrueba de 30 minutos10 $/hora (pago por uso) o 22 $/usuario/mes + 5 $/hora
Otter.aiNo, sin compatibilidad300 min/mes16,99 $/mes (solo inglés/español/francés)

Para un desglose completo de los costes de transcripción por minuto y por suscripción, consulta comparación de precios de transcripción 2026. Si tu contenido en vietnamita es para un pódcast o una serie continua, mejor transcripción para pódcasts 2026 cubre consideraciones de flujo de trabajo.

Quién usa realmente la transcripción del vietnamita

Los creadores de contenido de la diáspora vietnamita en EE. UU. (en particular la comunidad de Little Saigon en California, la mayor comunidad vietnamita fuera del sudeste asiático) producen pódcasts en vietnamita, contenidos de entrevistas y grabaciones de archivos familiares. Para el público de la diáspora, la fidelidad de los diacríticos importa tanto porque la salida escrita debe ser legible en vietnamita estándar como porque omitir las marcas tonales cambia el significado del texto, no solo su apariencia.

Las redacciones vietnamitas usan la transcripción para acelerar los tiempos de entrega de entrevistas en medios impresos y digitales. Los educadores vietnamitas transcriben clases para material de cursos publicado. El denominador común es que todos estos casos de uso requieren salida diacritizada, no aproximaciones ASCII.

Para una visión más amplia de cómo funciona la diarización en contenido vietnamita con varios hablantes, consulta diarización de hablantes explicada.

Si necesitas una transcripción limpia del vietnamita y no necesitas funciones de bot de reuniones, ConvertAudioToText admite el vietnamita con salida diacritizada adecuada y un plan gratuito para probarlo con tu propio audio.

Preguntas frecuentes

¿La transcripción con IA conserva las marcas tonales del vietnamita?

Depende del motor. Los motores entrenados con texto vietnamita correctamente diacritizado, como Whisper y Deepgram Nova-2/3, devuelven las marcas tonales en su salida. Los motores que solo admiten una lista corta de idiomas (Otter, por ejemplo, que no admite el vietnamita en absoluto) no podrán procesarlo. Verifica siempre que la herramienta incluya el vietnamita como idioma compatible antes de subir tu archivo.

¿Qué dialecto regional del vietnamita es más difícil de transcribir para la IA?

El vietnamita central, especialmente el dialecto de Hué, es el más difícil. Sus realizaciones tonales difieren del estándar del norte que domina los datos de entrenamiento de la IA, conserva distinciones consonánticas fusionadas en el norte (tr/ch, s/x, d/gi/r) y utiliza vocabulario (mô, răng) ausente de la mayoría de los corpus de entrenamiento. Espera notablemente más errores en el vietnamita central que en grabaciones con el estándar de Hanói o de Ciudad Ho Chi Minh.

¿La fusión hoi-nga del vietnamita del sur provoca errores de transcripción?

Puede provocarlos. En el vietnamita del sur, los tonos hoi (descenso suave) y nga (descenso con corte glotal) se pronuncian casi de forma idéntica. Un motor que procesa el audio fonéticamente puede escribir la marca tonal equivocada, porque la señal acústica ya no los distingue. La forma escrita correcta utiliza ambos tonos, así que un motor bien entrenado debería aplicarlos según el contexto del vocabulario, pero es un punto débil conocido.

¿Cómo afecta a la calidad de la transcripción la alternancia de códigos entre vietnamita e inglés?

Los motores modernos suelen manejarla razonablemente bien: las palabras vietnamitas vuelven diacritizadas en vietnamita y las inserciones en inglés vuelven en inglés. El problema es que la alternancia de códigos es extremadamente común en el habla tecnológica y empresarial vietnamita, de modo que si el modelo vietnamita de un motor es débil, los fragmentos mixtos agravan la tasa de errores. Usa un motor que admita explícitamente el vietnamita, no solo una detección multilingüe dominada por el inglés.

¿Qué formatos de archivo y calidad de audio importan más para la transcripción del vietnamita?

Para un idioma tonal, el formato importa menos que la calidad del audio. Las marcas tonales del vietnamita dependen de contornos de tono sutiles, concretamente formas ascendentes, descendentes y glotalizadas que abarcan toda la sílaba. El ruido de fondo y la calidad del micrófono degradan directamente la recuperación de los tonos. Graba en un entorno silencioso, usa un micrófono dedicado si es posible y exporta el audio a 44,1 kHz o superior. Los formatos comunes (MP3, M4A, WAV, FLAC) funcionan todos con los principales motores.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles