
Guía de transcripción en tailandés: escritura, tonos y realidad del ASR (2026)
Summarize this article with:
La transcripción en tailandés funciona bien para el tailandés central (estándar de Bangkok) en los motores comerciales modernos, pero la mecánica de la escritura, la ambigüedad tonal y la segmentación de palabras sin espacios crean desafíos que las herramientas genéricas gestionan de forma inconsistente. Los motores especializados en tailandés como iApp Technology superan al Whisper base en contenido dialectal. Las variedades regionales (Lanna, isan, tailandés sureño) son considerablemente más difíciles y la mayoría de las grandes plataformas occidentales reconocen una menor precisión para ellas. Esta guía cubre la mecánica del idioma, benchmarks honestos de los motores y flujos de trabajo prácticos para contenido en tailandés en 2026.
La transcripción en tailandés funciona para la mayoría del audio en tailandés central en los motores comerciales modernos. Lo que obtienes de una herramienta bien soportada es escritura tailandesa correcta con los signos tonales intactos. Llegar ahí requiere entender tres propiedades específicas del idioma que ningún otro gran idioma del sudeste asiático combina de esta manera: una escritura sin espacios, un sistema de cinco tonos codificado tanto en signos explícitos como en la clase consonántica, y un sistema de registro donde las partículas de cortesía cambian el carácter de cada enunciado.
Escritura tailandesa: lo que el motor debe manejar
La escritura tailandesa (อักษรไทย) es un abugida de izquierda a derecha con 44 consonantes, 15 símbolos vocálicos básicos, cuatro signos tonales y sin espacios entre palabras. Los símbolos vocálicos se colocan encima, debajo, antes, después o alrededor de la base consonántica. Los signos tonales van encima de la pila consonántica. Esto difiere de los alfabetos latinos en aspectos que importan para el ASR:
Una frase como «quiero comer arroz» se escribe «ผมอยากกินข้าว» como una cadena continua de caracteres. El motor debe generar caracteres Unicode tailandeses en el orden correcto, con la posición vocálica correcta y los signos tonales correctos. Una herramienta que romaniza la salida («phom yak gin khao») produce texto sugerente fonéticamente pero inutilizable para lectores tailandeses. La salida en escritura nativa es el requisito básico para cualquier flujo de trabajo serio en tailandés.
Las consonantes en tailandés pertenecen a una de tres clases (alta, media, baja), y la clase determina el tono predeterminado de una sílaba antes de aplicar cualquier signo tonal explícito. Los signos tonales explícitos (mai ek ่, mai tho ้, mai tri ๊, mai chattawa ๋) modifican aún más el tono dentro de esa regla de clase. Este sistema en capas significa que el tono es en parte estructural y en parte explícito, lo cual difiere de un idioma tonal como el mandarín, donde los signos tonales siempre son diacríticos sobre las vocales.
El sistema de cinco tonos y el ASR
El tailandés tiene cinco tonos: medio, bajo, descendente, alto y ascendente. El tono de una sílaba no es solo un diacrítico; lo determina la interacción entre la clase consonántica, la longitud de la vocal, la estructura silábica y cualquier signo tonal explícito. La palabra «ข้าว» (khâo, arroz) y «เข้า» (khâo, entrar) suenan idénticas; el significado proviene del contexto circundante y de la composición de caracteres.
Para el ASR, esto crea un problema de discriminación. El motor escucha un contorno de tono y debe emparejarlo con la secuencia de caracteres portadora del tono correcta. En audio limpio de estudio, los motores modernos lo manejan bien para el tailandés central estándar. En audio ruidoso, con hablantes superpuestos o en habla informal donde los tonos se reducen, es más probable que haya errores en la elección de los caracteres portadores del tono.
La buena noticia: cuando los motores comerciales generan escritura tailandesa nativa, los signos tonales aparecen correctamente para los caracteres que generan. El problema es si los caracteres en sí son correctos, no si los signos están bien colocados.
Segmentación de palabras: el problema acumulativo
La ausencia de espacios entre palabras es el desafío estructural que hace que el tailandés sea más difícil de posprocesar que cualquier idioma delimitado por espacios. Un sistema ASR debe reconocer simultáneamente fonemas, mapearlos a caracteres tailandeses y decidir dónde caen los límites de palabra.
Los errores se acumulan en dos direcciones. Si el motor oye mal una sílaba, puede seleccionar una secuencia de caracteres que cambia dónde termina una palabra válida. Si la segmentación es incorrecta, las herramientas posteriores (corrección ortográfica, extracción de palabras clave, indexación de búsqueda) operan sobre unidades de tokens incorrectas.
La escritura tailandesa estándar sí usa espacios, pero marcan límites de frase, no límites de palabra. Dentro de una frase, las palabras van juntas. Los lectores dependen del contexto y del conocimiento léxico para analizar correctamente. Los motores replican este proceso usando una combinación de modelado acústico y priors de modelo de lenguaje entrenados en grandes corpus tailandeses.
Para lectura y publicación, obtienes una salida que parece texto tailandés normal; la convención sin espacios es lo que esperan los lectores tailandeses. Para tareas posteriores de PLN (indexación de búsqueda, análisis de sentimiento, pipelines de procesamiento de lenguaje), necesitas marcadores explícitos de límites de palabra, lo que requiere una herramienta separada de segmentación de palabras tailandesas como PyThaiNLP aplicada a la salida de la transcripción.
Registro y partículas de cortesía
El tailandés tiene un sistema formal de registro expresado en parte mediante partículas de cortesía al final de la oración. Los hombres usan ครับ (khráp) al final de las oraciones; las mujeres usan ค่ะ (khâ, tono descendente) en afirmaciones y คะ (khá, tono alto) en preguntas. Omitir estas partículas desplaza el habla hacia un registro casual o incluso grosero según el contexto. El contenido formal y público en tailandés casi siempre las incluye.
Para la transcripción, estas partículas importan porque aparecen con frecuencia, a menudo varias veces por minuto en el habla cortés, y llevan distinciones tonales propias. ค่ะ y คะ difieren solo por tono y contexto; usar la equivocada es un error de registro. Los motores entrenados en corpus formales tailandeses las manejan bien. Los motores con datos de entrenamiento tailandeses más escasos pueden confundirlas u omitirlas.
El tailandés técnico y empresarial también contiene grandes cantidades de préstamos del inglés adaptados fonológicamente a la pronunciación tailandesa. «Schedule» se convierte en una adaptación a la fonología tailandesa; los nombres de marca aparecen en caracteres tailandeses o se dejan en inglés según el hablante. Los motores modernos manejan razonablemente bien la alternancia de código: las palabras tailandesas vuelven en escritura tailandesa y las inserciones en inglés vuelven en inglés. Verifica esto en tu audio específico antes de comprometerte con un flujo de trabajo.

La realidad dialectal
El tailandés central (estándar de Bangkok, usado en medios, educación y gobierno) es la variedad con la que la mayoría de los motores fueron entrenados y en la que rinden mejor. Tres variedades regionales principales son considerablemente diferentes:
Tailandés del norte (Lanna / Kammeuang): A veces clasificado como idioma separado. Tiene un inventario tonal diferente y vocabulario distintivo. Los datos de entrenamiento para ASR específico de Lanna son limitados. Una investigación publicada a principios de 2026 (MDPI Applied Sciences) desarrolló un sistema de reconocimiento de voz para el dialecto del tailandés del norte precisamente porque los motores de propósito general entrenados con tailandés central rinden mal con él.
Tailandés del noreste (Isan): Estrechamente relacionado con el lao. Los resultados benchmark de Typhoon ASR (un modelo especializado en tailandés) muestran aproximadamente 10-11% de tasa de error de caracteres en contenido isan incluso con un modelo dedicado. Los motores comerciales occidentales de propósito general probablemente sean peores. La similitud isan-lao también significa que la autodetección de idioma puede clasificar erróneamente grabaciones isan como lao.
Tailandés sureño (Pak Tai): Contornos tonales distintos del tailandés central. La población de hablantes más pequeña significa menos datos de entrenamiento en la mayoría de los modelos.
Para contenido en dialectos regionales, la línea base honesta es: tailandés central, bien. Variedades regionales, variable, y deberías probar con una muestra corta antes de comprometerte con un flujo de trabajo. Esto no es un problema de escasez de datos de entrenamiento a la escala de los idiomas africanos de bajos recursos (consulta por qué la IA tiene dificultades con los idiomas de bajos recursos para esa comparación); es un problema de divergencia dialectal con una mayoría subrepresentada.
Cómo manejan el tailandés los grandes motores en 2026
La tabla siguiente refleja información actual verificada de la documentación de los proveedores y benchmarks independientes. No se listan porcentajes de precisión por herramienta para tu audio específico porque ningún benchmark único cubre todas las variaciones (calidad de audio, dialecto, dominio, número de hablantes) que determinan la precisión real.
| Herramienta | Salida en escritura tailandesa | Modelo de soporte del tailandés | Plan gratuito | Modelo de precios |
|---|---|---|---|---|
| Deepgram Nova-3 | Sí | Nova-3 (69% de reducción de WER frente a Nova-2 según Deepgram) | Nivel gratuito limitado | Pago por minuto, niveles por volumen |
| AssemblyAI Universal-2 | Sí | Universal-2 («buena precisión»: nivel de 10-25% de WER según su documentación) | Limitado | Pago por minuto |
| iApp Technology (específico para tailandés) | Sí | iApp ASR Pro (91.23% de precisión de palabras en Common Voice 17) | 60 créditos gratuitos | Basado en créditos: 1-2 IC/minuto |
| Notta | Sí | No revelado (modelo de 58 idiomas) | 120 min/mes, máx. 3 min por grabación | Pro a $13.99/mes; gratis $0 |
| Otter.ai | No | No admitido | 600 min/mes (solo inglés) | Pro a $8.33/mes (anual) |
| Whisper large-v3 base | Sí | 18-26% de CER (Tier-3 según benchmarks independientes) | Solo autoalojado | Coste de cómputo |
Algunas notas sobre lo que muestra la tabla:
Otter no admite el tailandés. Si un flujo de trabajo depende de Otter, el contenido en tailandés necesita una herramienta aparte.
iApp Technology es un proveedor especializado en tailandés con un benchmark de precisión publicado sobre un conjunto de datos estándar. Su modelo de precios basado en créditos (1 IC/minuto en el plan base, 2 IC/minuto en Pro; aproximadamente 53-107 THB por hora en tarifas por volumen, más 7% de IVA) es el modelo relevante para el uso profesional tailandés de alto volumen en Tailandia. Las cuentas nuevas reciben 60 créditos gratuitos.
La expansión de Nova-3 de Deepgram al tailandés es su mejora más reciente, con una reducción relativa de WER del 69% frente a Nova-2 en modo streaming. El streaming es el benchmark más exigente, así que la mejora es real aunque el punto de partida absoluto fuera alto.
El Whisper large-v3 base fue evaluado de forma independiente con un 18-26% de CER para tailandés, una degradación significativa comparado con el inglés. Las variantes Whisper tailandesas ajustadas (como Typhoon Whisper large-v3) pueden alcanzar un 4-6% de CER en benchmarks estándar con una curación de datos adecuada, pero necesitas un modelo ajustado, no el modelo base.
Para una visión más amplia de cómo se comparan los motores en precios, consulta la comparación de precios de APIs de voz a texto.
Flujos de trabajo prácticos para contenido en tailandés
Configurar el idioma explícitamente: Especifica siempre tailandés (th o th-TH según la API). La autodetección hace más probable la confusión isan/lao y añade un paso de procesamiento con su propia tasa de error.
Proporcionar contexto de nombres propios donde la herramienta lo permita: Los nombres de personas tailandeses, los nombres de distritos de Bangkok, los nombres de empresas tailandesas y los nombres de provincias se transcriben como escritura tailandesa por la mayoría de los motores. Si tu plataforma admite un glosario o un prompt de palabras clave, aliméntalo con los nombres que aparecen con frecuencia. Los nombres tailandeses en contexto romanizado (p. ej., en correos electrónicos que citas) pueden necesitar una pasada de revisión.
Para tailandés técnico y científico: Muchos términos son préstamos del inglés que los hablantes tailandeses pronuncian con fonología tailandesa. El motor puede devolverlos en escritura tailandesa fonologizada, en inglés o de forma inconsistente. Una pasada de revisión terminológica es práctica estándar.
Para entrevistas con varios hablantes tailandeses: La precisión de la diarización de hablantes para tailandés formal de dos hablantes es razonable en los motores comerciales. La conversación casual con habla superpuesta y hablantes isan o del sur es más difícil. Considera grabar con micrófonos separados si la calidad de la diarización importa. Para más sobre flujos de entrevista, consulta cómo transcribir una grabación de entrevista.
Para subtítulos SRT: El Unicode tailandés se renderiza correctamente en YouTube, Vimeo y la mayoría de las plataformas de video modernas. Exporta el SRT desde tu herramienta de transcripción y súbelo directamente. El generador de subtítulos maneja la escritura tailandesa en el archivo de salida. La ubicación de los saltos de línea es automática y sigue la estructura de frases tailandesa.
Para notas de programas de podcast: La salida de resúmenes con IA en tailandés varía significativamente según la herramienta. Las herramientas que ejecutan su resumen sobre una transcripción en tailandés pueden devolver marcadores de capítulos y citas destacadas en tailandés si su modelo de resumen admite el tailandés. Vale la pena probarlo específicamente porque algunas herramientas que transcriben tailandés resumen solo en inglés. Para flujos específicos de podcast, consulta la mejor transcripción para podcasts.
Mi opinión: para la mayoría del trabajo de producción de contenido en tailandés, la elección está entre un proveedor especializado en tailandés (iApp para tailandés profesional de alto volumen en Tailandia, precios basados en créditos, benchmarks conocidos) y una API comercial multilingüe (Deepgram Nova-3 o AssemblyAI Universal-2, mejor para flujos multilingües o cuando también necesitas inglés y otros idiomas en el mismo pipeline). El Whisper base por sí solo no es la herramienta adecuada para la transcripción profesional en tailandés dados los benchmarks de 18-26% de CER.
Si necesitas una transcripción limpia en tailandés sin integración de API ni configuración de bot de reuniones, ConvertAudioToText procesa archivos de audio en tailandés directamente con salida en escritura nativa.
FAQ
¿Otter.ai admite la transcripción en tailandés?
No. Otter solo transcribe en inglés, español, francés, alemán, japonés y chino. El tailandés no es un idioma admitido en ningún plan de Otter hasta mediados de 2026.
¿Por qué la salida del ASR en tailandés a veces no respeta los límites de palabra?
El tailandés se escribe sin espacios entre palabras. Los motores ASR deben aplicar un paso de segmentación de palabras sobre el reconocimiento de voz. Los errores se acumulan: una sílaba mal entendida desplaza dónde el tokenizador coloca los límites, y unos límites incorrectos cambian el significado de las palabras. Los motores bien entrenados manejan bien el tailandés estándar; los menos entrenados producen cadenas continuas que requieren limpieza manual.
¿Los motores de IA conservan los signos tonales tailandeses en la salida de la transcripción?
Los motores comerciales que generan escritura tailandesa nativa generalmente conservan los signos tonales porque generan directamente caracteres Unicode tailandeses en lugar de representaciones fonéticas. El riesgo aparece cuando una herramienta produce una transliteración romanizada en lugar de escritura tailandesa: esa representación pierde toda la información tonal y no resulta útil para lectores tailandeses.
¿Qué tan precisa es la transcripción en tailandés para dialectos regionales como el tailandés del norte o el isan?
Considerablemente menos precisa que el tailandés central. Los benchmarks de investigación muestran que el ASR del isan arroja aproximadamente 10-11% de tasa de error de caracteres incluso con modelos especializados, y el tailandés del norte (Lanna) cuenta con un conjunto limitado de datos de entrenamiento, lo que significa que la mayoría de los motores fueron entrenados principalmente con tailandés central. Espera una precisión entre 5 y 15 puntos porcentuales menor en las variedades regionales en comparación con el habla estándar de Bangkok.
¿Con qué idiomas confunden comúnmente los motores de transcripción de IA al tailandés?
El lao es el objetivo de confusión más frecuente. El tailandés y el lao comparten similitudes significativas de escritura y solapamiento fonológico. La detección automática puede etiquetar erróneamente el tailandés del noreste (isan), estrechamente relacionado con el lao, como audio en lao. Configura siempre el idioma explícitamente como tailandés en lugar de usar la autodetección para contenido en tailandés.
Fuentes
- Precios de Otter.ai, detalles de planes e idiomas admitidos verificados en julio de 2026
- Precios de Notta, detalles del plan gratuito y del plan Pro
- Precios de iApp Technology, niveles de precios por crédito
- iApp SpeechFlow, benchmarks de precisión en Common Voice 17
- Idiomas admitidos de AssemblyAI, clasificación por niveles del idioma tailandés
- Expansión de Deepgram Nova-3 a Asia-Pacífico, afirmaciones de mejora de WER en streaming para tailandés
- Precisión de Whisper por idioma (novascribe), benchmarks de CER Tier-3 para tailandés
- Typhoon ASR (arxiv), benchmarks de CER para isan y dialectos
- MDPI Applied Sciences, ASR del dialecto del tailandés del norte, investigación específica de Lanna 2026
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.