Guía de transcripción del coreano: Hangul, honoríficos y Konglish
transcripcióncoreanoidiomas

Guía de transcripción del coreano: Hangul, honoríficos y Konglish

BMMamane B. MoussaMay 26, 2026Updated July 2, 202610 min read

Summarize this article with:

La versión corta

Para el coreano estándar de Seúl, tanto Deepgram Nova-3 como Whisper Large-v3 producen transcripciones precisas en Hangul con las terminaciones verbales correctas según el nivel de habla. Para el dialecto de jeju o contenido con mucha carga dialectal, solo los motores especializados nativos del coreano cubren bien esa brecha. Si necesitas una transcripción limpia sin bot de reuniones ni configuración de cuenta, ConvertAudioToText admite el coreano con etiquetas de hablante; una cuenta gratuita incluye 10 minutos de transcripción otorgados una sola vez al registrarte, y la exportación a SRT viene con un plan de pago o la prueba de 7 días.

La transcripción y la traducción del coreano son pasos separados con precisiones separadas
La transcripción y la traducción del coreano son pasos separados con precisiones separadas

Por qué la transcripción del coreano tiene su propia clase de problemas

El coreano no es difícil para la IA por su alfabeto. El Hangul es uno de los sistemas de escritura fonémicamente más regulares del mundo: cada bloque silábico codifica consonantes y vocales en un patrón fijo, y no existe la ambigüedad de caracteres que hace que la transcripción del chino sea un problema completamente distinto.

La verdadera dificultad es estructural y social:

El espaciado coreano es opcional y disputado. El término formal es 띄어쓰기 (tteui-eo-sseu-gi) y las reglas son genuinamente ambiguas incluso entre hablantes nativos. Los verbos auxiliares pueden escribirse unidos o separados; los sustantivos dependientes se escriben oficialmente separados, pero suelen escribirse unidos. En el habla no hay pausas que marquen estos límites, así que un motor de IA debe decidir dónde dividir las cadenas verbales aglutinantes. Deepgram ha documentado el espaciado de los sustantivos compuestos coreanos como uno de los "desafíos centrales" abordados en Nova-3. Los artículos de evaluación de Whisper usan la tasa de error de caracteres (CER) para el coreano en lugar de la tasa de error de palabras (WER), precisamente porque la segmentación de palabras es variable. Un motor que fusiona "받아도 돼요" en "받아도돼요" está produciendo una estructura gramatical diferente, no solo una preferencia de formato.

Los verbos coreanos codifican la jerarquía social. Acertar con las palabras no basta. Una transcripción que normaliza a todos a 해요체 cuando un hablante usó 하십시오체 y otro usó 해체 ha perdido información que un lector coreano usaría para reconstruir la relación entre los participantes. Consulta la sección de honoríficos más abajo.

Los préstamos lingüísticos viven en dos escrituras a la vez. Una conversación de negocios en coreano mezcla palabras inglesas renderizadas en Hangul (핸드폰, 카페, 아파트) con acrónimos y nombres de marca en alfabeto latino (PM, OKR, KPI, ChatGPT). Una transcripción correcta debe colocar cada término en la escritura adecuada, y esa correspondencia no se puede predecir solo desde la fonética: 컴퓨터 (computadora) aparece en Hangul, mientras que "IT" permanece en latín, porque así los escriben los coreanos.

El problema de los honoríficos y por qué importa para las transcripciones

El coreano tiene un sistema de niveles de habla llamado 존댓말 (jondaemal), distinto del vocabulario honorífico. Los niveles de habla se codifican en las terminaciones verbales e indican la relación del hablante con el oyente, no con el sujeto. Una transcripción en coreano debe reproducir las terminaciones verbales reales del hablante.

Los tres niveles aún comunes en el habla moderna:

  • 하십시오체 (hasipsio-che): Formal cortés. Estándar en noticieros, entrevistas de trabajo, ejército, presentaciones de negocios, industria de servicios y primeros encuentros con personas notablemente mayores en rango. Terminación verbal: -(으)십시오, -(으)ㅂ니다.
  • 해요체 (haeyo-che): Cortés informal. Es el predeterminado en la conversación diaria de adultos, la mayoría de las interacciones con clientes y los creadores de contenido dirigiéndose a su audiencia.
  • 해체 (hae-che): Informal. Se usa con amigos cercanos, pares de la misma edad y por adultos al dirigirse a niños.

Las demás formas, 하소서체 (formal alta arcaica), 하게체 (semiformal, hoy rara entre los hablantes jóvenes) y 해라체 (llana/narrativa, común en la narración escrita), aparecen con menos frecuencia en el habla, pero siguen cargando significado.

Por qué esto importa para la precisión de la transcripción: una transcripción de reunión de negocios que representa consistentemente las terminaciones 하십시오체 le dice a un lector coreano quién hablaba con quién, en qué calidad y con qué nivel de formalidad. Una transcripción que aplana todo a un solo nivel pierde eso. Whisper Large-v3 conserva los niveles de habla porque transcribe lo que se dijo en lugar de normalizar el registro. Deepgram Nova-3, entrenado específicamente con datos de emisiones y negocios coreanos, refleja de igual modo las terminaciones reales del hablante.

Niveles de soporte de los motores: lo que está verificado

Estos niveles reflejan lo que los proveedores han documentado o lo que evaluaciones independientes han publicado. No he inventado porcentajes de precisión.

Nivel 1: Soporte fuerte del coreano, mejoras documentadas

  • Deepgram Nova-3 (ko / ko-KR): Deepgram publicó una entrada de blog que documenta una reducción de hasta el 27% del WER respecto a Nova-2 para el coreano, citando la ambigüedad del espaciado en Hangul, la conjugación rápida y los bloques silábicos como los desafíos específicos abordados. Keyterm Prompting está disponible para el coreano, lo cual resulta útil para nombres de marca y vocabulario técnico. Nova-3 y Nova-2 admiten ambos los códigos de idioma ko y ko-KR.
  • OpenAI Whisper Large-v3: el coreano es uno de los idiomas mejor representados en los datos de entrenamiento de Whisper, y OpenAI usa CER (no WER) para sus pruebas comparativas del coreano. El lanzamiento de large-v3 mostró una reducción de errores del 10-20% respecto a large-v2 en todos los idiomas compatibles. Consulta el desglose de precios de la API de Whisper si estás decidiendo entre la API alojada y el autoalojamiento.

Nivel 2: Buena precisión, documentación específica del coreano limitada

  • AssemblyAI Universal-2: la documentación de AssemblyAI ubica al coreano en la banda de "buena precisión", definida como un WER superior al 10% y de hasta el 25%. La diarización y los capítulos automáticos funcionan para el coreano; el resumen basado en LeMUR en coreano depende del LLM subyacente, no de la capa de STT. El streaming en tiempo real para el coreano no está disponible actualmente.
  • Google Cloud Speech-to-Text (modelo Chirp): el coreano está entre los más de 125 idiomas compatibles. El precio de Chirp es por segundo, facturado en incrementos de 15 segundos, con una asignación gratuita mensual de 60 minutos. No hay un WER publicado para el coreano en Chirp. Lee el desglose completo de precios de Google Cloud STT antes de comprometerte a un volumen alto.

Nivel 3: Nativo del coreano, infraestructura de Corea

  • Naver Clova Speech: el modelo de Naver se entrena solo con datos en coreano, lo que le da ventaja en dialectos regionales y habla coloquial. El precio es por segundo y está denominado en wons (disponible en la calculadora de precios de Naver Cloud Platform). El servicio está disponible en las regiones de Corea, EE. UU., Singapur, Japón y Alemania. Para contenido multilingüe coreano-inglés, Clova es una opción más débil que los motores del Nivel 1.

No disponible para el coreano:

  • Otter.ai: admite oficialmente inglés, español, francés, alemán, japonés y chino. El coreano no aparece en la lista. Las cifras de precisión de tablas comparativas antiguas que asignan a Otter un puntaje de WER en coreano son inverificables y deben descartarse.

Salida solo en Hangul y la excepción del Hanja

La escritura coreana moderna es casi enteramente Hangul. Los Hanja (caracteres chinos usados históricamente para vocabulario coreano) aparecen ocasionalmente en textos legales formales, titulares de periódicos de publicaciones anteriores y citas académicas, pero casi nunca en el habla. Una transcripción coreana correcta produce salida en Hangul.

Si un hablante menciona una palabra de origen Hanja (casi todo el vocabulario sino-coreano), la transcripción la escribe en su forma fonética Hangul. Esto coincide con lo que un lector coreano nativo espera ver: 대학교 (universidad), no 大學校, salvo que el contexto sea un documento histórico.

La puntuación coreana moderna sigue las convenciones occidentales: un punto es un punto (.), una coma es una coma (,). Los estilos editoriales antiguos usaban puntuación de ancho completo derivada del japonés (。、), pero esta no aparece en las transcripciones contemporáneas de los motores de IA.

Konglish y alternancia de códigos: cómo deberían manejarlo los motores

El habla de negocios y tecnología en coreano está fuertemente entremezclada con inglés. No se trata de jerga informal, sino del registro estándar de la vida profesional coreana. Una reunión en una empresa coreana de software produce con regularidad frases como "저는 PM이에요, OKR 설정해야 돼요" o "이 API 문서 업데이트해줘요."

La regla para decidir qué escritura recibe cada elemento:

TipoEjemplo (hablado)Transcripción esperada
Préstamo totalmente integradohaendeupon핸드폰
Integrado pero abreviadokape (café)카페
Acrónimo inglés, permanece en latínO-K-ROKR
Nombre de marca inglésChatGPTChatGPT
Término técnico inglés, a menudo en Hangulseobeo서버
Compuesto mixtoUI/UXUI/UX o 유아이/유엑스 (depende del motor)

Whisper Large-v3 y Deepgram Nova-3 manejan ambos esta alternancia de códigos correctamente con los préstamos comunes. Los casos límite son las palabras Konglish que no son inglés estándar: 아이쇼핑 (mirar vitrinas, de "eye shopping"), 핸드폰 (teléfono móvil, de "hand phone"), 아파트 (apartamento, abreviado). Una lista de términos clave bien mantenida cubre los inusuales.

Para profundizar en cómo la alternancia de códigos tensiona la precisión de los motores, consulta cómo corregir la alternancia de códigos multilingüe en las transcripciones.

Dialectos regionales: Seúl como referencia, Jeju como caso atípico

Todos los principales motores de IA evalúan la precisión del coreano contra el coreano estándar de Seúl (서울말), que es el dialecto de los medios de difusión, la educación nacional y la mayor parte del contenido en línea.

Los dialectos regionales introducen grados variables de divergencia:

  • Gyeongsang (경상도, incluye Busan y Daegu): acento tonal distintivo, terminaciones verbales diferentes. Más difícil de forma medible que el coreano de Seúl para los motores estándar.
  • Jeolla (전라도, incluye Gwangju): patrones de entonación diferentes y cierto vocabulario propio. Reconocido por la mayoría de los motores con cierta pérdida de precisión.
  • Jeju (제주): lingüísticamente tan distinto que la UNESCO lo clasificó como lengua en peligro separada del coreano propiamente dicho. Conserva rasgos del coreano medio ausentes del coreano estándar y resulta mutuamente ininteligible para muchos hablantes coreanos de la península. Los motores de IA de propósito general fallan sustancialmente con el jeju. Solo los sistemas especializados con datos de entrenamiento dedicados al jeju, como PersonaAI (que destinó aproximadamente una cuarta parte de su corpus de entrenamiento coreano de 50 000 horas a datos dialectales), manejan el jeju con precisión significativa.

Si tu contenido incluye hablantes de jeju, ajusta las expectativas en consecuencia y valora si se requiere un poseditor humano.

Diarización de hablantes para contenido en coreano

El habla formal coreana está estructurada por turnos. El coreano informal (paneles de programas de variedades, podcasts grupales) presenta una superposición significativa y mucho cruce de voces.

Para la [di

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles