
Transcripción de mandarín: simplificado, tradicional y tonos
Summarize this article with:
La transcripción de mandarín funciona bien en 2026 para audio limpio de estudio, pero tienes que tomar tres decisiones antes de empezar: salida en simplificado o tradicional, qué código de idioma pasar y si tu audio es realmente cantonés (un idioma distinto para el reconocimiento automático de voz). Los tonos los gestiona el motor automáticamente y no deben aparecer en la transcripción. La desambiguación de homófonos y la alternancia mixta mandarín-inglés son los principales riesgos de precisión. Si quieres una transcripción limpia sin un bot de reuniones, ConvertAudioToText gestiona tanto la salida en simplificado como en tradicional en /tools/audio-to-text.
La transcripción de mandarín en 2026 produce texto limpio y legible cuando configuras el código de idioma correcto y entiendes qué puede y qué no puede resolver el motor por sí solo. Las dos decisiones que importan antes de empezar son: qué juego de caracteres necesitas, y si el audio es realmente mandarín en lugar de cantonés.

Simplificado vs. tradicional: se trata de tu audiencia, no del audio
El idioma hablado en tu grabación es el mismo, sin importar si el hablante es de Shanghái, Taipéi o Singapur. La salida escrita no lo es. El chino simplificado (jiantizi) es el estándar en China continental y Singapur. El chino tradicional (fantizi) es el estándar en Taiwán, Hong Kong, Macao y las publicaciones de la diáspora.
Todos los motores ASR principales enrutan el audio en mandarín a un juego de caracteres según el código de idioma que proporciones:
zhozh-CNozh-Hans: salida en simplificadozh-TWozh-Hant: salida en tradicionalzh-HK: en Deepgram Nova-3, esto aborda específicamente el cantonés tradicional
Configurar el código de idioma explícitamente importa. La detección automática de idioma en clips de mandarín cortos o con ruido tiene un modo de fallo conocido: el propio rastreador de incidencias de Deepgram documenta casos donde el mandarín se identifica erróneamente como inglés en Nova-2 y Nova-3. Pasa siempre el código explícito.
Si tu flujo de trabajo abarca ambas regiones, el camino más seguro es transcribir en simplificado y convertir a tradicional usando una herramienta consciente del contexto como OpenCC. Una tabla de intercambio de caracteres ingenua no funciona limpiamente porque muchos caracteres simplificados se corresponden con más de un carácter tradicional, y elegir el correcto requiere contexto. Un mapeo de uno a muchos, como 發/髮 (ambos simplificados como 发), requiere saber si la palabra significa "enviar" o "pelo".
Por qué los tonos no aparecen en tu transcripción
Los cuatro tonos del mandarín (más un tono neutro) son un problema que debe resolver el motor, no algo que tengas que marcar tú. La transcripción se entrega en caracteres chinos estándar escritos, sin diacríticos de tono. Lo que hace el motor en realidad es usar la información tonal de forma acústica para elegir el carácter correcto entre un conjunto de homófonos, y luego mostrar ese carácter en silencio.
Los homófonos son el principal riesgo de precisión en la transcripción del mandarín. El inventario de fonemas del mandarín es pequeño en comparación con la cantidad de morfemas que codifica, lo que significa que muchas sílabas suenan idénticas: shì puede significar correcto (是), asunto (事), habitación (室), mercado (市), poder (势) y docenas más. El motor debe resolver esto a partir del contexto y del modelado del lenguaje, no solo de la fonética.
Los términos específicos de un dominio agravan este problema. Una grabación médica que use 心 (corazón) frente a 新 (nuevo) en palabras compuestas, o un contexto legal que use 法 (ley) frente a 发 (emitir), requiere un conocimiento del dominio que un modelo general puede no tener. Proporcionar un glosario de términos clave cuando esté disponible reduce estos errores. Los nombres chinos son especialmente vulnerables porque los nombres de pila usan un grupo reducido de caracteres con muchas opciones homófonas y sin una convención rígida.
La salida en pinyin con marcas de tono (nǐ hǎo en lugar de 你好) es un formato secundario útil solo en contextos de aprendizaje de idiomas. Las transcripciones estándar para cualquier otro propósito usan caracteres.
Mandarín frente a cantonés: dos problemas distintos de ASR
Esta distinción importa en la práctica y a menudo se malinterpreta. El cantonés (yue) es una lengua separada del mandarín a efectos de ASR, no un acento regional.
El cantonés tiene seis tonos frente a los cuatro más neutro del mandarín, una fonología diferente y una gran brecha entre la forma hablada coloquial y su representación escrita. Un hablante de Hong Kong alterna entre el habla cantonesa y los caracteres chinos escritos que pueden representar la estructura gramatical del mandarín. Esto hace que el ASR en cantonés sea un problema más difícil incluso a nivel técnico.
Un modelo entrenado en mandarín, al recibir audio en cantonés, transcribirá las palabras en mandarín fonéticamente más similares, generando un resultado que suena relacionado pero que con frecuencia es incorrecto a nivel de palabra. La caída en precisión no es una degradación menor.
Deepgram Nova-3 ahora incluye zh-HK como cantonés tradicional, separado de las variantes de mandarín simplificado y tradicional. Esa separación es la decisión arquitectónica correcta. Para herramientas que no distinguen entre ambos, comprueba si el cantonés aparece explícitamente como idioma compatible antes de transcribir contenido de Hong Kong o Guangdong.
Para reuniones mixtas de mandarín y cantonés (habituales en entornos corporativos de Hong Kong), el flujo de trabajo práctico es transcribir con el modelo de mandarín y planificar una revisión por parte de un editor con dominio del cantonés en los segmentos con cambio de código.
Consulta por qué la IA falla con idiomas de bajos recursos para entender los mecanismos de datos de entrenamiento detrás de estas diferencias de precisión.
Mandarín taiwanés (Guoyu) frente a mandarín continental (Putonghua)
El Guoyu y el Putonghua comparten un estándar escrito común y son mutuamente inteligibles, pero divergen en aspectos que afectan al reconocimiento automático del habla.
Las diferencias acústicas: el mandarín taiwanés carece de la erhua (el sufijo 儿化 común en el habla de Pekín, por ejemplo nǎr en lugar de nǎlǐ para "dónde"). Los hablantes de Taiwán también suelen fusionar las consonantes retroflejas zh/ch/sh en z/c/s, de modo que "zhōngwén" suena más como "zōngwén". El rango tonal también difiere: los hablantes taiwaneses suelen usar un rango más estrecho, y el tono ascendente puede parecerse acústicamente al tono descendente-ascendente.
Las diferencias de vocabulario: un estudio de los 7.000 caracteres más usados encontró aproximadamente un 18% de divergencia entre el uso estándar en Taiwán y en el continente, que baja al 13% para los 3.500 caracteres más frecuentes. Entre ellos hay términos taiwaneses de origen hokkien o japonés que un modelo entrenado en el continente puede convertir en aproximaciones fonéticas con otros caracteres.
Setting zh-TW routes the engine to expectations appropriate for Taiwanese speech patterns and ensures Traditional character output. The zh-TW code is not just about character set; on well-configured models it also adjusts acoustic weighting toward Guoyu phonology.
Chinese-English Code-Switching in Practice
Tech and business Mandarin almost always contains English. A sentence like "我們需要review一下這個PR" (We need to review this PR) or "這個KPI很重要" (This KPI is important) is standard spoken form in Chinese technology companies.
Well-trained multilingual models handle this by keeping English words in Latin script rather than phoneticizing them. The output you want is: review stays as review, acronyms like KPI and OKR stay in Latin, and proper nouns like Apple and Google remain in English.
The failure mode is at code-switching boundaries, where the engine may drop a syllable or misparse a short English word as a Mandarin morpheme. Mid-clause switching ("因為這個API...") is harder than whole-word insertion. If your audio is dense with mid-clause English, test on a real sample before committing to a pipeline.
See how to fix multilingual code-switching issues for practical remediation steps.
Full-Width Punctuation Is Not Optional
A correctly formatted Mandarin transcript uses full-width punctuation as standardized in GB/T 15834-2011:
- 。for a sentence-ending period (not
.) - ,for a comma (not
,) - 、for an enumeration separator in lists
- :for a colon
- 「」or 《》for quotation contexts
If your transcription output returns Mandarin text with half-width ASCII punctuation (., ,), the transcript is nonstandard. For publishing to mainland Chinese audiences, Taiwanese audiences, or any Chinese-language document, this needs correction before use. Some tools produce correct full-width punctuation by default; others require post-processing.
Engine Support for Mandarin in 2026
Deepgram Nova-3 es el cambio más destacado para 2026 en mandarín. Nova-3 admite variantes explícitas de simplificado (zh, zh-CN, zh-Hans), tradicional (zh-TW, zh-Hant) y cantonés (zh-HK). Deepgram reportó una reducción relativa del WER del 65,21% en transcripción por lotes de mandarín simplificado en comparación con Nova-2, y del 44,87% para el tradicional. Son mejoras relativas, no cifras de precisión absoluta, pero la mejora direccional es sustancial. Para más detalles sobre el motor, consulta Deepgram Nova-3 explicado.
AssemblyAI Universal-2 admite chino mandarín, situándolo en la banda de precisión ">10% a menos o igual que 25% WER" según su documentación. Eso significa que funciona, pero el mandarín no está en su nivel más alto de precisión. La documentación de su modelo Universal-3 Pro no lista el mandarín en las tablas detalladas de soporte de idiomas a mediados de 2026, así que Universal-2 es la ruta confirmada para chino en AssemblyAI.
OpenAI Whisper Large-v3 maneja el mandarín con un rendimiento razonable. Las variantes específicas para chino ajustadas finamente (como Belle-whisper-large-v3-zh) muestran una mejora relativa del 24 al 65% en los benchmarks de ASR chino frente al modelo base, lo que indica dónde está el techo del mandarín en el modelo base. Para contenido chino técnico o de dominio específico, vale la pena evaluar una variante ajustada.
El mandarín regional con fonología no estándar marcada (mandarín de Sichuan, con acento shanghainés o influenciado por el hokkien) sigue por debajo de la precisión del putonghua estándar en todos los motores principales. El sesgo de los datos de entrenamiento hacia el mandarín formal de radiodifusión es una limitación estructural.
Una comparación de cómo rinden los distintos motores en idiomas con menos recursos está en precisión de transcripción explicada.
Comparación de herramientas para transcripción en chino
| Característica | Otter.ai | Notta | Deepgram Nova-3 API | CATT |
|---|---|---|---|---|
| Mandarín simplificado | Sí (beta) | Sí | Sí (zh-CN) | Sí |
| Mandarín tradicional | No (solo simplificado) | Sí | Sí (zh-TW) | Sí (zh-TW) |
| Cantonés | No | Sí | Sí (zh-HK, separado) | Limitado |
| Resumen con IA en chino | Solo inglés | Chino | Requiere tu propio LLM | Chino |
| Plan gratuito | 300 min/mes | 120 min/mes | Crédito API de $200 | Plan gratuito disponible |
| Precio de pago | $8.33/mes (anual) | $9.99/mes (anual) | $0.0043/min por lotes | $9.99/mes, ilimitado |
| Cambio de código | Limitado | Razonable | Depende del modelo | Sí |
El soporte de chino de Otter es solo simplificado y marcado como beta en su propia documentación, lo que lo convierte en una mala opción para contenido orientado a Taiwán o necesidades de salida en tradicional. Notta admite tanto simplificado como tradicional y tiene una página dedicada a la transcripción de audio en chino que indica una inversión real en mandarín. La vía API de Deepgram te da el control más preciso sobre códigos de idioma y variantes, a costa de requerir tu propia integración.
Mi opinión: para archivos de audio independientes donde necesitas una salida limpia en simplificado o tradicional sin depender de un bot de reuniones, ConvertAudioToText es la vía directa. Para pipelines API multilingües donde estás construyendo tu propio producto, Deepgram Nova-3 es por donde yo empezaría en 2026, dado el documentado WER mejorado en mandarín.
Diarización de hablantes para chino
El audio empresarial chino tiende a una estructura de turnos clara en contextos formales. Las entrevistas de dos hablantes con pausas marcadas producen una diarización más limpia que los podcasts informales donde los hablantes se interrumpen entre sí.
El reto de diarización específico del mandarín es que las normas conversacionales chinas incluyen retroalimentación afirmativa (嗯, 对, 好) dicha en voz baja mientras el hablante principal continúa. Esto genera falsos eventos de cambio de hablante en diarizadores menos sofisticados.
Grabación por micrófono individual, cuando está disponible, elimina la mayoría de estos errores. Para audio estilo podcast con un solo micrófono, planifica una revisión ligera de la diarización en los segmentos con solapamiento.
Consulta explicación de la diarización de hablantes para ver cómo el algoritmo subyacente maneja estos casos.
Consejos para una mejor transcripción en mandarín
- Establece el código de idioma exacto:
zh-CNpara simplificado,zh-TWpara tradicional,zh-HKpara cantonés. La detección por defecto no es fiable en clips cortos. - Aporta un glosario de nombres propios (nombres de personas, marcas, nombres internos de productos) antes de procesar. Los nombres de pila chinos son especialmente vulnerables a la mala selección por homofonía.
- Para contenido técnico, incluye términos del dominio. Un modelo que no reconoce 机器学习 (aprendizaje automático) como compuesto puede dividirlo incorrectamente.
- Graba en condiciones de bajo ruido. Las distinciones tonales son la principal señal de desambiguación y se comprimen con el ruido de fondo.
- Trata el audio en cantonés como algo que requiere una herramienta separada o un código de idioma distinto, no como una variante del ajuste de mandarín.
- Para resúmenes con IA en chino, verifica que la herramienta genere el resumen en chino en lugar de resumir en inglés y darlo por hecho. La mayoría de las herramientas de reuniones orientadas a Occidente solo hacen resúmenes en inglés.
Preguntas frecuentes
¿Debo usar salida en chino simplificado o tradicional para mi transcripción?
Adecúalo a tu audiencia: simplificado (zh-CN) para contenido de China continental y Singapur, tradicional (zh-TW) para Taiwán, y zh-HK para Hong Kong. El mismo mandarín hablado produce una salida de caracteres distinta según el código de idioma que pases al motor. Si tu audiencia abarca varias regiones, transcribe en simplificado y convierte con una biblioteca sensible al contexto como OpenCC, que gestiona los muchos caracteres simplificados que se corresponden con más de un carácter tradicional.
¿Aparecen los tonos en las transcripciones en mandarín?
No. El mandarín estándar genera caracteres chinos, no pinyin con marcas de tono. El motor usa las distinciones tonales para desambiguar homófonos y elegir el carácter correcto, pero esas distinciones se absorben en el proceso de selección de caracteres y nunca se imprimen. El resultado es un texto limpio en la forma que tus lectores esperan, como 你好 en lugar de nǐ hǎo.
¿Por qué baja la precisión del cantonés incluso si selecciono chino?
El cantonés (chino yue) es una lengua distinta del mandarín, no un acento de este. Tiene seis tonos frente a los cuatro más neutro del mandarín, una fonología diferente y una forma escrita estandarizada limitada. Los motores de reconocimiento de voz entrenados con datos de mandarín rinden mal con audio en cantonés. Deepgram Nova-3 ofrece zh-HK como variante separada, y ese es el código correcto para audio en cantonés. Para otras herramientas, comprueba si listan el cantonés como opción de idioma distinta antes de transcribir contenido en cantonés de Hong Kong bajo un ajuste general de chino.
¿Cómo afecta la alternancia de código mandarín-inglés a la transcripción?
El mandarín técnico y de negocios mezcla con frecuencia términos ingleses a mitad de frase. Los modelos multilingües bien entrenados manejan esto manteniendo las palabras inglesas en escritura latina en lugar de fonetizarlas en caracteres. Los acrónimos como KPI, OKR y API se quedan en escritura latina. Los nombres de producto como Apple y Microsoft también. El problema surge cuando el hablante cambia a mitad de cláusula en lugar de a mitad de palabra: algunos motores pierden una sílaba en el límite del cambio. Merece la pena probar con una muestra real de tu audio antes de comprometerte con un flujo de trabajo.
¿Qué códigos de idioma debo usar para la transcripción en mandarín?
Para mandarín simplificado, usa zh, zh-CN o zh-Hans. Para tradicional, usa zh-TW o zh-Hant. En Deepgram Nova-3, zh-HK es cantonés tradicional. En AssemblyAI Universal-2, el chino mandarín está soportado. Configura siempre la variante de forma explícita en lugar de depender de la detección automática de idioma, porque el mandarín puede identificarse erróneamente como otros idiomas en clips cortos o con ruido.
¿Se trata el mandarín taiwanés (Guoyu) de forma distinta al putonghua continental?
Son lo bastante parecidos como para que la mayoría de los motores los gestionen bajo un único modelo de mandarín, pero divergen en aspectos medibles. El mandarín taiwanés carece del sufijo erhua (儿化), habitual en el habla de Pekín, y los hablantes suelen fusionar las consonantes retroflejas zh/ch/sh en z/c/s. El vocabulario también difiere: entre un 13 y un 18 por ciento de los caracteres de uso común varían entre Taiwán y el continente. Indicar zh-TW transmite estas expectativas al motor y además dirige la salida a caracteres tradicionales, que es el sistema de escritura estándar en Taiwán.
Fuentes
- Deepgram Nova-3 Expands to Asia-Pacific (Deepgram)
- Deepgram Models and Languages Overview
- AssemblyAI Supported Languages
- Otter.ai Supported Languages (Help Center)
- Otter.ai Pricing
- Notta Pricing
- Notta Chinese Audio to Text
- Taiwanese Mandarin (Wikipedia)
- Chinese Punctuation (Wikipedia)
- Deepgram Nova-3 Mandarin changelog (March 31, 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How to Get a Spotify Podcast Transcript Free (2026): Every Method, Honestly Compared
Spotify already shows free transcripts for many episodes, so start there. When it doesn't, here is every real way to get a Spotify podcast transcript free, including the limits of each, and when a paid tool is honestly the answer.

Transcription Without a Subscription (2026): One-Time, Pay-As-You-Go, and Free Options
Every real way to transcribe audio without another monthly subscription: free tools with no account, one-time licenses, and pay-as-you-go minutes, with the exact prices and the catches vendors do not lead with.