Transcrição de Mandarim: Simplificado, Tradicional e Tons
transcriçãochinêsmandarimidiomas

Transcrição de Mandarim: Simplificado, Tradicional e Tons

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

A transcrição de mandarim funciona bem em 2026 para áudio limpo de estúdio, mas você precisa tomar três decisões antes de começar: saída em simplificado ou tradicional, qual código de idioma usar e se seu áudio é realmente cantonês (um idioma diferente para fins de ASR). Os tons são tratados automaticamente pelo mecanismo e não devem aparecer na transcrição. Desambiguação de homófonos e alternância mista mandarim-inglês são os principais riscos de precisão. Se você quer uma transcrição limpa sem um bot de reunião, o ConvertAudioToText lida com saída em simplificado e tradicional em /tools/audio-to-text.

Fragmento 1:

A transcrição de mandarim em 2026 produz texto limpo e legível quando você define o código de idioma certo e entende o que o mecanismo consegue ou não resolver sozinho. As duas decisões que importam antes de começar são: qual conjunto de caracteres você precisa, e se o áudio é realmente mandarim e não cantonês.

A saída em mandarim vem em simplificado ou tradicional; a tradução é separada
A saída em mandarim vem em simplificado ou tradicional; a tradução é separada

Simplificado vs. Tradicional: É Sobre o Seu Público, Não o Áudio

A língua falada na sua gravação é a mesma, independentemente de o falante ser de Xangai, Taipei ou Singapura. A saída escrita não é. O chinês simplificado (jiantizi) é o padrão na China continental e em Singapura. O chinês tradicional (fantizi) é o padrão em Taiwan, Hong Kong, Macau e na publicação da diáspora.

Todo mecanismo ASR importante roteia o áudio em mandarim para um conjunto de caracteres com base no código de idioma que você fornece:

  • zh ou zh-CN ou zh-Hans: saída em simplificado
  • zh-TW ou zh-Hant: saída em tradicional
  • zh-HK: no Deepgram Nova-3, isso aborda especificamente o cantonês tradicional

Definir o código de idioma explicitamente importa. A detecção automática de idioma em clipes curtos ou ruidosos de mandarim tem um modo de falha conhecido: o rastreador de problemas do próprio Deepgram documenta casos em que o mandarim é identificado erroneamente como inglês no Nova-2 e no Nova-3. Sempre passe o código explícito.

Se o seu fluxo de trabalho abrange as duas regiões, o caminho mais seguro é transcrever em simplificado e converter para tradicional usando uma ferramenta sensível ao contexto, como o OpenCC. Uma tabela ingênua de troca de caracteres não funciona bem porque muitos caracteres simplificados mapeiam para mais de um caractere tradicional, e escolher o certo exige contexto. Um mapeamento de um para muitos, como 發/髮 (ambos simplificados como 发), exige saber se a palavra significa "enviar" ou "cabelo".

Por Que os Tons Não Aparecem na Sua Transcrição

Os quatro tons do mandarim (mais um tom neutro) são problema do motor resolver, não seu de marcar. A saída da transcrição é em caracteres chineses escritos padrão, sem diacríticos de tom. O que o motor faz, na prática, é usar a informação tonal acusticamente para escolher o caractere certo entre um conjunto de homófonos, e então emitir esse caractere silenciosamente.

Homófonos são o principal risco de precisão na transcrição em mandarim. O inventário fonêmico do mandarim é pequeno em relação ao número de morfemas que ele codifica, o que significa que muitas sílabas soam idênticas: shì pode significar certo (是), assunto (事), sala (室), mercado (市), poder (势), e dezenas de outras. O motor precisa resolver isso a partir de contexto e modelagem de linguagem, não só de fonética.

Termos específicos de domínio agravam esse problema. Uma gravação médica usando 心 (coração) versus 新 (novo) em palavras compostas, ou um contexto jurídico usando 法 (lei) versus 发 (emitir), exige conhecimento de domínio que um modelo genérico pode não ter. Fornecer um glossário de termos-chave quando disponível reduz esses erros. Nomes chineses são particularmente vulneráveis, porque nomes próprios usam um conjunto pequeno de caracteres com muitas opções homofônicas e sem convenção rígida.

Saída em pinyin com marcas de tom (nǐ hǎo em vez de 你好) é um formato secundário, útil só em contextos de aprendizado de idioma. Transcrições padrão para qualquer outro fim usam caracteres.

Mandarim vs Cantonês: Dois Problemas Diferentes de ASR

Essa distinção importa na prática e é frequentemente mal compreendida. O cantonês (yue) é uma língua separada do mandarim para fins de ASR, não um sotaque regional.

O cantonês tem seis tons contra os quatro mais neutro do mandarim, fonologia diferente, e um grande abismo entre a forma falada coloquial e sua representação escrita. Um falante de Hong Kong alterna entre a fala em cantonês e caracteres chineses escritos que podem representar estrutura gramatical do mandarim. Isso torna o ASR em cantonês um problema mais difícil, mesmo em nível técnico.

Um modelo treinado em mandarim, quando recebe áudio em cantonês, transcreve as palavras mandarim foneticamente mais parecidas, gerando uma saída que soa relacionada, mas que frequentemente erra no nível da palavra. A queda de precisão não é uma degradação pequena.

O Deepgram Nova-3 agora lista zh-HK como cantonês tradicional, separado das variantes de mandarim simplificado e tradicional. Essa separação é a decisão arquitetural certa. Para ferramentas que não fazem essa distinção, verifique se o cantonês está explicitamente listado como idioma suportado antes de transcrever conteúdo de Hong Kong ou Guangdong.

Para reuniões mistas de mandarim e cantonês (comuns em ambientes corporativos de Hong Kong), o fluxo prático é transcrever com o modelo de mandarim e planejar uma revisão por um editor fluente em cantonês nos trechos com alternância de código.

Veja por que a IA tem dificuldade com idiomas de baixos recursos para entender a mecânica dos dados de treinamento por trás dessas lacunas de precisão.

Mandarim de Taiwan (Guoyu) vs Mandarim da China continental (Putonghua)

Guoyu e Putonghua compartilham um padrão escrito comum e inteligibilidade mútua, mas divergem em aspectos que afetam o ASR.

As diferenças acústicas: o mandarim de Taiwan não tem erhua (o sufixo 儿化 comum na fala de Pequim, por exemplo, nǎr em vez de nǎlǐ para "onde"). Falantes em Taiwan também costumam mesclar as consoantes retroflexas zh/ch/sh em z/c/s, então "zhōngwén" soa mais como "zōngwén". A variação de tom também difere: falantes de mandarim de Taiwan costumam usar uma faixa tonal mais estreita, e o tom ascendente pode se assemelhar acusticamente ao tom descendente-ascendente.

As diferenças de vocabulário: um estudo dos 7.000 caracteres mais usados encontrou aproximadamente 18% de divergência entre o uso padrão em Taiwan e na China continental, caindo para 13% entre os 3.500 caracteres mais frequentes. Isso inclui termos taiwaneses de origem hokkien ou japonesa que um modelo treinado na China continental pode renderizar como aproximações fonéticas usando outros caracteres.

Definir zh-TW direciona o mecanismo para expectativas adequadas aos padrões de fala taiwaneses e garante a saída em caracteres tradicionais. O código zh-TW não é só sobre o conjunto de caracteres; em modelos bem configurados, ele também ajusta a ponderação acústica para a fonologia do Guoyu.

Alternância de Código Chinês-Inglês na Prática

O mandarim de tecnologia e negócios quase sempre contém inglês. Uma frase como "我們需要review一下這個PR" (Precisamos revisar este PR) ou "這個KPI很重要" (Este KPI é importante) é a forma falada padrão em empresas de tecnologia chinesas.

Modelos multilíngues bem treinados lidam com isso mantendo as palavras em inglês no alfabeto latino, em vez de fonetizá-las. A saída que você quer é: review continua como review, siglas como KPI e OKR ficam em latim, e nomes próprios como Apple e Google permanecem em inglês.

O modo de falha está nas fronteiras de alternância de código, onde o mecanismo pode perder uma sílaba ou interpretar mal uma palavra curta em inglês como um morfema de mandarim. A alternância no meio da cláusula ("因為這個API...") é mais difícil do que a inserção de palavras inteiras. Se seu áudio for denso em inglês no meio de cláusulas, teste com uma amostra real antes de fechar o pipeline.

Veja como corrigir problemas de alternância de código multilíngue para etapas práticas de remediação.

Pontuação de Largura Total Não é Opcional

Uma transcrição de mandarim formatada corretamente usa pontuação de largura total, conforme padronizado na GB/T 15834-2011:

  • 。para ponto final (não .)
  • ,para vírgula (não ,)
  • 、para separador de enumeração em listas
  • :para dois pontos
  • 「」ou 《》para contextos de citação

Se sua saída de transcrição retornar texto em mandarim com pontuação ASCII de meia largura (., ,), a transcrição é não padronizada. Para publicação para públicos da China continental, públicos taiwaneses ou qualquer documento em língua chinesa, isso precisa de correção antes do uso. Algumas ferramentas produzem pontuação de largura total correta por padrão; outras exigem pós-processamento.

Suporte do Mecanismo para Mandarim em 2026

Deepgram Nova-3 é a mudança que se destaca para 2026 em mandarim. O Nova-3 suporta variantes explícitas de chinês simplificado (zh, zh-CN, zh-Hans), tradicional (zh-TW, zh-Hant) e cantonês (zh-HK). A Deepgram reportou uma redução relativa de 65,21% no WER para transcrição em lote de mandarim simplificado em comparação com o Nova-2, e 44,87% para o tradicional. São melhorias relativas, não números absolutos de precisão, mas a melhora direcional é substancial. Para saber mais sobre o motor, veja Deepgram Nova-3 explicado.

AssemblyAI Universal-2 suporta chinês mandarim, colocando-o na faixa de precisão ">10% a menos ou igual a 25% WER", segundo a documentação deles. Isso significa que funciona, mas o mandarim não está no nível mais alto de precisão deles. A documentação do modelo Universal-3 Pro não lista o mandarim nas tabelas detalhadas de suporte a idiomas em meados de 2026, então o Universal-2 é o caminho confirmado para chinês na AssemblyAI.

OpenAI Whisper Large-v3 lida bem com mandarim, com desempenho razoável. Variantes específicas para chinês com fine-tuning (como Belle-whisper-large-v3-zh) mostram melhora relativa de 24 a 65% em benchmarks de ASR chinês em comparação com o modelo base, o que indica onde está o teto do mandarim no modelo original. Para conteúdo chinês técnico ou de domínio específico, vale avaliar uma variante com fine-tuning.

Mandarim regional com fonologia não padrão pesada (mandarim de Sichuan, com sotaque de xangainês, influenciado pelo hokkien) ainda fica abaixo da precisão do putonghua padrão em todos os motores principais. O viés dos dados de treinamento para mandarim formal de transmissão é uma limitação estrutural.

Uma comparação de como diferentes motores se saem em idiomas com menos recursos está em explicação sobre precisão de transcrição.

Comparando Ferramentas para Transcrição em Chinês

RecursoOtter.aiNottaAPI Deepgram Nova-3CATT
Mandarim simplificadoSim (beta)SimSim (zh-CN)Sim
Mandarim tradicionalNão (somente simplificado)SimSim (zh-TW)Sim (zh-TW)
CantonêsNãoSimSim (zh-HK, separado)Limitado
Resumo em IA para chinêsSomente inglêsChinêsRequer LLM próprioChinês
Plano gratuito300 min/mês120 min/mêsCrédito de API de $200Plano gratuito disponível
Preço pago$8,33/mês (anual)$9,99/mês (anual)$0,0043/min em lote$9,99/mês, ilimitado
Alternância de idiomasLimitadaRazoávelDepende do modeloSim

O suporte para chinês do Otter é somente simplificado e marcado como beta na própria documentação deles, o que o torna uma escolha ruim para conteúdo voltado a Taiwan ou para quem precisa de saída em tradicional. O Notta suporta tanto simplificado quanto tradicional e tem uma página dedicada de áudio para texto em chinês, o que indica um investimento real em mandarim. A rota via API da Deepgram dá o controle mais preciso sobre códigos de idioma e variantes, ao custo de exigir sua própria integração.

Minha opinião: para arquivos de áudio avulsos em que você precisa de saída limpa em simplificado ou tradicional sem depender de um bot de reuniões, o ConvertAudioToText é o caminho direto. Para pipelines de API multilíngues em que você está construindo seu próprio produto, a Deepgram Nova-3 é por onde eu começaria em 2026, dado o WER documentado com melhorias em mandarim.

Diarização de locutores para chinês

Áudio de negócios em chinês tende a ter trocas de turno estruturadas em contextos formais. Entrevistas com dois locutores e pausas claras produzem diarização mais limpa do que podcasts casuais em que as pessoas falam por cima umas das outras.

O desafio específico da diarização em mandarim é que as normas conversacionais chinesas incluem respostas afirmativas de apoio (嗯, 对, 好) faladas em volume baixo enquanto o locutor principal continua. Isso gera falsos eventos de troca de locutor em diarizadores menos sofisticados.

Gravação por microfone individual, quando disponível, elimina a maioria desses erros. Para áudio no formato de podcast com um único microfone, planeje uma revisão leve na diarização em segmentos sobrepostos.

Veja diarização de falantes explicada para entender como o algoritmo subjacente lida com esses casos.

Dicas para Melhor Transcrição em Mandarim

  1. Defina o código de idioma exato: zh-CN para simplificado, zh-TW para tradicional, zh-HK para cantonês. A detecção padrão não é confiável em clipes curtos.
  2. Forneça um glossário de nomes próprios (nomes de pessoas, marcas, nomes internos de produtos) antes do processamento. Nomes próprios chineses são particularmente vulneráveis a erros de seleção por homofonia.
  3. Para conteúdo técnico, inclua termos do domínio. Um modelo que não conhece 机器学习 (aprendizado de máquina) como um composto pode dividi-lo incorretamente.
  4. Grave em ambientes com baixo ruído. As distinções tonais são o principal sinal de desambiguação e elas se comprimem sob ruído de fundo.
  5. Trate o áudio em cantonês como algo que exige uma ferramenta separada ou um código de idioma próprio, não como uma variação da configuração de mandarim.
  6. Para resumos de IA em chinês, verifique se a ferramenta gera o resumo em chinês, em vez de resumir em inglês e considerar o trabalho feito. A maioria das ferramentas de reunião voltadas ao Ocidente gera apenas resumos em inglês.

FAQ

Devo usar saída em chinês simplificado ou tradicional para minha transcrição?

Alinhe com seu público: simplificado (zh-CN) para conteúdo da China continental e Singapura, tradicional (zh-TW) para Taiwan, e zh-HK para Hong Kong. O mesmo mandarim falado produz saídas de caracteres diferentes dependendo do código de idioma que você passa ao mecanismo. Se seu público atravessa regiões, transcreva em simplificado e converta usando uma biblioteca sensível ao contexto como OpenCC, que lida com os muitos caracteres simplificados que mapeiam para mais de um caractere tradicional.

Os tons aparecem em transcrições em mandarim?

Não. Transcrições em mandarim padrão geram caracteres chineses, não pinyin com marcas de tom. O motor usa as distinções tonais para desambiguar homófonos e escolher o caractere certo, mas essas distinções são absorvidas no processo de seleção e nunca são impressas. O resultado é um texto limpo no formato que seus leitores esperam, como 你好 em vez de nǐ hǎo.

Por que a precisão do cantonês cai mesmo quando eu seleciono chinês?

O cantonês (yue) é uma língua distinta do mandarim, não um sotaque dele. Tem seis tons, contra os quatro mais o neutro do mandarim, fonologia diferente e uma forma escrita padronizada limitada. Motores de ASR treinados em dados de mandarim vão mal em áudio cantonês. O Deepgram Nova-3 oferece zh-HK como variante separada, e esse é o código certo para áudio cantonês. Para outras ferramentas, verifique se elas listam cantonês como opção de idioma distinta antes de transcrever conteúdo de cantonês de Hong Kong sob uma configuração genérica de chinês.

Como a alternância de código mandarim-inglês afeta a transcrição?

O mandarim de negócios e tecnologia mistura termos em inglês no meio da frase com frequência. Modelos multilíngues bem treinados lidam com isso mantendo palavras em inglês em escrita latina, em vez de fonetizá-las em caracteres. Siglas como KPI, OKR e API ficam em escrita latina. Nomes de produtos como Apple e Microsoft também. O desafio aparece quando o falante troca no meio de uma oração, e não no meio de uma palavra: alguns motores deixam cair uma sílaba na fronteira da troca. Testar com uma amostra real do seu áudio antes de fechar um pipeline vale a pena.

Quais códigos de idioma devo usar para transcrição em mandarim?

Para mandarim simplificado, use zh, zh-CN ou zh-Hans. Para tradicional, use zh-TW ou zh-Hant. No Deepgram Nova-3, zh-HK é cantonês tradicional. No AssemblyAI Universal-2, o mandarim é suportado. Sempre defina a variante explicitamente, em vez de confiar na detecção automática de idioma, porque o mandarim pode ser confundido com outras línguas em clipes curtos ou com ruído.

O mandarim taiwanês (Guoyu) é tratado de forma diferente do putonghua do continente?

Eles são próximos o bastante para que a maioria dos mecanismos lide com ambos sob um único modelo de mandarim, mas divergem em aspectos mensuráveis. O mandarim taiwanês não tem o sufixo erhua (儿化), comum na fala de Pequim, e os falantes costumam mesclar as consoantes retroflexas zh/ch/sh em z/c/s. O vocabulário também difere: cerca de 13 a 18 por cento dos caracteres de uso comum variam entre Taiwan e o continente. Definir zh-TW sinaliza essas expectativas ao mecanismo e também direciona a saída para caracteres tradicionais, que é o sistema de escrita padrão em Taiwan.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles