
Transcrição de Vietnamita: Seis Tons, Precisão Real
Summarize this article with:
A transcrição de vietnamita é mais difícil do que a da maioria das línguas de escrita latina porque a ortografia codifica seis tons distintos como diacríticos sobrepostos, e a perda de um sinal muda completamente o significado da palavra. O vietnamita do Norte (padrão de Hanói) tem a melhor cobertura de IA; o vietnamita Central (Hue, Da Nang) é o dialeto mais difícil para os modelos atuais. Deepgram Nova-2 e Nova-3, OpenAI Whisper e AssemblyAI Universal listam suporte ao vietnamita, mas a precisão para áudio fora do padrão do Norte fica num patamar inferior ao do francês ou do espanhol. Se você precisa de transcrições limpas e diacritizadas em vietnamita, escolha uma ferramenta que liste explicitamente o suporte ao vietnamita, defina o código de idioma manualmente e reserve mais tempo de pós-edição para áudio do dialeto Central do que para gravações no padrão de Hanói.
Obter uma transcrição limpa de vietnamita significa obter as marcas tonais. Perca um diacrítico e você muda a palavra: "ma" (fantasma), "má" (mãe), "mà" (mas), "mả" (túmulo), "mã" (cavalo) e "mạ" (muda de arroz) são seis palavras diferentes do vietnamita distinguidas inteiramente pela marca tonal sobre a mesma sílaba. Não é uma questão de formatação, é uma questão de significado, e é por isso que a transcrição de vietnamita é mais difícil do que parece à primeira vista para sistemas de IA.

Este guia cobre a ortografia, a lacuna entre os dialetos regionais, quais motores realmente suportam o vietnamita em 2026 e o que esperar de cada um.
O Sistema de Seis Tons e Por Que os Diacríticos São Essenciais
O vietnamita é escrito em chữ Quốc Ngữ, um sistema de escrita baseado no alfabeto latino finalizado no início do século XX. Ele codifica seis tons fonêmicos por meio de um sistema de diacríticos sobrepostos: a sílaba sem marca carrega o tom nivelado (ngang), e cada um dos outros cinco tons recebe uma marca própria.
Os seis tons:
- ngang (nivelado, sem marca): "a" como em ma (fantasma)
- sắc (alto ascendente): "á" como em má (mãe)
- huyền (baixo descendente): "à" como em mà (mas)
- hỏi (descendente-ascendente): "ả" como em mả (túmulo)
- ngã (descendente com pausa glotal): "ã" como em mã (cavalo)
- nặng (baixo descendente pesado, ponto abaixo): "ạ" como em mạ (muda de arroz)
A ortografia fica mais densa quando diacríticos de qualidade vocálica são empilhados sobre as marcas tonais. O vietnamita tem sete vogais modificadas: ă, â, ê, ô, ơ, ư e đ. Uma vogal como "ă" pode carregar qualquer um dos seis tons, produzindo formas como ắ, ằ, ẳ, ẵ, ặ. O Unicode as representa na forma pré-composta sob a Forma de Normalização C, o que é importante para a saída da transcrição: uma ferramenta que retorna caracteres combinantes decompostos em vez de pontos de código pré-compostos pode gerar texto que parece correto na tela, mas quebra em processamentos de texto posteriores.
Para fins de transcrição, o ponto essencial é que as marcas tonais não são pontuação opcional. Uma transcrição que devolve letras latinas sem acento não é um rascunho, é o texto errado.
Suporte dos Motores: Mais Limitado Que o das Línguas de Primeiro Nível
O vietnamita aparece como idioma suportado nos principais motores:
- OpenAI Whisper (incluindo o modelo large-v3): lista o vietnamita (vi) em seu conjunto de idiomas suportados.
- Deepgram Nova-2 e Nova-3: ambos listam
vicom suporte nos endpoints de lote e de streaming. - AssemblyAI Universal: inclui o vietnamita, com diarização de falantes disponível.
O que "suportado" significa varia. A documentação da AssemblyAI coloca o vietnamita na faixa de "boa precisão", que define como taxas de erro de palavra acima de 10% a 25%. Para comparação, o inglês fica abaixo de 10% de WER. Em termos de dados de treinamento, o vietnamita é uma língua com menos recursos, e a expectativa honesta é que a precisão no vietnamita seja consideravelmente menor do que no francês, no espanhol ou no alemão, especialmente em áudios fora do padrão.
O Otter.ai não suporta vietnamita. Seus idiomas suportados, até 2026, são inglês, espanhol, francês, alemão, japonês e chinês (simplificado). Qualquer ferramenta que cite números de precisão do Otter para vietnamita está inventando dados.
Para uma visão mais ampla de como o suporte dos motores varia entre os idiomas, veja por que a IA sofre com línguas com poucos recursos.
Norte vs. Sul vs. Centro: A Lacuna nos Dados de Treinamento
O Vietnã tem três grandes grupos de dialetos regionais, e a cobertura de IA é desigual entre eles.
Vietnamita do Norte (Padrão de Hanói)
Este é o dialeto que domina a mídia jornalística, a educação formal e o conteúdo governamental, e representa a maior fatia dos dados de treinamento para transcrição de vietnamita. Os seis tons são acusticamente bem distintos no vietnamita do Norte. A precisão da IA é máxima em áudio no padrão de Hanói. Se você está transcrevendo conteúdo formal de transmissão da VTV ou fala empresarial formal de falantes de Hanói, está trabalhando com o dialeto para o qual a IA foi construída.
Vietnamita do Sul (Cidade de Ho Chi Minh, Delta do Mekong)
A principal diferença no vietnamita do Sul é a fusão hỏi/ngã. No Sul, ambos os tons são realizados como um simples tom descendente baixo, sem a interrupção glotal que distingue o ngã no Norte. A língua escrita ainda exige as duas marcas tonais em suas respectivas posições, mas a distinção acústica que ajudava a IA a atribuí-las desapareceu. A precisão no vietnamita do Sul costuma ser menor do que no do Norte, principalmente para distinguir ả e ã. Pesquisas sobre conjuntos de dados de ASR vietnamita também documentaram que o vietnamita do Sul é sub-representado nos corpora de treinamento em comparação com o do Norte e até mesmo com o do Centro, o que agrava o problema.
Vietnamita Central (Hue, Da Nang, Quang Tri)
O vietnamita Central é o dialeto mais desafiador para os sistemas de IA atuais. Ele preserva distinções consonantais que o vietnamita do Norte fundiu, incluindo tr/ch, s/x e d/gi/r. Suas realizações tonais diferem tanto das formas padrão do Norte quanto das do Sul, com quedas dramáticas de pitch e voz soprosa ausentes do dialeto que a IA aprendeu principalmente. O dialeto de Hue também mantém vocabulário ausente da maioria dos dados de treinamento: "mô" no lugar de "đâu" (onde), "răng" no lugar de "sao" (por quê). Reserve mais tempo de pós-edição para áudio em vietnamita Central do que para qualquer outra variedade regional.
Diacríticos e Codificação Ortográfica: O Que Pode Dar Errado
Como os caracteres vietnamitas envolvem sobreposição, a representação Unicode importa na prática. Um caractere como "ộ" (a vogal ô com o ponto do nặng abaixo) é um único ponto de código pré-composto (U+1ED9) sob a normalização NFC. Motores que retornam a sequência decomposta (o + circunflexo combinante + ponto combinante abaixo) podem causar problemas em editores, bancos de dados e pipelines de exportação que esperam NFC. Ao avaliar um motor, teste-o com um trecho conhecido de vietnamita e inspecione a saída bruta quanto à forma de normalização, não apenas o resultado renderizado na tela.
Um segundo problema prático: algumas ferramentas mais antigas removem completamente os diacríticos para evitar problemas de codificação, retornando saída em ASCII puro. Isso não é uma transcrição, é apenas uma pista fonética. Qualquer motor que você usar para conteúdo em vietnamita deve retornar saída diacritizada por padrão.
Alternância de Códigos: Vietnamita-Inglês nos Negócios e na Tecnologia
A alternância de códigos entre vietnamita e inglês é pervasiva na fala tecnológica e empresarial vietnamita. Frases como "Tôi đang work on a project mới" são rotina em ambientes de startup, e o padrão está bem documentado em pesquisas de sociolinguística sobre comunicação em escritórios vietnamitas e comunidades da diáspora. A troca acontece porque o vocabulário técnico em inglês (email, deadline, meeting, server) não tem equivalente natural em vietnamita ou simplesmente é mais rápido no contexto.
Para a transcrição, isso cria um problema bilíngue: o motor precisa lidar com os diacríticos vietnamitas nas partes em vietnamita e com inglês padrão nas inserções, dentro da mesma fala. Motores modernos que suportam explicitamente o vietnamita geralmente lidam melhor com isso do que ferramentas dominadas pelo inglês que tentam detectar o vietnamita automaticamente, porque a detecção de idioma no nível da fala frequentemente falha em discurso misto.
Para dicas sobre como lidar com áudio em vários idiomas, veja como corrigir a alternância de códigos multilíngue em transcrições.
Para falantes vietnamitas mais velhos educados antes de 1975, também existe a alternância entre vietnamita e francês, particularmente na comunidade da diáspora na França e entre moradores mais antigos em contextos profissionais da era Saigon. O volume desse conteúdo é menor, e o suporte dos motores para misturas de vietnamita-francês é menos testado.
Dicas Práticas Para Uma Melhor Transcrição de Vietnamita
- Defina o código de idioma explicitamente como
vi. A detecção automática em canais com conteúdo misto às vezes assume chinês ou outros idiomas do Sudeste Asiático, especialmente em clipes curtos de áudio. - Grave sem ruído de fundo. Os tons do vietnamita são realizados como contornos de pitch que atravessam toda a sílaba. O ruído degrada diretamente a detecção de pitch, o que degrada a recuperação dos tons. Isso importa mais para o vietnamita do que para línguas não tonais.
- Forneça uma lista de vocabulário para nomes e lugares antes de enviar o arquivo, se sua ferramenta suportar vocabulário personalizado. Nomes pessoais e topônimos vietnamitas (Hà Nội, TP HCM, Đà Nẵng, Nguyễn Văn An) com os diacríticos corretos dão ao motor uma âncora para decisões de transcrição ambíguas localmente.
- Verifique a saída diacritizada imediatamente. Confira o primeiro parágrafo de qualquer transcrição em vietnamita em busca de marcas tonais ausentes ou incorretas antes de confiar no restante.
- Espere mais correção no áudio em vietnamita Central. Planeje de 3 a 5 passadas extras de edição em gravações de falantes de Hue ou Da Nang em comparação com conteúdo no padrão de Hanói.
Para um guia mais amplo sobre a precisão da IA entre idiomas e dialetos, veja precisão de transcrição explicada.
Comparando Ferramentas de Transcrição de Vietnamita
A tabela abaixo se baseia em preços verificados nos sites dos fornecedores até julho de 2026. A precisão é descrita de forma qualitativa, não como percentuais inventados, porque nenhum fornecedor publica benchmarks de WER específicos para vietnamita desses produtos.
| Ferramenta | Suporte a Vietnamita | Plano Gratuito | Preço Inicial |
|---|---|---|---|
| Ferramentas baseadas em Whisper (ex.: CATT) | Sim, vi suportado | 10 minutos grátis, uma única vez | A partir de US$ 9,99/mês (ilimitado) |
| Deepgram (API) | Sim, Nova-2 e Nova-3 | Pague pelo uso | Medido, com faixas de volume |
| AssemblyAI (API) | Sim, com diarização | Pague pelo uso | Medido |
| Happy Scribe | Sim, transcrição por IA | Teste de 10 minutos | A partir de €17/mês, 120 min |
| Sonix | Sim, listado em 54 idiomas | Teste de 30 minutos | US$ 10/hora (pago pelo uso) ou US$ 22/usuário/mês + US$ 5/hora |
| Otter.ai | Não, sem suporte | 300 min/mês | US$ 16,99/mês (somente inglês/espanhol/francês) |
Para um detalhamento completo dos custos de transcrição por minuto e por assinatura, veja comparação de preços de transcrição 2026. Se o seu conteúdo em vietnamita é para um podcast ou série contínua, melhor transcrição para podcasts 2026 aborda considerações de fluxo de trabalho.
Quem Realmente Usa a Transcrição de Vietnamita
Criadores de conteúdo da diáspora vietnamita nos EUA (particularmente a comunidade de Little Saigon, na Califórnia, que é a maior comunidade vietnamita fora do Sudeste Asiático) produzem podcasts em vietnamita, conteúdo de entrevistas e gravações de acervo familiar. Para o público da diáspora, a fidelidade aos diacríticos importa tanto porque a saída escrita precisa ser legível no vietnamita padrão quanto porque perder marcas tonais muda o significado do texto, não apenas sua aparência.
Redações vietnamitas usam transcrição para agilizar a publicação de entrevistas em veículos impressos e digitais. Educadores vietnamitas transcrevem aulas para material de curso publicado. O ponto em comum é que todos esses casos de uso exigem saída diacritizada, não aproximações em ASCII.
Para uma visão mais ampla de como funciona a diarização em conteúdo vietnamita com múltiplos falantes, veja diarização de falantes explicada.
Se você precisa de uma transcrição limpa de vietnamita e não precisa de recursos de bot de reunião, o ConvertAudioToText suporta vietnamita com saída adequadamente diacritizada e um plano gratuito para testar com seu próprio áudio.
Perguntas Frequentes
A transcrição por IA preserva as marcas tonais do vietnamita?
Depende do motor. Motores treinados com texto vietnamita corretamente diacritizado, como Whisper e Deepgram Nova-2/3, retornam as marcas tonais na saída. Motores que só suportam uma lista curta de idiomas (o Otter, por exemplo, que não suporta vietnamita de forma alguma) não darão conta. Sempre verifique se a ferramenta lista o vietnamita como idioma suportado antes de enviar o arquivo.
Qual dialeto regional do vietnamita é o mais difícil para a IA transcrever?
O vietnamita Central, especialmente o dialeto de Hue, é o mais difícil. Suas realizações tonais diferem do padrão do Norte que domina os dados de treinamento de IA, ele mantém distinções consonantais fundidas no norte (tr/ch, s/x, d/gi/r) e usa vocabulário (mô, răng) ausente da maioria dos corpora de treinamento. Espere erros visivelmente maiores no vietnamita Central do que em gravações no padrão de Hanói ou da cidade de Ho Chi Minh.
A fusão hỏi-ngã do vietnamita do Sul causa erros de transcrição?
Pode causar. No vietnamita do Sul, os tons hỏi (descendente suave) e ngã (descendente com pausa glotal) são pronunciados quase identicamente. Um motor que processa o áudio foneticamente pode escrever a marca tonal errada, porque o sinal acústico já não os distingue. A forma escrita correta usa ambos os tons, então um motor bem treinado deveria aplicá-los com base no contexto do vocabulário, mas esse é um ponto fraco conhecido.
Como a alternância de códigos entre vietnamita e inglês afeta a qualidade da transcrição?
Os motores modernos geralmente lidam razoavelmente bem com isso: as palavras em vietnamita voltam diacritizadas em vietnamita, e as inserções em inglês voltam em inglês. O problema é que a alternância de códigos é extremamente comum na fala de tecnologia e negócios em vietnamita, então, se o modelo vietnamita de um motor for fraco, as falas alternadas elevam ainda mais a taxa de erro. Use um motor que suporte explicitamente o vietnamita, e não apenas detecção multilíngue dominada pelo inglês.
Quais formatos de arquivo e qual qualidade de áudio importam mais para a transcrição de vietnamita?
Para uma língua tonal, o formato importa menos do que a qualidade do áudio. As marcas tonais do vietnamita dependem de contornos sutis de pitch — especificamente formas ascendentes, descendentes e glotalizadas que atravessam toda a sílaba. O ruído de fundo e a qualidade do microfone degradam diretamente a recuperação dos tons. Grave em ambiente silencioso, use um microfone dedicado se possível e exporte o áudio a 44,1 kHz ou mais. Os formatos comuns (MP3, M4A, WAV, FLAC) funcionam com todos os principais motores.
Fontes
- Documentação de Modelos e Idiomas da Deepgram: https://developers.deepgram.com/docs/models-languages-overview
- Documentação de Idiomas Suportados da AssemblyAI: https://www.assemblyai.com/docs/supported-languages
- Artigo de ajuda de Idiomas Suportados do Otter.ai: https://help.otter.ai/hc/en-us/articles/360047247414-Supported-languages
- Página de preços do Happy Scribe: https://www.happyscribe.com/pricing
- Página de preços do Sonix: https://sonix.ai/pricing/detailed-pricing-and-features
- Fonologia do vietnamita, Wikipédia: https://en.wikipedia.org/wiki/Vietnamese_phonology
- Alfabeto vietnamita, Wikipédia: https://en.wikipedia.org/wiki/Vietnamese_alphabet
- Tons do vietnamita do Sul, SVFF: https://svff.online/blog/southern-vietnamese-tones-explained
- Revisão do ASR vietnamita, arXiv 2025: https://arxiv.org/html/2603.14779v1
- Alternância de códigos vietnamita-inglês em contextos de escritório: https://stdjssh.scienceandtechnology.com.vn/index.php/stdjssh/article/view/690
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.