Guia de Transcrição de Coreano: Hangul, Honoríficos e Konglish
transcriçãocoreanoidiomas

Guia de Transcrição de Coreano: Hangul, Honoríficos e Konglish

BMMamane B. MoussaMay 26, 2026Updated July 2, 202616 min read

Summarize this article with:

A Versão Curta

Para o coreano padrão de Seul, tanto o Deepgram Nova-3 quanto o Whisper Large-v3 produzem transcrições precisas em Hangul com terminações verbais corretas conforme o nível de fala. Para o dialeto de Jeju ou conteúdo com forte presença dialectal, apenas motores especializados nativos de coreano lidam bem com essa lacuna. Se você precisa de uma transcrição limpa sem bot de reuniões nem configuração de conta, o ConvertAudioToText cobre o coreano com rótulos de falantes; uma conta gratuita vem com 10 minutos de transcrição concedidos uma única vez no cadastro, e a exportação SRT está disponível em plano pago ou no período de teste de 7 dias.

Transcrição e tradução de coreano são etapas separadas com precisões separadas
Transcrição e tradução de coreano são etapas separadas com precisões separadas

Por Que a Transcrição de Coreano Tem Uma Classe Própria de Problemas

O coreano não é difícil para a IA por causa do seu alfabeto. O Hangul é um dos sistemas de escrita fonemicamente mais regulares do mundo: cada bloco silábico codifica consoantes e vogais em um padrão fixo, e não há ambiguidade de caracteres do tipo que torna a transcrição do chinês um problema completamente diferente.

A dificuldade real é estrutural e social:

O espaçamento no coreano é opcional e contestado. O termo formal é 띄어쓰기 (tteui-eo-sseu-gi), e as regras são genuinamente ambíguas até mesmo entre falantes nativos. Verbos auxiliares podem ser escritos junto ou separado; substantivos dependentes são oficialmente escritos separados, mas comumente aparecem junto. Na fala, não há pausas marcando esses limites, então um motor de IA precisa decidir onde dividir cadeias verbais aglutinativas. A Deepgram documentou o espaçamento de substantivos compostos do coreano como um dos "desafios centrais" abordados no Nova-3. Os artigos de avaliação do Whisper usam taxa de erro por caractere (CER) para o coreano em vez de taxa de erro por palavra (WER), justamente porque a segmentação de palavras é variável. Um motor que funde "받아도 돼요" em "받아도돼요" está produzindo uma estrutura gramatical diferente, não apenas uma preferência de formatação.

Os verbos coreanos codificam hierarquia social. Acertar as palavras não basta. Uma transcrição que normaliza todos para 해요체 quando um falante usou 하십시오체 e outro usou 해체 perdeu informações que um leitor coreano usaria para reconstruir a relação entre os participantes. Veja a seção sobre honoríficos abaixo.

Os empréstimos vivem em dois sistemas de escrita simultaneamente. Uma conversa de negócios em coreano mistura inglês renderizado em Hangul (핸드폰, 카페, 아파트) com siglas e nomes de marcas em alfabeto latino (PM, OKR, KPI, ChatGPT). Uma transcrição correta precisa colocar cada elemento no sistema de escrita certo, e esse mapeamento não é previsível apenas pela fonética: 컴퓨터 (computador) volta em Hangul, enquanto "IT" fica em latim, porque é assim que os coreanos os escrevem.

O Problema dos Honoríficos e Por Que Isso Importa para Transcrições

O coreano tem um sistema de níveis de fala chamado 존댓말 (jondaemal), distinto do vocabulário honorífico. Os níveis de fala são codificados nas terminações verbais e sinalizam a relação do falante com o ouvinte, não com o assunto. Uma transcrição de coreano precisa reproduzir as terminações verbais reais do falante.

Os três níveis ainda comuns na fala moderna:

  • 하십시오체 (hasipsio-che): Polido formal. Padrão em telejornais, entrevistas de emprego, ambiente militar, apresentações de negócios, setor de serviços e primeiros encontros com pessoas significativamente mais seniores. Terminação verbal: -(으)십시오, -(으)ㅂ니다.
  • 해요체 (haeyo-che): Polido informal. O padrão para conversas cotidianas entre adultos, a maioria das interações com clientes e criadores de conteúdo se dirigindo à sua audiência.
  • 해체 (hae-che): Informal. Usado com amigos próximos, pares da mesma idade e por adultos se dirigindo a crianças.

As outras formas, 하소서체 (formal elevada arcaica), 하게체 (semiformal, hoje rara entre falantes mais jovens) e 해라체 (plana/narrativa, comum em narrações escritas), aparecem com menos frequência na fala, mas ainda carregam significado.

Por que isso importa para a precisão da transcrição: Uma transcrição de reunião de negócios que renderiza consistentemente as terminações 하십시오체 corretamente diz a um leitor coreano quem estava falando com quem, em qual capacidade e em qual nível de formalidade. Uma transcrição que achata tudo para um único nível perde isso. O Whisper Large-v3 preserva os níveis de fala porque transcreve o que foi dito em vez de normalizar o registro. O Deepgram Nova-3, treinado especificamente com dados de radiodifusão e negócios em coreano, reflete de forma semelhante as terminações reais do falante.

Níveis de Suporte dos Motores: O Que Foi Verificado

Esses níveis refletem o que os fornecedores documentaram ou o que avaliações independentes publicaram. Eu não inventei percentuais de precisão.

Nível 1: Forte suporte a coreano, melhorias documentadas

  • Deepgram Nova-3 (ko / ko-KR): A Deepgram publicou um post no blog documentando uma "redução de WER de até 27%" em relação ao Nova-2 para o coreano, citando a ambiguidade de espaçamento do Hangul, a conjugação rápida e os blocos silábicos como os desafios específicos abordados. O Keyterm Prompting está disponível para o coreano, o que é útil para nomes de marcas e vocabulário técnico. Tanto o Nova-3 quanto o Nova-2 suportam os códigos de idioma ko e ko-KR.
  • OpenAI Whisper Large-v3: O coreano está entre os idiomas mais bem representados nos dados de treinamento do Whisper, e a OpenAI usa CER (não WER) para benchmarks de coreano. O lançamento do large-v3 mostrou redução de erro de 10-20% em relação ao large-v2 em todos os idiomas suportados. Veja a análise de preços da API do Whisper se você estiver escolhendo entre a API hospedada e a auto-hospedagem.

Nível 2: Boa precisão, documentação limitada específica de coreano

  • AssemblyAI Universal-2: A documentação da AssemblyAI lista o coreano na faixa de "boa precisão", definida como WER maior que 10% até 25%. Diarização e capítulos automáticos funcionam para o coreano; a sumarização baseada em LeMUR em coreano depende do LLM subjacente, não da camada de STT. Streaming em tempo real para coreano não é suportado atualmente.
  • Google Cloud Speech-to-Text (modelo Chirp): O coreano está entre os mais de 125 idiomas suportados. O preço do Chirp é por segundo, cobrado em incrementos de 15 segundos, com uma franquia mensal gratuita de 60 minutos. Não há WER publicado para coreano no Chirp. Leia a análise completa de preços do Google Cloud STT antes de se comprometer com grandes volumes.

Nível 3: Nativo de coreano, infraestrutura na Coreia

  • Naver Clova Speech: O modelo da Naver treina exclusivamente com dados em coreano, o que lhe dá vantagem em dialetos regionais e fala coloquial. O preço é por segundo, denominado em wons (disponível na calculadora de preços da Naver Cloud Platform). O serviço está disponível nas regiões da Coreia, EUA, Singapura, Japão e Alemanha. Para conteúdo multilíngue coreano-inglês, a Clova é uma escolha mais fraca que os motores do Nível 1.

Não disponível para coreano:

  • Otter.ai: Suporta oficialmente inglês, espanhol, francês, alemão, japonês e chinês. O coreano não está listado. Os números de precisão em tabelas comparativas antigas que atribuem à Otter uma pontuação de WER para coreano são inverificáveis e devem ser desconsiderados.

Saída Somente em Hangul e a Exceção dos Hanja

A escrita coreana moderna é quase inteiramente em Hangul. Hanja (caracteres chineses historicamente usados para vocabulário coreano) aparecem ocasionalmente em textos jurídicos formais, manchetes de jornais de publicações mais antigas e citações acadêmicas, mas quase nunca na fala. Uma transcrição de coreano correta produz saída em Hangul.

Se um falante menciona uma palavra de origem Hanja (praticamente todo o vocabulário sino-coreano), a transcrição a escreve em forma fonética em Hangul. Isso corresponde à expectativa de um leitor coreano nativo: 대학교 (universidade), não 大學校, a menos que o contexto seja um documento histórico.

A pontuação coreana moderna segue convenções ocidentais: ponto é ponto (.), vírgula é vírgula (,). Estilos editoriais mais antigos usavam pontuação de largura total derivada do japonês (。、), mas ela não aparece em transcrições contemporâneas de motores de IA.

Konglish e Alternância de Código: Como os Motores Devem Lidar Com Isso

A fala de negócios e tecnologia em coreano é fortemente entremeada com inglês. Isso não é gíria informal, mas o registro padrão da vida profissional coreana. Uma reunião em uma empresa de software coreana rotineiramente produz frases como "저는 PM이에요, OKR 설정해야 돼요" ou "이 API 문서 업데이트해줘요."

A regra para qual sistema de escrita cada elemento recebe:

TipoExemplo (falado)Transcrição esperada
Empréstimo totalmente integradohaendeupon핸드폰
Integrado mas abreviadokape (café)카페
Sigla em inglês, permanece em latimO-K-ROKR
Nome de marca em inglêsChatGPTChatGPT
Termo técnico em inglês, geralmente em Hangulseobeo서버
Composto mistoUI/UXUI/UX ou 유아이/유엑스 (depende do motor)

Whisper Large-v3 e Deepgram Nova-3 lidam corretamente com essa alternância de código para empréstimos comuns. Os casos extremos são palavras do Konglish que não são inglês padrão: 아이쇼핑 (window shopping, de "eye shopping"), 핸드폰 (celular, de "hand phone"), 아파트 (apartamento, abreviado). Uma lista de termos-chave bem mantida cobre os casos incomuns.

Para uma análise mais profunda de como a alternância de código tensiona a precisão dos motores, veja como corrigir a alternância de código multilíngue em transcrições.

Dialetos Regionais: Seul Como Base, Jeju Como Exceção

Todos os principais motores de IA avaliam a precisão do coreano contra o coreano padrão de Seul (서울말), que é o dialeto da mídia de radiodifusão, da educação nacional e da maior parte do conteúdo online.

Dialetos regionais introduzem graus variados de divergência:

  • Gyeongsang (경상도, inclui Busan, Daegu): Acento tonal distintivo, terminações verbais diferentes. Mensuravelmente mais difícil que o coreano de Seul para motores padrão.
  • Jeolla (전라도, inclui Gwangju): Padrões de entonação diferentes e algum vocabulário distinto. Reconhecido pela maioria dos motores com alguma queda de precisão.
  • Jeju (제주): Linguisticamente distinto o suficiente para que a UNESCO o tenha classificado como língua ameaçada separada do coreano propriamente dito. Ele retém características do coreano médio ausentes do coreano padrão e é mutuamente ininteligível para muitos falantes coreanos do continente. Motores de IA de uso geral falham substancialmente com o jeju. Apenas sistemas especializados com dados de treinamento dedicados ao jeju, como a PersonaAI (que destinou aproximadamente um quarto de seu corpus de treinamento coreano de 50.000 horas a dados dialectais), lidam com o jeju com precisão significativa.

Se o seu conteúdo inclui falantes de jeju, defina as expectativas adequadamente e considere se um pós-editor humano é necessário.

Diarização de Falantes para Conteúdo em Coreano

A fala formal coreana é estruturada em turnos. O coreano casual (painéis de programas de variedades, podcasts em grupo) tem sobreposição e fala cruzada significativas.

Para diarização de falantes, as condições importam mais que o idioma:

  • Entrevista formal com 2 falantes gravada em microfones separados: a diarização funciona de forma confiável.
  • Reunião de negócios com 4 a 6 pessoas, gravação em sala única: mais desafiadora, especialmente quando os falantes cedem a palavra uns aos outros com breves sinais de concordância (네, 맞아요, 그렇죠).
  • Programa de variedades ou formato de painel: fala cruzada e reações sobrepostas reduzem a precisão em qualquer motor.

Gravação por canal (cada falante em sua própria trilha) é a melhoria isolada mais eficaz para a qualidade da diarização, independentemente da escolha do motor.

Fluxo de Trabalho Prático para Conteúdo em Coreano

Podcasts e YouTube: Envie o arquivo de áudio ou vídeo, defina o idioma como coreano explicitamente em vez de confiar na detecção automática (a detecção automática é ligeiramente mais lenta e pode confundir conteúdo com muito Konglish com inglês). Ative rótulos de falantes para programas com vários apresentadores. Exporte o SRT em coreano para os arquivos de legenda. Para o funcionamento da geração de legendas, veja a ferramenta geradora de legendas.

Reuniões de negócios: Se sua plataforma exporta um arquivo de áudio ou vídeo, qualquer um dos motores do Nível 1 produz uma transcrição de coreano utilizável. Note que ferramentas de bot de reuniões (Otter, Fireflies) não têm suporte a coreano até meados de 2026, então a transcrição baseada em arquivo é o caminho confiável.

Entrevistas de pesquisa: Pesquisa qualitativa em coreano produz transcrições que precisam ter a precisão dos níveis de fala preservada. Um glossário de nomes próprios (nomes coreanos têm múltiplas grafias possíveis em Hangul; 이 pode ser 이, 리 ou 리 em nomes diferentes) previne os erros de reconhecimento mais comuns.

Conteúdo do YouTube: O gerador de transcrição do YouTube aceita vídeos em coreano diretamente.

Minha opinião: para a maior parte do conteúdo em coreano, a escolha entre Whisper Large-v3 e Deepgram Nova-3 é marginal na prática. As melhorias de coreano documentadas da Deepgram e seu keyterm prompting são significativas para conteúdo de domínio especializado (jurídico, médico, técnico). O Whisper é a melhor escolha quando você precisa de uma opção auto-hospedada ou com custo controlado. A Naver Clova é a decisão certa quando você está construindo um produto para o mercado coreano com conteúdo exclusivamente em coreano e quer a cobertura de dialetos mais completa.

Se você só precisa de uma transcrição de coreano limpa sem configurar uma API nem implantar infraestrutura, o ConvertAudioToText lida com coreano com rótulos de falantes e exportação SRT/VTT em planos pagos, com 10 minutos gratuitos de transcrição, concedidos uma única vez no cadastro, para começar. O plano Pro pago custa US$ 9,99 por mês para transcrição ilimitada em todos os idiomas suportados.

Dicas para Melhores Resultados de Transcrição de Coreano

  1. Defina o código de idioma explicitamente. ko ou ko-KR evita que os motores gastem tempo de inferência na detecção de idioma.
  2. Forneça uma lista de termos-chave para nomes próprios coreanos. Nomes coreanos como 이준호, 박민서 e 김지원 têm cada um grafias alternativas plausíveis em Hangul; ancorá-los previne erros de substituição.
  3. Para nomes de marcas e produtos, inclua tanto a forma em Hangul coreano quanto qualquer versão em alfabeto latino que o falante possa usar alternadamente.
  4. Grave em ambientes com pouco ruído de fundo. As sibilantes coreanas (ㅅ, ㅆ, ㅈ, ㅊ) perdem definição em ruído ambiente, produzindo os erros de reconhecimento incorreto mais frequentes.
  5. Para falantes de jeju, defina as expectativas antes da transcrição. Ou busque um motor especializado ou reserve orçamento para pós-edição humana.
  6. Não presuma que uma transcrição que parece correta em inglês (nos trechos de empréstimos) esteja precisa por completo. Verifique os trechos em Hangul separadamente.

Para uma comparação de como o coreano se compara a idiomas de dificuldade semelhante, veja por que a IA tem dificuldade com idiomas de baixos recursos e o guia de transcrição de japonês para um paralelo CJK.

FAQ

O Whisper suporta bem o coreano?

Sim. O coreano está entre os idiomas mais bem representados nos dados de treinamento do Whisper Large-v3. A OpenAI avalia o coreano usando taxa de erro por caractere (CER) em vez de taxa de erro por palavra (WER), porque o espaçamento entre palavras no coreano é opcional, o que torna a WER uma métrica pouco confiável. O modelo large-v3 mostra uma redução de erro de 10-20% em relação ao large-v2 em todos os idiomas suportados. Para o coreano padrão de Seul em condições de áudio claras, o Whisper tem desempenho confiável. Dialetos regionais, especialmente o de Jeju, são consideravelmente mais difíceis.

A Otter.ai suporta transcrição de coreano?

Não. Até meados de 2026, a Otter suporta oficialmente inglês, espanhol, francês, alemão, japonês e chinês. O coreano não está na lista. A arquitetura de bot de reuniões da Otter também não oferece geração de resumo por IA em coreano. Se suas reuniões são em coreano, a transcrição baseada em arquivo com Deepgram ou Whisper é o caminho atual.

Como uma transcrição de coreano por IA deve lidar com os níveis de fala honoríficos?

Uma transcrição correta reproduz as terminações verbais reais do falante em vez de normalizar tudo para um único registro. Terminações 하십시오체 (-(으)ㅂ니다, -(으)십시오) presentes no áudio devem aparecer como 하십시오체 no texto. Isso importa porque leitores coreanos usam essas terminações para inferir a relação entre os falantes. Tanto o Whisper quanto o Deepgram preservam corretamente os níveis de fala porque transcrevem o que foi dito, não uma forma normalizada disso.

O que acontece com empréstimos do inglês em uma transcrição de coreano?

Depende se a palavra é um empréstimo totalmente integrado ao coreano ou um termo vivo do inglês. Empréstimos integrados como 핸드폰 (haendeupon, celular) e 카페 (kape, café) voltam em Hangul porque é assim que os coreanos os escrevem. Siglas em alfabeto latino como OKR, PM e KPI permanecem em latim porque a convenção coreana as mantém assim. Nomes de marcas em inglês (ChatGPT, Google) permanecem em latim. A fronteira entre essas categorias pode depender do motor para termos incomuns, e é aí que uma lista de termos-chave ajuda.

O dialeto de Jeju é apenas um sotaque coreano forte?

Não. O jeju (제주어) é uma variedade divergente do coreano classificada pela UNESCO como língua criticamente ameaçada de extinção, não um dialeto. Ele retém características do coreano médio que não existem no coreano moderno padrão e é parcial ou totalmente ininteligível para falantes coreanos do continente que não o conhecem. Motores de fala de uso geral treinados em coreano padrão falham substancialmente com o jeju. Apenas motores com dados de treinamento dedicados ao jeju (como o modelo nativo de coreano da PersonaAI, que destinou uma parcela significativa de seu corpus de 50.000 horas à fala regional) produzem transcrições confiáveis de jeju. Reserve orçamento para revisão humana se conteúdo em jeju fizer parte do seu fluxo de trabalho.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles