Corrija Nomes Transcritos Incorretamente na Sua Transcrição (Guia 2026)
substantivos-própriosnomestranscriçãocorreção

Corrija Nomes Transcritos Incorretamente na Sua Transcrição (Guia 2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202611 min read

Summarize this article with:

TL;DR

Modelos de transcrição por IA substituem substantivos próprios desconhecidos por palavras foneticamente semelhantes que já conhecem. A correção acontece em duas etapas: uma passagem de localizar e substituir em uma transcrição existente (em menos de cinco minutos) e uma configuração de vocabulário personalizado que impede que os mesmos erros apareçam em transcrições futuras. Escolher uma ferramenta com suporte de primeira classe a vocabulário personalizado é o que mais importa se substantivos próprios aparecem em todas as gravações que você processa.

Nomes, marcas e nomes de lugares saem errados em transcrições de IA por um único motivo: o modelo nunca os viu e substitui pela palavra mais próxima que conhece. Seu colega Sam vira "Sahm". Sua CEO Aoife vira "Eva". Seu produto Convo vira "Convoy". A correção acontece em duas etapas: uma passagem de localizar e substituir em uma transcrição existente e uma configuração de vocabulário personalizado que impede que os mesmos erros apareçam novamente.

Por Que Substantivos Próprios Erram de Forma Diferente das Outras Palavras

Modelos de transcrição por IA aprendem a distribuição das palavras que aparecem nos seus dados de treinamento. Palavras comuns e nomes comuns estão bem representados. Nomes incomuns, primeiros nomes estrangeiros, nomes técnicos de produtos e marcas inventadas estão sub-representados ou completamente ausentes.

Quando o modelo ouve um nome desconhecido, ele escolhe o som familiar mais próximo. "Aoife" (um nome irlandês pronunciado "EE-fa") vira "Eva". "Sahm" vira "Sam". "Convo" vira "Convoy". Essa é uma característica do funcionamento dos modelos de linguagem: a saída é sempre uma palavra que o modelo aprendeu, nunca um token não visto.

Dois fatores tornam isso diferente dos erros comuns de transcrição:

  • A substituição é consistente. O modelo comete o mesmo erro toda vez que ouve aquele som, então uma gravação longa produz a mesma grafia errada dezenas de vezes.
  • O erro é fora do vocabulário (OOV). O modelo não consegue melhorar a substituição apenas pelo contexto, porque não tem nenhuma representação da palavra correta.

Essas duas propriedades moldam a forma de corrigir o problema.

A Correção Rápida: Localizar e Substituir

Para uma transcrição que você já recebeu, o localizar e substituir resolve o problema em menos de cinco minutos. Monte uma lista enquanto lê as primeiras centenas de palavras:

Sahm → Sam
Eva → Aoife
Convoy → Convo

Execute cada substituição. Alguns avisos práticos:

  • Use correspondência sensível a maiúsculas e minúsculas para nomes curtos que aparecem dentro de palavras comuns. Substituir "sam" sem diferenciar maiúsculas de minúsculas vai quebrar "same", "sample" e "Samsung".
  • Verifique variações de escrita antes de fechar o arquivo. O modelo pode ter escrito o mesmo nome de duas formas diferentes em dois parágrafos diferentes (veja o caso de "renderização inconsistente" abaixo).

Para sessões recorrentes com as mesmas pessoas, mantenha um script de substituição que você aplica a cada nova transcrição:

substitutions = {
    "Sahm": "Sam",
    "Eva": "Aoife",
    "Convoy": "Convo",
}

def fix_names(transcript: str) -> str:
    for wrong, right in substitutions.items():
        transcript = transcript.replace(wrong, right)
    return transcript

Isso transforma uma tarefa repetitiva por transcrição em um custo único de configuração. O script roda em segundos em arquivos de qualquer tamanho.

Ferramenta de upload de áudio no ConvertAudioToText, envie seu arquivo, baixe a transcrição bruta e depois execute sua passagem de substituição
Ferramenta de upload de áudio no ConvertAudioToText, envie seu arquivo, baixe a transcrição bruta e depois execute sua passagem de substituição

Se você só precisa de uma transcrição limpa para aplicar essa passagem sem precisar criar uma conta antes, o ConvertAudioToText começa a transcrever imediatamente, sem login, e exporta em texto simples ou DOCX para que suas substituições rodem sobre uma string limpa.

Quando o Localizar e Substituir Não É Suficiente

Três casos específicos quebram a abordagem de localizar e substituir:

Homófonos em contexto. Um colega chamado Pat não pode ser substituído isoladamente da palavra comum "pat" sem quebrar todas as outras ocorrências dessa palavra na transcrição. O vocabulário personalizado ensina o modelo a ler o contexto e reconhecer "Pat" como um nome, e não como uma ação.

Renderização inconsistente. Alguns nomes confundem os modelos a ponto de a saída variar de parágrafo para parágrafo. "Aoife" pode aparecer como "Eva", "Effie" e "Eve" na mesma gravação. Uma única regra de substituição perde duas das três formas. O vocabulário personalizado ancora o modelo em uma saída consistente.

Tokens com maiúsculas e minúsculas misturadas e alfanuméricos. "Web3", "iOS", "gRPC", "GPT-4o". O localizar e substituir funciona, mas exige várias regras porque o modelo produz diversas variantes de capitalização. O vocabulário personalizado trava o formato de saída esperado no momento da inferência.

Para padrões mais profundos de problemas de precisão, o post sobre precisão de transcrição explicada aborda como a taxa de erro de palavras é calculada e onde os erros se concentram.

A Correção Permanente: Vocabulário Personalizado

O vocabulário personalizado é preventivo, e não reativo. Você fornece ao modelo uma lista de termos que ele deve reconhecer, e esses termos são transcritos corretamente nas execuções seguintes. A implementação varia conforme a plataforma:

FerramentaNome do recursoLimite de termosOnde configurar
Deepgram Nova-3 / FluxKeyterm prompting100 termos, limite de 500 tokensParâmetro por requisição
AssemblyAI (lote)keyterms_promptAté 1.000 termos (6 palavras por frase)Parâmetro por requisição
AssemblyAI word_boostword_boost + boost_paramVaria; intensidade baixa/padrão/altaParâmetro por requisição
Otter ProVocabulário personalizado100 nomes + 100 termos por usuárioUpload nas configurações
Google Cloud STTDicas de frases (Chirp 3)Até 5.000 por requisiçãoSpeechContext na requisição
AWS TranscribeVocabulário personalizado (formato de tabela)Até 50 KB por arquivo, 100 arquivos por contaRecurso nomeado pré-criado
Azure SpeechModelos Custom SpeechAjuste fino completo do modeloPortal do Azure, custo adicional

Segundo a documentação de cada fornecedor, verificado em julho de 2026.

Uma observação sobre o Whisper: a API do OpenAI Whisper aceita um parâmetro initial_prompt que direciona o modelo para o vocabulário esperado, mas o prompt tem limite de 224 tokens e a própria documentação do Whisper descreve essa técnica como "não especialmente confiável". Se substantivos próprios são um problema recorrente no seu trabalho, uma plataforma com suporte de primeira classe a vocabulário personalizado vai te atender melhor do que engenharia de prompt no Whisper.

Minha opinião: para a maioria dos usuários individuais, o keyterm prompting da Deepgram é o mais fácil de usar, porque não exige nenhum recurso pré-criado. Você envia uma lista de termos junto com a requisição de áudio e o modelo os incorpora imediatamente. Para equipes que rodam centenas de transcrições com o mesmo vocabulário de domínio, a abordagem de arquivo de vocabulário personalizado nomeado da AWS Transcribe mantém a lista centralizada e reutilizável em todas as requisições.

O Que Colocar em uma Boa Lista de Vocabulário

Listas eficazes compartilham algumas características:

  • 20 a 100 entradas é a faixa prática. Poucas demais e você perde substantivos próprios recorrentes; muitas demais e o modelo começa a forçar termos listados em contextos onde não pertencem.
  • Termos específicos, não genéricos. "Convo" é uma boa entrada. "Empresa" é uma entrada ruim porque o modelo já lida bem com ela.
  • Inclua o incomum, pule o óbvio. Primeiros nomes de convidados que são palavras comuns em inglês ("Mark", "Kate") raramente precisam de ajuda do vocabulário. Primeiros nomes estrangeiros, marcas inventadas e siglas técnicas sim.
  • Atualize conforme seu conteúdo muda. Um podcast que cobre uma nova área de temas ou traz convidados de um novo campo vai encontrar novos termos OOV. Adicione-os antes de gravar.

Aplicando Isso a Fluxos de Trabalho Específicos

Programas de entrevistas em podcast

Adicione o nome completo de cada convidado e qualquer pessoa que eles provavelmente mencionarão (colegas, referências, cofundadores). Para temas técnicos, adicione os nomes de produtos, nomes de empresas e jargões específicos daquele episódio. Execute sua lista de substituições na transcrição bruta antes de editar. O post melhor transcrição para podcasts aborda considerações adicionais de precisão para áudio gravado.

Chamadas de vendas e atendimento ao cliente

Adicione os nomes dos seus produtos, os nomes dos seus clientes, os nomes dos concorrentes que você discute e os termos técnicos específicos do seu domínio. Essas listas tendem a permanecer bastante estáveis de um trimestre para o outro. Para transcrição de reuniões, rótulos de falantes combinados com nomes corretos reduzem substancialmente o tempo de pós-processamento. Para como transcrever uma reunião do Zoom especificamente, a mesma lista de vocabulário vale para qualquer plataforma em que você grave.

Entrevistas de pesquisa

Adicione todos os nomes dos participantes, suas afiliações institucionais e a terminologia especializada da sua área de pesquisa. Para conteúdo que será citado ou referenciado, erros em nomes e substantivos próprios têm consequências maiores do que em anotações casuais.

Conteúdo multilíngue

O vocabulário personalizado ajuda com nomes que o modelo, de outra forma, transcreveria foneticamente segundo o sistema sonoro do idioma errado. O post correção para code-switching multilíngue aborda mais detalhes desse padrão específico de falha.

Um Fluxo de Trabalho Prático de Construção Gradual

O padrão que a maioria dos usuários frequentes adota:

  1. Comece com uma lista de substituições vazia e uma lista de vocabulário vazia.
  2. Nas primeiras três a cinco transcrições, procure nomes transcritos incorretamente e adicione-os às duas listas.
  3. Depois dessa passagem inicial, a maioria dos substantivos próprios recorrentes estará coberta.
  4. Adicione novos nomes quando novas pessoas, produtos ou temas entrarem no seu trabalho.
  5. Se você tem acesso à API, mova a lista para o recurso de vocabulário personalizado da sua ferramenta, para que ela seja aplicada no momento da inferência em vez de como etapa de pós-processamento.

O investimento de configuração é pequeno, menos de uma hora para montar uma lista inicial útil, e o retorno é permanente. Combine isso com a correção para jargão técnico se suas transcrições também contêm siglas de domínio e termos especializados.

FAQ

Por que a transcrição por IA continua escrevendo o mesmo nome errado toda vez?

O modelo substitui o nome desconhecido pela palavra mais próxima da sua distribuição de treinamento toda vez que ouve aquele som. Não é aleatório: é uma substituição consistente, porque o modelo aprendeu uma palavra foneticamente semelhante e não a outra. O vocabulário personalizado quebra esse hábito ao dizer ao modelo qual palavra esperar.

O vocabulário personalizado funciona em todos os motores de transcrição?

A maioria das ferramentas profissionais e de nível de API oferece algum tipo de suporte, mas a implementação varia. Deepgram Nova-3 e Flux oferecem keyterm prompting (até 100 termos por requisição, limite de 500 tokens). AssemblyAI oferece keyterms_prompt para lote (até 1.000 termos) e word_boost com intensidade ajustável. Google Cloud Speech-to-Text aceita até 5.000 dicas de frases por requisição. AWS Transcribe usa arquivos de vocabulário personalizado nomeados (formato de tabela, até 50 KB). Otter Pro oferece 100 nomes mais 100 outros termos por usuário. A API do OpenAI Whisper aceita um parâmetro initial_prompt de até 224 tokens, mas a própria documentação descreve essa técnica como não especialmente confiável para substantivos próprios.

Quando o localizar e substituir falha e eu preciso de vocabulário personalizado?

Três casos. Primeiro, homófonos: se uma pessoa chamada Pat não pode ser distinguida da palavra comum "pat" apenas pela posição, a substituição generalizada vai estragar a palavra comum. Segundo, renderização inconsistente: se o modelo gera "Eva", "Effie" e "Eve" para o mesmo nome no mesmo arquivo, você precisa de várias regras de substituição em vez de uma. Terceiro, tokens com maiúsculas e minúsculas misturadas como "gRPC" ou "GPT-4o": o localizar e substituir é frágil porque o modelo produz várias variantes de capitalização e você precisa capturar todas.

Quantos termos devo colocar em uma lista de vocabulário personalizado?

A maioria dos praticantes fica entre 20 e 100 entradas. Poucas demais e os substantivos próprios recorrentes escapam; muitas demais e o modelo pode começar a alucinar termos listados em contextos onde não pertencem. Inclua termos específicos e incomuns, nomes que o modelo não encontraria com frequência nos dados de treinamento gerais. Pule palavras comuns que o modelo já lida bem.

Fontes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles