
Corrija Palavras Estrangeiras na Sua Transcrição (Guia 2026)
Summarize this article with:
Quando um modelo de transcrição é configurado para o inglês, ele renderiza empréstimos estrangeiros foneticamente, como sons do inglês. A correção depende de quão previsíveis são essas palavras: use uma ferramenta baseada no Whisper para acertar de primeira os estrangeirismos comuns, keyterm prompting (Deepgram Nova-3) ou preparação por prompt (OpenAI Whisper API, AssemblyAI Universal-3 Pro) para termos específicos do seu domínio, e uma lista de localizar e substituir para frases recorrentes que sua ferramenta ainda erra. Para conteúdo em que mais de 10% da fala está em outro idioma, trate-o como alternância de códigos (code-switching), e não como empréstimos estrangeiros.
O problema tem um diagnóstico de uma frase só: sua ferramenta de transcrição foi instruída a escutar inglês, então escreveu "schadenfreude" como "shadow in frood" e "croissant" como "crossant". A correção de que você precisa depende de essas palavras estrangeiras serem previsíveis ou não.
Por Que Ferramentas em Modo Inglês Deturpam Palavras Estrangeiras
Quando um modelo de transcrição é configurado para um único idioma, ele mapeia cada som recebido para o candidato mais próximo no inventário fonêmico desse idioma. Palavras estrangeiras ficam fora desse inventário. O modelo escolhe a sequência em inglês mais parecida sonoramente e segue em frente.
Isso é diferente da alternância de códigos completa, em que os falantes alternam entre idiomas ao longo de frases inteiras. Palavras estrangeiras em uma transcrição essencialmente em inglês são empréstimos isolados: uma frase em francês, um substantivo composto alemão, um termo gastronômico japonês. O modelo está configurado para o inglês e renderiza os fonemas estrangeiros em escrita inglesa.
A boa notícia é que o Whisper Large-v3, treinado com cerca de 680.000 horas de áudio multilíngue cobrindo 99 idiomas, reconhece estrangeirismos comuns já na primeira passada, sem nenhuma configuração extra. "Bonjour", "schadenfreude", "croissant", "anime" e "karaoke" normalmente saem corretamente. As falhas se concentram em termos menos comuns, substantivos próprios e nomes de lugares regionais.
Correção 1: Escolha uma Ferramenta Treinada em Vários Idiomas
A mudança de maior impacto é migrar para uma ferramenta construída sobre o Whisper Large-v3. Como o modelo viu palavras estrangeiras nos dados de treinamento multilíngues, ele conhece as grafias corretas, e não palpites fonéticos.
- Ferramentas baseadas no Whisper (incluindo a ferramenta de áudio para texto do ConvertAudioToText, a API OpenAI Whisper e o Whisper auto-hospedado): estrangeirismos comuns em áudio em inglês normalmente sobrevivem intactos. "Düsseldorf" chega com o umlaut; "je ne sais quoi" sai como francês, e não como inglês fonético.
- Deepgram Nova-3 no modo somente inglês: aplica uma modelagem monolíngue mais rígida, então estrangeirismos saem pior sem configuração extra (veja a Correção 3 abaixo).
- Ferramentas da Web Speech API do navegador: um único idioma por sessão, por design. Palavras estrangeiras saem muito deturpadas, e não há como contornar isso senão trocando completamente o idioma da sessão.
- Google Cloud STT v1 antigo: consciência multilíngue limitada; substituído pelo v2 com conjuntos de frases (phrase sets).

A ferramenta de upload de áudio roda um pipeline baseado no Whisper que lida com estrangeirismos comuns em transcrições em inglês sem configuração extra.
Correção 2: Localizar e Substituir para Palavras Estrangeiras Recorrentes
Para palavras estrangeiras que aparecem repetidamente no seu trabalho, uma lista de substituição é a correção mais confiável, independentemente da ferramenta que você usa.
Monte a lista depois da sua primeira transcrição de um novo tema:
bone jure → bonjour
say la vee → c'est la vie
jaw da veever → joie de vivre
shadow in frood → schadenfreude
doosseldorf → Düsseldorf
moon ick → Munich
A lista acumula valor. Depois de transcrever uma dúzia de episódios de um podcast gastronômico, você já cobriu os termos culinários franceses, os nomes dos preparos italianos e os nomes dos pratos japoneses que se repetem. Aplique a lista como uma etapa de localizar e substituir em massa no final de cada transcrição dessa série.
Esta é a solução certa para:
- Podcasts que citam regularmente cozinhas, lugares ou expressões estrangeiras específicas
- Reuniões de negócios que mencionam escritórios ou parceiros internacionais pelo nome
- Conteúdo acadêmico que recorre ao latim (medicina, direito), ao alemão (filosofia) ou ao italiano (música)
Correção 3: Keyterm Prompting e Listas de Vocabulário
Várias APIs de transcrição permitem fornecer os termos esperados antes de o áudio ser processado. Isso é mais poderoso do que o pós-processamento, porque o modelo é preparado para produzir grafias específicas, e não aproximações fonéticas aleatórias.
Keyterm prompting do Deepgram Nova-3 (verificado pela documentação do Deepgram, conferido em julho de 2026): envie até 500 tokens por requisição, cerca de 100 palavras. O recurso funciona tanto para modelos Nova-3 monolíngues quanto multilíngues. Uma lista de vocabulário para um podcast em inglês com convidados internacionais pode ficar assim:
bonjour, croissant, déjà vu, faux pas, je ne sais quoi,
schadenfreude, zeitgeist, wanderlust, kindergarten,
karaoke, ramen, sayonara, piñata, tortilla
A Deepgram informa que o keyterm prompting pode melhorar a taxa de recall de palavras-chave em até 90% para os termos listados.
Parâmetro prompt da API OpenAI Whisper: passe as palavras estrangeiras e os substantivos próprios esperados no campo opcional prompt. O modelo considera os últimos 224 tokens desse prompt, o suficiente para 30 a 50 termos estrangeiros. Para listas maiores, a documentação da OpenAI recomenda, em vez disso, uma passada de pós-processamento com GPT-4 sobre a transcrição concluída.
AssemblyAI Universal-3 Pro: o modelo tem como padrão transcrever no idioma dominante do áudio. Se o seu áudio em inglês contém frases em francês, o modelo sem instruções pode traduzi-las para o inglês. Passe a instrução explícita: "Preserve o(s) idioma(s) e a escrita originais conforme falados, incluindo alternância de códigos e frases em idiomas mistos." Segundo a documentação de engenharia de prompts da AssemblyAI, especificidade importa. Quanto mais explícita a instrução, menos o modelo interpreta por conta própria.
Google Cloud STT v2: os conjuntos de frases permitem fornecer uma lista ponderada de palavras esperadas com uma pontuação de boost. Um boost maior aumenta a probabilidade de correspondência com a frase listada; a documentação observa que valores de boost muito altos podem aumentar falsos positivos, então valores moderados funcionam melhor para substantivos próprios estrangeiros.
Correção 4: Correção Manual com uma Referência
Para palavras estrangeiras imprevisíveis (um convidado que cita nomes de lugares obscuros, pratos regionais ou expressões típicas de um dialeto), a passada de correção manual é a escolha prática.
O processo: ouça a palavra estrangeira em contexto, confira a grafia correta na Wikipédia, no Google Tradutor ou em um dicionário específico do idioma, e substitua o texto deturpado. Cerca de 30 segundos por palavra nos casos comuns. Para áudios carregados de referências estrangeiras imprevisíveis, é lento, mas preciso. Para o termo ocasional mal renderizado em uma transcrição quase toda em inglês, é a decisão certa.
Como Isso se Divide por Família Linguística
O padrão de falhas é previsível o suficiente para você se preparar com antecedência.
Línguas Românicas (Francês, Espanhol, Italiano, Português)
A deturpação é foneticamente sistemática. "Bonjour" vira "bone jure", "gracias" vira "graceous", "pasta carbonara" vira "pasta carbon era". Os sons existem no inglês; o modelo apenas escolhe a palavra errada em inglês. Localizar e substituir cobre bem esses casos porque os erros são consistentes entre gravações.
Alemão
Os umlauts (a-umlaut, o-umlaut, u-umlaut) são o principal ponto de falha. "Düsseldorf" perde o umlaut ou vira "doosseldorf". Substantivos compostos podem ser divididos em palavras separadas. Adicione as grafias Unicode corretas ao seu vocabulário personalizado ou à lista de localizar e substituir.
Japonês
Estrangeirismos de alta frequência no inglês (sushi, ramen, anime, mangá, karaoke, sayonara) aparecem extensivamente nos dados de treinamento do Whisper e geralmente saem corretamente. Termos japoneses menos comuns, nomes de lugares regionais específicos e nomes de pratos fora do cânone conhecido deturpam mais. Vocabulário personalizado resolve essa camada.
Chinês
Múltiplos sistemas de romanização (Pinyin e Wade-Giles) significam que a mesma palavra tem várias grafias corretas. "Beijing" e "Shanghai" funcionam porque são onipresentes. "Chongqing", "Xiao long bao" e termos semelhantes deturpam mais. Grafias em Pinyin são mais seguras de usar em listas de vocabulário do que Wade-Giles, porque são mais comuns nos dados de treinamento modernos.
Híndi e Línguas do Sul da Ásia
Empréstimos comuns (curry, masala, naan, samosa, biryani, dharma, karma) são tratados de forma confiável por ferramentas baseadas no Whisper. Termos técnicos em sânscrito e especificidades regionais precisam de vocabulário personalizado.
Árabe
Empréstimos de alta frequência (falafel, homus, baklava) saem bem. Nomes de lugares romanizados de formas diferentes (Al Jazeera vs. Aljazeera) podem gerar saída inconsistente. Adicionar a grafia romanizada preferida à sua lista de vocabulário fixa a saída.
Um Fluxo de Trabalho Prático para Conteúdo Predominantemente em Inglês
Se o seu conteúdo é principalmente em inglês, com referências estrangeiras ocasionais:
- Transcreva com uma ferramenta baseada no Whisper. Estrangeirismos comuns saem corretamente na primeira passada.
- Percorra a transcrição procurando sequências deturpadas. Elas tendem a se concentrar em fontes específicas em língua estrangeira.
- Execute localizar e substituir para qualquer termo deturpado recorrente.
- Adicione as grafias corretas à sua lista de keyterms/vocabulário dessa ferramenta. A lista vale para todas as transcrições futuras do mesmo projeto.
- Trate termos imprevisíveis e pontuais manualmente usando uma referência.
Minha opinião: a lista de vocabulário é o investimento de maior impacto aqui. A primeira transcrição exige mais limpeza; na quinta, a ferramenta já gera automaticamente as grafias corretas dos termos estrangeiros do seu domínio.
Para conteúdo em que as palavras estrangeiras são densas ou imprevisíveis, pergunte-se se o áudio é realmente multilíngue, e não inglês com empréstimos. Se mais de cerca de 10% da fala estiver em outro idioma, a correção de alternância de códigos aplica técnicas diferentes: detecção de idioma por segmento, modo multilíngue e marcação de idioma consciente da diarização.
Ferramentas que Pioram Isso
Algumas ferramentas lidam especialmente mal com palavras estrangeiras:
- Implementações da Web Speech API do navegador: um idioma por sessão, rígidas. Palavras estrangeiras saem gravemente deturpadas, sem correção possível senão trocar o idioma da sessão.
- Ferramentas com detecção de idioma agressiva: se a ferramenta detecta palavras estrangeiras demais, pode virar a transcrição inteira para o idioma estrangeiro, quebrando as partes em inglês. Isso é raro em pipelines baseados no Whisper, mas comum em algumas implementações de STT em nuvem.
- Ferramentas de legendagem em tempo real otimizadas para fluência em inglês: ferramentas em lote lidam melhor com estrangeirismos do que ferramentas de legendagem ao vivo, porque processam a fala completa, e não fragmentos.
Para trabalho com idiomas mistos, a transcrição em lote com um pipeline baseado no Whisper é o ponto de partida correto. Combine este post com a correção de nomes transcritos errado quando as palavras estrangeiras em questão forem especificamente substantivos próprios.
Perguntas Frequentes
Por que minha ferramenta de transcrição escreve palavras francesas foneticamente, em vez de escrevê-las corretamente?
Quando uma ferramenta é configurada para um único idioma (inglês), ela mapeia cada som para a correspondência mais próxima no vocabulário desse idioma. Os fonemas do francês não têm equivalente direto em inglês, então o modelo produz a sequência em inglês mais parecida sonoramente. Mudar para um modelo treinado em vários idiomas, como o Whisper Large-v3, ou usar keyterm prompting no Deepgram Nova-3, dá ao modelo a grafia que ele deveria gerar.
O Deepgram Nova-3 lida com palavras estrangeiras em áudio que é basicamente em inglês?
O Deepgram Nova-3 no modo inglês padrão não reconhece automaticamente estrangeirismos. A solução é o recurso de keyterm prompting do Nova-3: você envia até 500 tokens (cerca de 100 palavras) de termos esperados por requisição, e o modelo reforça o reconhecimento dessas grafias exatas. Para alternância de códigos em tempo real entre inglês, espanhol, francês, alemão, híndi, russo, português, japonês, italiano e holandês, use o modo Nova-3 Multilingual.
Posso usar o parâmetro prompt da API OpenAI Whisper para listas de palavras estrangeiras?
Sim. O parâmetro prompt aceita uma lista das palavras estrangeiras ou substantivos próprios que você espera encontrar no áudio, e o modelo tenta corresponder essas grafias. O limite prático é de 224 tokens por requisição, o suficiente para 30 a 50 termos estrangeiros. Para vocabulários maiores, a documentação do Whisper recomenda executar uma passada de pós-processamento com GPT-4 sobre a transcrição.
Quando o vocabulário estrangeiro ocasional passa para o território da alternância de códigos?
Um limite útil: se mais de 10% do áudio estiver em um idioma diferente do principal, trate o arquivo como multilíngue, e não como inglês com empréstimos. As correções para palavras estrangeiras deste post (localizar e substituir, vocabulário personalizado, preparação por prompt) funcionam bem para estrangeirismos isolados e expressões consagradas. Conteúdo multilíngue contínuo exige uma abordagem diferente, coberta no post sobre correção de alternância de códigos.
Fontes
- Documentação de keyterm prompting do Deepgram Nova-3 (conferido em julho de 2026)
- Expansão de idiomas do Deepgram Nova-3 Multilingual (conferido em julho de 2026)
- Guia de fala para texto da API OpenAI Whisper (conferido em julho de 2026)
- Engenharia de prompts do AssemblyAI Universal-3 Pro (conferido em julho de 2026)
- Documentação de alternância de códigos da AssemblyAI (conferido em julho de 2026)
- Conjuntos de frases e adaptação de modelo do Google Cloud STT (conferido em julho de 2026)
- Discussão multilíngue no repositório GitHub do OpenAI Whisper (conferido em julho de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.