Corrige las palabras extranjeras en tu transcripción (Guía 2026)
palabras-extranjerasmultilingüetranscripcióncorrección

Corrige las palabras extranjeras en tu transcripción (Guía 2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

Cuando un modelo de transcripción está configurado en inglés, representa los préstamos extranjeros fonéticamente como sonidos ingleses. La solución depende de lo predecibles que sean esas palabras: usa una herramienta basada en Whisper para acertar a la primera con los préstamos comunes, keyterm prompting (Deepgram Nova-3) o prompt priming (OpenAI Whisper API, AssemblyAI Universal-3 Pro) para los términos específicos de tu ámbito, y una lista de buscar y reemplazar para las frases recurrentes que tu herramienta sigue escribiendo mal. Para contenido donde más del 10 % del habla está en otro idioma, trátalo como alternancia de códigos y no como préstamos extranjeros.

El problema tiene un diagnóstico de una sola frase: a tu herramienta de transcripción le dijeron que escuchara inglés, así que escribió "schadenfreude" como "shadow in frood" y "croissant" como "crossant". La solución que necesitas depende de si esas palabras extranjeras son predecibles o no.

Por qué las herramientas en modo inglés destrozan las palabras extranjeras

Cuando un modelo de transcripción está configurado para un solo idioma, asigna cada sonido entrante al candidato más cercano del inventario fonémico de ese idioma. Las palabras extranjeras quedan fuera de ese inventario. El modelo elige la cadena inglesa que más se parece al sonido y sigue adelante.

Esto es diferente de la alternancia de códigos completa, donde los hablantes alternan entre idiomas a lo largo de frases enteras. Las palabras extranjeras en una transcripción que por lo demás está en inglés son préstamos aislados: una frase francesa, un sustantivo compuesto alemán, un término gastronómico japonés. El modelo está configurado en inglés y representa los fonemas extranjeros con escritura inglesa.

La buena noticia es que Whisper Large-v3, entrenado con unas 680 000 horas de audio multilingüe que abarca 99 idiomas, reconoce los préstamos comunes a la primera sin ninguna configuración adicional. "Bonjour", "schadenfreude", "croissant", "anime" y "karaoke" suelen salir correctamente. Los fallos se concentran en los términos menos comunes, los nombres propios y los topónimos regionales.

Solución 1: Elige una herramienta entrenada de forma multilingüe

El cambio de mayor impacto es pasarte a una herramienta construida sobre Whisper Large-v3. Como el modelo ha visto palabras extranjeras en sus datos de entrenamiento multilingües, ha visto grafías correctas y no meras conjeturas fonéticas.

  • Herramientas basadas en Whisper (incluida la herramienta de audio a texto de ConvertAudioToText, la OpenAI Whisper API y Whisper autoalojado): los préstamos extranjeros comunes en audio en inglés suelen sobrevivir intactos. "Düsseldorf" llega con su diéresis; "je ne sais quoi" aparece como francés y no como inglés fonético.
  • Deepgram Nova-3 en modo solo inglés: aplica un modelado monolingüe más estricto, así que los préstamos extranjeros salen peor sin configuración adicional (consulta la Solución 3 más abajo).
  • Herramientas con la Web Speech API del navegador: un solo idioma por sesión, por diseño. Las palabras extranjeras se destrozan y no hay forma de evitarlo salvo cambiar por completo el idioma de la sesión.
  • Google Cloud STT v1 antiguo: conocimiento multilingüe limitado; sustituido por la v2 con conjuntos de frases.

Herramienta de carga de audio de ConvertAudioToText
Herramienta de carga de audio de ConvertAudioToText

La herramienta de carga de audio ejecuta un flujo basado en Whisper que maneja los préstamos extranjeros comunes en transcripciones en inglés sin configuración adicional.

Solución 2: Buscar y reemplazar para las palabras extranjeras recurrentes

Para las palabras extranjeras que aparecen repetidamente en tu trabajo, una lista de sustituciones es la solución más fiable, independientemente de la herramienta que uses.

Construye la lista después de tu primera transcripción sobre un tema nuevo:

bone jure        → bonjour
say la vee       → c'est la vie
jaw da veever    → joie de vivre
shadow in frood  → schadenfreude
doosseldorf      → Düsseldorf
moon ick         → Munich

La lista gana valor con el tiempo. Después de transcribir una docena de episodios de un pódcast gastronómico, ya habrás cubierto los términos culinarios franceses, los nombres de las elaboraciones italianas y los nombres de platos japoneses que se repiten. Aplica la lista como un paso masivo de buscar y reemplazar al final de cada transcripción de esa serie.

Es la herramienta adecuada para:

  • Pódcasts que mencionan habitualmente cocinas, lugares o expresiones extranjeras concretas
  • Reuniones de negocio que citan oficinas internacionales o socios por su nombre
  • Contenido académico que recurre al latín (medicina, derecho), al alemán (filosofía) o al italiano (música)

Solución 3: Keyterm prompting y listas de vocabulario

Varias APIs de transcripción te permiten suministrar los términos esperados antes de procesar el audio. Esto es más potente que el posprocesamiento porque el modelo llega preparado para producir grafías específicas, no aproximaciones fonéticas aleatorias.

Keyterm prompting de Deepgram Nova-3 (verificado en la documentación de Deepgram, comprobado en julio de 2026): pasa hasta 500 tokens por solicitud, unas 100 palabras. La función funciona tanto con los modelos Nova-3 monolingües como con los multilingües. Una lista de vocabulario para un pódcast en inglés con invitados internacionales podría ser así:

bonjour, croissant, déjà vu, faux pas, je ne sais quoi,
schadenfreude, zeitgeist, wanderlust, kindergarten,
karaoke, ramen, sayonara, piñata, tortilla

Deepgram informa de que el keyterm prompting puede mejorar la tasa de recuperación de palabras clave hasta un 90 % para los términos incluidos en la lista.

Parámetro prompt de la OpenAI Whisper API: pasa las palabras extranjeras y los nombres propios esperados en el campo opcional prompt. El modelo tiene en cuenta los últimos 224 tokens de ese prompt, lo que basta para entre 30 y 50 términos extranjeros. Para listas más grandes, la documentación de OpenAI recomienda en su lugar una pasada de posprocesamiento con GPT-4 sobre la transcripción terminada.

AssemblyAI Universal-3 Pro: el modelo transcribe por defecto en el idioma dominante del audio. Si tu audio en inglés contiene frases en francés, el modelo sin instrucciones puede traducirlas al inglés. Pásale la instrucción explícita: "Conserva el idioma o los idiomas originales y su escritura tal como se pronuncian, incluidas la alternancia de códigos y las frases en varios idiomas". Según la documentación de ingeniería de prompts de AssemblyAI, la especificidad importa. Cuanto más explícita sea la instrucción, menos interpretará el modelo por su cuenta.

Google Cloud STT v2: los conjuntos de frases (phrase sets) te permiten suministrar una lista ponderada de palabras esperadas con una puntuación de refuerzo (boost). Un boost más alto aumenta la probabilidad de coincidir con la frase de la lista; la documentación señala que valores muy altos de boost pueden aumentar los falsos positivos, así que los valores moderados funcionan mejor para los nombres propios extranjeros.

Solución 4: Corrección manual con una referencia

Para las palabras extranjeras impredecibles (un invitado que menciona topónimos poco conocidos, platos regionales o expresiones propias de un dialecto), la pasada de corrección manual es la opción práctica.

El proceso: escucha la palabra extranjera en contexto, busca la grafía correcta en Wikipedia, Google Translate o un diccionario específico de ese idioma, y sustituye el texto destrozado. Unos 30 segundos por palabra en los casos comunes. Para audio cargado de referencias extranjeras impredecibles, es lento pero preciso. Para el término ocasional mal escrito en una transcripción mayoritariamente en inglés, es la decisión correcta.

Cómo varía esto según la familia lingüística

El patrón de fallos es lo bastante predecible como para que puedas prepararte con antelación.

Lenguas romances (francés, español, italiano, portugués)

Los destrozos son sistemáticos desde el punto de vista fonético. "Bonjour" se convierte en "bone jure", "gracias" en "graceous" y "pasta carbonara" en "pasta carbon era". Los sonidos existen en inglés; el modelo simplemente elige la palabra inglesa equivocada. Buscar y reemplazar cubre bien estos casos porque los errores son consistentes entre grabaciones.

Alemán

Los umlauts (a-umlaut, o-umlaut, u-umlaut) son el principal punto de fallo. "Düsseldorf" pierde la diéresis o se convierte en "doosseldorf". Los sustantivos compuestos pueden dividirse en palabras separadas. Añade las grafías Unicode correctas a tu vocabulario personalizado o a tu lista de buscar y reemplazar.

Japonés

Los préstamos de alta frecuencia en inglés (sushi, ramen, anime, manga, karaoke, sayonara) aparecen extensamente en los datos de entrenamiento de Whisper y suelen salir correctamente. Los términos japoneses menos comunes, los topónimos regionales concretos y los nombres de platos fuera del canon familiar se destrozan más. El vocabulario personalizado cubre este nivel.

Chino

Los múltiples sistemas de romanización (Pinyin y Wade-Giles) hacen que una misma palabra tenga varias grafías correctas. "Beijing" y "Shanghai" funcionan porque son ubicuos. "Chongqing", "Xiao long bao" y términos similares se destrozan más. Las grafías en Pinyin son más seguras que las de Wade-Giles para las listas de vocabulario porque son más comunes en los datos de entrenamiento modernos.

Hindi y lenguas del sur de Asia

Los préstamos comunes (curry, masala, naan, samosa, biryani, dharma, karma) los manejan con fiabilidad las herramientas basadas en Whisper. Los términos técnicos sánscritos y los detalles regionales necesitan vocabulario personalizado.

Árabe

Los préstamos de alta frecuencia (falafel, hummus, baklava) salen bien. Los topónimos romanizados de varias maneras (Al Jazeera frente a Aljazeera) pueden producir resultados inconsistentes. Añadir la grafía romanizada preferida a tu lista de vocabulario fija el resultado.

Un flujo de trabajo práctico para contenido mayoritariamente en inglés

Si tu contenido es principalmente en inglés con referencias extranjeras ocasionales:

  1. Transcribe con una herramienta basada en Whisper. Los préstamos comunes salen correctamente a la primera.
  2. Repasa la transcripción buscando cadenas destrozadas. Suelen agruparse alrededor de fuentes concretas en otros idiomas.
  3. Ejecuta buscar y reemplazar para cualquier término destrozado recurrente.
  4. Añade las grafías correctas a tu lista de keyterms/vocabulario de esa herramienta. La lista se mantiene para cada transcripción futura del mismo proyecto.
  5. Gestiona manualmente los términos únicos e impredecibles usando una referencia.

Mi opinión: la lista de vocabulario es la inversión de mayor impacto aquí. La primera transcripción requiere más limpieza; para la quinta, la herramienta ya muestra automáticamente las grafías correctas de los términos extranjeros de tu ámbito.

Para contenido donde las palabras extranjeras son densas o impredecibles, pregúntate si el audio es realmente multilingüe y no inglés con préstamos. Si más del 10 % del habla está en otro idioma, la solución para la alternancia de códigos aplica técnicas diferentes: detección de idioma por segmento, modo multilingüe y etiquetado de idioma consciente de la diarización.

Herramientas que empeoran el problema

Algunas herramientas manejan especialmente mal las palabras extranjeras:

  • Implementaciones de la Web Speech API del navegador: un idioma por sesión, estricto. Las palabras extranjeras se destrozan gravemente y no hay arreglo salvo cambiar el idioma de la sesión.
  • Herramientas con detección de idioma agresiva: si la herramienta detecta demasiadas palabras extranjeras, puede volcar toda la transcripción al idioma extranjero, rompiendo las partes en inglés. Esto es raro en flujos basados en Whisper, pero común en algunas implementaciones de STT en la nube.
  • Herramientas de subtitulado en tiempo real optimizadas para la fluidez en inglés: las herramientas por lotes manejan mejor los préstamos extranjeros que las de subtitulado en vivo porque procesan la intervención completa en lugar de fragmentos.

Para trabajo con idiomas mezclados, la transcripción por lotes con un flujo basado en Whisper es el punto de partida correcto. Combina esta entrada con la solución para nombres mal transcritos cuando las palabras extranjeras en cuestión sean específicamente nombres propios.

Preguntas frecuentes

¿Por qué mi herramienta de transcripción escribe las palabras francesas fonéticamente en lugar de escribirlas correctamente?

Cuando una herramienta está configurada para un solo idioma (inglés), asigna cada sonido a la coincidencia más cercana en el vocabulario de ese idioma. Los fonemas franceses no tienen equivalente directo en inglés, así que el modelo produce la cadena inglesa que más se parece al sonido. Cambiar a un modelo entrenado de forma multilingüe como Whisper Large-v3, o usar el keyterm prompting en Deepgram Nova-3, le da al modelo la grafía que debería mostrar.

¿Gestiona Deepgram Nova-3 las palabras extranjeras en un audio que por lo demás está en inglés?

Deepgram Nova-3 en modo inglés estándar no reconoce automáticamente los préstamos extranjeros. La solución es la función de keyterm prompting de Nova-3: pasas hasta 500 tokens (unas 100 palabras) de términos esperados por solicitud, y el modelo refuerza el reconocimiento de esas grafías exactas. Para la alternancia de códigos en tiempo real entre inglés, español, francés, alemán, hindi, ruso, portugués, japonés, italiano y neerlandés, usa en su lugar el modo Nova-3 Multilingual.

¿Puedo usar el parámetro prompt de la OpenAI Whisper API para listas de palabras extranjeras?

Sí. El parámetro prompt acepta una lista de las palabras extranjeras o nombres propios que esperas encontrar en el audio, y el modelo intenta ajustarse a esas grafías. El límite práctico es de 224 tokens por solicitud, suficiente para entre 30 y 50 términos extranjeros. Para vocabularios más grandes, la documentación de Whisper recomienda ejecutar en su lugar una pasada de posprocesamiento con GPT-4 sobre la transcripción.

¿Cuándo cruza el vocabulario extranjero ocasional al territorio de la alternancia de códigos?

Un umbral útil: si más del 10 % del audio está en un idioma distinto del principal, trata el archivo como multilingüe y no como inglés con préstamos. Las soluciones para palabras extranjeras de esta entrada (buscar y reemplazar, vocabulario personalizado, prompt priming) funcionan bien con préstamos aislados y frases hechas. El contenido sostenidamente multilingüe necesita otro enfoque, cubierto en la entrada sobre la solución para la alternancia de códigos.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles