Corrige los nombres mal transcritos en tu transcripción (Guía 2026)
nombres-propiosnombrestranscripcióncorrección

Corrige los nombres mal transcritos en tu transcripción (Guía 2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202611 min read

Summarize this article with:

TL;DR

Los modelos de transcripción con IA sustituyen los nombres propios desconocidos por palabras fonéticamente similares que ya conocen. La solución tiene dos etapas: una pasada de buscar y reemplazar sobre una transcripción existente (en menos de cinco minutos) y una configuración de vocabulario personalizado que evita que los mismos errores aparezcan en transcripciones futuras. Elegir una herramienta con soporte de primera clase para vocabulario personalizado importa más si los nombres propios aparecen en cada grabación que procesas.

Los nombres, las marcas y los topónimos fallan en las transcripciones con IA por una sola razón: el modelo no los ha visto y los sustituye por la palabra más cercana que conoce. Tu colega Sam se convierte en «Sahm». Tu CEO Aoife se convierte en «Eva». Tu producto Convo se convierte en «Convoy». La solución tiene dos etapas: una pasada de buscar y reemplazar sobre una transcripción existente y una configuración de vocabulario personalizado que impide que los mismos errores vuelvan a aparecer.

Por qué los nombres propios fallan de forma distinta a otras palabras

Los modelos de transcripción con IA aprenden la distribución de las palabras que aparecen en sus datos de entrenamiento. Las palabras comunes y los nombres frecuentes están bien representados. Los nombres poco comunes, los nombres de pila no ingleses, los nombres técnicos de productos y las marcas inventadas están infrarrepresentados o ausentes por completo.

Cuando el modelo escucha un nombre desconocido, elige el sonido familiar más cercano. «Aoife» (un nombre irlandés que se pronuncia EE-fa) se convierte en «Eva». «Sahm» se convierte en «Sam». «Convo» se convierte en «Convoy». Esta es una propiedad del funcionamiento de los modelos de lenguaje: la salida siempre es una palabra que el modelo ha aprendido, nunca un token no visto.

Dos cosas hacen que esto sea diferente de los errores ordinarios de transcripción:

  • La sustitución es consistente. El modelo comete el mismo error cada vez que escucha ese sonido, así que una grabación larga produce la misma grafía incorrecta docenas de veces.
  • El error es fuera de vocabulario (OOV). El modelo no puede mejorar la sustitución solo con el contexto porque no tiene ninguna representación de la palabra correcta.

Ambas propiedades determinan cómo lo corriges.

La solución rápida: buscar y reemplazar

Para una transcripción que ya has recibido, buscar y reemplazar resuelve el problema en menos de cinco minutos. Crea una lista a medida que lees los primeros cientos de palabras:

Sahm → Sam
Eva → Aoife
Convoy → Convo

Aplica cada sustitución. Algunas advertencias prácticas:

  • Usa coincidencia sensible a mayúsculas y minúsculas para los nombres cortos que aparecen dentro de palabras comunes. Reemplazar «sam» sin distinguir mayúsculas romperá «same», «sample» y «Samsung».
  • Revisa si hay variantes antes de cerrar el archivo. El modelo puede haber escrito el mismo nombre de dos maneras distintas en dos párrafos diferentes (consulta el caso de «representación inconsistente» más abajo).

Para sesiones recurrentes con las mismas personas, mantén un script de sustituciones que apliques a cada nueva transcripción:

substitutions = {
    "Sahm": "Sam",
    "Eva": "Aoife",
    "Convoy": "Convo",
}

def fix_names(transcript: str) -> str:
    for wrong, right in substitutions.items():
        transcript = transcript.replace(wrong, right)
    return transcript

Esto convierte una tarea repetitiva por transcripción en un costo de configuración único. El script se ejecuta en segundos en archivos de cualquier longitud.

Herramienta de subida de audio de ConvertAudioToText: sube tu archivo, descarga la transcripción en bruto y luego aplica tu pasada de sustituciones
Herramienta de subida de audio de ConvertAudioToText: sube tu archivo, descarga la transcripción en bruto y luego aplica tu pasada de sustituciones

Si solo necesitas una transcripción limpia sobre la que aplicar esta pasada sin crear una cuenta primero, ConvertAudioToText empieza a transcribir de inmediato, sin necesidad de iniciar sesión, y exporta a texto plano o DOCX para que tus sustituciones se apliquen sobre una cadena limpia.

Cuándo buscar y reemplazar no es suficiente

Tres casos concretos rompen el enfoque de buscar y reemplazar:

Homófonos en contexto. Un colega llamado Pat no puede separarse de la palabra común «pat» sin romper todas las demás apariciones de esa palabra en la transcripción. El vocabulario personalizado enseña al modelo a leer el contexto y reconocer «Pat» como un nombre y no como una acción.

Representación inconsistente. Hay nombres que confunden tanto a los modelos que la salida varía según el párrafo. «Aoife» puede aparecer como «Eva», «Effie» y «Eve» en la misma grabación. Una sola regla de sustitución pasa por alto dos de las tres formas. El vocabulario personalizado ancla al modelo a una salida consistente.

Tokens con mayúsculas mixtas y alfanuméricos. «Web3», «iOS», «gRPC», «GPT-4o». Buscar y reemplazar funciona, pero requiere varias reglas porque el modelo genera múltiples variantes de mayúsculas y minúsculas. El vocabulario personalizado fija el formato de salida esperado en el momento de la inferencia.

Para patrones más profundos de los problemas de precisión, la entrada sobre la precisión de la transcripción explicada cubre cómo se calcula la tasa de error de palabras y dónde se concentran los errores.

La solución permanente: vocabulario personalizado

El vocabulario personalizado es preventivo en lugar de reactivo. Le das al modelo una lista de términos que debe reconocer, y esos términos se transcriben correctamente en las ejecuciones posteriores. La implementación varía según la plataforma:

HerramientaNombre de la funciónLímite de términosDónde configurarlo
Deepgram Nova-3 / FluxKeyterm prompting100 términos, límite de 500 tokensParámetro por solicitud
AssemblyAI (lotes)keyterms_promptHasta 1.000 términos (6 palabras por frase)Parámetro por solicitud
AssemblyAI word_boostword_boost + boost_paramVariable; intensidad baja/predeterminada/altaParámetro por solicitud
Otter ProVocabulario personalizado100 nombres + 100 términos por usuarioSubida en ajustes
Google Cloud STTSugerencias de frases (Chirp 3)Hasta 5.000 por solicitudSpeechContext en la solicitud
AWS TranscribeVocabulario personalizado (formato de tabla)Hasta 50 KB por archivo, 100 archivos por cuentaRecurso con nombre precreado
Azure SpeechModelos Custom SpeechAjuste fino completo del modeloPortal de Azure, costo adicional

Según la documentación de cada proveedor, verificada en julio de 2026.

Una nota sobre Whisper: la API de OpenAI Whisper acepta un parámetro initial_prompt que sesga al modelo hacia el vocabulario esperado, pero el prompt está limitado a 224 tokens y la propia documentación de Whisper describe esta técnica como «no especialmente fiable». Si los nombres propios son un problema recurrente en tu trabajo, una plataforma con soporte de primera clase para vocabulario personalizado te servirá mejor que hacer ingeniería de prompts con Whisper.

Mi opinión: para la mayoría de los usuarios individuales, el keyterm prompting de Deepgram es el más fácil de usar porque no requiere ningún recurso precreado. Pasas una lista de términos junto con tu solicitud de audio y el modelo los incorpora de inmediato. Para equipos que procesan cientos de transcripciones contra el mismo vocabulario de dominio, el enfoque de archivo de vocabulario personalizado con nombre de AWS Transcribe mantiene la lista centralizada y reutilizable en todas las solicitudes.

Qué debe incluir una buena lista de vocabulario

Las listas eficaces comparten algunas características:

  • De 20 a 100 entradas es el rango práctico. Muy pocas y se te escapan los nombres propios recurrentes; demasiadas y el modelo empieza a forzar los términos de la lista en contextos donde no pertenecen.
  • Términos específicos, no genéricos. «Convo» es una buena entrada. «Empresa» es una mala entrada porque el modelo ya la maneja bien.
  • Incluye lo inusual, omite lo obvio. Los nombres de pila de los invitados que son palabras comunes en inglés («Mark», «Kate») rara vez necesitan ayuda del vocabulario. Los nombres de pila no ingleses, las marcas inventadas y las abreviaturas técnicas sí.
  • Actualiza a medida que cambia tu contenido. Un podcast que aborda un nuevo tema o trae invitados de un nuevo campo encontrará nuevos términos OOV. Añádelos antes de grabar.

Cómo aplicar esto a flujos de trabajo específicos

Programas de entrevistas en podcast

Añade el nombre completo de cada invitado y cualquier persona que sea probable que mencione (colegas, referencias, cofundadores). Para temas técnicos, añade los nombres de productos, los nombres de empresas y la jerga específica de ese episodio. Aplica tu lista de sustituciones sobre la transcripción en bruto antes de editar. La entrada sobre la mejor transcripción para podcasts cubre consideraciones adicionales de precisión para audio grabado.

Llamadas de ventas y de clientes

Añade los nombres de tus productos, los nombres de tus clientes, los nombres de los competidores que discutes y los términos técnicos específicos de tu dominio. Estas listas tienden a mantenerse bastante estables de trimestre a trimestre. Para la transcripción de reuniones, las etiquetas de hablante combinadas con los nombres correctos reducen sustancialmente el tiempo de posprocesamiento. Para cómo transcribir una reunión de Zoom en concreto, la misma lista de vocabulario aplica a cualquier plataforma en la que grabes.

Entrevistas de investigación

Añade los nombres de todos los participantes, sus afiliaciones institucionales y la terminología especializada de tu área de investigación. Para contenido que se citará o se mencionará, los errores en nombres y nombres propios tienen consecuencias mayores que en notas informales.

Contenido multilingüe

El vocabulario personalizado ayuda con los nombres que un modelo, de otro modo, transcribiría fonéticamente con el sistema de sonidos del idioma equivocado. La entrada sobre la corrección del cambio de código multilingüe cubre más sobre ese patrón de fallo concreto.

Un flujo de trabajo práctico de construcción progresiva

El patrón en el que acaban la mayoría de los usuarios habituales:

  1. Empieza con una lista de sustituciones vacía y una lista de vocabulario vacía.
  2. En las primeras tres a cinco transcripciones, busca nombres mal transcritos y añádelos a ambas.
  3. Después de esa pasada inicial, la mayoría de los nombres propios recurrentes quedan cubiertos.
  4. Añade nombres nuevos cuando entren nuevas personas, productos o temas en tu trabajo.
  5. Si tienes acceso a la API, mueve la lista a la función de vocabulario personalizado de tu herramienta para que se aplique en el momento de la inferencia y no como paso de posprocesamiento.

La inversión de configuración es pequeña, menos de una hora para construir una lista inicial útil, y el retorno es permanente. Combina esto con la corrección de la jerga técnica si tus transcripciones también contienen abreviaturas de dominio y términos especializados.

Preguntas frecuentes

¿Por qué la transcripción con IA escribe mal el mismo nombre una y otra vez?

El modelo reemplaza el nombre desconocido por la palabra más cercana de su distribución de entrenamiento cada vez que escucha ese sonido. No es aleatorio: es una sustitución consistente porque el modelo aprendió una palabra fonéticamente similar y no la otra. El vocabulario personalizado rompe ese hábito al indicarle al modelo qué palabra esperar.

¿Funciona el vocabulario personalizado con todos los motores de transcripción?

La mayoría de las herramientas profesionales y de nivel API admiten alguna forma de ello, pero la implementación varía. Deepgram Nova-3 y Flux admiten keyterm prompting (hasta 100 términos por solicitud, con un límite de 500 tokens). AssemblyAI admite keyterms_prompt para lotes (hasta 1.000 términos) y word_boost con intensidad ajustable. Google Cloud Speech-to-Text acepta hasta 5.000 sugerencias de frases por solicitud. AWS Transcribe utiliza archivos de vocabulario personalizado con nombre (formato de tabla, hasta 50 KB). Otter Pro ofrece 100 nombres más otros 100 términos por usuario. La API de OpenAI Whisper acepta un parámetro initial_prompt de hasta 224 tokens, pero su propia documentación describe esta técnica como no especialmente fiable para los nombres propios.

¿Cuándo deja de funcionar buscar y reemplazar y necesito vocabulario personalizado?

Tres casos. Primero, homófonos: si una persona llamada Pat no puede distinguirse de la palabra común «pat» solo por su posición, un reemplazo masivo estropeará la palabra común. Segundo, representación inconsistente: si el modelo produce «Eva», «Effie» y «Eve» para el mismo nombre en el mismo archivo, necesitas varias reglas de sustitución en lugar de una sola. Tercero, tokens con mayúsculas mixtas como «gRPC» o «GPT-4o»: buscar y reemplazar es frágil porque el modelo genera varias variantes de mayúsculas y minúsculas y tienes que atraparlas todas.

¿Cuántos términos debo incluir en una lista de vocabulario personalizado?

La mayoría de los profesionales se decanta por entre 20 y 100 entradas. Si son muy pocos, se te escaparán los nombres propios recurrentes; si son demasiados, el modelo puede empezar a alucinar términos de la lista en contextos donde no pertenecen. Incluye términos específicos e inusuales, nombres que el modelo no encontraría a menudo en datos de entrenamiento generales. Omite las palabras comunes que el modelo ya maneja bien.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles