Por qué la transcripción comete errores: los modos de fallo explicados
precisión de transcripciónerrorestécnico

Por qué la transcripción comete errores: los modos de fallo explicados

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Los errores de transcripción se dividen en cinco categorías con soluciones distintas: acústicos (el modelo oyó mal; arregla la grabación), lingüísticos (homófonos y nombres desconocidos; añade vocabulario o edita), atribución de hablante (límites de la diarización), errores de límite temporal (palabras correctas, marcas de tiempo equivocadas) y alucinaciones (texto inventado como 'gracias por vernos' durante el silencio; recorta el silencio). Diagnostica la categoría antes de culpar al motor, porque los errores rara vez son aleatorios.

La respuesta corta

Los errores de transcripción con IA se dividen en cinco categorías distintas, cada una con una causa raíz diferente. Saber a qué categoría pertenece un error te indica dónde centrar la corrección. Los errores que parecen aleatorios normalmente no lo son en absoluto.

Sube una muestra de tu audio real para ver qué modos de fallo se aplican
Sube una muestra de tu audio real para ver qué modos de fallo se aplican

Errores acústicos: el modelo no escuchó bien

La causa subyacente es una señal de audio degradada. Cuando el sonido que llega al modelo es ambiguo, el modelo hace una suposición y, a veces, se equivoca.

Los culpables acústicos más comunes:

Audio telefónico de banda estrecha. La telefonía estándar codifica el habla a 8 kHz, lo que elimina la mayor parte del contenido de frecuencia por encima de 4 kHz. Un análisis comparativo de 2025 sobre grabaciones reales de centros de llamadas descubrió que incluso el mejor sistema alcanzaba solo un 87,7% de precisión con ese audio, frente al 95-99% que se ve habitualmente en grabaciones de banda ancha. Las frecuencias altas que faltan son precisamente las que distinguen ciertas fricativas y oclusivas entre sí.

Ruido de fondo. El ruido enmascara la señal de voz y reduce la relación señal-ruido. Lo que recibe el modelo es una mezcla de voces y entorno, no una voz limpia. Consulta cómo lidiar con el ruido de fondo en la transcripción para ver las opciones técnicas.

Distancia y reverberación. Un micrófono al otro lado de la habitación capta un borrón de reverberación del sonido original. Cuando la forma de onda llega al modelo, los bordes de las consonantes están difuminados y las palabras cortas desaparecen entre los reflejos de la sala.

Artefactos del micrófono. Los chasquidos de las oclusivas, el ruido del viento, el recorte y las caídas de señal eliminan información que el modelo necesita para distinguir fonemas. Una forma de onda recortada es irrecuperable; el modelo ve una línea plana donde debería haber una consonante.

Mi opinión: los errores acústicos casi siempre se pueden corregir en el origen. Un micrófono direccional a corta distancia en una habitación silenciosa supone una mejora de precisión mayor que cambiar de proveedor de transcripción.

Errores lingüísticos: el modelo oyó bien pero eligió mal

El modelo recibió el audio correctamente pero seleccionó la palabra equivocada entre opciones acústicamente similares. Es un fallo del modelo de lenguaje, no de la señal.

Homófonos

"Their", "there" y "they're" suenan idénticos. El modelo usa el contexto circundante para elegir uno, y con frases cortas o turnos de palabra rápidos, ese contexto es escaso. Lo mismo ocurre con "affect" frente a "effect", "principal" frente a "principle", y cientos de pares similares. La elección es probabilística, y el modelo a veces se equivoca con total seguridad.

Palabras fuera de vocabulario (OOV)

Este es uno de los modos de fallo más consistentes. Cada modelo de transcripción tiene un vocabulario entrenado. Las palabras fuera de ese vocabulario, casi siempre nombres propios, marcas, apellidos poco comunes y términos especializados, se reconocen mal como el equivalente más cercano dentro del vocabulario. El modelo no puede generar algo para lo que nunca fue entrenado.

Una empresa llamada "Atrion" aparece como "Adrian". Un nombre de fármaco como "Dupixent" se convierte en "duplex aunt". El nombre de un fundador se transcribe como la palabra común más parecida. Los errores OOV duelen justo donde más importa la precisión, porque los nombres y los términos de marca cargan un significado que una sustitución genérica destruye.

Mitigación práctica: tanto Deepgram como los sistemas basados en Whisper admiten sesgo de vocabulario o indicaciones iniciales. Alimentar una lista de nombres propios esperados antes de la transcripción reduce sustancialmente los fallos OOV.

Números y formatos

"Three fifty", "three hundred fifty", "350" y "3:50" son todas interpretaciones plausibles de la misma expresión según el contexto. El modelo elige una y a menudo se equivoca de registro. Los contextos técnicos con mucha densidad de números, como documentos legales, llamadas financieras o conferencias científicas, tienden a producir una tasa de error más alta en los números.

Vocabulario de dominio

Los campos médico, legal, científico y técnico tienen jerga que está poco representada en los datos de entrenamiento generales. "Dysarthria" se transcribe como "this arthria". "Fiduciary" a veces aparece como "field theory". El modelo opta por la palabra más común que ocupa un espacio acústico similar.

Para más detalles sobre cómo eligen los modelos entre candidatos en competencia, consulta explicación de la precisión de la transcripción.

Errores del hablante: palabras correctas, persona equivocada

La diarización asigna palabras a los hablantes. Cuando falla, la transcripción es correcta pero la atribución no. Según una investigación publicada en 2025, las tasas de error de diarización en un solo canal en audio sin segmentar oscilan entre el 10 y el 18%.

Por qué se confunden las voces

La diarización de hablantes funciona extrayendo una huella de voz para cada segmento y agrupándolos. Dos hablantes con tono, ritmo de habla y acento similares quedan cerca en ese espacio de huellas, y el algoritmo de agrupación asigna mal los segmentos.

Los turnos cortos lo empeoran. Cuando alguien dice solo "sí" o "ajá" antes de devolver la palabra, el modelo casi no tiene señal para fijar la identidad de ese hablante. Esos apoyos de una sola palabra se atribuyen mal con frecuencia.

Conversación cruzada: el caso más difícil

Cuando dos personas hablan a la vez en un mismo micrófono, sus rasgos acústicos se funden en una sola onda y el algoritmo de diarización no puede separarlos matemáticamente. El resultado es que se pierde a uno de los hablantes o aparece un hablante fantasma que no existe en la realidad. Los sistemas de diarización conscientes de la superposición detectan estas regiones de forma explícita y las marcan, lo cual es mejor que una atribución errónea silenciosa, pero el contenido subyacente sigue siendo ambiguo.

La grabación multicanal, con un micrófono por hablante, resuelve esto de forma limpia. La separación de canales le da al modelo una señal que la diarización con un solo micrófono no puede reproducir.

Consulta cómo funciona la diarización de hablantes para un desglose más completo del proceso de agrupación.

Errores de límite: palabras correctas, posiciones equivocadas

Las palabras en los bordes de los segmentos de audio son siempre el punto de mayor riesgo para los errores. Hay dos mecanismos que los provocan.

Recorte por detección de actividad de voz

La mayoría de los pipelines de transcripción usan la detección de actividad de voz (VAD) para identificar las regiones de habla y saltarse el silencio. Una VAD agresiva se activa un poco antes o después de lo debido, recortando el primer fonema de una emisión o la última consonante de una frase. Palabras cortas como "sí", "no" o "y" desaparecen por completo. El error es invisible porque no hay una palabra equivocada en la transcripción; la palabra correcta simplemente no está.

Artefactos en los límites de fragmentos en Whisper

Whisper procesa audio largo en ventanas de 30 segundos, avanzando según las marcas de tiempo previstas. Las palabras que cruzan un límite de fragmento se procesan dos veces, una al final de una ventana y otra al principio de la siguiente. El resultado es duplicación de palabras, omisión de palabras o un empalme que fusiona dos palabras distintas. Este es un comportamiento documentado en el pipeline de transcripción de audio largo de Whisper, no un caso excepcional.

Herramientas como WhisperX añaden un paso de alineación específico que vuelve a anclar las marcas temporales de las palabras contra la señal de audio después de la decodificación, lo que reduce, aunque no elimina, estos artefactos en los límites.

Al revisar una transcripción, las posiciones de los límites entre segmentos, aproximadamente cada 30 segundos, son los lugares con mayor probabilidad de contener este tipo de error.

Alucinación: palabras que nadie dijo

El modelo produjo texto sin audio correspondiente. Esto es cualitativamente distinto de las otras categorías porque no hay una entrada real que se haya malinterpretado; el modelo inventó la salida de la nada.

Silencios largos y audio sin habla

Está ampliamente documentado que Whisper genera texto durante silencios, música de fondo o ruido que no es habla. Las alucinaciones concretas no son aleatorias: como Whisper se entrenó con unas 680.000 horas de audio web que incluían grandes cantidades de contenido de YouTube, ha aprendido a asociar el silencio cerca del final de una grabación con frases de cierre de vídeo. Salidas como "Gracias por vernos" o "Suscríbete a mi canal" que aparecen en la transcripción de una declaración judicial son texto que Whisper inserta porque lo aprendió de los guiones de cierre de YouTube, no texto que nadie pronunciara realmente.

Bucles de repetición

Otro modo de fallo reconocido y aparte es el bucle de repetición: el decodificador se queda atascado generando la misma frase una y otra vez hasta que algo en el audio proporciona un nuevo anclaje. La investigación ha documentado este comportamiento en 14 de los 19 idiomas auditados. El patrón es visualmente evidente, una frase que se repite cinco o diez veces seguidas, y debe tratarse como una señal para truncar esa sección.

Fuga de datos de entrenamiento

Más allá de las frases de YouTube, se ha demostrado que Whisper produce frases que parecen provenir de sus datos de entrenamiento en lugar del audio de entrada. Estas son difíciles de detectar automáticamente porque son gramaticalmente plausibles. Las comprobaciones manuales puntuales de transcripciones de regiones de audio silenciosas o muy bajas son la forma más fiable de detectarlas.

Una mitigación: VAD antes del modelo, para que el modelo nunca vea las regiones de silencio que desencadenan la alucinación. La mayoría de los pipelines de transcripción bien configurados hacen esto por defecto.

Cómo se combinan las categorías

Una grabación real casi nunca falla en una sola categoría. Un podcast con dos presentadores que ocasionalmente se pisan al hablar, grabado con micrófonos de portátil en una sala con ruido de climatización, producirá errores acústicos, fallos de diarización durante los solapamientos, errores OOV cuando los invitados mencionan nombres poco comunes, y alucinación durante el silencio previo al episodio. El perfil de error es aditivo.

El diagnóstico más eficiente es tomar diez errores de tu transcripción, clasificar cada uno por categoría, y ver cuál domina. Eso te dice dónde invertir el esfuerzo de corrección.

Condición de audioRango de precisión típico
Grabación en estudio, un solo hablante, vocabulario común95 a 99 por ciento
Oficina en casa, un solo hablante, micrófono decente90 a 96 por ciento
Videoconferencia, configuración profesional, varios hablantes85 a 92 por ciento
Llamada telefónica o VoIP, audio de banda estrecha80 a 88 por ciento
Grabación de campo, varios hablantes, ruido ambiental70 a 85 por ciento
Acento marcado en audio degradadoPor debajo del 70 por ciento en los peores casos

Los rangos de precisión provienen del benchmark de AssemblyAI de 2026 y del estudio de centros de llamadas de Voicegain de 2025. Los resultados individuales varían según el motor y el audio.

Dónde acudir para las correcciones

Este post explica los mecanismos. Para las mitigaciones prácticas:

Si quieres probar tu propio audio antes de invertir tiempo en arreglos, el plan gratuito de ConvertAudioToText te permite subir hasta 10 minutos sin necesidad de cuenta. El resultado te mostrará qué categoría de error predomina en tu archivo concreto.

Preguntas frecuentes

¿Por qué mi transcripción dice "gracias por vernos" si nadie lo dijo?

Es una alucinación documentada de Whisper ligada a sus datos de entrenamiento. Whisper aprendió de unas 680.000 horas de audio de la web, una gran parte proveniente de vídeos de YouTube con subtítulos. El modelo asocia el silencio o el ruido no verbal con los finales típicos de los vídeos de YouTube y genera esas frases como salida. No está transcribiendo algo apenas audible de fondo, sino que hace coincidencia de patrones ante la ausencia de habla.

¿Por qué los nombres propios casi siempre salen mal en mis transcripciones?

Los nombres propios, apellidos, marcas y nombres de pila poco comunes están infrarrepresentados en los datos generales de entrenamiento. Cuando el modelo encuentra un nombre que rara vez o nunca ha visto, lo sustituye por la palabra más cercana en su vocabulario que encaje con el patrón acústico. Es el problema de vocabulario fuera de alcance (OOV, por sus siglas en inglés), y es uno de los fallos más constantes en todos los motores de transcripción. El sesgo de vocabulario o un prompt inicial que liste los nombres esperados es la solución directa.

¿Por qué a veces el mismo orador aparece etiquetado como dos personas distintas?

La diarización de hablantes funciona agrupando embeddings de voz. Las intervenciones cortas, palabras sueltas o muletillas no contienen suficiente señal acústica como para anclar de forma fiable la identidad de un hablante. El modelo las asigna al clúster más cercano en ese momento, que puede no ser el hablante correcto. Esto es especialmente habitual en intercambios rápidos donde las respuestas breves se alternan con rapidez.

¿Puede la transcripción con IA alucinar alguna vez con audio claramente hablado?

Sí, pero es raro. El escenario más común es la alucinación durante silencios, música o ruido no vocal. Con audio claramente hablado, los errores más probables son sustituciones (se elige una palabra incorrecta) más que inserciones (se inventa una palabra). La alucinación real sobre habla limpia ocurre, sobre todo con bucles de repetición donde el decodificador se queda atascado, pero es un mecanismo distinto al que se dispara con el silencio.

¿Puedo hacer algo con los errores de transcripción causados por hablantes que se solapan?

La solución más eficaz es grabar con micrófonos separados, uno por hablante. El audio multicanal elimina la mezcla de formas de onda que hace imposible diarizar correctamente las interferencias. Si eso no es viable, la mayoría de los sistemas modernos de diarización tienen un modo de detección de solapamiento que al menos marca los segmentos ambiguos en lugar de hacer una atribución errónea en silencio. Corrige manualmente esos segmentos marcados después.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles