
Por qué la transcripción comete errores: los modos de fallo explicados
Summarize this article with:
Los errores de transcripción se dividen en cinco categorías con soluciones distintas: acústicos (el modelo oyó mal; arregla la grabación), lingüísticos (homófonos y nombres desconocidos; añade vocabulario o edita), atribución de hablante (límites de la diarización), errores de límite temporal (palabras correctas, marcas de tiempo equivocadas) y alucinaciones (texto inventado como 'gracias por vernos' durante el silencio; recorta el silencio). Diagnostica la categoría antes de culpar al motor, porque los errores rara vez son aleatorios.
La respuesta corta
Los errores de transcripción con IA se dividen en cinco categorías distintas, cada una con una causa raíz diferente. Saber a qué categoría pertenece un error te indica dónde centrar la corrección. Los errores que parecen aleatorios normalmente no lo son en absoluto.

Errores acústicos: el modelo no escuchó bien
La causa subyacente es una señal de audio degradada. Cuando el sonido que llega al modelo es ambiguo, el modelo hace una suposición y, a veces, se equivoca.
Los culpables acústicos más comunes:
Audio telefónico de banda estrecha. La telefonía estándar codifica el habla a 8 kHz, lo que elimina la mayor parte del contenido de frecuencia por encima de 4 kHz. Un análisis comparativo de 2025 sobre grabaciones reales de centros de llamadas descubrió que incluso el mejor sistema alcanzaba solo un 87,7% de precisión con ese audio, frente al 95-99% que se ve habitualmente en grabaciones de banda ancha. Las frecuencias altas que faltan son precisamente las que distinguen ciertas fricativas y oclusivas entre sí.
Ruido de fondo. El ruido enmascara la señal de voz y reduce la relación señal-ruido. Lo que recibe el modelo es una mezcla de voces y entorno, no una voz limpia. Consulta cómo lidiar con el ruido de fondo en la transcripción para ver las opciones técnicas.
Distancia y reverberación. Un micrófono al otro lado de la habitación capta un borrón de reverberación del sonido original. Cuando la forma de onda llega al modelo, los bordes de las consonantes están difuminados y las palabras cortas desaparecen entre los reflejos de la sala.
Artefactos del micrófono. Los chasquidos de las oclusivas, el ruido del viento, el recorte y las caídas de señal eliminan información que el modelo necesita para distinguir fonemas. Una forma de onda recortada es irrecuperable; el modelo ve una línea plana donde debería haber una consonante.
Mi opinión: los errores acústicos casi siempre se pueden corregir en el origen. Un micrófono direccional a corta distancia en una habitación silenciosa supone una mejora de precisión mayor que cambiar de proveedor de transcripción.
Errores lingüísticos: el modelo oyó bien pero eligió mal
El modelo recibió el audio correctamente pero seleccionó la palabra equivocada entre opciones acústicamente similares. Es un fallo del modelo de lenguaje, no de la señal.
Homófonos
"Their", "there" y "they're" suenan idénticos. El modelo usa el contexto circundante para elegir uno, y con frases cortas o turnos de palabra rápidos, ese contexto es escaso. Lo mismo ocurre con "affect" frente a "effect", "principal" frente a "principle", y cientos de pares similares. La elección es probabilística, y el modelo a veces se equivoca con total seguridad.
Palabras fuera de vocabulario (OOV)
Este es uno de los modos de fallo más consistentes. Cada modelo de transcripción tiene un vocabulario entrenado. Las palabras fuera de ese vocabulario, casi siempre nombres propios, marcas, apellidos poco comunes y términos especializados, se reconocen mal como el equivalente más cercano dentro del vocabulario. El modelo no puede generar algo para lo que nunca fue entrenado.
Una empresa llamada "Atrion" aparece como "Adrian". Un nombre de fármaco como "Dupixent" se convierte en "duplex aunt". El nombre de un fundador se transcribe como la palabra común más parecida. Los errores OOV duelen justo donde más importa la precisión, porque los nombres y los términos de marca cargan un significado que una sustitución genérica destruye.
Mitigación práctica: tanto Deepgram como los sistemas basados en Whisper admiten sesgo de vocabulario o indicaciones iniciales. Alimentar una lista de nombres propios esperados antes de la transcripción reduce sustancialmente los fallos OOV.
Números y formatos
"Three fifty", "three hundred fifty", "350" y "3:50" son todas interpretaciones plausibles de la misma expresión según el contexto. El modelo elige una y a menudo se equivoca de registro. Los contextos técnicos con mucha densidad de números, como documentos legales, llamadas financieras o conferencias científicas, tienden a producir una tasa de error más alta en los números.
Vocabulario de dominio
Los campos médico, legal, científico y técnico tienen jerga que está poco representada en los datos de entrenamiento generales. "Dysarthria" se transcribe como "this arthria". "Fiduciary" a veces aparece como "field theory". El modelo opta por la palabra más común que ocupa un espacio acústico similar.
Para más detalles sobre cómo eligen los modelos entre candidatos en competencia, consulta explicación de la precisión de la transcripción.
Errores del hablante: palabras correctas, persona equivocada
La diarización asigna palabras a los hablantes. Cuando falla, la transcripción es correcta pero la atribución no. Según una investigación publicada en 2025, las tasas de error de diarización en un solo canal en audio sin segmentar oscilan entre el 10 y el 18%.
Por qué se confunden las voces
La diarización de hablantes funciona extrayendo una huella de voz para cada segmento y agrupándolos. Dos hablantes con tono, ritmo de habla y acento similares quedan cerca en ese espacio de huellas, y el algoritmo de agrupación asigna mal los segmentos.
Los turnos cortos lo empeoran. Cuando alguien dice solo "sí" o "ajá" antes de devolver la palabra, el modelo casi no tiene señal para fijar la identidad de ese hablante. Esos apoyos de una sola palabra se atribuyen mal con frecuencia.
Conversación cruzada: el caso más difícil
Cuando dos personas hablan a la vez en un mismo micrófono, sus rasgos acústicos se funden en una sola onda y el algoritmo de diarización no puede separarlos matemáticamente. El resultado es que se pierde a uno de los hablantes o aparece un hablante fantasma que no existe en la realidad. Los sistemas de diarización conscientes de la superposición detectan estas regiones de forma explícita y las marcan, lo cual es mejor que una atribución errónea silenciosa, pero el contenido subyacente sigue siendo ambiguo.
La grabación multicanal, con un micrófono por hablante, resuelve esto de forma limpia. La separación de canales le da al modelo una señal que la diarización con un solo micrófono no puede reproducir.
Consulta cómo funciona la diarización de hablantes para un desglose más completo del proceso de agrupación.
Errores de límite: palabras correctas, posiciones equivocadas
Las palabras en los bordes de los segmentos de audio son siempre el punto de mayor riesgo para los errores. Hay dos mecanismos que los provocan.
Recorte por detección de actividad de voz
La mayoría de los pipelines de transcripción usan la detección de actividad de voz (VAD) para identificar las regiones de habla y saltarse el silencio. Una VAD agresiva se activa un poco antes o después de lo debido, recortando el primer fonema de una emisión o la última consonante de una frase. Palabras cortas como "sí", "no" o "y" desaparecen por completo. El error es invisible porque no hay una palabra equivocada en la transcripción; la palabra correcta simplemente no está.
Artefactos en los límites de fragmentos en Whisper
Whisper procesa audio largo en ventanas de 30 segundos, avanzando según las marcas de tiempo previstas. Las palabras que cruzan un límite de fragmento se procesan dos veces, una al final de una ventana y otra al principio de la siguiente. El resultado es duplicación de palabras, omisión de palabras o un empalme que fusiona dos palabras distintas. Este es un comportamiento documentado en el pipeline de transcripción de audio largo de Whisper, no un caso excepcional.
Herramientas como WhisperX añaden un paso de alineación específico que vuelve a anclar las marcas temporales de las palabras contra la señal de audio después de la decodificación, lo que reduce, aunque no elimina, estos artefactos en los límites.
Al revisar una transcripción, las posiciones de los límites entre segmentos, aproximadamente cada 30 segundos, son los lugares con mayor probabilidad de contener este tipo de error.
Alucinación: palabras que nadie dijo
El modelo produjo texto sin audio correspondiente. Esto es cualitativamente distinto de las otras categorías porque no hay una entrada real que se haya malinterpretado; el modelo inventó la salida de la nada.
Silencios largos y audio sin habla
Está ampliamente documentado que Whisper genera texto durante silencios, música de fondo o ruido que no es habla. Las alucinaciones concretas no son aleatorias: como Whisper se entrenó con unas 680.000 horas de audio web que incluían grandes cantidades de contenido de YouTube, ha aprendido a asociar el silencio cerca del final de una grabación con frases de cierre de vídeo. Salidas como "Gracias por vernos" o "Suscríbete a mi canal" que aparecen en la transcripción de una declaración judicial son texto que Whisper inserta porque lo aprendió de los guiones de cierre de YouTube, no texto que nadie pronunciara realmente.
Bucles de repetición
Otro modo de fallo reconocido y aparte es el bucle de repetición: el decodificador se queda atascado generando la misma frase una y otra vez hasta que algo en el audio proporciona un nuevo anclaje. La investigación ha documentado este comportamiento en 14 de los 19 idiomas auditados. El patrón es visualmente evidente, una frase que se repite cinco o diez veces seguidas, y debe tratarse como una señal para truncar esa sección.
Fuga de datos de entrenamiento
Más allá de las frases de YouTube, se ha demostrado que Whisper produce frases que parecen provenir de sus datos de entrenamiento en lugar del audio de entrada. Estas son difíciles de detectar automáticamente porque son gramaticalmente plausibles. Las comprobaciones manuales puntuales de transcripciones de regiones de audio silenciosas o muy bajas son la forma más fiable de detectarlas.
Una mitigación: VAD antes del modelo, para que el modelo nunca vea las regiones de silencio que desencadenan la alucinación. La mayoría de los pipelines de transcripción bien configurados hacen esto por defecto.
Cómo se combinan las categorías
Una grabación real casi nunca falla en una sola categoría. Un podcast con dos presentadores que ocasionalmente se pisan al hablar, grabado con micrófonos de portátil en una sala con ruido de climatización, producirá errores acústicos, fallos de diarización durante los solapamientos, errores OOV cuando los invitados mencionan nombres poco comunes, y alucinación durante el silencio previo al episodio. El perfil de error es aditivo.
El diagnóstico más eficiente es tomar diez errores de tu transcripción, clasificar cada uno por categoría, y ver cuál domina. Eso te dice dónde invertir el esfuerzo de corrección.
| Condición de audio | Rango de precisión típico |
|---|---|
| Grabación en estudio, un solo hablante, vocabulario común | 95 a 99 por ciento |
| Oficina en casa, un solo hablante, micrófono decente | 90 a 96 por ciento |
| Videoconferencia, configuración profesional, varios hablantes | 85 a 92 por ciento |
| Llamada telefónica o VoIP, audio de banda estrecha | 80 a 88 por ciento |
| Grabación de campo, varios hablantes, ruido ambiental | 70 a 85 por ciento |
| Acento marcado en audio degradado | Por debajo del 70 por ciento en los peores casos |
Los rangos de precisión provienen del benchmark de AssemblyAI de 2026 y del estudio de centros de llamadas de Voicegain de 2025. Los resultados individuales varían según el motor y el audio.
Dónde acudir para las correcciones
Este post explica los mecanismos. Para las mitigaciones prácticas:
- Calidad de audio y elección de micrófono: consejos de micrófono para una transcripción clara y mejora la calidad del audio antes de transcribir
- Técnicas de reducción de ruido: cómo lidiar con el ruido de fondo en la transcripción
- Obtener resultados más precisos de archivos ruidosos: transcribir con mala calidad de audio
- Por qué varían los índices de precisión entre servicios: la precisión de la transcripción explicada
Si quieres probar tu propio audio antes de invertir tiempo en arreglos, el plan gratuito de ConvertAudioToText te permite subir hasta 10 minutos sin necesidad de cuenta. El resultado te mostrará qué categoría de error predomina en tu archivo concreto.
Preguntas frecuentes
¿Por qué mi transcripción dice "gracias por vernos" si nadie lo dijo?
Es una alucinación documentada de Whisper ligada a sus datos de entrenamiento. Whisper aprendió de unas 680.000 horas de audio de la web, una gran parte proveniente de vídeos de YouTube con subtítulos. El modelo asocia el silencio o el ruido no verbal con los finales típicos de los vídeos de YouTube y genera esas frases como salida. No está transcribiendo algo apenas audible de fondo, sino que hace coincidencia de patrones ante la ausencia de habla.
¿Por qué los nombres propios casi siempre salen mal en mis transcripciones?
Los nombres propios, apellidos, marcas y nombres de pila poco comunes están infrarrepresentados en los datos generales de entrenamiento. Cuando el modelo encuentra un nombre que rara vez o nunca ha visto, lo sustituye por la palabra más cercana en su vocabulario que encaje con el patrón acústico. Es el problema de vocabulario fuera de alcance (OOV, por sus siglas en inglés), y es uno de los fallos más constantes en todos los motores de transcripción. El sesgo de vocabulario o un prompt inicial que liste los nombres esperados es la solución directa.
¿Por qué a veces el mismo orador aparece etiquetado como dos personas distintas?
La diarización de hablantes funciona agrupando embeddings de voz. Las intervenciones cortas, palabras sueltas o muletillas no contienen suficiente señal acústica como para anclar de forma fiable la identidad de un hablante. El modelo las asigna al clúster más cercano en ese momento, que puede no ser el hablante correcto. Esto es especialmente habitual en intercambios rápidos donde las respuestas breves se alternan con rapidez.
¿Puede la transcripción con IA alucinar alguna vez con audio claramente hablado?
Sí, pero es raro. El escenario más común es la alucinación durante silencios, música o ruido no vocal. Con audio claramente hablado, los errores más probables son sustituciones (se elige una palabra incorrecta) más que inserciones (se inventa una palabra). La alucinación real sobre habla limpia ocurre, sobre todo con bucles de repetición donde el decodificador se queda atascado, pero es un mecanismo distinto al que se dispara con el silencio.
¿Puedo hacer algo con los errores de transcripción causados por hablantes que se solapan?
La solución más eficaz es grabar con micrófonos separados, uno por hablante. El audio multicanal elimina la mezcla de formas de onda que hace imposible diarizar correctamente las interferencias. Si eso no es viable, la mayoría de los sistemas modernos de diarización tienen un modo de detección de solapamiento que al menos marca los segmentos ambiguos en lugar de hacer una atribución errónea en silencio. Corrige manualmente esos segmentos marcados después.
Fuentes
- AssemblyAI, "¿Qué tan preciso es el reconocimiento de voz en 2026?" https://www.assemblyai.com/blog/how-accurate-speech-to-text
- Voicegain, "Benchmark de precisión de reconocimiento de voz 2025 para archivos de audio de centro de llamadas a 8 kHz" https://www.voicegain.ai/post/2025-speech-to-text-accuracy-benchmark-for-8-khz-call-center-audio-files
- TechCrunch, "La herramienta de transcripción Whisper de OpenAI tiene problemas de alucinación, según los investigadores" https://techcrunch.com/2024/10/26/openais-whisper-transcription-tool-has-hallucination-issues-researchers-say/
- Gladia, "Sesgos en los modelos de IA: ¿Qué salió mal con Whisper de OpenAI?" https://www.gladia.io/blog/ai-model-biases-what-went-wrong-with-whisper-by-openai
- AssemblyAI, "¿Qué es la diarización de hablantes y cómo funciona?" https://www.assemblyai.com/blog/what-is-speaker-diarization-and-how-does-it-work
- arxiv.org, "Investigación sobre las alucinaciones de Whisper ASR inducidas por audio no verbal" https://arxiv.org/html/2501.11378v1
- Kerson AI Solutions, "Sesgo de acento en el reconocimiento de voz: desafíos, impactos y soluciones" https://kerson.ai/research/accent-bias-in-speech-recognition-challenges-impacts-and-solutions/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.