Redes neuronales y transcripción: cómo aprenden los modelos a escuchar
redes neuronalesiareconocimiento de voz

Redes neuronales y transcripción: cómo aprenden los modelos a escuchar

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

La precisión de la transcripción moderna proviene casi por completo de redes neuronales entrenadas con millones de horas de audio. Un modelo de habla es una pila de funciones matemáticas que aprende patrones acústicos en sus primeras capas, estructura fonética en sus capas intermedias y contexto lingüístico en sus últimas capas. La arquitectura transformer, introducida en 2017, reemplazó a las antiguas redes recurrentes y permitió que los modelos manejaran directamente las dependencias de largo alcance en el audio. Whisper Large-v3, por ejemplo, se entrenó con aproximadamente 5 millones de horas de audio y utiliza 128 canales de frecuencia mel como entrada.

La precisión de la transcripción moderna se construye sobre redes neuronales. Las mejoras entre 2015 y hoy provinieron casi por completo de mejores arquitecturas y conjuntos de entrenamiento más grandes, no de reglas artesanales ingeniosas superpuestas. Esta publicación relaciona los conceptos fundamentales de las redes neuronales con lo que realmente ocurre dentro de un modelo de transcripción.

Qué es una red neuronal, al nivel mínimo útil

Una red neuronal es una pila de funciones matemáticas con muchos parámetros ajustables. La entrenas mostrándole millones de pares de entrada-salida y ajustando los parámetros cada vez que la red produce una salida incorrecta. Después de suficiente entrenamiento, la red generaliza: produce salidas correctas para entradas que nunca ha visto.

Para el reconocimiento de voz, las entradas son representaciones de audio y las salidas son tokens de texto. Ese es todo el marco. Las preguntas interesantes tienen que ver con la forma de la entrada, qué aprenden realmente las distintas capas y por qué los datos de entrenamiento determinan el techo de precisión.

Lo que la red ve como entrada

Las redes modernas de reconocimiento de voz no operan sobre muestras de audio sin procesar. Operan sobre espectrogramas: imágenes 2D que muestran cómo se distribuye la energía de las frecuencias a lo largo del tiempo.

Whisper Large-v3 recibe como entrada un espectrograma log-mel con 128 canales de frecuencia, un fotograma cada 10 milisegundos. Este es un aumento deliberado respecto a los 80 canales utilizados en versiones anteriores de Whisper. La mejora le da al modelo una resolución de frecuencia más fina, lo que resulta especialmente útil para los idiomas tonales y las vocales muy cercanas entre sí.

Nuestra publicación sobre cómo funciona el reconocimiento de voz cubre la conversión a espectrograma con más detalle. Para esta publicación, el punto clave es que la red ve algo parecido a una fotografía del audio, no el audio mismo.

La interfaz de subida de audio de ConvertAudioToText, donde los archivos subidos se convierten en espectrogramas antes de la transcripción
La interfaz de subida de audio de ConvertAudioToText, donde los archivos subidos se convierten en espectrogramas antes de la transcripción

Capa por capa: qué aprende el modelo

Las redes neuronales profundas desarrollan representaciones internas que se vuelven progresivamente más abstractas a medida que avanzas desde la primera capa hasta la última. Para el reconocimiento de voz, el patrón sigue una jerarquía aproximada de tres etapas.

Primeras capas: características acústicas

Las primeras capas detectan patrones acústicos de bajo nivel. Una consonante sonora tiene una firma espectral distinta a la de una sorda; una vocal difiere de una fricativa. Estas distinciones corresponden aproximadamente a las que trazaría un fonetista, aunque nunca se le dijo al modelo que las buscara explícitamente.

Las investigaciones que mapean las representaciones internas de Whisper con datos neurales humanos muestran que las primeras capas se correlacionan más fuertemente con el procesamiento acústico relacionado con el inicio de los sonidos, lo cual es coherente con lo que sabemos sobre la corteza auditiva temprana.

Capas intermedias: patrones fonéticos y silábicos

Las capas intermedias combinan características de bajo nivel en unidades de nivel superior: fonemas, sílabas, fragmentos cortos de palabras. En esta etapa, la red ha comprimido la señal acústica cruda en una representación que captura el contenido lingüístico mientras descarta detalles específicos del hablante como el tono y el tamaño del tracto vocal.

Aquí también es donde el modelo aprende a ser invariable ante cosas que no deberían afectar la transcripción: la calidad de la grabación, la variación de acentos, el ruido de fondo (dentro de ciertos límites). El modelo no aprende nada de esto explícitamente; la señal de entrenamiento es simplemente «produce el texto correcto», así que el modelo descubre las invarianzas que le ayudan a lograrlo. Nuestra publicación sobre modelos acústicos frente a modelos de lenguaje cubre la división histórica de estas tareas entre sistemas separados.

Últimas capas: contexto lingüístico

Las últimas capas del codificador y las capas del decodificador son donde ocurre el modelado del lenguaje. El modelo aprende que ciertas secuencias de palabras son más probables que otras, que las construcciones gramaticales son comunes y las agramaticales no, y que palabras particulares tienden a aparecer en contextos particulares.

Esto es lo que permite al modelo resolver frases acústicamente ambiguas. La frase «recognize speech» suena casi idéntica a «wreck a nice beach» cuando se dice rápido. La capacidad de modelado del lenguaje elige la interpretación correcta según el contexto circundante. El ejemplo ha sido una broma recurrente en el campo desde los años sesenta, cuando el ingeniero Manfred Schroeder descubrió que su vocoder seguía transformando su frase de prueba de esa manera.

La arquitectura transformer

Casi todos los modelos competitivos de reconocimiento de voz actuales usan un transformer. La arquitectura se presentó en 2017 en el artículo «Attention Is All You Need» (Vaswani et al.) para traducción automática. Resultó generalizar bien a casi todas las tareas de modelado de secuencias, incluido el habla.

El mecanismo central es la autoatención. Cada posición de la secuencia de entrada puede atender a todas las demás posiciones, con pesos aprendidos que determinan cuánto «le importa» cada posición a cada otra. Para el audio, esto significa que una palabra en el segundo 12 puede usar directamente el contexto del segundo 4 sin necesidad de propagar información a través de cada paso intermedio.

Las redes recurrentes más antiguas (RNN y LSTM) procesaban las secuencias paso a paso y les costaba retener información a través de largos intervalos. Los transformers manejan las dependencias de largo alcance de manera más natural, algo importante porque la interpretación correcta de una palabra en una transcripción suele depender del contexto de muchos segundos antes.

Estructura codificador-decodificador

Para el reconocimiento de voz, la disposición estándar del transformer es codificador-decodificador. El codificador lee el espectrograma completo y produce una secuencia de vectores de alta dimensión, uno por fotograma temporal. Luego, el decodificador genera tokens de texto de uno en uno, atendiendo a la salida del codificador en cada paso.

Whisper Large-v3 usa esta estructura. También la usan la mayoría de los modelos competitivos de reconocimiento de voz de código abierto. Nuestra publicación sobre Whisper Large-v3 explicado cubre la arquitectura específica con más detalle.

Cómo funciona realmente el entrenamiento

Comienzas con parámetros aleatorios. El modelo produce disparates. Calculas el error entre la salida del modelo y la transcripción correcta, propagas ese error hacia atrás por la red (retropropagación) y ajustas ligeramente cada parámetro en la dirección que reduce el error. Repites este proceso miles de millones de veces a lo largo de millones de ejemplos de entrenamiento.

La mecánica involucra lotes (muchos ejemplos a la vez para mayor eficiencia), programas de tasa de aprendizaje (con qué agresividad actualizas los parámetros con el tiempo) y técnicas de regularización para evitar el sobreajuste. Para un modelo del tamaño de Whisper Large-v3, el entrenamiento dura días o semanas en cientos de GPU.

Por qué los datos de entrenamiento determinan el techo

El modelo solo puede aprender patrones que existen en sus datos de entrenamiento. Si los datos de entrenamiento son todos inglés grabado en estudio, el modelo rendirá peor con audio telefónico o hablantes no nativos. Si el conjunto de entrenamiento no tiene vocabulario médico, el modelo escribirá mal los nombres de los medicamentos.

Whisper Large-v3 se entrenó con aproximadamente 5 millones de horas de audio en total: alrededor de 1 millón de horas de audio débilmente etiquetado y 4 millones adicionales de horas de audio pseudoetiquetado generado al ejecutar Whisper Large-v2 sobre contenido sin etiquetar. Esto es significativamente más que las 680.000 horas usadas para entrenar la versión original de Whisper.

Deepgram Nova-3, lanzado a principios de 2025, se entrenó con un conjunto de datos propietario que abarca más de 100 dominios y decenas de miles de millones de tokens. La escala y la diversidad de dominios de los datos de entrenamiento son una de las principales razones por las que los modelos de laboratorios con abundantes recursos superan a las alternativas más pequeñas en condiciones reales.

El ajuste fino es la solución práctica cuando un modelo general rinde mal en tu dominio. Tomas un modelo preentrenado y continúas el entrenamiento con una pequeña cantidad de datos específicos del dominio: unas pocas horas de grabaciones médicas, declaraciones juradas o pódcast técnicos. Como el modelo ya conoce la estructura del lenguaje y la acústica, solo necesita ajustar los parámetros que importan para tu vocabulario. Consulta nuestra publicación sobre precisión de transcripción explicada para saber más sobre cómo el desajuste de dominio se refleja en las tasas de error.

Qué ocurre en el momento de la inferencia

Una vez entrenado, usar el modelo es sencillo. Proporcionas audio, el modelo produce texto.

El proceso de inferencia:

  1. El audio se convierte en un espectrograma log-mel.
  2. El codificador procesa el espectrograma y produce una secuencia de vectores ocultos.
  3. El decodificador genera tokens de texto de uno en uno, condicionando cada nuevo token a la salida del codificador y a todos los tokens generados previamente.
  4. La generación se detiene cuando el decodificador produce un token de fin de secuencia.

Para un clip de 30 segundos, esto toma una fracción de segundo en hardware moderno. El audio más largo se procesa en fragmentos de 30 segundos que luego se unen.

Por qué los sistemas de extremo a extremo superaron a los híbridos

Antes de aproximadamente 2017, los sistemas de reconocimiento de voz eran híbridos: una red neuronal estimaba las probabilidades de los fonemas, un diccionario de pronunciación mapeaba fonemas a palabras, un modelo de lenguaje independiente puntuaba secuencias de palabras y un algoritmo de búsqueda de haz combinaba todo.

Los sistemas de extremo a extremo condensaron todo esto en una única red entrenada directamente con pares de audio a texto. El objetivo de entrenamiento es simplemente «producir el texto correcto a partir del audio», y el modelo aprende cualquier estructura interna que sirva a ese fin.

Tres razones concretas de por qué esto funciona mejor:

El modelo puede usar información que los diseñadores de sistemas híbridos no anticiparon. Rasgos prosódicos como la entonación, el énfasis y el ritmo pueden desambiguar palabras que suenan idénticas de forma aislada. Los sistemas híbridos rara vez usaban la prosodia; los modelos de extremo a extremo la captan de manera incidental durante el entrenamiento.

La optimización conjunta es más eficiente que ajustar componentes separados. Un sistema híbrido está limitado por su módulo más débil. Un modelo de extremo a extremo puede aprender a compensar las debilidades de una parte con las fortalezas de otra.

La transferencia entre idiomas es natural. Un único modelo Whisper maneja 99 idiomas porque las representaciones internas compartidas ayudan en todos ellos. Los sistemas híbridos necesitaban componentes en gran medida separados para cada idioma.

Para saber más sobre las decisiones de arquitectura, consulta nuestra publicación sobre cómo funciona el reconocimiento de voz con IA, que cubre las familias codificador-decodificador y CTC con profundidad técnica.

Dónde siguen fallando las redes neuronales

Las redes neuronales no son magia. Tienen modos de fallo sistemáticos que provienen directamente del proceso de entrenamiento.

Vocabulario de cola larga. Las palabras que aparecieron rara vez en los datos de entrenamiento se escriben mal de forma consistente: nombres de marcas, jerga técnica, nombres propios inusuales. El modelo asigna baja probabilidad a los tokens raros porque aparecieron pocas veces en transcripciones correctas durante el entrenamiento. Nuestra publicación sobre por qué la transcripción comete errores cubre esto en detalle.

Desplazamiento de distribución. El audio que difiere significativamente de la distribución de entrenamiento, ya sea por condiciones de grabación inusuales, acento marcado o vocabulario novedoso del dominio, produce peores resultados. Esto no es un error; es una consecuencia directa de cómo funciona el entrenamiento.

Alucinación. El decodificador puede producir texto que suena plausible pero que no corresponde a nada del audio, particularmente durante silencios o ruido de fondo. El modelo tiene un sesgo fuerte hacia producir texto porque sus datos de entrenamiento casi siempre contenían habla. La detección de actividad de voz (VAD), que filtra los segmentos sin habla antes de que lleguen al modelo de transcripción, es la mitigación estándar. Nuestra publicación sobre cómo funciona el VAD explica la técnica.

Confusión de hablantes. Los modelos de transcripción estándar producen un único flujo de texto indiferenciado. Separar a los hablantes requiere un paso adicional llamado diarización. Nuestra publicación sobre diarización de hablantes explicada cubre cómo funciona eso por separado de la transcripción base.

Mi opinión: los modos de fallo enumerados arriba tienen mitigaciones conocidas, y los mejores sistemas de producción aplican varias de ellas en combinación. Pero entender la causa raíz de cada modo de fallo es lo que te indica qué mitigación aplicar y cuándo no servirá de ayuda.

Una nota sobre el flujo del producto

Esta publicación se centra en la red neuronal misma. Si quieres entender cómo funciona el flujo completo del producto, desde la subida hasta la transcripción formateada —incluyendo VAD, diarización, restauración de puntuación y formato de salida—, consulta nuestra publicación sobre cómo funciona la transcripción con IA. Ambas publicaciones están pensadas para leerse juntas.

Si quieres probar el resultado de un sistema de transcripción neuronal en producción con tu propio audio, ConvertAudioToText ejecuta Whisper Large-v3 sobre los archivos subidos, sin necesidad de registro para clips cortos.

Fuentes

Preguntas frecuentes

¿Qué entrada recibe realmente una red neuronal del audio?

Recibe un espectrograma, no muestras de onda sin procesar. Para la mayoría de los modelos modernos, eso significa un espectrograma log-mel: una representación 2D de cómo se distribuye la energía de las frecuencias a lo largo del tiempo. Whisper Large-v3 utiliza 128 canales de frecuencia mel por fotograma temporal, una mejora respecto a los 80 canales usados en versiones anteriores de Whisper.

¿Por qué las redes neuronales de extremo a extremo reemplazaron a los sistemas ASR híbridos?

Los sistemas híbridos más antiguos tenían componentes separados: una red neuronal para probabilidades de fonemas, un diccionario de pronunciación, un modelo de lenguaje y un decodificador de búsqueda de haz. Cada uno debía ajustarse de forma independiente. Los modelos de extremo a extremo condensaron todo esto en una sola red entrenada directamente con pares de audio a texto. El entrenamiento conjunto permite al modelo aprender estrategias de compensación que los componentes separados no pueden, y un solo modelo Whisper puede servir a 99 idiomas porque comparte representaciones internas entre todos ellos.

¿Por qué un modelo de transcripción a veces produce texto que nunca fue dicho?

Esto es la alucinación: el decodificador genera texto plausible incluso cuando el audio contiene solo silencio, ruido de fondo o sonido ininteligible. El modelo aprendió de audios que casi siempre contienen habla, por lo que tiene un sesgo fuerte hacia producir texto. La detección de actividad de voz (VAD) mitiga esto filtrando los segmentos sin habla antes de que lleguen al modelo de transcripción.

¿Qué es el ajuste fino y cuándo ayuda?

El ajuste fino consiste en tomar un modelo entrenado de propósito general y continuar su entrenamiento con un pequeño conjunto de datos de un dominio específico, como grabaciones médicas o declaraciones juradas. Como el modelo ya conoce la estructura del lenguaje y la acústica, solo necesita unas pocas horas de audio específico del dominio para inclinarse hacia el vocabulario y la redacción correctos. El ajuste fino es más útil para vocabulario técnico que apareció rara vez en los datos de entrenamiento originales.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles