
Cómo funciona el reconocimiento de voz con IA: el pipeline neuronal (2026)
Summarize this article with:
El pipeline de un vistazo
El reconocimiento de voz con IA moderno es una red neuronal encoder-decoder que lee un espectrograma log-mel de tu audio y emite tokens de texto, todo en una sola pasada y sin un modelo acústico ni un diccionario de pronunciación separados en medio. El modelo aprende conjuntamente el mapeo del sonido a las palabras, y por eso la precisión ha mejorado tan drásticamente en los últimos cinco años. Si quieres la historia del antiguo pipeline híbrido (HMM, MFCC, modelos acústicos y de lenguaje separados), consulta cómo funciona el reconocimiento de voz. Si quieres la perspectiva del producto (qué ocurre entre que subes tu archivo y descargas la transcripción), consulta cómo funciona la transcripción con IA. Esta entrada cubre la arquitectura neuronal moderna en sí misma.
De la onda sonora a la entrada del modelo
Antes de que cualquier red neuronal vea tu audio, la forma de onda cruda debe convertirse en un formato que el modelo pueda procesar.
El formato de entrada estándar es un espectrograma log-mel. El audio se divide en fotogramas de 25 ms solapados, muestreados cada 10 ms. Cada fotograma se pasa por una Transformada de Fourier de Tiempo Corto (STFT) para producir un espectro de frecuencias, que luego se filtra mediante un banco de filtros triangulares espaciados según la escala mel (una escala de frecuencia perceptual que coincide con el funcionamiento del oído humano). A las salidas de los filtros se les aplica una compresión logarítmica, que aproxima la sensibilidad logarítmica del oído a la intensidad sonora. El resultado es una cuadrícula 2D: el tiempo en un eje, la frecuencia mel en el otro, y la intensidad mostrando cuánta energía hay presente en cada banda de frecuencias en cada momento.
Whisper large-v3 utiliza 128 bandas de frecuencia mel (las versiones anteriores de Whisper y la mayoría de los demás modelos usan 80). Esta cuadrícula 2D es lo que lee el codificador.
El codificador: extraer significado de los parches del espectrograma
La tarea del codificador es convertir el espectrograma en una representación interna rica de lo que se está diciendo.
Los codificadores transformer procesan el espectrograma en parches solapados con autoatención multicabezal. Cada cabeza de atención compara cada posición del espectrograma con todas las demás para identificar qué partes del contexto del audio se relacionan entre sí. Las capas convolucionales iniciales (o los subbloques convolucionales, como en la arquitectura Conformer) capturan patrones locales, mientras que las capas transformer capturan dependencias de largo alcance. Esto es lo que permite al modelo saber que el "right" de una frase sobre girar en una esquina no es el mismo sonido que el de una frase sobre tener razón, incluso antes de que el decodificador se haya decidido por alguna de las dos lecturas.
El Conformer (publicado por Google en INTERSPEECH 2020) añade un módulo convolucional dentro de cada bloque transformer, mezclando procesamiento local y global de una manera que funciona especialmente bien para el habla, porque las características acústicas tienen una fuerte correlación local.
El decodificador: generar texto, token a token
El decodificador es donde el modelo realmente produce texto.
Whisper utiliza un decodificador seq2seq autorregresivo con atención cruzada. El decodificador genera los tokens de texto de uno en uno. En cada paso utiliza autoatención sobre los tokens que ya ha emitido (para mantener un lenguaje coherente) y atención cruzada hacia la salida del codificador (para mantenerse anclado en la evidencia del audio). Los pesos de la atención cruzada determinan a qué partes del espectrograma está "escuchando" el modelo mientras escribe cada token.
Los tokens son unidades de subpalabras (vocabulario BPE), no fonemas. El modelo nunca produce una capa explícita de fonemas; mapea el audio directamente a tokens de fragmentos de palabra en un único proceso aprendido. Si has oído que el ASR moderno todavía usa modelos acústicos a nivel de fonema y un modelo de lenguaje estadístico separado, esa descripción corresponde al clásico pipeline híbrido, que los modelos basados en CTC reemplazaron parcialmente y los modelos seq2seq casi por completo.
CTC, Seq2Seq y transductores: tres estrategias para un mismo problema
No todos los sistemas ASR neuronales usan el mismo mecanismo de salida. Entender los tres enfoques principales es el núcleo de este apartado.
CTC (Connectionist Temporal Classification) fue propuesto en 2006 y sigue siendo ampliamente utilizado (wav2vec 2.0, de Facebook AI, es el ejemplo moderno más destacado). El modelo emite una distribución de probabilidad sobre los tokens en cada fotograma de audio. Después, CTC colapsa la secuencia a nivel de fotograma fusionando los tokens repetidos y eliminando los tokens en blanco para producir la transcripción final. La propiedad clave es que CTC asume independencia condicional entre los tokens de salida: la predicción de cada fotograma se hace sin acceso a los tokens previamente predichos. Esto hace que CTC sea rápido y fácil de entrenar, pero la suposición de no incluir un modelo de lenguaje en el bucle significa que puede ser léxicamente incoherente con palabras poco frecuentes.
La atención seq2seq (encoder-decoder) es lo que utiliza Whisper. El decodificador autorregresivo tiene un comportamiento plenamente similar al de un modelo de lenguaje: cada token se condiciona por todo lo anterior. Esto produce un texto más natural y coherente, especialmente con palabras fuera del vocabulario o específicas de un dominio. La contrapartida es que la decodificación es secuencial y más lenta, y el modelo necesita procesar todo el audio antes de generar (procesamiento por lotes en lugar de streaming).
RNN-T (Recurrent Neural Network Transducer) combina las fortalezas de ambos. Su codificador acústico y su red de predicción (un pequeño modelo de lenguaje autorregresivo sobre los tokens previamente predichos) se fusionan a través de una red conjunta. La ventaja clave es el streaming: RNN-T puede emitir tokens a medida que llega el audio, sin esperar al final del enunciado. Por eso los modelos basados en transductores dominan las aplicaciones de streaming en producción, los asistentes de voz y los sistemas de subtitulado en tiempo real. Surgió del trabajo de Alex Graves y se ha convertido en la columna vertebral del ASR en el dispositivo en productos como la grabadora del Pixel de Google.
| Arquitectura | Estrategia de salida | Modelado de lenguaje | Preparado para streaming | Modelo representativo |
|---|---|---|---|---|
| CTC | Nivel de fotograma, colapsado | Externo o ninguno | Sí (con cuidado) | wav2vec 2.0 |
| Atención seq2seq | Autorregresivo, token a token | Integrado | No (necesita todo el audio) | Whisper |
| Transductor RNN-T | Codificador + red de predicción fusionados | Integrado | Sí, de forma natural | ASR de Google/en dispositivo |
El entrenamiento híbrido CTC + atención es cada vez más común: la pérdida CTC fomenta una alineación monótona durante el entrenamiento, ayudando al decodificador de atención a converger más rápido, mientras que el decodificador de atención se encarga de la salida final.
Lo que los datos de entrenamiento realmente moldean
El volumen y la diversidad de los datos de entrenamiento determinan la generalización más que la arquitectura por sí sola.
El Whisper original (2022) se entrenó con 680.000 horas de audio multilingüe débilmente supervisado, que abarcaba 96 idiomas e incluía 125.000 horas de datos de traducción. Whisper large-v3 (lanzado a finales de 2023) se entrenó con 1 millón de horas de audio débilmente etiquetado más 4 millones de horas de audio pseudoetiquetado generado con Whisper large-v2, unas 5 millones de horas en total, con 1,55 mil millones de parámetros y soporte para 99 idiomas.
"Débilmente supervisado" significa que las etiquetas de entrenamiento provenían de fuentes existentes en internet (subtítulos, transcripciones) en lugar de grabaciones de estudio anotadas minuciosamente. La diversidad de condiciones que esto introduce es parte de la razón por la que el modelo maneja mejor el audio real que muchos competidores entrenados con corpus más pequeños pero más limpios.
Algunos modelos se entrenan conjuntamente en transcripción, traducción, identificación de idioma y predicción de marcas de tiempo. En el caso de Whisper, el condicionamiento de tareas se maneja por completo mediante tokens especiales del decodificador anteponidos a la secuencia de salida: los mismos pesos del transformer aprenden las cuatro tareas simultáneamente. Este entrenamiento multitarea parece producir representaciones de audio más ricas que el entrenamiento de tarea única.
Diarización de hablantes: un sistema paralelo
La diarización, es decir, averiguar quién dijo qué, no está integrada en el modelo ASR principal. Se ejecuta como un pipeline separado junto a la transcripción.
La diarización neuronal moderna extrae embeddings de hablante y luego los agrupa. El audio se divide en segmentos solapados. Un codificador neuronal (comúnmente una arquitectura TDNN o ResNet) convierte cada segmento en un vector de alta dimensión que captura las características vocales del hablante: patrones de tono, frecuencias de formantes, forma del tracto vocal. Estos embeddings se agrupan jerárquicamente. A los segmentos con embeddings similares se les asigna la misma etiqueta de hablante.
El desafío central es que el número de hablantes es desconocido. Los sistemas modernos usan umbrales de similitud aprendidos para decidir dónde cortar el dendrograma. El habla solapada (dos personas hablando al mismo tiempo) sigue siendo un problema activo de investigación: la mayoría de los sistemas en producción manejan el habla simultánea asignando un solo hablante por fotograma, lo que significa que la voz más baja en un solapamiento suele perderse.
Herramientas como la transcripción de reuniones y la transcripción de entrevistas aplican la diarización como paso de posprocesamiento después de que el ASR principal termina.
Precisión: lo que significan realmente las cifras
Las cifras de precisión destacadas que ves en material de marketing casi siempre reflejan habla leída limpia, no audio real.
Whisper large-v3 alcanza un 2,7% de WER en LibriSpeech test-clean, que es audio de audiolibro leído con calidad de estudio. En el Hugging Face Open ASR Leaderboard (instantánea de mediados de 2026), Whisper large-v3 registró un WER medio de 7,44% en diversos conjuntos de prueba del mundo real. Los modelos mejor clasificados, como Transcribe de Cohere (5,42% de WER medio) y ElevenLabs Scribe v2 (5,83%), empujan el estado del arte, pero estas cifras cambian a medida que nuevos modelos entran en el ranking.
Para contenido práctico, el WER real en reuniones, podcasts y llamadas telefónicas suele oscilar entre el 8% y el 15%, según el nivel de ruido, el número de hablantes y la diversidad de acentos. La brecha entre el WER de referencia y el WER práctico es la razón principal por la que deberías probar cualquier sistema ASR con tu propio audio antes de comprometerte.
Mi opinión: el WER en LibriSpeech te indica el techo del modelo. El WER sobre tu contenido real es la única cifra que importa para tu caso de uso.

Por qué los modelos end-to-end superan al antiguo pipeline híbrido
El pipeline clásico tenía un extractor de características, un modelo acústico basado en HMM que mapeaba características a fonemas, un léxico de pronunciación y un modelo de lenguaje n-grama entrenado por separado. Cada etapa se optimizaba de forma independiente, así que los errores de una etapa eran invisibles para las demás.
Los modelos end-to-end optimizan conjuntamente todo el mapeo de audio a texto. Si una palabra suena acústicamente ambigua, el decodificador neuronal puede usar de inmediato el contexto de la frase para resolverla, porque la evidencia acústica y el modelo de lenguaje son el mismo conjunto de pesos. No hay costura entre "¿qué fonema es este?" y "¿qué palabra deletrea esta secuencia de fonemas?". Esa es la razón arquitectónica por la que la precisión en audio difícil mejoró tan drásticamente entre 2019 y 2023.
El cambio llegó en dos oleadas. Los modelos basados en CTC, como DeepSpeech (2014), fueron los primeros sistemas ASR end-to-end prácticos. Los modelos seq2seq basados en transformer desde alrededor de 2020 extendieron esto aún más al eliminar la suposición de independencia condicional que hacía débil la integración del modelo de lenguaje en CTC.
Si quieres ver en detalle qué ocurre después de que existe la salida del ASR (restauración de puntuación, fusión de diarización, formateo de párrafos, exportación), consulta cómo funciona la transcripción con IA. Si quieres la historia pre-neuronal que empieza con los HMM y los MFCC, cómo funciona el reconocimiento de voz cubre todo el recorrido.
Lo que aún limita al ASR moderno
Las mejoras de arquitectura tienen un techo. Algunas limitaciones provienen de la física y de los datos, no del diseño del modelo.
El habla solapada es genuinamente difícil: dos voces ocupan los mismos bins tiempo-frecuencia, y separarlas requiere modelos de separación de fuentes (como Conv-TasNet) ejecutándose antes del modelo ASR, lo que añade latencia y complejidad.
Los idiomas de bajos recursos siguen estando mal atendidos. Un idioma con solo unos cientos de horas de datos de entrenamiento etiquetados producirá un modelo con un WER un orden de magnitud mayor que el de un idioma con muchos recursos, sin importar la sofisticación de la arquitectura. Esta es una razón por la que la IA tiene dificultades con los idiomas de bajos recursos.
La música de fondo es categóricamente diferente del ruido de fondo. El ruido constante se puede filtrar con detección de actividad de voz. La música ocupa rangos de frecuencia solapados con el habla, así que el modelo a menudo alucina letras o palabras cuando hay música. Este es un modo de fallo conocido de Whisper en particular.
Los modelos propietarios como Deepgram Nova optimizan diferentes equilibrios (latencia, streaming, adaptación de dominio) usando arquitecturas que sus equipos no han publicado en detalle. Para un desglose de lo que hace diferente Nova-3, consulta Deepgram Nova-3 explicado.
Para trabajos que necesitan transcripciones limpias y rápidas sin ejecutar tu propia infraestructura de ASR, ConvertAudioToText gestiona el pipeline completo por ti, incluida la diarización y la exportación a SRT, VTT y texto plano.
Preguntas frecuentes
¿Cuál es la diferencia entre CTC y seq2seq en el reconocimiento de voz?
CTC predice un token en cada fotograma de audio de forma independiente y luego colapsa la secuencia. Es rápido y compatible con streaming, pero no toma decisiones a nivel de modelo de lenguaje durante la decodificación. Seq2seq (como Whisper) utiliza un decodificador autorregresivo con atención cruzada al codificador: genera cada token condicionado por todos los tokens anteriores y toda la evidencia acústica a la vez. Esto produce un texto más coherente, especialmente con vocabulario específico de dominio, pero requiere procesar todo el audio antes de generar la salida.
¿Por qué los modelos ASR modernos no usan fonemas como paso intermedio?
Los sistemas híbridos antiguos usaban fonemas porque el modelo acústico y el modelo de lenguaje se entrenaban por separado: el modelo acústico necesitaba un espacio de salida fijo (los fonemas) que el modelo de lenguaje pudiera consumir. Los modelos end-to-end aprenden el mapeo completo de audio a texto en una sola pasada, así que emiten directamente tokens de subpalabras (unidades BPE). El modelo aprende implícitamente las representaciones intermedias que le resultan útiles, que no son necesariamente fonemas.
¿Cómo mejora el entrenamiento multitarea el reconocimiento de voz?
Entrenar un modelo simultáneamente en transcripción, traducción, identificación de idioma y predicción de marcas de tiempo lo obliga a construir representaciones de audio que generalizan entre tareas. Whisper, por ejemplo, condiciona las cuatro tareas mediante tokens especiales de prefijo anteponidos al decodificador: los mismos pesos del codificador deben capturar suficiente detalle acústico para soportarlas todas. El resultado es un modelo con mejor robustez frente a acentos e idiomas que un modelo entrenado solo para transcripción con los mismos datos.
¿Qué precisión tiene el reconocimiento de voz con IA en audio real en 2026?
En habla leída (LibriSpeech test-clean), los modelos líderes alcanzan alrededor de 2-3% de WER. En audio real, incluidas reuniones, podcasts y llamadas telefónicas, el WER suele oscilar entre 8-15% según el ruido, los hablantes solapados y la diversidad de acentos. Los líderes del ranking a mediados de 2026, como Transcribe de Cohere, reportan un WER medio de 5,42% en conjuntos de prueba mixtos, aunque estas cifras reflejan la composición del ranking y cambian a medida que se evalúan nuevos modelos.
¿Qué diferencia a la arquitectura Conformer de un transformer estándar para ASR?
Un transformer estándar usa autoatención entre todas las posiciones para capturar contexto global. El Conformer, publicado por Google en INTERSPEECH 2020, añade un módulo convolucional dentro de cada bloque transformer, entre dos módulos feed-forward. Esto permite que cada bloque capture simultáneamente patrones acústicos locales (mediante convolución) y dependencias de largo alcance (mediante atención). Como el habla tiene una fuerte estructura local (las características acústicas están muy correlacionadas con los fotogramas vecinos), esta combinación supera a un transformer puro para ASR en la mayoría de los benchmarks.
Fuentes
- GitHub de OpenAI Whisper (ficha del modelo, arquitectura, datos de entrenamiento): https://github.com/openai/whisper
- Hugging Face: ficha del modelo openai/whisper-large-v3: https://huggingface.co/openai/whisper-large-v3
- Google Research: Conformer (INTERSPEECH 2020): https://research.google/pubs/conformer-convolution-augmented-transformer-for-speech-recognition/
- Curso de Audio de Hugging Face, arquitecturas Seq2Seq: https://huggingface.co/learn/audio-course/chapter3/seq2seq
- Hugging Face Transformers: documentación de wav2vec2: https://huggingface.co/docs/transformers/en/model_doc/wav2vec2
- pyannote.ai: Qué es la diarización de hablantes: https://www.pyannote.ai/blog/what-is-speaker-diarization
- Hugging Face Open ASR Leaderboard (instantánea de mediados de 2026): https://huggingface.co/spaces/hf-audio/open_asr_leaderboard
- AssemblyAI: La tasa de error de palabras está rota (2026): https://www.assemblyai.com/blog/word-error-rate-is-broken
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.