
Cómo funciona el reconocimiento de voz: una historia desde 1952 hasta hoy
Summarize this article with:
El reconocimiento de voz convierte el audio en texto extrayendo características acústicas de la señal de sonido y pasándolas por un modelo entrenado para predecir palabras. Los sistemas actuales son redes neuronales de extremo a extremo entrenadas con cientos de miles de horas de audio. Pero ese resultado exigió siete décadas de investigación: desde los simples emparejadores de patrones en los años 50, pasando por los modelos estadísticos probabilísticos en los 80, hasta la revolución del aprendizaje profundo en los 2010 que finalmente hizo la tecnología útil a gran escala.
El reconocimiento de voz funciona convirtiendo una onda sonora en una representación numérica de su contenido de frecuencia, y luego usando un modelo entrenado para predecir qué palabras se pronunciaron. Esa respuesta de una frase es precisa hoy en día, pero oculta setenta años de giros equivocados, cambios de paradigma y algunos avances críticos que transformaron lo que el campo creía posible.
Esta publicación traza el arco completo, desde las primeras máquinas que podían reconocer dígitos hablados en 1952 hasta los modelos de transformadores que ahora igualan la precisión humana en audio limpio. Los detalles técnicos del pipeline neuronal actual se cubren en nuestra publicación hermana sobre cómo funciona el reconocimiento de voz con IA, y el pipeline del lado del producto (subida, VAD, diarización, formato) está en cómo funciona la transcripción con IA. Esta publicación es la base histórica sobre la que se construyen ambas.
Los años 50: Audrey y un comienzo muy limitado
El sistema Audrey de Bell Labs, construido en 1952, es reconocido como el primer sistema de reconocimiento de voz. Ocupaba un bastidor de relés de seis pies y podía reconocer los dígitos hablados del cero al nueve. Eso suena modesto, pero fue un logro de ingeniería genuino: Audrey funcionaba analizando los formantes (picos de frecuencia resonante) de cada dígito hablado y comparándolos con plantillas almacenadas.
El inconveniente: Audrey lograba hasta un 97 por ciento de precisión solo si el hablante era hombre, hacía una pausa de al menos 350 milisegundos entre cada dígito, y si la máquina había sido calibrada para la voz de ese hablante específico. Funcionaba porque el reconocimiento de dígitos es un problema de conjunto cerrado con solo diez respuestas posibles. El habla natural, con su enorme vocabulario y flujo continuo, era un problema completamente distinto.
Una década después, IBM presentó Shoebox en la Feria Mundial de Seattle de 1962. Reconocía 16 palabras: los diez dígitos más seis comandos aritméticos como "más" y "total". La máquina podía aceptar un problema aritmético hablado y pasar el cálculo a una sumadora. Seguía siendo comparación de patrones, y seguía siendo dolorosamente limitada.
Los años 70: DARPA, la búsqueda en haz y la barrera de las 1.000 palabras
Los años 70 trajeron dinero público y un objetivo más ambicioso. El programa Speech Understanding Research (SUR) de DARPA, activo entre 1971 y 1976, financió a un pequeño grupo de equipos de investigación para perseguir una meta concreta: un sistema capaz de entender habla continua con un vocabulario de al menos 1.000 palabras.
El sistema Harpy de Carnegie Mellon, completado en 1976, alcanzó ese objetivo. Harpy conocía 1.011 palabras e introdujo la búsqueda en haz, una estrategia de decodificación que poda el espacio de secuencias de palabras candidatas mientras procesa el audio, en lugar de evaluar exhaustivamente todas las posibilidades. La búsqueda en haz sigue usándose en los decodificadores modernos.
Hearsay, otro sistema de CMU de la misma época, optó por un enfoque distinto: "fuentes de conocimiento" en capas que pasaban hipótesis de la acústica a los fonemas, luego a las palabras y después a la sintaxis. Era arquitectónicamente interesante, pero frágil, y perdió frente a Harpy en el punto de referencia. La lección, que el campo no dejaba de reaprender, era que una estructura elegante importa menos que encontrar algo que reduzca errores de forma fiable.
Los años 80: los modelos ocultos de Márkov lo cambian todo
La verdadera base estadística del reconocimiento de voz moderno llegó con los modelos ocultos de Márkov (HMM). Lenny Baum desarrolló las matemáticas subyacentes en Princeton a principios de los años 70. James y Janet Baker aplicaron los HMM al habla en Carnegie Mellon para su tesis doctoral de 1974, construyendo el sistema Dragon que acabaría convirtiéndose en un producto comercial.
HMMs were a conceptual shift from template matching to probabilistic modeling. Rather than storing a fixed fingerprint for each word and measuring distance from it, an HMM models speech as a sequence of hidden states (the phonemes being produced) with observable outputs (the acoustic features measured from the signal). Given observed features, you ask: what sequence of hidden states most probably generated this?
This matters for several reasons. First, the same word sounds slightly different every time you say it. HMMs handle that variation probabilistically rather than requiring rigid agreement with a template. Second, HMMs compose: you can chain phone-level models into word-level models and word-level models into sentence-level models. Third, HMMs can be trained from data rather than hand-engineered, which meant that more data produced better models.
By the late 1980s, HMMs were paired with Gaussian Mixture Models (GMMs) to produce the acoustic model in what became the standard architecture: a GMM-HMM system with a separate n-gram language model that rescored candidate transcripts by how probable the word sequence was in general text.
The 1990s: Commercial Dictation Arrives
The GMM-HMM framework was good enough to build commercial products. Dragon Dictate launched in 1990 at $9,000 with an 80,000-word dictionary. It was discrete speech: you had to pause between words. IBM's ViaVoice (1996) improved usability with speaker-independent models.
Then in 1997, Dragon NaturallySpeaking launched at $150 and supported continuous speech, recognizing roughly 100 words per minute without trained pauses. That was the first system most people could actually use. It still required a speaker-training session to adapt to your voice, and it still struggled with accents, background noise, and domain-specific vocabulary. But it proved that desktop dictation was viable.
Mi opinión: los sistemas de los años 90 eran impresionantes dadas las limitaciones de la época, pero eran frágiles de una manera que los hacía agotadores de usar. Si te alejabas de un entorno silencioso o decías algo fuera de los patrones esperados, la precisión se derrumbaba. La maquinaria estadística era correcta; los datos y la capacidad de cómputo aún no eran suficientes.
Los 2000: Escala, redes neuronales y la apuesta de Google
Google Voice Search, lanzado en 2008, aplicó una idea clave: los grandes conjuntos de datos y la computación distribuida podían producir modelos que manejaban acentos y ruido de forma robusta, algo que ninguna cantidad de ajuste manual de un sistema con pocos datos podía igualar. Los modelos subyacentes seguían siendo en gran parte GMM-HMM, pero los datos de entrenamiento eran órdenes de magnitud mayores que los que habían usado los investigadores académicos.
Mientras tanto, Geoffrey Hinton y sus colaboradores demostraban que las redes neuronales profundas podían superar a los GMM en el modelado acústico. El artículo pionero de 2012 "Deep Neural Networks for Acoustic Modeling in Speech Recognition", coescrito por Hinton, Li Deng, Dong Yu, George Dahl y otros de Microsoft, IBM, Google y Toronto, mostró que sustituir el GMM por una red neuronal profunda en un pipeline HMM por lo demás estándar producía grandes mejoras de precisión en múltiples benchmarks. El híbrido DNN-HMM redujo drásticamente las tasas de error en sistemas que apenas habían mejorado durante años.
No fue un paso incremental menor. El campo cambió casi de inmediato. En pocos años, todos los grandes sistemas comerciales de ASR habían reemplazado los modelos acústicos GMM por DNN.
La era 2014-2017: Aprendizaje de extremo a extremo
El híbrido DNN-HMM era mejor, pero seguía siendo un sistema de tres componentes: modelo acústico, diccionario de pronunciación y modelo de lenguaje. Cada pieza se entrenaba por separado y tenía que encajar en el momento de la inferencia. Los investigadores empezaron a preguntarse si se podía entrenar un único modelo que mapeara el audio directamente a texto.
Surgieron dos enfoques casi al mismo tiempo.
Connectionist Temporal Classification (CTC), presentado por Alex Graves en 2006 pero que ganó tracción en ASR hacia 2014, ofreció una forma de entrenar modelos secuencia a secuencia sin necesidad de pares de entrada y salida alineados. Deep Speech de Baidu usó una RNN bidireccional con pérdida CTC para batir el benchmark Switchboard Hub5'00 en 2014, sin recurrir a diccionarios fonéticos tradicionales ni a características diseñadas a mano.
Los modelos encoder-decoder basados en atención se tomaron prestados de la traducción automática. El trabajo de Chorowski, Bahdanau y sus colegas en 2015 demostró que la atención suave sobre la secuencia acústica podía sustituir la alineación explícita impuesta por los HMM. El modelo aprendía a alinear por su cuenta.
Ambos enfoques eran "de extremo a extremo" en el sentido de que una única red neuronal aprendía todo a partir de los datos, los patrones acústicos y los patrones del lenguaje juntos, sin necesidad de componentes separados ni de diccionarios de pronunciación.
2017 y el Transformer
El artículo de 2017 "Attention Is All You Need", de Vaswani y sus colegas en Google, introdujo la arquitectura Transformer para el modelado de secuencias. Sustituyó las redes neuronales recurrentes que habían dominado el PLN y el ASR por capas de autoatención capaces de modelar relaciones entre cualquier par de posiciones de una secuencia, sin el cuello de botella secuencial de las RNN.
Los Transformers podían procesar la secuencia de entrada completa en paralelo, modelar dependencias de largo alcance de forma eficiente y escalar con más datos y potencia de cálculo de un modo que las RNN no lograban igualar. Hacia 2019 y 2020, los sistemas de ASR basados en Transformers alcanzaban resultados de última generación en los benchmarks estándar.
Facebook AI's wav2vec 2.0 (2020) demostró que los transformers también podían preentrenarse con audio sin etiquetar de forma autosupervisada y, después, ajustarse con pequeñas cantidades de datos transcritos. Entrenar con 53.000 horas de audio sin etiquetar y ajustar con solo diez minutos de datos etiquetados produjo tasas de error de palabra que, con enfoques anteriores, habrían requerido miles de horas etiquetadas. Esto fue un avance importante para los idiomas con pocos recursos y escasos datos transcritos, un problema que abordamos en detalle en nuestro artículo sobre por qué la IA tiene dificultades con los idiomas de bajos recursos.
De 2022 a hoy: Whisper y la recompensa de la escala
OpenAI lanzó Whisper en 2022. El modelo es un transformer encoder-decoder estándar, pero sus datos de entrenamiento fueron sin precedentes en escala y diversidad: 680.000 horas de audio con transcripciones asociadas, incluyendo 563.000 horas en inglés y 117.000 horas en otros 96 idiomas, recopiladas de la web.
El audio se convierte en un espectrograma log-mel de 80 canales calculado en ventanas de 25 milisegundos a 16.000 Hz antes de entrar en el encoder. El decoder genera los tokens de texto de forma autorregresiva. No hay nada exótico en la arquitectura; la escala de los datos de entrenamiento fue lo que marcó la diferencia.

Whisper Large-v3 alcanza alrededor de un 3 por ciento de tasa de error de palabra en benchmarks de habla leída y limpia. La precisión en el mundo real varía significativamente según la calidad del audio: en grabaciones limpias puede bajar del 5 por ciento de WER, mientras que el audio ruidoso o conversacional con varios hablantes puede elevar las tasas de error al rango del 15 al 30 por ciento. Para comparar, los transcriptores humanos suelen lograr un WER del 2 al 4 por ciento en buenas condiciones y del 10 al 15 por ciento en entornos ruidosos.
Para una explicación desde cero de qué significa el WER y por qué puede inducir a error, consulta nuestro artículo sobre la precisión de la transcripción explicada.
Por qué llevó 70 años
Tres limitaciones frenaron el avance del campo, y cada una tuvo que resolverse más o menos en orden.
Datos. Whisper se entrenó con 680.000 horas. Dragon NaturallySpeaking en 1997 se entrenó con mucho menos, y los modelos que podía aprender eran proporcionalmente más superficiales. Recopilar y etiquetar audio a gran escala era caro; al final, la web lo proporcionó gratis.
Potencia de cálculo. Entrenar un transformer con 680.000 horas requiere clústeres de GPU. El avance de DNN-HMM en 2012 coincidió con que la era de la computación con GPU se volvió lo bastante accesible como para ejecutar redes profundas con presupuestos de investigación. Antes, sencillamente no había potencia disponible.
Algoritmos. Los HMM eran el marco adecuado para los datos y la potencia disponibles en los años 80. Las redes profundas eran teóricamente atractivas antes, pero en la práctica no se podían entrenar con el hardware y los tamaños de conjunto de datos que existían. Los transformers resolvieron los problemas de paralelismo y dependencias de largo alcance que hacían que las RNN fueran difíciles de entrenar a escala.
La lección: cada generación de investigadores trabajaba cerca de la frontera de lo que sus limitaciones permitían. El equipo de Audrey en 1952 hizo algo realmente difícil con coincidencia de patrones y circuitos analógicos. El trabajo con HMM de los años 80 fue estadísticamente riguroso y duradero. El giro hacia el aprendizaje profundo en 2012 fue rápido precisamente porque las ideas habían madurado y la potencia de cálculo se había puesto al día. Entender esa progresión hace que la era actual de los transformers parezca menos magia y más la siguiente iteración del mismo patrón.
Si quieres ver el reconocimiento moderno de extremo a extremo en acción, la herramienta de audio a texto de ConvertAudioToText procesa archivos con el flujo actual, y la salida que obtienes es el producto de todo lo descrito arriba.
FAQ
¿Cuál fue el primer sistema de reconocimiento de voz?
Bell Labs construyó Audrey en 1952. Podía reconocer los dígitos del cero al nueve, pero solo con un único hablante y en condiciones controladas. Ocupaba un bastidor de relés de seis pies y funcionaba comparando las frecuencias de los formantes de cada dígito con plantillas almacenadas.
¿Qué son los Modelos Ocultos de Markov y por qué fueron importantes para el reconocimiento del habla?
Los Modelos Ocultos de Markov (HMM) modelan el habla como una secuencia de estados ocultos (fonemas) que producen salidas observables (características acústicas). En lugar de comparar el audio con una plantilla fija, los HMM calculan la secuencia de fonemas más probable que podría haber generado el audio observado. Este enfoque probabilístico manejaba la variación natural en la pronunciación y se escalaba a vocabularios grandes de una manera que los métodos anteriores de comparación con plantillas no podían.
¿Qué cambió en 2012 para que el reconocimiento del habla mejorara tanto?
El avance de 2012 fue sustituir el componente acústico de Modelo de Mezclas Gaussianas (GMM) en el pipeline estándar GMM-HMM por una red neuronal profunda. Un artículo de Hinton, Deng, Yu, Dahl y colaboradores de Microsoft, Google, IBM y la Universidad de Toronto demostró que los sistemas híbridos DNN-HMM superaban claramente a las líneas base GMM-HMM en múltiples referencias, lo que provocó una adopción rápida en toda la industria.
¿Qué significa "de extremo a extremo" en el reconocimiento del habla?
Un sistema de extremo a extremo es una única red neuronal entrenada para mapear el audio directamente a texto, sin modelos acústicos separados, diccionarios de pronunciación ni modelos de lenguaje que deban entrenarse y combinarse por separado. Deep Speech de Baidu (2014) fue un ejemplo temprano de alto perfil que usaba la pérdida CTC. Whisper es un ejemplo más reciente que usa una arquitectura de transformador codificador-decodificador. Las principales ventajas son pipelines de entrenamiento más simples y la capacidad de optimizar todo de forma conjunta hacia la transcripción final.
¿Qué precisión tiene el reconocimiento del habla moderno?
En audio limpio y bien grabado de un solo hablante, los modelos más avanzados alcanzan menos de un 5 por ciento de tasa de error por palabra (WER). En audio ruidoso, conversacional o con varios hablantes, el WER suele situarse entre el 15 y el 30 por ciento. Los transcriptores humanos logran aproximadamente un 2 a 4 por ciento de WER en buenas condiciones y degradan hasta un 10 a 15 por ciento en audio difícil. La precisión depende sobre todo de la calidad del audio: el ruido de fondo, los hablantes que se solapan y la baja tasa de bits de grabación son los principales factores que elevan las tasas de error, incluso con los mejores modelos.
Fuentes
- Anuncio y detalles técnicos de OpenAI Whisper: https://openai.com/index/whisper/
- Artículo técnico de Whisper vía resumen de OpenWhispr: https://openwhispr.com/blog/how-whisper-ai-works
- Historia de los hitos del reconocimiento de voz (Milvus): https://milvus.io/ai-quick-reference/what-is-the-history-of-speech-recognition-technology
- Historia del ASR (Descript/Medium): https://medium.com/descript/a-brief-history-of-asr-automatic-speech-recognition-b8f338d4c0e5
- Audrey y los primeros sistemas, Computer History Museum: https://computerhistory.org/blog/audrey-alexa-hal-and-more/
- Wikipedia de Janet M. Baker (orígenes de HMM/Dragon): https://en.wikipedia.org/wiki/Janet_M._Baker
- Wikipedia de James K. Baker: https://en.wikipedia.org/wiki/James_K._Baker
- Artículo de 2012 sobre DNN-HMM (Hinton et al.), IEEE Signal Processing Magazine: https://www.cs.toronto.edu/~gdahl/papers/deepSpeechReviewSPM2012.pdf
- CTC, Wikipedia: https://en.wikipedia.org/wiki/Connectionist_temporal_classification
- Artículo de wav2vec 2.0 (arXiv): https://arxiv.org/pdf/2006.11477
- "Attention Is All You Need" (arXiv): https://arxiv.org/abs/1706.03762
- Puntos de referencia de WER y discusión sobre precisión (AssemblyAI): https://www.assemblyai.com/blog/word-error-rate-is-broken
- Programa DARPA SUR y Harpy (documento histórico de CMU): https://rr.cs.cmu.edu/SUR.pdf
- Tasa de muestreo y Nyquist para ASR (Picovoice): https://picovoice.ai/blog/audio-sampling-and-sample-rate/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.