Whisper Large-v3 explicado: arquitectura, WER y límites (2026)
whisperopenaireconocimiento de voz

Whisper Large-v3 explicado: arquitectura, WER y límites (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

TL;DR

Whisper Large-v3 es el transformador codificador-decodificador de OpenAI con 1,55 mil millones de parámetros, entrenado con 5 millones de horas de audio y compatible con 99 idiomas bajo una licencia abierta permisiva. Alcanza un WER del 2,7% en LibriSpeech test-clean y reduce los errores entre un 10 y un 20% frente a Large-v2. Sus principales puntos débiles son las alucinaciones durante el silencio, la falta de diarización nativa de hablantes y su escasa idoneidad para streaming en tiempo real. La variante Turbo de octubre de 2024 reduce el decodificador de 32 capas a 4, bajando a 809 millones de parámetros y funcionando de 2 a 5 veces más rápido con una pérdida mínima de precisión.

Whisper Large-v3 es el modelo de reconocimiento de voz de código abierto de OpenAI lanzado en noviembre de 2023. Tiene 1.550 millones de parámetros, admite 99 idiomas y se sitúa en el centro de gran parte de las herramientas de transcripción creadas en 2024 y 2025. Este artículo cubre la arquitectura, la historia de los datos de entrenamiento, cifras de referencia verificadas y los modos de fallo reales que encontrarás en producción.

Arquitectura: Transformer codificador-decodificador

Whisper es un transformer de secuencia a secuencia con dos mitades conectadas mediante atención cruzada.

El codificador convierte el audio bruto en una representación compacta. El audio se transforma primero en un espectrograma log-Mel usando 128 bandas de frecuencia (Large-v3 aumentó esta cifra desde las 80 bandas usadas en versiones anteriores). El espectrograma alimenta una pila de bloques transformer que producen una codificación de alta dimensión del contenido de audio a lo largo del tiempo. El codificador procesa el audio en ventanas de 30 segundos.

El decodificador es autorregresivo: genera tokens de salida uno a uno, atendiendo a la salida del codificador y a sus propios tokens anteriores. Ese único proceso generativo maneja la transcripción, la traducción, la identificación de idioma y la detección de actividad de voz mediante el enrutamiento de tokens especiales. El mismo modelo produce texto en francés a partir de audio en francés, texto en inglés a partir de audio en inglés y texto en inglés a partir de audio extranjero cuando se ejecuta en modo de traducción.

Para Large-v3 específicamente, la arquitectura tiene 32 capas de codificador y 32 capas de decodificador, un ancho de modelo de 1.280 y 20 cabezales de atención. Estas cifras no cambian respecto a Large-v2; lo que cambió en v3 fueron los datos de entrenamiento y el número de bandas Mel.

Los datos de entrenamiento detrás de v3

El Whisper original (2022) se entrenó con 680.000 horas de audio web con etiquetado débil. Large-v3 amplió eso de forma sustancial.

La mezcla de entrenamiento de v3 es:

  • 1 millón de horas de audio con etiquetado débil (transcrito por humanos o emparejado desde la web)
  • 4 millones de horas de audio con pseudoetiquetas generadas al ejecutar Large-v2 sobre datos sin etiquetar

Eso son 5 millones de horas en total, entrenadas durante 2 épocas. El enfoque de pseudoetiquetado, que usa un modelo existente para anotar datos nuevos, es la razón principal por la que v3 muestra una reducción del error del 10-20% frente a v2 en una amplia variedad de idiomas. La calidad de las pseudoetiquetas está limitada por el propio Large-v2, que es a la vez la fortaleza y el techo del enfoque.

El desglose original de 680.000 horas del artículo de 2022 da una idea de la distribución lingüística: aproximadamente 438.000 horas de inglés emparejadas con transcripciones en inglés, 117.000 horas de audio no inglés emparejadas con transcripciones en el idioma nativo, y 125.000 horas de audio no inglés emparejadas con traducciones al inglés. Esa última categoría es la que otorga a Whisper su capacidad de traducción de serie.

Interfaz de subida de audio usada para transcripción por lotes con Whisper Large-v3
Interfaz de subida de audio usada para transcripción por lotes con Whisper Large-v3

Puntos de referencia WER verificados

Cifras extraídas de la ficha oficial del modelo y del Open ASR Leaderboard de Hugging Face, evaluadas en Common Voice 15 y Fleurs.

Punto de referenciaWER
LibriSpeech test-clean (inglés leído)2,7%
LibriSpeech test-other (inglés variado)5,2%
Media del Open ASR Leaderboard7,44%
Corpus AMI (audio de reuniones)15,95%
Hindi (ARTPARK-IISc Vaani)26,8%

El audio del mundo real, reuniones, podcasts, llamadas telefónicas, entrevistas, suele situarse en el rango del 8-12% de WER. LibriSpeech test-clean es audio de audiolibros leídos con condiciones de grabación casi ideales, así que la cifra del 2,7% representa el techo, no la media.

Para contextualizar, modelos de código abierto más recientes como Parakeet y Canary de NVIDIA ya superan a Whisper en LibriSpeech test-clean (alrededor del 1,6-1,7% de WER). La posición dominante de Whisper en las herramientas desplegadas se debe a la madurez de su ecosistema, su cobertura de idiomas y la gama de tiempos de ejecución optimizados que lo rodean, no a una precisión puntera en las clasificaciones.

Cobertura de idiomas: 99, pero desigual

Whisper Large-v3 es compatible oficialmente con 99 idiomas, y el cantonés se añadió como un token de idioma nuevo en la v3. El rendimiento se concentra sobre todo en los idiomas con más datos de entrenamiento.

Los idiomas mejor soportados incluyen inglés, español, francés, alemán, italiano, japonés, coreano, portugués y ruso. El rendimiento en idiomas con menos recursos, muchos idiomas africanos y lenguas regionales del sur de Asia, puede llegar a un WER del 25-35% o peor. El punto de referencia de hindi mencionado antes (26,8%) ofrece un dato concreto de dónde aterriza incluso un idioma con recursos moderadamente altos en audio difícil.

Para casos de uso con idiomas de bajos recursos, consulta nuestro análisis de por qué la IA tiene dificultades con los idiomas de bajos recursos.

Qué mejoró Large-v3 respecto a Large-v2

La arquitectura es prácticamente la misma entre la v2 y la v3. Las mejoras vienen de:

  • Más bins de frecuencia Mel (128 frente a 80), lo que da al codificador una resolución de frecuencia más fina.
  • Un conjunto de entrenamiento de 5 millones de horas frente a las 680.000 horas originales, con pseudoetiquetado de Large-v2.
  • Una reducción del error del 10-20% en todos los idiomas, especialmente en los de menos recursos.
  • Mayor precisión en las marcas de tiempo.
  • Mejor manejo del cambio de código, cuando los hablantes mezclan dos idiomas a mitad de frase.

La afirmación sobre la reducción de alucinaciones que circuló tras el lanzamiento de la v3 es parcialmente cierta: la v3 alucina menos que la v2 en algunas condiciones, pero el problema no está resuelto. Sigue siendo una debilidad conocida en producción.

La variante Turbo (octubre de 2024)

OpenAI lanzó Whisper Large-v3-Turbo en octubre de 2024. El cambio clave es la poda del decodificador: se reducen las 32 capas del decodificador a 4, lo que baja el número de parámetros de 1.55B a 809M. El codificador no cambia.

El resultado es una inferencia de 2 a 5 veces más rápida con lo que OpenAI describe como "una degradación menor de la calidad". En GPUs de NVIDIA, las mediciones de factor de tiempo real muestran que Turbo procesa audio significativamente más rápido que en tiempo real. La contrapartida es que Turbo excluye las tareas de traducción de su ajuste fino, por lo que solo se encarga de la transcripción.

Para la mayoría de los casos de uso de transcripción por lotes en producción, Turbo es ahora la opción por defecto cuando controlas la infraestructura. La diferencia de precisión es lo bastante pequeña como para que la ganancia en rendimiento normalmente la compense.

Debilidades conocidas en producción

Alucinación durante el silencio. El decodificador de Whisper sigue generando tokens incluso cuando no hay voz presente, especialmente a temperatura 0. La salida suele ser texto que suena plausible pero que nunca se pronunció. La solución estándar es el preprocesado con VAD (detección de actividad de voz) para eliminar los segmentos de silencio antes de que lleguen al modelo. Un esquema de respaldo de temperatura, que proporciona una tupla de valores de temperatura crecientes en lugar de un flotante fijo, también reduce los bucles. Nuestro artículo sobre cómo funciona el VAD cubre esta técnica.

Sin diarización nativa de hablantes. Whisper produce una transcripción continua sin etiquetas de hablante. La solución estándar es WhisperX, que encadena Whisper (a través del backend faster-whisper), el alineamiento forzado a nivel de fonema usando wav2vec2 y la diarización de pyannote.audio en un solo pipeline. Cada etapa también puede ejecutarse de forma independiente. Para más sobre diarización, consulta diarización de hablantes explicada.

Mal ajuste para streaming en tiempo real. La ventana de procesamiento de 30 segundos y el decodificador autorregresivo dificultan el streaming de baja latencia. Los modelos diseñados para streaming usan una arquitectura diferente, normalmente CTC en streaming o atención por fragmentos con salida de hipótesis parcial. La serie Nova de Deepgram es la alternativa más común para casos de uso en tiempo real. El artículo sobre Deepgram Nova-3 cubre la comparación.

Sin contexto entre fragmentos. Un archivo de audio de 60 minutos se procesa como 120 fragmentos secuenciales de 30 segundos. El modelo no recuerda el fragmento 1 cuando procesa el fragmento 5. Un nombre, acrónimo o término introducido al principio puede transcribirse de forma inconsistente más adelante en el mismo archivo.

Vocabulario especializado. Whisper no tiene mecanismo de sesgo de vocabulario. La terminología médica, legal o financiera que no apareció con frecuencia durante el entrenamiento producirá errores incluso con audio limpio. El ajuste fino con datos específicos del dominio es la solución correcta para casos de uso especializados de alto riesgo.

Ejecutar Whisper por tu cuenta

Tres opciones prácticas para el despliegue local:

La implementación de referencia de OpenAI (Python). El código canónico, con la inferencia más lenta. Útil para probar o depurar el comportamiento del modelo, pero no para rendimiento en producción.

Whisper.cpp (C++). Se ejecuta en CPU, Apple Silicon (Metal), CUDA y Vulkan. La mejor opción para despliegues en Mac o sistemas embebidos. Sin dependencia de Python.

Faster-Whisper (Python, mediante CTranslate2). Se ejecuta 4 veces más rápido que la implementación de referencia en GPU NVIDIA, con cuantización INT8 que reduce el uso de VRAM en aproximadamente un 40%. Es la opción estándar para servidores Linux con GPU.

Las tres producen resultados equivalentes a partir de los mismos pesos del modelo. La diferencia está en la velocidad de inferencia y el uso de recursos.

Licencia

El código y los pesos de Whisper se publican bajo la licencia MIT según el repositorio oficial de OpenAI en GitHub. La ficha del modelo en Hugging Face indica Apache 2.0. Ambas son licencias permisivas que permiten uso comercial sin regalías. Si tu caso de uso requiere una licencia específica, consulta el repositorio de GitHub directamente en lugar de fiarte de la ficha de Hugging Face.

Cuándo encaja Whisper y cuándo no

Whisper Large-v3 es una opción sólida por defecto para:

  • Transcripción por lotes de audio pregrabado.
  • Contenido multilingüe o con idioma de origen desconocido.
  • Tareas de traducción (audio en otro idioma a texto en inglés).
  • Casos de uso que requieran un modelo de pesos abiertos que puedas ejecutar en tu propia infraestructura.

Es la elección equivocada para:

  • Streaming en tiempo real o de baja latencia, usa en su lugar un modelo optimizado para streaming.
  • Transcripción de reuniones con atribución de hablante, añade una capa de diarización o usa un servicio que la incluya.
  • Vocabulario altamente especializado sin ajuste fino, se necesita adaptación al dominio.

Para una comparación más amplia de enfoques de transcripción y sus costes, consulta la comparativa de precios de transcripción y el resumen de las mejores APIs de voz a texto.

Si quieres evaluar Whisper con tu propio audio sin montar ninguna infraestructura, el plan gratuito de ConvertAudioToText ejecuta un pipeline de Whisper Large-v3 sobre el audio subido. Sube un archivo de muestra y compara el resultado con tu referencia antes de comprometerte con cualquier vía de implementación.

Preguntas frecuentes

¿Cuántos parámetros tiene Whisper Large-v3?

Whisper Large-v3 tiene 1.550 millones de parámetros (1,55B). La variante Turbo de octubre de 2024 lo reduce a 809M al pasar el decodificador de 32 capas a 4, lo que ofrece una inferencia de 2 a 5 veces más rápida con una ligera pérdida de precisión.

¿Qué tasa de error de palabra alcanza Whisper Large-v3?

En LibriSpeech test-clean (audio de audiolibros en inglés leídos), Whisper Large-v3 llega al 2,7% de WER. En la división test-other, más difícil, alcanza el 5,2%. El WER medio en el conjunto de referencia del Open ASR Leaderboard es de 7,44. El audio del mundo real con ruido, acentos o calidad de teléfono suele situarse en el rango del 8 al 12%.

¿Whisper Large-v3 admite diarización de hablantes?

No. Whisper no etiqueta de forma nativa quién está hablando. El enfoque habitual es ejecutar Whisper para la transcripción, luego pyannote.audio por separado para los límites de hablante, y alinear ambas salidas usando marcas de tiempo a nivel de palabra. La librería WhisperX empaqueta este pipeline de tres etapas en una sola herramienta.

¿Por qué Whisper alucina texto durante los silencios?

El decodificador autorregresivo de Whisper continúa generando tokens incluso cuando no hay voz, especialmente con decodificación determinista (temperatura 0). La solución más fiable es aplicar un preprocesado de detección de actividad de voz (VAD) para eliminar los segmentos de silencio antes de que lleguen al modelo. Usar un esquema de respaldo de temperatura en lugar de un único valor fijo también ayuda, ya que provoca un remuestreo cuando el modelo entra en bucle.

¿Cuál es la diferencia entre Whisper Large-v3 y Large-v3-Turbo?

Ambos comparten el mismo codificador. Turbo reduce el decodificador de 32 capas a 4 y afina el resultado, bajando el número total de parámetros de 1.55B a 809M. La ganancia de velocidad es de 2 a 5 veces según el hardware. OpenAI describe la diferencia de precisión como una "degradación menor de calidad". Turbo no admite tareas de traducción porque ese ajuste fino excluyó los datos de traducción.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles