Cómo funciona la detección de actividad de voz (VAD) en la transcripción
vaddetección de actividad de voztécnico

Cómo funciona la detección de actividad de voz (VAD) en la transcripción

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

Qué decide el VAD

La detección de actividad de voz responde una pregunta para cada pequeño fragmento de audio: ¿está ocurriendo habla aquí o no? La respuesta determina qué fotogramas llegan al modelo de transcripción y cuáles se descartan. Si se equivoca, terminas con texto alucinado sobre el silencio o con el inicio de palabras reales cortado.

Por qué existe el VAD en el flujo

Un modelo de transcripción recibe audio y produce texto. No tiene ningún concepto inherente de que «nadie está hablando». Si le das silencio, ruido de fondo o música de espera, seguirá intentando producir texto, porque para eso fue entrenado. El VAD es la compuerta que se sitúa aguas arriba y decide qué llega siquiera al modelo.

De esa compuerta se derivan tres efectos concretos.

Evita la alucinación sobre el silencio

Whisper Large-v3 tiene una tendencia bien documentada a generar texto fantasma durante audio silencioso o sin habla. Como el modelo fue entrenado con datos de internet dominados por videos de YouTube, aprendió a asociar el audio con habla transcribible. Cuando encuentra silencio, recurre a los finales más comunes de sus datos de entrenamiento: frases como «gracias por ver el video» o «suscríbete a mi canal» aparecen en la salida de Whisper sobre tramos de audio que no contienen ninguna de las dos cosas. Esto ha sido documentado en múltiples análisis independientes y no es un caso límite ocasional. Investigadores han descubierto que un pequeño subconjunto de cabezas de atención del decodificador explica la mayoría de las alucinaciones sin habla.

El VAD evita esto eliminando las regiones sin habla antes de que el modelo las vea. El modelo no puede alucinar sobre un silencio que nunca recibe.

Reduce el costo de procesamiento

Ejecutar un modelo de transcripción sobre silencio no es gratis. El modelo sigue procesando el espectrograma completo de cada fotograma que recibe. Para audios que contienen largos tramos sin habla, omitir esos fotogramas ahorra cómputo significativo. Investigadores han señalado ahorros de entre el 50 y el 70 por ciento en grabaciones mayormente silenciosas. Una clase de 90 minutos con pausas prolongadas, una grabación de campo con sonido ambiental entre ráfagas de habla relevante, un audio de centro de llamadas donde los agentes están en espera: todos estos casos se benefician en proporción a cuánto del audio no es habla.

Para casos de uso de bajo volumen esto es una preocupación menor. Para despliegues en producción que procesan miles de horas al mes, se convierte en una palanca de costos real.

Da a las marcas de tiempo una base más sólida

Cuando el modelo de transcripción recibe segmentos de habla limpios con tiempos de inicio precisos, su temporización a nivel de palabra queda anclada a eventos de audio reales en lugar de extenderse a través del silencio. El resultado son marcas de tiempo de palabras más confiables y una salida de subtítulos más limpia. Esto importa más en los flujos de trabajo que dependen de cortes precisos: generación de subtítulos, notas de reuniones indexadas por tema o transcripciones emparejadas con video.

Cómo funciona el VAD por dentro

El enfoque técnico ha evolucionado desde el procesamiento simple de señales hasta la inferencia neuronal. Hoy siguen en uso tres generaciones.

VAD basado en energía

El enfoque más antiguo y simple. Se mide la energía (volumen) de cada fotograma de audio. Los fotogramas por encima de un umbral se etiquetan como habla; los que están por debajo, como silencio.

Esto funciona en un estudio silencioso. En cualquier entorno real falla: un ruido de fondo de 60 decibelios enmascara habla tranquila de 55 decibelios, y un zumbido fuerte de ventilación provoca falsos positivos por todas partes. El VAD basado en energía rara vez se usa en los flujos de transcripción modernos, pero todavía aparece en sistemas embebidos con recursos limitados donde el costo de cómputo importa más que la precisión.

VAD estadístico (WebRTC VAD)

Un paso adelante respecto a la energía bruta. En lugar de un único umbral de energía, se ajusta un Modelo de Mezcla Gaussiana (GMM) sobre múltiples características acústicas por fotograma: energía, forma espectral, tasa de cruces por cero y tono. El GMM asigna una probabilidad de que el fotograma coincida con la distribución aprendida de «habla» frente a la de «sin habla».

WebRTC VAD, la implementación de código abierto del proyecto WebRTC de Google, utiliza este enfoque. Pesa alrededor de 158 KB, procesa fragmentos de 30 ms en menos de 1 ms en CPU y tiene una licencia permisiva. Está ampliamente desplegado en flujos de comunicación de voz (videollamadas, VoIP) donde la latencia importa más que la precisión.

Su debilidad es que el GMM fue entrenado con condiciones de audio específicas. La música con voces, el habla en salas con mucha reverberación y los entornos muy ruidosos producen clasificaciones erróneas. En un benchmark de Picovoice (que vende un producto competidor, así que toma los números como orientativos), WebRTC VAD logró aproximadamente una tasa de detección de habla del 50 por ciento con una tasa de falsos positivos del 5 por ciento, un resultado que ilustra sus limitaciones en condiciones ruidosas más que en silenciosas.

VAD neuronal

El estándar actual para los flujos de transcripción. Una pequeña red neuronal se entrena con audio etiquetado que abarca miles de horas y muchas condiciones de fondo, aprendiendo a detectar habla en la forma de onda cruda o en el espectrograma sin características diseñadas manualmente.

Silero VAD es el VAD neuronal de código abierto más adoptado en los flujos de transcripción en producción. Lanzado en diciembre de 2020 y mantenido hasta 2026 (versión actual 6.2.1), utiliza una arquitectura respaldada por PyTorch y ONNX con un tamaño de modelo de alrededor de 2 MB. Admite frecuencias de muestreo de 8000 Hz y 16000 Hz, fue entrenado con datos que abarcan más de 6000 idiomas y procesa cada fragmento de 30 ms en menos de 1 ms por hilo de CPU. La licencia MIT significa que no hay registro ni dependencia de proveedores.

En el mismo benchmark de Picovoice, Silero alcanzó aproximadamente un 87,7 por ciento de detección de habla con una tasa de falsos positivos del 5 por ciento, una mejora sustancial respecto al enfoque GMM. El VAD neuronal maneja la música con voces, la reverberación y la calidad variable de micrófonos mucho mejor que los métodos estadísticos, aunque ningún modelo elimina todos los casos límite.

Tipo de VADBase técnicaLatenciaRobustez al ruidoEjemplo
Basado en energíaUmbral de volumenMenos de 1 msBajaSistemas embebidos heredados
Estadístico (GMM)GMM sobre características espectralesMenos de 1 msMediaWebRTC VAD (Google)
NeuronalRed neuronal profunda1-5 msAltaSilero VAD, modelos propietarios

El VAD en el flujo de Whisper

La implementación de referencia de Whisper de OpenAI no incluye un VAD externo por defecto. El modelo contiene un token interno de probabilidad de «sin habla», pero en la práctica es lo bastante poco confiable como para que los despliegues en producción añadan una pasada dedicada de VAD aguas arriba.

La arquitectura típica, usada por WhisperX y envoltorios similares de Whisper, funciona así:

  1. El audio pasa por Silero VAD o Pyannote, que devuelve una lista de segmentos de tiempo con habla activa.
  2. Los segmentos adyacentes separados por brechas cortas (normalmente de 0,5 segundos o menos) se fusionan.
  3. Las regiones de habla resultantes se dividen en la ventana de procesamiento de Whisper (30 segundos como máximo).
  4. Cada fragmento se transcribe con Whisper Large-v3.
  5. Las marcas de tiempo se ajustan de vuelta a la línea temporal original antes de concatenar los fragmentos.

Este diseño es notablemente más confiable que alimentar a Whisper con audio crudo, especialmente para grabaciones con silencios prolongados o fondo ambiental. Para un análisis más profundo del modelo en sí, consulta Whisper Large-v3 explicado.

Cargador de audio de CATT; tras la carga, el VAD se ejecuta en el servidor antes de que el audio llegue al modelo de transcripción
Cargador de audio de CATT; tras la carga, el VAD se ejecuta en el servidor antes de que el audio llegue al modelo de transcripción

El VAD en el flujo de Deepgram

Deepgram Nova-3 integra la detección de actividad de voz directamente en el flujo del modelo de extremo a extremo. Los usuarios no configuran una etapa de VAD separada. Esto es operativamente más simple: un modelo, una llamada a la API, sin ajuste de VAD. El VAD integrado de Nova-3 mejoró específicamente respecto a modelos anteriores de Deepgram que a veces transcribían audio solo de música o casi silencioso como texto fantasma.

La contrapartida es la transparencia. No puedes inspeccionar las decisiones de límites del VAD por separado de la salida de transcripción, lo que dificulta depurar los casos límite. Si tu flujo de trabajo depende de auditar exactamente qué fotogramas fueron clasificados como habla, un VAD externo explícito es preferible. Para la mayoría de los usuarios, el enfoque integrado es la mejor opción por defecto. El desglose completo está en Deepgram Nova-3 explicado.

Lo que el VAD no puede hacer

Tres límites que vale la pena conocer antes de esperar demasiado de él.

El VAD no identifica hablantes. Distingue habla de no-habla. El hablante A y el hablante B producen ambos fotogramas etiquetados como «habla». Separarlos es un problema aparte cubierto en diarización de hablantes explicada.

El VAD no limpia el ruido dentro de los fotogramas de habla. Solo determina qué fotogramas llegan al modelo; el audio de esos fotogramas permanece igual. Una grabación ruidosa sigue siendo ruidosa dentro de los segmentos seleccionados por el VAD. El VAD previene las alucinaciones relacionadas con el silencio, pero los errores de transcripción causados por ruido de fondo dentro de las regiones de habla requieren un manejo diferente.

El VAD no distingue tipos de no-habla. Las risas, la música, el ruido de multitud y el silencio absoluto suelen producir una etiqueta de «no habla». Los sistemas especializados separan estas categorías, pero el VAD estándar usado en los flujos de transcripción no lo hace.

Para un mapa más amplio de lo que causa errores de transcripción, por qué la transcripción comete errores cubre toda la taxonomía de modos de fallo.

Ajuste del VAD: tres parámetros que importan

Para la mayoría de los usuarios, el VAD es invisible. El flujo viene con valores predeterminados y estos suelen estar bien. Para los desarrolladores que integran transcripción en sus propios sistemas, tres parámetros tienen el mayor impacto.

Sensibilidad (el umbral de probabilidad de habla). Un umbral alto requiere evidencia más fuerte de habla antes de etiquetar un fotograma como activo. Esto reduce los falsos positivos (ruido etiquetado como habla), pero arriesga descartar habla suave o susurrada. Un umbral bajo captura más habla, pero también deja pasar más ruido. Los sistemas en producción normalmente ajustan esto con una pequeña muestra de audio representativo antes de desplegar a gran escala.

Duración mínima de segmento. Un filtro que descarta los segmentos de habla detectados más cortos que una duración establecida, típicamente 250 ms. Sin él, un clic breve o un ruido de impacto se pasa al modelo de transcripción como un segmento de «habla», produciendo una sola palabra o sílaba espuria en la salida.

Relleno (padding). La mayoría de los sistemas de VAD extienden cada segmento de habla detectado una cantidad fija antes y después de los límites detectados. Sin relleno, el primer fonema de una expresión suele quedar cortado porque el disparador del VAD se activa unos milisegundos después del inicio del habla. Un valor de relleno de 300 ms es un valor predeterminado común para la transcripción ASR; los flujos de entrenamiento de TTS usan valores más largos, de 400 a 500 ms, para preservar la prosodia natural.

Estos parámetros interactúan. Una sensibilidad agresiva con duración mínima corta y relleno ajustado maximiza la cantidad de no-habla que se elimina, al costo de cortar ocasionalmente habla real. Una sensibilidad permisiva con relleno largo preserva más habla al costo de pasar más ruido al modelo.

Cuándo tiene el VAD el mayor impacto

El VAD importa más en proporción a cuánta no-habla haya en el audio.

Las grabaciones largas con pausas significativas se benefician más: clases, entrevistas de podcast con pausas para pensar, reuniones con intercambio activo de turnos que deja el canal de un hablante mayormente silencioso. Estas son también las grabaciones más propensas a producir texto fantasma sin VAD, porque Whisper tiene más silencio que llenar.

Las notas de voz y el dictado se benefician porque los patrones habla-pausa-habla son el detonante de alucinación más agudo: el modelo no tiene nada a lo que anclarse en la pausa, así que genera algo.

Las grabaciones de campo con sonido ambiental entre ráfagas de habla relevante suelen ser inutilizables sin VAD. La proporción de no-habla frente a habla puede ser muy alta en audio naturalista.

Mi opinión: para cargas de consumidores desde un teléfono o portátil en una habitación normal, el VAD es una tubería invisible. La transcripción o funciona o tiene problemas de precisión por ruido o acento, y el VAD no es el cuello de botella. Los casos donde el VAD cambia visiblemente la salida son las grabaciones largas, los archivos con cortes de silencio frecuentes y cualquier cosa grabada en un entorno con sonido de fondo sostenido.

Si quieres ver cómo un flujo con VAD incluido maneja tu audio específico, la herramienta de audio a texto de CATT procesa los primeros 10 minutos gratis. Prueba con un archivo que haya generado texto fantasma en otras herramientas.

Preguntas frecuentes

¿Qué tamaño de fotograma suele usar el VAD?

La mayoría de los sistemas de VAD en producción procesan el audio en fragmentos de 10 a 30 ms. Los fotogramas más pequeños detectan el inicio del habla más rápido, pero se equivocan con más frecuencia en condiciones ruidosas. Los fotogramas más grandes son más precisos pero añaden unos pocos milisegundos de retraso en la detección. Silero VAD fue entrenado con fragmentos de 30 ms y puede manejar fragmentos más largos de forma nativa. WebRTC VAD admite modos de 10, 20 y 30 ms; los 30 ms son los más utilizados en los flujos de transcripción.

¿Afecta el VAD a la precisión de la transcripción dentro de las regiones de habla?

No. El VAD cambia qué porciones del audio llegan al modelo, no cómo este las procesa. La tasa de error de palabras del modelo sobre un segmento de habla determinado no se ve afectada por si se usó o no VAD para encontrar ese segmento. El beneficio de precisión del VAD es indirecto: evita el texto alucinado en los silencios y le da al modelo límites de segmento más limpios con los que trabajar.

¿Por qué Whisper alucina sobre el silencio sin VAD?

Whisper fue entrenado con audio procedente de internet, principalmente transcripciones de YouTube. Los videos de YouTube suelen terminar con segmentos de despedida, música de espera y audio de relleno acompañados de frases habladas como «gracias por ver el video» o «suscríbete a mi canal». El modelo aprendió a asociar estos patrones de audio sin habla con ese texto. Cuando recibe silencio o música, recurre a esas asociaciones y genera texto que nunca fue pronunciado. Un VAD externo elimina los fotogramas silenciosos antes de que Whisper los vea, eliminando así el detonante.

¿Es el VAD neuronal siempre mejor que el WebRTC VAD?

Para los flujos de transcripción, sí en casi todos los casos. El VAD neuronal como Silero maneja los entornos ruidosos, la música con voces y la reverberación mucho mejor que el GMM de WebRTC. WebRTC VAD tiene la ventaja de un costo computacional casi nulo y una huella menor, lo que lo convierte en una buena opción para aplicaciones de comunicación de voz en tiempo real donde la latencia está estrictamente limitada y la calidad del audio está controlada (una videollamada en una habitación silenciosa). Para la transcripción de audio del mundo real, el enfoque neuronal vale el sobrecosto ligeramente mayor.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles