
Diarización de hablantes explicada: cómo las máquinas saben quién dijo qué
Summarize this article with:
La diarización de hablantes es la parte de la transcripción que responde a «quién está hablando cuándo» codificando cada segmento de audio como un vector de voz y agrupando los vectores similares en grupos de hablantes. Los sistemas modernos sobre audio limpio de dos hablantes alcanzan una DER inferior al 10% (pyannote logra un 9,0% en VoxConverse; Deepgram v2 se lanzó en mayo de 2026), pero el audio difícil con varios hablantes como DIHARD III muestra entre el 11% y el 14% incluso en sistemas punteros. El mayor modo de fallo individual es el habla solapada. Controlar tu configuración de grabación antes de pulsar grabar elimina más errores que cualquier truco de posprocesamiento.
La diarización de hablantes es la parte de la transcripción que averigua quién dijo qué. Sin ella, una entrevista entre dos personas se lee como un monólogo ininterrumpido. Con ella, la misma transcripción se lee como una obra de teatro, con cada voz correctamente atribuida y cada cita rastreable hasta su fuente.
Esta publicación cubre el pipeline detrás de la diarización moderna, por qué las voces se pueden agrupar de forma fiable, los principales modos de fallo, cómo interpretar la métrica de precisión DER y los pasos prácticos que puedes seguir para obtener etiquetas de hablante limpias en tus grabaciones.
Qué es la diarización y qué no es
La diarización responde a la pregunta «quién está hablando cuándo», no a «quién es específicamente esta persona». Un sistema de diarización etiqueta a los hablantes como Hablante 1, Hablante 2, Hablante 3 según sus firmas acústicas, no cruzando datos con una base de datos de identidades conocidas. Etiquetas a los hablantes después («el Hablante 1 es Alice») y un simple buscar y reemplazar corrige todas las apariciones.
Dos tareas relacionadas que la gente confunde con la diarización:
- Detección de actividad de voz (VAD). Decide dónde hay habla en absoluto, frente a silencio, música o ruido. La diarización asume que el VAD ya se ha ejecutado. Consulta cómo funciona el VAD para conocer el paso previo.
- Identificación del hablante. Compara una voz desconocida con muestras registradas de personas conocidas («esto suena como Alice»). Requiere una base de datos. La diarización es la necesidad más sencilla y común.
Para la mayoría de los casos de uso de entrevistas y reuniones, la diarización sin identificación es suficiente. Identifica una vez, actualiza en todas partes.
El pipeline de embedding y clustering
Un pipeline de diarización estándar ejecuta cuatro etapas, aunque los sistemas modernos las implementan como una única pasada neuronal en lugar de cuatro llamadas secuenciales:
- VAD. Elimina el silencio, la música de fondo y las regiones sin habla.
- Segmentación. Corta el audio restante en ventanas cortas, normalmente de 1,5 a 3 segundos cada una.
- Embedding. Codifica cada segmento como un vector de alta dimensión que captura las características de voz de ese segmento.
- Clustering. Agrupa los segmentos con embeddings similares en clústeres de hablantes y asigna a cada clúster una etiqueta.
El resultado es una secuencia de tuplas (tiempo de inicio, tiempo de fin, etiqueta de hablante). Un paso de ASR aparte transcribe las palabras; la salida de la diarización mapea palabras a hablantes.
Si quieres ver dónde encaja la diarización dentro de la transcripción en su conjunto, la publicación sobre cómo funciona la transcripción con IA cubre todo el pipeline del producto, desde la subida hasta la salida formateada.
Por qué funcionan los embeddings de voz
El truco que hace posible la diarización es que las voces tienen firmas acústicas estables incluso cuando cambian las palabras. El rango tonal, las frecuencias formánticas (las resonancias que distinguen los sonidos vocálicos), la velocidad de habla, los patrones de respiración y los hábitos fonéticos son sorprendentemente consistentes para una misma persona a lo largo de una conversación.
Un modelo moderno de embedding de hablante, como ECAPA-TDNN, TitaNet de NVIDIA NeMo o las arquitecturas x-vector, toma un segmento corto de audio y produce un vector de 192 a 512 dimensiones. Dos segmentos del mismo hablante quedan agrupados cerca en ese espacio. Dos segmentos de hablantes distintos quedan más alejados. Los algoritmos de clustering aglomerativo o espectral se encargan de la agrupación.
Las matemáticas no son el cuello de botella. El cuello de botella es lo que ocurre cuando esas suposiciones fallan.
Dónde falla la diarización
Cinco modos de fallo que encontrarás en grabaciones reales:
Solapamiento de hablantes
Cuando dos personas hablan a la vez, la mayoría de los sistemas tipo cascada eligen un hablante y descartan al otro. La palabra solapada va a una etiqueta y la contribución del otro hablante se pierde silenciosamente. Esta es la mayor fuente individual de error en mesas redondas, debates animados y entrevistas a ritmo rápido.
Los enfoques neuronales de diarización de extremo a extremo, a veces llamados modelos EEND, tratan la diarización como un problema de predicción multietiqueta y pueden asignar un segmento a dos hablantes simultáneamente. Eso maneja mejor el solapamiento, pero aumenta la complejidad del sistema. Para la mayoría de los flujos de trabajo prácticos, la solución real es una mejor disciplina de micrófonos.
Voces similares
Dos hablantes con tono, acento y velocidad de habla similares se fusionan en un solo clúster más a menudo de lo que esperarías. Los paneles del mismo género y las entrevistas familiares son casos problemáticos habituales. El modelo no tiene forma de saber que las voces son distintas si los embeddings se solapan significativamente.
Los canales de micrófono separados por hablante resuelven esto directamente. Cuando eso no es posible, espera algo de limpieza manual.
Intervenciones cortas
Una interjección de una sola palabra («Sí», «Claro», «Exacto») suele carecer de suficiente audio para una asignación de hablante segura. La mayoría de los sistemas o adivinan (frecuentemente mal) u omiten el segmento. En una entrevista de ida y vuelta donde una persona hace preguntas cortas, el problema del hablante equivocado se vuelve muy evidente.
Voces de fondo
Un televisor de fondo, una segunda conversación audible a través de una pared delgada o la reproducción de audio desde un teléfono son tratados todos como nuevos hablantes por el diarizador. Tu entrevista de 2 personas muestra de repente cuatro hablantes: los dos participantes más quien sea que salga en el noticiero. Grabar en un espacio silencioso es la solución barata.
Estimación del número de hablantes
La mayoría de los sistemas detectan automáticamente el número de hablantes o aceptan una pista. La detección automática es imperfecta. La diarización de Deepgram, por ejemplo, detecta automáticamente sin requerir un número de entrada y afirma obtener resultados precisos con 16 o más hablantes. Pyannote acepta un número de hablantes como pista opcional. Cuando la herramienta que usas admite el parámetro y conoces la cifra, proporciónala. Cuando la herramienta estima automáticamente, verifica con cuidado el primer minuto del resultado.

Tasa de error de diarización (DER) explicada
La DER es la métrica estándar de precisión para la diarización. La fórmula combina tres tipos de error:
- Confusión de hablante. Se detecta la habla correcta, pero se asigna el hablante equivocado.
- Habla omitida. Habla real etiquetada como silencio.
- Falsa alarma. Silencio o ruido etiquetado como habla.
DER = (falsa alarma + omitida + confusión de hablante) / duración total del habla de referencia.
Una DER inferior al 10% se considera generalmente buena en la mayoría de los dominios de audio reales.
| Sistema | Benchmark | DER |
|---|---|---|
| pyannote (pyannote.ai) | VoxConverse | 9,0% |
| Picovoice Falcon | VoxConverse | 10,3% |
| Amazon Transcribe | VoxConverse | 11,1% |
| PyannoteAI | DIHARD III | 11,2% |
| DiariZen (código abierto) | DIHARD III | 13,3% |
| EEND-TA | DIHARD III | 14,5% |
| Diarización de Google STT | VoxConverse | 50,2% |
Fuentes: benchmark abierto de Picovoice (VoxConverse) y benchmarks independientes de investigación (DIHARD III), julio de 2026.
Una DER del 10% significa que aproximadamente uno de cada diez segundos tiene la etiqueta de hablante equivocada. Para un archivo de 60 minutos, son 6 minutos de habla mal atribuida. Si eso importa depende de tu caso de uso. Un resumen aproximado de reunión lo tolera. Una transcripción judicial no.
Mi opinión: la brecha entre las mejores herramientas de código abierto y los complementos comerciales más débiles es enorme, más de 40 puntos porcentuales en los extremos. Elegir una herramienta según el modelo de diarización subyacente en lugar de la marca general importa más aquí que en casi cualquier otra función de transcripción.
Para contexto sobre cómo se mide la precisión en toda la pila de transcripción, consulta precisión de la transcripción explicada.
Pasos prácticos para una diarización limpia
Si controlas la grabación, estas son las palancas que más importan:
- Un micrófono por hablante. Micrófonos USB, de solapa o auriculares con micrófono para cada participante. Esto elimina la mayor parte de la dificultad de la diarización antes de que empiece.
- Canales de audio separados si es posible. La grabación multipista (Riverside, Zencastr o captura local en la máquina de cada participante) permite al diarizador trabajar canal por canal en lugar de separar un flujo mezclado. La atribución basada en canales está esencialmente resuelta.
- Pausas breves entre turnos. Un intervalo de medio segundo ayuda al sistema a detectar los límites de hablante de forma fiable.
- Entorno silencioso. Silencia los televisores, cierra puertas y pide a otras personas en el espacio que guarden silencio.
- Proporciona el número de hablantes si es compatible. Cuando sabes cuántos hablantes hay en el archivo y la herramienta acepta esa pista, úsala.
Para grabaciones de reuniones en particular, la guía práctica en cómo transcribir una reunión de Zoom cubre la configuración de grabación a nivel de canal que deja la diarización casi perfecta.
Cuando recibes el archivo después
Si no controlaste la grabación, trabajas con lo que tienes. El flujo de recuperación:
- Ejecuta una herramienta de diarización de alta calidad. Pyannote, Deepgram con
diarize_model=latest(el parámetro recomendado actualmente, según la documentación de Deepgram de mayo de 2026, que reemplaza el obsoletodiarize=true), o AssemblyAI conspeaker_labels: true. Los tres ofrecen una precisión sólida en audio típico de entrevistas y reuniones. - Proporciona el número de hablantes cuando la herramienta lo acepte. Donde la API admite esta pista, reduce el ruido de estimación.
- Revisa el primer minuto con cuidado. Si las etiquetas son correctas al principio, suelen ser correctas durante todo el archivo. Los errores se concentran al inicio, cuando el modelo está calibrando las identidades de los hablantes.
- Busca puntos de confusión conocidos. Las interjecciones cortas, los segmentos solapados y los cambios de hablante son donde se concentran los errores.
- Etiqueta a los hablantes manualmente una vez. Buscar y reemplazar se encarga del resto.
Si solo necesitas una transcripción limpia con etiquetas de hablante sin montar tú mismo un pipeline de diarización, la herramienta de transcripción de reuniones de CATT ejecuta la diarización automáticamente al subir el archivo.
Qué permiten las transcripciones con diarización
Una transcripción con etiquetas de hablante abre flujos de trabajo que una sin etiquetas no puede soportar:
- Recuento de palabras por hablante. ¿Quién domina tus reuniones?
- Análisis por hablante. Sentimiento por participante, temas planteados por cada persona.
- Mejores resúmenes con LLM. El modelo puede producir «Alice argumentó X, Bob replicó Y» en lugar de «los participantes discutieron».
- Extracción de citas. Extrae todas las contribuciones del Hablante 2 para una nota de investigación o un testimonio de cliente.
Para transcripción de entrevistas en particular, la guía sobre cómo transcribir una grabación de entrevista muestra cómo las etiquetas de hablante se traducen en salida estructurada.
Cuándo no necesitas diarización
Si la grabación es de un solo hablante (una nota de voz, una clase, un podcast en solitario), desactiva la diarización. La transcripción se procesa más rápido y evitas el pequeño riesgo de que un error de diarización introduzca un corte de hablante fantasma en un monólogo.
Para todo lo que tenga dos o más voces, vale la pena activar la diarización. El costo es mínimo y la diferencia de legibilidad en una grabación larga es significativa.
Preguntas frecuentes
¿Qué es la diarización de hablantes?
La diarización de hablantes segmenta una grabación de audio por hablante, etiquetando cada segmento como «Hablante 1», «Hablante 2», etc., según las características de la voz. Responde a «quién está hablando cuándo», no a «quién es específicamente esta persona». Ese último paso requiere un sistema de identificación de hablantes aparte, con muestras de voz registradas.
¿Qué es la tasa de error de diarización (DER)?
La DER es la métrica estándar de precisión. Suma tres tipos de error: habla de falsa alarma (silencio identificado como habla), habla omitida (habla real identificada como silencio) y confusión de hablante (habla correcta, etiqueta de hablante incorrecta), y luego divide entre la duración total del habla de referencia. Una DER inferior al 10% se considera generalmente buena. Las API comerciales modernas oscilan entre aproximadamente el 11% y más del 50% en el benchmark VoxConverse según el proveedor.
¿Cómo maneja la diarización automática de hablantes el habla solapada?
La mayoría de los sistemas tipo cascada eligen un solo hablante por segmento y descartan por completo la otra voz. Los sistemas neuronales de extremo a extremo como EEND tratan la diarización como una predicción multietiqueta, por lo que pueden marcar un segmento como que contiene dos hablantes simultáneamente. El solapamiento sigue siendo el modo de fallo más difícil. La solución práctica es una mejor disciplina de micrófonos antes de que empiece la llamada.
¿Puedo especificar el número de hablantes para mejorar la precisión?
Algunas herramientas permiten establecer un número de hablantes (Deepgram lo detecta automáticamente sin necesidad de indicarlo; pyannote lo admite como pista). Cuando una herramienta admite el parámetro y conoces la cifra, proporcionarla reduce el error de estimación. Si no la conoces o la herramienta la estima automáticamente, revisa el primer minuto del resultado para detectar etiquetas erróneas a tiempo.
¿Qué grabaciones obtienen los mejores resultados de diarización?
Grabaciones limpias con un micrófono por hablante o canales de audio separados por participante. Cada hablante en su propio canal convierte la diarización en un problema casi trivial. Los espacios silenciosos, las pausas breves entre turnos y la ausencia de voces de fondo también ayudan significativamente. Si la grabación ya está mezclada, una API de diarización de alta calidad más una revisión manual del primer minuto es la mejor vía de recuperación.
Fuentes
- Documentación de diarización de hablantes de Deepgram
- Benchmark de diarización de hablantes de Picovoice (VoxConverse)
- AssemblyAI: mejores bibliotecas y API de diarización de hablantes 2026
- Comparativa de modelos de diarización, arxiv 2509.26177
- Llevando la diarización de extremo a extremo al límite, Interspeech 2025
- Deepgram: presentación de Batch Diarization V2 (mayo de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.