
Cómo la IA gestiona a varios hablantes: límites y ajustes
Summarize this article with:
La transcripción y la diarización de hablantes son dos modelos separados cuyas salidas se ensamblan después, lo que explica la mayoría de los fallos con varios hablantes. La diarización es fiable con pocos hablantes claramente diferenciados y se degrada a medida que aumenta el número; el habla solapada es el principal punto de ruptura. Un ajuste de número máximo de hablantes es una pista para el modelo, no una garantía. Whisper por sí solo no tiene diarización alguna; motores como AssemblyAI y Deepgram la añaden. Para reuniones, la captura por participante mediante un bot de reuniones supera a diarizar un único micrófono de sala.
Cómo los motores separan a los hablantes
Cuando subes una grabación con varios hablantes, la IA hace dos trabajos separados: transcribe las palabras y averigua quién dijo cada una. La mayoría de la gente asume que ambas cosas ocurren a la vez. No es así. El modelo de transcripción y el modelo de diarización funcionan en paralelo, y sus salidas se ensamblan al final. Entender esa separación explica la mayoría de los errores de la transcripción con varios hablantes.
El nombre técnico del trabajo de "quién dijo qué" es la diarización de hablantes. Para profundizar en cómo funcionan los modelos subyacentes, consulta diarización de hablantes explicada. Este artículo se centra en el lado práctico: cómo gestionan los motores el audio con varios hablantes, cuáles son sus límites de hablantes documentados y dónde cae la precisión.
La arquitectura de dos modelos
Un motor de transcripción típico ejecuta dos modelos sobre cada pieza de audio.
El modelo de transcripción convierte la forma de onda del audio en texto con marcas de tiempo a nivel de palabra. Produce algo como: "0,4 s: la, 0,6 s: reunión, 0,9 s: empieza, 1,2 s: ahora." No tiene ni idea de cuántas personas están hablando.
El modelo de diarización produce un tipo de salida distinto: una línea de tiempo de hablantes. Dice "de 0,0 s a 14,2 s este es el Hablante A; de 14,2 s a 16,0 s este es el Hablante B". No tiene ni idea de lo que dijeron los hablantes.
Cuando ambos modelos terminan, el motor los alinea. Cada palabra recibe la etiqueta de hablante que la línea de tiempo de diarización asignó a su marca de tiempo. El resultado es una transcripción con etiquetas de hablante.
El modelo de diarización en sí suele funcionar en tres pasos: detección de actividad de voz (identificar las regiones del audio que contienen habla), speaker embedding (convertir segmentos breves de audio en vectores que codifican la identidad vocal) y clustering (agrupar vectores similares en etiquetas de hablante). En el fondo, la mayoría de las API comerciales usan variantes de este pipeline, a menudo construidas sobre pyannote o inspiradas en él, el framework de diarización de código abierto dominante.
Una advertencia importante: el modelo de diarización no identifica a los hablantes por su nombre. Asigna etiquetas de clúster. "Hablante 1" y "Hablante 2" son identificadores de clúster, no identidades reales. La asignación de nombres, si existe, ocurre aparte mediante la inscripción de hablantes, metadatos del calendario o un renombrado manual.

Qué significan realmente los ajustes de "número máximo de hablantes"
La mayoría de las API de transcripción exponen un parámetro para el número de hablantes. Esto es lo que documentan los principales motores a mediados de 2026.
| Motor | Parámetro de hablantes | Rango documentado | Notas |
|---|---|---|---|
| AWS Transcribe | MaxSpeakerLabels | 2 a 30 | Según la referencia de la API. Los hablantes por encima del límite se fusionan en el clúster más cercano. |
| Google Cloud STT v1 | min_speaker_count / max_speaker_count | Rango mostrado en ejemplos de código hasta 10; techo máximo sin documentar | La documentación de V1 muestra ejemplos hasta 10; tómalo como orientación, no como un techo estricto. |
| AssemblyAI (asíncrono) | speakers_expected / speaker_options | 1 a 20 | Según la documentación del proveedor, consultada en julio de 2026. |
| AssemblyAI (streaming) | max_speakers | 1 a 10 | Una pista, no un límite estricto; la precisión se degrada en el extremo superior. |
| Deepgram Nova-3 | Detección automática | Sin límite publicado en la documentación | Deepgram no documenta un máximo; el modelo detecta automáticamente el número de hablantes. |
| Whisper (API de OpenAI) | Ninguno | No compatible de forma nativa | Whisper solo transcribe palabras. La diarización requiere un complemento como WhisperX con pyannote. |
Algunas cosas que la tabla no te dice: un techo alto de parámetro no significa una salida precisa en ese techo. Configurar MaxSpeakerLabels=30 en AWS Transcribe no significa que AWS identifique de forma fiable a 30 hablantes distintos. Significa que el sistema lo intentará. La precisión en el extremo superior del rango de cualquier motor es sustancialmente menor que con 2 a 4 hablantes.
Cómo se degrada la precisión según el número de hablantes
Cuantos más hablantes añades, menos audio aporta cada uno por minuto y más difícil se vuelve el problema de clustering. Una conversación entre dos personas le da al modelo varios minutos de señal de voz por persona para construir un perfil de voz fiable. Una llamada de conferencia con 10 personas puede dar a cada una 90 segundos de turnos fragmentados.
Los conjuntos de datos de referencia ofrecen algunos puntos de comparación, aunque son cifras en condiciones controladas. En el corpus de reuniones AMI (grabaciones con micrófono, 3-4 hablantes, condiciones controladas), los sistemas de última generación alcanzan aproximadamente un 7% de tasa de error de diarización (DER). En DIHARD, un conjunto de datos mucho más difícil con audio más ruidoso y variado, el DER sube a alrededor del 18% incluso para sistemas potentes. Las grabaciones reales con una mala configuración de micrófonos, habla solapada y muchos hablantes suelen situarse más cerca del rango de DIHARD o peor.
El DER mide la proporción de tiempo de habla atribuida al clúster de hablante equivocado, junto con el habla omitida y las falsas alarmas. Un DER del 7% en una grabación de una hora significa que unos 4 minutos de audio están mal etiquetados. Es manejable para un resumen de reunión; no es aceptable para una transcripción legal literal.
Las condiciones que elevan el DER de forma consistente:
Muchos hablantes. Con seis o más es donde la mayoría de los motores empiezan a sufrir. Los clústeres empiezan a solaparse; los turnos cortos se atribuyen mal; los hablantes con voces similares se fusionan.
Turnos cortos. "Sí", "exacto", "vale". Estos turnos de una sola palabra casi no dan nada con que trabajar al modelo de embeddings. Se etiquetan mal con frecuencia incluso cuando los turnos más largos del mismo hablante son correctos.
Voces similares. Dos personas del mismo sexo, edad parecida y acento similar pueden quedar muy cerca en el espacio de embeddings. El algoritmo de clustering a veces las fusiona o intercambia sus etiquetas a mitad de conversación.
Un solo micrófono, acústica de sala. Un micrófono de techo en una sala de conferencias mezcla todas las voces antes de cualquier procesamiento de señal. Las señales por canal de micrófonos individuales son dramáticamente más fáciles de diarizar. Sobre el habla solapada en concreto, consulta cómo manejar el habla solapada y cómo corregir hablantes solapados.
La brecha de Whisper
Merece la pena mencionar a Whisper aparte porque es la base de muchas herramientas de transcripción. El modelo Whisper de OpenAI no tiene diarización nativa alguna. Produce una transcripción sin etiquetas de hablante.
Los productos construidos sobre Whisper en bruto o bien omiten la diarización por completo, o añaden WhisperX (que pasa la salida de Whisper por pyannote), o ejecutan un modelo de diarización independiente sobre el mismo audio. Si una herramienta se describe como "basada en Whisper" y ofrece etiquetas de hablante, pregunta qué modelo de diarización utiliza y dónde ocurre la alineación. La respuesta importa para la precisión con audio difícil.
Para una comparación de cómo se sitúa Whisper frente a las API especializadas, consulta Whisper vs Google Cloud Speech 2026 y las mejores API de voz a texto 2026.
Bot de reuniones frente a diarización por subida de archivos
Dos arquitecturas distintas, dos perfiles de precisión distintos.
Los bots de reuniones (Otter, Fireflies y herramientas similares) se unen a la llamada como participantes. Pueden capturar flujos de audio por participante desde la plataforma, acceder a los metadatos del calendario con los nombres de los asistentes y emparejar las etiquetas de hablante con nombres reales en tiempo real. Esta es una ventaja estructural para los casos de uso centrados en reuniones. Fireflies documenta soporte para hasta 50 hablantes por conversación, más que la mayoría de las API de subida de archivos, en parte porque la separación de flujos por participante hace el problema de diarización mucho más fácil.
Las API de subida de archivos trabajan a partir de una mezcla mono o estéreo. No tienen ninguna de las ventajas del flujo por participante. Para grabaciones de reuniones, esto significa que la precisión suele ser menor que la de un bot que asistió en vivo a la misma reunión. Para otros tipos de audio (pódcast, entrevistas, audiencias judiciales), el enfoque de subida de archivos es la única opción.
Mi opinión: para la precisión con varios hablantes en reuniones grabadas, un bot de reuniones nativo tiene una ventaja estructural. Para todo lo demás, Deepgram Nova-3 y AssemblyAI son las opciones de subida de archivos más potentes según los benchmarks actuales y los rangos de hablantes documentados. Pero prueba con tu propio audio antes de comprometerte con un pipeline. Los benchmarks de DER se miden en conjuntos de datos controlados; tus grabaciones no lo están.
Cuándo desactivar la diarización
No todas las grabaciones con varios hablantes necesitan diarización. Algunos casos en los que añade ruido en lugar de valor:
Grabaciones en solitario con voces de fondo ocasionales. Un narrador único con un copresentador que habla poco. La diarización producirá cambios de hablante espurios cada vez que la voz de fondo intervenga.
Subtítulos codificados y subtítulos de vídeo. El espectador ve el vídeo; la estructura de hablantes es visible. Las etiquetas añaden desorden.
Clips muy cortos. Con menos de dos minutos, la estructura de hablantes suele ser obvia por el contexto, y el modelo tiene demasiado poco audio para construir un clúster fiable.
Para archivos de un solo hablante, la mayoría de los motores permiten desactivar la diarización explícitamente. Hazlo. Obtienes una transcripción más limpia y un procesamiento más rápido.
Si necesitas corregir etiquetas de hablante erróneas en una transcripción existente, el artículo corregir etiquetas de hablante incorrectas cubre el flujo de corrección.
Qué buscar en una transcripción de varios hablantes
Una lista breve de comprobación al evaluar cualquier motor para uso con varios hablantes:
- ¿Detecta automáticamente el número de hablantes o lo configuras tú? La detección automática es más flexible pero puede equivocarse en el conteo. Establecer el número esperado de hablantes, cuando lo conoces, generalmente mejora la precisión.
- ¿Documenta un techo máximo de hablantes? AWS Transcribe indica 30. AssemblyAI asíncrono indica 20. El techo estricto de Google Cloud está menos claramente documentado. Deepgram no publica ninguno. Ten claro con qué estás trabajando.
- ¿Ofrece marcas de tiempo a nivel de palabra junto con las etiquetas de hablante? La calidad de la alineación depende de la precisión de las marcas de tiempo. Sin marcas de tiempo a nivel de palabra, los límites de las etiquetas de hablante pueden ir rezagados o adelantados respecto al cambio real de hablante.
- ¿Puedes corregir las etiquetas tras el procesamiento? El etiquetado incorrecto es inevitable. Una interfaz de edición o una exportación estructurada donde puedas renombrar y fusionar clústeres ahorra tiempo en cualquier transcripción importante.
Si necesitas una transcripción rápida y precisa sin montar un bot de reuniones, ConvertAudioToText gestiona subidas con varios hablantes con etiquetas de hablante numeradas y una salida estructurada que puedes descargar o copiar directamente. No se requiere cuenta para probarlo.
Preguntas frecuentes
¿Qué es la diarización de hablantes y por qué se ejecuta por separado de la transcripción?
La diarización de hablantes es el proceso de dividir el audio en segmentos y asignar cada segmento a un clúster de hablante. Se ejecuta por separado de la transcripción porque los dos modelos resuelven problemas distintos: uno decodifica el habla a texto y el otro codifica la identidad vocal en vectores y los agrupa. La mayoría de los motores ejecutan ambos en paralelo y alinean las salidas por marca de tiempo. Mantenerlos separados también significa que puedes cambiar el backend de diarización sin reentrenar el modelo de transcripción.
¿Cuántos hablantes pueden manejar con precisión los motores de transcripción con IA?
Los techos publicados de los parámetros son altos (AWS Transcribe llega hasta 30, AssemblyAI asíncrono hasta 20), pero la precisión se degrada mucho antes de alcanzar esas cifras. En la práctica, de 2 a 4 hablantes con pausas claras entre turnos produce una salida fiable. Con 6 o más hablantes, la precisión cae de forma significativa, especialmente en grabaciones con un solo micrófono. Los turnos cortos y los perfiles vocales similares agravan el problema independientemente del número de hablantes.
¿OpenAI Whisper admite la diarización de hablantes?
No. Whisper produce una transcripción sin etiquetas de hablante. Los productos que añaden diarización sobre Whisper o integran WhisperX (que acopla pyannote al pipeline de Whisper) o ejecutan un modelo de diarización independiente y alinean las salidas. Si las etiquetas de hablante te importan, comprueba qué modelo de diarización está funcionando en el fondo, no solo qué modelo de reconocimiento de voz.
¿Cuándo debería desactivar la diarización?
Para audio de un solo hablante, clips cortos de menos de dos minutos y casos de uso de subtítulos codificados o subtítulos donde la estructura de hablantes es visualmente obvia. Ejecutar la diarización en audio de un solo hablante suele producir cambios de hablante espurios que ensucian la transcripción. La mayoría de los motores permiten desactivarla explícitamente, lo que además acelera el procesamiento.
Fuentes
- AWS Transcribe API Reference, Settings.MaxSpeakerLabels: https://docs.aws.amazon.com/transcribe/latest/APIReference/API_Settings.html (consultado en julio de 2026)
- AssemblyAI, Top Speaker Diarization Libraries and APIs 2026: https://www.assemblyai.com/blog/top-speaker-diarization-libraries-and-apis (consultado en julio de 2026)
- Deepgram, Speaker Diarization documentation: https://developers.deepgram.com/docs/diarization (consultado en julio de 2026)
- Google Cloud Speech-to-Text, Detect different speakers: https://docs.cloud.google.com/speech-to-text/docs/multiple-voices (consultado en julio de 2026)
- Picovoice, State of Speaker Diarization 2026 (pyannote vs Falcon benchmark): https://picovoice.ai/blog/state-of-speaker-diarization/ (consultado en julio de 2026)
- pyannote.ai, What is Speaker Diarization: https://www.pyannote.ai/blog/what-is-speaker-diarization (consultado en julio de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.