Puntuaciones de confianza en transcripciones, explicadas: cómo usarlas
puntuaciones de confianzacalidad de transcripcióntécnico

Puntuaciones de confianza en transcripciones, explicadas: cómo usarlas

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

Qué significa realmente la puntuación

Una puntuación de confianza es la estimación del motor, expresada como un número entre 0 y 1, de que una palabra concreta de la transcripción es correcta. Una puntuación de 0.95 significa que el modelo cree que hay aproximadamente un 95% de probabilidades de que haya acertado con esa palabra. Una puntuación de 0.42 significa que estaba mucho menos seguro.

La puntuación vive a nivel de palabra en la mayoría de las API de producción. Deepgram, por ejemplo, devuelve un campo confidence por palabra en cada objeto de palabra de la respuesta de la API, definido en su documentación como "un número flotante entre 0 y 1 que representa la probabilidad estimada por el modelo de que la palabra se transcribiera correctamente". En la práctica verás valores agrupados cerca de 1.0 en audio limpio, porque con habla clara el modelo está genuinamente seguro de la mayoría de las palabras. La señal está en los valores atípicos.

La salida de referencia de Whisper funciona de forma distinta. No expone la confianza por palabra de forma nativa. En su lugar, cada segmento lleva avg_logprob (probabilidad logarítmica media del segmento, donde un valor más negativo indica menos certeza) y no_speech_prob (la estimación del modelo de que nadie estaba hablando durante ese intervalo). No hay un equivalente directo a la puntuación por palabra de Deepgram sin un postprocesado adicional de las probabilidades de los tokens. Las herramientas que envuelven Whisper pueden derivar estimaciones a nivel de palabra a partir de pasadas de alineación, pero no son lo mismo que una salida nativa por palabra.

Por qué los números son más difíciles de usar de lo que parecen

Una confianza alta no es una garantía

Una confianza de 0.99 significa que, aproximadamente, una palabra de cada cien con esa puntuación será incorrecta. En una transcripción de una hora con 8.000 palabras, incluso un 1% de errores con "confianza muy alta" produce unas 80 equivocaciones. El riesgo mayor es que los modelos neuronales modernos pueden ser sistemáticamente demasiado confiados, sobre todo en condiciones de ruido. Investigaciones publicadas en 2024 y 2025 hallaron que algunos modelos ASR predicen incorrectamente entre el 10 y el 20% de los tokens con una confianza superior a 0.70 en relaciones señal-ruido bajas. Eso no es un defecto de un producto concreto; refleja cómo se comportan las probabilidades softmax en los decodificadores neuronales cuando el modelo no ha sido ajustado en calibración.

La consecuencia práctica: trata la alta confianza como un filtro, no como una prueba. Te indica dónde invertir tu tiempo de revisión al final, no dónde no pueden existir errores.

La baja confianza no es un veredicto de error

Lo contrario también es cierto. Una palabra con 0.45 de confianza puede ser perfectamente correcta. La baja confianza suele significar que el modelo consideró varias candidatas plausibles y eligió una por un margen pequeño. Los nombres propios que el motor ha visto rara vez, los números donde el contexto admite varios valores y los homófonos que solo se desambiguan en la siguiente frase son las palabras de baja confianza más comunes. La respuesta adecuada es contrastar esas palabras con el audio, no asumir que están mal.

Las puntuaciones no son comparables entre motores

Esta es la advertencia más importante y es fácil pasarla por alto. Un 0.85 de Deepgram y un 0.85 de otro motor no afirman lo mismo. La documentación propia de Deepgram lo dice directamente: "Las definiciones y la calibración de las puntuaciones de confianza varían entre proveedores de STT. No puedes comparar directamente las distribuciones de confianza en bruto entre proveedores." Distintos motores usan escalas de probabilidad diferentes, ajustes de calibración distintos y, a veces, definiciones diferentes de lo que representa la puntuación. Si eliges entre motores basándote en la salida media de confianza, estás comparando números incompatibles.

Una comparación significativa de motores requiere ejecutar ambos sobre el mismo audio, revisar la salida manualmente y medir la tasa real de error por palabra. Consulta explicación de la precisión de transcripción para saber cómo hacerlo correctamente.

Nivel de palabra frente a nivel de segmento

La confianza a nivel de palabra asigna un número a cada palabra individual. Es el formato más práctico para revisar transcripciones, porque puedes ir directamente a la palabra concreta que generaba dudas.

La confianza a nivel de segmento asigna un único número a una frase o bloque de oración. La puntuación a nivel de transcripción de Deepgram es la mediana de los valores a nivel de palabra en ese fragmento. El avg_logprob de Whisper es una probabilidad logarítmica a nivel de segmento. Ambos sirven para ojear una transcripción larga y localizar secciones aproximadas, pero ninguno te dice qué palabra dentro de un segmento marcado es el problema.

Para trabajo práctico de revisión, el nivel de palabra es la mejor herramienta. Para decisiones de enrutamiento (enviar este segmento a un revisor humano), el nivel de segmento suele bastar.

Calibración: qué es y por qué importa

Una puntuación de confianza calibrada es aquella donde el número refleja con honestidad la precisión. Si recopilas cada palabra que el motor puntuó con 0,90 y las compruebas todas, exactamente el 90% debería ser correcto. Eso es calibración. Deepgram describe su confianza de palabra como una "probabilidad calibrada" con esa propiedad como objetivo.

La mayoría de los modelos neuronales no están perfectamente calibrados de fábrica. Tienden al exceso de confianza en el extremo alto: marcan algo como 0,95 cuando la precisión real se acerca más a 0,88. El escalado de temperatura y otras técnicas posteriores pueden mejorar esto, pero pocos productos publican si las aplican y cómo.

La respuesta práctica: no asumas que el número de confianza es una probabilidad perfectamente honesta. Úsalo como una señal relativa, no absoluta. Verifícalo con tus propios datos revisando una muestra de palabras en diferentes rangos de confianza y observa qué fracción es realmente correcta. La curva de calibración resultante te dice qué significa realmente cada nivel de confianza en tu tipo de audio específico. Una entrevista con acento marcado producirá una curva de calibración distinta a la de un podcast grabado en estudio, incluso con el mismo motor.

Uso de las puntuaciones de confianza en la práctica

Prioriza tu revisión ordenando de menor a mayor

Para transcripciones largas, ordena o filtra las palabras por confianza y revisa primero las de menor puntuación. La mayoría de los errores reales en una transcripción de 90 minutos se concentran en unos pocos cientos de palabras por debajo del umbral de 0.70. Revisar esas palabras concretas contra el audio captura la mayor parte de los fallos con una fracción del tiempo que costaría leer de principio a fin.

La mayoría de las herramientas de transcripción para consumidores lo muestran con resaltado de color: las palabras de baja confianza aparecen en un color distinto y haces clic en ellas. Si trabajas con la salida cruda de la API, filtra la lista de palabras por el campo confidence y pon en cola las marcas de tiempo de esas palabras en tu reproductor de audio.

Herramienta de subida de audio en ConvertAudioToText donde comienzan la transcripción y la revisión
Herramienta de subida de audio en ConvertAudioToText donde comienzan la transcripción y la revisión

Establece un umbral para el control de calidad automatizado

Para flujos de trabajo de alto volumen o sensibles al cumplimiento normativo, establece un umbral y marca automáticamente las transcripciones o palabras que queden por debajo para revisión humana. Un punto de partida habitual es 0.80 o 0.85, pero el número correcto depende de lo que muestre tu comprobación de calibración para tu tipo de audio.

La señal de incertidumbre del modelo se convierte en un control de calidad integrado. Esto funciona bien en cualquier flujo donde la calidad de la transcripción deba cumplir un estándar definido antes de que el texto alimente los sistemas posteriores. Para más información sobre qué hace que una transcripción cueste menos producirla con calidad, los artículos sobre precios cubren qué es lo que realmente pagas cuando la revisión consciente de la confianza está incluida.

Ponderar las coincidencias de baja confianza en los sistemas posteriores

Si estás construyendo búsqueda o analítica sobre transcripciones, trata el texto como una señal ruidosa en lugar de una verdad absoluta. Una coincidencia de palabra clave en una palabra puntuada con 0.45 debería tener menos peso que una coincidencia con 0.98. Un panel de analítica que cuente ocurrencias de términos debería considerar la ponderación por confianza. De lo contrario, un nombre propio confuso se propaga hacia datos posteriores engañosos.

Lo que la confianza no detecta

Conocer los límites importa tanto como conocer los casos de uso.

La confianza no detecta palabras incorrectas semánticamente plausibles. "Afecto" frente a "efecto", "principal" frente a "principio", "tu" frente a "tú" a menudo se transcriben con alta confianza porque el motor se comprometió con una opción antes de que el contexto estuviera disponible para distinguirlas. Son errores reales que la puntuación no señalará.

La confianza no detecta alucinaciones durante el silencio. Si el modelo genera texto fantasma durante un tramo de silencio, la confianza en esas palabras fantasma podría ser moderada, pero las palabras son completamente inventadas. Este es un modo de fallo separado con sus propias señales de detección, sin relación con el campo de confianza de la palabra.

La confianza no cubre la precisión de la etiqueta del hablante. La confianza de la transcripción se refiere a las palabras. Deepgram también devuelve un campo speaker_confidence en audio pregrabado para resultados de diarización, pero es un número aparte, de un modelo distinto. Las dos señales son independientes. Una palabra puede transcribirse correctamente pero atribuirse al hablante equivocado, y ninguno de los dos campos de confianza lo señalará. Consulta explicación de la diarización de hablantes para ver cómo funciona la confianza del hablante.

La confianza no detecta palabras omitidas. Si el modelo no transcribió una palabra en absoluto, no hay puntuación de confianza que lo marque. Las palabras ausentes son los errores más difíciles de detectar a posteriori y quedan fuera del alcance de lo que aborda la puntuación de confianza.

Confianza entre motores: Deepgram y Whisper, lado a lado

SeñalDeepgramWhisper (referencia)
Confianza por palabraSí, campo confidence (0-1)No expuesta de forma nativa en la API
Señal a nivel de segmentoConfianza de transcripción = mediana de las puntuaciones de palabrasavg_logprob (flotante negativo, más negativo = menos certeza)
Detección de silenciono_speech_prob no está en la salida estándarno_speech_prob por segmento
Confianza del hablantespeaker_confidence (solo pregrabado)No disponible
Listo para flujos de trabajo con umbralesSí, sin necesidad de postprocesadoRequiere herramientas adicionales de alineación para nivel de palabra

Para quienes quieran crear flujos de revisión o ponderación posteriores basados en la confianza, el formato de Deepgram resulta más práctico de inmediato. El avg_logprob de Whisper es útil para decisiones de enrutamiento (marcar un segmento completo), pero requiere herramientas adicionales para obtener valores por palabra. Consulta Deepgram Nova-3 explicado para más detalles sobre cómo funciona el motor de Deepgram por dentro.

Mi opinión: lo más útil que puedes hacer con las puntuaciones de confianza es ejecutar una comprobación de calibración sobre una muestra de tu propio audio antes de montar cualquier flujo automatizado basado en umbrales. Lo que significa un 0.80 en tu material no es lo que significa en el de otro, y la curva se desplaza según cambian las condiciones del audio.

FAQ

¿Qué es una buena puntuación de confianza para la transcripción?

No existe un umbral universal porque las escalas de confianza difieren entre motores. Dentro de un mismo motor, las palabras por debajo de 0.80 merecen una segunda mirada. Las palabras por debajo de 0.60 casi siempre requieren revisión. Pero estos cortes son puntos de partida, no garantías: una palabra con 0.99 puede seguir siendo incorrecta, y una con 0.55 puede ser correcta.

¿Son comparables las puntuaciones de confianza entre Deepgram, Whisper y otros motores?

No. La documentación de Deepgram indica explícitamente que las definiciones de confianza y la calibración varían entre proveedores y que las puntuaciones brutas no pueden compararse directamente. Un 0.85 de Deepgram y un 0.85 de otro motor no son la misma afirmación sobre precisión.

¿Por qué una palabra con alta confianza a veces resulta ser incorrecta?

El modelo se compromete con una palabra token a token, antes de que esté disponible el contexto completo. Palabras acústicamente similares ('affect' vs. 'effect', 'principal' vs. 'principle') pueden obtener una alta confianza porque el modelo nunca las consideró ambiguas, incluso cuando eligió la incorrecta. El exceso de confianza bajo ruido también está bien documentado en la investigación de ASR.

¿Una puntuación de confianza baja significa que la palabra es incorrecta?

No necesariamente. Una confianza baja indica que el modelo consideró varios candidatos plausibles y el elegido ganó por un margen estrecho. El ganador puede seguir siendo correcto. Las palabras con confianza baja más comunes son nombres propios, números y homófonos donde el contexto circundante no fue suficiente para fijar un ganador claro.

Si quieres experimentar con la transcripción consciente de la confianza sin crear una cuenta, la herramienta de audio a texto de ConvertAudioToText procesa las subidas de inmediato y devuelve una salida estructurada cuando el motor subyacente admite valores por palabra.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles