
Precisión de transcripción explicada: qué significa realmente el 99%
Summarize this article with:
La tasa de error de palabras (WER) es la métrica estándar de precisión: los errores divididos entre el total de palabras de referencia, expresados como un porcentaje restado de 100. Una afirmación de "precisión del 99%" suena impresionante hasta que descubres que suele venir de grabaciones limpias de audiolibros, no de reuniones o llamadas telefónicas. El mismo modelo que alcanza un 98% en un archivo de estudio puede caer al 75-85% con audio ruidoso o con acento. Este post explica las matemáticas, los trucos de los benchmarks y cómo se sienten en la práctica los distintos niveles de precisión.
La precisión de la transcripción es la métrica que todos los proveedores anuncian y casi ninguno explica. La versión corta: "precisión" significa la tasa de error por palabra (WER) convertida en porcentaje, el punto de referencia del que proviene importa tanto como el número en sí, y el archivo que subes rara vez coincidirá con las condiciones que generaron esa afirmación de marketing.
Qué mide realmente la tasa de error por palabra
La fórmula es:
WER = (Sustituciones + Eliminaciones + Inserciones) / Total de palabras de referencia
Cada tipo de error cuenta como un punto:
- Sustitución. "Él dijo sí" transcrito como "ella dijo sí".
- Eliminación. "Envía el informe" transcrito como "envía informe".
- Inserción. "Nos vimos" transcrito como "nos hemos visto".
Una transcripción de referencia de 1.000 palabras con 50 errores da un WER del 5%, que se convierte en "95% de precisión" en la página del producto. Las matemáticas son correctas. Lo que el número oculta es que el WER trata cada palabra por igual: omitir "no" en "no apruebes la transferencia" cuesta un punto, y también lo hace omitir "eh". El daño a tu flujo de trabajo no es el mismo.
El WER tampoco penaliza el contexto erróneo. Un modelo que transcribe sistemáticamente "dos" como "to" mostrará casi ninguna penalización en el WER en la mayoría del audio, pero romperá cualquier script que procese números.
Cómo se sienten los rangos de precisión en la práctica
Los números aislados son fáciles de malinterpretar. Para una entrevista de una hora (aproximadamente 9.000 palabras):
| Precisión | Errores | Errores por minuto | Lo que obtienes |
|---|---|---|---|
| 99% | 90 | 1,5 | Transcripción casi limpia, solo una revisión ligera |
| 97% | 270 | 4,5 | Legible, 15-20 minutos de edición antes de publicar |
| 95% | 450 | 7,5 | Errores notables, especialmente en nombres propios, 30-45 minutos de edición |
| 90% | 900 | 15 | Útil como referencia aproximada pero necesita edición intensiva |
| 80% | 1.800 | 30 | A menudo más rápido volver a escribir desde cero |
Para la mayoría de los flujos de trabajo de publicación, el 95% es el mínimo y el 97% o más es lo que deberías esperar de una buena herramienta de IA con audio limpio. Si una herramienta rinde por debajo del 90% con tus archivos, el problema casi siempre está en la entrada de audio, no en el modelo. El artículo complementario sobre cómo mejorar la precisión de la transcripción cubre las soluciones concretas; el artículo sobre cómo lidiar con el ruido de fondo profundiza en la preparación del audio.
Por qué las cifras de referencia engañan
Los proveedores eligen sus propios puntos de referencia. Esto es lo que realmente miden los más comunes:
LibriSpeech. Audiolibros leídos por voluntarios en salas silenciosas. Los modelos puntúan sistemáticamente entre 97 y 99% aquí. Whisper Large-v3 alcanza aproximadamente un 2,7% de WER en el conjunto de prueba limpio. Este es el mejor escenario posible para cualquier grabación.
TED-LIUM. Charlas de conferencias con acentos y cierta variación entre hablantes. Más difícil, pero sigue siendo discurso ensayado. GPT-4o-transcribe llega a un 2,5% de WER aquí; AssemblyAI Universal-3 Pro ronda el 6,8% de WER.
CallHome / Earnings-22 / AMI. Conversaciones telefónicas, llamadas de resultados, reuniones con varios participantes. Whisper Large-v3 obtiene un 26,4% de WER en CallHome y un 15,9% de WER en audio de reuniones AMI. Estas son las cifras que reflejan cómo suena el audio empresarial real.
El número en la página de inicio casi siempre proviene de LibriSpeech o de un conjunto de datos limpio similar. El número que obtienes en una llamada de Zoom se acerca más al de CallHome o AMI, a veces peor.
Mi opinión: cuando un proveedor cita "99% de precisión", la primera pregunta que hay que hacer es "¿sobre qué conjunto de datos?". Si no pueden responder, trata el número como decorativo.
Los puntos de referencia independientes de terceros producen sistemáticamente tasas de error más altas que los internos de los proveedores. Los puntos de referencia internos de Deepgram sitúan a Nova-3 en aproximadamente un 5-7% de WER en sus conjuntos de prueba seleccionados; los puntos de referencia de terceros sobre audio mixto del mundo real colocan al mismo modelo en torno al 18% de WER. Ninguno está equivocado. Están midiendo cosas distintas.
For a detailed breakdown of how individual API providers compare, see the best speech-to-text APIs 2026 post.
What Actually Moves Your WER
The model choice is one variable. These factors move accuracy more on most files:
Audio quality
A clean 16 kHz mono recording with the speaker close to a USB microphone can hit under 3% WER. The same speaker on a speakerphone in a noisy room hits 15-25% WER on the same model. Verified real-world data confirms the range: clean studio audio lands at 3-5% WER for top models; far-field room audio lands at 18-28% WER.
The specific culprits: background noise above -40 dB relative to speech, heavy MP3 compression (64 kbps loses the fricative consonants models depend on), room reverb from hard walls, and distance from the microphone.
Accent and dialect
A model trained mostly on American English will score 96% on American English and closer to 85% on heavily accented speech. Whisper Large-v3 on accented English sits in the 8-15% WER range. The gap has narrowed with multilingual models, but it has not closed.
For non-English audio, using a provider that natively supports your language matters more than picking the highest-rated English model.
Domain vocabulary
General-purpose models trip on medical, legal, scientific, and niche technical terms. "Encephalitis" might come back as "in cephalitis." Brand names and proper nouns are especially fragile because they appear rarely in training data.
Three practical fixes: vocabulary boosting (most APIs let you pass a term list), custom models for high-volume domain work, or a targeted find-and-replace pass on known recurring terms.
Number of speakers and overlap
Single-speaker monologue is the easiest condition. Two speakers in a structured interview is manageable. Three or more people, especially with crosstalk, compounds errors quickly. Diarization errors and recognition errors stack on top of each other.
Para reuniones con varios interlocutores, espera un WER del 10-15% incluso con un modelo de primer nivel, salvo que el audio esté bien separado. El artículo sobre diarización de hablantes explicada cubre cómo interactúa la diarización con la precisión.
Duración del archivo
La mayoría de los pipelines modernos dividen el audio en ventanas de 30 segundos con solapamiento para manejar archivos largos. Whisper, en particular, puede alucinar en los límites de los fragmentos cuando el troceado es ingenuo, produciendo texto que suena fluido pero que no tiene nada que ver con el audio. Investigaciones publicadas en 2024-2025 confirmaron que un pequeño subconjunto de las cabezas de atención del decodificador de Whisper provoca la mayoría de estas alucinaciones en segmentos sin habla. La solución práctica es usar detección de actividad de voz antes del troceado para eliminar el silencio.
Puntuaciones de confianza: qué te dicen y qué no
La mayoría de las APIs modernas de reconocimiento de voz devuelven una puntuación de confianza por palabra o segmento. Una confianza de 0.92 significa que el modelo asigna un 92% de probabilidad a que esa palabra sea correcta.
La confianza es útil para:
- Señalar tramos a revisar. Un editor puede saltar directamente a las palabras de baja confianza en lugar de leer la transcripción completa.
- Control de calidad automatizado. Rechazar segmentos por debajo de un umbral y volver a ejecutarlos con otro modelo o con revisión humana.
- Estimar el tiempo de edición. Una transcripción de 90 minutos con 30 palabras de baja confianza se revisa más rápido que una donde los errores están repartidos de manera uniforme.
La confianza no es útil para:
- Demostrar corrección. Un modelo puede asignar alta confianza a una palabra alucinada. Whisper es el ejemplo más citado, produciendo salida que suena fluida en entradas silenciosas o ruidosas con puntuaciones de confianza altas.
- Comparar entre modelos. Un 0.90 de Deepgram y un 0.90 de Whisper usan escalas internas distintas. No son el mismo número.
Usa la confianza para saber dónde mirar, no como sustituto de mirar.
Transcripción humana como punto de referencia
Trained human transcriptionists score 98-99% on clean audio and 95-97% on difficult audio. The AI-to-human gap on clean audio is now small enough that the difference rarely justifies the cost for most use cases.
The gap on hard audio is still meaningful. Courts, qualitative researchers, and medical documentation workflows still use human transcription for material where errors carry real consequences.
Worth noting: two humans transcribing the same file will not produce identical transcripts. Inter-annotator agreement on challenging audio sits around 95%, which sets a practical ceiling on what any system, AI or human, can achieve on that material.
Measuring Your Own WER
If you want to know what accuracy you are actually getting on your audio:
- Take a 5-minute sample of your typical audio, something representative of your real workload.
- Transcribe it carefully by hand (this is your reference transcript).
- Run the same clip through your AI tool (this is your hypothesis transcript).
- Compute WER using the Python jiwer library or the NIST sclite toolkit.
Five minutes of your actual audio gives you a more actionable number than any vendor benchmark. The comparison to aim for is not the marketing page, it is your own reference against your own audio.
If you want a fast check before committing to a paid plan, the audio-to-text tool at ConvertAudioToText lets you upload a sample and inspect the output directly. If your specific audio type produces poor results, you will see it before you pay.
When WER Is Not the Right Question
Three use-case rules:
- Publicación verbatim (notas del episodio, citas de prensa): apunta al 97% o más y reserva una pasada de edición de 15 a 20 minutos. Un solo número o nombre mal escrito en una transcripción publicada es el tipo de error que no pasa desapercibido.
- Indexación para búsquedas o toma de notas: un 90-92% suele ser suficiente. Los errores en muletillas y variaciones menores no rompen una consulta de búsqueda.
- Citar pasajes concretos por escrito: verifica siempre la cita específica contra el audio, sin importar la precisión general. El WER global puede ser excelente mientras una frase concreta está mal.
El umbral de precisión correcto lo marca el uso que se le va a dar a la transcripción, no lo que suena bien en una comparativa de productos.
FAQ
¿Qué es la tasa de error por palabra (WER)?
El WER es la métrica estándar para medir la precisión de una transcripción. Se calcula como (sustituciones + eliminaciones + inserciones) dividido entre el número total de palabras de la transcripción de referencia. Un WER del 5% se reporta como una precisión del 95%. Cuenta tres tipos de error por igual: una palabra sustituida, una omitida y una añadida cuestan un punto cada una, sin importar cuánto cambien el significado.
¿Por qué los proveedores afirman un 99% de precisión pero mis archivos salen peor?
Porque la elección del benchmark importa muchísimo. La mayoría de los proveedores citan la precisión de LibriSpeech, un conjunto de datos de audiolibros limpio donde incluso los modelos de gama media superan el 97%. El audio del mundo real, sobre todo reuniones, llamadas telefónicas o entornos ruidosos, produce tasas de error significativamente más altas. Los investigadores de Gladia han documentado que un mismo modelo reporta un 5% de WER en un benchmark y más de un 25% en producción con audio real equivalente. El número del benchmark no es una mentira, pero tampoco es tu número.
¿Cómo se siente realmente una precisión del 95% en una grabación de una hora?
Una entrevista de una hora tiene unas 9.000 palabras. Con un 95% de precisión, eso son 450 errores, o unos 7 fallos por minuto. El texto se puede leer, pero los nombres propios y los términos técnicos suelen fallar, y necesitarás entre 30 y 45 minutos de revisión antes de publicar. Con un 99% de precisión (90 errores), se lee casi como una transcripción humana limpia y solo requiere un repaso ligero.
¿Puedo fiarme de las puntuaciones de confianza para encontrar errores?
Las puntuaciones de confianza sirven para señalar qué palabras conviene revisar, no como prueba de que sean correctas. Un modelo puede asignar una confianza alta a una palabra inventada, sobre todo en segmentos con ruido o silencio. Whisper es especialmente conocido por generar texto que suena fluido en audio que no contiene habla. Además, una confianza de 0,9 de un modelo no es lo mismo que 0,9 de otro: las escalas no están calibradas entre proveedores.
¿Cómo mido mi WER real?
Toma una muestra de 5 minutos de tu audio habitual, transcríbela manualmente, pásala por tu herramienta de IA y luego compara ambas con la librería jiwer de Python o el kit de herramientas sclite de NIST. Ambos calculan el WER a partir de una transcripción de referencia y una hipótesis. Cinco minutos de tu audio real te dan un número mucho más útil que cualquier benchmark del proveedor.

Fuentes
- Word Error Rate está roto: cómo evaluar realmente el speech-to-text en 2026 - AssemblyAI
- ¿Qué precisión tiene el speech-to-text en 2026? - AssemblyAI
- ¿Qué es el WER en el speech-to-text? - Vatis Tech
- Qué es el Word Error Rate (WER): cómo se calcula - Gladia
- ¿Qué precisión tiene Whisper en 2026? (datos de WER por idioma) - VexaScribe
- Mejor modelo de speech-to-text de código abierto en 2026 (con benchmarks) - Northflank
- jiwer - calculadora de WER en Python - PyPI
- Precisión de la transcripción con IA frente a la humana - Rev
- Calm-Whisper: reduce las alucinaciones de Whisper - Interspeech 2025
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.