Cómo mejorar la precisión de la transcripción: el flujo completo
transcripciónprecisiónconsejos

Cómo mejorar la precisión de la transcripción: el flujo completo

BMMamane B. MoussaMay 26, 2026Updated July 2, 202612 min read

Summarize this article with:

Los 5 cambios de mayor impacto

La precisión que obtienes de cualquier modelo de transcripción se determina en su mayor parte antes de pulsar subir. Whisper Large-v3 registra alrededor de un 2,7 % de tasa de error de palabra (WER) en audio limpio de estudio y sube hasta un 8 %–12 % en grabaciones reales. Deepgram Nova-3 publica un WER por lotes del 5,26 % en audio de producción. Esa diferencia no es culpa del modelo: es el ruido de la sala, la distancia del micrófono, los ajustes del códec y la jerga sin pistas previas; todo eso depende de ti.

El flujo termina en el uploader: entra audio limpio, sale transcripción limpia
El flujo termina en el uploader: entra audio limpio, sale transcripción limpia

Los cinco cambios que más mueven la aguja de la precisión, en orden:

  1. Un micrófono dedicado, cerca del hablante. Ningún otro cambio individual mueve la aguja tanto.
  2. Una sala silenciosa y con poca reverberación. La reverberación puede recortar la precisión entre un 20 % y un 30 % en espacios muy reflectantes, independientemente del nivel de ruido de fondo.
  3. Captura multipista por hablante para llamadas remotas. Una pista compartida con dos hablantes es un problema de diarización desde el principio.
  4. El modelo adecuado para tu idioma. Un modelo afinado para inglés de EE. UU. aplicado a audio en francés pierde puntos de precisión en cifras de dos dígitos.
  5. Pistas de términos clave y el número correcto de hablantes suministrados al modelo antes de iniciar la transcripción. El keyterm prompting de Deepgram puede elevar la tasa de recuperación de palabras clave hasta el 90 %; la mayoría de las plataformas ofrecen este ajuste, pero pocos usuarios lo tocan.

Todo lo que sigue es el flujo ordenado para acertar con los cinco, de principio a fin.

Etapa 1: Asegura la sala antes de grabar

La mayoría de los errores de transcripción se remontan al entorno de grabación, no al modelo. El modelo recibe lo que sea que haya capturado el micrófono: arreglar la sala es más rápido que cualquier posprocesamiento.

Los dos problemas de una sala son el ruido y la reverberación, y se potencian mutuamente. Un espacio de superficies duras y propenso al eco amplifica el ruido de fondo porque las reflexiones hacen rebotar el ruido. Resuelve ambos a la vez:

  • Elimina las fuentes de ruido continuo durante la ventana de grabación: sistemas de climatización (HVAC), ventiladores de sobremesa, ventanas abiertas hacia el tráfico.
  • Aléjate de las grandes superficies duras (paredes desnudas, ventanas). El mobiliario blando (sofá, alfombra, cortinas, un armario lleno de ropa) absorbe las reflexiones sin necesidad de espuma acústica.
  • Cierra todas las puertas entre el espacio de grabación y el ruido exterior. La rendija bajo una puerta deja pasar más sonido que la propia puerta; una toalla enrollada en la base ayuda.

Si tu sala tiene ruido inevitable, Krisp (en tiempo real, elimina el ruido antes de que entre en la grabación) y Adobe Podcast Enhance Speech (gratuito, basado en navegador, procesa después) son herramientas probadas para una limpieza moderada. Reducen el ruido que capturó el micrófono; no pueden recuperar las palabras que el ruido borró.

Para profundizar en la preparación de la sala y el manejo del ruido, consulta cómo lidiar con el ruido de fondo en la transcripción y buenas prácticas del entorno de grabación.

Etapa 2: Coloca el micrófono correctamente

Un buen micrófono mal colocado rinde peor que un micrófono mediocre bien colocado. El principio básico: cada vez que duplicas la distancia entre el hablante y el micrófono, la intensidad efectiva de la señal cae mientras el ruido de la sala permanece constante. La calidad a 24 pulgadas es mediblemente peor que a 6 pulgadas con el mismo hardware.

Reglas prácticas de colocación:

  • Busca una distancia de 4 a 8 pulgadas de la boca del hablante con un micrófono direccional (cardioide).
  • Mantén el micrófono desviado unos 15 grados del eje para evitar los golpes plosivos en los sonidos «p» y «b». Un filtro antipop de 5 dólares logra lo mismo si necesitas colocarlo en el eje.
  • Para salas de conferencias: un micrófono de condensador compartido en el centro de la mesa es la peor configuración posible. Un micrófono de solapa por hablante, aunque sea uno de pinza de 10 dólares, supera a un micrófono de conferencia de 200 dólares situado a 3 pies de la mitad de los participantes.

Para recomendaciones concretas de hardware según distintos presupuestos y la decisión entre USB y XLR, consulta consejos de micrófono para una transcripción clara.

Etapa 3: Configura los ajustes de captura antes de pulsar grabar

Los ajustes de captura son una decisión que se toma una sola vez y determina el techo de todos los pasos posteriores.

Formato: Graba en WAV o FLAC (sin pérdida) para tu archivo maestro siempre que puedas. Un MP3 de alta tasa de bits (192 kbps o superior) transcribe casi tan bien como un formato sin pérdida para el habla, pero un archivo de baja tasa de bits (por debajo de 96 kbps) elimina las pistas consonánticas de alta frecuencia de las que depende el modelo. La regla práctica: nunca comprimas por debajo de 128 kbps un audio que vayas a transcribir.

La jerarquía de formatos importa menos que la calidad subyacente de la grabación. Un WAV limpio con micrófono cercano y un MP3 limpio con micrófono cercano a 192 kbps producen transcripciones muy similares. Un WAV con ruido y a distancia no supera a ninguno de los dos. Consulta WAV frente a MP3 para transcribir para ver el análisis completo de ventajas e inconvenientes.

Frecuencia de muestreo y profundidad de bits: 16 bits a 16 kHz es la línea base con la que se entrenó la mayoría de los modelos de voz a texto. Grabar a 44,1 kHz o 48 kHz está bien (el modelo reduce la frecuencia de muestreo), pero grabar por debajo de 16 kHz pierde información que no puedes recuperar.

Para llamadas remotas (Zoom, Google Meet, Teams): Graba localmente en cada extremo usando Riverside o Zencastr en lugar de la grabadora integrada de la plataforma. Ambas capturan pistas WAV separadas por hablante, lo que te da una diarización más limpia y te permite procesar a cada hablante de forma independiente antes de transcribir. Usa auriculares en todos los extremos para evitar que el audio del otro participante se filtre.

Etapa 4: Planifica para varios hablantes

La diarización (separar «quién dijo qué») falla de formas predecibles que puedes prevenir antes de empezar la grabación.

El paso de prevención más importante es el aislamiento por hablante. El habla solapada (dos personas hablando a la vez) crea un único segmento de audio que el modelo debe asignar a un hablante u otro. Suele equivocarse. Pide a los participantes que mantengan la norma de «silenciar mientras escuchan», especialmente en llamadas numerosas.

Al subir el archivo, dale al modelo el número correcto de hablantes. La mayoría de las plataformas ofrecen un campo para ello. La detección automática es propensa a errores: indica el número real de personas que hablan, no el número de presentes. Una llamada de 10 personas en la que solo hablaron 3 es un archivo de 3 hablantes.

Para saber cómo funciona la diarización por dentro y qué precisión esperar con distintos números de hablantes, consulta la diarización de hablantes explicada.

Etapa 5: Prepara el modelo antes de subir el archivo

La diferencia entre un 92 % y un 97 % de precisión en contenido cargado de jerga suele reducirse a dos ajustes que casi nadie usa: las pistas de términos clave y la selección de idioma.

Pistas de términos clave. Si tu audio contiene nombres de empresas, nombres de productos, términos médicos o jurídicos, o siglas que el modelo probablemente confundirá, proporciónalos como lista de palabras clave o términos clave antes de enviarlo. El keyterm prompting de Deepgram admite hasta 100 términos (500 tokens en total). Su documentación muestra mejoras en la puntuación de confianza de 0,71 a 0,97 en palabras específicas del dominio con los términos clave activados. AssemblyAI ofrece una función similar (keyterms_prompt) que admite hasta 1.000 palabras. En ambos casos, una lista corta y enfocada (de 20 a 50 términos) da mejores resultados que volcar todas las palabras de tu glosario.

Mi opinión: he visto cómo una lista de 15 nombres de productos eliminaba casi por completo una clase recurrente de errores que habría llevado 20 minutos corregir a mano. La función tarda 2 minutos en configurarse y la mayoría de los usuarios jamás la abre.

Selección de idioma y modelo. Ajusta el modelo al idioma realmente hablado. Un modelo de inglés de propósito general pierde mucha precisión con audio en otros idiomas. Whisper Large-v3 ofrece una cobertura multilingüe más amplia, con 99 idiomas. Deepgram Nova-3 cuenta con soporte multilingüe dedicado y mejoras de WER documentadas en varios idiomas. Si tu contenido alterna entre idiomas, usa un modelo que gestione explícitamente la alternancia entre idiomas (code-switching).

Para orientarte sobre qué API de voz a texto encaja con tu caso de uso, consulta las mejores APIs de voz a texto de 2026 o precios de APIs de voz a texto en 2026 si el coste es el factor decisivo.

Lista de comprobación antes de subir

Repasa esto antes de enviar cualquier archivo que te importe:

  • La sala estuvo silenciosa durante la grabación (climatización apagada, puertas cerradas)
  • El micrófono estaba a menos de 8 pulgadas del hablante
  • El archivo es WAV, FLAC o MP3 a 128 kbps o superior
  • La llamada remota usó grabación local por hablante (o auriculares para evitar fugas de audio)
  • El número de hablantes está fijado al número real de participantes que hablan
  • La lista de términos clave incluye los nombres de productos, nombres propios o términos del dominio que el modelo podría confundir
  • El idioma está establecido explícitamente (no dejado en detección automática si conoces el idioma)

Cada punto de esta lista elimina una fuente de errores evitable. Si repasas la lista y aun así obtienes una transcripción deficiente, el problema está en el audio de origen: consulta cómo transcribir con audio de mala calidad para ver opciones de recuperación. Si prefieres una versión de consulta rápida en lugar del flujo completo, consejos para mejorar la precisión de la transcripción recoge la lista resumida.

Para una transcripción sencilla sin una configuración complicada, ConvertAudioToText procesa las subidas directamente con controles de idioma y de hablantes en el formulario de envío.

Preguntas frecuentes

¿Importa más el precio del micrófono que su colocación?

La colocación importa más en todos los rangos de precio. Un micrófono USB de 50 dólares a 6 pulgadas del hablante supera a un micrófono de condensador de 200 dólares a 24 pulgadas, porque la física de la distancia y la relación señal-ruido pesan más que la calidad del hardware en entornos típicos de grabación de voz.

¿Cuánto afecta realmente la reverberación a la precisión de la transcripción?

Las investigaciones sobre reconocimiento de voz con micrófonos a distancia muestran que la reverberación puede reducir la precisión entre un 20 % y un 30 % en salas muy reflectantes en comparación con espacios tratados, incluso cuando no hay otro ruido de fondo. Los límites de los fonemas se difuminan cuando las reflexiones arrastran los sonidos en el tiempo, y los modelos de voz a texto entrenados con audio limpio no han visto ese patrón de distorsión. Una sala con mobiliario blando (sofá, alfombra, cortinas) reduce sustancialmente la reverberación sin necesidad de paneles acústicos.

¿Debería usar siempre audio sin pérdida (WAV/FLAC) para transcribir?

Para archivar tu grabación maestra, sí. Como entrada para la transcripción, un MP3 de alta tasa de bits (192 kbps o superior) produce transcripciones casi indistinguibles de las de WAV sobre el mismo discurso. El umbral relevante está por debajo de 128 kbps, donde la codificación con pérdida elimina las pistas consonánticas que el modelo usa para detectar los límites de las palabras.

¿Qué es el refuerzo de términos clave o de vocabulario y cuándo debería usarlo?

El refuerzo de términos clave te permite pasar una lista breve de palabras o frases al modelo de transcripción antes de procesar el audio. El modelo prioriza esos términos cuando se encuentra con audio ambiguo. Úsalo en cualquier grabación con vocabulario específico del dominio: nombres de productos, términos médicos o jurídicos, nombres propios o siglas. Deepgram admite hasta 100 términos clave por solicitud. AssemblyAI admite hasta 1.000 palabras. Las mejoras son más visibles en términos con grafía o pronunciación poco habituales que, de lo contrario, serían sustituidos por una aproximación con palabras comunes.

¿Por qué indicar el número de hablantes mejora la precisión de la diarización?

La mayoría de los sistemas de diarización usan agrupamiento (clustering) para clasificar los segmentos de audio según la firma vocal de cada hablante. Detectar automáticamente el número de grupos es un paso adicional de inferencia que introduce errores, sobre todo cuando los hablantes tienen voces parecidas o hay solapamiento. Indicar el número exacto elimina esa incertidumbre del flujo. Configúralo con el número de personas que realmente hablan durante la grabación, no con el número de asistentes a la reunión.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles