
Mejora la calidad del audio antes de transcribir: qué funciona
Summarize this article with:
Procesar un audio existente antes de subirlo puede recuperar entre 10 y 20 puntos porcentuales de precisión de transcripción en grabaciones problemáticas. La cadena es: recortar, reducir ruido, normalizar, ecualizar, convertir a mono y exportar. El inconveniente: el audio limpio no necesita nada de esto, y el audio con saturación severa o reverberación intensa también se resiste. Averigua en cuál de los tres grupos cae tu archivo antes de abrir un editor.
Procesar tu audio antes de subirlo merece la pena solo cuando la grabación tiene un problema identificable: un zumbido constante, un volumen irregular, frecuencias graves apagadas o un archivo estéreo donde ambos canales llevan la misma voz. En grabaciones moderadamente ruidosas, la cadena completa de procesamiento puede recuperar entre 10 y 20 puntos porcentuales de precisión. En audio limpio, no aporta nada. Esta guía cubre la cadena en el orden en que debe aplicarse y señala las dos situaciones en las que deberías saltártela por completo.

Para saber cómo evitar estos problemas en el momento de grabar, consulta el entorno de grabación para obtener los mejores resultados. Para lidiar con material de origen muy deficiente que el procesamiento previo a la subida no puede arreglar, consulta transcribir con mala calidad de audio.
Primero, los tres grupos
Antes de abrir un editor de audio, clasifica tu archivo:
Limpio: Puedes oír cada palabra con claridad a un volumen de escucha normal. Transcríbelo directamente. Procesarlo no ayudará y puede introducir artefactos.
Recuperable: Zumbido de fondo, volúmenes desiguales entre hablantes, habla apagada o una grabación de volumen bajo con ruido audible pero no abrumador. Aquí es donde la cadena de procesamiento justifica su uso.
Irrecuperable: No consigues entender porciones importantes incluso escuchando con atención y con auriculares. Saturación fuerte (una distorsión áspera y crepitante durante toda la grabación), hablantes simultáneos en todo el archivo o un micrófono en otra habitación. Vuelve a grabar si puedes. El procesamiento no producirá una transcripción utilizable.
La mayoría de las grabaciones con ruido evidente pero tolerable caen en el grupo recuperable.
Paso 1: Recortar primero
Antes de cualquier procesamiento de audio, recorta las secciones innecesarias: el silencio previo a la reunión, el preámbulo de «¿me escucha todo el mundo?» o el silencio muerto del final. Recortar cumple dos propósitos. Primero, elimina secciones que pueden sesgar el perfil de ruido que necesitarás en el paso 2. Segundo, acorta el archivo, lo que reduce el tiempo de procesamiento de todos los pasos siguientes.
Herramientas para recortar: Notas de voz en iOS, la Grabadora de sonido integrada de Windows o Audacity en cualquier plataforma. Las tres permiten un simple cortar y exportar sin tocar la calidad de la señal.
No dividas una grabación larga en muchos fragmentos diminutos para «paralelizar» la transcripción. Dividir en fronteras naturales de tema (cada 20 o 30 minutos, en una pausa clara) es razonable. Dividir en trozos de 5 minutos introduce pérdida de contexto en cada corte y puede romper la continuidad de los hablantes.
Paso 2: Reducción de ruido
Este paso ataca el ruido de fondo constante: el aire acondicionado, el zumbido de un ventilador, el retumbo de la climatización, el zumbido de las luces fluorescentes. Se llaman ruidos estacionarios porque ocupan bandas de frecuencia predecibles y constantes. La reducción de ruido funciona tomando una muestra breve del ruido solo, construyendo una huella acústica y restándola de todo el archivo.
Audacity (gratuito, audacityteam.org) es suficiente para la mayoría de las preparaciones de transcripción. Esta es la secuencia:
- Abre tu archivo recortado en Audacity.
- Encuentra de 1 a 2 segundos de audio donde nadie hable pero sí esté presente el ruido de fondo.
- Selecciona esa sección. Ve a Efecto, luego Reducción de ruido y haz clic en «Obtener perfil de ruido».
- Selecciona todo el archivo (Ctrl+A o Cmd+A).
- Vuelve a Efecto, luego Reducción de ruido. Los valores predeterminados recomendados son: Reducción de ruido 6 dB, Sensibilidad 6, Suavizado de frecuencia 6. Son ajustes conservadores que priorizan la conservación de la voz sobre la eliminación máxima del ruido.
- Usa el interruptor «Residuo» para escuchar qué se va a eliminar. Si se oye voz en el residuo, estás siendo demasiado agresivo.
- Previsualiza, ajusta si hace falta y aplica.
Mi consejo: empieza con 6 dB e incrementa en pasos de 3 dB si el ruido sigue siendo evidente. Cualquier valor por encima de 15 dB empieza a producir artefactos robóticos en la voz, lo que normalmente perjudica la precisión de la transcripción más que el ruido original.
Los ruidos intermitentes, un ladrido de perro, un portazo, una notificación del teléfono, no responden a esta técnica. Puedes seleccionarlos manualmente y silenciar esos momentos (Editar, Silenciar audio en Audacity) si son breves y están rodeados de habla clara.
Alternativas a Audacity:
Adobe Podcast Enhance (podcast.adobe.com/enhance) funciona íntegramente en el navegador. Es gratuito con una cuenta de Adobe, admite archivos de hasta 30 minutos y 500 MB por sesión, con un límite diario de 1 hora. Aplica eliminación de ruido basada en IA con un clic y sin ajuste de parámetros. La contrapartida es menos control: obtienes el resultado que produce el modelo de Adobe, no el resultado que tú calibras.
iZotope RX es la opción profesional. RX 12 Elements parte de 99 dólares, Standard de 399 dólares y Advanced de 1.399 dólares. Para preparar transcripciones, Elements cubre todo lo que realistamente necesitarás: Dialogue Denoise, De-reverb y Repair Assistant. La versión Advanced está dirigida a flujos de trabajo de radiodifusión y posproducción que van más allá de una tarea de limpieza para transcripción.
Paso 3: Normalizar el volumen
El volumen irregular es el segundo problema más común. Un hablante está cerca del micrófono y otro al otro lado de la mesa. La grabación se desvanece a mitad de camino. Hay partes bien, pero algunas secciones son casi inaudibles.
La normalización viene en dos variantes:
La normalización de picos sube el nivel general hasta que el momento más alto alcanza un límite objetivo, normalmente -1 dB. En Audacity: Efecto, luego Normalizar y fija la amplitud de pico en -1,0 dB. Es la elección correcta cuando la grabación es constantemente baja.
La compresión del rango dinámico reduce la distancia entre los momentos más altos y más bajos. Sube al hablante bajo y contiene al alto. En Audacity: Efecto, luego Compresor. Una relación de 3:1 con un umbral alrededor de -20 dB es un punto de partida razonable para habla con varios participantes a distintos volúmenes. Ajusta de oído usando el botón Vista previa.
Si tu archivo es bajo porque el micrófono estaba lejos del hablante, la normalización de picos también amplificará el ruido de fondo. En ese caso, aplica primero la reducción de ruido (paso 2) y luego normaliza el resultado más limpio.
Para flujos de trabajo por línea de comandos, la herramienta ffmpeg-normalize (pip install ffmpeg-normalize) aplica la normalización de sonoridad EBU R128 en un solo comando. El filtro equivalente de ffmpeg es:
ffmpeg -i input.wav -af "loudnorm=I=-16:TP=-1.5:LRA=11" output.wav
EBU R128 apunta a -16 LUFS, el estándar de entrega para podcasts, y es un objetivo razonable para el procesamiento previo a la transcripción.
Paso 4: Ecualizar para la claridad del habla
La ecualización ajusta el equilibrio de las frecuencias. Para preparar una transcripción, el objetivo es estrecho: cortar lo que no es habla y conservar lo que sí lo es.
La inteligibilidad del habla humana se sitúa aproximadamente entre 300 Hz y 3.400 Hz. Esa es la banda de frecuencia que han usado las llamadas telefónicas durante décadas; basta para entender el habla, incluso sin todo el rango.
Una configuración de EQ de tres movimientos funciona para la mayoría de las grabaciones:
- Filtro paso alto entre 80 y 100 Hz. Corta el retumbo de bajas frecuencias del tráfico, la climatización y el manejo del micrófono, que no aporta contenido de habla alguno.
- Filtro paso bajo en 8.000 Hz. Reduce el siseo de altas frecuencias. La mayor parte de la energía del habla está muy por debajo; cortar por encima elimina ruido con un efecto mínimo en la claridad.
- Realce suave de 1 a 3 dB en el rango de 1.000 a 3.000 Hz. Es la región rica en consonantes donde vive la inteligibilidad.
En Audacity, aplícalos mediante Efecto, luego Filter Curve EQ (para control preciso) o Efecto, luego Filtro paso alto y Filtro paso bajo para los pasos de corte individualmente.
La ecualización es el paso más opcional de todos. Si la reducción de ruido y la normalización produjeron una grabación que puedes seguir con facilidad, sáltate el EQ. Ayuda más en grabaciones apagadas (altas frecuencias débiles) o en grabaciones con mucho retumbo de graves.
Paso 5: Convertir a mono
El audio estéreo lleva dos canales. Para un único hablante, una grabación de llamada telefónica, un podcast en solitario, una entrevista, ambos canales suelen contener la misma señal de voz. Mantenerlo en estéreo duplica el tamaño del archivo sin ningún beneficio de precisión para la transcripción.
Convertir a mono reduce a la mitad el tamaño del archivo y, en algunos casos, mejora la transcripción porque el modelo procesa una señal coherente en lugar de dos canales que pueden tener ligeras diferencias de fase o niveles de señal distintos.
En Audacity: Pistas, luego Mezclar, luego Mezclar estéreo a mono. O, desde la línea de comandos:
ffmpeg -i input.wav -ac 1 output_mono.wav
Sáltate este paso si tu grabación tiene contenido genuinamente distinto en cada canal (algunas configuraciones de entrevista de doble canal, grabaciones de radiodifusión donde el presentador y el invitado están en pistas separadas). En esos casos, mezcla los canales correctamente en lugar de limitarte a pasar a mono.
Paso 6: Exportar en el formato correcto
La cadena de procesamiento termina con una exportación. El formato importa menos que la calidad de lo que has procesado, pero se aplican algunas reglas:
WAV o FLAC conservan todo lo que ha producido el procesamiento. WAV no está comprimido. FLAC tiene compresión sin pérdida, normalmente entre un 40 y un 60 por ciento más pequeño que WAV con idéntica calidad. Cualquiera de los dos es la elección correcta si quieres archivar el archivo procesado o encadenarlo con otra herramienta.
MP3 a 128 kbps o más es práctico para subir archivos cuando el tamaño importa. Una grabación limpia y procesada en MP3 a 128 kbps se transcribe casi tan bien como la misma grabación en WAV. Bajar de 128 kbps introduce artefactos de compresión audibles que pueden confundir a los modelos de ASR.
Evita recodificar entre formatos con pérdida. Si tu fuente ya es un MP3, exporta como MP3 o conviértelo a WAV/FLAC; no conviertas de MP3 a AAC a M4A. Cada recodificación con pérdida añade pérdida de calidad.
Para servicios de transcripción como ConvertAudioToText, se aceptan WAV, FLAC, MP3, M4A y la mayoría de los demás formatos habituales. La elección del formato rara vez cambia la transcripción; la calidad de la grabación sí.
La cadena completa, ordenada
| Paso | Herramienta | Cuándo aplicarlo |
|---|---|---|
| 1. Recortar | Cualquier reproductor de audio, Audacity | Siempre |
| 2. Reducción de ruido | Audacity, Adobe Podcast Enhance, iZotope RX | Cuando haya ruido estacionario |
| 3. Normalizar | Audacity, ffmpeg-normalize | Cuando el volumen sea irregular o constantemente bajo |
| 4. Ecualizar | Filter Curve EQ de Audacity | Cuando se oiga retumbo o un sonido apagado |
| 5. Convertir a mono | Audacity, ffmpeg | Cuando el archivo sea estéreo y el contenido sea el mismo en ambos canales |
| 6. Exportar | Audacity, ffmpeg | Siempre, como WAV/FLAC/MP3 a 128 kbps o más |
El orden no es opcional. La reducción de ruido antes de la normalización evita amplificar el ruido. La normalización antes del EQ le da al EQ un nivel estable con el que trabajar. Reordenar la cadena degrada el resultado.
Cuando el procesamiento no merece el tiempo
Tres situaciones en las que el esfuerzo no compensa:
El audio ya está limpio. Si suena claro para tus oídos, transcríbelo directamente. Procesar audio limpio corre el riesgo de introducir justo los artefactos que intentas evitar.
El daño es del tipo equivocado. La saturación severa (ese sonido distorsionado y crepitante de haber grabado con niveles demasiado altos) no puede repararse de forma significativa con reducción de ruido ni con EQ. El módulo Declip de iZotope RX recupera saturaciones leves; la distorsión real a nivel de palabra en todo el archivo no es recuperable en casa.
Hay mucho eco o reverberación. Las reflexiones de la sala impregnadas en una grabación son extremadamente difíciles de eliminar. Las herramientas De-reverb (iZotope RX, la Adaptive Noise Reduction de Adobe Audition) ayudan parcialmente, pero la reverberación intensa suele reducir la precisión entre 10 y 20 puntos porcentuales independientemente del procesamiento. Si la grabación suena como hecha en un baño con el hablante a unos tres metros, volver a grabar es más rápido que procesar.
Para grabaciones que caen en esos modos de fallo, consulta transcribir con mala calidad de audio para saber qué hacer después, o cómo mejorar la precisión de la transcripción para enfoques que no dependen del audio, como elegir un modelo más adecuado.
Si quieres transcripciones limpias sin la sobrecarga del procesamiento, ConvertAudioToText funciona bien como punto de partida: sube, transcribe y observa la precisión de referencia antes de comprometerte con una pasada de edición.
Para un análisis más profundo de cómo interactúa específicamente el ruido de fondo con los modelos de transcripción con IA, consulta cómo lidiar con el ruido de fondo en la transcripción.
Preguntas frecuentes
¿Cuánto puede mejorar la precisión de transcripción el procesamiento de audio?
En grabaciones moderadamente ruidosas, zumbido estacionario, volumen bajo, habla apagada, la cadena completa (reducción de ruido, normalización, ecualización) suele recuperar de 10 a 20 puntos porcentuales. Los modelos actuales de transcripción con IA alcanzan una precisión del 95 al 97 por ciento en audio limpio de estudio y pueden caer por debajo del 60 por ciento en grabaciones reales con ruido. El procesamiento mueve el audio recuperable hacia el extremo limpio de ese rango. En audio ya limpio, la mejora es esencialmente nula.
¿Audacity cuesta algo?
No. Audacity es gratuito y de código abierto (audacityteam.org). Cubre cada paso de esta cadena: reducción de ruido, normalización, compresión, ecualización, conversión a mono y exportación. Adobe Podcast Enhance también es gratuito para archivos de hasta 30 minutos con una cuenta gratuita de Adobe. iZotope RX parte de 99 dólares para la versión Elements y solo es la elección correcta cuando se trata de grabaciones gravemente degradadas.
¿Debo siempre convertir estéreo a mono antes de transcribir?
No siempre. Convierte a mono cuando ambos canales llevan el mismo contenido, un único hablante grabado en estéreo, una exportación de llamada telefónica o una grabación de reunión donde el campo estéreo no aporta nada. Mantén el estéreo (o mezcla adecuadamente los canales) cuando tu fuente tiene hablantes o instrumentos diferentes a cada lado, como en algunas configuraciones de entrevista de doble pista.
¿Cuál es el orden correcto para la reducción de ruido, la normalización y la ecualización?
Primero la reducción de ruido, luego la normalización y después la ecualización. Normalizar antes de reducir el ruido amplifica el ruido de fondo, lo que dificulta eliminarlo limpiamente. Ejecutar el EQ antes de la normalización significa que el EQ trabaja contra un nivel inestable. El orden de esta guía refleja cómo cada paso prepara el siguiente.
¿Afecta el formato de audio (WAV frente a MP3) a la precisión de la transcripción?
En general no, por encima de 128 kbps. Un MP3 limpio y procesado a 128 kbps se transcribe prácticamente tan bien como el mismo audio en WAV o FLAC. Donde importa el formato: no recodifiques entre formatos con pérdida (de MP3 a AAC, por ejemplo) y evita los archivos MP3 por debajo de 128 kbps, donde los artefactos de compresión empiezan a afectar la claridad del habla. Si vas a archivar el archivo procesado, WAV o FLAC evita cualquier pérdida adicional de calidad.
Fuentes
- Manual de reducción de ruido de Audacity: https://manual.audacityteam.org/man/noise_reduction.html
- Adobe Podcast Enhance: https://podcast.adobe.com/en/enhance
- Precios de iZotope RX 12: https://www.izotope.com/en/products/rx/pricing-options
- AssemblyAI sobre formato de audio para voz a texto: https://www.assemblyai.com/blog/best-audio-file-formats-for-speech-to-text
- AssemblyAI sobre precisión de transcripción: https://www.assemblyai.com/blog/how-accurate-speech-to-text
- ffmpeg-normalize: https://github.com/slhck/ffmpeg-normalize
- Tendencias de precisión de transcripción con IA de Sonix AI: https://sonix.ai/resources/ai-transcription-accuracy-trends/
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.