Cómo convertir WAV a texto: guía de formatos y consejos de precisión
transcripciónwavaudio

Cómo convertir WAV a texto: guía de formatos y consejos de precisión

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Los archivos WAV almacenan audio PCM sin comprimir y sin compresión con pérdida, lo que los convierte en la entrada más limpia posible para los motores de voz a texto. A 44,1 kHz / 16 bits estéreo, un minuto de WAV pesa unos 10 MB, así que una grabación de 60 minutos ronda los 600 MB. Para la mayoría de las subidas, convertir primero a WAV mono de 16 kHz (unos 110 MB/hora) o a un MP3 de alta tasa de bits no cuesta nada en precisión y reduce drásticamente el tiempo de subida. Para grabaciones legales, de archivo o de calidad dudosa, subir el WAV directamente es la decisión correcta.

El WAV es la entrada óptima en precisión para voz a texto porque es audio PCM sin procesar y sin comprimir. No hay nada que descomprimir, sin artefactos de códecs con pérdida ni reconstrucciones a ciegas antes de que el audio llegue al modelo. Si tienes un WAV de una grabadora de estudio, una unidad de campo de radiodifusión o un sistema de captura de clases, partes del mejor material fuente posible.

Las subidas de WAV funcionan directamente; el tamaño es la única consideración
Las subidas de WAV funcionan directamente; el tamaño es la única consideración

Esta publicación cubre la mecánica del formato que importa para la transcripción, no solo los pasos de subida.

¿Cuánto pesa una grabación WAV de 60 minutos?

El WAV almacena el audio como PCM lineal: cada muestra se escribe tal cual, sin compresión. El cálculo es sencillo y las cifras son grandes.

A 44,1 kHz / 16 bits estéreo (calidad CD, habitual en grabadoras domésticas y mezcladoras de podcast):

DuraciónTamaño WAVMP3 a 192 kbpsWAV mono de 16 kHz
1 minuto~10 MB~1,4 MB~1,9 MB
30 minutos~300 MB~43 MB~57 MB
60 minutos~600 MB~86 MB~110 MB
3 horas~1,8 GB~259 MB~330 MB

A 48 kHz / 24 bits estéreo (el estándar de las grabadoras de campo de radiodifusión como la serie Zoom F y la RodeCaster Pro II), las cifras vuelven a ser aproximadamente un 65% mayores: una grabación de 60 minutos alcanza unos 990 MB.

Estos tamaños determinan si puedes subir directamente o si necesitas convertir primero. También explican por qué un WAV de conferencia de 3 horas puede dejar atascada una subida desde el navegador durante 20 minutos con una conexión doméstica típica.

¿Cuál es la diferencia entre WAV, BWF y polyWAV?

WAV es un formato contenedor (especificación RIFF/WAVE), no un códec. La mayoría de los archivos WAV contienen audio PCM lineal sin comprimir, pero el contenedor también puede alojar otras codificaciones. Tres variantes que realmente te encontrarás al transcribir:

PCM WAV es el predeterminado. Muestras de audio almacenadas como enteros de punto fijo: 16 bits (doméstico), 24 bits (profesional) o entero de 32 bits (poco común). Todos los servicios modernos de transcripción los gestionan de forma nativa. La gran mayoría de los WAV que te encontrarás son PCM de 16 o 24 bits.

BWF (Broadcast Wave Format) es WAV más un bloque de metadatos BEXT que lleva timecode, datos de escena/toma e identificadores únicos de archivo. Es el formato predeterminado de la mayoría de las grabadoras de campo de radiodifusión (Sound Devices, serie Zoom F, Tascam Portacapture en modo ENG). Para transcripción, BWF es funcionalmente idéntico al WAV normal: el bloque BEXT lo ignoran los motores de voz.

PolyWAV es un BWF multicanal: un archivo, varias pistas, cada pista en su propio canal. Una RodeCaster Pro graba un polyWAV de 14 canales (cada micrófono más la mezcla estéreo). Una Zoom F8n Pro puede grabar hasta 10 canales en un solo polyWAV.

Esta es la mayor trampa específica del formato para la transcripción: la mayoría de los servicios de transcripción que aceptan WAV tratan un polyWAV como una única secuencia de audio mezclada. Ejecutan la diarización sobre la mezcla, no por pista. Para obtener una transcripción limpia por pista, necesitas hacer una de estas dos cosas:

  1. Dividir primero el polyWAV en WAV mono individuales (ffmpeg -i poly.wav -map 0:a:0 track1.wav -map 0:a:1 track2.wav ...) y luego enviar uno por hablante.
  2. Usar un servicio con soporte multicanal explícito (el parámetro multichannel=true de Deepgram procesa cada canal como una transcripción independiente). Ten en cuenta que multicanal y diarización de hablantes son mutuamente excluyentes: eliges un enfoque por solicitud.

Para saber más sobre cuándo usar separación de hablantes basada en canales frente a la basada en diarización, consulta diarización de hablantes explicada.

¿Puedo subir un WAV de 32 bits flotante a herramientas de transcripción?

Común en herramientas profesionales de producción (Pro Tools, Logic Pro, el formato interno de Audacity) y en grabadoras de campo con modo «32-bit float» como la Zoom F8n Pro o la Sound Devices MixPre-10 II. La ventaja es el margen dinámico: el formato de 32 bits flotante captura audio que recortaría en el hardware sin limitación dura. La trampa para la transcripción: Google Cloud Speech-to-Text v1 rechaza el WAV de 32 bits flotante, lo que exige conversión antes de enviarlo. Si un servicio de transcripción devuelve un error de codificación con un WAV, esta es la causa más probable.

Convierte antes de subir:

ffmpeg -i input-float.wav -acodec pcm_s16le output-pcm.wav

La mayoría de los servicios modernos de transcripción aceptan el WAV de 32 bits flotante sin problema; la conversión solo hace falta cuando una herramienta rechaza el archivo.

WAV de grabadoras comunes: qué frecuencia de muestreo y profundidad de bits esperar

Los distintos dispositivos de grabación producen especificaciones WAV diferentes, y estas afectan al tamaño de subida:

Mezcladoras de podcast (RodeCaster Pro II, Rodecaster Duo): 48 kHz / 24 bits, polyWAV para multipista. La mezcla estéreo es un WAV estándar de 2 canales.

Grabadoras de campo profesionales (serie Zoom F, Sound Devices MixPre): hasta 192 kHz / 32 bits flotante. Para transcripción, todo lo que supere 16 kHz / 16 bits es subir más datos de los que el modelo usará.

Cámaras réflex y sin espejo (serie Canon R, serie Sony A7): WAV PCM o BWF a 48 kHz / 16 bits, grabado en la tarjeta interna o en una grabadora conectada. Fuente habitual de entrevistas grabadas en cámara.

Sistemas de captura de clases (Echo360, Panopto): suelen generar WAV a 44,1 kHz / 16 bits junto con el vídeo, o incrustar el audio en el contenedor de vídeo. La pista WAV, si está disponible por separado, es más limpia de procesar que extraerla de un vídeo H.264.

Para fines de transcripción, el objetivo interno de procesamiento del modelo es PCM mono de 16 kHz y 16 bits. Todo lo que supere eso se descarta internamente. Estás pagando ancho de banda de subida por datos que el motor no usa.

¿Debería convertir WAV a MP3 antes de subirlo si el archivo es demasiado grande?

Si tu WAV supera el límite de subida de un servicio, conviértelo a MP3 de 192 kbps y archiva el WAV original. Hay cuatro caminos en total:

Camino 1: Subir el WAV directamente. Para archivos por debajo del límite de subida de tu servicio, la subida directa es el camino más simple. Aléjate y vuelve luego. El tiempo de subida manda.

Camino 2: Reducir a WAV mono de 16 kHz (sin pérdidas desde la perspectiva del modelo). El motor de transcripción hará esta conversión internamente de todos modos. Hazla primero en el cliente para reducir el tamaño de subida en torno a un 80%:

ffmpeg -i recording.wav -ac 1 -ar 16000 recording-16k-mono.wav

Un WAV estéreo de 44,1 kHz de 60 minutos baja de 600 MB a unos 110 MB. El modelo ve un contenido idéntico.

Camino 3: Convertir a FLAC (sin pérdidas, más pequeño). FLAC comprime sin pérdidas los mismos datos PCM, normalmente hasta el 40-60% del tamaño del WAV. Un WAV de 60 minutos de 300 MB pasa a rondar los 150-180 MB como FLAC.

ffmpeg -i recording.wav -acodec flac recording.flac

FLAC merece la pena cuando quieres conservar la fidelidad exacta del audio original pero necesitas subidas más rápidas de las que permite el WAV. Para saber más sobre cómo convertir formatos de audio para transcripción, consulta cómo convertir FLAC a texto.

Camino 4: Convertir a MP3 y archivar el WAV. El flujo de trabajo más práctico para situaciones de gran volumen. Sube un MP3 de 192 kbps (unos 1,4 MB/min) y conserva el WAV como máster de archivo.

ffmpeg -i recording.wav -acodec mp3 -ab 192k recording.mp3

A 192 kbps, la diferencia de precisión respecto al WAV original es insignificante para el habla en grabaciones limpias. Por debajo de 128 kbps, la compresión con pérdida empieza a erosionar las consonantes de alta frecuencia. Por debajo de 64 kbps, la precisión cae lo suficiente como para producir errores sistemáticos en nombres poco comunes y vocabulario técnico. Para una comparación completa de los compromisos entre formatos para reconocimiento de voz, consulta WAV frente a MP3 para transcripción.

¿Cuándo tiene sentido de verdad convertir primero a MP3? Cuando tu WAV supera un límite de subida. Un WAV largo a 48 kHz / 24 bits puede chocar con los límites de tamaño de archivo del servicio. Convertir a MP3 de 192 kbps lleva una grabación de 5 horas de unos 5 GB a unos 700 MB, muy dentro del límite de cualquier servicio. Archiva siempre el WAV original antes de convertir.

Cómo transcribir un archivo WAV

El paso de subida es deliberadamente breve porque la experiencia sobre el formato es el punto central de esta publicación.

  1. Elige tu camino de arriba (WAV directo, WAV reducido, FLAC o MP3).
  2. Sube el archivo a tu servicio de transcripción preferido.
  3. Configura idioma, número de hablantes y cualquier pista de vocabulario.
  4. Ejecuta. Los archivos WAV se procesan a la misma velocidad que MP3 de duración equivalente: el motor trabaja según la duración del audio, no el tamaño del archivo.
  5. Exporta como TXT, SRT, VTT o DOCX.

Si solo necesitas una transcripción limpia sin un bot de reuniones ni herramientas de edición pesadas, ConvertAudioToText gestiona WAV de forma nativa, admite toda la ruta de reducción a 16 kHz en el servidor y acepta subidas de varios gigabytes en los planes de pago.

Ediciones previas a la transcripción que ayudan

Para archivos WAV con problemas de audio, una pasada breve de edición antes de subir compensa:

  • Reducción de ruido: iZotope RX, Adobe Enhance Speech o el filtro de reducción de ruido de Audacity. Más valiosa en grabaciones de sala con zumbido de climatización o grabaciones exteriores con viento.
  • Recorte de silencios: Elimina el aire muerto al principio y al final. Ayuda a la diarización, que puede fallar con silencios largos.
  • Normalización de sonoridad: Lleva a los hablantes quedos a un nivel consistente. Problema habitual en grabaciones de podcast con varias personas donde un micrófono estaba demasiado lejos del hablante.
  • Rango dinámico: El rango dinámico del WAV (96 dB para 16 bits, 144 dB para 24 bits) significa que los pasajes muy quedos que se comprimen mal en MP3 siguen capturándose con claridad. Esta es la principal ventaja práctica de archivar en WAV.

Para grabaciones capturadas limpiamente, sáltate por completo la pasada de edición y envía directamente. El tiempo de edición se acumula rápido, y los modelos de voz modernos manejan el ruido moderado mejor que hace tres años. Reserva la edición para grabaciones donde escuchas el problema con claridad al reproducirlas.

¿Transcribe WAV con más precisión que MP3?

La principal ventaja de precisión del WAV es lo que le falta: artefactos de codificación con pérdida. Un WAV de 44,1 kHz y 16 bits transporta todo el rango de frecuencias hasta unos 22 kHz, muy por encima del corte de 8 kHz del audio telefónico y por encima del rango de 4 kHz donde vive la mayoría del contenido del habla.

En la práctica, la diferencia de precisión entre WAV y un MP3 de 192 kbps de la misma grabación es insignificante para la mayoría del contenido hablado. La brecha crece en dos escenarios:

  • Calidad de audio límite: salas ruidosas, micrófonos lejanos, acentos fuertes. La codificación con pérdida hace que el audio marginal sea más difícil de recuperar.
  • Idiomas tonales o vocabulario técnico: los fonemas que dependen de una estructura espectral fina se conservan mejor en audio sin comprimir.

Para un análisis más profundo de cómo afecta el formato de audio a la precisión de la transcripción, consulta precisión de la transcripción explicada.

Preguntas frecuentes

¿Transcribe WAV con más precisión que MP3?

Para una misma grabación, la diferencia entre WAV y un MP3 de alta tasa de bits (192 kbps o más) es insignificante en audio limpio. La brecha crece con MP3 de menor calidad: a 64 kbps pierdes suficiente contenido de alta frecuencia como para que la precisión baje de forma notable. Conserva WAV para grabaciones límite o necesidades legales de cadena de custodia; usa MP3 a 192 kbps para el trabajo diario.

¿Cuánto pesa una grabación WAV de 60 minutos?

A 44,1 kHz / 16 bits estéreo (calidad CD), un WAV de 60 minutos pesa unos 600 MB. A 48 kHz / 24 bits estéreo (habitual en grabadoras de campo), se acerca al 1 GB. Convertir a mono de 16 kHz antes de subir reduce esa misma hora de audio a unos 110 MB, que es lo que la mayoría de los motores de transcripción procesan internamente de todos modos.

¿Puedo subir un WAV de 32 bits flotante a herramientas de transcripción?

La mayoría de los servicios modernos de transcripción aceptan WAV de 32 bits flotante, pero algunas integraciones antiguas y Google Cloud Speech-to-Text v1 lo rechazan. Si una herramienta rechaza tu archivo, conviértelo primero a PCM de 16 bits con ffmpeg: ffmpeg -i input.wav -acodec pcm_s16le output.wav. El contenido de audio es idéntico tras la conversión.

¿Cuál es la diferencia entre WAV, BWF y polyWAV?

WAV es el contenedor estándar de Microsoft/IBM para audio PCM. BWF (Broadcast Wave Format) es WAV con un bloque adicional de metadatos BEXT que lleva timecode, información de escena/toma e identificadores únicos de archivo, la salida predeterminada de la mayoría de las grabadoras de campo de radiodifusión. PolyWAV es un BWF multicanal que almacena hasta 99 pistas en un solo archivo, una por micrófono. Para transcripción, los tres se comportan igual; los motores de voz ignoran los metadatos.

¿Debería convertir WAV a MP3 antes de subirlo si el archivo es demasiado grande?

Sí. Si tu WAV supera el límite de subida de un servicio, conviértelo a MP3 de 192 kbps con ffmpeg (ffmpeg -i recording.wav -acodec mp3 -ab 192k recording.mp3) y conserva el WAV como archivo maestro. A 192 kbps la diferencia de precisión es demasiado pequeña para importar en la mayoría de las grabaciones. Como alternativa, convierte primero a WAV mono de 16 kHz, lo que te da audio sin pérdidas a aproximadamente una quinta parte del tamaño original.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles