
Transcribir audio por lotes durante la noche: ponlo en cola y duerme (2026)
Summarize this article with:
Prepáralo todo antes de acostarte
Si tienes 40 grabaciones de entrevistas o 60 llamadas de clientes que transcribir, lo correcto es ponerlo todo en cola antes de dormir y abrir el portátil por la mañana con las transcripciones ya terminadas. Un solo archivo tarda 1-3 minutos con la IA moderna, así que hacerlo de noche no va de esperar al procesamiento, sino de no tener que vigilar docenas de subidas.
Esta guía cubre el flujo de trabajo masivo: organizar, convertir, enviar y olvidarte. Dos caminos: sin código para quienes quieren resolverlo una sola vez, y un bucle con API para los equipos que lo hacen cada mes.
Cuándo el lote nocturno realmente tiene sentido
Sé honesto contigo mismo en esto. Una grabación de una hora se transcribe en unos 2 minutos. No necesitas dejarlo para la noche.
El lote nocturno es la decisión correcta cuando:
- Tienes 20 o más archivos y no quieres ir haciendo clic en ellos uno por uno.
- Tu ancho de banda de subida es la limitación real (40 archivos WAV sin comprimir pueden suponer varios gigabytes; hacerlo de noche elimina la presión de estar sentado esperando mientras sube).
- Mantienes un flujo de trabajo recurrente, un archivo de investigación, episodios de podcast pendientes o una revisión trimestral de llamadas, donde el lote es la unidad de trabajo.
- El límite de concurrencia de tu cuenta hace que los trabajos se pongan en cola unos detrás de otros de todos modos.
Para 3 archivos o menos, súbelos ahora mismo. El planteamiento de «lote» aplica cuando la sobrecarga del envío manual es el auténtico coste de tiempo.
Paso 1: Reúne todo en una sola carpeta
Coloca todos los archivos de origen en un único directorio. Estandariza los nombres de archivo para poder relacionar después cada transcripción con su fuente:
interview_2026-06-15_smith.mp3
interview_2026-06-15_lee.mp3
interview_2026-06-16_kim.mp3
Evita los espacios en los nombres de archivo. Sobreviven a la mayoría de los flujos de trabajo, pero de vez en cuando dan problemas a los scripts de shell y a las herramientas por lotes.
Paso 2: Reduce primero el tamaño de subida
El cuello de botella real del lote nocturno suele ser el ancho de banda de subida, no el procesamiento. Un WAV de 1 hora a 48 kHz estéreo pesa unos 600 MB. La misma hora como MP3 mono a 128 kbps ronda los 60 MB. En 40 archivos, eso son 24 GB frente a 2,4 GB. Con una conexión de 50 Mbps, hablamos de más de una hora de subida frente a menos de 10 minutos.
Convierte con ffmpeg antes de poner en cola:
for f in *.wav; do
ffmpeg -i "$f" -ac 1 -ar 16000 -b:a 64k "${f%.wav}.mp3"
done
Las opciones: -ac 1 para mono, -ar 16000 para una frecuencia de muestreo de 16 kHz (de sobra para voz) y -b:a 64k para obtener un archivo pequeño. La precisión de la transcripción no se degrada de forma significativa con esta configuración en grabaciones de voz.
Las notas de voz del iPhone (M4A) y las grabaciones MP4 de Zoom funcionan bien tal cual si prefieres saltarte la conversión. Solo comprueba que no estás subiendo vídeo 4K estéreo cuando un MP3 mono a 64 kbps haría el mismo trabajo.
Paso 3: Sube el lote
La herramienta de audio a texto acepta subidas de varios archivos. Arrastra la carpeta completa a la zona de subida y cada archivo se pondrá en cola como un trabajo independiente.

Para 40-60 archivos, calcula entre 5 y 20 minutos hasta que la subida se complete, según tu conexión y el tamaño de los archivos. Después, cada archivo se procesa de forma independiente.
Cierra la pestaña cuando terminen las subidas. El procesamiento continúa en el servidor. Los resultados se guardan en tu cuenta tanto si el navegador sigue abierto como si no. La mayoría de los lotes de 40-60 grabaciones de entrevistas estándar terminan dentro de las 2-4 horas siguientes a la finalización de la subida. Vuelve por la mañana.
La vía de la API para lotes recurrentes
Si haces esto cada mes o cada trimestre, escribir un script para el bucle de envío ahorra tiempo de verdad y elimina por completo los clics manuales. El acceso a la API está disponible en el plan Business.
Un bucle de envío mínimo
API_KEY="your_api_key"
for f in ./audio/*.mp3; do
curl -s -X POST https://convertaudiototext.com/api/v1/transcribe \
-H "Authorization: Bearer $API_KEY" \
-F "source=upload" \
-F "language=en" \
-F "file=@$f" \
> "./jobs/$(basename "$f" .mp3).json"
echo "submitted: $f"
sleep 2
done
El sleep 2 entre peticiones te mantiene dentro de los límites de tasa. La API responde de inmediato con un ID de trabajo; el procesamiento se ejecuta de forma asíncrona.
Consultar los resultados por la mañana
for job_file in ./jobs/*.json; do
job_id=$(jq -r .job_id "$job_file")
curl -s https://convertaudiototext.com/api/v1/result/$job_id \
-H "Authorization: Bearer $API_KEY" \
> "./results/${job_id}.json"
done
Los trabajos que siguen procesándose devuelven un campo de estado. Los que han terminado devuelven la transcripción. Ejecuta esto una vez por la mañana y lo tendrás todo.
Entrega por webhook en lugar de sondeo
Para lotes más grandes, los webhooks son más limpios: registras un endpoint una sola vez y la API envía los resultados a tu URL a medida que cada trabajo termina. Es el patrón adecuado para las canalizaciones automatizadas que escriben las transcripciones directamente en una base de datos o en un espacio de trabajo de Notion.
Errores que arruinan las ejecuciones nocturnas
No limitar la tasa de tus envíos. La mayoría de las APIs tienen límites por minuto. Envía en tandas de 10-20 con una pequeña pausa entre cada una. El tiempo total de procesamiento es idéntico, pero recuperarse de un fallo por límite de tasa en el archivo 47 de 60 es menos doloroso.
Confiar en la detección automática con un corpus de idioma conocido. La detección automática de idioma añade unos segundos por archivo y de vez en cuando identifica mal clips cortos o ruidosos. Para 60 archivos cuyo idioma ya conoces, especifícalo explícitamente en cada petición. Ahorras tiempo y evitas las escasas detecciones erróneas.
No comprobar si hay fallos. Algún archivo falla de vez en cuando: audio corrupto, un códec no compatible, un corte de red durante la subida. Revisa siempre tu directorio de resultados por la mañana en busca de IDs de trabajo faltantes y vuelve a enviar esos archivos.
Ignorar los nombres de archivo en la salida. Cuando tienes 60 transcripciones, pasar de «Transcript_1.txt» a «Transcript_60.txt» no sirve de nada. Conserva el nombre original del archivo en tu estructura de salida desde el principio.
Patrones que sí funcionan
Archivo de investigación. Un investigador vuelve de una semana de trabajo de campo con 25 entrevistas. Lo mete todo en lote la misma noche de su regreso, define el idioma explícitamente y abre por la mañana una carpeta de transcripciones indexadas. Este es el flujo de trabajo para transcribir grabaciones de entrevistas a gran escala.
Episodios de podcast pendientes. Un productor con 50 grabaciones de episodios sin publicar procesa todo el acumulado en una sola ejecución nocturna y luego publica las transcripciones, una por semana, junto con las republicaciones de los episodios. Consulta también la mejor transcripción para podcasts para ver las consideraciones de calidad por episodio.
Revisión trimestral de llamadas de clientes. Un equipo de revenue ops pone en lote cada mes, durante la noche, un trimestre de llamadas de ventas, analiza el resultado y genera un archivo de Voz del Cliente (Voice of Customer) con búsqueda integrada. La comparación del coste de la transcripción por hora muestra por qué los planes ilimitados de tarifa plana hacen viable «transcribirlo todo» para el análisis continuo de llamadas.
Qué hacer con los resultados
Los lotes nocturnos producen mucho texto. Tres patrones de salida prácticos:
Un archivo por fuente, más un índice maestro. Cada transcripción como archivo Markdown o TXT, con un índice CSV que relaciona el nombre del archivo con la ruta de la transcripción, el número de hablantes y la duración.
CSV combinado para análisis. Si vas a hacer análisis de sentimiento o de temas sobre todo el corpus, concatena las transcripciones en un único CSV con una columna de archivo de origen. Es la entrada directa para la mayoría de las herramientas de análisis cualitativo.
Escritura en base de datos vía webhook. Para las canalizaciones continuas, las transcripciones se envían directamente desde el manejador del webhook a Postgres o Notion, listas para buscar y etiquetar.
El cálculo real del coste
Mi opinión: el patrón nocturno cambia la economía de lo que decides transcribir. Si pagaras 1,50 $ por minuto por transcripción humana, transcribirías de forma selectiva. Los planes ilimitados de tarifa plana convierten «transcribirlo todo y buscarlo después» en una estrategia legítima para los equipos que hacen trabajo recurrente con llamadas o entrevistas.
Para los flujos de trabajo con volumen de API a gran escala, las principales APIs de nube fijan el precio de la transcripción por lotes con descuentos significativos frente a sus equivalentes de streaming. AssemblyAI (según su página de precios, consultada en julio de 2026) cuesta 0,15 $/hora por Universal-2 y 0,21 $/hora por Universal-3.5 Pro. Los niveles de AWS Transcribe empiezan en torno a 0,024 $/minuto con descuentos por volumen. Esto resulta relevante para los equipos que construyen herramientas internas sobre las APIs en bruto. Para la mayoría de los equipos de contenido e investigadores, un plan ilimitado de tarifa plana es más fácil de razonar.
Si solo necesitas una transcripción limpia sin tener que configurar claves de API ni scripts, ConvertAudioToText gestiona directamente las colas de varios archivos. El plan Pro cuesta 9,99 $/mes sin límite por archivo. El plan Business añade acceso a la API y a los webhooks para los equipos que construyen canalizaciones automatizadas.
Preguntas frecuentes
¿Sigue siendo necesaria la transcripción por lotes durante la noche si la IA es tan rápida ahora?
Para unos pocos archivos, no. La IA moderna procesa una grabación de 1 hora en aproximadamente 1-3 minutos. El lote nocturno tiene sentido cuando tienes 20 o más archivos y la sobrecarga del envío manual, el tiempo de subida y no querer vigilar la barra de progreso es el coste real. Es un patrón de flujo de trabajo masivo, no un truco para ganar velocidad.
¿Cuál es el límite práctico de archivos que puedo enviar en lote?
Depende del límite de concurrencia de la plataforma. AssemblyAI, por ejemplo, tiene por defecto 200 trabajos simultáneos (según su documentación, consultada en julio de 2026). La mayoría de las herramientas para el usuario final ponen los trabajos en cola y los procesan en orden. Para lotes muy grandes (200 o más archivos), usa la API con un ritmo consciente de los límites de tasa en lugar de un único arrastrar y soltar.
¿Debería convertir WAV a MP3 antes de subirlo?
En los lotes donde importa el ancho de banda de subida, sí. Un WAV de 1 hora puede pesar 600 MB; el mismo archivo como MP3 mono a 64 kbps ronda los 35-60 MB. La conversión lleva unos minutos con un bucle de ffmpeg de una sola línea y ahorra mucho tiempo de subida en lotes grandes. La precisión de la transcripción en grabaciones de voz no cambia significativamente a 64 kbps mono.
¿Cómo manejo los archivos que fallan a mitad de un lote?
Revisa siempre tus resultados en busca de archivos de salida faltantes cuando el lote haya terminado. Escribe tu bucle de envío para que registre el ID del trabajo junto al nombre del archivo de origen y, después, comprueba qué IDs de trabajo no tienen su archivo de resultado correspondiente. Vuelve a enviar solo esos archivos. La mayoría de los lotes de audio limpio se completan sin fallos; la comprobación toma 30 segundos y te evita un hueco silencioso en tu archivo.
Fuentes
- Página de precios de AssemblyAI: https://www.assemblyai.com/pricing (consultado en julio de 2026)
- Documentación de concurrencia de transcripción por lotes de AssemblyAI: https://support.assemblyai.com/articles/4854424693-how-does-the-concurrency-limit-work-for-transcription-requests (consultado en julio de 2026)
- Precios de AWS Transcribe: https://aws.amazon.com/transcribe/pricing/ (consultado en julio de 2026)
- Precios de Deepgram: https://deepgram.com/pricing (consultado en julio de 2026)
- Precios de ConvertAudioToText: https://convertaudiototext.com/pricing (consultado en julio de 2026)
- AssemblyAI: transcripción en tiempo real frente a por lotes: https://www.assemblyai.com/blog/real-time-vs-batch-transcription (consultado en julio de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.