Precios de la API de OpenAI Whisper por minuto en 2026
apitranscriptionpricingopenaiwhisper

Precios de la API de OpenAI Whisper por minuto en 2026

BMMamane B. MoussaFebruary 23, 202617 min read

Summarize this article with:

La API de Whisper de OpenAI se ha convertido en uno de los servicios de transcripción más comentados desde su lanzamiento, en gran parte por su precio sencillo y por la reputación del modelo de código abierto Whisper que la respalda. Pero entender lo que realmente pagas, lo que recibes y a lo que renuncias en comparación con otras opciones requiere un análisis más detallado del que ofrecen la mayoría de los resúmenes.

Esta guía cubre todo lo que necesitas saber sobre los precios por minuto de la API de OpenAI Whisper en 2026, incluyendo los costos reales, las limitaciones de tamaño de archivo, la economía del autoalojamiento y cómo se compara Whisper frente a las alternativas de pago de Google, AWS y Deepgram.

Precios de la API de Whisper de un vistazo

OpenAI mantiene los precios de la API de Whisper simples. Hay un solo precio, un solo modelo y ningún sistema complicado de niveles que descifrar.

DetalleValor
Precio por minuto$0.006
Precio por hora$0.36
Incremento de facturaciónPor segundo (redondeado al segundo más cercano)
Nivel gratuitoNinguno
Descuentos por volumenNinguno
Cargo mínimoBasado en la duración real del audio
ModeloWhisper v3 (large-v3)

Esa tarifa fija de $0.006 por minuto se aplica sin importar cuánto audio proceses. Ya sea que transcribas diez minutos de audio al mes o diez mil horas, el costo por minuto se mantiene igual. OpenAI no ofrece descuentos por volumen, precios por uso comprometido ni un nivel gratuito para la API de Whisper.

Para tener una referencia, una hora de transcripción cuesta $0.36. Diez horas cuestan $3.60. Cien horas cuestan $36. Las cuentas son sencillas, lo cual es uno de los mayores atractivos de Whisper para los equipos que quieren una facturación predecible y sin sorpresas.

Pagas únicamente por la duración real del audio de tu archivo. Si envías una grabación de cinco minutos, pagas por cinco minutos sin importar cuánto tarde la API en procesarla. Los silencios dentro del archivo también cuentan para la duración, ya que la API procesa todo el flujo de audio.

Visita la página de precios de OpenAI para conocer las tarifas oficiales más recientes.

Qué obtienes por $0.006 por minuto

A ese precio, la API de Whisper ofrece un servicio de transcripción capaz, respaldado por uno de los modelos de reconocimiento de voz más conocidos del mundo.

Funciones incluidas

Modelo Whisper v3 (large-v3). La API ejecuta el modelo Whisper más grande y preciso de OpenAI. No necesitas elegir entre tamaños de modelo ni administrar distintos niveles de precisión. Cada solicitud usa el mismo modelo.

Soporte para más de 57 idiomas. Whisper maneja la transcripción en docenas de idiomas, desde inglés y español hasta hindi, árabe, japonés y muchos más. El soporte de idiomas es una de las mayores ventajas de Whisper. La lista completa de idiomas compatibles está disponible en el repositorio de Whisper en GitHub.

Detección automática de idioma. Si no especificas el idioma, Whisper lo detectará automáticamente a partir de los primeros 30 segundos de audio. Esto funciona bien para la mayoría de las grabaciones, aunque especificar el idioma cuando lo conoces mejora la precisión.

Marcas de tiempo a nivel de palabra. La API puede devolver marcas de tiempo para palabras individuales, lo cual es útil para generar subtítulos, buscar dentro del audio y alinear transcripciones con video.

Traducción al inglés. Además de la transcripción, Whisper ofrece un modo de traducción que transcribe audio en otros idiomas directamente a texto en inglés en un solo paso, sin necesidad de un servicio de traducción aparte.

Lo que NO obtienes

Entender las limitaciones de Whisper es tan importante como conocer sus funciones, especialmente al compararlo con las alternativas de pago.

Sin transcripción en streaming ni en tiempo real. La API de Whisper funciona únicamente por lotes. Subes un archivo de audio completo y recibes la transcripción completa una vez que termina el procesamiento. No hay un endpoint de WebSocket, ni resultados parciales, ni capacidad de subtitulado en vivo. Si necesitas transcripción en tiempo real para reuniones o transmisiones en vivo, Whisper no es la herramienta adecuada.

Sin diarización de hablantes nativa. Whisper no identifica ni etiqueta a los distintos hablantes de una conversación. La transcripción llega como un único flujo de texto sin ninguna indicación de quién dijo qué. Puedes agregar una diarización de terceros por encima, pero eso suma complejidad y costo.

Sin vocabulario personalizado ni refuerzo de palabras clave. Si tu audio contiene terminología especializada, nombres de marcas o palabras poco comunes, no puedes proporcionar un diccionario personalizado para mejorar la precisión. Whisper transcribe basándose únicamente en sus datos de entrenamiento.

Sin análisis de sentimiento ni detección de temas. La API devuelve texto y marcas de tiempo. No analiza el tono emocional, no identifica los temas de la conversación ni proporciona ningún análisis semántico del contenido.

Sin control automático de puntuación. Whisper agrega puntuación automáticamente, pero tienes un control limitado sobre cómo puntúa. En algunos idiomas, la precisión de la puntuación puede ser inconsistente.

Red neuronal de IA procesando datos de audio
Red neuronal de IA procesando datos de audio

El límite de tamaño de archivo de 25MB

Una de las frustraciones más comunes con la API de Whisper es su límite de 25MB por solicitud. Para grabaciones cortas o audio comprimido, esto rara vez es un problema. Pero para archivos más largos, especialmente archivos de video o grabaciones de alto bitrate, alcanzarás este tope rápidamente.

Un límite de 25MB equivale aproximadamente a:

FormatoDuración aproximada a 25MB
MP3 a 128kbps~26 minutos
MP3 a 64kbps~52 minutos
WAV (16 bits, 16kHz mono)~13 minutos
M4A a 128kbps~26 minutos
Video MP43-10 minutos (varía mucho)

Si tus grabaciones superan estas duraciones, necesitas una estrategia alternativa.

Estrategia 1: Comprimir antes de subir

El enfoque más sencillo es convertir tu audio a un formato comprimido antes de enviarlo a la API. Convertir un archivo WAV a MP3 a 64kbps puede reducir el tamaño del archivo en un 90% o más, manteniendo una precisión de transcripción prácticamente idéntica a la del original. Herramientas como FFmpeg manejan esta conversión de forma eficiente. Para contenido que solo contiene voz, el MP3 a 64kbps conserva toda la información de frecuencia que Whisper necesita.

Estrategia 2: Dividir archivos largos en fragmentos

Para grabaciones que superan los 25MB incluso después de comprimirlas, dividir el archivo en segmentos más pequeños es el enfoque estándar. La consideración clave aquí es elegir los puntos de corte con cuidado. Dividir a mitad de una oración hará que la API devuelva oraciones incompletas en los límites de los fragmentos, y tendrás que unir los resultados de forma inteligente. Dividir en puntos de silencio naturales produce resultados más limpios.

La mayoría de las bibliotecas de procesamiento de audio pueden detectar pausas de silencio en las grabaciones y usarlas como puntos de corte. Apunta a fragmentos de entre 20 y 24MB para dejar un pequeño margen por debajo del límite.

Estrategia 3: Extraer el audio del video

Si trabajas con archivos de video, extrae primero la pista de audio en lugar de subir el video completo. Un video MP4 de una hora puede pesar 500MB, pero la pista de audio sola como MP3 podría pesar menos de 30MB. Este paso de extracción es rápido y evita enviar datos de video que la API ignora de todos modos.

Estrategia 4: Usar un servicio que se encargue de esto por ti

Plataformas como ConvertAudioToText manejan el preprocesamiento de archivos automáticamente. Subes archivos de cualquier tamaño y la plataforma se encarga de la compresión, la división en fragmentos y el reensamblado tras bambalinas. Esto elimina la carga de ingeniería de construir tu propio pipeline de preprocesamiento.

Autoalojar Whisper: gratis pero no gratis

Como Whisper es de código abierto, puedes ejecutarlo en tu propia infraestructura sin pagarle nada a OpenAI. Los pesos del modelo están disponibles libremente y el código está bien documentado. Esto plantea una pregunta obvia: ¿por qué pagar $0.006 por minuto cuando puedes ejecutarlo gratis?

La respuesta se reduce a los costos de GPU, el tiempo de ingeniería y la escala.

Costos de GPU para el autoalojamiento

El modelo large-v3 de Whisper requiere una GPU capaz para funcionar a velocidades razonables. Esto es lo que cuestan las opciones más comunes en los principales proveedores de nube:

GPUCosto en la nube (por hora)Velocidad de procesamiento de WhisperCosto por hora de audio
NVIDIA A100 (80GB)~$1.50 - $3.00~6-10x tiempo real$0.15 - $0.50
NVIDIA A10G~$0.75 - $1.20~3-5x tiempo real$0.15 - $0.40
NVIDIA T4~$0.35 - $0.50~1-2x tiempo real$0.18 - $0.50
NVIDIA L4~$0.50 - $0.80~3-4x tiempo real$0.13 - $0.27

La velocidad de procesamiento importa porque determina cuántas horas de audio puedes transcribir por hora de GPU. Una A100 puede procesar una grabación de una hora en unos seis a diez minutos, lo que significa que puedes transcribir aproximadamente de seis a diez horas de audio por hora de GPU. Una T4 procesa a una velocidad cercana al tiempo real, así que una hora de GPU rinde aproximadamente de una a dos horas de audio transcrito.

Los costos ocultos

El alquiler bruto de la GPU es solo una parte de la ecuación. Autoalojar Whisper también requiere:

Gestión de infraestructura. Necesitas aprovisionar servidores, gestionar el escalado, manejar la conmutación por error y mantener el tiempo de actividad. No es un despliegue de configurar y olvidar.

Gestión de colas y trabajos. Procesar audio a escala requiere una cola de trabajos, gestión de workers, lógica de reintentos y seguimiento de estado. Básicamente estás construyendo la infraestructura de backend que las APIs gestionadas ofrecen de fábrica.

Actualizaciones del modelo. Cuando OpenAI publica pesos de modelo mejorados, necesitas actualizar tu despliegue. Probar, validar y desplegar las actualizaciones del modelo consume tiempo de ingeniería.

Monitoreo y depuración. Las cargas de trabajo en GPU fallan de maneras distintas a los servicios web típicos. Los errores de memoria insuficiente, los problemas de drivers y los conflictos de versiones de CUDA son dolores de cabeza frecuentes.

Almacenamiento y redes. Mover archivos de audio a tus servidores con GPU y almacenar los resultados agrega costos de ancho de banda y almacenamiento que es fácil pasar por alto.

Cuándo el autoalojamiento ahorra dinero

El autoalojamiento empieza a tener sentido financiero cuando procesas volúmenes grandes y constantes. El punto de equilibrio depende de tus decisiones de infraestructura, pero como guía aproximada:

Volumen mensualCosto de la API (a $0.006/min)Estimación de autoalojamientoMejor opción
Menos de 100 horas$36$150 - $400+API
100 - 500 horas$36 - $180$200 - $600API (generalmente)
500 - 2,000 horas$180 - $720$300 - $800Autoalojamiento (depende)
Más de 2,000 horas$720+$400 - $1,200Autoalojamiento

Estas estimaciones asumen que tienes recursos de ingeniería disponibles para construir y mantener la infraestructura. Si necesitas contratar o reasignar ingenieros para gestionar un despliegue autoalojado de Whisper, el punto de equilibrio se desplaza considerablemente hacia arriba.

Ventajas y desventajas del autoalojamiento

VentajasDesventajas
Sin cargos por minutoEsfuerzo de ingeniería inicial considerable
Control total sobre el modelo y el pipelineLos costos de GPU se acumulan rápido con volúmenes bajos
Los datos permanecen en tu infraestructuraTú te encargas del escalado, el monitoreo y las actualizaciones
Puedes personalizar el preprocesamiento y el posprocesamientoSin SLA ni soporte de OpenAI
Sin límites de tamaño de archivoRequiere experiencia en GPU dentro de tu equipo

Whisper vs alternativas de pago

El precio por minuto es la métrica más visible, pero cuenta una historia incompleta. Lo que importa es el costo total de lograr la calidad de transcripción y las funciones que tu flujo de trabajo requiere.

Tabla comparativa de precios

ServicioPrecio por minutoDiarización de hablantesStreamingIdiomasVocabulario personalizado
OpenAI Whisper API$0.006NoNo57+No
Deepgram (Nova-2)$0.004336+
Google Cloud STT$0.016125+Sí (frases)
AWS Transcribe$0.02437+
Azure Speech$0.016100+
AssemblyAI$0.006520+No

Lo que revela la tabla

Whisper es barato, pero no el más barato. El modelo Nova-2 de Deepgram supera a Whisper en precio con $0.0043 por minuto, e incluye además diarización de hablantes, streaming, vocabulario personalizado y funciones como análisis de sentimiento y detección de temas. Para aplicaciones que necesitan más que una transcripción básica, Deepgram suele ofrecer mejor valor a pesar de ser un servicio de pago. Puedes leer más sobre cómo se comparan estos servicios en nuestra comparativa de precios de APIs de voz a texto.

Los servicios empresariales cobran más, pero también ofrecen más. Google Cloud Speech-to-Text y AWS Transcribe cuestan de dos a cuatro veces más que Whisper, pero incluyen soporte de streaming, diarización de hablantes, vocabulario personalizado y SLAs de nivel empresarial. Para aplicaciones en producción donde el tiempo de inactividad cuesta dinero real, esos extras importan.

Las funciones que faltan tienen costos ocultos. Si necesitas diarización de hablantes con Whisper, tendrás que agregar un servicio o una biblioteca de diarización de terceros, lo que suma complejidad, latencia y, potencialmente, costos adicionales. Los "ahorros" de la tarifa por minuto más baja de Whisper pueden evaporarse cuando tomas en cuenta las integraciones necesarias para igualar lo que otros servicios incluyen de forma nativa.

Para una comparación detallada entre Whisper y la oferta de Google, consulta nuestro análisis de Whisper vs Google Cloud Speech.

Comunicación multilingüe global y traducción
Comunicación multilingüe global y traducción

Cuándo Whisper es la opción correcta

A pesar de sus limitaciones, hay escenarios en los que la API de Whisper es genuinamente la mejor opción.

Transcripción multilingüe por lotes

Si transcribes con frecuencia audio en muchos idiomas distintos y no necesitas resultados en tiempo real, la combinación de amplio soporte de idiomas y bajo costo de Whisper es difícil de superar. Una empresa de medios que transcribe entrevistas en francés, japonés y portugués puede usar una sola API con precios consistentes en todos los idiomas. La mayoría de los competidores o cobran más por los idiomas distintos del inglés o admiten menos de ellos.

Proyectos a pequeña escala con presupuesto ajustado

Para startups, investigadores y desarrolladores independientes que procesan volúmenes modestos de audio, la tarifa de $0.006 por minuto de Whisper mantiene los costos al mínimo. Transcribir diez horas de audio cuesta $3.60 sin ninguna infraestructura que administrar. No hay compromiso mínimo, ni suscripción, ni costo inicial más allá de tus créditos de la API de OpenAI.

Preferencia por el código abierto y control de los datos

Las organizaciones que prefieren la tecnología de código abierto pueden usar la API de Whisper como un punto de entrada conveniente y migrar a un Whisper autoalojado más adelante si los volúmenes crecen. Como el modelo es idéntico, los resultados de transcripción serán consistentes en ambos modelos de despliegue. Es una flexibilidad que los servicios propietarios no pueden igualar. Para los desarrolladores que exploran opciones de transcripción gratuitas, la disponibilidad de Whisper en código abierto es una ventaja significativa.

Transcripción simple sin extras

Si tu caso de uso es sencillo, subir un archivo y obtener una transcripción, Whisper entrega exactamente eso sin que pagues por funciones que no necesitas. No estás subsidiando un motor de diarización, una infraestructura de streaming ni un sistema de vocabulario personalizado que nunca vas a usar.

Prototipado y desarrollo

Whisper es una excelente opción para construir y probar funciones de transcripción antes de comprometerte con un servicio más completo (y más caro). La API simple, los precios predecibles y la bien documentada guía de integración hacen que sea fácil tener un prototipo funcionando rápidamente.

Estimando tus costos mensuales

Para ayudarte a presupuestar, aquí tienes algunos casos de uso comunes con costos mensuales estimados usando la API de Whisper.

Caso de usoVolumen mensualCosto mensual
Periodista freelance que transcribe entrevistas10 horas$3.60
Equipo pequeño de podcast que transcribe episodios20 horas$7.20
Equipo de investigación que procesa grupos focales50 horas$18.00
Agencia de contenido que transcribe medios de clientes200 horas$72.00
Empresa que procesa grabaciones de llamadas1,000 horas$360.00
Digitalización de archivos de medios a gran escala5,000 horas$1,800.00

Estos costos cubren únicamente el uso de la API de Whisper. Si necesitas procesamiento adicional como diarización, formateo o generación de subtítulos, considera el costo de esos servicios adicionales o evalúa una plataforma como ConvertAudioToText que agrupa estas funciones en un solo paquete.

Preguntas frecuentes

¿Existe un nivel gratuito para la API de OpenAI Whisper?

No. OpenAI no ofrece un nivel gratuito para la API de Whisper. Cada minuto de audio procesado se factura a $0.006. Las cuentas nuevas de OpenAI a veces reciben una pequeña cantidad de créditos de API gratuitos que pueden usarse para Whisper, pero se trata de un crédito introductorio único, no de un nivel gratuito permanente. Si necesitas transcripción gratuita, el modelo Whisper de código abierto puede autoalojarse sin costo de software, aunque tendrás que aportar tu propia infraestructura de GPU.

¿Cómo se comparan los precios de la API de Whisper con contratar transcriptores humanos?

Los servicios de transcripción humana suelen cobrar entre $1.00 y $3.00 por minuto de audio con tiempos de entrega estándar, y las tarifas urgentes son más altas. A $0.006 por minuto, la API de Whisper es aproximadamente de 150 a 500 veces más barata que la transcripción humana. Sin embargo, los transcriptores humanos siguen ofreciendo mayor precisión en audio difícil, incluyendo grabaciones con acentos marcados, hablantes que se superponen o mucho ruido de fondo. Para audio limpio con un solo hablante, la precisión de Whisper es competitiva con la transcripción humana a una fracción del costo.

¿Puedo usar Whisper para transcripción en tiempo real de reuniones en vivo?

No. La API de Whisper solo admite procesamiento por lotes. Debes subir un archivo de audio completo y esperar a que se devuelva la transcripción completa. No hay endpoint de streaming, ni soporte de WebSocket, ni manera de recibir resultados parciales mientras se graba el audio. Para transcripción de reuniones en tiempo real, necesitarás un servicio que admita streaming, como Deepgram, Google Cloud Speech-to-Text o AssemblyAI.

¿OpenAI ofrece descuentos por volumen para clientes de alto uso de la API de Whisper?

A principios de 2026, OpenAI no ofrece descuentos por volumen publicados para la API de Whisper. La tarifa de $0.006 por minuto es la misma ya sea que proceses una hora o diez mil horas al mes. Los clientes empresariales con volúmenes muy altos pueden llegar a negociar precios personalizados contactando directamente al equipo de ventas de OpenAI, pero no existe una estructura de descuentos de autoservicio.

¿Qué pasa si mi archivo de audio supera el límite de 25MB?

La API rechazará la solicitud con un error. Necesitas reducir el tamaño del archivo antes de subirlo. Los enfoques más efectivos son comprimir el audio a un formato MP3 de menor bitrate, extraer el audio de los archivos de video para eliminar los datos de video, o dividir las grabaciones largas en fragmentos más pequeños. La mayoría de las implementaciones en producción automatizan este paso de preprocesamiento para que los usuarios finales nunca se topen con el límite directamente.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles