
Whisper vs Google Cloud Speech-to-Text en 2026: ¿Qué API gana?
Summarize this article with:
Which should you use in 2026, OpenAI Whisper or Google Cloud Speech-to-Text? If you need real-time streaming or speaker diarization today, Google wins. If you need the cheapest per-minute batch transcription with broad language coverage, Whisper wins. And if your workload is non-urgent batch processing, Google's Dynamic Batch tier at roughly $0.004 per minute now undercuts the Whisper API itself.

The rest of this guide explains why.
The Short Version
Both services have changed meaningfully since the last round of comparison posts. Google's V2 API and the Chirp 3 model replaced the old Standard/Enhanced tier structure. OpenAI added gpt-4o-transcribe alongside the still-available whisper-1. And Google's Dynamic Batch tier flipped the cost comparison in a way most developers haven't noticed yet.
Key takeaways:
- Google Standard with Chirp 3: $0.016/min, includes streaming, diarization, and a built-in denoiser. No separate "Enhanced" tier exists anymore.
- Whisper API (whisper-1): $0.006/min, batch-only, 99-language coverage, no native diarization.
- Google Dynamic Batch: roughly $0.004/min, results within 24 hours, no streaming.
- gpt-4o-mini-transcribe: $0.003/min, OpenAI's lowest-cost hosted option, similar batch constraints to whisper-1.
If you are making a fast choice: batch-only, cost-sensitive, multilingual? Start with Whisper. Need real-time or a managed enterprise service? Google Cloud Speech-to-Text.
Two Different Philosophies
Before comparing prices, it helps to understand what each service actually is.
OpenAI Whisper es un modelo de código abierto cuyos pesos están disponibles públicamente en GitHub. Cuando los desarrolladores dicen "Whisper", pueden referirse al modelo de código abierto ejecutándose en su propia GPU, al endpoint alojado whisper-1, o a uno de los modelos más recientes de OpenAI, como gpt-4o-transcribe. El coste, el control y la carga operativa difieren entre esas tres opciones.
Google Cloud Speech-to-Text es un servicio cloud totalmente gestionado. Envías audio, Google lo procesa y recibes los resultados. El modelo subyacente no se puede descargar. A cambio, obtienes un servicio de nivel de producción: streaming en tiempo real, diarización de hablantes, cobertura de más de 100 idiomas con Chirp 3, y un denoiser integrado para audio con ruido. La documentación oficial cubre el conjunto completo de funciones.
Esa diferencia de filosofía condiciona todo lo demás. Whisper cambia la comodidad gestionada por flexibilidad y control de costes. Google cambia el control por pulido y completitud.
Comparativa lado a lado
| Característica | OpenAI Whisper (API whisper-1) | Google Cloud STT (V2 / Chirp 3) |
|---|---|---|
| Precio por minuto (estándar) | $0.006 | $0.016 |
| Precio gestionado más bajo | $0.003 (gpt-4o-mini-transcribe) | ~$0.004 (Dynamic Batch, entrega en 24h) |
| Nivel gratuito | $5 de crédito para cuentas nuevas | 60 minutos/mes de forma continua |
| Streaming | No (el endpoint whisper-1 es solo por lotes) | Sí, en tiempo real con resultados provisionales |
| Idiomas | 99 | 100+ (Chirp 3 cubre 85+ en GA/preview) |
| Diarización de hablantes | No compatible de forma nativa | Sí (modos por lotes/síncrono; no en streaming con Chirp 3) |
| Manejo de audio con ruido | Moderado | Fuerte (denoiser integrado en Chirp 3) |
| Vocabulario personalizado | Solo mediante texto en el prompt | Sí, hasta 1.000 sugerencias de frases |
| Autoalojamiento | Sí (pesos del modelo de código abierto) | No |
| Ideal para | Procesamiento por lotes sensible al coste, autoalojamiento, multilingüe | Aplicaciones de streaming, empresas, audio con ruido |
Análisis detallado de precios
Aquí es donde la comparación cambió más en 2026, y merece la pena tener los números claros.
Opciones de OpenAI
El endpoint whisper-1 cobra una tarifa plana de $0.006 por minuto, facturada por segundo. OpenAI ahora también ofrece:
- gpt-4o-transcribe: $0.006/min (misma tarifa, afirma mejor precisión que whisper-1)
- gpt-4o-mini-transcribe: $0.003/min (la mitad de precio, adecuado para trabajo por lotes de menor riesgo)
Los tres son endpoints solo por lotes. OpenAI tiene un producto de voz en tiempo real aparte, pero a unos $0.017/min está pensado para aplicaciones de voz en vivo con un punto de precio muy distinto.
Opciones de Google V2
La API V2 con Chirp 3 simplificó los precios de Google:
- Estándar (tiempo real o por lotes): $0.016/min, Chirp 3 incluido sin recargo
- Lote dinámico: aproximadamente $0.004/min, resultados entregados en 24 horas
- Modelos médicos: $0.078/min (dictado y conversación, no aplicable para uso general)
- Nivel gratuito: 60 minutos al mes de forma continua, más $300 en créditos de GCP para cuentas nuevas
El nivel de lote dinámico está aproximadamente un 75% por debajo de la tarifa estándar. Ese cálculo lo sitúa en unos $0.004/min, que queda por debajo de los $0.006/min de la API de Whisper. Para archivos de pódcast, transcripción de medios y cualquier carga de trabajo donde puedas esperar hasta el día siguiente, esta es la opción gestionada más rentable que ofrecen ambos proveedores.
Coste a escala
Tarifas verificadas: gpt-4o-mini-transcribe $0.003/min, Whisper-1 $0.006/min, Lote dinámico de Google ~$0.004/min, Estándar de Google $0.016/min. El lote dinámico requiere un plazo de 24 h. El estándar de Google incluye Chirp 3.
| Monthly Volume | Whisper-1 | Google Standard | Google Dynamic Batch |
|---|---|---|---|
| 100 hours | $36 | $96 | ~$24 |
| 1,000 hours | $360 | $960 | ~$240 |
Con 1.000 horas al mes, Dynamic Batch ahorra unos $120 frente a Whisper y $720 frente a Google Standard. La contrapartida es una ventana de resultados de 24 horas, algo que muchas cargas de trabajo por lotes pueden asumir sin problema.
Para una visión más amplia de lo que cobran los servicios de transcripción en el mercado, la guía comparativa de precios de transcripción analiza más proveedores lado a lado.
El Comodín del Autohospedaje
Autohospedar Whisper introduce una estructura de costes completamente distinta. Los pesos del modelo son gratuitos. El coste está en el cómputo de GPU.
En AWS, una instancia g5.xlarge (1x A10G, 24GB de VRAM) cuesta alrededor de $1/hora bajo demanda. Whisper large-v3 en una sola A10G puede transcribir a una velocidad aproximada de 100x en tiempo real, lo que significa que una hora de GPU cubre unas 100 horas de audio. Con una utilización plena, el coste efectivo por minuto de audio queda muy por debajo de $0,002.
Eso suena atractivo hasta que contabilizas el tiempo de inactividad. Una GPU al 50% de utilización duplica tu coste efectivo por minuto. Añade la carga operativa de DevOps para el despliegue, la monitorización y el escalado, y el punto de equilibrio frente a la API de Whisper se sitúa en torno a las 500 horas al mes. Por debajo de esa cifra, la API casi siempre sale más barata cuando incluyes el tiempo de ingeniería.
El autohospedaje tiene sentido claro en dos escenarios: volumen superior a 500 horas al mes, o requisitos de soberanía de datos donde el audio no puede salir de tu infraestructura.
La guía de costes ocultos de los servicios de transcripción profundiza en las matemáticas de utilización de GPU y sobrecarga de infraestructura.
Precisión según el Idioma y el Tipo de Audio
Ambos servicios logran una precisión sólida con audio en inglés limpio. Las diferencias en 2026 son más matizadas.
Google Chirp 3 en audio ruidoso. El modelo Chirp 3 incluye un eliminador de ruido integrado que maneja el ruido de fondo, las salas con reverberación y el audio telefónico mejor que la arquitectura anterior Standard/Enhanced. Para llamadas telefónicas y grabaciones de campo, esto supone una mejora significativa, y viene incluido en la tarifa estándar de $0.016/min sin necesidad de subir de nivel.
Whisper en contenido multilingüe. Whisper se entrenó con aproximadamente 680.000 horas de audio multilingüe en 99 idiomas. Para idiomas con menos recursos, como el galés, el suajili, el malayo y el catalán, Whisper suele superar a las alternativas porque su conjunto de entrenamiento se diseñó deliberadamente para abarcar más. Google Chirp 3 cubre más de 100 idiomas, pero solo 24 están plenamente disponibles y el resto siguen en vista previa. La cobertura sobre el papel y la precisión en la práctica divergen en esos idiomas de vista previa.
Comparativa directa en inglés. Para audio de estudio limpio, podcasts y reuniones bien grabadas, ambos servicios rinden de forma comparable en el rango de precisión de palabras superior al 90 por ciento. OpenAI afirma que gpt-4o-transcribe reduce la tasa de error de palabras frente a whisper-1, sobre todo en habla con acento y audio difícil. Estas afirmaciones coinciden con los análisis independientes, aunque el margen varía según el dominio.
Mi opinión: haz una prueba piloto específica para tu dominio antes de comprometerte. La precisión en declaraciones legales no es la misma que en llamadas de atención al cliente, y tampoco es la misma que en presentaciones de conferencias. Los análisis publicados son un punto de partida, no una decisión de contratación.
Para profundizar en lo que significa realmente la tasa de error de palabras en producción, consulta explicación de la precisión en transcripción.
La cuestión del streaming
El endpoint de la API whisper-1 no admite streaming. Subes un archivo de audio completo, esperas a que termine el procesamiento y recibes la transcripción completa en una sola respuesta. Esto funciona bien para contenido pregrabado, pero resulta excluyente para cualquier cosa que requiera resultados en vivo.
Google Cloud Speech-to-Text ofrece streaming en tiempo real de verdad mediante una conexión gRPC bidireccional. Envías fragmentos de audio a medida que llegan desde un micrófono o una transmisión en vivo y recibes resultados provisionales en milisegundos mientras Google procesa cada segmento. Esto lo convierte en la opción natural para subtitulado en directo, asistentes de voz y transcripción de reuniones en tiempo real.
Una nota sobre Chirp 3 y el streaming: aunque el modelo Chirp 3 sí admite el método StreamingRecognize, la diarización de hablantes en Chirp 3 está disponible actualmente solo en los modos de reconocimiento por lotes y síncrono. Si necesitas tanto streaming como diarización, consulta la documentación actual antes de construir tu pipeline.
Whisper autoalojado puede aproximar el streaming con herramientas como faster-whisper usando segmentos de audio solapados, pero Whisper fue diseñado como un modelo por lotes de fragmentos de 30 segundos. Puedes ingeniártelas para sortearlo, pero no igualarás la latencia de un servicio de streaming creado específicamente para ello.
Si el streaming es un requisito ineludible, Google Cloud Speech-to-Text es la opción práctica.
Autoalojar Whisper: La Evaluación Honesta
El autoalojamiento te da privacidad total de datos, sin costes por minuto, sin límites de tasa y la capacidad de ajustar el modelo con tus datos de dominio. Esas ventajas son reales.
Los costes también lo son:
- Instancias de GPU a $0.75-$1/hora bajo demanda, a menudo más
- Tiempo de ingeniería para desplegar, escalar, monitorizar y actualizar el modelo
- Sin diarización, vocabulario personalizado ni streaming de serie
El autoalojamiento merece la pena cuando procesas más de 500 horas de audio al mes con una utilización constante, o cuando tu postura de cumplimiento (HIPAA, interpretaciones estrictas del GDPR, contratación en defensa) exige que el audio nunca salga de tu infraestructura.
Por debajo de 500 horas al mes, la API de Whisper o Google Dynamic Batch suelen ser más baratos si contabilizas las horas de ingeniería. Para la mayoría de startups y equipos medianos, la API es el punto de partida correcto.
Matriz de Decisión
| Caso de uso | Recomendado | Por qué |
|---|---|---|
| Subtítulos en directo o en tiempo real | Google Cloud STT | El streaming con resultados provisionales es imprescindible |
| Aplicación controlada por voz | Google Cloud STT | Se requiere streaming de baja latencia |
| Archivo de podcasts o vídeos por lotes | Google Dynamic Batch | Más barato que la API de Whisper si un plazo de 24 horas es aceptable |
| Transcripción por lotes de bajo coste (resultados rápidos) | gpt-4o-mini-transcribe | $0.003/min, resultados bajo demanda |
| Contenido multilingüe (más de 50 idiomas) | Whisper API | La mayor amplitud de entrenamiento multilingüe |
| Llamadas telefónicas, grabaciones de campo con ruido | Google Cloud STT | Reductor de ruido integrado Chirp 3 |
| Requisito de soberanía de datos | Whisper autoalojado | El audio nunca sale de tu infraestructura |
| Volumen alto (más de 500 horas al mes) | Whisper autoalojado | El ahorro de costes justifica la carga operativa a escala |
| Empresa con stack de GCP | Google Cloud STT | Integración nativa con los servicios de GCP |
| MVP o prototipo de startup | Whisper API o gpt-4o-mini | Precios simples, camino más rápido hacia código funcional |
Si solo necesitas una transcripción limpia de un archivo de audio o vídeo sin montar una integración de API, ConvertAudioToText gestiona la subida, la transcripción y la exportación sin necesidad de código.
Cómo decidir
Recorre estas cuatro preguntas.
¿Necesitas streaming en tiempo real? Si es así, Google Cloud STT. El endpoint whisper-1 no puede hacer esto, y las soluciones de streaming con Whisper autoalojado conllevan una sobrecarga de ingeniería considerable.
¿Tu trabajo por lotes tolera un plazo de 24 horas? Si es así, Google Dynamic Batch a unos $0.004/min es ahora más barato que la API de Whisper a $0.006/min. La ventaja de coste del incumbente se ha invertido para lotes no urgentes.
¿Necesitas una cobertura multilingüe sólida en más de 90 idiomas? Si es así, Whisper. Su amplitud de entrenamiento para idiomas con menos recursos sigue siendo inigualable entre los servicios gestionados.
¿La privacidad de datos es un requisito legal estricto? Si es así, Whisper autoalojado es el camino más limpio.
Si ninguna de estas opciones ofrece una respuesta clara, opta por el proveedor que mejor encaje con tu infraestructura existente. Google se integra de forma natural en entornos GCP. Whisper encaja en stacks de Python donde ya se usan las librerías de Hugging Face. Ambos harán el trabajo de transcripción.
Para un desglose completo de las tarifas por minuto en todas las APIs principales, incluidas Deepgram y AWS Transcribe, la guía de precios de APIs de transcripción de voz a texto cubre todo el panorama.
Preguntas frecuentes
¿Es OpenAI Whisper más preciso que Google Cloud Speech-to-Text?
Para audio en inglés limpio, ambos están cerca. Google Chirp 3 tiene una ligera ventaja en grabaciones con ruido gracias a su eliminador de ruido integrado. Para idiomas con menos recursos, Whisper suele rendir mejor porque su conjunto de entrenamiento cubre 99 idiomas con datos multilingües profundos. La respuesta honesta es: haz una prueba con 50 muestras de tu propio audio antes de comprometerte, ya que los factores específicos del dominio importan más que los benchmarks publicados.
¿Puedo usar Whisper para transcripción de reuniones en vivo?
No con el endpoint de la API whisper-1, que solo admite lotes con un límite de archivo de 25MB. Tendrías que autoalojar Whisper y montar un pipeline de streaming con herramientas como faster-whisper, lo que añade complejidad de ingeniería. Google Cloud Speech-to-Text (modelo Chirp 3) admite streaming en tiempo real con resultados provisionales y es la opción más práctica para transcripción de reuniones en vivo. OpenAI ahora ofrece un endpoint de voz en tiempo real por separado, pero cuesta aproximadamente $0.017 por minuto, lo que cambia mucho el cálculo de costes.
¿Es más barato autoalojar Whisper que usar Google Cloud Speech-to-Text?
A volúmenes altos y con un buen uso de la GPU, sí. Una instancia de GPU ejecutando Whisper large-v3 puede alcanzar costes efectivos muy por debajo de los $0.002 por minuto. Pero el nivel Dynamic Batch de Google, a aproximadamente $0.004 por minuto con un plazo de entrega de 24 horas, ahora supera en precio a la API de Whisper ($0.006/min) para trabajo por lotes que no requiere tiempo real, y sin la carga de gestionar GPUs. El autoalojamiento solo gana claramente cuando superas unas 500 horas al mes y tienes capacidad de ingeniería para mantener la infraestructura.
¿Admite Google Cloud Speech-to-Text la diarización de hablantes?
Sí. La diarización de hablantes está disponible tanto en la API V1 como en la V2 con Chirp 3. Un matiz: con Chirp 3, la diarización funciona en modos por lotes y síncrono (Recognize) para unas 15 lenguas compatibles, pero aún no está disponible en modo streaming. Whisper no incluye diarización de forma nativa en absoluto; tendrías que ejecutar un modelo aparte como pyannote sobre la salida de Whisper.
¿Puedo cambiar entre Whisper y Google Cloud Speech-to-Text más adelante?
Sí, con algo de trabajo de integración. Ambos aceptan formatos de audio estándar y devuelven texto con marcas de tiempo. Las formas de las API son diferentes, los formatos de respuesta difieren, y las funciones exclusivas de cada servicio (vocabulario personalizado de Google, modo de traducción de Whisper) requieren adaptación. Si prevés cambiar, envuelve tus llamadas de transcripción tras una capa de abstracción ligera desde el principio, de modo que un cambio de proveedor afecte a un solo archivo, no a todo tu código.
Fuentes
- Precios de Google Cloud Speech-to-Text
- Precios de la API de OpenAI
- Documentación de Chirp 3
- Página del modelo Whisper de OpenAI
- Desglose de precios de Google STT (costbench.com)
- Desglose de precios de Whisper de OpenAI (costbench.com)
- Análisis de costes ocultos de Google STT
- Hilo del foro sobre diarización de hablantes en Google STT
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Google Cloud STT Pricing 2026: $0.003–$0.016/min
Google Cloud Speech-to-Text pricing 2026: V2 real-time is $0.016/min but Dynamic Batch drops to ~$0.003/min with 24-hr turnaround. Free 60 min/month ongoing. Chirp, V1 vs V2, and volume tier math.

OpenAI Whisper API Pricing 2026: $0.003–$0.006/min
OpenAI Whisper API pricing in 2026: whisper-1 is still $0.006/min but gpt-4o-mini-transcribe cuts that to $0.003/min. Real per-hour math, file limits (25MB/25-min), and how it stacks up against Deepgram Nova-3 and AssemblyAI.