
Modelos de transcripción de código abierto frente a propietarios en 2026
Summarize this article with:
Por debajo de unas 10.000 minutos al mes, una API propietaria (Deepgram, AssemblyAI) suele ganar a autoalojar Whisper en coste total cuando se cuentan GPU y tiempo de ingeniería; por encima de ese volumen, la ecuación cambia rápido. Lo propietario también gana en latencia de streaming y diarización integrada; lo de código abierto gana en privacidad, control y coste marginal cero. Muchos equipos de producción usan ambos: una API para tiempo real y Whisper autoalojado para lotes.
The Real Tradeoffs
If you transcribe fewer than 10,000 minutes a month, a proprietary API almost always beats self-hosting Whisper on total cost. The open-source model weights are free, but the GPU compute is not, and the engineering time to run it in production rarely is either. Above that volume, the math flips fast, and the case for self-hosting becomes genuinely compelling.
The 2026 question is not ideological. Both ecosystems are mature. The useful answer lives in four dimensions: cost at your actual volume, accuracy on your actual audio, how much latency tolerance you have, and how much operational complexity your team can absorb. This post walks each one honestly.
What Each Side Actually Includes
The Open-Source Side
The open-source speech recognition stack has three main layers worth knowing:
- OpenAI Whisper and its successive versions through Large-v3. The model weights are MIT-licensed. You run them on your own infrastructure, pay only for compute, and keep the audio on your servers.
- Faster implementations like faster-whisper (CTranslate2 backend), whisper.cpp (C++ port), and MLX Whisper (Apple Silicon). These run identical Whisper weights with 4-6x better throughput and roughly half the VRAM. The faster-whisper INT8 quantization drops VRAM usage another 40% with negligible accuracy loss.
- Adjacent open models: NVIDIA NeMo's Parakeet and Canary families, Hugging Face's Distil-Whisper (a faster, smaller Whisper derivative), and SenseVoice for multilingual tasks. The ecosystem around Whisper is now a platform, not just one model.
For a deeper look at how the Whisper architecture actually works, see Whisper Large-v3 explained.
The Proprietary Side
Proprietary APIs sell the same capability minus the deployment work:
- Deepgram Nova-3: actualmente entre los más rápidos para procesamiento por lotes y en streaming, con un precio aproximado de $0.0043 por minuto para audio pregrabado (pago por uso) y $0.0048 por minuto para streaming. El plan de crecimiento con facturación anual reduce ambos precios aún más. Consulta Deepgram Nova-3 explicado para un desglose detallado.
- OpenAI Whisper API: aloja Large-v3 a $0.006 por minuto. Integración más sencilla que cualquier opción autogestionada, con la cola más lenta y la sobrecarga de programación que implica el alojamiento gestionado.
- AssemblyAI Universal-2: $0.15 por hora ($0.0025/min) para transcripción básica, con complementos para diarización (+$0.02/hora), detección de entidades y resúmenes con precios separados. Ten en cuenta que desde el 1 de julio de 2026, los precios regionales subieron un 10%; usar
"model_region": "global"en las solicitudes de API evita ese aumento. - AWS Transcribe: $0.024 por minuto en el nivel estándar (0-250K minutos al mes), bajando en cuatro niveles de volumen hasta $0.0078/min a partir de 5M+ minutos. El análisis médico y de llamadas cuesta más.
- Google Cloud STT v2 (modelo Chirp): $0.016 por minuto estándar, con procesamiento por lotes o dinámico disponible a $0.003 por minuto para cargas de trabajo no sensibles al tiempo. Google factura en incrementos de 15 segundos redondeados hacia arriba, algo relevante para clips cortos.

Precisión: números de referencia frente a la realidad en producción
Lo más engañoso en este ámbito es una tabla simple de WER sin contexto. Todos los sistemas importantes son competitivos en los benchmarks académicos. El rendimiento en el mundo real varía mucho más.
Whisper Large-v3 alcanza un 2,7% de WER en LibriSpeech test-clean, un conjunto de datos de habla leída y controlada. En grabaciones mixtas del mundo real, el mismo modelo promedia alrededor de un 7-8% de WER, subiendo hasta un 17% o más en audio telefónico de baja calidad. Deepgram Nova-3 en los benchmarks de producción propios de Deepgram (2.703 archivos en nueve dominios) muestra una mediana del 5,26% de WER en lote y del 6,84% en streaming, aunque los benchmarks publicados por el proveedor usan conjuntos de datos seleccionados.
El contexto cambia al ganador:
- Audio ruidoso o telefónico: Deepgram Nova-3 tiene una ventaja consistente aquí. Los modelos propietarios entrenados intensivamente con datos de centros de llamadas manejan mejor el audio telefónico que Whisper, que se optimizó sobre un corpus multilingüe amplio.
- Idiomas con pocos recursos y habla con acento: Whisper Large-v3, entrenado con 680.000 horas de audio multilingüe, maneja acentos poco comunes y el cambio de código mejor que la mayoría de las APIs propietarias. Para entender por qué persiste esta brecha, consulta por qué la IA falla con idiomas de pocos recursos.
- Audio de larga duración: Whisper tiene una tendencia conocida a alucinar durante silencios prolongados. Las APIs propietarias gestionan la segmentación y la detección de silencios en la capa de infraestructura, así que esto prácticamente no es tu problema.
- Diariación de hablantes: Todos los sistemas lo hacen de forma imperfecta. Deepgram y AssemblyAI invierten específicamente en la capa de diariación sobre sus modelos base. Autoalojar Whisper implica integrar Pyannote o NeMo por separado. Consulta diariación de hablantes explicada para ver cómo funciona.
Mi opinión: si tu audio es de reunión o podcast con calidad clara en un idioma mayoritario, la diferencia de precisión entre cualquier opción seria es lo bastante pequeña como para que el coste y la complejidad operativa decidan. Si tu audio es de calidad telefónica, con acento o multilingüe, prueba todos los candidatos con una muestra real antes de comprometerte.
Coste: El punto de equilibrio llega alrededor de los 10.000 minutos al mes
La tabla más importante de este post. Costes de propietario frente a autoalojado en tres volúmenes, usando el precio de Deepgram Nova-3 para grabaciones previas (~$0.0043/min) y un coste realista de autoalojamiento en RunPod (A100 desde ~$1.29/hora):
| Volumen mensual | Deepgram Nova-3 | faster-whisper autoalojado |
|---|---|---|
| 1.000 minutos | ~$4.30 | $40-80 (mínimo por GPU) |
| 10.000 minutos | ~$43 | $60-120 |
| 50.000 minutos | ~$215 | $100-200 |
| 500.000 minutos | ~$2.150 | $400-900 |
El mínimo por GPU es la clave. Una instancia de GPU persistente cuesta dinero tanto si transcribe como si no. Con poco volumen, pagas sobre todo por tiempo ocioso. Con mucho volumen, repartes ese coste fijo entre suficiente trabajo como para que la tarifa efectiva por minuto quede muy por debajo de cualquier API.
El punto de equilibrio depende de lo bien que aproveches la GPU. Con colas y programación por lotes, una sola A100 con faster-whisper puede procesar varios cientos de horas al día. Si tu carga de trabajo la llena, el autoalojamiento supera a cualquier precio propietario a gran volumen. Si está ociosa el 80% del tiempo, has devuelto la ventaja.
Para la comparativa completa de precios entre servicios, consulta comparativa de precios de transcripción 2026.
Latencia: donde el propietario tiene una ventaja real
Deepgram Nova-3 en streaming devuelve transcripciones parciales en 100-300ms. Whisper no es un modelo de streaming por naturaleza; las aproximaciones con whisper-streaming o WhisperX añaden más latencia, normalmente de 500-1500ms para resultados parciales. Para subtítulos en tiempo real, transcripción de llamadas en vivo o bucles de agente de voz, esta diferencia es significativa.
Para trabajo por lotes (reuniones grabadas, podcasts, entrevistas), la diferencia es menor. Deepgram procesa un archivo de una hora en unos 2-3 minutos. Un despliegue bien ajustado de faster-whisper en una A100 hace un trabajo similar en 4-7 minutos. La API alojada de OpenAI Whisper es más lenta que ambas por la sobrecarga de la cola.
Si tu pipeline se ejecuta durante la noche y nadie está esperando, las diferencias de latencia son prácticamente irrelevantes. Si los usuarios están mirando una barra de progreso, no lo son.
Complejidad operativa: el coste subestimado
Mantener un despliegue de Whisper en producción implica hacerse cargo de una serie de problemas que una API gestionada absorbe de forma invisible:
- Aprovisionamiento de GPU: las instancias persistentes cuestan dinero cuando están inactivas; las opciones serverless (RunPod, Modal, Replicate) añaden latencia de arranque en frío.
- Picos de tráfico: una ráfaga de subidas golpea tu cola de GPU de capacidad fija, no una API con escalado global y margen de sobra.
- Mantenimiento del modelo: actualizaciones de dependencias, compatibilidad de versiones de CUDA, monitorización.
- Integración de diarización: Pyannote o NeMo tienen sus propios requisitos de instalación y licencias.
- Formato y exportación de resultados: SRT, VTT, restauración de puntuación, etiquetas de hablante. Las APIs propietarias devuelven todo esto. Con Whisper autoalojado, lo construyes tú.
En la práctica, esto supone entre una y dos semanas de ingeniero de trabajo inicial y un mantenimiento continuo nada despreciable. Para una startup de dos personas que transcribe 1.000 minutos al mes, es un mal uso del tiempo. Para un equipo que transcribe 500.000 minutos al mes y cuenta con una persona dedicada a infraestructura, es un martes cualquiera.
El patrón híbrido
Muchos despliegues en producción enrutan según el tipo de trabajo en lugar de comprometerse con una sola opción:
- API propietaria para la ruta por defecto. Rápida, sin mantenimiento, maneja tráfico impredecible.
- Autoalojado para audio sensible a la privacidad. Cualquier cosa que no deba salir de tu infraestructura se ejecuta localmente.
- Autoalojado para lotes de alto volumen. Trabajos por lotes nocturnos donde la latencia da igual y el volumen hace que el coste por minuto sea el factor dominante.
Este patrón añade algo de complejidad operativa, pero permite que el coste y los requisitos de cumplimiento guíen cada trabajo en lugar de forzar una única compensación para todos ellos.
Cuándo elegir cada opción
Pick open-source (self-hosted) if:
- You transcribe more than 10,000 minutes per month and have engineering capacity to deploy and maintain a GPU pipeline.
- Privacy requirements prevent audio from reaching third-party servers.
- You need domain fine-tuning: Whisper weights are openly fine-tunable on your own labeled data.
- You want language flexibility without per-language API surcharges.
Pick a proprietary API if:
- You want working transcription in hours, not weeks.
- Your volume is low to moderate and a fixed GPU cost would dominate.
- You need bundled features: advanced diarization, summarization, entity detection, topic modeling.
- You want a vendor to own reliability, uptime, and throughput scaling.
Pick a managed tool if:
- You need a finished product rather than an API: upload, review, export, done.
- Predictable flat-rate pricing matters more than per-minute optimization.
- You want formatting and editing on top of transcription without building it.
If you want clean transcripts without setting up infrastructure, ConvertAudioToText handles upload-to-text with no account required for short files. It does not pretend to be the only option in this space, but it fits the "finished product" lane cleanly.
FAQ
Is Whisper as accurate as Deepgram Nova-3?
It depends on the audio type. On academic benchmarks like LibriSpeech, Whisper Large-v3 achieves 2.7% WER on clean English. In production across varied audio types, both systems show 5-12% WER depending on conditions. Whisper has an accuracy edge on low-resource languages and accented speech; Deepgram Nova-3 tends to outperform on telephony and call-center audio.
At what volume does self-hosting Whisper start saving money?
Alrededor de 10.000 a 20.000 minutos al mes, aunque el punto exacto de cruce depende de cómo de eficientemente empaques el trabajo de GPU. Una A100 persistente en RunPod (unos 1,29 $/hora) que funcione al 80% de capacidad transcribiendo 50.000 minutos al mes cuesta aproximadamente entre 100 y 200 dólares, frente a unos 215 dólares con la tarifa base por minuto de Deepgram. Por debajo de ese volumen, el coste fijo de la GPU domina y una API por minuto sale más barata.
¿Puedo usar Whisper en un sistema de streaming en tiempo real?
No directamente: Whisper procesa el audio en fragmentos y no es un modelo de streaming nativo. Librerías como whisper-streaming y WhisperX añaden aproximaciones de streaming, pero la latencia se sitúa entre 500 y 1500 ms para resultados parciales. Deepgram Nova-3 en streaming devuelve parciales en 100-300 ms. Para subtitulado en vivo o agentes de voz, las APIs propietarias de streaming tienen una ventaja práctica clara.
¿Cuáles son las principales razones para elegir AssemblyAI en lugar de Deepgram?
El precio de AssemblyAI (0,15 $/hora base) está por debajo de la tarifa de Deepgram para grabaciones, y su capa de postprocesado integrada (resúmenes, detección de entidades, modelado de temas, análisis de sentimiento) es un diferenciador real. Si tu pipeline necesita salida estructurada en lugar de solo una transcripción, AssemblyAI incluye ese trabajo. Si necesitas máxima velocidad o streaming, Deepgram tiene ventaja.
¿El autoalojamiento de Whisper resuelve las preocupaciones de privacidad?
Sí, para la mayoría de los modelos de amenaza prácticos. Ejecutar Whisper en tu propia infraestructura significa que el audio nunca sale de tus servidores. Eso importa para grabaciones legales, médicas o sensibles de otro tipo. La contrapartida es que tú eres responsable de la seguridad de esa infraestructura. Una API propietaria gestionada externaliza la preocupación de privacidad de la transcripción, pero introduce sus propios acuerdos de procesamiento de datos que hay que revisar.
Fuentes
- Página de precios de Deepgram: https://deepgram.com/pricing
- Página de precios de AssemblyAI: https://www.assemblyai.com/pricing
- Precios de AWS Transcribe: https://aws.amazon.com/transcribe/pricing/
- Precios de Google Cloud STT: https://cloud.google.com/speech-to-text/pricing
- Precios de la API de OpenAI: https://openai.com/business/pricing/
- Introducción a Deepgram Nova-3: https://deepgram.com/learn/introducing-nova-3-speech-to-text-api
- faster-whisper en GitHub: https://github.com/SYSTRAN/faster-whisper
- Precios de GPU de RunPod: https://www.runpod.io/pricing
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How AI Transcription Works: The Product Pipeline Explained (2026)
From upload to exported transcript: a clear walkthrough of every stage in the AI transcription pipeline, including VAD, ASR, diarization, post-processing, and export.

Deepgram Nova-3 Pricing 2026: $0.0043/min Batch, $0.0077 Streaming
Deepgram Nova-3 costs $0.0043/min for batch and $0.0077/min for streaming in 2026. Honest accuracy vs Whisper, 50+ language coverage, keyterm prompting, and when Nova-3 beats cheaper alternatives like AssemblyAI.