
Cómo funciona la transcripción con IA: la cadena de procesamiento explicada (2026)
Summarize this article with:
Cuando subes un archivo de audio o vídeo a una herramienta de transcripción con IA, el servicio ejecuta seis etapas secuenciales antes de devolverte la transcripción: ingesta y preprocesamiento, detección de actividad de voz, codificación acústica y reconocimiento de voz, diarización, posprocesamiento y formateo de exportación. Cada etapa tiene sus propios modos de fallo y sus compromisos de velocidad. Entenderlas te ayuda a elegir la herramienta adecuada, diagnosticar resultados deficientes y grabar mejor audio desde el principio.
Cuando subes un archivo de audio y la transcripción vuelve unos minutos más tarde, entre esos dos momentos ocurren seis etapas distintas de una cadena de procesamiento. Este artículo recorre cada una en orden, desde que el archivo llega al servidor hasta que el archivo exportado y formateado aparece en tu carpeta de descargas. Entender la cadena te dice de dónde vienen los errores, por qué algunas herramientas son más rápidas y qué puedes hacer para mejorar los resultados sin cambiar de servicio.
Este es el artículo sobre la cadena de producto. Para la arquitectura neuronal técnica detrás de la etapa de ASR, consulta cómo funciona el reconocimiento de voz con IA. Para la evolución histórica de los sistemas basados en reglas al aprendizaje profundo, consulta cómo funciona el reconocimiento de voz.
Etapa 1: Ingesta y preprocesamiento
Lo primero que hace un servicio de transcripción es convertir tu archivo a un formato interno estándar. La mayoría de las cadenas reducen la frecuencia de muestreo a PCM mono de 16 kHz, porque eso es lo que esperan los modelos de voz subyacentes. Si tu archivo es un MP4 estéreo de 48 kHz procedente de una grabación de Zoom, el servicio elimina la pista de vídeo, mezcla o separa los canales de audio y remuestrea.
Los archivos de vídeo añaden un paso extra: la pista de audio se extrae con una herramienta como FFmpeg antes de que se ejecute la cadena de audio. Por eso un MP4 de 60 minutos tarda algo más que un MP3 de 60 minutos de la misma fuente.
En esta etapa también afloran los errores de formato. Una cabecera M4A corrupta, un archivo sin flujo de audio o un archivo cifrado subido por error como audio se detectan todos aquí. Un servicio bien construido valida la entrada y devuelve un error claro antes de seguir procesando o cobrarte por un trabajo fallido.
Etapa 2: Detección de actividad de voz
Antes de alimentar el audio al modelo de voz, la cadena identifica qué porciones contienen habla real y cuáles contienen silencio, ruido o música. Este paso se llama detección de actividad de voz (VAD).
El VAD actúa como portero: segmenta el audio en regiones de habla y no habla. Un enfoque sencillo basado en energía mide la amplitud del audio y marca las regiones de baja energía como silencio. Los sistemas neuronales modernos de VAD van más allá: usan modelos de aprendizaje automático entrenados con ruido del mundo real para distinguir el habla de sonidos de fondo con niveles de energía similares, como el ruido del teclado o el zumbido de la climatización.
Sin VAD, un modelo de voz intentaría transcribir el silencio y el ruido como palabras, produciendo texto alucinado en las pausas. Con él, el modelo solo recibe audio que probablemente contiene habla, lo que ahorra cómputo, acelera el procesamiento y reduce las inserciones de palabras espurias.
Para ver en profundidad cómo funcionan los modelos VAD a nivel de señal, este explicador sobre VAD cubre el detalle técnico.
Etapa 3: Codificación acústica y reconocimiento de voz
Esta es la etapa a la que la mayoría se refiere cuando dice "la IA". Tiene dos partes.
Primero, el audio se convierte en una representación de características que el modelo puede leer. Las redes neuronales no consumen muestras de audio en bruto. Consumen un espectrograma log-mel, que es un mapa bidimensional de cómo se distribuye la energía entre las bandas de frecuencia a lo largo del tiempo. Si has visto un visualizador de música con barras horizontales apiladas, estás viendo algo parecido a lo que ve el modelo. La escala mel comprime las bandas de alta frecuencia para adaptarse a la percepción auditiva humana, produciendo una entrada compacta que conserva la información acústica que distingue un fonema de otro.
Segundo, una red neuronal mapea esas características en tokens de texto. Tres familias de modelos dominan las cadenas de producción en 2026:
| Motor | Tipo | Fortaleza clave |
|---|---|---|
| OpenAI Whisper Large-v3 | Código abierto | Sólida cobertura multilingüe en 99 idiomas |
| Deepgram Nova-3 | SaaS cerrado | Latencia en lote inferior a 300 ms, WER un 54,2 % menor que el competidor más cercano según los propios benchmarks de Deepgram |
| AssemblyAI Universal-3.5 Pro | SaaS cerrado | Mayor precisión en audio pregrabado, prompting de términos clave en lenguaje natural |
Whisper Large-v3 en una GPU moderna alcanza un factor de tiempo real (RTF) de entre 0,072 y 0,15, lo que significa que procesa el audio entre 7 y 14 veces más rápido que en tiempo real según la GPU. El modo por lotes de Deepgram logra un rendimiento mucho mayor a escala. Whisper solo con CPU puede ser entre 20 y 30 veces más lento, y por eso las configuraciones autoalojadas en hardware modesto se sienten tan diferentes de las API en la nube.
Mi opinión: para la mayoría del audio empresarial, la elección del motor importa menos que la calidad del audio y la cobertura de vocabulario. Un archivo de reunión bien grabado se transcribirá con precisión en cualquiera de estos tres. Una llamada telefónica ruidosa grabada a través de un altavoz dará problemas en todos ellos.
Para la comparación completa de precisión y precios entre estas y otras API, consulta las mejores API de voz a texto en 2026 y precios de las API de voz a texto.

Etapa 4: Diarización (quién dijo qué)
Para grabaciones de un solo hablante, esta etapa se omite o resulta trivial. Para entrevistas, reuniones y podcasts, la diarización es lo que separa una transcripción legible de un muro de texto indiferenciado.
La diarización ejecuta un modelo aparte en paralelo con el reconocimiento. Escucha las características de la voz (tono, timbre, cadencia al hablar) y agrupa los segmentos de audio por hablante; luego adjunta etiquetas como "Hablante 1:" y "Hablante 2:" a cada intervención.
Los casos difíciles están bien documentados: habla superpuesta (dos personas hablando a la vez) y voces que suenan parecidas (dos hombres con el mismo acento y registro tonal). Los benchmarks de investigación que miden la tasa de error de diarización (DER) en los principales sistemas caen consistentemente en el rango del 10 al 20 % en audio conversacional de reuniones, siendo los conjuntos de datos con un 15 a 19 % de habla superpuesta la condición más difícil. En audio limpio de dos hablantes grabado cerca de cada micrófono, el rendimiento real es sustancialmente mejor.
Para una explicación técnica completa de cómo funciona el agrupamiento de la diarización, consulta diarización de hablantes explicada.
Etapa 5: Posprocesamiento
La salida bruta de un modelo de voz es un flujo de tokens en minúsculas, a menudo sin puntuación. "la reunión es a las cuatro pm deberíamos traer el portátil" es técnicamente una transcripción correcta, pero no sirve como documento.
El posprocesamiento transforma los tokens brutos en texto legible mediante varias capas:
- Normalización inversa de texto (ITN): convierte "cuatro pm" en "4 PM" y "veinte veintiséis" en "2026." Los sistemas modernos de ITN usan transductores de estados finitos o modelos neuronales entrenados con pares de formas hablada-escrita.
- Restauración de puntuación: inserta comas, puntos y signos de interrogación basándose en pausas, entonación y predicciones de modelos de lenguaje.
- Mayúsculas: gestiona los inicios de oración, los nombres propios y las siglas.
- Eliminación de muletillas (opcional): suprime "eh," "em," y los falsos arranques para la salida en modo limpio.
Aquí es donde se aplica la distinción entre transcripción literal y limpia. Si necesitas la forma hablada exacta para investigación, uso legal o médico, elige la literal. El modo limpio es mejor para legibilidad cuando las disfluencias exactas no importan. Consulta precisión de la transcripción explicada para saber más sobre cómo afecta cada capa al texto final.
Etapa 6: Exportación y formato
La etapa final convierte los datos estructurados de la transcripción (texto más marcas de tiempo más etiquetas de hablante) en el formato que necesita tu flujo de trabajo.
Formatos de exportación habituales:
- TXT: texto plano, sin marcas de tiempo. El más rápido de revisar, el más fácil de pegar en documentos.
- SRT: formato SubRip con bloques numerados y marcas de tiempo. El estándar para YouTube, Facebook, LinkedIn, Premiere Pro y DaVinci Resolve.
- VTT: Web Video Text Tracks, un superconjunto de SRT usado de forma nativa por los reproductores de vídeo HTML5 y muchas plataformas en línea.
- DOCX o PDF: documentos de procesador de texto con etiquetas de hablante y códigos de tiempo en los márgenes.
- JSON: datos estructurados con marcas de tiempo a nivel de palabra, puntuaciones de confianza e identificadores de hablante, útil para desarrolladores que construyen aplicaciones posteriores.
El formato que eliges viene determinado por lo que harás después con la transcripción, no por la precisión. Los archivos SRT y VTT son los formatos que debes pedir si vas a añadir subtítulos a un vídeo. JSON es el formato que debes pedir si vas a enviar la salida a otro sistema. El TXT plano sirve para todo lo que se quede en lectura humana.
Si necesitas una transcripción limpia sin que un bot de reunión se una a tu llamada, la herramienta de audio de ConvertAudioToText toma cualquier archivo que subas y ejecuta esta cadena completa sin requerir integración con el calendario.
Qué determina la velocidad
Tres variables fijan el tiempo total de entrega:
- Rendimiento del modelo. Deepgram Nova-3 en modo por lotes alcanza factores de tiempo real muy altos a escala, manteniendo la latencia por debajo de 300 ms en streaming. Whisper Large-v3 en GPU funciona a unos 0,1 a 0,15 RTF por lotes. Las configuraciones solo con CPU están en otra categoría completamente distinta.
- Disponibilidad de GPU. Las API SaaS escalan horizontalmente. Whisper autoalojado queda limitado por la cola de tu GPU.
- Paralelismo de etapas. Las cadenas bien construidas ejecutan la diarización en paralelo con el reconocimiento en lugar de hacerlo secuencialmente. Las mal diseñadas las ejecutan en serie y pagan la penalización dos veces.
Modos de fallo frecuentes
La transcripción con IA es precisa en la mayoría del audio empresarial, pero falla de forma predecible en condiciones específicas:
- Nombres propios y nombres de marca. "Coolify" se convierte en "Cool if I". La solución es una lista de vocabulario personalizado suministrada a nivel de API, o una pasada de buscar y reemplazar después.
- Homófonos. "Hecho" frente a "echo". Los modelos usan el contexto para elegir, y el contexto a veces engaña.
- Cambio de código. Los hablantes que cambian de idioma a mitad de frase confunden a los modelos entrenados con datos de un solo idioma.
- Habla susurrada o gritada. Ambas quedan fuera de la distribución acústica con la que se entrenó el modelo.
- Números en contextos ambiguos. "Dos mil veinte" puede ser el año 2020 o una cantidad cualquiera. La normalización inversa de texto maneja los patrones comunes pero pasa por alto combinaciones inusuales.
Una pasada de corrección de cinco minutos con el audio reproduciéndose junto a la transcripción basta para detectar el 1 al 3 % que un modelo suele equivocarse en audio empresarial limpio.
FAQ
¿Cuánto tarda la transcripción con IA en un archivo de una hora?
Depende del motor y de la infraestructura. Deepgram Nova-3 en modo por lotes puede procesar audio a cientos de veces la velocidad en tiempo real, así que un archivo de 60 minutos puede terminar en menos de un minuto. Whisper Large-v3 en una GPU moderna funciona a alrededor de 0,1 a 0,15 veces el factor de tiempo real, lo que sitúa un archivo de 60 minutos en 6 a 9 minutos. Las configuraciones solo con CPU son mucho más lentas. En la mayoría de las herramientas SaaS con infraestructura GPU adecuada, un archivo de una hora se devuelve en 2 a 8 minutos, diarización incluida.
¿Cuál es la diferencia entre una transcripción limpia y una transcripción literal?
Una transcripción literal incluye cada muletilla (eh, em, o sea), cada falso arranque y cada palabra repetida exactamente como se pronunciaron. Una transcripción limpia elimina eso y puede reformatear ligeramente el discurso encadenado en frases legibles. La etapa de posprocesamiento de la IA decide qué versión recibes. La mayoría de las herramientas ofrecen un interruptor; para casos de uso legales, médicos o de investigación donde el lenguaje hablado exacto importa, elige siempre la literal.
¿Por qué la transcripción con IA se equivoca con nombres y nombres de marca?
Los modelos de voz se entrenan con grandes corpus generales y nunca han encontrado tu nombre de marca concreto, el nombre de tu colega ni el término de tu producto. La secuencia acústica de "Coolify" suena como "Cool if I" para un modelo sin contexto previo. Las soluciones incluyen listas de vocabulario personalizado (soportadas por Deepgram Nova y AssemblyAI Universal-3), que suministras a nivel de API, o una pasada manual de buscar y reemplazar cuando llega la transcripción.
¿Qué precisión tiene la diarización de hablantes?
En audio limpio de un solo micrófono con dos voces claramente distinguibles, los modelos modernos de diarización identifican correctamente a los hablantes la mayor parte del tiempo. En audio real de reuniones con habla superpuesta, voces que suenan parecidas o audio de calidad telefónica, las tasas de error de diarización (DER) medidas en los principales sistemas académicos y comerciales caen consistentemente en el rango del 10 al 20 %. Los principales modos de fallo son el habla superpuesta y las voces con tono y acento similares.
¿Puedo mejorar la precisión de la transcripción con IA sin cambiar de herramienta?
Sí. La palanca más grande es la calidad del audio: un micrófono USB a 15 cm del hablante supera a cualquier micrófono de portátil a través de una sala de conferencias. Más allá del hardware, colocar el micrófono más cerca, una sala silenciosa y pistas de grabación individuales para cada participante en una reunión reducen todas el nivel de ruido contra el que tiene que trabajar el modelo. A nivel de API, suministrar una lista de vocabulario personalizado para términos específicos del dominio (médico, legal, técnico) reduce de forma medible los errores en nombres propios.
Fuentes
- Benchmarks y latencia de Deepgram Nova-3
- Entender la latencia en las API de voz a texto
- Página de producto de AssemblyAI Universal-3.5 Pro
- Lanzamientos de AssemblyAI de octubre de 2025: streaming multilingüe y mejoras de diarización
- Estado de la diarización de hablantes 2026: benchmark pyannote vs Falcon
- AssemblyAI: mejorar la legibilidad de las transcripciones con puntuación, mayúsculas e ITN
- Guía y configuración de Silero VAD
- Formatos de transcripción explicados: SRT, VTT, TXT, DOCX
- Benchmark de Whisper Large-v3: análisis de velocidad y precisión
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Open Source vs Proprietary Transcription Models 2026
Honest tradeoffs between Whisper open-source and Deepgram, AssemblyAI, and other proprietary APIs. Verified costs, accuracy ranges, and when each actually makes sense.

Deepgram Nova-3 Pricing 2026: $0.0043/min Batch, $0.0077 Streaming
Deepgram Nova-3 costs $0.0043/min for batch and $0.0077/min for streaming in 2026. Honest accuracy vs Whisper, 50+ language coverage, keyterm prompting, and when Nova-3 beats cheaper alternatives like AssemblyAI.