IA multimodal y transcripción: qué cambia realmente
multimodaliatranscripciónvideo

IA multimodal y transcripción: qué cambia realmente

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

Qué cambia con la multimodalidad

Durante las tres primeras décadas de la transcripción comercial, todos los sistemas funcionaban sobre un único canal: entra audio, sale texto. Incluso cuando la fuente era un video, el modelo procesaba únicamente la pista de audio. Las etiquetas de hablante, el texto en pantalla, los rótulos con nombres, las diapositivas… todo ese contexto visual que una persona viendo el video usaría de forma natural se descartaba antes de que el modelo siquiera viera la entrada.

Esa arquitectura cambió a medida que maduraron los grandes modelos multimodales. Gemini 2.5 Pro acepta archivos de video de forma nativa, muestreando fotogramas junto con el audio en una sola llamada a la API. GPT-4o puede procesar fotogramas de imagen extraídos del video en paralelo con el audio, lo que le aporta contexto visual durante la transcripción. Ninguno de los dos es simplemente un modelo de transcripción al que se le adjunta una captura de pantalla. Los flujos visual y de audio se informan mutuamente durante la decodificación.

Para la transcripción en concreto, esto desbloquea tres cosas con las que los sistemas solo de audio llevaban décadas batallando.

Mejor identificación de hablantes

La diarización solo de audio separa el habla según características de la voz. Funciona razonablemente bien con dos voces claramente distintas, pero se degrada cuando los hablantes comparten un tono similar, cuando una persona domina la conversación o cuando dos personas hablan a la vez. Un modelo multimodal que observa una videollamada puede ver quién está en cámara, leer las etiquetas de nombre en la vista de galería de la llamada y correlacionar el movimiento visible de los labios con el flujo de audio.

La investigación publicada en el MISP 2025 Challenge, que evaluó específicamente la diarización audiovisual sobre grabaciones de reuniones, muestra el techo real aquí. El mejor sistema audiovisual de ese desafío logró una Tasa de Error de Diarización (DER) de 8,09%. Es una mejora significativa frente a las líneas base solo de audio, pero no es cero. En videollamadas donde todos los participantes están en pantalla y etiquetados, los sistemas de producción rinden mejor. En cualquier segmento donde un hablante esté fuera de cámara, la ventaja visual desaparece por completo.

Algo que conviene decir con honestidad: la narrativa popular de la «lectura labial con IA» exagera lo que estos modelos hacen realmente. No ejecutan un módulo dedicado de lectura labial que decodifique fonemas a partir de las formas de la boca. Muestrean fotogramas a razón de 1 fotograma por segundo y usan ese contexto visual junto con el audio durante la generación. El beneficio es real, pero se parece más a «contexto visual para desempatar» que a «leer los labios en lugar de los oídos».

Nombres propios precisos gracias al texto en pantalla

Cuando alguien dice «estamos usando LangGraph» en un video, un modelo solo de audio tiene que elegir entre varias transcripciones plausibles. Un modelo multimodal que puede ver el logo de un producto en la pantalla del ponente o leer una diapositiva que presenta el término puede anclar esa elección correctamente.

Es una de las quejas más persistentes sobre la precisión de la transcripción: nombres propios, nombres de productos y jerga técnica transcritos como homófonos de palabras comunes. La capa visual ayuda cuando la fuente es un video y el término relevante aparece en pantalla. No ayuda en grabaciones solo de audio.

Contexto a partir de diapositivas y contenido en pantalla

Una transcripción de clase que dice «veamos esta ecuación» es menos útil que una que incluye la ecuación. Gemini 2.5 Pro, trabajando a partir de fotogramas de video, puede extraer texto de diapositivas, código de grabaciones de pantalla y títulos de pizarras. La transcripción resultante se lee más como un documento que como un registro estenográfico.

Esto importa sobre todo para el contenido técnico y educativo: charlas de ingeniería, demos de producto, videos de formación, clases universitarias. Para esos formatos, la multimodalidad produce resultados cualitativamente distintos al procesamiento solo de audio.

Transcripción de video con Gemini y GPT-4o mediante la herramienta de video a texto de ConvertAudioToText
Transcripción de video con Gemini y GPT-4o mediante la herramienta de video a texto de ConvertAudioToText

Herramientas que ya lo usan hoy

La capacidad multimodal existe a nivel de API. Que un producto orientado al usuario la exponga depende de cada herramienta.

Gemini 2.5 Pro (Google AI / Vertex AI). Acepta archivos de video de forma nativa mediante la File API. Los videos se muestrean a 1 fotograma por segundo por defecto, con audio a 1 Kbps. Puedes subir una grabación larga de una reunión y solicitar una transcripción con etiquetas de hablante, extracción del contenido de las diapositivas y marcas de tiempo en una sola llamada. Gemini procesa el video a aproximadamente 300 tokens por segundo de metraje. Para un video de una hora eso equivale a unos 1,08 millones de tokens de entrada, lo que cae en el tramo de precios de más de 200K, a $2,50 por millón de tokens para Gemini 2.5 Pro, de modo que solo la entrada ronda los $2,70 por esa hora, antes de los tokens de salida.

GPT-4o (OpenAI). No acepta archivos de video directamente para transcribir. El modelo dedicado gpt-4o-transcribe es solo de audio, con un precio de $0,006 por minuto ($0,36/hora). Para transcripción consciente del video con GPT-4o, el camino práctico es extraer tú mismo los fotogramas del video y enviarlos como entradas de imagen junto con el audio, lo que requiere un pipeline de varios pasos por tu parte. El soporte nativo de video de Gemini es más sencillo para este caso de uso.

APIs especializadas de transcripción. A mediados de 2026, las principales APIs dedicadas de voz a texto (Deepgram, AssemblyAI) siguen siendo solo de audio. No aceptan entrada de video ni usan contexto visual durante la transcripción. Su ventaja es el costo y la latencia: el audio pregrabado de Deepgram Nova-3 cuesta unos $0,0043 por minuto ($0,26/hora), aproximadamente una décima parte del costo del procesamiento multimodal.

La brecha es real. Para la mayoría de los casos de uso, lo solo de audio sigue siendo el valor predeterminado práctico.

Dónde la multimodalidad todavía se queda corta

A pesar de las ganancias, la transcripción multimodal tiene modos de fallo claros.

Hablantes fuera de cámara. Si un hablante no es visible en el encuadre, la ventaja visual se evapora. Preguntas del público en una conferencia, un presentador narrando sobre b-roll, un entrevistador fuera de cámara: en todos estos casos, el modelo vuelve al comportamiento solo de audio. Como el video real suele tener segmentos así, las mejoras reales de precisión son menores de lo que sugieren las cifras de los benchmarks.

Video comprimido o con poca luz. Las señales visuales solo ayudan si el modelo puede leerlas. El video muy comprimido, las capturas de pantalla con baja tasa de fotogramas y las grabaciones con poca luz degradan la entrada visual. Con un muestreo de 1 fotograma por segundo, el movimiento rápido también reduce la utilidad del flujo visual.

Costo en formato largo. La diferencia de costo entre el procesamiento de video multimodal y la transcripción solo de audio ronda las 10 veces para una hora de contenido. Es la herramienta adecuada para una reunión trimestral de toda la empresa de alto valor; no es el valor predeterminado adecuado para cien grabaciones rutinarias de llamadas uno a uno.

Límites de ventana de contexto en videos muy largos. La ventana de contexto de 1 millón de tokens de Gemini 2.5 Pro maneja aproximadamente 55 minutos de video a resolución predeterminada antes de alcanzar los límites. Para una grabación de varias horas, hay que dividir el video en fragmentos, lo que añade complejidad y puede partir la intervención de un hablante a mitad de frase.

Diapositivas en otro idioma o en idiomas mezclados. Si el ponente habla en un idioma pero las diapositivas están en otro, el modelo tiene que gestionar ambos simultáneamente. El inglés, el español y los principales idiomas europeos funcionan bien para la extracción de texto. Los idiomas minoritarios producen resultados menos consistentes.

Un flujo de trabajo práctico que funciona hoy

Mi opinión: para la mayoría de los usos en producción, la transcripción solo de audio sigue siendo la mejor opción por defecto, con la multimodalidad como pase de corrección dirigido.

Un flujo de trabajo que produce resultados sólidos sin pagar el procesamiento multimodal completo:

  1. Extrae la pista de audio y genera una transcripción rápida solo de audio usando Deepgram Nova-3 u OpenAI Whisper.
  2. Revisa la transcripción en busca de segmentos dudosos: nombres propios que parezcan incorrectos, etiquetas de hablante que no encajen, jerga destrozada.
  3. Ejecuta un pase multimodal dirigido con Gemini 2.5 Pro sobre los segmentos específicos que necesiten desambiguación, aportando los fotogramas de video correspondientes.
  4. Fusiona las correcciones multimodales en la transcripción de audio.

Esto cuesta una fracción del procesamiento multimodal completo y normalmente produce un resultado comparable o mejor, porque el modelo de audio dedicado es más fiable en los tramos largos sin ambigüedad.

Para un único video de alto valor donde la precisión importa de principio a fin (una conferencia magistral, la grabación de un lanzamiento de producto, una presentación ante el consejo), un pase multimodal completo justifica el recargo. Para la transcripción de podcasts o las grabaciones de llamadas donde los participantes rara vez están en cámara, lo solo de audio gana tanto en costo como en precisión.

Si necesitas transcripciones limpias y rápidas sin gestionar nada de este pipeline, la herramienta de video a texto de ConvertAudioToText se encarga de la extracción de audio y la transcripción en un solo paso.

Qué observar durante los próximos 18 meses

Compresión de costos. El procesamiento de video multimodal está en la misma curva de caída de costos que los LLM solo de texto. Cuando el costo de entrada de un video de una hora baje de $0,50, el cálculo del flujo de trabajo cambia y la multimodalidad pasa a ser un valor predeterminado razonable en lugar de una opción premium.

Mejor muestreo de fotogramas. El valor predeterminado actual de 1 fotograma por segundo es un compromiso entre costo y precisión. Tasas de muestreo más altas capturan más contexto visual (especialmente el movimiento de los labios y las diapositivas que cambian rápido), pero multiplican el costo en tokens. Cabrá esperar un muestreo adaptativo que concentre los tokens en los segmentos de mucho movimiento o mucha información.

Multimodalidad en el dispositivo. Apple incluye transcripción en el dispositivo en iOS 18 para Notas de Voz y Notas. Los modelos tienen unos 3.000 millones de parámetros optimizados para el silicio de Apple. La transcripción multimodal completa en el dispositivo (donde el modelo procesa simultáneamente audio y fotogramas de video sin llamar a un servidor) aún no está disponible con calidad de producción, pero las piezas arquitectónicas ya están colocadas. Para la trayectoria más amplia, consulta el futuro de la transcripción con IA.

Para la diarización de hablantes en concreto, los resultados de investigación del MISP 2025 sugieren que las mejores ganancias a corto plazo vendrán de combinar modelos dedicados de diarización de audio con contexto multimodal, en lugar de sustituir los primeros por lo segundo.

Preguntas frecuentes

¿Puede un modelo multimodal leer los labios para mejorar la transcripción?

Parcialmente, y con matices importantes. Los modelos de investigación como los evaluados en el MISP 2025 Challenge utilizan codificadores visuales de la región labial y lograron una tasa de error de diarización (DER) mínima de 8,09% en tareas audiovisuales, una mejora frente a las líneas base solo de audio. Pero los modelos multimodales de producción como Gemini 2.5 Pro y GPT-4o utilizan fotogramas de video muestreados (típicamente 1 fotograma por segundo), no módulos dedicados de lectura labial. Correlacionan el movimiento de los labios con el contexto de audio en lugar de decodificar fonemas directamente desde los labios. El beneficio práctico se nota sobre todo en la identificación y desambiguación de hablantes, no en recuperar palabras que el audio omitió por completo.

¿Cuánto cuesta la transcripción de video multimodal en comparación con la solo de audio?

La diferencia es considerable. El audio pregrabado de Deepgram Nova-3 cuesta unos $0,0043 por minuto ($0,26 por hora). GPT-4o-transcribe, que es solo de audio, cuesta $0,006 por minuto ($0,36 por hora). Gemini 2.5 Pro procesa video a aproximadamente 300 tokens por segundo, lo que para un video de una hora supone unos 1,08 millones de tokens de entrada, con un precio de $2,50 por millón de tokens para prompts grandes. Eso deja el costo solo de entrada para procesar una hora de video multimodal en torno a $2,70, aproximadamente diez veces la tarifa solo de audio, antes de contar los tokens de salida. El recargo es real y la sección de flujo de trabajo de arriba explica cuándo vale la pena pagarlo.

¿Procesa GPT-4o video de forma nativa para transcribir?

No de la misma manera que Gemini. El modelo dedicado gpt-4o-transcribe es solo de audio y cuesta $0,006 por minuto. Para usar GPT-4o en transcripción consciente del video debes enviar fotogramas extraídos como entradas de imagen junto con el audio, lo que requiere un pipeline de varios pasos por tu parte. Gemini 2.5 Pro acepta archivos de video de forma nativa mediante la File API, muestreando a 1 fotograma por segundo por defecto, lo que simplifica el flujo de trabajo para casos de uso con mucho video.

¿Qué tipos de contenido de video se benefician más de la transcripción multimodal?

El video estructurado donde la información visual es aditiva: grabaciones de clases con diapositivas, demos de producto con texto en pantalla, paneles de conferencias donde las credenciales o las etiquetas en pantalla identifican a los ponentes, y grabaciones de pantalla de flujos de trabajo técnicos. Las ganancias son menores para el contenido centrado en el audio, como entrevistas de podcast, grabaciones de llamadas telefónicas o cualquier escenario donde los hablantes están fuera de cámara. Para esos casos, un motor de transcripción estándar solo de audio es más rápido y económico, con una precisión comparable.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles