Cómo convertir FLV a texto: transcribir archivos de la era Flash (2026)
transcripciónvídeoflv

Cómo convertir FLV a texto: transcribir archivos de la era Flash (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202614 min read

Summarize this article with:

TL;DR

Los archivos FLV de la era Flash (2003-2020) siguen teniendo valor real: seminarios web archivados, vídeos de formación, capturas de emisiones RTMP. El plugin de Flash ya no existe, pero el FLV como contenedor sigue siendo totalmente legible por ffmpeg, VLC y las herramientas de transcripción modernas. El códec de audio importa más que el contenedor: el MP3 y el AAC dentro de un FLV se transcriben con limpieza, mientras que los códecs de voz Nellymoser y Speex de las antiguas grabaciones con cámara web necesitan un paso adicional de conversión. Si tu herramienta rechaza el FLV, un comando de ffmpeg de una sola línea lo remultiplexa a MP4 sin tocar la calidad del audio.

Para obtener una transcripción de un archivo FLV, súbelo directamente a una herramienta que acepte el formato, o extrae primero el audio con ffmpeg si tu herramienta lo exige. La era de Flash terminó, pero los archivos sobreviven perfectamente en cualquier flujo de trabajo moderno.

Qué es el FLV y por qué los archivos guardados siguen importando

FLV (Flash Video) fue el formato de vídeo web desde aproximadamente 2003 hasta 2020. Impulsó YouTube antes del salto a HTML5, todas las primeras emisiones de Twitch, la mayoría de las plataformas de seminarios web antes de pasarse a MP4 y gran parte de los sistemas de formación corporativa que funcionaban sobre Adobe Flash.

Adobe puso fin al soporte de Flash Player a finales de 2020. Los navegadores lo eliminaron. La web siguió adelante.

Los archivos no. Todavía hay grandes colecciones de FLV guardadas en almacenamiento corporativo, capturadas desde:

  • Seminarios web anteriores a 2014 de WebEx, GoToMeeting y Microsoft LiveMeeting
  • Grabaciones de emisiones RTMP de Twitch y Periscope antes de cambiar de formato
  • Bibliotecas de cursos educativos creadas con Adobe Captivate y Articulate
  • Repositorios internos de formación que nunca se migraron a MP4
  • Grabaciones de servidores de emisión como Adobe Media Server y Wowza

Si has heredado uno de estos archivos, el camino hacia la transcripción es sencillo una vez que conoces la realidad de los códecs.

Qué hay realmente dentro de tu archivo FLV

El contenedor es la parte fácil. El códec interior es lo que determina tu flujo de trabajo.

El FLV transporta el vídeo en uno de estos tres formatos:

  • Sorenson Spark (basado en H.263): el códec original de Flash Video, habitual antes de 2005
  • VP6: se convirtió en el códec preferido con Flash Player 8 en septiembre de 2005
  • H.264: añadido en Flash Player 9 Update 3 (diciembre de 2007) y usado hasta el final de Flash

Para la transcripción, el códec de vídeo no importa en absoluto. Lo que importa es la pista de audio:

  • MP3 en FLV: el formato de audio más común en los archivos FLV, se transcribe de forma idéntica a un archivo MP3 independiente
  • AAC en FLV: usado en las versiones posteriores de Flash Player, se transcribe con limpieza a tasas de bits estándar
  • Nellymoser Asao: un códec de voz propietario de bajo ancho de banda integrado en Flash para la captura de micrófono, usado en grabaciones con cámara web y en VoIP temprana; se transcribe aceptablemente pero se degrada a tasas de bits más bajas
  • Speex: un códec de voz de código abierto añadido en Flash Player 10 para streaming, afinado para voz pero de bajo ancho de banda

Ejecuta ffprobe yourfile.flv para identificar exactamente qué códec de audio usa tu archivo antes de decidir el flujo de trabajo.

Paso a paso: convertir FLV a texto

Paso 1: Comprueba que el archivo se reproduce

Ábrelo en VLC. VLC lee todas las variantes de códecs FLV: Sorenson Spark, VP6, vídeo H.264 y todos los códecs de audio, incluidos Nellymoser y Speex. Si VLC lo reproduce con sonido, tienes un archivo utilizable.

Si VLC se niega con un error de reproducción (no un aviso de DRM), el archivo puede tener metadatos truncados procedentes de una captura RTMP interrumpida a mitad de emisión. Pasa al Paso 2 antes de transcribir.

Paso 2: Repara los metadatos si hace falta

Las grabaciones de emisiones RTMP suelen tener metadatos de duración ausentes o incorrectos. La solución es una sola pasada de ffmpeg que copia todos los flujos sin recodificar:

ffmpeg -i broken.flv -c copy -fflags +genpts fixed.flv

Esto reconstruye las marcas de tiempo del contenedor sin tocar los datos reales de audio o vídeo. Ejecútalo en cualquier FLV que informe de «could not determine duration» o que falle al buscar posiciones correctamente.

Paso 3: Sube o extrae el audio

Si tu herramienta acepta FLV directamente, súbelo tal cual. CATT acepta archivos FLV junto con MP4, MOV, MKV y otros formatos mediante la herramienta de vídeo a texto.

Si tu herramienta exige otro formato, extrae la pista de audio. Cuando el audio ya está en MP3 o AAC, la copia de flujo es más rápida y sin pérdidas:

ffmpeg -i video.flv -vn -c:a copy audio.mp3

Cuando el audio es Nellymoser o Speex, transcodifícalo a MP3:

ffmpeg -i video.flv -vn -c:a libmp3lame -b:a 192k audio.mp3

Si necesitas una salida completa en MP4 (para una herramienta que lo exija) y el FLV usa vídeo H.264, puedes copiar ambos flujos directamente:

ffmpeg -i video.flv -c copy output.mp4

Si el FLV usa vídeo Sorenson Spark o VP6, necesitas una recodificación completa, que es más lenta:

ffmpeg -i video.flv -c:v libx264 -c:a aac output.mp4

Interfaz de subida de la herramienta de vídeo a texto de CATT gestionando formatos de vídeo antiguos, incluido FLV
Interfaz de subida de la herramienta de vídeo a texto de CATT gestionando formatos de vídeo antiguos, incluido FLV

Paso 4: Configura el idioma

Especifica el idioma manualmente. El contenido FLV antiguo a veces tiene audio degradado que confunde a la detección automática de idioma. Para contenido que no esté en inglés, configura el idioma antes de procesar en lugar de corregir después.

Paso 5: Ejecuta la transcripción

Un FLV de 60 minutos tarda entre 3 y 6 minutos en procesarse en la mayoría de los servicios. La extracción de audio es casi instantánea; la transcripción es la fase más larga.

Paso 6: Revisa el resultado

El audio FLV antiguo tiene características que afectan a la precisión:

  • Audio de tasa de bits baja (de 32 a 96 kbps era lo típico en streaming)
  • Micrófonos de cámara web y audio de asistentes por línea telefónica
  • Artefactos por cortes de red en las capturas RTMP

Espera una precisión del 80 al 92 % en contenido antiguo de seminarios web con audio mezclado, y del 90 al 95 % en FLV grabados profesionalmente con un micrófono dedicado para el presentador.

Cuándo remultiplexar a MP4 ayuda de verdad (y cuándo no)

La pregunta surge constantemente con los archivos FLV: ¿convertir primero a MP4 o transcribir directamente?

La remultiplexación no mejora la precisión de la transcripción. El modelo de voz procesa el códec de audio, y la envoltura del contenedor se descarta antes del procesamiento. Una pista de audio Nellymoser en un FLV produce el mismo resultado que una pista Nellymoser en un MP4.

La remultiplexación sí ayuda en dos situaciones reales:

  1. Tu herramienta de transcripción rechaza el FLV directamente. Muchas herramientas de consumo solo aceptan MP4, MOV, MP3 y WAV. Si es tu caso, una remultiplexación con copia de flujo tarda segundos y no cuesta calidad.
  2. Quieres verificar que el archivo se reproduce antes de enviarlo. El MP4 se reproduce de forma más universal en reproductores multimedia y ventanas de vista previa del navegador si necesitas confirmar el contenido antes de subirlo.

Para un lote de cientos de archivos, sáltate por completo el paso de remultiplexación y trabaja con los originales. Lee más sobre flujos de trabajo específicos por formato en la guía para convertir vídeo a texto y en la entrada complementaria sobre archivos WMV, otro formato con preocupaciones similares de legado.

Escenarios comunes de FLV

Archivos antiguos de seminarios web

Las plataformas de 2004 a 2014 (WebEx, GoToMeeting, MS LiveMeeting, ON24) grababan en FLV. La calidad de audio varía drásticamente según la fuente:

  • Micrófono del presentador: normalmente limpio, se transcribe con una precisión del 90 al 95 %
  • Audio telefónico de los asistentes (PSTN): calidad telefónica de 8 kHz, se transcribe con una precisión del 75 al 85 %
  • Mezcla de presentador y asistentes: promedia ambos

En archivos grandes de seminarios web, comprueba si la plataforma grabó pistas de audio separadas para el presentador y los asistentes. Si fue así, extráelas por separado, transcribe cada una y luego combina los resultados.

Capturas de Twitch y de streaming

Twitch usaba RTMP antes de cambiar a HLS alrededor de 2017. Los archivos de emisiones de ese periodo están en FLV. La precisión varía según la configuración de audio del streamer.

El contenido de streaming suele tener música de fondo, audio del juego y efectos de sonido mezclados en la pista de voz. Los modelos de IA pueden alucinar texto durante las secciones musicales. Recorta a segmentos de solo voz antes de subirlo si la precisión importa.

Bibliotecas de cursos educativos

Adobe Captivate, Articulate Storyline y herramientas de autoría similares exportaban módulos basados en FLV de 2005 a 2015. La narración en off de estos cursos suele estar grabada en estudio con un micrófono dedicado. La precisión generalmente es del 95 % o superior.

Grabaciones de servidores RTMP

Adobe Media Server (antes Flash Media Server), Wowza y Red5 grababan las emisiones RTMP en FLV por defecto. Estas capturas a veces tienen:

  • Metadatos de duración ausentes o incorrectos (se reparan con -fflags +genpts como se mostró arriba)
  • Desfase de audio en grabaciones de más de una hora
  • Caídas de fotogramas o huecos de audio por interrupciones de red

Repara los metadatos antes de transcribir. El desfase de audio es más difícil de corregir en postproducción y afecta sobre todo a la alineación de marcas de tiempo más que a la precisión de la transcripción.

Archivos de marketing y corporativos

Las bibliotecas de vídeo de marketing anteriores a 2015 suelen existir tanto en su forma FLV original como en MP4 recodificado. Si tienes ambas, transcribe desde el FLV original. La recodificación a MP4 pasó por un paso de compresión con pérdida que el original no sufrió.

Qué vigilar

Grabaciones truncadas. Las capturas RTMP a veces se cortan a mitad de frase cuando la emisión se cayó o el servidor se detuvo. Reproduce hasta el final antes de dar por hecho que tienes el contenido completo. Una transcripción que termina abruptamente a mitad de idea es un síntoma, no un error de la transcripción.

Pistas de audio duales. Algunos FLV de seminarios web graban al presentador y a los asistentes en pistas de audio separadas. La mayoría de las herramientas de transcripción procesan solo la primera pista. Comprueba con ffprobe -show_streams si tu archivo tiene más de un flujo de audio y extrae el que necesites.

Puntos de referencia incrustados y datos de chat. Algunos archivos FLV de sistemas de seminarios web incrustan el chat de texto como puntos de referencia (cue points) de metadatos. No son audio; son metadatos del contenedor. La mayoría de las herramientas de transcripción los ignoran. Si una herramienta informa de errores de análisis, elimina primero los metadatos que no sean de audio:

ffmpeg -i in.flv -c copy -map 0:v -map 0:a clean.flv

Calidad de Nellymoser y Speex. Ambos son códecs de voz que operan a tasas de bits bajas. Se transcriben, pero la precisión cae en comparación con MP3 o AAC a calidad de contenido equivalente. Si tienes audio Nellymoser o Speex y la precisión es crítica, transcodifica primero a MP3 a 192k. La recodificación introduce cierta pérdida generacional, pero el resultado suele ser más reconocible para un modelo de voz que el flujo Nellymoser en bruto a 5,5 kHz.

Consejos prácticos para lotes de archivos FLV

Repara primero todos los archivos. Ejecuta una reparación de metadatos por lotes sobre todo el archivo antes de transcribir nada:

for f in *.flv; do ffmpeg -i "$f" -c copy -fflags +genpts "fixed_$f"; done

Esto reconstruye los metadatos del contenedor sin tocar el audio. Cualquier archivo con metadatos truncados o incorrectos queda bien formado antes de entrar en tu canalización de transcripción.

Procesa cronológicamente. Los archivos de la misma época y plataforma tienen patrones de calidad de audio similares. Calibra tus expectativas con un archivo representativo y luego aplica la misma configuración al resto.

Usa acceso por API para grandes volúmenes. Subir 500 horas de archivos uno a uno no es práctico. Los planes Developer y Business de CATT incluyen acceso por API con webhooks, lo que permite automatizar el procesamiento por lotes con scripts. Consulta los costos ocultos de los servicios de transcripción antes de elegir un plan para trabajo de gran volumen.

Sáltate el preprocesamiento de audio. El audio FLV antiguo ya está muy comprimido. Añadir reducción de ruido, ecualización o normalización sobre una fuente ya comprimida suele empeorar la precisión de la IA, no mejorarla. Sube el audio original y deja que el modelo se encargue.

Comprueba el DRM antes de empezar. El contenido comercial FLV de servicios desaparecidos de la era Flash a veces estaba protegido con DRM. VLC se negará con un error de «protected content». El contenido grabado por usuarios (seminarios web, formación, emisiones) casi nunca tiene DRM. Si te topas con DRM, no hay camino práctico hacia la transcripción.

Formato FLV frente a formatos modernos

FormatoÉpocaCódec de audio típicoTasa de bits habitualPrecisión de transcripción
FLV (MP3)2003-2014MP332-128 kbps88-95%
FLV (AAC)2009-2020AAC64-192 kbps92-97%
FLV (Nellymoser)2003-2011Nellymoser5-64 kbps80-90%
FLV (Speex)2008-2016Speex8-45 kbps82-92%
MP42008-presenteAAC96-256 kbps94-98%
WebM2013-presenteOpus64-192 kbps94-98%

El FLV que contiene vídeo H.264 y audio AAC se transcribe esencialmente igual que un MP4 con los mismos códecs. El contenedor exterior lo descarta la canalización de transcripción. Lo que cuenta es el audio de dentro.

Si solo necesitas una transcripción limpia de un archivo y quieres saltarte los pasos de ffmpeg, ConvertAudioToText acepta FLV directamente: sube, selecciona el idioma y el servicio gestiona la extracción automáticamente.

Preguntas frecuentes

¿Puedo transcribir archivos FLV en 2026 aunque Flash esté muerto?

Sí. El plugin de Flash para navegadores desapareció, pero el FLV como formato de archivo sigue estando totalmente soportado por ffmpeg, VLC y muchos servicios de transcripción. El contenedor se lee sin problemas; lo que importa es el códec de audio de dentro. El MP3 y el AAC en FLV se transcriben igual que cualquier archivo MP3 o AAC independiente.

¿Debería convertir el FLV a MP4 antes de transcribir?

Solo si tu herramienta de transcripción rechaza el FLV directamente. Para la calidad de audio, la conversión no ayuda: el códec de audio dentro del contenedor es lo que procesa realmente el modelo de voz, así que remultiplexar el contenedor no cambia nada en cuanto a precisión. Extraer solo el audio con ffmpeg es más rápido que una remultiplexación completa, y cualquiera de las dos opciones te lleva a la misma transcripción.

¿Cuándo necesita el FLV recodificarse antes de la transcripción?

El audio necesita recodificarse cuando el FLV contiene audio Nellymoser o Speex, porque esos códecs pueden sonar degradados a tasas de bits bajas y algunas herramientas los rechazan. Ejecuta ffprobe sobre el archivo primero para comprobarlo. Si la pista de audio ya está en MP3 o AAC, puedes extraerla con copia de flujo (-c:a copy) y saltarte la recodificación por completo, lo que conserva la calidad original.

¿Qué pasa si mi archivo FLV tiene DRM?

Prueba primero a reproducirlo en VLC. Si se niega con un error de contenido protegido, el archivo está bloqueado por DRM. Los archivos FLV grabados por usuarios (seminarios web, vídeos de formación, capturas de emisiones) rara vez tienen DRM. El contenido comercial FLV de servicios desaparecidos de la era Flash a veces sí lo tiene, y eliminarlo rara vez resulta práctico o legal una década después del cierre del servicio original.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles