
Modelado de temas a partir de audio: LDA, BERTopic y clustering con LLM (2026)
Summarize this article with:
De horas de audio a un mapa de temas
El modelado de temas sobre audio implica dos pasos: transcribir las grabaciones a texto y luego ejecutar un algoritmo de modelado sobre el corpus resultante. El algoritmo encuentra clusters de contenido relacionado entre todos los documentos para que puedas producir una lista de temas defendible en horas en lugar de semanas. Esta publicación cubre los tres enfoques que vale la pena conocer en 2026, cuándo usar cada uno y un flujo de trabajo práctico que lleva un montón de grabaciones hasta una taxonomía de temas limpia.
La escala del problema suele motivar la inversión. Leer palabra por palabra 30 horas de transcripciones de entrevistas toma una semana. Elegir tres transcripciones al azar es sesgado e insistemático. El modelado de temas aplicado a un corpus completo es la herramienta que hace viable el análisis cualitativo a escala para un investigador individual o un equipo pequeño.
Por qué la calidad de la transcripción marca el techo
El modelado de temas trata cada palabra como una señal, por lo que los errores de transcripción se propagan a tus temas. Si «Kubernetes» se transcribe como «couvernettes» en decenas de entrevistas, el algoritmo ve una palabra nueva y puede producir un cluster espurio para ella. El problema se acumula: un corpus de 30 horas puede contener 400.000 palabras, e incluso una tasa de error del 5% inyecta 20.000 tokens corruptos en la señal.
Para la mayoría del audio en inglés, basta un modelo orientado a una precisión de palabras del 95-98%. La terminología específica de dominio en entrevistas médicas, legales o técnicas se beneficia del ajuste de vocabulario antes de la transcripción, porque los términos técnicos fallan más a menudo que las palabras comunes.
La diarización de hablantes es opcional pero a menudo merece la pena. En entrevistas de investigación estructuradas, el entrevistador hace preguntas similares en todas las sesiones. Esas preguntas repetidas forman su propio cluster de temas, que es ruido estructural y no contenido de los participantes. La diarización te permite filtrar solo los turnos de los participantes antes del modelado, lo que afina los temas que extraes. Consulta diarización de hablantes explicada para saber cómo funciona esta tecnología.
Si necesitas transcribir un corpus de entrevistas grabadas, la herramienta de entrevistas de ConvertAudioToText procesa audio por lotes sin requerir configuración de cuenta para pruebas rápidas.

Los tres enfoques, comparados con honestidad
Tres métodos dominan el uso en producción. Se diferencian en lo que te exigen, en lo que producen y en lo que cuestan.
LDA (Latent Dirichlet Allocation)
El método clásico, desarrollado en 2003 y todavía muy usado. Cada documento se modela como una mezcla de temas, y cada tema como una distribución de probabilidad sobre palabras. La salida es un número fijo de temas, cada uno representado como una lista ordenada de palabras.
Fortalezas: Rápido, bien comprendido, salida interpretable. Sus modos de fallo están documentados tras dos décadas de uso. Las herramientas de Python (gensim, scikit-learn) son maduras y estables. Corre en CPU sin requisitos de GPU.
Debilidades: Requiere preprocesamiento: tokenización, eliminación de stopwords, lematización. Los temas emergen como listas de palabras, no como conceptos etiquetados, así que una persona todavía tiene que escribir las etiquetas. Le cuesta con documentos cortos y corpus pequeños donde no hay suficientes coocurrencias de palabras para estimar distribuciones de forma fiable.
Cuándo usarlo: Corpus grandes de 500 o más documentos, análisis exploratorio donde quieras una primera pasada rápida, pipelines ya construidos alrededor de herramientas de PLN en Python.
BERTopic
BERTopic incrusta los documentos usando codificadores de frases tipo transformer, reduce la dimensionalidad, agrupa por similitud semántica (normalmente con HDBSCAN) y luego extrae palabras representativas por cluster usando c-TF-IDF. El resultado son temas definidos por el significado y no por la frecuencia de palabras.
La biblioteca se mantiene activamente, con adiciones recientes que incluyen modelado de temas zero-shot, fusión de modelos y etiquetado de temas basado en LLM como paso de posprocesamiento. Soporta más de 50 idiomas de fábrica.
Fortalezas: Mejor coherencia semántica que LDA, especialmente en corpus específicos de dominio o de texto corto. El número de clusters lo determinan los datos, no se fija de antemano. Una pasada opcional de LLM puede etiquetar los clusters con nombres legibles para humanos.
Debilidades: Más lento que LDA. Más componentes que configurar (modelo de embeddings, reductor de dimensionalidad, clusterizador). La sensibilidad a las elecciones de hiperparámetros significa que los resultados pueden variar entre ejecuciones. La investigación que compara puntuaciones de coherencia entre BERTopic y LDA muestra resultados mixtos según el corpus: BERTopic gana en interpretabilidad semántica para la mayoría de los corpus de marketing y entrevistas, mientras que LDA puede superar en métricas de coherencia para texto de dominio con vocabulario estrecho.
Cuándo usarlo: Corpus de 100 a 10.000 documentos, investigación donde la coherencia semántica importa más que la pureza estadística, situaciones en las que tienes una GPU o puedes tolerar tiempos de ejecución más largos en CPU.
Clustering basado en LLM
Un enfoque que se volvió práctico entre 2024 y 2026: el LLM hace el clustering directamente mediante prompting. Cada transcripción se resume en temas clave, los resúmenes se pasan al LLM con un prompt que solicita una taxonomía, y el LLM devuelve clusters etiquetados con citas de ejemplo.
Fortalezas: La mayor coherencia semántica. Los temas llegan con etiquetas legibles para humanos y pasajes de ejemplo. No hay pipeline de preprocesamiento que construir.
Debilidades: El costo escala con el volumen de tokens. Cada hora de audio produce aproximadamente 7.000-10.000 palabras de transcripción; resumir y agrupar un corpus de 30 entrevistas mediante una API fronteriza queda en el rango de unos pocos dólares según el nivel del modelo y el diseño del prompt. La estructura de temas puede variar entre ejecuciones a un ritmo que los métodos estadísticos no, porque el LLM es generativo y no determinista.
Cuándo usarlo: Corpus pequeños o medianos de 10 a 150 documentos, cuando la audiencia del análisis necesita resultados legibles sin un paso de etiquetado, cuando hay presupuesto de cómputo disponible.
De un vistazo
| LDA | BERTopic | Clustering con LLM | |
|---|---|---|---|
| Mínimo de corpus | 50-100 documentos | 50 documentos | 5-10 documentos |
| Preprocesamiento requerido | Sí (tokenizar, lematizar) | Mínimo | Ninguno |
| Número de temas | Fijado por ti | Según los datos | Lo especificas en el prompt |
| Coherencia semántica | Media | Alta | La más alta |
| Etiquetas listas para usar | No | Parcial (con complemento LLM) | Sí |
| Estabilidad entre ejecuciones | Alta | Media | Menor |
| GPU necesaria | No | Opcional | No (basado en API) |
| Costo por 100 documentos | Casi cero | Casi cero + electricidad | De centavos a pocos dólares |
Preparar tus transcripciones para cada método
Los pasos de preparación difieren lo suficiente como para tenerlos en cuenta.
Para LDA:
- Tokeniza cada transcripción en palabras.
- Elimina las stopwords («the», «is», «and» y ruido similar).
- Lematiza para que las formas flexionadas colapsen a una raíz («running», «ran», «runs» se convierten todas en «run»).
- Construye una matriz documento-término.
- Elige un número de temas, normalmente entre 5 y 20, y evalúa la coherencia en varios valores en lugar de adivinar una sola vez.
Para BERTopic:
- Divide las transcripciones en frases o párrafos cortos, no en documentos completos, para que cada unidad tenga un significado enfocado.
- Pásalas por un sentence transformer para obtener los embeddings (el modelo
all-MiniLM-L6-v2es un punto de partida habitual). - Deja que el pipeline predeterminado de BERTopic gestione la reducción de dimensionalidad y el clustering.
- Revisa las asignaciones de clusters y fusiona los que sean claramente variantes del mismo tema.
Para el clustering con LLM:
- Resume cada transcripción en 5 a 10 puntos clave o temas usando un prompt estructurado (consulta la entrada salida estructurada vs prosa de resumen para ver patrones de prompt que producen un formato consistente).
- Pasa todos los resúmenes al LLM con un prompt que le pida agruparlos en N temas y etiquetar cada uno.
- Para cada tema, ejecuta un prompt de seguimiento pidiendo de tres a cinco citas textuales representativas de las transcripciones originales.
Etiquetar y validar la salida
Ningún método produce resultados listos para publicar. El modelo encuentra los clusters; tú los etiquetas y los validas.
Con LDA, la salida se ve así:
Topic 1: pricing, plan, expensive, value, cost, charge, monthly
Topic 2: integration, slack, zapier, api, automate, workflow
Topic 3: support, help, response, ticket, slow, never
Las etiquetas se pueden inferir aquí (preocupaciones de precios, casos de uso de integraciones, frustración con el soporte), pero requieren una frase humana por tema. Para 10 temas en 30 entrevistas, el paso de etiquetado toma de 15 a 30 minutos.
BERTopic produce listas de palabras similares, a menudo más coherentes semánticamente. El clustering con LLM produce etiquetas borrador directamente, que normalmente solo necesitan una edición ligera en lugar de escribirse desde cero.
El paso de validación suele quedar infradimensionado. Un tema con 200 documentos de apoyo puede resultar ser 180 documentos sobre una cosa y 20 documentos sobre algo distinto que el modelo confundió. Revisar al azar los 5 documentos principales por tema detecta la mayoría de estas confusiones antes de que los temas entren en un informe.
Casos de uso: archivos y corpus de investigación
El caso de uso de entrevistas de investigación acapara la mayor parte de la atención en los artículos sobre modelado de temas, pero las colecciones de audio archivísticas e históricas son donde el caso de escala resulta más convincente.
Los proyectos de historia oral, los archivos de emisiones de radio y las bibliotecas de grupos focales grabados suelen contener de cientos a miles de horas de audio acumuladas durante años. El análisis temático manual de un archivo de ese tamaño es esencialmente imposible para un equipo pequeño. Un pipeline de modelado de temas cambia la pregunta de «qué grabaciones analizamos» a «qué dice toda la colección», lo cual es un instrumento de investigación distinto y más potente.
Para el trabajo con archivos, algunas notas prácticas:
La calidad del audio varía más que en entrevistas controladas. Las grabaciones antiguas, las grabaciones de campo y las entrevistas telefónicas pueden contener ruido significativo que degrada la precisión de la transcripción y, aguas abajo, la calidad de los temas. Revisar una muestra de 10-20 transcripciones antes de comprometerse con el pipeline completo detecta temprano los problemas de calidad de audio.
LDA a gran escala maneja corpus muy grandes de manera eficiente. Ejecutar BERTopic sobre 5.000 documentos con la configuración predeterminada es factible pero lento en CPU. La variante MEGA-scale de la biblioteca admite procesamiento multi-GPU para colecciones donde eso importa.
La comparación entre colecciones es un caso de uso que LDA y BERTopic manejan bien. Si tienes dos corpus recopilados en momentos distintos o bajo condiciones diferentes, puedes entrenar un modelo con uno e inferir distribuciones de temas en el otro, lo que te da una forma de seguir cómo cambiaron los temas. La entrada análisis de sentimiento a partir de transcripciones cubre un enfoque complementario para seguir la valencia junto con los temas.
Un flujo de trabajo práctico: de 30 entrevistas a un informe de temas
Esta es una secuencia concreta para un proyecto de investigación cualitativa de tamaño medio:
- Fase de grabación. 30 horas de audio entre todas las entrevistas.
- Transcripción. Sube todas las grabaciones. El procesamiento paralelo gestiona varios archivos simultáneamente; el tiempo transcurrido para 30 horas es de aproximadamente 1,5 a 2 horas según la profundidad de la cola.
- Filtro de diarización. Exporta solo los turnos de los participantes, excluyendo las preguntas del entrevistador, para evitar que el andamiaje estructural de la entrevista aparezca como un tema.
- Modelado de temas. Ejecuta BERTopic sobre los turnos de los participantes. En una CPU moderna de portátil, 30 transcripciones de una hora toman de 20 a 40 minutos.
- Etiquetado. Una persona investigadora etiqueta los 8 a 15 temas que emergen. De 30 a 60 minutos.
- Extracción de citas. Extrae de 3 a 5 citas representativas por tema. De 20 a 30 minutos.
- Síntesis. Escribe la sección de temas del informe de investigación usando los temas etiquetados y las citas como andamiaje.
Tiempo activo del investigador: unas 3 a 5 horas para un corpus que tomaría de 30 a 60 horas analizar manualmente mediante escucha y codificación línea por línea. La contrapartida es el ruido estadístico en las asignaciones de clusters y el trabajo adicional de validación para detectar errores del modelo antes de que lleguen al informe.
Recomendaciones de herramientas
Para flujos de trabajo basados en Python:
- gensim: Implementación de LDA de larga trayectoria. Bien documentada, fácil de empezar. Versión 4.x, mantenida activamente.
- BERTopic: La recomendación general actual. Pipeline modular, desarrollo activo, se integra con los principales modelos de embeddings y LLM para etiquetado posterior.
- scikit-learn: Incluye primitivas de LDA y clustering si quieres construir un pipeline más personalizado.
Para investigadores que prefieren interfaces gráficas:
- NVivo: Herramienta comercial de investigación cualitativa con codificación integrada y funciones de IA emergentes.
- MAXQDA: Codificación y resumen asistidos por IA mediante MAXQDA AI Assist, con investigaciones independientes que sugieren que mapea las codificaciones humanas con más precisión que las integraciones de IA de herramientas competidoras.
- ATLAS.ti: Herramienta cualitativa de larga trayectoria con un AI Lab que ofrece sugerencias de códigos basadas en LLM, aunque reseñas independientes señalan que la salida requiere una poda manual considerable.
Mi opinión sobre las herramientas gráficas: las tres han añadido funciones de IA, pero ninguna es nativa de IA. Funcionan bien para investigadores que quieren flujos de trabajo de apuntar y hacer clic y no se sienten cómodos con Python. Para corpus grandes o pipelines de investigación reproducibles, los enfoques basados en código te dan más control y transparencia.
Para el clustering basado en LLM:
- Salidas estructuradas de OpenAI: Respuestas consistentes impuestas por esquemas JSON que hacen el clustering fiable sin parseo frágil.
- Anthropic Claude: Rinde bien en razonamiento cualitativo y produce taxonomías de temas coherentes con buen etiquetado.
- Modelos de código abierto vía Ollama: Viables para proyectos sensibles al presupuesto; la calidad varía más que en las APIs fronterizas, pero el costo es casi cero para la inferencia local.
Errores comunes
Demasiados pocos documentos
Los métodos estadísticos necesitan suficientes documentos para clusters estables. Con menos de 20 entrevistas, LDA y BERTopic suelen producir temas que cambian sustancialmente entre ejecuciones. Para corpus pequeños, el clustering con LLM es más fiable porque razona sobre el significado en lugar de estimar distribuciones.
Transcripciones defectuosas
Una precisión de transcripción por debajo del 90% inyecta suficiente ruido para que los temas que emergen reflejen errores tanto como contenido. Consulta cómo mejorar la precisión de la transcripción para conocer los pasos de preparación que más importan.
Número incorrecto de temas para LDA
LDA requiere que especifiques el número de temas antes de ejecutarlo. Si son muy pocos, los temas se amontonan; si son demasiados, se fragmentan en casi duplicados. Las métricas de coherencia (en concreto la puntuación C_v) ayudan a encontrar un número defendible, pero probar tres o cuatro valores y comparar la salida etiquetada por humanos es más fiable que fiarse solo de la métrica.
Ignorar la estructura de la entrevista
Una entrevista estructurada donde las mismas preguntas aparecen en 30 sesiones producirá un cluster de temas para esas preguntas. Ese cluster representa el protocolo de la entrevista, no las opiniones de los participantes. Filtra los turnos del entrevistador antes del modelado. El efecto es más pronunciado en entrevistas cargadas de preguntas donde el entrevistador pronuncia el 30-40% de las palabras.
Tratar los temas como verdad
El modelado de temas es una hipótesis de clustering, no una descripción de la realidad. Los temas que emergen son puntos de partida para el análisis. Valida cada tema contra las transcripciones originales antes de publicarlo o actuar en base a él. La entrada transcripción con IA vs humana cubre preguntas relacionadas sobre cuándo la salida estadística necesita verificación humana.
Preguntas frecuentes
¿Necesito transcripciones antes de poder aplicar modelado de temas al audio?
Sí. Ninguna biblioteca importante de modelado de temas funciona directamente sobre audio. Primero transcribes y luego alimentas el texto a tu pipeline de modelado. La calidad de tus transcripciones marca el techo de la calidad de tus temas, así que una transcripción precisa vale la inversión.
¿Cuántas entrevistas o grabaciones necesito para que funcione el modelado de temas?
Los métodos estadísticos como LDA necesitan al menos 50-100 documentos para obtener clusters estables. Por debajo de 20, los resultados varían significativamente de una ejecución a otra. Para corpus pequeños de 5-20 grabaciones, el clustering basado en LLM es más fiable porque razona sobre el significado en lugar de contar frecuencias de palabras.
¿Cuál es la diferencia entre LDA y BERTopic en la práctica?
LDA trata cada documento como una mezcla de temas definidos por frecuencias de palabras. BERTopic incrusta los documentos en un espacio semántico primero y luego agrupa por significado. Los temas de BERTopic tienden a ser más coherentes semánticamente, pero los resultados dependen del tamaño del corpus y de las elecciones de hiperparámetros. Para corpus grandes con patrones de vocabulario claros, LDA es más rápido y sus resultados son más fáciles de auditar. Para documentos desordenados o cortos, BERTopic suele ganar.
¿Debería filtrar las preguntas del entrevistador antes de modelar las respuestas de los participantes?
Normalmente sí. Si tu corpus sigue un formato de entrevista estructurada, las preguntas repetidas del entrevistador se convierten en su propio cluster de temas, lo cual es ruido y no señal sobre las opiniones de los participantes. La diarización de hablantes te permite conservar solo los turnos de los participantes. El efecto es más pronunciado cuando las mismas preguntas aparecen en decenas de entrevistas.
Fuentes
- Documentación de BERTopic: https://maartengr.github.io/BERTopic/index.html
- BERTopic en PyPI: https://pypi.org/project/bertopic/
- Documentación de LDA de Gensim: https://radimrehurek.com/gensim/models/ldamodel.html
- "AI-powered topic modeling: comparing LDA and BERTopic in analyzing opioid-related cardiovascular risks in women," PubMed, 2025: https://pubmed.ncbi.nlm.nih.gov/40093658/
- "Comparative Analysis of BERTopic Versus LDA: Topic Modelling in Marketing Research," SAGE Journals, 2026: https://journals.sagepub.com/doi/10.1177/14413582251399667
- Comparativa de MAXQDA vs ATLAS.ti, Skimle, 2026: https://skimle.com/blog/maxqda-vs-atlas-ti-qualitative-analysis-software-2026
- Mejores herramientas de análisis de datos cualitativos 2026, UserCall: https://www.usercall.co/post/top-5-qualitative-data-analysis-software-tools
- Precios de la API de OpenAI, Value Add VC, 2026: https://valueaddvc.com/blog/openai-api-pricing-2026-gpt-4o-o3-and-gpt-5-cost-breakdown-for-developers
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.