
Transcripción de investigación UX: repositorio y operativa
Summarize this article with:
El mejor flujo de transcripción para investigación UX es el que te lleva de la grabación en bruto al insight atómico etiquetado en menos de una hora por entrevista. Transcribe externamente para ganar precisión y luego importa a tu repositorio para etiquetar, recortar y sintetizar. La mayoría de repositorios dedicados (Dovetail, Looppanel) limitan las horas de transcripción, así que el enfoque de transcripción externa ahorra costes y protege la calidad. Verifica cada cita que llegue a un informe para stakeholders contra el audio original, porque los errores de transcripción con IA en nombres propios y términos técnicos son lo bastante comunes como para importar.
The fastest research cycles share a single structural decision: transcribe externally, import for insight work. Most dedicated research repositories either limit transcription hours by tier, carry a seat-based cost that makes unlimited transcription expensive at scale, or produce transcripts that need more correction than a specialist tool would. The workflow that scales separates the transcription job from the tagging job, and chooses the right tool for each.

This post covers the research-ops layer: tooling choices, atomic tagging, repository comparison, and the disciplines that keep a UX research program running when you are handling 50 to 150 interviews per year.
The Decision Stack Before the First Interview
Three tooling questions shape every UX research transcription decision.
Where will the transcript live long-term? If your team uses a dedicated repository like Dovetail, Condens, or Looppanel, the transcript is an input to tagging and clipping, not the final output. That changes what you need from the transcription step: speaker accuracy matters more than export format, and timestamp fidelity matters more than cosmetic readability.
How many hours per month do you transcribe? A solo researcher running 4 to 6 interviews per month has very different cost constraints than a research-ops function supporting 5 product teams. Unlimited flat-rate transcription makes sense at high volume; metered per-minute pricing is cheaper at low volume.
Does your repository count transcription hours? Some platforms include unlimited transcription; others meter it. Knowing your monthly hour total before choosing a repository tier saves you from overages you did not budget for.
The answers to these three questions determine whether you transcribe inside your repository, use a dedicated external tool, or split the work.
Repository Tooling Compared
Four platforms dominate the UX research repository space in 2026. Each has a meaningfully different transcription model.
| Tool | Transcription | Pricing model | Best for |
|---|---|---|---|
| Dovetail | Included, hours limited by plan | Free tier + custom Enterprise (per vendor page; third-party trackers place professional seats near $29/user/month) | Large teams, complex tagging |
| Condens | Unlimited hours, all plans | Lite at €15/month, Business at €500/month (confirmed, condens.io/pricing) | Small teams, video clip analysis |
| Looppanel | 30 hrs/month on Pro | $395/month for 5 editors or $4,200/year (confirmed, looppanel.com/pricing) | High-accuracy transcription, AI notes |
| Marvin | AI-native, metered by tier | Free tier available; paid tiers contact-sales (heymarvin.com/pricing) | AI-first synthesis, CRM integrations |
My take: Condens is the clearest choice if you want unlimited transcription inside the repository and your team is small. Looppanel's transcription accuracy is consistently cited as stronger than Dovetail's in comparative reviews, which matters when the transcript feeds atomic insights you will cite in stakeholder decks. Dovetail's strength is collaborative tagging depth for large programs, not transcription quality per se.
EnjoyHQ, now part of UserTesting, has shifted toward enterprise custom pricing and broader research operations rather than focused transcript tagging. It fits organizations running research across product, marketing, and support, not teams that want a tight transcript-to-insight pipeline.
The Atomic Tagging Workflow
The goal of UX research transcription is not the transcript. It is the atomic insight.
Una idea atómica tiene tres partes: una observación, su evidencia y un conjunto de etiquetas. La observación es una afirmación única e imparcial de lo que aprendiste ("los usuarios esperaban que el filtro se mantuviera entre sesiones"). La evidencia es la cita o el clip que la respalda. El conjunto de etiquetas es lo que hace que se pueda encontrar más adelante: metodología, segmento de usuario, etapa del recorrido, área del producto, magnitud, sentimiento.
El etiquetado se hace sobre la transcripción, no de memoria. Por eso la pasada de lectura rápida y etiquetado dentro de la hora posterior a la entrevista no es opcional. Pasadas 48 horas, el contexto que te dice si "me rendí" es frustración, resignación o un comportamiento de solución aprendido ya no está. La transcripción conserva las palabras. Tú conservas el significado con las etiquetas.
Una taxonomía práctica de etiquetas para la mayoría de los equipos de UX:
- Etiquetas de procedimiento: fecha del estudio, método (generativo/evaluativo/diario), versión del prototipo
- Etiquetas de participante: segmento, cohorte de reclutamiento, antigüedad con el producto
- Etiquetas de experiencia: punto de dolor, necesidad no cubierta, solución alternativa, señal positiva, sorpresa
- Etiquetas de recorrido: tarea o flujo al que pertenece la observación
- Etiquetas de prioridad: gravedad, frecuencia, relevancia para el equipo
Cuando la misma etiqueta aparece en 7 de 10 entrevistas, tienes un hallazgo. Cuando aparece en 2, tienes una señal que vale la pena seguir. El modelo atómico construye esa visibilidad automáticamente si etiquetas de forma consistente.
El flujo de trabajo del sprint
Un sprint de 10 entrevistas, de 45 a 60 minutos cada una, funciona así.
Inmediatamente después de cada entrevista: Sube la grabación. Una entrevista de 60 minutos se procesa en 3 a 6 minutos. Al final del día, cada sesión tiene su transcripción.
Dentro de la hora posterior a cada entrevista: Lee la transcripción por encima mientras la conversación sigue fresca. Etiqueta los momentos atómicos: puntos de dolor descritos, objetivos mencionados, soluciones alternativas reveladas, reacciones a los prototipos, cualquier cosa sorprendente. Esta pasada de 10 minutos por entrevista es la base de todo lo que viene después. Si la omites, tardarás 4 veces más en reconstruir el contexto a partir de transcripciones frías más adelante.
Mismo día, o al día siguiente: ejecuta un resumen con IA por cada entrevista. El resumen capta hilos que seguías en directo y que quizá perdiste de vista a nivel contextual. Leer tanto el resumen como tus propias etiquetas antes de la síntesis te da dos lentes independientes sobre la misma sesión.
Día dos o tres: la síntesis. Reúne todos los momentos etiquetados de todas las sesiones. Agrúpalos por tema en Miro, Figjam o el lienzo nativo de tu repositorio. Identifica los 3 a 5 patrones más sólidos. Extrae 1 o 2 citas por patrón. Redacta la declaración de insight.
Para un proyecto de 10 entrevistas, la fase de síntesis requiere de 4 a 8 horas de trabajo concentrado. Más que eso y estás sobreingenierizando un entregable táctico.
Día tres o cuatro: la presentación. El entregable se construye en torno a citas, no a resúmenes del investigador. Las citas hacen que los insights resulten reales para las partes interesadas que no estaban en la sala. Extrae de 2 a 4 citas por insight. Luego verifica cada cita contra el audio antes de que aparezca en la presentación.
Las transcripciones con etiquetas de hablante aceleran notablemente el paso de hojeado y etiquetado: puedes escanear por hablante en lugar de leer de forma lineal.
La Verificación de Citas como Disciplina Profesional
Verifica cada cita dirigida a las partes interesadas contra el audio, no contra la transcripción. Los errores de transcripción con IA se concentran en nombres propios, nombres de funciones, acrónimos y vocabulario específico del dominio. Son exactamente los términos que más probablemente aparezcan en citas sobre una experiencia de producto.
Avanza hasta la marca de tiempo. Escucha la cita en su contexto. Confirma que las palabras coinciden. Confirma que el contexto circundante no cambia el significado. Esto lleva de 30 a 60 segundos por cita. Una presentación con 12 citas de apoyo requiere de 6 a 12 minutos de verificación. El coste de credibilidad de un nombre de producto incorrecto en una cita que un vicepresidente lee el viernes por la mañana es mucho mayor que eso.
Para orientación sobre la precisión de la transcripción y sus límites, incluido cómo la IA maneja el vocabulario específico del dominio, la publicación enlazada cubre los mecanismos.
Speaker Diarization for Video Interviews
Video interviews on Zoom or Teams have a structural audio advantage: each participant's audio is captured on their own channel, which makes automated speaker separation significantly more accurate than mixed-channel recording.
Platform-native transcription pipelines that preserve channel separation produce accurate speaker labels with little to no manual correction. In-person interviews do not have this advantage. For any in-person setup, a clip-on lavalier mic per participant produces dramatically cleaner speaker separation than a room recorder. The focus group transcription tips post covers in-person setup in detail, including mic placement and recorder settings.
For a deeper explanation of how diarization works and when it fails, see speaker diarization explained.
Multilingual Research Programs
Global product teams run interviews in multiple languages. The transcription workflow has one firm rule: always transcribe in the original language.
Translating audio to English before transcription introduces two compounding error layers. First, the translation errors. Second, the transcription errors applied to a translated output rather than natural speech. Both degrade the quality of evidence in your repository.
The defensible workflow:
- Transcribe in the original language with a tool that handles that language natively.
- Have a bilingual team member review the original-language transcript before tagging.
- Translate only the specific quotes selected for the readout.
- Flag translated quotes in the deliverable so stakeholders know what they are reading.
For teams without bilingual coverage in every research language, this either means different staffing for different markets or a narrower language scope for unsupported languages.
Cost and Volume Budget
Una investigadora de UX que gestiona un programa completo realiza entre 50 y 150 entrevistas al año, de 45 a 60 minutos cada una. Eso supone entre 50 y 150 horas de audio anual.
La transcripción profesional humana, a unos 1,50 dólares por minuto según las tarifas actuales del mercado (ver coste de transcripción por hora), supone entre 4.500 y 13.500 dólares al año con ese volumen. Pocos equipos de investigación tienen presupuesto para eso como flujo de trabajo por defecto.
La transcripción con IA mediante un plan de tarifa plana reduce ese coste a unos 120 o 180 dólares al año con las tarifas publicadas actualmente. La contrapartida es la precisión con acentos, vocabulario técnico y términos específicos del sector, por eso el enfoque híbrido tiene sentido: transcripción con IA como opción predeterminada, con transcripción humana puntual para las sesiones donde la calidad del audio o la densidad de acentos superaron al modelo de IA.
Para equipos donde el repositorio mide las horas de transcripción y necesitan capacidad externa, ConvertAudioToText gestiona la transcripción sin configuración y sin comprometerse a otra suscripción por usuario. No es un repositorio, así que no sustituye a Dovetail o Condens para etiquetar y recortar fragmentos, pero es una solución limpia para el paso exclusivo de transcripción cuando el cupo del plan de tu repositorio se queda corto.
Tres patrones de Research Ops que ralentizan los programas
Patrón 1: Transcribir primero, etiquetar nunca. La transcripción entra en el repositorio. El contexto de la entrevista se desvanece. Tres semanas después, la síntesis parte de transcripciones frías y de la memoria de la investigadora, en lugar de partir de momentos etiquetados. La solución es imponer la pasada de etiquetado dentro de la primera hora como un paso innegociable del flujo, no como un pulido opcional.
Patrón 2: Construir insights sin citas. Los informes más sólidos se construyen alrededor del lenguaje de las personas usuarias, no de los resúmenes de la investigación. Si te encuentras redactando afirmaciones de insight sin vincularlas a citas concretas, has pasado de la evidencia a la interpretación. Vuelve a los momentos etiquetados y encuentra la cita antes de escribir la afirmación.
Pattern 3: Skipping the tag taxonomy governance. Repositories become unsearchable when every researcher tags slightly differently. A simple shared taxonomy document, updated quarterly, prevents the entropy. The five tag categories above (procedural, participant, experience, journey, priority) give a starting structure; the team owns the specific terms.
The research-ops discipline of UX transcription is the speed-to-tagged-insight loop, not the transcript itself. For the specific workflow around user interviews, including question formats and note-taking during the live session, the linked sibling post covers that layer in depth.
FAQ
Should I transcribe inside my research repository or externally?
It depends on your volume. Dovetail's transcription quality is adequate for internal tagging, but most teams running high-volume research find that a dedicated transcription tool produces cleaner speaker labels and better handling of domain vocabulary. Condens (with unlimited transcription hours confirmed on their pricing page) lets you transcribe inside the platform without counting hours. Looppanel's Pro plan includes 30 transcription hours per month before overages. If you regularly exceed that, transcribing externally and importing gives you more control over accuracy and cost.
What is atomic research and how does transcription fit into it?
Atomic research breaks findings into their smallest reusable unit: an observation, its evidence (the quote or clip), and the tags that make it discoverable. Transcription is the step that creates the evidence layer. A clean, timestamp-accurate transcript lets you extract the exact quote, link it to the audio, and tag it with the right demographic, journey, and experience-oriented labels. Without a reliable transcript, the entire atomic nugget is built on a shaky foundation.
How do I handle multilingual UX research interviews?
Transcribe siempre en el idioma original. Traducir el audio antes de transcribir acumula errores en todo tu análisis. Pide a un revisor bilingüe que lea y verifique la transcripción en el idioma original, y traduce solo las citas concretas que vayan a aparecer en tu informe. Marca explícitamente las citas traducidas en cualquier entrega para que las partes interesadas sepan que están leyendo una traducción, no las palabras exactas del usuario.
¿Cuál es un presupuesto de tiempo razonable para un sprint de investigación UX de 10 entrevistas?
Con la transcripción por IA, una entrevista de 60 minutos se procesa en unos 3 a 6 minutos. Para un sprint de 10 entrevistas, todas las transcripciones están listas en menos de una hora desde que termina la última sesión. Añade 10 minutos por entrevista para tu pasada de repaso y etiquetado, de 4 a 8 horas para la síntesis, y de 2 a 3 horas para preparar el informe. El ciclo completo desde la última entrevista hasta la entrega se puede lograr en 2 días, en lugar de los 5 a 7 días que impone la transcripción manual.
Fuentes
- Página de precios de Dovetail (https://dovetail.com/pricing, consultada el 02/07/2026)
- Página de precios de Condens (https://condens.io/pricing, consultada el 02/07/2026)
- Página de precios de Looppanel (https://looppanel.com/pricing, consultada el 02/07/2026)
- Página de precios de Marvin (https://heymarvin.com/pricing, consultada el 02/07/2026)
- Guía de campo de User Interviews: Atomic Research Nuggets (https://www.userinterviews.com/ux-research-field-guide-chapter/atomic-research-nuggets, consultada el 02/07/2026)
- Página de precios de ConvertAudioToText (https://convertaudiototext.com/pricing, consultada el 02/07/2026)
- Koji: Best UX Research Repository Tools in 2026 (https://koji.so/blog, consultado el 02/07/2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.