Cómo grabar entrevistas en persona para obtener transcripciones limpias
grabación de entrevistasen personatranscripción

Cómo grabar entrevistas en persona para obtener transcripciones limpias

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

La palanca más importante para la precisión de la transcripción de entrevistas no es el software que usas, sino cómo colocas el micrófono. Dos micrófonos de solapa en pistas separadas superan cualquier configuración de una sola pista para separar hablantes. Apunta a picos entre -12 y -6 dB, graba siempre una copia de seguridad y consigue el consentimiento verbal en la grabación antes de empezar. Un kit de 300-400 dólares cubre todos los escenarios, desde una oficina tranquila hasta un recinto de congresos concurrido.

Una buena colocación del micrófono supera cualquier truco de software disponible. Una entrevista de 90 minutos bien grabada se sube, se transcribe y devuelve una transcripción etiquetada por hablante en cuestión de minutos. Una mal grabada significa horas de limpieza sin importar qué IA uses. Esta guía cubre las configuraciones específicas que funcionan, con equipos realmente disponibles en 2026.

Por qué grabar en persona es diferente del trabajo de estudio

No controlas la sala. Las entrevistas ocurren en cafeterías, vestíbulos de hotel, oficinas con ruido de planta abierta, recintos de congresos y coches. Tienes quizá noventa segundos para montarlo todo antes de que tu entrevistado empiece a sentirse cohibido por el equipo.

Las restricciones reales:

  • Ruido variable que no puedes reducir
  • Entrevistados que se mueven, cambian de postura o se alejan
  • Una ventana de tiempo estricta (normalmente de 30 a 60 minutos)
  • Un umbral de comodidad: el equipo visible hace que la gente hable de otra manera

La buena noticia: la transcripción moderna con IA perdona el audio imperfecto cuando los fundamentos son correctos. Los fundamentos son una distancia constante al micrófono y una separación limpia de hablantes.

Tres configuraciones que cubren todos los escenarios

ConfiguraciónIdeal paraCoste aprox. del equipoSeparación de hablantes
Micrófono de solapa único en el entrevistadoUno a uno, preguntas y respuestas periodísticas70-130 USDBuena (solo el entrevistado)
Dos micrófonos de solapa, pistas separadasEntrevistas a dos personas, investigadores, podcasters270-400 USDExcelente
Micrófono de frontera sobre la mesaGrupos de 3-4 personas, mesas redondas35-180 USDRegular

Configuración 1: Micrófono de solapa único en el entrevistado

La opción de menor fricción. Sujeta un micrófono de solapa a la camisa del entrevistado, a unos quince o veinte centímetros por debajo de la barbilla, con la cápsula ligeramente inclinada hacia arriba. Conéctalo a una grabadora de campo o a tu teléfono.

Opciones actuales fiables: el Rode SmartLav+ (~69 USD en grandes minoristas, verificado en julio de 2026) se conecta directamente a un teléfono inteligente mediante TRRS. Para una grabadora dedicada, combina cualquier micrófono de solapa cableado con la Zoom H1essential (unos 99 dólares de precio de mercado), que graba audio en coma flotante de 32 bits y recorta la mayoría de los errores de ganancia antes de que ocurran.

Esto capta al entrevistado con claridad. Tú no apareces en la grabación, lo cual está bien para el periodismo de preguntas y respuestas donde tus preguntas son breves y las recuerdas. Para entrevistas analíticas más largas donde tus preguntas importan tanto como las respuestas, usa la Configuración 2.

Configuración 2: Dos micrófonos de solapa en pistas separadas (recomendada)

Dos micrófonos, uno por hablante, en canales estéreo separados, es la configuración con la que se queda la mayoría de los periodistas e investigadores en activo. Cada hablante tiene una pista limpia y aislada, lo que significa que la identificación de hablantes en el momento de transcribir es determinista y no probabilística.

Para configuraciones cableadas, dos micrófonos de solapa económicos más una grabadora multientrada es el camino. La Zoom H4essential (~199 USD de precio de mercado) acepta dos entradas XLR/TRS en canales separados. La Zoom H6essential (~299 USD de precio de mercado) gestiona cuatro entradas simultáneas y añade una función de pista de seguridad. Precios obtenidos de Zoom y de minoristas externos, julio de 2026; los modelos anteriores H5 y H1n han sido sustituidos por esta serie Essential.

Para sistemas inalámbricos, el sistema de doble canal Rode Wireless GO II (dos transmisores, un receptor) sigue comercializándose activamente a mediados de 2026, con precios de mercado que oscilan entre unos 185 y 299 dólares según el minorista y el paquete. Te ofrece 200 metros de alcance y grabación integrada en cada transmisor como red de seguridad.

El coste extra se amortiza rápidamente. Cuando cada voz está en su propia pista, subes un archivo estéreo y el paso de diarización se reduce a una simple división izquierda/derecha en lugar de a conjeturas acústicas. Para saber más sobre cómo afecta la separación de hablantes a la precisión, consulta qué es la diarización de hablantes.

Configuración 3: Micrófono de frontera sobre la mesa

Sin distorsión ni tiempo de montaje. Coloca un micrófono de frontera (también llamado micrófono PZM) plano en el centro de la mesa. El Shure MX391 y modelos similares en el rango de 35-150 dólares captan a todos los presentes dentro de un radio de unos dos metros.

Usa esta opción cuando los entrevistados se nieguen a llevar micrófonos de solapa, o cuando haya más de cuatro personas y los micrófonos individuales resulten poco prácticos.

La contrapartida: una única pista mezclada significa que la IA debe separar las voces acústicamente. Eso funciona bien con dos voces muy distintas, pero empeora con tres o más hablantes de tono similar. También capta todo lo demás que hay en la mesa: vasos, papeles que se arrastran, golpecitos. Para una configuración móvil que cubra entrevistas grupales en Android o iPhone, un teléfono con un adaptador de frontera enganchable es un sustituto razonable.

Detalles de colocación del micrófono

Para micrófonos de solapa:

  • Sujétalo a la solapa o la zona del pecho, a unos quince o veinte centímetros por debajo de la barbilla
  • Inclina la cápsula ligeramente hacia arriba, apuntando a la boca
  • Evita cuellos sueltos, bufandas o joyas que rocen la cápsula
  • Haz una prueba de 30 segundos y pide al entrevistado que gire la cabeza a izquierda y derecha mientras observas los niveles de la grabadora. Si los niveles se disparan cuando se mueve, vuelve a sujetarlo más arriba o usa un bucle para fijar el cable

Para micrófonos de frontera sobre una mesa:

  • Centro de la mesa, equidistante de todos los hablantes
  • Colócalo sobre un paño doblado o un cuaderno para amortiguar los golpes transmitidos por la mesa
  • Al menos a 45 centímetros de las manos de cualquiera
  • Lejos de las rejillas de ventilación del portátil

Para micrófonos dinámicos de mano (el enfoque de micro de bastón):

  • A unos quince o veinte centímetros de la boca del hablante
  • Ligeramente fuera de eje (inclinado, no apuntando directamente a la boca) para reducir las explosivas
  • Mueve el micrófono durante las transiciones entre hablantes, no a mitad de respuesta

Ajustes de la grabadora que importan

Estos ajustes aplican a cualquier grabadora de campo de la serie Zoom Essential o equivalente:

  • Formato: WAV, 44,1 kHz, 16 bits como mínimo. El formato de coma flotante de 32 bits (disponible en la serie Essential) es mejor porque hace que los errores de ganancia sean mayormente recuperables en posproducción.
  • Canales: L y R asignados por separado. Con la Configuración 2, confirma que cada micrófono de solapa va dirigido a su propio canal, no sumados en mono.
  • Ganancia: ajústala durante una conversación de prueba de 30 segundos, con picos entre -12 y -6 dB. No toques el mando de ganancia una vez empiece la entrevista.
  • Limitador: activado. Atrapa los picos repentinos de volumen, las risas y los golpes en la mesa antes de que se recorten.
  • Filtro de corte de graves: 80 Hz o 100 Hz. Elimina el retumbo de la climatización, los graves del tráfico y el ruido de manejo sin afectar a la voz.

Cómo elegir la sala

Elegir la sala está infravalorado. Unos minutos dedicados a escoger el lugar adecuado compensan más que cualquier mejora de micrófono.

  • Un sitio en la esquina o junto a la pared gana al centro de la sala. Cortas el ruido reflejado desde dos direcciones.
  • Siéntate perpendicular a las fuentes de ruido (cocinas, entradas, corredores con tránsito de gente), no en paralelo. En paralelo, ambos micrófonos quedan igual de expuestos al ruido.
  • Las superficies duras rebotan el sonido. Una sala con alfombra, muebles tapizados o incluso cortinas gruesas produce un audio más inteligible que una sala de reuniones de cristal y azulejos.
  • Si el ruido ambiente compite con la voz, cámbiate de sitio o reprograma. Ninguna técnica de micrófono ni ningún modelo de IA recupera un audio en el que el ruido de fondo tenga el mismo volumen que el hablante.

Graba de 20 a 30 segundos de tono de sala al principio o al final. Si luego usas software de reducción de ruido, esa muestra le da al algoritmo un perfil de ruido limpio que restar.

Herramienta de transcripción de entrevistas ConvertAudioToText mostrando el audio subido y la salida etiquetada por hablante
Herramienta de transcripción de entrevistas ConvertAudioToText mostrando el audio subido y la salida etiquetada por hablante

Grabación de respaldo

Usa un segundo dispositivo. Siempre.

Lo mínimo: pon tu teléfono sobre la mesa con una app de notas de voz grabando. Esto salva baterías agotadas, tarjetas llenas y fallos del firmware de la grabadora, todo lo cual ocurre en los peores momentos.

Una configuración profesional de redundancia usa dos grabadoras simultáneamente. Muchas grabadoras de campo de la gama Zoom Essential y de la serie H tienen modos de doble grabación que escriben la misma entrada en dos archivos con distintos ajustes de ganancia, dándote una copia de seguridad a un nivel más bajo por si la pista principal se recorta.

Perder el audio de una entrevista es un problema que puede definir una carrera. Un dispositivo de respaldo cuesta un minuto de tiempo de montaje.

Flujo de trabajo de transcripción después de la entrevista

Copia los archivos a tu portátil. Para un archivo estéreo de dos pistas (Configuración 2), súbelo directamente a la herramienta de audio a texto de ConvertAudioToText y selecciona tu idioma. Las dos pistas distintas dan al paso de diarización una señal fuerte sobre la que trabajar.

Para archivos de una sola pista (Configuraciones 1 y 3), súbelos de la misma manera. La precisión de la separación de hablantes en una sola pista mezclada depende mucho de lo distintas que sean las dos voces y de cuánto se solapen. Sala más limpia, menos solapamiento, voces más distintas: mejores resultados. Para profundizar en cómo funcionan los cálculos de precisión, consulta cómo funciona la precisión de la transcripción.

Para investigadores que construyen un análisis estructurado, la guía cómo transcribir una grabación de entrevista cubre el flujo de trabajo posterior a la transcripción para extraer temas y citas clave. Para periodistas con fecha límite, crear actas de reunión a partir de audio cubre el paso de extracción de resúmenes.

Si necesitas una transcripción sin registrarte para crear una cuenta, ConvertAudioToText procesa archivos de audio directamente sin requerir registro para archivos cortos.

Consentimiento antes de pulsar grabar

Obtén el consentimiento verbal en la propia grabación, antes de que empiece la conversación en serio. «Esta entrevista se está grabando, ¿te parece bien?» seguido de un «sí» claro en la grabación es protección tanto para ti como para el entrevistado.

La ley federal de EE. UU. y la mayoría de los estados permiten grabar con el consentimiento de una sola parte (solo la persona que graba necesita estar de acuerdo). A fecha de 2026, 12 estados exigen el consentimiento de todas las partes: California, Connecticut, Delaware, Florida, Illinois, Maryland, Massachusetts, Montana, New Hampshire, Oregon, Pennsylvania y Washington. Connecticut y Oregon tienen matices: Connecticut aplica el consentimiento de todas las partes a las llamadas telefónicas, pero el de una sola parte a las conversaciones en persona según el derecho penal; Oregon exige el consentimiento de todas las partes específicamente para las comunicaciones en persona. El Reporters Committee for Freedom of the Press publica una encuesta actualizada de los 50 estados y es la fuente autorizada que conviene consultar antes de grabar en una jurisdicción que no conozcas.

Para entrevistas confidenciales o sensibles, verifica qué promete cualquier plataforma de transcripción sobre conservación de datos y acceso antes de subir nada. Las políticas varían.

Un kit de campo que cabe en una mochila

El kit que cubre el 90 % de los escenarios:

  • Grabadora Zoom H4essential (~199 USD)
  • Dos micrófonos de solapa cableados económicos con conectores XLR o TRS (~30-60 USD cada uno)
  • Pilas AA de repuesto y una tarjeta SD de 32 GB nueva
  • Un cable alargador XLR corto (permite que el entrevistado se siente más lejos de la grabadora)
  • Teléfono en modo avión, con nota de voz grabando, sobre la mesa como respaldo

Total: unos 280-350 dólares, según el micrófono de solapa elegido. Dura años en todos los formatos, desde una oficina silenciosa hasta una sala de congresos ruidosa.

Haz una prueba de 60 segundos al comienzo de cada entrevista antes de pasar a tus preguntas reales. Comprueba los niveles, comprueba ambos canales, comprueba que no haya roce de tela. Nunca vas a necesitar la grabación de respaldo, salvo esa única vez en que sí la necesites.

Preguntas frecuentes

¿Qué configuración de micrófonos es mejor para entrevistas en persona entre dos personas?

Dos micrófonos de solapa, uno sujeto a cada hablante, conectados a canales separados en una grabadora de campo estéreo. Cada hablante tiene una pista limpia y aislada, lo que produce una separación de hablantes fiable en el momento de transcribir. Un solo micrófono que capte a ambos funciona, pero depende de las diferencias acústicas de las voces para separarlos, lo cual es menos consistente.

¿A qué distancia debe estar un micrófono de solapa de la boca del hablante?

De quince a veinte centímetros por debajo de la barbilla, en la solapa o la parte alta del pecho, con la cápsula ligeramente inclinada hacia arriba. A menos de diez centímetros hay riesgo de explosivas y ruido de respiración. A más de veinticinco centímetros baja el nivel y deja que el ruido de la sala compita con la voz.

¿Necesito avisar a alguien de que le estoy grabando?

En EE. UU., la ley federal permite grabar con el consentimiento de una sola parte, es decir, puedes grabar una conversación de la que formas parte sin avisar a la otra persona. Sin embargo, a fecha de 2026, doce estados exigen el consentimiento de todas las partes: California, Connecticut, Delaware, Florida, Illinois, Maryland, Massachusetts, Montana, New Hampshire, Oregon, Pennsylvania y Washington. Obtener el consentimiento verbal al inicio de la grabación es la práctica más segura en cualquier jurisdicción y es estándar en el periodismo.

¿Qué ajustes de grabadora producen el audio más limpio para la transcripción?

Formato WAV a 44,1 kHz, 16 bits o superior, con la ganancia ajustada para que los picos lleguen a entre -12 y -6 dB durante una conversación de prueba. Activa el limitador y un filtro de corte de graves de 80-100 Hz. Evita tocar la ganancia durante la entrevista. Si tu grabadora admite grabación en coma flotante de 32 bits (la serie Zoom Essential lo hace), úsala: hace recuperables la mayoría de los errores de ganancia en posproducción sin tener que volver a grabar.

Fuentes

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles