Cómo transcribir una entrevista grabada 2026
transcripciónentrevistaperiodismo

Cómo transcribir una entrevista grabada 2026

BMMamane B. MoussaMay 26, 2026Updated June 30, 202619 min read

Summarize this article with:

TL;DR

Transcribir una entrevista de una hora a mano lleva entre cuatro y seis horas. Con la transcripción por IA obtienes un borrador en unos minutos y luego dedicas entre 15 y 30 minutos a editar nombres propios, números y etiquetas de hablante antes de citar. La diferencia de precisión entre herramientas depende sobre todo de tu micrófono y tu configuración de consentimiento, no del software. Elige la transcripción limpia para periodismo, conserva el audio original y verifica cada cita contra la grabación antes de publicarla.

TL;DR. Una entrevista de una hora toma de cuatro a seis horas transcribirla a mano y unos cinco minutos más una pasada de edición de 15 a 30 minutos con IA. La mayor parte de tu precisión final se decide antes de pulsar grabar: micrófono, sala y consentimiento. Elige la transcripción limpia para periodismo, pasa el audio por una herramienta de transcripción, corrige nombres propios y números en una pasada de edición rápida y verifica cada cita directa contra la grabación antes de publicar. Conserva el audio original.

Una entrevista típica produce entre 30 y 60 minutos de audio que deben convertirse en citas, temas y análisis precisos. La transcripción es la base. Si la haces bien, la redacción fluye. Si la haces mal, pierdes horas rastreando palabras mal citadas en la grabación o, peor, publicas una cita fantasma y publicas una corrección.

Yo construyo ConvertAudioToText, así que leo y edito transcripciones todo el día. El flujo de trabajo que sigue es el que resiste la presión de los plazos para periodistas e investigadores cualitativos. No se trata de qué logo es "la mejor herramienta". Las decisiones de configuración que tomas antes de la entrevista afectan mucho más a la precisión que el software. Los periodistas, en concreto, también deberían consultar la página de herramientas de transcripción para periodistas, que cubre el flujo de trabajo de una redacción de principio a fin.

Free · No sign-up

Transcribe your first file right in your browser

Upload a file or paste a YouTube/podcast link and get a clean, unwatermarked transcript with speaker labels, timestamps, and an AI summary. First 10 minutes free, no account.

Subir una grabación de entrevista a ConvertAudioToText: arrastra y suelta un archivo, graba en vivo o pega una URL. Los primeros 10 minutos son gratis sin necesidad de cuenta.
Subir una grabación de entrevista a ConvertAudioToText: arrastra y suelta un archivo, graba en vivo o pega una URL. Los primeros 10 minutos son gratis sin necesidad de cuenta.

Cuánto tiempo ahorra realmente la IA

La versión honesta de la promesa. La transcripción manual sigue una proporción bien documentada: los transcriptores experimentados trabajan a un ritmo de cuatro horas de tecleo por cada hora de audio, y un audio deficiente o varios hablantes pueden duplicar o triplicar esa cifra (GMR Transcription). Tu cerebro sigue el habla a 125–175 palabras por minuto, pero la mayoría de la gente teclea a 60–90, así que te detienes y rebobinas constantemente.

La IA invierte las cuentas. Una entrevista de 60 minutos se transcribe en unos tres a cinco minutos, y dedicas el tiempo ahorrado a lo que necesita un humano: editar y reportar.

EnfoqueTiempo para una entrevista de 1 horaCosteIdeal para
A mano4 a 6 horasTu tiempoClips diminutos, transcripción literal de nivel legal, control máximo
Borrador con IA y luego editas5 min de proceso + 15 a 30 min de ediciónGratis a unos pocos dólaresLa mayoría de las entrevistas
Servicio de transcripción humanaDe 12 horas a unos días de entrega~$1.50 a $2 por minuto de audioAcentos marcados, precisión de nivel judicial, tienes presupuesto

El punto de equilibrio es obvio para casi todas las entrevistas. La transcripción a mano solo gana cuando la grabación es tan confusa que un borrador de IA tardaría más en arreglarse que en teclearse desde cero, lo que normalmente significa que el audio de origen era malo. Eso es un problema de grabación, y la grabación es donde empezamos.

Antes de grabar: la parte que decide tu precisión

La transcripción más limpia proviene del audio más limpio, y el audio limpio es una decisión de configuración, no un arreglo de posproducción. Ningún modelo recupera palabras que el micrófono nunca capturó.

Adapta el micrófono al formato

  • En persona. Dos micrófonos de solapa, o un micrófono de cañón colocado entre tú y el sujeto. Una grabadora de campo como la serie Zoom H puede capturar a cada hablante en una pista separada, lo que hace que las etiquetas de hablante sean mucho más fiables.
  • Videollamada remota. Graba a cada hablante localmente cuando sea posible (Riverside, Zencastr o similares lo hacen), para que cada voz tenga su propio archivo limpio en lugar de un único flujo comprimido con calidad de llamada.
  • Teléfono. Usa una aplicación de grabación de teléfono o una grabadora dedicada, no el altavoz captado por un micrófono de sala a medio metro.

Qué evitar: el micrófono integrado del portátil al otro lado de un escritorio, o dos personas inclinadas hacia un único teléfono sobre una mesa. Ambos producen audio de calidad media que un modelo de IA transcribirá igualmente, solo que con más errores que luego tendrás que cazar de oído. Para una mirada más profunda al equipo, consulta las mejores grabadoras para periodistas y cómo manejar el ruido de fondo en una grabación.

Obtén el consentimiento en la grabación

Las normas de grabación varían según la jurisdicción y son importantes. Un grupo central de estados de EE. UU. exige consentimiento de todas las partes (todas las personas consienten antes de grabar), y California, Florida, Illinois y Pensilvania están entre los más estrictos. Varios estados son genuinamente controvertidos o híbridos (Nevada y Michigan son interpretados de manera distinta por diferentes tribunales), así que no te fíes de una lista plana que encuentres en línea, incluido este párrafo. Revisa los detalles de tu estado en grabar entrevistas legalmente por estado y en la encuesta de 50 estados de Justia.

Incluso en estados de consentimiento de una sola parte, el consentimiento grabado es buena práctica y te protege si la entrevista se cuestiona después. La apertura estándar: "Estoy grabando esto para mayor precisión, ¿le parece bien?" Espera el "sí" verbal. Esa línea grabada entra en la transcripción y se convierte en tu autorización documentada.

Elige primero el estilo literal

Decide antes de la entrevista cuán literal debe ser la transcripción. La elección cambia cómo editas y cómo puedes citar.

  • Literal estricta conserva cada "um", arranque en falso y pausa. Requerida para evidencia legal, análisis de voz y parte de la investigación cualitativa.
  • Literal inteligente elimina muletillas y arranques en falso, mantiene la gramática tal como se dijo. Estándar en investigación académica.
  • Transcripción limpia elimina muletillas y suaviza ligeramente los arranques en falso. Estándar en periodismo.
  • Editada reescribe en prosa limpia. Úsala solo para la cita final publicada, nunca como transcripción archivada.

Para periodismo, la transcripción limpia casi siempre es lo correcto: mantiene intacta la voz del hablante mientras elimina el ruido que hace quedar mal a cualquiera en la página. Las ventajas y desventajas se explican en transcripción literal vs. limpia.

Durante la entrevista: tres hábitos que dan frutos después

  • Deja que el sujeto termine. Las interrupciones son la mayor fuente de errores de transcripción, porque ningún modelo ni diarizador separa limpiamente a dos personas hablando a la vez. La pausa de medio segundo se siente larga en la sala y se lee limpia en la página.
  • Repite nombres y términos inusuales. "Solo para confirmar, se escribe C-O-O-L-I-F-Y?" le da a la transcripción un ancla limpia y te ahorra una verificación posterior.
  • Anota la marca de tiempo de cualquier cita destacada. Escribir "23:17, declaración de misión" en tu cuaderno convierte una búsqueda posterior de citas en una localización de 10 segundos.

La pasada de transcripción

1. Recorta y convierte

Corta el aire muerto al principio y al final. Si el archivo es video (MP4 de Zoom o Riverside), solo el audio es suficiente y se sube más rápido:

ffmpeg -i interview.mp4 -vn -acodec mp3 -ab 192k interview.mp3

Esto reduce el tamaño del archivo aproximadamente un 80 por ciento sin pérdida significativa de precisión para el habla.

2. Sube y configura

Suelta el archivo en tu herramienta de transcripción. El transcriptor gratuito de inglés maneja entrevistas cortas sin cuenta, y la plantilla de entrevista periodística es el punto de entrada correcto cuando quieres una salida estructurada (citas destacadas, afirmaciones para verificar, candidatos a entradilla) en lugar de una pared de texto crudo.

Tres ajustes que mejoran la precisión:

  • Idioma. Especifícalo en lugar de confiar en la detección automática, especialmente para audio que no está en inglés.
  • Número de hablantes. Establece el número real (2 para una entrevista uno a uno, 3 para un reportero más dos sujetos). La diarización es más precisa cuando no tiene que adivinar cuántas voces buscar.
  • Vocabulario o refuerzo de palabras clave. Pasa cualquier nombre inusual, jerga o nombre propio. Una lista de cinco palabras detecta los errores de marca y apellido que de otro modo aparecen en cada primera pasada.

3. Ejecuta

Una entrevista de 60 minutos normalmente se procesa en tres a cinco minutos y escala de forma aproximadamente lineal. La transcripción por IA moderna alcanza entre 8 y 12 por ciento de tasa de error por palabra en audio conversacional real, mejor en grabaciones limpias y peor en las ruidosas con calidad de llamada (referencias de WER de Whisper). Por eso existe la pasada de edición y por qué importa tu configuración de micrófono: una grabación limpia cae en el extremo bueno de ese rango.

4. La pasada de edición de 15 minutos

Este es el paso más importante y el que la gente se salta. Abre la transcripción con el audio sincronizado (el editor de CATT vincula el texto al audio para que puedas hacer clic en cualquier palabra e ir a ese punto):

  1. Reproduce a 1.5x y hojea el texto mientras escuchas.
  2. Pausa para arreglar lo que te mete en problemas:
    • Nombres propios. Casi siempre mal en la primera pasada.
    • Números. Una cifra en dólares o una fecha mal dicha se publica tal cual y es embarazosa.
    • Etiquetas de hablante. Verifica que el primer minuto sea correcto; el resto suele seguir.
    • Errores que cambian el significado. Un "no" omitido, o "su" vs. "sus".
  3. Omite preferencias estilísticas, debates sobre muletillas (si elegiste transcripción limpia) y puntuación menor.

Una entrevista de 60 minutos debería tomar de 15 a 30 minutos de edición. Si toma más, el audio de origen era malo y estás reescribiendo, no editando. Más sobre cómo cerrar la brecha de precisión en por qué varía la precisión de la transcripción.

No install · No watermark

Skip the setup — transcribe right now

No command line, no app to download. Upload, record, or paste a URL and your transcript is ready in minutes — free to start.

Extraer y verificar citas

La transcripción existe. Ahora necesitas citas, y necesitas que sean exactamente lo que se dijo.

Encuentra las citas

  • Busca y hojea para pasajes cortos donde ya conoces el ángulo: busca palabras clave, extrae los pasajes.
  • Pasada de resaltado para piezas más largas: lee toda la transcripción una vez, marca cualquier cosa citable y luego elige las tres a cinco más fuertes por tema.
  • Salida estructurada cuando quieres una ventaja inicial: la plantilla de entrevista periodística devuelve temas, citas candidatas y sugerencias de entradilla. Trátala como un borrador y verifica todo contra el audio. El método completo está en cómo extraer citas de una entrevista.

Verifica antes de publicar

Antes de que cualquier cita directa vaya a imprenta:

  1. Encuentra la cita en la transcripción.
  2. Haz clic para ir a ese momento del audio.
  3. Escucha el contexto circundante.
  4. Confirma la redacción, incluidos el énfasis y el tono.

Con un editor de clic para ir al audio, esto es unos 30 segundos por cita. Omitirlo ha causado más correcciones periodísticas que cualquier otra brecha de flujo de trabajo. La IA se equivoca sutilmente en palabras de manera que parecen plausibles, precisamente por eso una escucha rápida capta lo que una relectura no.

Comparación honesta: dónde difieren realmente las herramientas

La herramienta importa menos que la configuración, pero es una pregunta justa, así que aquí va la versión directa con precios actuales. Las herramientas especializadas para entrevistas e investigación se agrupan en torno a tres compromisos: cuánta edición hacen por ti, si ofrecen una opción de calidad humana y cómo cobran.

HerramientaModeloPlan gratuitoEntrada de pagoDestacado para entrevistas
ConvertAudioToTextIA, tarifa plana mensual10 min, sin cuenta; 10 minutos únicos con cuentaDesde $9.99/mesEtiquetas de hablante, editor de clic para ir al audio, plantillas estructuradas de periodismo/investigación, cobertura de idiomas africanos y no ingleses
Otter.aiIA, en tiempo real300 min/mes (Basic)Pro $8.33/usuario/mes (anual)Captura de reuniones en vivo y notas (otter.ai/pricing)
DescriptIA, editor primero1 hora/mesHobbyist $16/mes (10 h)Editar audio/video editando la transcripción (descript.com/pricing)
TrintIA, redacciónNingunoStarter ~$52/mesColaboración y traducción para equipos editoriales
RevIA + humano45 min de IA/mesEssentials $29.99/mes; humano ~$1.50 a $2 por minuto de audioTranscripción humana cuando el 99 % de precisión no es negociable (rev.com/pricing)

Mi opinión en una frase: para la mayoría de las entrevistas, cualquier herramienta de IA competente más una pasada de edición disciplinada supera pagar por transcripción humana, y la única razón para pagar la tarifa humana por minuto de Rev es cuando un tribunal, un acento marcado o una exposición legal hacen que el último pequeño porcentaje de precisión valga aproximadamente 20 veces el coste. Si quieres el desglose completo de cuándo vale la pena la prima humana, consulta transcripción con IA vs. humana. Los precios anteriores son vigentes a mediados de 2026 y cambian, así que revisa la página de cada proveedor antes de comprometerte.

Entrevistas con varios hablantes y paneles

Las entrevistas tipo panel con tres o más sujetos son más difíciles, y ser honesto al respecto te evita confiar en una etiqueta incorrecta:

  • Cuenta con cierta atribución errónea. Verifica la etiqueta del hablante en cada cita que realmente uses.
  • Las interrupciones empeoran. Algunas líneas de un micrófono serán ininteligibles. Los micrófonos por hablante arreglan la mayor parte si controlas la configuración.
  • Establece el número de hablantes en la herramienta para que la diarización no esté adivinando.

Cómo funciona el etiquetado subyacente se cubre en explicación de la diarización de hablantes.

Entrevistas en otros idiomas y traducidas

Si la entrevista está en español, francés, portugués, árabe u otro idioma, transcribe primero en el idioma original. El resultado es más preciso que pedirle al modelo que traduzca mientras transcribe, y conservas un registro fiel del que citar.

Luego traduce la transcripción como un paso separado (DeepL, Google Translate o un traductor humano según lo que esté en juego). Cita en el original donde importe, traducido cuando publiques en inglés. Para wolof, suajili y hausa, CATT cubre idiomas de África occidental y oriental que muchas herramientas antiguas simplemente no manejan.

Manejo de material sensible

Algunos contenidos de entrevistas necesitan un tratamiento cuidadoso:

  • Pasajes extraoficiales. Márcalos en la transcripción ("inicio OTR" / "fin OTR"). No los borres de tu archivo, porque puedes necesitar verificar después lo que realmente se dijo, pero no cites de ellos.
  • Pasajes de fondo. Mismo manejo, disponibles para contexto pero no para atribución.
  • Fuentes anónimas. Sustituye el nombre por un seudónimo antes de que la transcripción llegue a un editor. Guarda el original con clave por separado y de forma segura.
  • Sujetos vulnerables. Sobrevivientes, menores, denunciantes. Trata la grabación misma como sensible y limita quién puede acceder a ella.

La plantilla de entrevista de investigación y la plantilla de conferencia de prensa manejan la salida estructurada para otros contextos de reportaje.

Guarda el audio, la transcripción y tus notas juntos

Conserva todo de una entrevista en una carpeta con un nombre coherente:

2026-05-26_alice-jones-interview/
  ├── audio.mp3
  ├── transcript.txt
  ├── transcript.docx
  ├── consent-line-timestamp.txt
  ├── notes-during-interview.md
  └── pull-quotes.md

Para investigaciones de larga duración, anida por proyecto: project-alpha/2026-05-26_alice/.... Las transcripciones se convierten en un corpus consultable, y seis meses después puedes encontrar cualquier entrevista en menos de un minuto. Nunca descartes el audio original. El disco es barato, y la grabación es lo único que te permite defender una cita si alguna vez se cuestiona.

Tres errores que más tiempo cuestan a los reporteros

  1. Transcribir a mano por costumbre. Cuatro a seis horas de tecleo reemplazadas por cinco minutos más una edición breve. El tiempo ahorrado se destina a reportar y escribir.
  2. Saltarse la pasada de edición. Publicar citas directas de una transcripción cruda de IA es como se imprimen citas fantasma. Edita siempre antes de citar.
  3. No conservar el audio. Sin la grabación no puedes verificar una cita en disputa, y esa es la situación en la que más lo necesitas.

Haz esto con tu próxima entrevista

Si tienes una entrevista en tu disco, pásala por el transcriptor gratuito de inglés, luego por la plantilla de entrevista periodística y compara la salida estructurada con lo que habrías producido a partir de una lectura manual. La mayoría de las entrevistas tienen al menos una cita fuerte en la salida de la plantilla que habrías pasado por alto en una primera lectura. Ese es el argumento para dejar que la máquina teclee mientras tú haces el reportaje.

Preguntas frecuentes

¿Cuánto se tarda en transcribir una entrevista de una hora?

A mano, de cuatro a seis horas con audio claro, y el doble o el triple con grabaciones deficientes o varios hablantes. Con IA, entre tres y cinco minutos para generar el borrador y luego de 15 a 30 minutos para editarlo antes de citar.

¿Qué tan precisa es la transcripción de entrevistas con IA?

La IA moderna alcanza entre un 8 y un 12 por ciento de tasa de error por palabra en audio conversacional real, mejor en grabaciones limpias y peor en ruidosas o con acentos marcados. Es suficiente para un borrador de trabajo, pero no para citas directas sin editar, por eso existen la pasada de edición y la verificación de citas.

¿Debería usar IA o un servicio de transcripción humana?

Usa IA para casi todas las entrevistas: una grabación limpia más una pasada de edición breve te da citas publicables gratis o por unos pocos dólares. Paga por transcripción humana (alrededor de $1.50 a $2 por minuto de audio) solo cuando el audio es muy difícil o la precisión exigida es de nivel legal, como una declaración o un acta judicial.

¿Qué estilo literal debo elegir para periodismo?

Transcripción limpia. Elimina muletillas y suaviza ligeramente los arranques en falso, pero conserva las palabras y la voz reales del hablante. Usa la transcripción literal estricta solo para evidencia legal o análisis de voz, y reserva la prosa totalmente editada para la cita final publicada, nunca para tu transcripción archivada.

Depende de tu jurisdicción. Un grupo central de estados de EE. UU. exige el consentimiento de todas las personas en la conversación, y algunos estados son genuinamente controvertidos. Grabar el consentimiento verbal al inicio te protege en todas partes. Revisa los detalles en nuestra guía estado por estado y en la encuesta de 50 estados de Justia antes de grabar.

¿Cómo transcribo una entrevista en otro idioma?

Transcribe primero en el idioma original y luego traduce el texto como un paso separado. Traducir durante la transcripción es menos preciso y pierde el registro fiel que necesitas para citar. CATT admite español, francés, árabe e idiomas africanos como wolof, suajili y hausa.

¿Por qué mi transcripción atribuye mal quién dijo qué?

El etiquetado de hablantes (diarización) sufre con las interrupciones y con dos voces que suenan parecidas, y empeora en paneles de tres o más. Grabar a cada hablante con un micrófono separado y establecer el número de hablantes en la herramienta ayudan. Verifica siempre la etiqueta del hablante en cualquier cita que publiques.

¿Puedo transcribir una entrevista de Zoom o video sin un archivo de audio separado?

Sí. Sube el MP4 directamente o extrae primero solo el audio con FFmpeg para reducir el archivo y acelerar la subida. El audio solo no pierde nada en precisión de transcripción.

Preguntas frecuentes

¿Cuánto se tarda en transcribir una entrevista de una hora?

A mano, de cuatro a seis horas con audio claro, y el doble o el triple con grabaciones deficientes o varios hablantes. Con IA, entre tres y cinco minutos para generar el borrador y luego de 15 a 30 minutos para editarlo antes de citar.

¿Qué tan precisa es la transcripción de entrevistas con IA?

La IA moderna alcanza entre un 8 y un 12 por ciento de tasa de error por palabra en audio conversacional real, mejor en grabaciones limpias y peor en ruidosas o con acentos marcados. Es suficiente para un borrador de trabajo, pero no para citas directas sin editar, por eso existen la pasada de edición y la verificación de citas.

¿Debería usar IA o un servicio de transcripción humana?

Usa IA para casi todas las entrevistas: una grabación limpia más una pasada de edición breve te da citas publicables gratis o por unos pocos dólares. Paga por transcripción humana (alrededor de $1.50 a $2 por minuto de audio) solo cuando el audio es muy difícil o la precisión exigida es de nivel legal, como una declaración o un acta judicial.

¿Qué estilo literal debo elegir para periodismo?

Transcripción limpia. Elimina muletillas y suaviza ligeramente los arranques en falso, pero conserva las palabras y la voz reales del hablante. Usa la transcripción literal estricta solo para evidencia legal o análisis de voz, y reserva la prosa totalmente editada para la cita final publicada, nunca para tu transcripción archivada.

Depende de tu jurisdicción. Un grupo central de estados de EE. UU. exige el consentimiento de todas las personas en la conversación, y algunos estados son genuinamente controvertidos. Grabar el consentimiento verbal al inicio te protege en todas partes. Revisa los detalles en nuestra guía estado por estado y en la encuesta de 50 estados de Justia antes de grabar.

¿Cómo transcribo una entrevista en otro idioma?

Transcribe primero en el idioma original y luego traduce el texto como un paso separado. Traducir durante la transcripción es menos preciso y pierde el registro fiel que necesitas para citar. CATT admite español, francés, árabe e idiomas africanos como wolof, suajili y hausa.

¿Por qué mi transcripción atribuye mal quién dijo qué?

El etiquetado de hablantes (diarización) sufre con las interrupciones y con dos voces que suenan parecidas, y empeora en paneles de tres o más. Grabar a cada hablante con un micrófono separado y establecer el número de hablantes en la herramienta ayudan. Verifica siempre la etiqueta del hablante en cualquier cita que publiques.

¿Puedo transcribir una entrevista de Zoom o video sin un archivo de audio separado?

Sí. Sube el MP4 directamente o extrae primero solo el audio con FFmpeg para reducir el archivo y acelerar la subida. El audio solo no pierde nada en precisión de transcripción.

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles