
Cómo transcribir un episodio de podcast: guía para creadores 2026
Summarize this article with:
Sube el archivo de audio o pega la URL del episodio en una herramienta de transcripción, configura el idioma y el número de hablantes, haz una pasada de edición de 15 minutos y luego exporta TXT para las notas del episodio y SRT para cualquier versión en vídeo. La grabación multipista (un archivo por hablante) es la palanca más importante para la precisión. Una vez que tienes la transcripción, las notas del episodio, los capítulos, los clips y la versión de YouTube salen todos del mismo archivo fuente.
El camino más rápido: sube el archivo de audio directamente o pega la URL pública del episodio si ya está alojado. La mayoría de las herramientas de transcripción modernas aceptan ambas opciones. Configura el idioma, indica el número de hablantes y tendrás un borrador de transcripción de un episodio de 60 minutos en unos 3-5 minutos. Lo que hagas después con esa transcripción es donde está la verdadera ventaja.

Subida de archivo frente a URL de RSS: qué camino elegir
Ambos puntos de entrada funcionan. La elección correcta depende de en qué fase del proceso de producción te encuentres.
| Ruta de entrada | Ideal para | Contrapartida |
|---|---|---|
| Subir archivo de audio | Episodios sin publicar, archivos multipista en bruto, MP3 editado antes del lanzamiento | Requiere tener el archivo en disco; las subidas grandes tardan más |
| Pegar URL del episodio | Episodios ya publicados, trabajo por lotes del catálogo antiguo, enlaces públicos de Spotify/Apple Podcasts | Depende de que el archivo sea accesible públicamente |
| URL del feed RSS | Importar automáticamente todos los episodios de un feed, flujos de trabajo de catálogo antiguo | El soporte varía según la herramienta; no todos los servicios leen RSS de forma nativa |
Si grabas en multipista (archivos separados por hablante), sube cada pista individualmente en lugar de la versión mezclada. La diferencia de calidad en la diarización es significativa; se explica en la siguiente sección.
Si estás poniendo al día el catálogo de episodios ya publicados, la ruta de la URL es más rápida. Pega la URL de audio desde la página del episodio de tu plataforma de alojamiento y te saltas por completo el paso de descargar y subir.
Si quieres usar ConvertAudioToText en concreto, el cargador de la página principal acepta archivos MP3, M4A, WAV y MP4 de hasta 100 MB, y el campo de URL admite enlaces de audio públicos de cualquier proveedor de alojamiento.
La ventaja multipista
La mayor diferencia entre una gran transcripción de podcast y una mediocre es si grabaste en multipista.
Multipista significa que cada presentador e invitado se graba en su propio archivo de audio. Las herramientas de grabación remota como Riverside, Zencastr y Descript (que adquirió SquadCast) lo hacen por defecto. Acabas con dos o tres archivos de audio en lugar de un único archivo mezclado.
Por qué esto importa para la transcripción:
- La diarización se vuelve exacta. Cada pista es un solo hablante por definición. La herramienta no necesita agrupar voces acústicamente; simplemente etiqueta cada pista.
- Los solapamientos dañan una pista cada vez. Si un invitado interrumpe y el presentador habla encima, la pista del presentador sigue teniendo audio limpio.
- La precisión se mantiene alta por hablante. Una pista limpia de un solo hablante elimina la ambigüedad que introducen los solapamientos. Los errores de diarización en audio mezclado suelen propagarse en cascada: una palabra mal atribuida hace que las frases circundantes cambien de hablante.
- Las tomas fallidas pueden silenciarse en una sola pista. Silenciar un error en una pista no afecta a la otra.
Las grabaciones con calidad de estudio, con micrófonos dedicados en habitaciones tratadas acústicamente, alcanzan típicamente una precisión del 95-99%. Las grabaciones remotas con Riverside o Zencastr se sitúan en el 92-95%. Los micrófonos de portátil en entornos ruidosos caen al 80-90%. El modelo importa menos que el audio de entrada. Para saber más sobre qué determina las puntuaciones de precisión, consulta explicación de la precisión de transcripción.
Para grabaciones presenciales, la multipista se consigue con micrófonos individuales conectados a una grabadora que captura cada uno como canal separado: el Zoom H6, el Tascam DR-40 y el RodeCaster Pro II lo hacen todos.
El flujo de trabajo de principio a fin
1. Graba en multipista
Usa una herramienta de grabación remota que capture a cada participante localmente y suba después. El resultado son archivos de audio por hablante, normalmente MP3 a 192 kbps o WAV sin comprimir.
Para grabaciones presenciales, conecta micrófonos individuales a una grabadora multicanal y activa la grabación por pista.
2. Pasada de edición ligera del audio
Recorta los silencios del principio y del final, elimina errores evidentes. No edites en exceso antes de transcribir: la transcripción debe coincidir con el audio publicado. Exporta cada pista a MP3 a 192 kbps.
3. Sube el archivo o pega la URL
Si tienes archivos por hablante, súbelos individualmente o por lotes. Si el episodio ya está publicado, pega la URL pública del audio.
Configura tres cosas antes de darle a transcribir:
- Idioma. Indícalo siempre. La detección automática no es fiable en episodios que empiezan con música de intro.
- Número de hablantes. Ajústalo al número real de hablantes (normalmente 2-3).
- Lista de vocabulario. Añade términos recurrentes específicos de tu programa: nombres de invitados, nombres de productos y terminología de nicho que el modelo no haya visto con alta frecuencia.
4. Procesa
Un episodio de 60 minutos suele procesarse en 3-5 minutos. Los archivos más largos escalan aproximadamente de forma lineal. El ciclo completo de subida a descarga para un episodio de 60 minutos suele durar menos de 10 minutos.
5. Pasada de edición
15 minutos por hora de audio es el objetivo. Reproduce a velocidad 1,5x mientras ojeas el texto:
- Corrige nombres propios, cifras y errores que cambien el significado.
- No persigas cada muletilla. La mayoría de los podcasts publican verbatim limpio, algo que las herramientas de IA gestionan automáticamente. Buscar cada "eh" es tiempo perdido a menos que necesites verbatim estricto por motivos de investigación o legales.
En la salida de diarización de hablantes, repasa las etiquetas de hablante de una sola pasada y corrige cualquier intercambio cerca del inicio del archivo (las atribuciones erróneas del principio tienden a persistir).
6. Exporta
Un solo trabajo de transcripción, múltiples resultados:
- TXT o DOCX para la página de notas del episodio.
- SRT para cualquier versión en vídeo (YouTube, clips de TikTok, Reels).
- VTT para la etiqueta de transcripción del RSS (más sobre esto abajo).
- JSON para herramientas posteriores.
7. Publica la transcripción
Publica la transcripción en su propia página dentro de tu sitio de podcast y enlázala desde la página del episodio. Esto crea texto indexable en torno a cada tema que cubre el episodio, incluidos nombres de invitados, nombres de productos y preguntas respondidas que un oyente podría buscar. Nada de eso es accesible para los buscadores solo con el archivo de audio.
Notas del episodio a partir de la transcripción
La transcripción rara vez es el entregable final. La mayoría de los programas la combinan con notas estructuradas del episodio: resumen, marcas de tiempo de los capítulos, citas destacadas y enlaces mencionados.
Con la transcripción completa en mano, un borrador completo de notas del episodio lleva 20-30 minutos, no 60-90. Ya tienes:
- Un resumen del episodio de 1 párrafo (extrae la afirmación más clara sobre de qué trata el episodio).
- De 5 a 10 marcas de tiempo con etiquetas de tema (identifica dónde cambia la conversación).
- De 3 a 5 citas destacadas para redes sociales, elegidas de la transcripción sin volver a escuchar.
- Una lista de recursos: todas las URL o libros que mencionó el invitado.
Con fines de SEO, apunta a al menos 300-600 palabras de contenido indexable en las notas del episodio, no solo la lista de marcas de tiempo. Las transcripciones completas son la versión más potente: miles de palabras de texto rico en palabras clave, buscables por los oyentes e indexadas por Google. Consulta la mejor transcripción para podcasts 2026 para comparar herramientas diseñadas en torno a este flujo de trabajo.
Marcadores de capítulos
Los marcadores de capítulos mejoran la experiencia del oyente y son importantes para el SEO de las plataformas. En 2026, YouTube es la plataforma de descubrimiento de podcasts más utilizada en EE. UU., con un 33% de cuota de mercado, por delante de Spotify con un 26% y Apple Podcasts con un 14%. El algoritmo de descubrimiento de YouTube responde a los capítulos de forma muy similar a como un buscador responde a los encabezados.
Tanto Apple Podcasts como Spotify muestran los marcadores de capítulos en sus aplicaciones. Los oyentes los usan para navegar por episodios largos y hacerse una idea de los temas antes de decidirse a escuchar.
Una lista de capítulos típica para un episodio de entrevista de 60 minutos tiene de 5 a 10 capítulos de 5-15 minutos cada uno. Los capítulos de menos de un minuto resultan ruidosos en el reproductor.
Añade los capítulos a través de tu plataforma de alojamiento de podcasts. Transistor, Buzzsprout, Megaphone y la mayoría de los alojamientos principales aceptan marcas de tiempo y títulos, ya sea pegándolos o subiéndolos en un archivo. Buzzsprout también admite capítulos incrustados en las etiquetas ID3v2 del MP3.
La etiqueta de transcripción de Podcast 2.0
Si publicas un feed RSS de podcast, añadir la etiqueta podcast:transcript a cada episodio merece 30 segundos de configuración. A mediados de 2026, 33 reproductores de podcast admiten la etiqueta, incluidos Apple Podcasts (desde iOS 17.4), Pocket Casts y AntennaPod. Spotify acepta formatos JSON y VTT.
La etiqueta básica tiene este aspecto:
podcast:transcript
url="https://example.com/transcripts/ep42.vtt"
type="text/vtt"
language="en"
Dos cosas provocan fallos silenciosos: la URL debe ser HTTPS y el tipo MIME debe estar configurado correctamente (las CDN suelen usar por defecto application/octet-stream). Si tu plataforma de alojamiento admite la etiqueta de forma nativa (Transistor y Buzzsprout ambos lo hacen), usa esa opción en lugar de añadirla manualmente.
VTT es el formato que funciona en la gama más amplia de aplicaciones. Exporta VTT desde tu herramienta de transcripción y tenlo alojado donde tengas el resto de recursos del episodio.
Cómo reutilizar la transcripción
Una vez que tienes el texto, el coste marginal de cada formato adicional es bajo:
- Versión de YouTube. Usa la exportación SRT, sincronízala con una versión en vídeo del episodio (una toma de cámara o una imagen estática de la forma de onda) y súbela. YouTube es ahora la principal plataforma de descubrimiento de podcasts en EE. UU.; tratarlo como algo secundario supone dejar alcance sobre la mesa. Consulta cómo transcribir un vídeo de YouTube para el camino inverso.
- Boletín por correo electrónico. Un resumen de 200 palabras más 2-3 citas destacadas, extraídas directamente de la transcripción.
- Hilos de LinkedIn o X. Las mejores citas de una entrevista a un invitado funcionan muy bien como publicaciones independientes con un breve contexto.
- Audiogramas. Elige un momento destacado de 30-60 segundos, genera un vídeo de forma de onda con subtítulos incrustados y publícalo en plataformas de formato corto.
- Versión de artículo completo. Algunos programas publican junto al audio un artículo editado basado en cada episodio. El artículo capta tráfico de búsqueda; el audio capta descargas. Se refuerzan mutuamente.
Cada formato lleva entre 5 y 20 minutos una vez que existe la transcripción. Sin ella, cada uno obliga a volver a escuchar.
Dónde pierden tiempo la mayoría de los podcasters
Tres patrones que se repiten una y otra vez:
- Mezclar las pistas antes de transcribir. Si grabaste en multipista, transcribe en multipista. La diferencia de calidad en la diarización es inmediata y visible.
- Re-transcribir para distintas exportaciones. Transcribe una vez y exporta TXT, SRT y VTT desde el mismo trabajo.
- Editar las muletillas a mano. El modo verbatim limpio de las herramientas de transcripción modernas lo gestiona automáticamente. Editar muletillas manualmente es, en gran parte, tiempo perdido, a menos que tengas un motivo concreto para el verbatim estricto.
Lista de verificación rápida de configuración
| Paso | Qué hacer |
|---|---|
| Grabación | Multipista, audio separado por hablante |
| Micrófonos | USB o XLR, cerca del hablante, en una habitación tratada |
| Ruta de entrada | Subir archivos por hablante o pegar la URL pública del episodio |
| Ajustes | Idioma especificado, número de hablantes especificado, lista de vocabulario cargada |
| Edición | 15 minutos por hora, centrarse en nombres propios y significado |
| Exportación | TXT para notas del episodio, SRT para vídeo, VTT para etiqueta de transcripción del RSS |
| Publicación | Transcripción en su propia página, enlazada desde la página del episodio; etiqueta podcast:transcript en el RSS |
Preguntas frecuentes
¿Transcribir un episodio de podcast realmente ayuda con el SEO?
Sí. Los buscadores indexan texto, no audio. Una transcripción completa publicada junto al episodio hace que cada tema, nombre de invitado, mención de producto y pregunta respondida en ese episodio sea buscable en Google. Sin transcripción, el contenido de audio es invisible para los buscadores. Las notas del episodio por sí solas (200-300 palabras) quedan cortas; una transcripción completa añade miles de palabras de contenido indexable por episodio.
¿Es mejor subir el archivo de audio o pegar la URL del episodio?
Ambas opciones producen la misma transcripción. Subir el archivo directamente funciona mejor para episodios aún no publicados o archivos multipista que quieras mantener separados. Pegar la URL es más rápido para episodios del catálogo antiguo que ya están alojados públicamente, ya que te saltas el paso de descargar y volver a subir.
¿Qué precisión puedo esperar de la transcripción de podcasts con IA?
La precisión depende principalmente de la calidad del audio, no de la herramienta concreta. Las grabaciones con calidad de estudio, con micrófonos dedicados en habitaciones silenciosas, alcanzan el 95-99%. Las grabaciones remotas con herramientas como Riverside o Zencastr suelen situarse entre el 92-95%. Los micrófonos de portátil en entornos ruidosos caen al 80-90%. La grabación multipista (archivo separado por hablante) produce de forma consistente una mejor diarización y menos errores por solapamiento de voces que un archivo mezclado.
¿Necesito editar la transcripción después de generarla?
Vale la pena hacer una pasada de edición ligera. El objetivo son 15 minutos por hora de audio, escuchando a velocidad 1,5x mientras revisas el texto. Céntrate en nombres propios, cifras y cualquier punto donde haya cambiado el significado. No persigas las muletillas a menos que tu estilo de podcast exija verbatim estricto; el modo verbatim limpio se encarga de ellas automáticamente.
¿Qué es la etiqueta RSS podcast:transcript y debería usarla?
Es una etiqueta de extensión de Podcasting 2.0 que vincula un archivo de transcripción directamente a la entrada de un episodio en el RSS. A mediados de 2026, 33 aplicaciones de podcast la admiten, incluidas Apple Podcasts (desde iOS 17.4), Pocket Casts y Spotify. Añadirla lleva unos 30 segundos por episodio si tu plataforma de alojamiento (Transistor, Buzzsprout y otras) escribe la etiqueta por ti. Usa formato VTT para la mayor compatibilidad. La URL del archivo debe ser HTTPS o Apple Podcasts la ignorará silenciosamente.
Fuentes
- Especificación de la etiqueta de transcripción de Podcasting 2.0
- ConvertAudioToText: RSS de podcast con transcripciones
- Grabación multipista de podcasts con Riverside
- Estadísticas de podcasts en vídeo 2026: dominio de YouTube
- Precisión de la transcripción con IA en 2026: benchmarks reales y WER
- Buzzsprout: crear marcadores de capítulos
- Transistor: añadir capítulos a tus episodios de podcast
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

How to Get a Spotify Podcast Transcript Free (2026): Every Method, Honestly Compared
Spotify already shows free transcripts for many episodes, so start there. When it doesn't, here is every real way to get a Spotify podcast transcript free, including the limits of each, and when a paid tool is honestly the answer.

Best Transcription for Podcasts in 2026: Honest Tool Guide
The transcription tools that fit podcasters: long files, speaker labels, exports. Ranked honestly by use case with verified pricing.