
Cómo transcribir audio a texto online gratis en 2026
Summarize this article with:
Puedes transcribir audio a texto online gratis en 2026, pero toda herramienta basada en el navegador tiene un límite: restricciones de subida, cuotas mensuales de minutos o máximos por grabación que son fáciles de pasar por alto en la letra pequeña. La vía más rápida sin registro es una herramienta del navegador que acepta la subida de un archivo y devuelve una transcripción en texto plano en cuestión de minutos. Para trabajos largos o recurrentes, conocer el techo gratuito real de cada herramienta antes de empezar te ahorra el frustrante muro de pago a mitad de la transcripción.
Sube tu archivo de audio a una herramienta de transcripción basada en el navegador y tendrás una transcripción en texto plano en minutos, gratis. Sin software de escritorio, sin clave de API, sin suscripción. La trampa está en que toda herramienta online gratuita tiene un techo: límites mensuales de minutos, restricciones por grabación o cuotas de importación de archivos que aparecen en el peor momento. Esta guía recorre el camino gratuito honesto, lo que cada herramienta realmente permite y cómo conseguir la mejor precisión sin gastar nada.
El camino gratuito más rápido: subir y transcribir
El flujo de trabajo es el mismo en todas las herramientas basadas en navegador:
Paso 1: Prepara tu archivo de audio. Comprueba primero tu formato. La mayoría de las herramientas gratuitas aceptan MP3, WAV, M4A, FLAC, OGG y AAC. Si tu archivo está en un formato poco común, conviértelo a MP3 con cualquier conversor de audio gratuito. La calidad del audio es el factor de precisión más importante, no la herramienta que uses, así que aplica un paso rápido de eliminación de ruido a las grabaciones con mucho sonido de fondo antes de subirlas.
Paso 2: Sube tu archivo y selecciona tu idioma. Ve a la herramienta, arrastra tu archivo y elige el idioma principal de la grabación. Si tienes dudas, la mayoría de las herramientas incluyen detección automática. Configurar bien el idioma importa: el audio con varios idiomas mezclados es uno de los escenarios más difíciles para cualquier modelo de voz, así que aunque unas pocas palabras estén en otra lengua, configura el idioma dominante.
Paso 3: Espera el procesamiento. Las herramientas basadas en navegador ejecutan modelos de IA en la nube. El tiempo de procesamiento depende de la duración del archivo y de la carga del servidor. Una grabación de 10 minutos suele devolver resultados en unos 1 a 3 minutos, aunque las colas en horas punta de los niveles gratuitos pueden alargar ese tiempo. No hay forma fiable de predecir el tiempo exacto; el rango es real.
Paso 4: Revisa y exporta. Ninguna herramienta produce un primer borrador perfecto. Espera dedicar unos minutos a corregir nombres propios, términos técnicos y las secciones donde la calidad del audio baja. Descarga como texto plano, SRT o VTT según tu uso.

Qué significa realmente «gratis»: los límites que debes conocer
La palabra «gratis» en las páginas de inicio de las herramientas de transcripción suele ocultar restricciones vinculantes. Esto es lo que debes mirar antes de empezar.
Cuotas mensuales de minutos. Otter.ai da 300 minutos al mes, lo que suena generoso hasta que chocas con el límite de 30 minutos por sesión y el límite vitalicio de 3 importaciones de archivos. Notta da 120 minutos al mes, pero impone un máximo de 3 minutos por grabación, lo que la hace poco práctica para cualquier cosa más larga que una nota de voz breve.
Límites diarios. TurboScribe adopta otro enfoque: 3 transcripciones al día, cada una de hasta 30 minutos. Son 90 minutos de audio al día, lo que puede ser más que suficiente para un uso habitual. Se requiere una cuenta gratuita para transcribir.
Vistas previas de un solo uso. El nivel gratuito de Happy Scribe es una prueba de 10 minutos. Es suficiente para evaluar la calidad, pero no para trabajo continuo. Las exportaciones llevan marca de agua.
Vistas previas sin registro con límite posterior. ConvertAudioToText te permite transcribir hasta 10 minutos sin crear una cuenta. Tras esa vista previa, una cuenta gratuita añade 10 minutos de transcripción, otorgados una sola vez al registrarte en lugar de renovarse cada mes, utilizables a razón de hasta 3 archivos al día de 10 minutos cada uno. Es la herramienta adecuada si necesitas transcribir una grabación ahora mismo sin ninguna fricción, pero no es un nivel gratuito sostenible para un uso regular.
Autoalojado sin ningún límite. El modelo Whisper de OpenAI es de código abierto y gratuito para ejecutar localmente. Con una GPU puede transcribir a varias veces la velocidad en tiempo real; en una CPU es más lento, pero sigue siendo gratis por minuto. La configuración requiere línea de comandos, Python y FFmpeg. Si te sientes cómodo con eso, es genuinamente ilimitado.
Comparativa de herramientas de transcripción gratuitas
| Herramienta | Límite gratuito | Cuenta requerida | Formatos de exportación | Notas |
|---|---|---|---|---|
| OpenAI Whisper (autoalojado) | Ilimitado | No | TXT, SRT, VTT, JSON | Requiere configuración de Python + CLI; funciona sin conexión tras instalarlo |
| TurboScribe | 3 archivos/día (hasta 30 min cada uno) | Sí (cuenta gratuita) | TXT, SRT, DOCX | El nivel gratuito basado en navegador más generoso |
| Otter.ai | 300 min/mes | Sí | TXT (nivel gratuito) | Límite de 30 min por sesión; 3 importaciones de archivos de por vida; solo EN/FR/ES |
| Notta | 120 min/mes | Sí | TXT | El límite de 3 min por grabación es la restricción decisiva |
| ConvertAudioToText | Vista previa de 10 min sin registro; 10 min gratis una vez con cuenta gratuita | No para la vista previa | TXT, SRT, VTT (de pago) | Inicio instantáneo sin registro; copiar la transcripción es gratis, la exportación de archivos requiere plan de pago |
| Happy Scribe | Prueba de 10 min | Sí | Con marca de agua | Solo vista previa; no apto para uso continuo |
| Escritura por voz de Google Docs | Ilimitado | Sí (cuenta de Google) | DOCX | Solo dictado en vivo; no acepta subida de archivos; requiere internet |
Nota sobre el orden: Whisper y TurboScribe encabezan la lista porque ofrecen la mayor capacidad gratuita, no porque sean la mejor opción para todos los flujos de trabajo.
Consejos para mejorar la precisión en un nivel gratuito
En audio limpio de un solo hablante, la precisión llega al 95–99% con los modelos de IA modernos. En grabaciones ruidosas con varios hablantes que se solapan, la precisión puede bajar del 80%. La calidad del audio, no la herramienta que elijas, determina la mayor parte de ese rango.
Usa un micrófono dedicado. Incluso un micrófono USB básico produce resultados dramáticamente mejores que el micrófono integrado del portátil. Si vas a grabar contenido que planeas transcribir, un buen micrófono merece la inversión.
Graba en un espacio silencioso. Apaga ventiladores y aire acondicionado. Los textiles blandos absorben el eco. Cuanto más limpia sea la fuente, menos corregirás después.
Habla a un ritmo natural. Los modelos modernos se entrenan con habla conversacional. Ralentizarte de forma antinatural o exagerar la articulación no ayuda y a menudo suena raro en la transcripción.
Un hablante a la vez cuando sea posible. El audio multihablante es donde los niveles gratuitos más sufren. Si tu grabación tiene varias voces, busca herramientas que incluyan diarización de hablantes. Ten en cuenta que la diarización de hablantes suele estar reservada a los planes de pago; los planes gratuitos etiquetan frecuentemente todo el audio como un único hablante.
Cuándo la transcripción gratuita te cubre
Para los casos de uso más comunes, la transcripción gratuita es suficiente:
Estudiantes. Las grabaciones de clases y las entrevistas de investigación suelen durar menos de 90 minutos. Dividirlas en segmentos de 30 minutos antes de subirlas funciona bien en la mayoría de los niveles gratuitos. Las transcripciones se pueden buscar y permiten estudiar más rápido que volver a escuchar.
Podcasters. Las notas del programa, las citas destacadas y las descripciones de episodios no requieren una transcripción completa. Un nivel gratuito cubre los extractos relevantes. Las transcripciones completas de episodios mejoran el SEO al hacer indexable el contenido de audio, aunque herramientas como la herramienta de audio a texto gestionan archivos más largos en niveles de pago cuando superas constantemente el límite gratuito.
Freelancers. Un resumen breve de una llamada con un cliente o una única reunión semanal caben holgadamente dentro de la mayoría de las asignaciones mensuales gratuitas.
Creadores de contenido. Reutilizar una única grabación en una entrada de blog, textos para redes sociales y un borrador de correo electrónico requiere solo una parte del audio. La transcripción gratuita cubre bien este flujo de trabajo.
Cuándo la transcripción gratuita no basta
Los niveles gratuitos tienen límites reales. Si los alcanzas con regularidad, la respuesta honesta es que la transcripción de pago cuesta menos que el tiempo que dedicas a gestionar límites.
Grabaciones largas. Los archivos de más de 30 minutos requieren unir segmentos manualmente o un plan de pago. Para archivos de audio de una hora, el procesamiento de pago supone mucha menos fricción.
Trabajo por lotes. Transcribir varios archivos a la vez requiere automatización de pago. Los modelos de precios medidos frente a ilimitados difieren significativamente aquí, y la elección correcta depende de tu volumen.
Grabaciones multihablante. Identificar quién dijo qué en una mesa redonda, una entrevista o una reunión de equipo se beneficia de la diarización de pago. Los niveles gratuitos suelen omitir por completo las etiquetas de hablantes.
Audio sensible. Las políticas de privacidad difieren según el proveedor. Si tus grabaciones contienen información confidencial, revisa la política de retención y almacenamiento de cualquier herramienta en la nube antes de subir nada. La retención de audio varía: algunos proveedores eliminan tras procesar, otros archivan indefinidamente y algunos permiten configurarla. Lee siempre la política actual del proveedor en lugar de darlo por supuesto.
Mi opinión
La opción verdaderamente sin fricciones en 2026 para una transcripción puntual es la subida desde el navegador sin registro: la vista previa de 10 minutos de CATT es la más práctica para trabajos rápidos. Para trabajo gratuito continuo, el límite de 3 archivos al día de TurboScribe es el nivel gratuito estructurado más generoso entre las herramientas de navegador, y admite más de 130 idiomas. Si te sientes cómodo con la terminal y tienes una máquina tranquila, Whisper autoalojado es la única opción sin ningún techo.
Las herramientas que parecen generosas en superficie suelen tener restricciones vinculantes ocultas: el límite de 3 minutos por grabación de Notta la hace poco práctica para reuniones reales, independientemente del fondo mensual de minutos. Las 3 importaciones de archivos de por vida de Otter se agotan rápido si subes grabaciones existentes en lugar de grabar en directo con su bot. Saber qué restricción aplica a tu flujo de trabajo antes de empezar.
Si tus necesidades superan los niveles gratuitos, el desglose del coste de la transcripción y la comparativa entre gratis y de pago son buenas lecturas siguientes.
Preguntas frecuentes
¿Es precisa la transcripción online gratuita?
La transcripción con IA moderna alcanza una precisión del 95 al 99% en audio claro de un solo hablante, independientemente de que uses una herramienta gratuita o de pago. El modelo de voz base suele ser idéntico entre niveles. La precisión cae en grabaciones ruidosas, con hablantes que se solapan, acentos marcados y jerga técnica, a veces por debajo del 80%. La calidad del audio determina la mayor parte del rango de precisión, no el nivel de precio. Los planes de pago a veces añaden vocabulario personalizado y preprocesamiento de audio que ayudan en grabaciones difíciles, pero la diferencia en audio limpio es mínima.
¿Puedo transcribir una clase completa gratis?
Depende del límite por grabación de cada herramienta. TurboScribe permite archivos de hasta 30 minutos cada uno, con 3 al día. Si tu clase es más larga, divide la grabación en segmentos de 30 minutos y transcribe cada uno. Otter.ai permite hasta 30 minutos por sesión. Para transcribir en un solo archivo una clase completa de 60 a 90 minutos, un plan de pago o Whisper autoalojado es el camino más limpio.
¿Las herramientas de transcripción gratuitas almacenan mi audio?
Las políticas de almacenamiento y retención varían según el proveedor y cambian con el tiempo. Algunos servicios eliminan el audio tras procesarlo, otros lo conservan para auditoría o reprocesamiento, y algunos te permiten controlar la eliminación tú mismo. Comprueba siempre la política de privacidad actual de cualquier herramienta antes de subir grabaciones sensibles. No te bases en resúmenes de terceros para tomar una decisión sobre políticas.
¿Qué formatos de audio funcionan con la transcripción gratuita?
La mayoría de las herramientas gratuitas basadas en navegador aceptan MP3, WAV, M4A, FLAC, OGG y AAC. Muchas también aceptan formatos de vídeo como MP4 y MOV y extraen la pista de audio automáticamente. El soporte de WMA es menos consistente. Si tienes dudas, convierte primero a MP3.
¿La transcripción gratuita admite idiomas además del inglés?
Sí, la mayoría de las herramientas admiten varios idiomas, aunque la profundidad lingüística varía según el nivel. TurboScribe admite más de 130 idiomas en su nivel gratuito. ConvertAudioToText admite más de 99 idiomas con detección automática. El plan gratuito de Otter.ai cubre inglés, francés y español. El plan gratuito de Notta incluye su biblioteca completa de más de 30 idiomas, pero con el límite de 3 minutos por grabación. Escritura por voz de Google Docs admite más de 100 idiomas, pero solo funciona como dictado en vivo, sin subida de archivos.
Fuentes
- Detalles del plan gratuito de Otter.ai: https://tldv.io/blog/otter-pricing/ (revisado en julio de 2026)
- Detalles del plan gratuito de Notta: https://tldv.io/blog/notta-ai-review/ (revisado en julio de 2026)
- Resumen de los planes de TurboScribe: https://thetoolsverse.com/tools/turboscribe (revisado en julio de 2026)
- Nivel gratuito de Happy Scribe: https://help.happyscribe.com/en/articles/6906232-plans-and-pricing (revisado en julio de 2026)
- Limitaciones de Escritura por voz de Google Docs: https://support.google.com/docs/answer/4492226 (revisado en julio de 2026)
- Benchmarks de precisión de la transcripción con IA: https://www.plainscribe.com/blog/transcription-accuracy-benchmark-2026 (revisado en julio de 2026)
- Nivel gratuito y número de idiomas de ConvertAudioToText: https://convertaudiototext.com/ (revisado en julio de 2026)
- Resumen de Whisper autoalojado de OpenAI: https://www.digitalapplied.com/blog/local-speech-to-text-whisper-self-hosted-transcription-2026 (revisado en julio de 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.