Software de voz a texto

Software de voz a texto, sin adivinar nada

Sube un archivo de audio o vídeo, o pega un enlace a una grabación. Recibes una transcripción con etiquetas de hablante y marcas de tiempo en 99 idiomas, además de resúmenes, tareas pendientes y exportaciones limpias. Los primeros 10 minutos de cualquier archivo son gratis y sin cuenta.

¿Prefieres dictar en lugar de subir un archivo? Prueba la escritura por voz en directo en tu navegador

Los primeros 10 minutos de cualquier archivo son gratis sin cuenta. Cuentas gratuitas: 10 minutos de transcripción, por única vez. Pro: ilimitado, desde $9.99/mes con facturación anual.

Cómo convertir voz en texto

  1. 1
    Trae tu audioSube un archivo MP3, WAV, M4A, MP4, MOV o WebM, o pega un enlace público a una grabación. El audio se extrae del vídeo automáticamente, así que no hay nada que convertir antes.
  2. 2
    Indica el idioma habladoElige el idioma antes de empezar. Indicarlo de antemano permite que el modelo se optimice para el conjunto de sonidos correcto en lugar de adivinar, que es de donde salen la mayoría de las transcripciones en el idioma equivocado. Se admiten 99 idiomas, con la salida en su escritura nativa.
  3. 3
    Lee, edita y exportaTu transcripción llega con etiquetas de hablante y marcas de tiempo. Leerla y copiarla es gratis. Los planes de pago añaden descargas en TXT, PDF, DOCX, SRT, VTT y JSON, además de resúmenes con IA, tareas pendientes y decisiones.

Lo que recibes

Etiquetas de hablante que separan quién habló y cuándo a lo largo de toda la grabación
Marcas de tiempo por palabra a las que puedes saltar, para que cada cita siga siendo verificable
99 idiomas con salida en la escritura nativa, no en texto romanizado
11 plantillas de IA ajustadas a cada tarea: entrevistas, pódcast, clases, reuniones e investigación
Tareas pendientes, decisiones y un borrador de correo listo para enviar extraídos de la transcripción y escritos en el idioma de la propia transcripción
Un editor de verdad: corrige una palabra, deja un comentario y conserva el historial de versiones

Qué tan precisa es, medido

Publicamos nuestras propias cifras en lugar de un porcentaje de marketing. En un conjunto de prueba público de seis archivos (habla limpia de LibriSpeech, inglés con acento nigeriano de OpenSLR 70 y una reunión de cuatro personas del corpus AMI) el producto en vivo promedió un 6.43% de tasa de error por palabra, medido el July 24, 2026. El audio de reuniones con voces superpuestas es mucho más difícil que el habla limpia, y el informe desglosa cada archivo, incluidos aquellos en los que peor salimos.

Leer el informe completo

Lo que dice la gente sobre las transcripciones

How easy it makes working with other tools, it's speed and it's efficiency. The interface is well coded and visually appealing. This is an incredible tool.
David E. · Marketing Manager
Best transcription tool I've ever used. The accuracy is amazing and the turnaround time is incredibly fast. Highly recommend!
Emily K. · Journalist
The multilingual support is what sold me. Transcribes French and Spanish recordings just as well as English.
Sofia G. · Translator

El mismo motor, por API

Si vas a integrar voz a texto en tu propio producto, los planes Developer y Business exponen una API REST: crea una clave en el panel, envía un archivo o una URL, consulta el resultado y recupera la transcripción con marcas de tiempo y etiquetas de hablante. Las llamadas de webhook están en el plan Business.

Ver planes con API

Preguntas frecuentes

¿La conversión de voz a texto es gratis?
Los primeros 10 minutos de cualquier archivo se transcriben gratis sin cuenta. Una cuenta gratuita añade 10 minutos de transcripción, entregados una sola vez y no recargados, que puedes usar en hasta 3 archivos al día de 10 minutos cada uno. Leer y copiar el texto sigue siendo gratis; las descargas de archivos y la duración ilimitada llegan con un plan de pago desde $9.99/mes con facturación anual.
¿Qué precisión tiene la conversión de voz a texto?
Depende mucho más del audio que de la herramienta. Con habla limpia y micrófono cercano, nuestra tasa de error por palabra medida ronda el 1%. En una reunión de cuatro personas con voces superpuestas supera el 20%. Publicamos el conjunto de prueba completo en nuestra página de referencia de precisión en lugar de citar una sola cifra. Cuenta con revisar nombres, jerga y todo lo que se diga sobre ruido de fondo.
¿Qué idiomas se admiten?
99 idiomas, con la transcripción escrita en la escritura propia de cada idioma: árabe en alfabeto árabe, hindi en devanagari, japonés en kana y kanji. Elige el idioma antes de subir el archivo. Los resúmenes con IA y las tareas pendientes se generan en el mismo idioma de la transcripción, no traducidos al inglés.
¿Puedo convertir la voz de un vídeo?
Sí. Sube MP4, MOV, WebM o MKV y extraemos la pista de audio por ti: no hace falta convertir el vídeo antes. También puedes pegar un enlace público a una grabación en lugar de subir un archivo.
¿Identifica quién está hablando?
Sí. La diarización de hablantes se ejecuta en cada transcripción: separa las voces y las etiqueta como Hablante 1, Hablante 2 y así sucesivamente. No conoce sus nombres reales: renombras a un hablante una vez en el editor y la etiqueta se actualiza en toda la transcripción.
¿Qué pasa con mi audio después?
Los archivos del plan gratuito se eliminan en un plazo de 7 días. Los planes de pago te dejan elegir el periodo de retención (30 días por defecto, hasta conservar el archivo indefinidamente) y puedes borrar cualquier archivo tú mismo cuando quieras.

Convierte tu primera grabación en texto

Nada que instalar y sin tarjeta. Los primeros 10 minutos corren por nuestra cuenta.

Empezar a transcribir