Editor de audio por texto: edita audio editando texto, online y gratis
Borra una palabra del texto y el audio se va con ella. Gratis, en tu navegador.
Un editor de audio por texto convierte tu grabación en texto con una marca de tiempo en cada palabra y luego corta el audio cuando cortas el texto. Borra una frase y el tramo de audio correspondiente se va con ella. CATT Editor hace esto gratis en edit.convertaudiototext.com, sin cuenta, y cada paso ocurre dentro de tu propio navegador.
El editor es una app gratuita aparte, en edit.convertaudiototext.com. Se abre en una pestaña nueva, no te pide nada y lee tu archivo directamente desde tu disco.
Funciona mejor en un navegador Chromium de escritorio. La primera vez descarga el modelo de voz, unos 200 MB para Base o unos 600 MB para Small, y luego lo guarda en caché. Todo se mantiene en memoria, así que los clips cortos funcionan mejor.
¿Por qué usar Editor de audio por texto?
Borra el texto y corta el audio
Selecciona una palabra o una frase entera, pulsa retroceso y el tramo de medios correspondiente desaparece. El corte cae en el límite de la palabra y la reproducción lo salta al instante, así que oyes la edición antes de exportarla.
Elimina las muletillas en inglés de un clic
El editor lleva una lista fija de sonidos de relleno en inglés: um, uh, ah, eh, hm, mm, uh-huh y sus grafías habituales. Cuando la transcripción contiene alguno, aparece un botón Remove fillers con la cuenta, y un clic los corta todos de una vez. Es una coincidencia literal de palabras, no un criterio: like, so y right se quedan. La lista se aplica sea cual sea el idioma hablado, así que en una grabación que no esté en inglés puede marcar una palabra con significado. Para eso está deshacer.
Tu archivo nunca sale del dispositivo
No hay subida ni procesamiento en servidor. El navegador lee el archivo desde tu disco, lo decodifica con WebAssembly y ejecuta el modelo de voz en tu propio hardware. Sí registramos analítica de producto anónima, y no incluye nombres de archivo, ni audio, ni texto.
Sin cuenta y sin límites de exportación
Sin registro, sin marca de agua, sin saldo de créditos, sin versión de pago del editor. Lo que te limita es tu máquina, no un plan.
Los vídeos funcionan igual
Suelta un MP4, WebM, MOV o MKV y edítalo exactamente como el audio. Los proyectos de vídeo se exportan como MP4 con vídeo H.264 y audio AAC, y los de solo audio como M4A.
Conoce el compromiso de precisión
El modelo del navegador es lo bastante pequeño para correr en un portátil, así que va bien con habla limpia y empeora con acentos, voces superpuestas, ruido de fondo e idiomas distintos del inglés. Para un texto que vayas a publicar, o una grabación de dos horas, pásala primero por ConvertAudioToText y trae el resultado al editor.
Cómo funciona
Suelta tu archivo
Audio o vídeo: MP3, WAV, M4A, MP4, WebM, MOV o MKV. El navegador lo lee directamente desde tu disco, así que no hay subida, ni cola, ni barra de progreso que esperar.
El modelo de voz corre en tu máquina
Whisper se ejecuta en un Web Worker sobre tu propia CPU o GPU y devuelve texto con una marca de tiempo en cada palabra, agrupado por hablante. La primera vez descarga el modelo, unos 200 MB para Base o unos 600 MB para Small, y luego lo guarda en caché.
Edita el texto y el audio le sigue
Borra las palabras que no quieras. La reproducción salta los tramos eliminados de inmediato, así que oyes el resultado antes de comprometerte.
Exporta el corte final
ffmpeg.wasm recorta y vuelve a unir los tramos conservados en el navegador y te entrega un archivo para descargar: MP4 para proyectos de vídeo, M4A para los de solo audio.
Editor de audio por texto frente a los editores que piden cuenta
Qué cambia cuando la edición ocurre en tu máquina y no en la suya.
| Característica | CATT | Editores que piden cuenta |
|---|---|---|
| Cuenta para empezar | Ninguna | Registro antes de la primera edición |
| Adónde va tu archivo | Se queda en tu dispositivo | Se sube a sus servidores |
| Coste de exportar | Gratis, sin marca de agua | Topes del plan gratuito, marcas de agua o ambos |
| Instalación | Ninguna, una pestaña del navegador | A menudo una app de escritorio para el conjunto completo |
| Cómo cortas | Borras las palabras y el audio les sigue | Depende de la herramienta |
| Grabaciones largas o difíciles | Limitado por la memoria de tu navegador | Se procesan en sus servidores |
Preguntas frecuentes
Sí. No hay cuenta, ni registro, ni límite de exportación, ni marca de agua, ni versión de pago del editor. Todo el trabajo ocurre en tu propia máquina, así que no hay coste por minuto que trasladarte.
No. Tu navegador lee el archivo en local, lo decodifica y ejecuta el modelo de voz en tu propio hardware. Los medios, el audio y el texto nunca salen del dispositivo. Las únicas peticiones de red que hace la página son la propia app, la descarga única del modelo y analítica de producto anónima que no contiene datos del archivo.
Porque el modelo de voz corre en tu máquina y antes tiene que llegar hasta ella. Whisper Base ocupa unos 200 MB y Whisper Small unos 600 MB. El navegador guarda el modelo en caché tras esa primera vez, así que la transcripción y la exportación siguen funcionando si se cae la conexión. Cargar la página sí necesita red: no hay caché de la aplicación para uso sin conexión.
Un navegador Chromium reciente en escritorio, o sea Chrome, Edge, Brave o Arc. El editor necesita SharedArrayBuffer y usa WebGPU cuando tu máquina lo expone, con WebAssembly como alternativa. Firefox funciona, pero suele ser más lento. Safari y la mayoría de navegadores móviles no son fiables para esta carga.
Nosotros no imponemos un límite, pero tu navegador sí. Todo se mantiene en memoria, así que un portátil va cómodo con clips de hasta diez o veinte minutos y se ralentiza o se queda sin memoria a partir de ahí. Para una entrevista de dos horas, pásala primero por ConvertAudioToText y trae el texto al editor.
Sí. Elige Importar en el menú de origen y carga un archivo de texto con marcas de tiempo que ya tengas. Saltarte el modelo local significa que no hay descarga ni espera, y es el camino más rápido para grabaciones largas.
Whisper Base y Small son los dos modelos lo bastante pequeños para correr en una pestaña del navegador, así que cambian precisión por tamaño. Van bien con habla limpia y empeoran de forma notable con acentos, voces superpuestas, ruido de fondo o audio que no sea en inglés. Para un texto que vayas a publicar, usa los modelos grandes de ConvertAudioToText.
Los proyectos de vídeo se exportan como MP4 con vídeo H.264 y audio AAC. Los de solo audio, como M4A. Ambos los escribe ffmpeg.wasm dentro de tu navegador y se guardan directamente en tu disco.
Un recortador trabaja sobre la onda: eliges un tiempo de inicio y uno de fin. Esto trabaja sobre las palabras: lees el texto y borras lo que no quieres, y el corte cae en el límite de la palabra. Usa el recortador cuando conozcas las marcas de tiempo, y esto cuando conozcas la frase.
Herramientas relacionadas
Alternativa gratuita a Descript
La parte de Descript en la que editas por texto, gratis en tu navegador. No el resto de la suite, y aquí decimos qué falta.
Recortador de Audio
Recorta y corta archivos de audio a la duración exacta que necesitas
Transcripción de Podcasts
Convierte los episodios de tu podcast en texto buscable y compartible