Conversión

Editor de audio por texto: edita audio editando texto, online y gratis

Borra una palabra del texto y el audio se va con ella. Gratis, en tu navegador.

Un editor de audio por texto convierte tu grabación en texto con una marca de tiempo en cada palabra y luego corta el audio cuando cortas el texto. Borra una frase y el tramo de audio correspondiente se va con ella. CATT Editor hace esto gratis en edit.convertaudiototext.com, sin cuenta, y cada paso ocurre dentro de tu propio navegador.

El editor es una app gratuita aparte, en edit.convertaudiototext.com. Se abre en una pestaña nueva, no te pide nada y lee tu archivo directamente desde tu disco.

Funciona mejor en un navegador Chromium de escritorio. La primera vez descarga el modelo de voz, unos 200 MB para Base o unos 600 MB para Small, y luego lo guarda en caché. Todo se mantiene en memoria, así que los clips cortos funcionan mejor.

¿Por qué usar Editor de audio por texto?

Borra el texto y corta el audio

Selecciona una palabra o una frase entera, pulsa retroceso y el tramo de medios correspondiente desaparece. El corte cae en el límite de la palabra y la reproducción lo salta al instante, así que oyes la edición antes de exportarla.

Elimina las muletillas en inglés de un clic

El editor lleva una lista fija de sonidos de relleno en inglés: um, uh, ah, eh, hm, mm, uh-huh y sus grafías habituales. Cuando la transcripción contiene alguno, aparece un botón Remove fillers con la cuenta, y un clic los corta todos de una vez. Es una coincidencia literal de palabras, no un criterio: like, so y right se quedan. La lista se aplica sea cual sea el idioma hablado, así que en una grabación que no esté en inglés puede marcar una palabra con significado. Para eso está deshacer.

Tu archivo nunca sale del dispositivo

No hay subida ni procesamiento en servidor. El navegador lee el archivo desde tu disco, lo decodifica con WebAssembly y ejecuta el modelo de voz en tu propio hardware. Sí registramos analítica de producto anónima, y no incluye nombres de archivo, ni audio, ni texto.

Sin cuenta y sin límites de exportación

Sin registro, sin marca de agua, sin saldo de créditos, sin versión de pago del editor. Lo que te limita es tu máquina, no un plan.

Los vídeos funcionan igual

Suelta un MP4, WebM, MOV o MKV y edítalo exactamente como el audio. Los proyectos de vídeo se exportan como MP4 con vídeo H.264 y audio AAC, y los de solo audio como M4A.

Conoce el compromiso de precisión

El modelo del navegador es lo bastante pequeño para correr en un portátil, así que va bien con habla limpia y empeora con acentos, voces superpuestas, ruido de fondo e idiomas distintos del inglés. Para un texto que vayas a publicar, o una grabación de dos horas, pásala primero por ConvertAudioToText y trae el resultado al editor.

Cómo funciona

1

Suelta tu archivo

Audio o vídeo: MP3, WAV, M4A, MP4, WebM, MOV o MKV. El navegador lo lee directamente desde tu disco, así que no hay subida, ni cola, ni barra de progreso que esperar.

2

El modelo de voz corre en tu máquina

Whisper se ejecuta en un Web Worker sobre tu propia CPU o GPU y devuelve texto con una marca de tiempo en cada palabra, agrupado por hablante. La primera vez descarga el modelo, unos 200 MB para Base o unos 600 MB para Small, y luego lo guarda en caché.

3

Edita el texto y el audio le sigue

Borra las palabras que no quieras. La reproducción salta los tramos eliminados de inmediato, así que oyes el resultado antes de comprometerte.

4

Exporta el corte final

ffmpeg.wasm recorta y vuelve a unir los tramos conservados en el navegador y te entrega un archivo para descargar: MP4 para proyectos de vídeo, M4A para los de solo audio.

Editor de audio por texto frente a los editores que piden cuenta

Qué cambia cuando la edición ocurre en tu máquina y no en la suya.

CaracterísticaCATTEditores que piden cuenta
Cuenta para empezarNingunaRegistro antes de la primera edición
Adónde va tu archivoSe queda en tu dispositivoSe sube a sus servidores
Coste de exportarGratis, sin marca de aguaTopes del plan gratuito, marcas de agua o ambos
InstalaciónNinguna, una pestaña del navegadorA menudo una app de escritorio para el conjunto completo
Cómo cortasBorras las palabras y el audio les sigueDepende de la herramienta
Grabaciones largas o difícilesLimitado por la memoria de tu navegadorSe procesan en sus servidores

Preguntas frecuentes

Sí. No hay cuenta, ni registro, ni límite de exportación, ni marca de agua, ni versión de pago del editor. Todo el trabajo ocurre en tu propia máquina, así que no hay coste por minuto que trasladarte.

No. Tu navegador lee el archivo en local, lo decodifica y ejecuta el modelo de voz en tu propio hardware. Los medios, el audio y el texto nunca salen del dispositivo. Las únicas peticiones de red que hace la página son la propia app, la descarga única del modelo y analítica de producto anónima que no contiene datos del archivo.

Porque el modelo de voz corre en tu máquina y antes tiene que llegar hasta ella. Whisper Base ocupa unos 200 MB y Whisper Small unos 600 MB. El navegador guarda el modelo en caché tras esa primera vez, así que la transcripción y la exportación siguen funcionando si se cae la conexión. Cargar la página sí necesita red: no hay caché de la aplicación para uso sin conexión.

Un navegador Chromium reciente en escritorio, o sea Chrome, Edge, Brave o Arc. El editor necesita SharedArrayBuffer y usa WebGPU cuando tu máquina lo expone, con WebAssembly como alternativa. Firefox funciona, pero suele ser más lento. Safari y la mayoría de navegadores móviles no son fiables para esta carga.

Nosotros no imponemos un límite, pero tu navegador sí. Todo se mantiene en memoria, así que un portátil va cómodo con clips de hasta diez o veinte minutos y se ralentiza o se queda sin memoria a partir de ahí. Para una entrevista de dos horas, pásala primero por ConvertAudioToText y trae el texto al editor.

Sí. Elige Importar en el menú de origen y carga un archivo de texto con marcas de tiempo que ya tengas. Saltarte el modelo local significa que no hay descarga ni espera, y es el camino más rápido para grabaciones largas.

Whisper Base y Small son los dos modelos lo bastante pequeños para correr en una pestaña del navegador, así que cambian precisión por tamaño. Van bien con habla limpia y empeoran de forma notable con acentos, voces superpuestas, ruido de fondo o audio que no sea en inglés. Para un texto que vayas a publicar, usa los modelos grandes de ConvertAudioToText.

Los proyectos de vídeo se exportan como MP4 con vídeo H.264 y audio AAC. Los de solo audio, como M4A. Ambos los escribe ffmpeg.wasm dentro de tu navegador y se guardan directamente en tu disco.

Un recortador trabaja sobre la onda: eliges un tiempo de inicio y uno de fin. Esto trabaja sobre las palabras: lees el texto y borras lo que no quieres, y el corte cae en el límite de la palabra. Usa el recortador cuando conozcas las marcas de tiempo, y esto cuando conozcas la frase.

Need to convert video files?

Try ConvertIntoMP4. 268 formats supported, free to use.

¿Listo para transcribir?

Empieza a transcribir gratis. Sin tarjeta de crédito.

10 minutos gratis · Sin tarjeta de crédito