Editor de áudio por texto: edite áudio editando texto, online e grátis
Apague uma palavra do texto e o áudio vai junto. Grátis, no seu navegador.
Um editor de áudio por texto transforma a sua gravação em texto com marcação de tempo em cada palavra e depois corta o áudio quando você corta o texto. Apague uma frase e o trecho de áudio correspondente vai junto. O CATT Editor faz isso de graça em edit.convertaudiototext.com, sem conta, e cada etapa acontece dentro do seu próprio navegador.
O editor é um app gratuito separado, em edit.convertaudiototext.com. Ele abre em uma nova aba, não pede nada e lê o seu arquivo direto do disco.
Funciona melhor em um navegador Chromium de desktop. Na primeira execução o modelo de voz é baixado, cerca de 200 MB para o Base ou cerca de 600 MB para o Small, e depois fica em cache. Tudo fica na memória, então clipes curtos funcionam melhor.
Por que usar Editor de áudio por texto?
Apague o texto e o áudio é cortado
Selecione uma palavra ou uma frase inteira, aperte backspace e o trecho de mídia correspondente sai. O corte cai no limite da palavra e a reprodução pula ele na hora, então você ouve a edição antes de exportar.
Tire os sons de preenchimento em inglês com um clique
O editor usa uma lista fixa de sons de preenchimento em inglês: um, uh, ah, eh, hm, mm, uh-huh e as grafias mais comuns. Quando a transcrição tem algum deles, aparece um botão Remove fillers com a contagem, e um clique corta todos de uma vez. É uma correspondência literal de palavras, não um critério: like, so e right ficam. A lista é aplicada seja qual for o idioma falado, então numa gravação que não esteja em inglês ela pode marcar uma palavra com significado. É para isso que serve desfazer.
Seu arquivo nunca sai do dispositivo
Não há upload nem processamento no servidor. O navegador lê o arquivo do seu disco, decodifica com WebAssembly e roda o modelo de voz no seu próprio hardware. Nós registramos métricas de produto anônimas, e elas não carregam nomes de arquivo, nem áudio, nem texto.
Sem conta e sem limite de exportação
Sem cadastro, sem marca d'água, sem saldo de créditos, sem versão paga do editor. O que limita você é a sua máquina, não um plano.
Vídeo funciona do mesmo jeito
Solte um MP4, WebM, MOV ou MKV e edite exatamente como áudio. Projetos de vídeo saem em MP4 com vídeo H.264 e áudio AAC, e projetos só de áudio saem em M4A.
Saiba a troca de precisão
O modelo que roda no navegador é pequeno o bastante para caber num notebook, então vai bem com fala limpa e piora com sotaques, vozes sobrepostas, ruído de fundo e idiomas fora o inglês. Para um texto que você vai publicar, ou uma gravação de duas horas, passe primeiro pelo ConvertAudioToText e traga o resultado para o editor.
Como funciona
Solte o seu arquivo
Áudio ou vídeo: MP3, WAV, M4A, MP4, WebM, MOV ou MKV. O navegador lê direto do seu disco, então não tem upload, nem fila, nem barra de progresso para esperar.
O modelo de voz roda na sua máquina
O Whisper roda em um Web Worker na sua própria CPU ou GPU e devolve texto com marcação de tempo em cada palavra, agrupado por locutor. Na primeira vez ele baixa o modelo, cerca de 200 MB para o Base ou cerca de 600 MB para o Small, e depois guarda em cache.
Edite o texto e o áudio acompanha
Apague as palavras que você não quer. A reprodução pula os trechos removidos na hora, então você ouve o resultado antes de assumir o corte.
Exporte o corte final
O ffmpeg.wasm corta e junta de novo os trechos mantidos dentro do navegador e entrega um arquivo para baixar: MP4 para projetos de vídeo, M4A para os que são só áudio.
Editor de áudio por texto versus editores que exigem conta
O que muda quando a edição acontece na sua máquina em vez da deles.
| Recurso | CATT | Editores que exigem conta |
|---|---|---|
| Conta para começar | Nenhuma | Cadastro antes da primeira edição |
| Para onde vai o seu arquivo | Fica no seu dispositivo | Enviado para os servidores deles |
| Custo para exportar | Grátis, sem marca d'água | Tetos do plano grátis, marca d'água ou os dois |
| Instalação | Nenhuma, uma aba do navegador | Muitas vezes um app de desktop para o conjunto completo |
| Como você corta | Apaga as palavras e o áudio acompanha | Varia conforme a ferramenta |
| Gravações longas ou difíceis | Limitado pela memória do navegador | Processadas nos servidores deles |
Perguntas frequentes
É. Não tem conta, cadastro, limite de exportação, marca d'água nem versão paga do editor. Todo o trabalho acontece na sua máquina, então não existe custo por minuto para repassar a você.
Não. O seu navegador lê o arquivo localmente, decodifica e roda o modelo de voz no seu próprio hardware. A mídia, o áudio e o texto nunca saem do dispositivo. As únicas requisições de rede da página são o próprio app, o download único do modelo e métricas de produto anônimas que não contêm dados do arquivo.
Porque o modelo de voz roda na sua máquina e antes precisa chegar até ela. O Whisper Base tem cerca de 200 MB e o Whisper Small cerca de 600 MB. O navegador guarda o modelo em cache depois dessa primeira vez, então a transcrição e a exportação continuam funcionando se a conexão cair. Carregar a página ainda precisa de rede: não há cache do aplicativo para uso offline.
Um navegador Chromium recente no desktop, ou seja Chrome, Edge, Brave ou Arc. O editor precisa de SharedArrayBuffer e usa WebGPU quando a sua máquina expõe, caindo para WebAssembly quando não. O Firefox funciona, mas costuma ser mais lento. Safari e a maioria dos navegadores de celular não são confiáveis para essa carga.
Nós não impomos limite, mas o seu navegador impõe. Tudo fica na memória, então um notebook fica confortável com clipes de até uns dez a vinte minutos e fica lento ou fica sem memória depois disso. Para uma entrevista de duas horas, passe primeiro pelo ConvertAudioToText e traga o texto para o editor.
Pode. Escolha Importar no menu de origem e carregue um arquivo de texto com marcação de tempo que você já tenha. Pular o modelo local significa nenhum download e nenhuma espera, e é o caminho mais rápido para gravações longas.
Whisper Base e Small são os dois modelos pequenos o bastante para rodar em uma aba, então trocam precisão por tamanho. Vão bem com fala limpa e pioram bastante com sotaques, vozes sobrepostas, ruído de fundo ou áudio que não seja em inglês. Para um texto que você vai publicar, use os modelos maiores do ConvertAudioToText.
Projetos de vídeo saem em MP4 com vídeo H.264 e áudio AAC. Projetos só de áudio saem em M4A. Os dois são escritos pelo ffmpeg.wasm dentro do seu navegador e salvos direto no seu disco.
Um cortador trabalha na forma de onda: você escolhe um tempo de início e um de fim. Aqui se trabalha nas palavras: você lê o texto e apaga o que não quer, e o corte cai no limite da palavra. Use o cortador quando souber os tempos, e este quando souber a frase.
Ferramentas relacionadas
Alternativa gratuita ao Descript
A parte do Descript em que você edita pelo texto, grátis no seu navegador. Não o resto da suíte, e aqui dizemos o que falta.
Cortador de Áudio
Corte e recorte arquivos de áudio na duração exata que você precisa
Transcrição de Podcasts
Transforme os episódios do seu podcast em texto pesquisável e compartilhável