Conversão

Editor de áudio por texto: edite áudio editando texto, online e grátis

Apague uma palavra do texto e o áudio vai junto. Grátis, no seu navegador.

Um editor de áudio por texto transforma a sua gravação em texto com marcação de tempo em cada palavra e depois corta o áudio quando você corta o texto. Apague uma frase e o trecho de áudio correspondente vai junto. O CATT Editor faz isso de graça em edit.convertaudiototext.com, sem conta, e cada etapa acontece dentro do seu próprio navegador.

O editor é um app gratuito separado, em edit.convertaudiototext.com. Ele abre em uma nova aba, não pede nada e lê o seu arquivo direto do disco.

Funciona melhor em um navegador Chromium de desktop. Na primeira execução o modelo de voz é baixado, cerca de 200 MB para o Base ou cerca de 600 MB para o Small, e depois fica em cache. Tudo fica na memória, então clipes curtos funcionam melhor.

Por que usar Editor de áudio por texto?

Apague o texto e o áudio é cortado

Selecione uma palavra ou uma frase inteira, aperte backspace e o trecho de mídia correspondente sai. O corte cai no limite da palavra e a reprodução pula ele na hora, então você ouve a edição antes de exportar.

Tire os sons de preenchimento em inglês com um clique

O editor usa uma lista fixa de sons de preenchimento em inglês: um, uh, ah, eh, hm, mm, uh-huh e as grafias mais comuns. Quando a transcrição tem algum deles, aparece um botão Remove fillers com a contagem, e um clique corta todos de uma vez. É uma correspondência literal de palavras, não um critério: like, so e right ficam. A lista é aplicada seja qual for o idioma falado, então numa gravação que não esteja em inglês ela pode marcar uma palavra com significado. É para isso que serve desfazer.

Seu arquivo nunca sai do dispositivo

Não há upload nem processamento no servidor. O navegador lê o arquivo do seu disco, decodifica com WebAssembly e roda o modelo de voz no seu próprio hardware. Nós registramos métricas de produto anônimas, e elas não carregam nomes de arquivo, nem áudio, nem texto.

Sem conta e sem limite de exportação

Sem cadastro, sem marca d'água, sem saldo de créditos, sem versão paga do editor. O que limita você é a sua máquina, não um plano.

Vídeo funciona do mesmo jeito

Solte um MP4, WebM, MOV ou MKV e edite exatamente como áudio. Projetos de vídeo saem em MP4 com vídeo H.264 e áudio AAC, e projetos só de áudio saem em M4A.

Saiba a troca de precisão

O modelo que roda no navegador é pequeno o bastante para caber num notebook, então vai bem com fala limpa e piora com sotaques, vozes sobrepostas, ruído de fundo e idiomas fora o inglês. Para um texto que você vai publicar, ou uma gravação de duas horas, passe primeiro pelo ConvertAudioToText e traga o resultado para o editor.

Como funciona

1

Solte o seu arquivo

Áudio ou vídeo: MP3, WAV, M4A, MP4, WebM, MOV ou MKV. O navegador lê direto do seu disco, então não tem upload, nem fila, nem barra de progresso para esperar.

2

O modelo de voz roda na sua máquina

O Whisper roda em um Web Worker na sua própria CPU ou GPU e devolve texto com marcação de tempo em cada palavra, agrupado por locutor. Na primeira vez ele baixa o modelo, cerca de 200 MB para o Base ou cerca de 600 MB para o Small, e depois guarda em cache.

3

Edite o texto e o áudio acompanha

Apague as palavras que você não quer. A reprodução pula os trechos removidos na hora, então você ouve o resultado antes de assumir o corte.

4

Exporte o corte final

O ffmpeg.wasm corta e junta de novo os trechos mantidos dentro do navegador e entrega um arquivo para baixar: MP4 para projetos de vídeo, M4A para os que são só áudio.

Editor de áudio por texto versus editores que exigem conta

O que muda quando a edição acontece na sua máquina em vez da deles.

RecursoCATTEditores que exigem conta
Conta para começarNenhumaCadastro antes da primeira edição
Para onde vai o seu arquivoFica no seu dispositivoEnviado para os servidores deles
Custo para exportarGrátis, sem marca d'águaTetos do plano grátis, marca d'água ou os dois
InstalaçãoNenhuma, uma aba do navegadorMuitas vezes um app de desktop para o conjunto completo
Como você cortaApaga as palavras e o áudio acompanhaVaria conforme a ferramenta
Gravações longas ou difíceisLimitado pela memória do navegadorProcessadas nos servidores deles

Perguntas frequentes

É. Não tem conta, cadastro, limite de exportação, marca d'água nem versão paga do editor. Todo o trabalho acontece na sua máquina, então não existe custo por minuto para repassar a você.

Não. O seu navegador lê o arquivo localmente, decodifica e roda o modelo de voz no seu próprio hardware. A mídia, o áudio e o texto nunca saem do dispositivo. As únicas requisições de rede da página são o próprio app, o download único do modelo e métricas de produto anônimas que não contêm dados do arquivo.

Porque o modelo de voz roda na sua máquina e antes precisa chegar até ela. O Whisper Base tem cerca de 200 MB e o Whisper Small cerca de 600 MB. O navegador guarda o modelo em cache depois dessa primeira vez, então a transcrição e a exportação continuam funcionando se a conexão cair. Carregar a página ainda precisa de rede: não há cache do aplicativo para uso offline.

Um navegador Chromium recente no desktop, ou seja Chrome, Edge, Brave ou Arc. O editor precisa de SharedArrayBuffer e usa WebGPU quando a sua máquina expõe, caindo para WebAssembly quando não. O Firefox funciona, mas costuma ser mais lento. Safari e a maioria dos navegadores de celular não são confiáveis para essa carga.

Nós não impomos limite, mas o seu navegador impõe. Tudo fica na memória, então um notebook fica confortável com clipes de até uns dez a vinte minutos e fica lento ou fica sem memória depois disso. Para uma entrevista de duas horas, passe primeiro pelo ConvertAudioToText e traga o texto para o editor.

Pode. Escolha Importar no menu de origem e carregue um arquivo de texto com marcação de tempo que você já tenha. Pular o modelo local significa nenhum download e nenhuma espera, e é o caminho mais rápido para gravações longas.

Whisper Base e Small são os dois modelos pequenos o bastante para rodar em uma aba, então trocam precisão por tamanho. Vão bem com fala limpa e pioram bastante com sotaques, vozes sobrepostas, ruído de fundo ou áudio que não seja em inglês. Para um texto que você vai publicar, use os modelos maiores do ConvertAudioToText.

Projetos de vídeo saem em MP4 com vídeo H.264 e áudio AAC. Projetos só de áudio saem em M4A. Os dois são escritos pelo ffmpeg.wasm dentro do seu navegador e salvos direto no seu disco.

Um cortador trabalha na forma de onda: você escolhe um tempo de início e um de fim. Aqui se trabalha nas palavras: você lê o texto e apaga o que não quer, e o corte cai no limite da palavra. Use o cortador quando souber os tempos, e este quando souber a frase.

Need to convert video files?

Try ConvertIntoMP4. 268 formats supported, free to use.

Pronto para transcrever?

Comece a transcrever gratuitamente. Sem cartão de crédito.

10 minutos grátis · Sem cartão de crédito