Conversion

Éditeur audio par texte : modifier l'audio en modifiant le texte, en ligne et gratuit

Supprimez un mot dans le texte et l'audio part avec lui. Gratuit, dans votre navigateur.

Un éditeur audio par texte transforme votre enregistrement en texte avec un horodatage sur chaque mot, puis coupe l'audio quand vous coupez le texte. Supprimez une phrase et la portion d'audio correspondante disparaît avec elle. CATT Editor le fait gratuitement sur edit.convertaudiototext.com, sans compte, et chaque étape se déroule dans votre propre navigateur.

L'éditeur est une application gratuite distincte, sur edit.convertaudiototext.com. Il s'ouvre dans un nouvel onglet, ne demande rien et lit votre fichier directement depuis votre disque.

Fonctionne mieux dans un navigateur Chromium de bureau. Au premier lancement, le modèle vocal est téléchargé, environ 200 Mo pour Base ou environ 600 Mo pour Small, puis mis en cache. Tout reste en mémoire, donc les clips courts conviennent le mieux.

Pourquoi utiliser Éditeur audio par texte ?

Supprimez le texte, l'audio est coupé

Sélectionnez un mot ou une phrase entière, appuyez sur retour arrière, et la portion de média correspondante disparaît. La coupe tombe sur la limite du mot et la lecture la saute aussitôt, donc vous entendez le montage avant de l'exporter.

Retirez les sons de remplissage anglais en un clic

L'éditeur s'appuie sur une liste fixe de sons de remplissage anglais : um, uh, ah, eh, hm, mm, uh-huh et leurs graphies courantes. Quand la transcription en contient, un bouton Remove fillers apparaît avec le décompte, et un clic les coupe tous d'un coup. C'est une correspondance littérale, pas un jugement : like, so et right restent. La liste s'applique quelle que soit la langue parlée, donc sur un enregistrement qui n'est pas en anglais elle peut marquer un mot porteur de sens. C'est à cela que sert l'annulation.

Votre fichier ne quitte jamais l'appareil

Il n'y a aucun envoi ni traitement côté serveur. Le navigateur lit le fichier sur votre disque, le décode en WebAssembly et exécute le modèle vocal sur votre propre matériel. Nous enregistrons bien des statistiques produit anonymes, sans nom de fichier, sans audio et sans texte.

Sans compte, sans limite d'export

Pas d'inscription, pas de filigrane, pas de solde de crédits, pas de version payante de l'éditeur. Ce qui vous limite, c'est votre machine, pas un forfait.

Les vidéos fonctionnent pareil

Déposez un MP4, WebM, MOV ou MKV et montez-le exactement comme de l'audio. Les projets vidéo s'exportent en MP4 avec vidéo H.264 et audio AAC, les projets audio uniquement en M4A.

Connaissez le compromis de précision

Le modèle embarqué est assez petit pour tourner sur un portable : il est bon sur une parole nette et se dégrade avec les accents, les voix qui se chevauchent, le bruit de fond et les langues autres que l'anglais. Pour un texte destiné à la publication, ou un enregistrement de deux heures, passez-le d'abord par ConvertAudioToText et ramenez le résultat dans l'éditeur.

Comment ça marche

1

Déposez votre fichier

Audio ou vidéo : MP3, WAV, M4A, MP4, WebM, MOV ou MKV. Le navigateur le lit directement sur votre disque, donc pas d'envoi, pas de file d'attente et pas de barre de progression à surveiller.

2

Le modèle vocal tourne sur votre machine

Whisper s'exécute dans un Web Worker sur votre propre CPU ou GPU et renvoie un texte horodaté mot par mot, groupé par locuteur. Le premier lancement télécharge le modèle, environ 200 Mo pour Base ou environ 600 Mo pour Small, puis le met en cache.

3

Modifiez le texte, l'audio suit

Supprimez les mots dont vous ne voulez pas. La lecture saute immédiatement les portions retirées, donc vous entendez le résultat avant de le valider.

4

Exportez le montage final

ffmpeg.wasm coupe et recolle les portions conservées dans le navigateur et vous rend un fichier à télécharger : MP4 pour les projets vidéo, M4A pour les projets audio uniquement.

Éditeur audio par texte face aux éditeurs qui exigent un compte

Ce qui change quand le montage se fait sur votre machine plutôt que sur la leur.

FonctionnalitéCATTÉditeurs qui exigent un compte
Compte pour démarrerAucunInscription avant le premier montage
Où va votre fichierIl reste sur votre appareilEnvoyé sur leurs serveurs
Coût de l'exportGratuit, sans filigranePlafonds de l'offre gratuite, filigranes ou les deux
InstallationAucune, un onglet de navigateurSouvent une application de bureau pour tout
Comment vous coupezVous supprimez les mots, l'audio suitVariable selon l'outil
Enregistrements longs ou difficilesPlafonné par la mémoire de votre navigateurTraités sur leurs serveurs

Questions fréquentes

Oui. Pas de compte, pas d'inscription, pas de limite d'export, pas de filigrane et pas de version payante de l'éditeur. Tout le travail se fait sur votre machine, il n'y a donc aucun coût à la minute à vous répercuter.

Non. Votre navigateur lit le fichier en local, le décode et exécute le modèle vocal sur votre propre matériel. Le média, l'audio et le texte ne quittent jamais l'appareil. Les seules requêtes réseau de la page sont l'application elle-même, le téléchargement unique du modèle et des statistiques produit anonymes qui ne contiennent aucune donnée de fichier.

Parce que le modèle vocal tourne sur votre machine, il doit d'abord y arriver. Whisper Base pèse environ 200 Mo et Whisper Small environ 600 Mo. Le navigateur met le modèle en cache après ce premier lancement, si bien que la transcription et l'export continuent de fonctionner si la connexion tombe. Charger la page, elle, demande toujours le réseau : il n'y a pas de cache applicatif hors ligne.

Un navigateur Chromium récent sur ordinateur, donc Chrome, Edge, Brave ou Arc. L'éditeur a besoin de SharedArrayBuffer et utilise WebGPU quand votre machine l'expose, avec WebAssembly en repli. Firefox fonctionne mais reste généralement plus lent. Safari et la plupart des navigateurs mobiles ne sont pas fiables pour cette charge.

Nous n'imposons pas de limite, mais votre navigateur en impose une. Tout est gardé en mémoire, donc un portable est à l'aise avec des extraits d'environ dix à vingt minutes et ralentit ou manque de mémoire au-delà. Pour un entretien de deux heures, passez-le d'abord par ConvertAudioToText et ramenez le texte dans l'éditeur.

Oui. Choisissez Importer dans le menu source et chargez un fichier texte horodaté que vous possédez déjà. Sauter le modèle local supprime le téléchargement et l'attente, et c'est le chemin le plus rapide pour les longs enregistrements.

Whisper Base et Small sont les deux modèles assez petits pour tourner dans un onglet, ils échangent donc de la précision contre de la taille. Ils sont bons sur une parole nette et se dégradent nettement avec les accents, les voix qui se chevauchent, le bruit de fond ou un audio qui n'est pas en anglais. Pour un texte destiné à la publication, utilisez les grands modèles de ConvertAudioToText.

Les projets vidéo s'exportent en MP4 avec vidéo H.264 et audio AAC. Les projets audio uniquement s'exportent en M4A. Les deux sont écrits par ffmpeg.wasm dans votre navigateur et enregistrés directement sur votre disque.

Un découpeur travaille sur la forme d'onde : vous choisissez un début et une fin. Ici on travaille sur les mots : vous lisez le texte et supprimez ce dont vous ne voulez pas, et la coupe tombe sur la limite du mot. Prenez le découpeur quand vous connaissez les minutages, et ceci quand vous connaissez la phrase.

Need to convert video files?

Try ConvertIntoMP4. 268 formats supported, free to use.

Prêt à transcrire ?

Commencez à transcrire gratuitement. Sans carte bancaire.

10 minutes offertes · Sans carte bancaire