Textbasierter Audio-Editor: Audio bearbeiten, indem Sie Text bearbeiten, online und kostenlos
Löschen Sie ein Wort im Text, und das Audio verschwindet mit. Kostenlos, im Browser.
Ein textbasierter Audio-Editor verwandelt Ihre Aufnahme in Text mit einem Zeitstempel auf jedem Wort und schneidet dann das Audio, wenn Sie den Text schneiden. Löschen Sie einen Satz, und der zugehörige Audioabschnitt geht mit. CATT Editor macht das kostenlos auf edit.convertaudiototext.com, ohne Konto, und jeder Schritt läuft in Ihrem eigenen Browser-Tab.
Der Editor ist eine eigenständige kostenlose App unter edit.convertaudiototext.com. Er öffnet sich in einem neuen Tab, verlangt nichts und liest Ihre Datei direkt von Ihrer Festplatte.
Funktioniert am besten in einem Chromium-Desktop-Browser. Beim ersten Start wird das Sprachmodell geladen, etwa 200 MB für Base oder etwa 600 MB für Small, danach liegt es im Cache. Alles bleibt im Arbeitsspeicher, kurze Clips laufen also am besten.
Warum Textbasierter Audio-Editor nutzen?
Text löschen, Audio schneiden
Markieren Sie ein Wort oder einen ganzen Satz, drücken Sie die Rücktaste, und der zugehörige Medienabschnitt verschwindet. Der Schnitt liegt auf der Wortgrenze, und die Wiedergabe überspringt ihn sofort, Sie hören den Schnitt also vor dem Export.
Englische Füllwörter mit einem Klick entfernen
Der Editor arbeitet mit einer festen Liste englischer Füllwörter: um, uh, ah, eh, hm, mm, uh-huh und ihren gängigen Schreibweisen. Sobald das Transkript eines davon enthält, erscheint ein Remove-fillers-Button mit der Anzahl, und ein Klick schneidet alle auf einmal heraus. Es ist ein reiner Wortabgleich und keine Abwägung, also bleiben like, so und right stehen. Abgeglichen wird unabhängig von der gesprochenen Sprache: In einer nicht englischen Aufnahme kann die Liste ein Wort treffen, das Bedeutung trägt. Dafür gibt es Rückgängig.
Ihre Datei verlässt das Gerät nie
Es gibt keinen Upload und keine serverseitige Verarbeitung. Der Browser liest die Datei von Ihrer Festplatte, dekodiert sie mit WebAssembly und führt das Sprachmodell auf Ihrer eigenen Hardware aus. Wir erfassen anonyme Produktstatistiken, und die enthalten keine Dateinamen, kein Audio und keinen Text.
Kein Konto, keine Exportgrenzen
Keine Anmeldung, kein Wasserzeichen, kein Guthaben, keine Bezahlversion des Editors. Was Sie begrenzt, ist Ihr Rechner, nicht ein Tarif.
Videodateien funktionieren genauso
Legen Sie MP4, WebM, MOV oder MKV ab und bearbeiten Sie es genau wie Audio. Videoprojekte werden als MP4 mit H.264-Video und AAC-Audio exportiert, reine Audioprojekte als M4A.
Kennen Sie den Genauigkeitskompromiss
Das Modell im Browser ist klein genug für einen Laptop, also ist es gut bei sauberer Sprache und wird schlechter bei Akzenten, Durcheinanderreden, Hintergrundgeräuschen und anderen Sprachen als Englisch. Für Text, den Sie veröffentlichen wollen, oder eine zweistündige Aufnahme, schicken Sie die Datei zuerst durch ConvertAudioToText und holen Sie das Ergebnis in den Editor.
So funktioniert es
Datei ablegen
Audio oder Video: MP3, WAV, M4A, MP4, WebM, MOV oder MKV. Der Browser liest sie direkt von Ihrer Festplatte, es gibt also keinen Upload, keine Warteschlange und keinen Fortschrittsbalken.
Das Sprachmodell läuft auf Ihrem Rechner
Whisper läuft in einem Web Worker auf Ihrer eigenen CPU oder GPU und liefert Text mit einem Zeitstempel auf jedem einzelnen Wort, nach Sprecher gruppiert. Der erste Lauf lädt das Modell, etwa 200 MB für Base oder etwa 600 MB für Small, und legt es dann im Cache ab.
Text bearbeiten, Audio folgt
Löschen Sie die Wörter, die Sie nicht wollen. Die Wiedergabe überspringt die entfernten Abschnitte sofort, Sie hören das Ergebnis also, bevor Sie sich festlegen.
Den fertigen Schnitt exportieren
ffmpeg.wasm schneidet und fügt die behaltenen Abschnitte im Browser wieder zusammen und gibt Ihnen eine Datei zum Herunterladen: MP4 für Videoprojekte, M4A für reine Audioprojekte.
Textbasierter Audio-Editor gegenüber Editoren mit Kontopflicht
Was sich ändert, wenn die Bearbeitung auf Ihrem Rechner statt auf deren Servern läuft.
| Funktion | CATT | Editoren mit Kontopflicht |
|---|---|---|
| Konto zum Start | Keins | Anmeldung vor der ersten Bearbeitung |
| Wohin Ihre Datei geht | Bleibt auf Ihrem Gerät | Wird auf deren Server hochgeladen |
| Kosten für den Export | Kostenlos, ohne Wasserzeichen | Grenzen im Gratistarif, Wasserzeichen oder beides |
| Installation | Keine, ein Browser-Tab | Oft eine Desktop-App für den vollen Funktionsumfang |
| Wie Sie schneiden | Wörter löschen, das Audio folgt | Je nach Tool verschieden |
| Lange oder schwierige Aufnahmen | Durch den Browser-Speicher begrenzt | Werden auf deren Servern verarbeitet |
Häufig gestellte Fragen
Ja. Kein Konto, keine Anmeldung, keine Exportgrenze, kein Wasserzeichen und keine Bezahlversion des Editors. Die gesamte Arbeit passiert auf Ihrem eigenen Rechner, es gibt also keine Kosten pro Minute, die wir weitergeben müssten.
Nein. Ihr Browser liest die Datei lokal, dekodiert sie und führt das Sprachmodell auf Ihrer eigenen Hardware aus. Die Medien, das Audio und der Text verlassen das Gerät nie. Die einzigen Netzwerkanfragen der Seite sind die App selbst, der einmalige Modell-Download und anonyme Produktstatistiken ohne Dateidaten.
Weil das Sprachmodell auf Ihrem Rechner läuft, muss es zuerst dorthin gelangen. Whisper Base ist rund 200 MB groß, Whisper Small rund 600 MB. Der Browser legt das Modell nach diesem ersten Lauf im Cache ab, Transkription und Export laufen also weiter, wenn die Verbindung abbricht. Die Seite selbst zu laden braucht weiterhin Netz: einen Offline-Cache der Anwendung gibt es nicht.
Einen aktuellen Chromium-Browser auf dem Desktop, also Chrome, Edge, Brave oder Arc. Der Editor braucht SharedArrayBuffer und nutzt WebGPU, wenn Ihr Rechner es bereitstellt, sonst WebAssembly. Firefox funktioniert, ist aber meist langsamer. Safari und die meisten mobilen Browser sind für diese Last nicht zuverlässig.
Wir setzen keine Grenze, Ihr Browser schon. Alles liegt im Arbeitsspeicher, ein Laptop kommt also mit Clips bis etwa zehn bis zwanzig Minuten gut zurecht und wird darüber langsam oder der Speicher geht aus. Für ein zweistündiges Interview schicken Sie die Datei zuerst durch ConvertAudioToText und holen den Text in den Editor.
Ja. Wählen Sie im Quellmenü Importieren und laden Sie eine vorhandene Textdatei mit Zeitstempeln. Wer das lokale Modell überspringt, spart Download und Wartezeit, und das ist der schnellste Weg für lange Aufnahmen.
Whisper Base und Small sind die beiden Modelle, die klein genug für einen Browser-Tab sind, sie tauschen also Genauigkeit gegen Größe. Sie sind gut bei sauberer Sprache und deutlich schlechter bei Akzenten, Durcheinanderreden, Hintergrundgeräuschen oder nicht englischem Audio. Für Text, den Sie veröffentlichen wollen, nutzen Sie die größeren Modelle auf ConvertAudioToText.
Videoprojekte werden als MP4 mit H.264-Video und AAC-Audio exportiert. Reine Audioprojekte als M4A. Beides schreibt ffmpeg.wasm in Ihrem Browser und speichert es direkt auf Ihrer Festplatte.
Ein Audio-Schneider arbeitet an der Wellenform: Sie wählen eine Startzeit und eine Endzeit. Das hier arbeitet an den Wörtern: Sie lesen den Text und löschen, was Sie nicht wollen, und der Schnitt liegt auf der Wortgrenze. Nehmen Sie den Schneider, wenn Sie die Zeitstempel kennen, und das hier, wenn Sie den Satz kennen.
Ähnliche Tools
Kostenlose Descript-Alternative
Der Teil von Descript, bei dem Sie über den Text schneiden, kostenlos im Browser. Nicht der Rest der Suite, und wir sagen, was fehlt.
Audio-Schneider
Audiodateien auf die exakt benötigte Länge zuschneiden und kürzen
Podcast-Transkription
Verwandeln Sie Podcast-Folgen in durchsuchbaren, teilbaren Text