
Musik in der Transkription richtig handhaben (ehrlicher Ratgeber 2026)
Summarize this article with:
Musik in einer Audiodatei ist einer der wenigen Fälle, in denen KI-Transkriptionsmodelle auf vorhersehbare, behebbare Weise versagen. Gesang erzeugt teilweise falsche Liedtexte. Instrumentale Passagen lösen halluzinierten Fülltext oder frei erfundene Phrasen aus. Kein großer Transkriptionsdienst bietet derzeit eine dedizierte Funktion zur Musikerkennung oder Musikunterdrückung an, daher liegen die zuverlässigen Lösungen vorgelagert: Schneiden Sie die Musik heraus, bevor Sie transkribieren, oder isolieren Sie die Sprachspur mit einem Source-Separation-Tool, bevor Sie die Datei an irgendeine Engine senden.
Musik in Ihrem Transkript zeigt sich als eines von zwei Problemen: wirre Pseudo-Liedtexte dort, wo ein Song lief, oder halluzinierter Fülltext über einem Instrumentalteil. Beide haben dieselbe Ursache, und für beide gibt es praktische Lösungen. Die entscheidende Erkenntnis: Keine der großen Transkriptions-Engines – weder Whisper noch Deepgram Nova-3 noch AssemblyAI – verfügt über eine geprüfte, dedizierte Musikerkennungsebene, die diese Segmente automatisch unterdrückt. Die zuverlässigen Lösungen greifen vor der Transkription, nicht innerhalb derselben.

Was Ihr Transkript Ihnen tatsächlich verrät
Das Symptom ist fast immer eines von drei Dingen.
Wirre Pseudo-Liedtexte über einer Gesangspassage. Ihr Podcast spielt einen 30-sekündigen Songausschnitt für eine Rezension. Das Transkript füllt diese Zeit mit unvollständigen, falschen Liedtextzeilen: Wörter aus dem Song vermischt mit erfundenen Wörtern, kaputter Zeichensetzung und Satzabbrüchen dort, wo das Modell die Sicherheit verlor.
Halluzinierter Fülltext über instrumentaler Musik. Ihr Intro-Jingle ist rein instrumental. Das Transkript produziert „also“, „ähm“, „wissen Sie“ oder sogar kohärent wirkende, erfundene Sätze. Eine im Mai 2025 veröffentlichte Studie ergab, dass Whisper large-v3 bei über 55 % der nichtsprachlichen Audio-Samples „so“ transkribiert und bei nahezu 100 % der Umgebungsklang-Eingaben halluziniert. Musik wird nicht gesondert behandelt.
Unvollständiges Kauderwelsch, wenn Musik unter Sprache läuft. Ihr Moderator spricht über einem Musikbett. Das Transkript erfasst die Sprache, verstümmelt aber Wörter an den Rändern musikalischer Phrasen, weil das Modell versucht, zwei Audioquellen gleichzeitig in Einklang zu bringen.
Wenn Sie verstehen, welches Symptom vorliegt, wissen Sie, welche Lösung Sie zuerst angehen sollten.
Warum KI-Engines das nicht automatisch lösen
Eine verbreitete Annahme ist, dass moderne Tools Musik „erkennen und markieren“. Genau das sagen die Herstellerdokumentationen jedoch nicht.
Die Dokumentation von Deepgram Nova-3 (geprüft im Juli 2026) nennt mehrsprachige Echtzeittranskription, Anpassung des Wortschatzes und Keyterm-Prompting. Eine Funktion zur Musikerkennung oder Musikunterdrückung taucht nicht auf.
Die Audio-Intelligence-Dokumentation von AssemblyAI (geprüft im Juli 2026) listet automatische Kapitel, Sentiment-Analyse, Entitätenerkennung, Themenerkennung und Zusammenfassungen auf. Musikerkennung wird nicht als Funktion genannt.
Das [Music]-Label, das in YouTube-Autountertiteln auftaucht, stammt von einer separaten Klassifizierungsebene, die Google seiner Pipeline hinzufügt – nicht von Whispers Decoder. Whispers eigene Ausgabe bei Musiksegmenten ist kein sauberes Tag.
Was Whisper tatsächlich mit Musik macht, ist in seinen GitHub-Diskussionsthreads und in veröffentlichter Forschung dokumentiert: Die Liste der Suppress-Tokens des Modells bewirkt, dass Hintergrundgeräusche nicht als [music], [applause] oder Ähnliches markiert werden, sodass die Dekodierung in nichtsprachliches Audio fortgesetzt wird, bis das Modell Sprache halluziniert. Die Ausgabe wirkt plausibel, was sie schwerer erkennbar macht als Stille es wäre.
Voice Activity Detection (VAD) hilft, löst das Problem aber nicht. VAD entfernt Stille zuverlässig. Musik trägt Energie in den Frequenzbändern, die VAD als Sprache einstuft, daher gelangen musikalische Passagen häufig ungefiltert hindurch. WhisperX nutzt VAD standardmäßig und erzeugt dennoch Musik-Halluzinationen.
Lösung 1: Musik vor dem Transkribieren herausschneiden
Bei vorhersehbarer, struktureller Musik (Intros, Outros, Bumper) ist dies die schnellste und zuverlässigste Lösung. Ihre ursprüngliche Veröffentlichungsdatei bleibt unverändert. Sie erstellen einen separaten „Transkriptions-Cut“ ohne die Musik, transkribieren diesen und fügen im Transkript manuelle Marker an den Stellen ein, an denen die Musik war.
Audacity erledigt das kostenlos. Markieren Sie das Musiksegment, löschen Sie es (oder stellen Sie es stumm, wenn Sie das Timing erhalten möchten), exportieren Sie die bereinigte Datei und transkribieren Sie die saubere Datei. Bei einem 10-sekündigen Podcast-Intro machen Sie das einmal und legen es als festen Workflow ab.
Bei Inhalten mit überall verteilten Musikpassagen (eine Musikrezensions-Sendung, ein Bildungs-Podcast mit Songbeispielen) kommt im Workflow ein Zeitstempel-Schritt hinzu:
- Listen Sie jedes Musiksegment mit Start- und Endzeit auf.
- Schneiden Sie jedes Segment aus der Transkriptionskopie heraus.
- Transkribieren Sie die Kopie nur mit Sprache.
- Fügen Sie die Marker an den richtigen Zeitstempeln wieder ins Transkript ein: [Song: „Titel“ von Interpret, 14:22-15:04].
Das bedeutet mehr Vorarbeit, liefert aber ein Transkript, das Sie tatsächlich für SEO, Shownotes, Suche oder Barrierefreiheit nutzen können.
Lösung 2: Die Sprachspur per Source Separation trennen
Wenn Sprache und Musik gleichzeitig laufen, kommt Herausschneiden nicht infrage, weil beide ineinander gemischt sind. Das ist der Fall, wenn ein Moderator über einem Musikbett spricht, ein Gast redet, während im Hintergrund ein Song läuft, oder bei einer Aufnahme bei einer Live-Veranstaltung.
Source-Separation-Tools zerlegen eine gemischte Audiodatei in einzelne Spuren.
Demucs v4 (Facebook Research, Open Source, auch als htdemucs bekannt) trennt Audio in Gesang, Schlagzeug, Bass und andere Instrumente. Nehmen Sie die Vocals/Other-Spur und transkribieren Sie diese. Demucs v4 erreicht 9,0 dB SDR auf MUSDB-HQ-Benchmarks, was in der Praxis eine recht saubere Sprachisolierung bedeutet. Es läuft über Python oder über Cloud-Dienste wie Replicate für Teams ohne lokale GPU-Kapazität.
Spleeter (Deezer, Open Source) bietet 2-Stem- (Gesang, Begleitung), 4-Stem- und 5-Stem-Trennungsmodi. Es ist schneller als Demucs auf der CPU, wird bei musikalischen Trennungsaufgaben aber allgemein schlechter bewertet. Für Szenarien mit Sprache über Musik funktioniert beides.
Source Separation kostet Verarbeitungszeit und bringt eigene Artefakte mit sich. Bei einer einmaligen Aufnahme mit deutlicher Hintergrundmusik lohnt sich der Qualitätszugewinn. Bei einem Podcast, in dem Musik nur in kurzen Bumpern auftaucht, ist Herausschneiden einfacher.
Lösung 3: Selbst gehostetes Whisper konfigurieren, um Nicht-Sprache zu unterdrücken
Wenn Sie Whisper selbst betreiben, reduzieren zwei Parameter die Musik-Halluzinationen (ohne sie ganz zu beseitigen).
no_speech_threshold legt die Wahrscheinlichkeit fest, ab der Whisper entscheidet, dass ein Segment keine Sprache enthält, und die Ausgabe unterdrückt. Ein höherer Wert (Richtung 1.0) macht das Modell aggressiver beim Verwerfen von Segmenten, bei denen es unsicher ist. Der Nachteil: Auch wirklich leise Sprache kann verworfen werden.
initial_prompt prägt die Erwartungen des Modells, bevor die Dekodierung beginnt. Wenn Sie das Audio als Podcast oder Interview einrahmen, verschiebt sich die A-priori-Wahrscheinlichkeit Richtung Konversationssprache. Der initial_prompt-Effekt hält nur für die ersten 30 Sekunden an, bevor er durch die Dekodierung der nachfolgenden Segmente überschrieben wird – daher ist er bei kurzen Dateien nützlicher als bei Langformat-Audio.
result = model.transcribe(
audio_file,
no_speech_threshold=0.8,
condition_on_previous_text=True,
initial_prompt="The following is a podcast interview. Music sections are not spoken content."
)
Das reduziert halluzinierte Ausgaben bei nichtsprachlichen Segmenten, erzeugt aber nicht zuverlässig saubere [Music]-Tags. Bei Gesangsmusik versucht das Modell insbesondere weiterhin, den Liedtext zu transkribieren. VAD-Vorverarbeitung schränkt das Audio vor der Dekodierung auf wahrscheinliche Sprachfenster ein und ist bei großen Dateien der stärkere der beiden Ansätze.
Diese Einstellungen sind relevant für selbst gehostetes Whisper über die Python-Bibliothek openai-whisper oder faster-whisper. Gehostete APIs bieten weniger Parameter an.
Lösung 4: Nachbearbeitung, um Musikabschnitte zu entfernen
Wenn Sie das Audio vor der Transkription nicht ändern können, zeigt das Transkript selbst erkennbare Zeichen einer Musikkontamination.
Musik-Halluzinationen zeigen sich typischerweise als: sich wiederholende kurze Phrasen, ungewöhnliche Eigennamen, Sätze, die semantisch nicht zum umgebenden Inhalt passen, oder plötzliche Wechsel in der Zeichensetzungsdichte. Ein Skript oder sorgfältiges Durchlesen kann diese Segmente zur Überprüfung markieren.
Ersetzen Sie die markierten Abschnitte durch explizite Marker:
[Intro music: 0:00-0:12]
[Song clip: 22:40-23:10]
Das ist sauberer, als wirren Text in einem Transkript zu belassen, das Sie für Shownotes, Untertitel oder die Suchindizierung verwenden werden. Nachgelagerte Zusammenfassungstools behandeln halluzinierte Liedtexte als Inhalt und liefern falsche Zusammenfassungen, wenn Sie sie drinlassen.
Konkrete Szenarien
Podcast mit Musik-Intro und -Outro
Schneiden Sie die Musik vor dem Transkribieren heraus. Wenn Sie jede Episode im selben Format veröffentlichen, erstellen Sie eine Vorlage für den Transkriptions-Cut, die an der Stelle beginnt, an der der Moderator zu sprechen beginnt. Bei Podcast-Transkriptions-Workflows mit mehreren Episoden pro Woche spart ein einmaliges Setup Stunden.
Musikrezensionen oder Bildungscontent
Sie werden überall verstreute Songausschnitte haben. Bauen Sie den in Lösung 1 beschriebenen Zeitstempel-Listen-Workflow in Ihren Produktionsprozess ein. Notieren Sie den Zeitstempel jedes Clips, bevor Sie Audio an ein Transkriptionstool senden. Nach der Transkription fügen Sie die Marker an den richtigen Stellen ein. Dies ist der einzige Ansatz, der für diese Art von Inhalt ein genaues Transkript liefert.
Aufnahme mit Musikbett im Hintergrund
Source Separation ist das richtige Werkzeug, wenn Audioqualität zählt. Ist die Musik leise und die Sprache klar, hilft manchmal ein höherer no_speech_threshold in selbst gehostetem Whisper. Leichte Genauigkeitsverluste bei Wörtern nahe musikalischer Phrasen zu akzeptieren, ist für interne Anwendungsfälle vertretbar. Zur Veröffentlichung: Trennen Sie die Spuren.
YouTube-Video mit Musik-Soundtrack
Die Audiospur aus einem YouTube-Video mit durchgehender Musik zu ziehen und direkt an eine Transkriptions-Engine zu senden, erzeugt erhebliche Halluzinationen. YouTube-Transkripterstellung funktioniert am besten, wenn das Video primär sprachgetrieben ist. Bei YouTube-Inhalten mit viel Musik ist Source Separation vor der Transkription der zuverlässige Weg.
Gottesdienst oder Predigt mit Musik
Predigt und Musik wechseln sich als getrennte Segmente ab. Die Musikabschnitte (Kirchenlieder, Worship-Songs) vor dem Transkribieren herauszuschneiden ist der praktische Weg. Fügen Sie für jeden Musikabschnitt manuelle Marker hinzu. Die gesprochenen Teile lassen sich sauber transkribieren.
Ein Workflow für Creator mit musiklastigen Inhalten
Für alle, die regelmäßig Inhalte mit Musik produzieren, ist es günstiger, den Bereinigungsschritt direkt in die Produktionskette einzubauen, als Transkripte hinterher zu reparieren.
- Erstellen Sie von jeder Episode zwei Versionen: den Veröffentlichungsmix (mit Musik) und einen Transkriptions-Cut (nur Sprache).
- Legen Sie den Transkriptions-Cut als eigenen Exportschritt in Ihrer Schnittsoftware an.
- Transkribieren Sie ausschließlich den Transkriptions-Cut.
- Fügen Sie dem finalen Transkript von Hand Musikmarker an den Zeitstempeln hinzu, an denen Musik lief.
- Nutzen Sie das saubere Transkript für Shownotes, SEO, Untertitel und Suche.
Bei einmaligen Aufnahmen deckt der Source-Separation-Weg (Lösung 2) die Fälle ab, in denen Sie die Datei nicht neu bearbeiten können.
Bei aufgezeichneten Inhalten mit leiser Hintergrundmusik prüfen Sie das Transkript auf die oben beschriebenen Halluzinationsmuster und entfernen Sie sie manuell. Der Speaker-Diarization-Erklärartikel behandelt ein verwandtes Genauigkeitsproblem: Überlappende Stimmen erzeugen ähnliche Wirrwarr-Symptome im Transkript, und der Diagnoseprozess ist vergleichbar.
Wenn Sie einfach nur ein sauberes Transkript aus einer reinen Sprachaufnahme ohne Musik benötigen, übernimmt ConvertAudioToText den Upload, ohne dass Sie zum Start ein Konto anlegen müssen.
FAQ
Warum steht in meinem Transkript unsinniger Text dort, wo Musik lief?
KI-Transkriptionsmodelle sind darauf trainiert, Audio in Worte umzusetzen. Enthält das Audio Musik, insbesondere Gesang, behandelt das Modell sie als Sprache und versucht, sie zu transkribieren. Das Ergebnis sind wirre Pseudo-Liedtexte, halluzinierter Fülltext oder frei erfundene Phrasen. Kein aktueller Transkriptionsdienst für Endverbraucher verfügt über eine geprüfte, dedizierte Musikerkennungsebene, die diese Segmente zuverlässig unterdrückt.
Kann VAD (Voice Activity Detection) Musik automatisch herausfiltern?
Teilweise. VAD filtert Stille und Segmente mit geringer Energie gut, versagt aber häufig bei Musik, weil Musik Energie in genau den Frequenzbändern trägt, die VAD als Sprache einstuft. WhisperX mit standardmäßig aktivierter VAD erzeugt weiterhin Halluzinationen bei musikalischen Passagen, die durchrutschen. VAD ist ein nützlicher Ausgangspunkt, aber keine vollständige Lösung für Musik.
Gibt Whisper für Musiksegmente ein [Music]-Label aus?
Nicht zuverlässig. Das [Music]-Label, das Sie möglicherweise in YouTube-Autountertiteln gesehen haben, stammt von einer separaten Ebene, die Google seiner eigenen ASR-Pipeline hinzufügt – nicht von Whispers Decoder. Whispers eigene Ausgabe bei Musik reicht von halluzinierten Liedtexten über erfundene Phrasen bis hin zu Füllwörtern. Eine 2025 veröffentlichte Studie ergab, dass Whisper large-v3 bei nahezu 100 % der nichtsprachlichen Umgebungsaudios halluziniert. Source Separation oder manuelles Herausschneiden ist die einzige zuverlässige Abhilfe.
Lohnt es sich, Songtexte aus einer Aufnahme zu transkribieren?
Fast nie über eine allgemeine ASR-Engine. Gesungene Sprache weist verändertes Timing, Tonhöhen und Phonemgrenzen auf, die Modelle verwirren, die auf Konversationsaudio trainiert wurden. Sie erhalten unvollständige, falsche Liedtexte vermischt mit erfundenen Wörtern. Wenn Sie wirklich genaue Songtexte benötigen, ist ein spezialisierter Dienst zur Texterkennung oder manuelle Transkription das richtige Werkzeug. Für die meisten Podcast- und Interview-Anwendungsfälle liefert das Herausschneiden des Musikteils und das Ersetzen durch einen Marker wie [Song: Titel von Interpret] ein deutlich sauberes Ergebnis.
Quellen
- Deepgram-Übersicht zu Modellen und Sprachen (geprüft im Juli 2026): https://developers.deepgram.com/docs/models-languages-overview
- AssemblyAI Audio-Intelligence-Dokumentation (geprüft im Juli 2026): https://www.assemblyai.com/docs/guides/audio-intelligence
- Calm-Whisper: Reduce Whisper Hallucination On Non-Speech (arXiv, 2025): https://arxiv.org/html/2505.12969v1
- Whisper-GitHub-Diskussion zu Halluzinationen #1606: https://github.com/openai/whisper/discussions/1606
- Demucs v4 / htdemucs Übersicht (HuggingFace Spaces): https://huggingface.co/spaces/abidlabs/music-separation
- Spleeter von Deezer (GitHub): https://github.com/deezer/spleeter
- WhisperX-VAD-Dokumentation (DeepWiki): https://deepwiki.com/m-bain/whisperX/4.1-voice-activity-detection
- Whisper-initial_prompt-Leitfaden (Sotto-Blog): https://sotto.to/blog/improve-whisper-accuracy-prompts
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.