
Sprecher-Diarisierung erklärt: Wie Maschinen wissen, wer was gesagt hat
Summarize this article with:
Die Sprecher-Diarisierung ist der Teil der Transkription, der die Frage „wer spricht wann“ beantwortet, indem sie jedes Audiosegment als Sprachvektor kodiert und ähnliche Vektoren zu Sprechergruppen clustert. Moderne Systeme erreichen bei sauberem Audio mit zwei Sprechern einen DER unter 10 % (pyannote erreicht 9,0 % auf VoxConverse, Deepgram v2 startete im Mai 2026), doch schwieriges Mehrsprecher-Audio wie DIHARD III liegt selbst bei Top-Systemen bei 11–14 %. Der größte einzelne Fehlermodus ist überlappende Sprache. Wer die Aufnahmesituation kontrolliert, bevor er auf „Aufnehmen“ drückt, beseitigt mehr Fehler als jeder Nachbearbeitungstrick.
Die Sprecher-Diarisierung ist der Teil der Transkription, der herausfindet, wer was gesagt hat. Ohne sie liest sich ein Interview zu zweit wie ein zusammenhängender Monolog. Mit ihr liest sich dasselbe Transkript wie ein Theaterstück, in dem jede Stimme korrekt zugeordnet ist und jedes Zitat bis zu seiner Quelle zurückverfolgbar ist.
Dieser Beitrag behandelt die Pipeline hinter der modernen Diarisierung, warum sich Stimmen zuverlässig clustern lassen, die wichtigsten Fehlermodi, wie man die Genauigkeitsmetrik DER interpretiert, und welche praktischen Schritte Sie unternehmen können, um saubere Sprecher-Labels für Ihre Aufnahmen zu erhalten.
Was Diarisierung ist – und was nicht
Diarisierung beantwortet die Frage „wer spricht wann“, nicht „wer genau ist diese Person“. Ein Diarisierungssystem kennzeichnet Sprecher anhand akustischer Signaturen als Sprecher 1, Sprecher 2, Sprecher 3 – nicht durch Abgleich mit einer Datenbank bekannter Identitäten. Sie markieren die Sprecher nachträglich („Sprecher 1 ist Alice“), und ein einziger Suchen-und-Ersetzen-Vorgang korrigiert alle Vorkommnisse.
Zwei verwandte Aufgaben, die häufig mit Diarisierung verwechselt werden:
- Voice Activity Detection (VAD). Entscheidet, wo überhaupt Sprache vorkommt – im Gegensatz zu Stille, Musik oder Rauschen. Diarisierung setzt voraus, dass VAD bereits gelaufen ist. Den vorgelagerten Schritt beschreibt der Beitrag Wie VAD funktioniert.
- Sprecheridentifikation. Vergleicht eine unbekannte Stimme mit hinterlegten Proben bekannter Personen („das klingt wie Alice“). Benötigt eine Datenbank. Diarisierung ist der einfachere und häufigere Bedarf.
Für die meisten Interview- und Meeting-Anwendungsfälle reicht Diarisierung ohne Identifikation aus. Einmal identifizieren, überall aktualisieren.
Die Embedding-Clustering-Pipeline
Eine Standard-Diarisierungspipeline durchläuft vier Stufen, wobei moderne Systeme sie als einzelnen neuronalen Durchlauf statt als vier sequenzielle Aufrufe umsetzen:
- VAD. Stille, Hintergrundmusik und Nicht-Sprachbereiche entfernen.
- Segmentierung. Die verbleibende Audiodatei in kurze Fenster schneiden, typischerweise jeweils 1,5 bis 3 Sekunden lang.
- Embedding. Jedes Segment als hochdimensionalen Vektor kodieren, der die Stimmmerkmale dieses Segments abbildet.
- Clustering. Segmente mit ähnlichen Embeddings zu Sprecher-Clustern gruppieren und jedem Cluster ein Label zuweisen.
Das Ergebnis ist eine Folge von Tupeln (Startzeit, Endzeit, Sprecher-Label). Ein separater ASR-Schritt transkribiert die Wörter; die Diarisierungs-Ausgabe ordnet die Wörter den Sprechern zu.
Wenn Sie sehen möchten, wo die Diarisierung im Gesamtbild der Transkription ihren Platz hat, behandelt der Beitrag Wie KI-Transkription funktioniert die gesamte Produkt-Pipeline vom Upload bis zur formatierten Ausgabe.
Warum Voice-Embeddings funktionieren
Der Trick, der Diarisierung überhaupt möglich macht: Stimmen haben stabile akustische Signaturen, selbst wenn sich die Wörter ändern. Tonhöhenumfang, Formantfrequenzen (die Resonanzen, die Vokalklänge unterscheiden), Sprechgeschwindigkeit, Atemmuster und Phonem-Gewohnheiten sind bei einer Person über ein Gespräch hinweg erstaunlich konstant.
Ein modernes Speaker-Embedding-Modell wie ECAPA-TDNN, NVIDIAs TitaNet oder x-vector-Architekturen nimmt ein kurzes Audiosegment und gibt einen 192–512-dimensionalen Vektor aus. Zwei Segmente desselben Sprechers liegen in diesem Raum eng beieinander, zwei Segmente verschiedener Sprecher weiter auseinander. Das Gruppieren übernehmen agglomerative oder spektrale Clustering-Algorithmen.
Die Mathematik ist nicht der Flaschenhals. Der Flaschenhals ist das, was passiert, wenn diese Annahmen brechen.
Wo die Diarisierung scheitert
Fünf Fehlermodi, auf die Sie in echten Aufnahmen stoßen werden:
Sprecherüberlappung
Wenn zwei Personen gleichzeitig sprechen, wählen die meisten Kaskadensysteme einen Sprecher aus und verwerfen den anderen. Das überlappende Wort landet unter einem Label, und der Beitrag des anderen Sprechers geht lautlos verloren. Dies ist die größte einzelne Fehlerquelle bei Podiumsdiskussionen, leidenschaftlichen Debatten und rasanten Interviews.
End-to-end-neuronale Diarisierungsansätze, manchmal auch EEND-Modelle genannt, behandeln Diarisierung als Multi-Label-Vorhersageproblem und können ein Segment gleichzeitig zwei Sprechern zuordnen. Das bewältigt Überlappungen besser, erhöht aber die Systemkomplexität. Für die meisten praktischen Workflows ist die echte Lösung bessere Mikrofondisziplin.
Ähnliche Stimmen
Zwei Sprecher mit ähnlicher Tonhöhe, Akzent und Sprechgeschwindigkeit werden öfter zu einem Cluster verschmolzen, als man erwarten würde. Panels mit Teilnehmern gleichen Geschlechts und Familieninterviews sind typische Problemfälle. Das Modell kann nicht wissen, dass die Stimmen verschieden sind, wenn sich die Embeddings deutlich überschneiden.
Getrennte Mikrofonkanäle pro Sprecher lösen dieses Problem vollständig. Wenn das nicht möglich ist, müssen Sie mit etwas manueller Nacharbeit rechnen.
Kurze Äußerungen
Ein Ein-Wort-Einwurf („Ja“, „Genau“, „Stimmt“) enthält oft zu wenig Audio für eine sichere Sprecherzuordnung. Die meisten Systeme raten entweder (häufig falsch) oder überspringen das Segment. In einem Frage-Antwort-Interview, in dem eine Person kurze Fragen stellt, wird das Problem der falschen Sprecherzuordnung sehr deutlich.
Hintergrundstimmen
Ein Fernseher im Hintergrund, ein zweites Gespräch, das durch eine dünne Wand hörbar ist, oder die Audiowiedergabe eines Handys – all das behandelt der Diarisierer als neue Sprecher. Ihr Interview zu zweit zeigt plötzlich vier Sprecher: die beiden Teilnehmer plus alle, die in der Nachrichtensendung zu hören sind. Die Aufnahme in einem ruhigen Raum ist die kostengünstige Lösung.
Schätzung der Sprecheranzahl
Die meisten Systeme erkennen die Anzahl der Sprecher entweder automatisch oder akzeptieren einen Hinweis. Die automatische Erkennung ist unvollkommen. Deepgrams Diarisierung beispielsweise erkennt die Anzahl automatisch, ohne dass eine Eingabe erforderlich ist, und gibt an, bei 16 oder mehr Sprechern genaue Ergebnisse zu liefern. Pyannote akzeptiert die Sprecheranzahl als optionalen Hinweis. Wenn das von Ihnen verwendete Tool den Parameter unterstützt und Sie die Anzahl kennen, geben Sie sie an. Wenn das Tool automatisch schätzt, prüfen Sie die erste Minute der Ausgabe sorgfältig.

Diarization Error Rate (DER) erklärt
DER ist die Standardmetrik für die Genauigkeit der Diarisierung. Die Formel kombiniert drei Fehlertypen:
- Sprecherverwechslung. Richtige Sprache erkannt, falscher Sprecher zugeordnet.
- Verpasste Sprache. Echte Sprache als Stille eingestuft.
- Fehlalarm. Stille oder Rauschen als Sprache eingestuft.
DER = (Fehlalarm + verpasste Sprache + Sprecherverwechslung) / Gesamtdauer der Referenzsprache.
Ein DER unter 10 % gilt in den meisten realen Audio-Bereichen allgemein als gut.
| System | Benchmark | DER |
|---|---|---|
| pyannote (pyannote.ai) | VoxConverse | 9,0 % |
| Picovoice Falcon | VoxConverse | 10,3 % |
| Amazon Transcribe | VoxConverse | 11,1 % |
| PyannoteAI | DIHARD III | 11,2 % |
| DiariZen (Open Source) | DIHARD III | 13,3 % |
| EEND-TA | DIHARD III | 14,5 % |
| Google STT-Diarisierung | VoxConverse | 50,2 % |
Quellen: Picovoice Open Benchmark (VoxConverse) und unabhängige Forschungs-Benchmarks (DIHARD III), Juli 2026.
Ein DER von 10 % bedeutet, dass grob eine von zehn Sekunden das falsche Sprecher-Label hat. Bei einer 60-minütigen Datei sind das 6 Minuten falsch zugeordneter Sprache. Ob das ins Gewicht fällt, hängt von Ihrem Anwendungsfall ab. Eine grobe Meeting-Zusammenfassung verzeiht das. Ein Gerichtsprotokoll nicht.
Meine Einschätzung: Die Lücke zwischen den besten Open-Source-Tools und den schwächeren kommerziellen Zusatzfunktionen ist enorm – an den Extremen über 40 Prozentpunkte. Hier wiegt die Wahl eines Tools anhand des zugrunde liegenden Diarisierungsmodells statt nach Gesamtmarke schwerer als bei fast jedem anderen Transkriptionsfeature.
Wie die Genauigkeit über den gesamten Transkriptions-Stack hinweg gemessen wird, erfahren Sie im Beitrag Transkriptionsgenauigkeit erklärt.
Praktische Schritte für saubere Diarisierung
Wenn Sie die Aufnahme steuern, sind dies die Stellschrauben mit der größten Wirkung:
- Ein Mikrofon pro Sprecher. USB-Mikrofone, Lavaliermikrofone oder Headsets für jeden Teilnehmer. Das eliminiert die meisten Diarisierungsschwierigkeiten, bevor sie entstehen.
- Separate Audiokanäle, wenn möglich. Mehrspurige Aufnahmen (Riverside, Zencastr oder lokale Aufzeichnung auf dem Rechner jedes Teilnehmers) ermöglichen es dem Diarisierer, kanalweise zu arbeiten, statt einen gemischten Stream zu trennen. Kanalbasierte Zuordnung ist praktisch gelöst.
- Kurze Pausen zwischen den Beiträgen. Eine halbe Sekunde Abstand hilft dem System, die Grenzen zwischen Sprechern zuverlässig zu erkennen.
- Ruhige Umgebung. Fernseher stummschalten, Türen schließen, andere Personen im Raum bitten, ruhig zu sein.
- Sprecheranzahl angeben, sofern unterstützt. Wenn Sie wissen, wie viele Sprecher in der Datei sind, und das Tool diesen Hinweis akzeptiert, nutzen Sie ihn.
Speziell für Meeting-Aufnahmen behandelt der Praxisleitfaden So transkribieren Sie ein Zoom-Meeting die kanalbasierte Aufnahmekonfiguration, die Diarisierung nahezu perfekt macht.
Wenn Sie die Datei erst im Nachhinein bekommen
Wenn Sie die Aufnahme nicht steuern konnten, arbeiten Sie mit dem, was vorhanden ist. Der Workflow zur Korrektur:
- Hochwertiges Diarisierungstool einsetzen. Pyannote, Deepgram mit
diarize_model=latest(der aktuell empfohlene Parameter laut Deepgrams Dokumentation vom Mai 2026, ersetzt den veraltetendiarize=true) oder AssemblyAI mitspeaker_labels: true. Alle drei bieten starke Genauigkeit bei typischem Interview- und Meeting-Audio. - Sprecheranzahl angeben, wenn das Tool sie akzeptiert. Wo die API diesen Hinweis unterstützt, reduziert er das Schätzrauschen.
- Die erste Minute sorgfältig prüfen. Stimmen die Labels am Anfang, stimmen sie meist durchgehend. Fehler häufen sich am Beginn, während das Modell die Sprecheridentitäten kalibriert.
- Nach bekannten Verwechslungspunkten suchen. Kurze Einwürfe, überlappende Segmente und Sprecherwechsel sind die Stellen, an denen sich Fehler konzentrieren.
- Sprecher einmal manuell markieren. Suchen-und-Ersetzen erledigt den Rest.
Wenn Sie einfach nur ein sauberes Transkript mit Sprecher-Labels benötigen, ohne selbst eine Diarisierungspipeline aufzusetzen, führt das Meeting-Transkriptionstool von CATT die Diarisierung beim Upload automatisch aus.
Was diarisierte Transkripte ermöglichen
Ein Transkript mit Sprecher-Labels erschließt Workflows, die ein solches ohne Labels nicht hergibt:
- Wortanzahl pro Sprecher. Wer dominiert Ihre Meetings?
- Analyse pro Sprecher. Stimmung je Teilnehmer, von welcher Person welches Thema eingebracht wurde.
- Bessere LLM-Zusammenfassungen. Das Modell kann „Alice argumentierte X, Bob entgegnete Y“ liefern statt „die Teilnehmer diskutierten“.
- Zitatextraktion. Alle Beiträge von Sprecher 2 für eine Recherchenotiz oder eine Kundenstimme herausziehen.
Speziell zur Interview-Transkription zeigt der Leitfaden So transkribieren Sie eine Interviewaufnahme, wie sich Sprecher-Labels in strukturierte Ausgaben überführen lassen.
Wann Sie keine Diarisierung benötigen
Handelt es sich bei der Aufnahme um eine einzige sprechende Person (ein Sprachmemo, eine Vorlesung, ein Solo-Podcast), schalten Sie die Diarisierung aus. Das Transkript wird schneller verarbeitet, und Sie vermeiden das kleine Risiko, dass ein Diarisierungsfehler einen Phantom-Sprecherwechsel in einen Monolog einbaut.
Bei allem mit zwei oder mehr Stimmen lohnt sich die Aktivierung. Der Aufwand ist minimal, und der Unterschied in der Lesbarkeit ist bei einer langen Aufnahme erheblich.
FAQ
Was ist Sprecher-Diarisierung?
Die Sprecher-Diarisierung segmentiert eine Audioaufnahme nach Sprechern und versieht jedes Segment auf Grundlage von Stimmmerkmalen mit einem Label wie „Sprecher 1“, „Sprecher 2“ und so weiter. Sie beantwortet die Frage „wer spricht wann“, nicht „wer genau ist diese Person“. Dieser letzte Schritt erfordert ein separates System zur Sprecheridentifikation mit hinterlegten Stimmproben.
Was ist die Diarization Error Rate (DER)?
DER ist die Standardmetrik für die Genauigkeit. Die Metrik summiert drei Fehlertypen – Fehlalarm-Sprache (Stille, die als Sprache gewertet wird), verpasste Sprache (echte Sprache, die als Stille gewertet wird) und Sprecherverwechslung (richtige Sprache, falsches Sprecher-Label) – und dividiert das Ergebnis durch die Gesamtdauer der Referenzsprache. Ein DER unter 10 % gilt allgemein als gut. Moderne kommerzielle APIs liegen im VoxConverse-Benchmark je nach Anbieter bei etwa 11 % bis über 50 %.
Wie geht die automatische Sprecher-Diarisierung mit überlappender Sprache um?
Die meisten Kaskadensysteme wählen pro Segment einen Sprecher aus und verwerfen die andere Stimme vollständig. End-to-end-neuronale Systeme wie EEND behandeln Diarisierung als Multi-Label-Vorhersage und können ein Segment daher als gleichzeitig zwei Sprecher enthaltend kennzeichnen. Überlappung bleibt dennoch der schwierigste Fehlermodus. Die praktische Lösung ist bessere Mikrofondisziplin, bevor das Gespräch beginnt.
Kann ich die Anzahl der Sprecher angeben, um die Genauigkeit zu verbessern?
Einige Tools ermöglichen es, die Sprecheranzahl festzulegen (Deepgram erkennt sie automatisch, ohne dass eine Angabe nötig ist; pyannote unterstützt sie als Hinweis). Wenn ein Tool den Parameter unterstützt und Sie die Anzahl kennen, reduziert deren Angabe den Schätzfehler. Wenn Sie sie nicht kennen oder das Tool sie automatisch schätzt, prüfen Sie die erste Minute des Ergebnisses, um Fehlzuteilungen früh zu erkennen.
Welche Aufnahmen liefern die besten Diarisierungsergebnisse?
Saubere Aufnahmen mit einem Mikrofon pro Sprecher oder separaten Audiokanälen pro Teilnehmer. Jeder Sprecher auf seinem eigenen Kanal macht die Diarisierung zu einem nahezu trivialen Problem. Ruhige Räume, kurze Pausen zwischen den Beiträgen und keine Hintergrundstimmen helfen ebenfalls erheblich. Ist die Aufnahme bereits gemischt, ist eine hochwertige Diarisierungs-API plus manuelle Prüfung der ersten Minute der beste Weg zur Korrektur.
Quellen
- Deepgram-Dokumentation zur Speaker-Diarisierung
- Picovoice-Benchmark zur Speaker-Diarisierung (VoxConverse)
- AssemblyAI: Top-Bibliotheken und APIs für Speaker-Diarisierung 2026
- Benchmarking von Diarisierungsmodellen, arxiv 2509.26177
- Die Grenzen der End-to-End-Diarisierung ausloten, Interspeech 2025
- Deepgram: Batch-Diarisierung V2 vorgestellt (Mai 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.