Wie Sie Videos mit Untertiteln barrierefrei machen (2026-Leitfaden)
UntertitelBarrierefreiheitVideo

Wie Sie Videos mit Untertiteln barrierefrei machen (2026-Leitfaden)

BMMamane B. MoussaApril 14, 2026Updated July 2, 202610 min read

Summarize this article with:

TL;DR

Untertitel machen Ihr Video für mehr als 430 Millionen Menschen mit einer behindernden Hörschädigung zugänglich – dazu für alle, die stumm schauen. Der Workflow umfasst vier Schritte: Untertitel mit einem KI-Tool generieren, sie auf Barrierefreiheits-Standard korrigieren (wörtliche Dialoge, Geräuschereignisse, Sprecherkennzeichnungen), das richtige Format pro Plattform wählen und vor der Veröffentlichung testen. Die meisten Plattformen unterstützen SRT-Uploads; Social-Media-Feeds benötigen eingebrannte Open Captions. Gesetzliche Anforderungen gelten inzwischen für einen breiteren Kreis von Organisationen als die meisten denken, und die Genauigkeitsschwelle für Compliance liegt höher, als es automatische Untertitel einer Plattform zuverlässig erreichen können.

Untertitel sind die wirkungsvollste einzelne Verbesserung, die Sie ein Video in puncto Barrierefreiheit machen können. Sie dienen den rund 430 Millionen Menschen weltweit mit einer behindernden Hörschädigung (WHO-Schätzung), allen Zuschauern, die in der Öffentlichkeit stumm schauen, und allen, deren Erstsprache nicht die gesprochene Sprache des Videos ist. Videos mit Untertiteln erzielen zudem 40 % höhere Quoten, mit denen Zuschauer bis zum Ende durchschauen, als Videos ohne Untertitel, und auf Facebook werden etwa 85 % des Videos ohne Ton geschaut.

Dieser Leitfaden führt durch die gesamte Untertitel-Pipeline: generieren, auf Standard korrigieren, für jede Plattform formatieren und überprüfen. Für vertiefende Compliance-Informationen siehe Barrierefreie Untertitel & ADA-Compliance.

Die drei Untertiteltypen verstehen

Closed Captions sind separate Textspuren, die Zuschauer ein- oder ausschalten können. Sie enthalten Dialoge, Sprecherkennzeichnungen und Beschreibungen von Nicht-Sprach-Audio. SRT, VTT, SBV und TTML sind allesamt Closed-Caption-Formate. Closed Captions sind der Standard für Barrierefreiheits-Compliance.

Open Captions sind dauerhaft ins Video eingebrannt. Zuschauer können sie nicht entfernen. Das ist die Norm für Social-Media-Inhalte (Instagram Reels, TikTok, Facebook-Feed), bei denen die Autoplay-Wiedergabe ohne Ton läuft.

Untertitel (Subtitles) übersetzen Dialoge in eine andere Sprache. Sie setzen voraus, dass der Zuschauer den Ton hören kann, und lassen Nicht-Sprach-Geräusche typischerweise weg. Im Sinne der Barrierefreiheit sind Untertitel kein Ersatz für Captions.

Die Grundlage jeder Barrierefreiheitsanforderung sind Closed Captions, keine Untertitel. Open Captions erfüllen dieselbe Anforderung nur dann, wenn der Zuschauer keine Möglichkeit hat, die Untertitel auszuschalten.

Schritt 1: Untertitel generieren

Laden Sie Ihr Video in den Untertitelgenerator hoch. Er akzeptiert MP4, MOV, AVI, MKV, WebM und weitere gängige Formate. Wählen Sie die gesprochene Sprache aus und starten Sie die Verarbeitung. Ein 10-minütiges Video dauert in der Regel unter 90 Sekunden.

KI-Untertitelgenerator verarbeitet eine Videodatei
KI-Untertitelgenerator verarbeitet eine Videodatei

KI-generierte Untertitel erreichen bei sauberem Ton mit klarer Sprache eine Genauigkeit von 95–98 %. Bei sich überlappenden Sprechern, starken Akzenten, Hintergrundmusik oder schnellem Fachvortrag sinkt die Genauigkeit. Der Generator liefert Ihnen den Ausgangspunkt; die menschliche Prüfung bringt Sie auf den Compliance-Standard.

Wenn Sie nur ein Transkript ohne plattformspezifische Formatierung benötigen, erzeugt ConvertAudioToText sauberen wörtlichen Text aus Audio oder Video im selben Schritt.

Schritt 2: Auf Barrierefreiheits-Standard korrigieren

Die rohe KI-Ausgabe ist noch nicht barrierefrei-tauglich. Prüfen und korrigieren Sie:

Wörtliche Genauigkeit. Jedes gesprochene Wort muss in der richtigen Reihenfolge erscheinen. Paraphrasieren Sie nicht, fassen Sie nicht zusammen und lassen Sie Füllwörter nicht weg, wenn das Erlebnis des Zuschauers davon abhängt. Eigennamen, Markennamen und Fachbegriffe sind die häufigsten KI-Fehler.

Geräuschereignisse. Gemäß den DCMP-Untertitelungsstandards und WCAG 1.2.2 müssen Untertitel Nicht-Sprach-Audioinformationen enthalten, die die Bedeutung beeinflussen. Verwenden Sie eckige Klammern: [Telefon klingelt], [fröhlicher Jazz], [Tür knallt]. Lassen Sie Umgebungsgeräusche ohne bedeutungstragende Information weg. Tritt ein Geräuschereignis gleichzeitig mit dem Dialog auf, verschieben Sie die Untertitelzeile des Geräuschereignisses an den oberen Bildschirmrand.

Sprecherkennzeichnung. Sprechen mehrere Personen, kennzeichnen Sie jede Untertitelzeile mit dem Namen des Sprechers oder einer konsistenten Rollenbezeichnung (ERZÄHLER, INTERVIEWER, DR. CHEN). Verwenden Sie Großbuchstaben oder eine einheitliche Klammernotation. Das ist bei Mehrsprecher-Inhalten gemäß Barrierefreiheitsstandards nicht optional.

Timing. Untertitel müssen genau in dem Moment erscheinen, in dem die Wörter gesprochen werden, und kurz danach wieder verschwinden. Zu frühe oder zu späte Untertitel zerstören das Verständnis. Achten Sie besonders auf Pausen, Satzgrenzen und schnelle Sprachpassagen.

Zeilenlänge und Lesegeschwindigkeit. Die DCMP- und Section-508-Richtlinien empfehlen höchstens zwei Zeilen pro Untertitel, 32–42 Zeichen pro Zeile und eine Lesegeschwindigkeit von unter 180 Wörtern pro Minute (rund 17–22 Zeichen pro Sekunde im Broadcast). Umbrechen Sie Zeilen an natürlichen sprachlichen Grenzen, nicht mitten im Satzteil oder Wort.

Schritt 3: Das richtige Format pro Plattform wählen

Nicht jede Plattform geht mit Untertiteln gleich um.

PlattformBevorzugte MethodeUnterstützte DateiHinweise
YouTubeSRT hochladenSRT, VTT, SBVImmer hochladen; Auto-Untertitel erreichen 78–96 % Genauigkeit, weit unter dem Compliance-Standard
VimeoVTT oder SRT hochladenSRT, VTTUnterstützt mehrere Sprachspuren
LinkedInSRT beim Posten hochladenSRTUntertitel lassen sich nach der Veröffentlichung weder hinzufügen noch bearbeiten
FacebookSRT hochladenSRTAuto-Untertitel verfügbar, erfordern aber Prüfung
Instagram ReelsUntertitel einbrennenN/AAuto-Untertitel der Plattform sind inkonsistent; eingebrannte Open Captions sind zuverlässiger
TikTokUntertitel einbrennen oder integrierte Funktion nutzenEingeschränktes SRTTikToks Auto-Untertitel verbessern sich laufend, machen aber weiterhin Fehler bei Namen und Fachbegriffen
Ihre WebsiteVTT über HTML5-track-Element einbindenVTTVerwenden Sie das track-Element mit kind="captions"

Für YouTube sind die Upload-Schritte: YouTube Studio, dann Untertitel, Ihr Video auswählen, auf „Sprache hinzufügen“ klicken, dann „Hinzufügen“ und die SRT-Datei hochladen. Verlassen Sie sich für die Barrierefreiheits-Compliance niemals auf YouTubes automatisch generierte Untertitel.

Für Instagram und TikTok brennen Sie die Untertitel vor dem Hochladen mit Untertitel zu Video hinzufügen ins Video ein. Halten Sie bei TikTok die Untertitel im oberen Drittel des Bildes, um Überlappungen mit den eigenen UI-Elementen der Plattform zu vermeiden.

Für Ihre eigene Website sieht das HTML so aus:

<video>
  <track kind="captions" src="captions.vtt" srclang="en" label="English" default>
</video>

Wenn Sie zwischen SRT und VTT konvertieren müssen, exportiert der Untertitelgenerator beide Formate.

Schritt 4: Vor der Veröffentlichung testen

Schauen Sie sich das komplette Video mit aktivierten Untertiteln an. Prüfen Sie:

  • Untertitel erscheinen und verschwinden synchron zur Sprache
  • Sprecherbezeichnungen sind vorhanden und durchgängig konsistent bei Mehrsprecher-Inhalten
  • Geräuschereignisse sind erfasst und korrekt getaktet
  • Keine langen Zeilen, die vom Bildschirm laufen oder wichtige visuelle Inhalte verdecken
  • Schriftgröße ist in üblicher Betrachtungsgröße lesbar (mindestens 18px-Äquivalent bei Standard-Videoauflösung, weißer Text mit dunklem Schlagschatten oder Kasten)

Testen Sie auf dem Mobilgerät. Die meisten Zuschauer sind unterwegs mit dem Smartphone, und die Lesbarkeit von Untertiteln lässt sich in einer Desktop-Vorschau schwerer beurteilen.

Gesetzliche Anforderungen

Die Compliance-Landschaft hat sich in den vergangenen zwei Jahren deutlich geschärft.

WCAG 2.1 Level AA verlangt Untertitel für alle vorab aufgezeichneten synchronisierten Medien (Erfolgskriterium 1.2.2, Level A) und für alle Live-Videos (1.2.4, Level AA). WCAG 2.2 hat diese Kriterien nicht geändert. Die meisten Organisationen zielen auf Level AA.

ADA Title II (USA): Die finale Regel des DOJ vom April 2024 verankerte WCAG 2.1 Level AA für digitale Dienste von Landes- und Kommunalbehörden. Die Compliance-Frist wurde im April 2026 verlängert: Gebietskörperschaften mit über 50.000 Einwohnern müssen bis zum 26. April 2027 compliant sein; kleinere Gebietskörperschaften und Sonderbezirke haben bis zum 26. April 2028 Zeit.

Section 508 (US-Bundesebene): Bundesbehörden und ihre Auftragnehmer müssen alle öffentlich verfügbaren Videos untertiteln. Automatisch generierte Untertitel erfüllen den Genauigkeitsstandard der Section 508 für vorab aufgezeichnete Inhalte nicht.

European Accessibility Act (EAA): Trat am 28. Juni 2025 in Kraft. Öffentlich zugängliche Videos, die nach diesem Datum veröffentlicht wurden, müssen genaue, zeitlich synchronisierte Closed Captions enthalten. Vor dem 28. Juni 2025 veröffentlichte Videos müssen bis zum 28. Juni 2030 barrierefrei gemacht werden. Bußgelder bei Verstößen reichen von 5.000 bis 100.000 Euro.

Das Erfolgskriterium 1.2.2 ist eine Level-A-Anforderung, d. h. es ist die Mindestschwelle, kein fortgeschrittenes Ziel. Organisationen, die irgendeine WCAG-Konformität beanspruchen, müssen es erfüllen.

Meine Einschätzung: Die meisten Organisationen sind weiter von der Compliance entfernt, als sie denken, weil sie automatisch generierte Untertitel bereits als „untertitelt“ zählen. Auto-Untertitel der Plattformen erfüllen das Kästchen erst, wenn sie geprüft und korrigiert wurden. Eine unkorrigierte Genauigkeitsrate von 85 % ist keine barrierefreie Untertitelung; sie ist ein erster Entwurf.

Referenz zur Untertitelformatierung

Wer diese Konventionen einhält, hält Untertitel lesbar und erfüllt die Anforderungen der meisten Standardisierungsgremien:

  • Höchstens zwei Zeilen pro Untertitel
  • 32–42 Zeichen pro Zeile (32 im Broadcast, bis zu 42 bei Online-Video)
  • Gemischte Groß- und Kleinschreibung (nicht ausschließlich GROSSBUCHSTABEN für vollständige Untertitel)
  • Lesegeschwindigkeit: 17–22 Zeichen pro Sekunde
  • Geräuschereignisse in eckigen Klammern: [Telefon klingelt]
  • Sprecherkennzeichnungen in Großbuchstaben vor dem Doppelpunkt: ANNA: Wir müssen jetzt gehen.
  • Position unten mittig im Bild, außer dort würden kritische Inhalte verdeckt
  • Mindestens 1 Sekunde auf dem Bildschirm; kein flackerndes Ein- und Ausblenden
  • Zeilen an Satzteilgrenzen umbrechen, nie mitten im Satzteil

Bei Open Captions in Social Videos zählt die Schriftstärke mehr als bei Closed-Caption-Systemen. Verwenden Sie eine kräftige, klare Serifenlose mit kontrastreichem Umriss oder Schlagschatten. Der Untertitel muss sowohl vor hellen als auch vor dunklen Hintergründen lesbar sein.

Das Geschäftsargument, kurz gefasst

Barrierefreiheit sollte eigentlich keiner finanziellen Rechtfertigung bedürfen, aber die Zahlen sind real. Werbevideos mit Untertiteln erreichen Skip-Raten von 18 % gegenüber 41 % ohne Untertitel. YouTube-Videos mit Untertiteln verzeichnen etwa 7 % mehr Engagement. TikTok-Inhalte mit Untertiteln zeigen einen messbaren Anstieg der Markenerinnerung. Dass 85 % des Facebook-Videos stumm geschaut werden, ist die älteste Statistik in diesem Bereich – aber sie hat nicht aufgehört, wahr zu sein.

Untertiteldateien sind außerdem Ihr günstigstes Werkzeug, um Inhalte weiterzuverwenden. Aus einer sauberen SRT-Datei wird ohne Mehraufwand ein Transkript, ein Blogartikel-Entwurf und Shownotes. Wie sich das auf Audioinhalte überträgt, lesen Sie in Beste Podcast-Transkription 2026.

FAQ

Was ist der Unterschied zwischen Closed Captions und Untertiteln im Hinblick auf Barrierefreiheit?

Closed Captions enthalten Dialoge, Sprecherkennzeichnungen und Beschreibungen von Nicht-Sprach-Audio wie Soundeffekten und Musikhinweisen. Untertitel übersetzen nur den gesprochenen Dialog für Zuschauer, die den Ton hören können, aber eine andere Sprache benötigen. Im Sinne der Barrierefreiheit sind Closed Captions erforderlich; Untertitel allein erfüllen den Standard nicht.

Erfüllen automatisch generierte Untertitel auf YouTube oder TikTok die Barrierefreiheitsanforderungen?

Nein, nicht in der ausgelieferten Form. Automatische Plattform-Untertitel erreichen je nach Audioqualität und Sprecherklarheit eine Genauigkeit von 78 bis 96 %. Barrierefreiheitsstandards, darunter WCAG 1.2.2 und Section 508, verlangen genaue Untertitel. Branchenpraxis und DOJ-Leitlinien behandeln unkorrigierte Auto-Untertitel bei vorab aufgezeichneten Inhalten als unzureichend. Sie müssen Untertitel generieren, prüfen und korrigieren, bevor Sie sie hochladen.

Was müssen barrierefreie Untertitel über die gesprochenen Worte hinaus enthalten?

Gemäß WCAG 1.2.2 und den DCMP-Standards müssen barrierefreie Untertitel alle bedeutungstragenden Nicht-Sprach-Audios enthalten: Soundeffekte, die Informationen vermitteln (in eckigen Klammern gekennzeichnet), Musikbeschreibungen, wenn relevant, Sprecherkennzeichnungen, wenn mehrere Personen sprechen, sowie Nicht-Sprach-Lautäußerungen wie Lachen oder Seufzen, wenn sie Bedeutung tragen. Stille und Umgebungsgeräusche müssen nur dann vermerkt werden, wenn ihr Fehlen den Zuschauer verwirren würde.

Welche Organisationen sind gesetzlich verpflichtet, ihre Videos mit Untertiteln zu versehen?

In den USA deckt Section 508 Bundesbehörden und ihre Auftragnehmer ab. ADA Title II gilt für Landes- und Kommunalbehörden (Frist auf 2027–2028 verlängert). ADA Title III findet zunehmend Anwendung auf Unternehmen, die öffentliche Einrichtungen betreiben, einschließlich Websites. Der European Accessibility Act erfasst Unternehmen, die an EU-Kunden verkaufen, mit der Frist Juni 2025 für neue Inhalte. Bildungseinrichtungen mit Bundesförderung unterliegen zusätzlichen Anforderungen nach Section 504. Im Zweifelsfall ist es der sicherste Weg, alle öffentlich zugänglichen Videos zu untertiteln.

Wie erstelle ich Untertitel für einen Livestream oder ein Echtzeit-Event?

Live-Untertitelung erfordert Echtzeit-Spracherkennung. Optionen sind professionelle CART-Dienstleister (Communication Access Realtime Translation) für Veranstaltungen mit hohen Anforderungen, plattformnative Live-Untertitel bei YouTube Live und Microsoft Teams sowie KI-gestützte Echtzeit-Transkriptionstools. Die Genauigkeitserwartungen an Live-Untertitel liegen gemäß WCAG 1.2.4 niedriger als bei vorab aufgezeichneten Inhalten, doch Untertitel müssen weiterhin synchronisiert und inhaltlich korrekt sein. Für Meetings und aufgezeichnete Sitzungen ist es oft praktischer, im Nachhinein mit Meeting-Transkription zu transkribieren und der Aufnahme Untertitel hinzuzufügen.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles