Exportformate für Transkriptionen: TXT, SRT, VTT, JSON
transkriptionuntertitelsrtvtt

Exportformate für Transkriptionen: TXT, SRT, VTT, JSON

BMMamane B. MoussaMay 26, 2026Updated July 2, 202610 min read

Summarize this article with:

TL;DR

Jedes Transkriptions-Exportformat hat genau einen besten Anwendungsfall: SRT für Videoplattformen, VTT für HTML5-Webplayer, TXT für Blogartikel und Shownotes, DOCX für Kunden und juristische Arbeiten, JSON für Entwickler, die auf einem Transkript aufbauen, und PDF für Ergebnisse mit festem Layout. Entscheiden Sie anhand dessen, was der Empfänger benötigt – nicht danach, was am vollständigsten wirkt. Netflix verlangt TTML statt SRT, prüfen Sie daher die Plattformanforderungen, bevor Sie davon ausgehen, dass ein Untertitelformat akzeptiert wird.

Ein fertiges Transkript kann in einem halben Dutzend Formate ausgeliefert werden, und das richtige hängt allein davon ab, was als Nächstes kommt. In einen Video-Player einbetten? SRT oder VTT verwenden. In einen Blogartikel einfügen? TXT oder DOCX. In ein anderes Tool einspeisen? JSON. Dieser Leitfaden behandelt, was jedes Format tatsächlich enthält, wo es zum Einsatz kommt und welche Eigenheiten regelmäßig für Überraschungen sorgen.

TXT: Der Klartext-Standard

Das einfachste Format. Nur Wörter, optional mit Sprecherbezeichnungen und Absatz-Zeitstempeln.

[00:00:00] Speaker 1: Welcome back to the show. Today we're talking about pricing.

[00:00:18] Speaker 2: Thanks for having me. Pricing is one of those topics...

TXT ist der schnellste Weg vom Audio zum lesbaren Text. Kein spezieller Player oder keine Bibliothek nötig. Einfach in jeden Editor, jedes CMS oder jeden E-Mail-Client kopieren und einfügen.

Worauf TXT verzichtet:

  • Keine feingranularen Timings für die Videosynchronisation.
  • Keine maschinenlesbare Struktur (alles ist ein String).
  • Verschiedene Tools erzeugen leicht unterschiedliche Layouts, was bei der Stapelverarbeitung relevant ist.

Verwenden Sie TXT für Blogartikel, Shownotes, Besprechungsprotokolle – überall dort, wo Menschen die Datei lesen werden. Für einen tieferen Blick darauf, wann sich dieser Kompromiss lohnt, siehe kostenlose vs. bezahlte Transkriptionsdienste.

DOCX: TXT mit Formatierung

Microsoft-Word-Format. Derselbe Inhalt wie TXT, aber mit formatierten Überschriften, fettgedruckten Sprechern und manchmal einem Kopfbereich mit Metadaten (Dateiname, Datum, Dauer).

DOCX ist das Standard-Lieferformat für menschliche Transkriptionsdienste. Gerichtsstenografen, juristische Transkribenten und akademische Transkriptionsanbieter senden fast immer DOCX. Es ist das Format, das die meisten nicht-technischen Kunden zu öffnen erwarten.

Für KI-Tools ist DOCX lediglich TXT mit Styling. Genauigkeit und Inhalt sind identisch; die Datei sieht nur schöner in Word aus. Wenn der Empfänger den Text bearbeiten wird, ist DOCX besser als PDF, weil Words Funktionen „Änderungen nachverfolgen“ und Kommentare ordnungsgemäß funktionieren.

SRT: Das universelle Untertitelformat

SubRip Subtitle. Das am weitesten unterstützte Untertitelformat im praktischen Einsatz. YouTube, Vimeo, Premiere, Final Cut und DaVinci Resolve akzeptieren alle SRT.

Format:

1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.

2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models for small businesses.

Jeder Cue besteht aus vier Teilen:

  1. Cue-Nummer (1, 2, 3, ...).
  2. Startzeit --> Endzeit im Format HH:MM:SS,mmm (beachten Sie das Komma als Dezimaltrennzeichen, keinen Punkt).
  3. Text (eine oder mehrere Zeilen).
  4. Leerzeile zur Trennung der Cues.

SRT-Eigenheiten:

  • Komma als Dezimaltrennzeichen, kein Punkt. 00:00:03,500, nicht 00:00:03.500. Das ist der mit Abstand häufigste SRT-Syntaxfehler. Viele Parser weisen eine Datei zurück, die stattdessen einen Punkt verwendet.
  • Keine Sprecherbezeichnungen in der Spezifikation. Die meisten Tools betten Sprecherbezeichnungen direkt in den Text ein, etwa als Speaker 1: Welcome back. Manche Player zeigen dies inline an; andere entfernen es möglicherweise.
  • Zeilenumbrüche sind wichtig. Die meisten Player zeigen 1–2 Zeilen pro Cue an. Dreizeilige Cues können abgeschnitten werden oder mehr vom Video verdecken als beabsichtigt.
  • Zeichenbegrenzung pro Zeile. Üblich sind 32–42 Zeichen pro Zeile, damit der Text auch auf kleineren Bildschirmen gut lesbar bleibt.
  • Cue-Dauer. Typisch sind 2–7 Sekunden pro Cue. Einwort-Cues wirken abgehackt; Cues über 7 Sekunden erfordern eine zu hohe Lesegeschwindigkeit.

Eine Plattform, die SRT für die professionelle Auslieferung NICHT akzeptiert, ist Netflix. Netflix verlangt TTML1 (mit der Endung .xml oder .ttml) für die Untertitelauslieferung. SRT, VTT und SCC werden für Netflix-Auslieferungen ohne ausdrückliche Ausnahme durch einen Netflix-Ansprechpartner nicht akzeptiert. Das ist ein verbreiteter Irrtum.

Verwenden Sie SRT für YouTube-Uploads, den Import in Videobearbeitungsprogramme und die meisten Videoplattformen für Endnutzer.

Untertitel-Generator-Tool mit SRT-Exportoption
Untertitel-Generator-Tool mit SRT-Exportoption

VTT: Der webnative Verwandte von SRT

WebVTT. Der HTML5-Standard für Untertitel direkt im Browser, definiert in der W3C-Spezifikation. Funktional SRT sehr ähnlich, jedoch mit deutlichen Unterschieden in Struktur und Funktionsumfang.

Format:

WEBVTT

00:00:00.000 --> 00:00:03.500
Welcome back to the show.

00:00:03.500 --> 00:00:09.200
Today we're talking about pricing models for small businesses.

Die wichtigsten Unterschiede zu SRT:

  • Punkt als Dezimaltrennzeichen, kein Komma. 00:00:03.500. Das Gegenteil von SRT. Dies ist die häufigste Quelle der Verwirrung bei der Konvertierung zwischen beiden.
  • Pflichtangabe WEBVTT-Header. Die Datei muss mit der Zeichenfolge „WEBVTT“ beginnen, gefolgt von zwei oder mehr Zeilenumbrüchen. Ohne ihn ist die Datei kein gültiges VTT.
  • Cue-Kennzeichner sind optional. Anders als bei SRT, wo Cue-Nummern üblich sind (wenn nicht sogar streng erforderlich), verlangt VTT sie nicht.
  • Unterstützt Voice-Tags. <v Speaker 1>Welcome back.</v> ist der W3C-definierte Weg, Sprecher zu kennzeichnen. Player können jede Stimme über CSS-Pseudoelemente unterschiedlich gestalten.
  • Unterstützt Styling. HTML-ähnliche Tags für Kursivschrift, Fettdruck und Farbe funktionieren innerhalb von Cues.
  • Unterstützt Cue-Einstellungen. Position, Ausrichtung und vertikaler Text lassen sich pro Cue festlegen.

VTT ist das, was das HTML5-Element <track> erwartet. Wenn Sie Untertitel auf einer Website über das native Videoelement einbinden, ist VTT das Format, das der Browser nativ versteht. YouTube akzeptiert VTT, empfiehlt aber SRT für neue Creator.

Für einen tieferen Vergleich dieser beiden Formate plus TTML siehe SRT vs. VTT vs. TTML.

TTML: Der Broadcast-Standard

Timed Text Markup Language. Das XML-basierte W3C-Format, das professionelle Rundfunkanstalten und Streaming-Plattformen verlangen. Auch bekannt als DFXP (Distribution Format Exchange Profile), ein bestimmtes Profil von TTML.

TTML unterstützt komplexes Styling, präzise Bildschirmpositionierung, Metadaten für Barrierefreiheit (SDH-Marker, Sprecheridentifikation) und mehrere Sprachspuren in einer einzigen Datei. Netflix verlangt TTML1 für alle Sprachen; BBC iPlayer und Hulu verlangen es ebenfalls für die professionelle Auslieferung.

Für die meisten Creator, die auf YouTube hochladen oder auf ihrer eigenen Website einbetten, wird TTML nicht benötigt. Es spielt eine Rolle, wenn Sie Inhalte an einen Broadcast-Partner oder eine Plattform mit formaler Auslieferungsspezifikation liefern. YouTube akzeptiert zwar TTML und DFXP, aber SRT oder VTT deckt die meisten Creator-Workflows ab.

JSON: Das maschinenlesbare Format

Für Entwickler ist JSON der verlustfreie Export. Alles, was die Transkriptions-Engine weiß, strukturiert und abfragbar.

{
  "transcript": "Welcome back to the show...",
  "words": [
    {"word": "Welcome", "start": 0.020, "end": 0.380, "confidence": 0.998, "speaker": 0},
    {"word": "back", "start": 0.380, "end": 0.640, "confidence": 0.997, "speaker": 0}
  ],
  "utterances": [
    {"speaker": 0, "text": "Welcome back to the show.", "start": 0.020, "end": 1.880}
  ],
  "metadata": {
    "duration": 1845.2,
    "language": "en",
    "model": "whisper-large-v3"
  }
}

JSON enthält das, was SRT und TXT nicht transportieren können: Zeitstempel auf Wortebene, Confidence-Scores pro Wort, Sprecherzuordnungen, Utterance-Gruppierungen und Modell-Metadaten. Optionale Felder von KI-fähigen Engines umfassen Themen, Sentiments und Zusammenfassungen.

Verwenden Sie JSON, wenn Sie irgendetwas auf einem Transkript aufbauen: eigene Video-Player, Suchindizes, KI-Pipelines oder Datenanalysen. Das Format ist ausführlich, aber verlustfrei. Wenn Ihr Transkriptionsdienst das JSON speichert, können Sie später jederzeit nach SRT oder TXT re-exportieren, ohne das Audio erneut durch die Engine laufen zu lassen.

PDF: Das polierte Endergebnis

PDF-Transkripte entstehen durch den Export von DOCX zu PDF. Sie wirken professionell, frieren die Formatierung ein und sind das erwartete Ergebnis für viele juristische und akademische Kunden.

Verwenden Sie PDF für:

  • Juristische Schriftsätze und Gerichtsdokumente.
  • Ergebnisse akademischer Forschung.
  • Kundenberichte, bei denen ein festes Layout zählt.
  • Archivierung (sofern der Text eingebettet und nicht gescannt ist).

Verwenden Sie PDF nicht, wenn:

  • Der Empfänger den Text bearbeiten wird. Die PDF-Bearbeitung ist langsam und fehleranfällig; geben Sie ihm stattdessen DOCX.
  • Der Empfänger es in ein anderes Tool einspeisen wird. JSON oder TXT ist kompatibler.

Wann welches Format?

AnwendungsfallPassendes Format
Podcast-ShownotesTXT
Blogartikel aus einem InterviewTXT oder DOCX
Untertitel für YouTube-VideosSRT
HTML5-Video auf Ihrer WebsiteVTT
TikTok oder Instagram ReelSRT
Netflix-AuslieferungTTML (laut Auslieferungsspezifikation)
Juristisches oder gerichtliches ErgebnisDOCX oder PDF
Akademische ForschungsdatenJSON + TXT
Aufbau eines SuchindexJSON
Eigene NLP- oder KI-PipelineJSON
Kunde möchte Inhalt bearbeitenDOCX
E-Mail an KollegenTXT
Archivierung mit festem LayoutPDF

Wenn Sie unsicher sind, exportieren Sie sowohl TXT als auch SRT. Es sind kleine Dateien; beide zu haben gibt Ihnen Flexibilität für Video- und Text-Workflows, ohne die Transkription erneut ausführen zu müssen.

Cue-Länge und Zeilenumbrüche

Genau dieses Thema beißt Untertitel-Einsteiger. Die Standardeinstellungen vieler Tools erzeugen SRT- oder VTT-Dateien mit Cues, die zu lang, zu kurz sind oder auf kleineren Bildschirmen ungeschickt umbrechen. Insbesondere bei Timing-Entscheidungen siehe wann Zeitstempel in der Transkription sinnvoll sind.

Bewährte Praktiken:

  • Cue-Dauer: 2–6 Sekunden. Einwort-Cues wirken abgehackt; Cues über 7 Sekunden treiben die Lesegeschwindigkeit zu hoch.
  • Zeichen pro Zeile: 32–42 ist die Konvention. Über 42 bricht die Zeile auf Mobilgeräten schlecht um.
  • Zeilen pro Cue: maximal 2. Dreizeilige Cues verdecken zu viel vom Video.
  • Wörter pro Minute: Zielen Sie auf eine Lesegeschwindigkeit von 160–180 wpm und passen Sie die Cue-Dauer an das Tempo des Sprechers an.

Die meisten modernen Tools liefern vernünftige Standardwerte. Wenn die Cues falsch herauskommen, suchen Sie nach einer Einstellung für „Zeilenlänge“ oder „Lesegeschwindigkeit“, bevor Sie manuell eingreifen.

Formatkonvertierung

Der Wechsel zwischen den Formaten ist meist unkompliziert, aber nicht immer verlustfrei:

  • TXT zu/von DOCX: Word beherrscht beides nativ. Kein Informationsverlust.
  • SRT zu/von VTT: Triviale Texttransformation: Kommas gegen Punkte tauschen (oder umgekehrt), WEBVTT-Header hinzufügen oder entfernen. Mit jeder Skriptsprache ein Einzeiler.
  • JSON zu TXT/SRT/VTT: Die meisten Transkriptionstools machen das automatisch. JSON ist die maßgebliche Quelle; alle anderen Formate leiten sich daraus ab.
  • TXT zu SRT/VTT: Erfordert, den Text wieder mit dem Audio abzugleichen, wofür die ursprünglichen Timing-Daten nötig sind. Ohne das Audio oder das ursprüngliche JSON nicht möglich.
  • PDF zu allem anderen: Nur zuverlässig, wenn das PDF aus Text erzeugt wurde. Gescannte PDFs erfordern OCR und verlieren die Formatierung.

Wenn Sie ConvertAudioToText verwenden, exportiert es TXT, SRT, VTT, JSON und DOCX aus einem einzigen Transkriptionsauftrag, sodass Sie die Engine nur erneut ausführen müssen, wenn Sie Einstellungen wie Sprache oder Sprecheranzahl ändern. Untertiteldateien können Sie auch direkt im Untertitel-Generator-Tool erstellen.

FAQ

Was ist der Unterschied zwischen SRT und VTT?

Beide sind zeitgesteuerte Untertitelformate mit nahezu identischer Struktur. SRT verwendet ein Komma als Dezimaltrennzeichen in Zeitstempeln (00:00:03,500) und verlangt Cue-Nummern. VTT verwendet einen Punkt (00:00:03.500), macht Cue-Nummern optional, verlangt einen WEBVTT-Header am Dateianfang und unterstützt zusätzlich Voice-Tags, CSS-Styling und Bildschirmpositionierung. SRT funktioniert standardmäßig auf mehr Plattformen; VTT ist das native Format für HTML5-Videoelemente.

Welches Format sollte ich für YouTube verwenden?

SRT ist der praktische Standard für YouTube. YouTube akzeptiert auch VTT, SBV, TTML und mehrere Broadcast-Formate, aber SRT ist das Format, das YouTubes eigene Hilfedokumentation Einsteigern beim Untertiteln empfiehlt. Es wird von Export-Tools breit unterstützt und erfordert keine besondere Konfiguration.

Akzeptiert Netflix SRT-Dateien?

Nein, nicht für die professionelle Auslieferung. Netflix verlangt TTML1 (mit der Endung .xml oder .ttml) für Untertiteldateien. SRT, VTT und SCC werden ohne ausdrückliche Ausnahme durch einen Netflix-Ansprechpartner nicht akzeptiert. Wenn Sie Inhalte an Netflix liefern, prüfen Sie das Netflix Partner Help Center für die aktuelle TTML-Spezifikation.

Was enthält ein JSON-Transkript, das SRT und TXT nicht enthalten?

JSON enthält Zeitstempel auf Wortebene, Confidence-Scores pro Wort, Sprecherzuordnungen, Utterance-Gruppierungen und Modell-Metadaten. SRT enthält nur zeitgesteuerte Textblöcke ohne Details auf Wortebene. TXT enthält nur die Wörter mit optionalen Sprecherbezeichnungen und Absatz-Zeitstempeln. Wenn Sie eine Suche bauen, NLP-Analysen durchführen oder einen eigenen Player antreiben wollen, ist JSON das einzige Format mit den vollständigen Daten.

Kann ich zwischen Transkriptformaten konvertieren, ohne die Transkription erneut auszuführen?

Bei den meisten Konvertierungen ja. SRT, VTT, TXT und DOCX lassen sich alle aus dem ursprünglichen JSON neu erzeugen, ohne das Audio erneut anzufassen – sofern Ihr Transkriptionsdienst das JSON gespeichert hat. Die Konvertierung, die nicht rückwärts funktioniert, ist TXT zu SRT oder VTT: Ohne Timing-Daten auf Wortebene lässt sich kein Zeitstempel präzise platzieren.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles