
Exportformate für Transkriptionen: TXT, SRT, VTT, JSON
Summarize this article with:
Jedes Transkriptions-Exportformat hat genau einen besten Anwendungsfall: SRT für Videoplattformen, VTT für HTML5-Webplayer, TXT für Blogartikel und Shownotes, DOCX für Kunden und juristische Arbeiten, JSON für Entwickler, die auf einem Transkript aufbauen, und PDF für Ergebnisse mit festem Layout. Entscheiden Sie anhand dessen, was der Empfänger benötigt – nicht danach, was am vollständigsten wirkt. Netflix verlangt TTML statt SRT, prüfen Sie daher die Plattformanforderungen, bevor Sie davon ausgehen, dass ein Untertitelformat akzeptiert wird.
Ein fertiges Transkript kann in einem halben Dutzend Formate ausgeliefert werden, und das richtige hängt allein davon ab, was als Nächstes kommt. In einen Video-Player einbetten? SRT oder VTT verwenden. In einen Blogartikel einfügen? TXT oder DOCX. In ein anderes Tool einspeisen? JSON. Dieser Leitfaden behandelt, was jedes Format tatsächlich enthält, wo es zum Einsatz kommt und welche Eigenheiten regelmäßig für Überraschungen sorgen.
TXT: Der Klartext-Standard
Das einfachste Format. Nur Wörter, optional mit Sprecherbezeichnungen und Absatz-Zeitstempeln.
[00:00:00] Speaker 1: Welcome back to the show. Today we're talking about pricing.
[00:00:18] Speaker 2: Thanks for having me. Pricing is one of those topics...
TXT ist der schnellste Weg vom Audio zum lesbaren Text. Kein spezieller Player oder keine Bibliothek nötig. Einfach in jeden Editor, jedes CMS oder jeden E-Mail-Client kopieren und einfügen.
Worauf TXT verzichtet:
- Keine feingranularen Timings für die Videosynchronisation.
- Keine maschinenlesbare Struktur (alles ist ein String).
- Verschiedene Tools erzeugen leicht unterschiedliche Layouts, was bei der Stapelverarbeitung relevant ist.
Verwenden Sie TXT für Blogartikel, Shownotes, Besprechungsprotokolle – überall dort, wo Menschen die Datei lesen werden. Für einen tieferen Blick darauf, wann sich dieser Kompromiss lohnt, siehe kostenlose vs. bezahlte Transkriptionsdienste.
DOCX: TXT mit Formatierung
Microsoft-Word-Format. Derselbe Inhalt wie TXT, aber mit formatierten Überschriften, fettgedruckten Sprechern und manchmal einem Kopfbereich mit Metadaten (Dateiname, Datum, Dauer).
DOCX ist das Standard-Lieferformat für menschliche Transkriptionsdienste. Gerichtsstenografen, juristische Transkribenten und akademische Transkriptionsanbieter senden fast immer DOCX. Es ist das Format, das die meisten nicht-technischen Kunden zu öffnen erwarten.
Für KI-Tools ist DOCX lediglich TXT mit Styling. Genauigkeit und Inhalt sind identisch; die Datei sieht nur schöner in Word aus. Wenn der Empfänger den Text bearbeiten wird, ist DOCX besser als PDF, weil Words Funktionen „Änderungen nachverfolgen“ und Kommentare ordnungsgemäß funktionieren.
SRT: Das universelle Untertitelformat
SubRip Subtitle. Das am weitesten unterstützte Untertitelformat im praktischen Einsatz. YouTube, Vimeo, Premiere, Final Cut und DaVinci Resolve akzeptieren alle SRT.
Format:
1
00:00:00,000 --> 00:00:03,500
Welcome back to the show.
2
00:00:03,500 --> 00:00:09,200
Today we're talking about pricing models for small businesses.
Jeder Cue besteht aus vier Teilen:
- Cue-Nummer (1, 2, 3, ...).
- Startzeit --> Endzeit im Format HH:MM:SS,mmm (beachten Sie das Komma als Dezimaltrennzeichen, keinen Punkt).
- Text (eine oder mehrere Zeilen).
- Leerzeile zur Trennung der Cues.
SRT-Eigenheiten:
- Komma als Dezimaltrennzeichen, kein Punkt.
00:00:03,500, nicht00:00:03.500. Das ist der mit Abstand häufigste SRT-Syntaxfehler. Viele Parser weisen eine Datei zurück, die stattdessen einen Punkt verwendet. - Keine Sprecherbezeichnungen in der Spezifikation. Die meisten Tools betten Sprecherbezeichnungen direkt in den Text ein, etwa als
Speaker 1: Welcome back. Manche Player zeigen dies inline an; andere entfernen es möglicherweise. - Zeilenumbrüche sind wichtig. Die meisten Player zeigen 1–2 Zeilen pro Cue an. Dreizeilige Cues können abgeschnitten werden oder mehr vom Video verdecken als beabsichtigt.
- Zeichenbegrenzung pro Zeile. Üblich sind 32–42 Zeichen pro Zeile, damit der Text auch auf kleineren Bildschirmen gut lesbar bleibt.
- Cue-Dauer. Typisch sind 2–7 Sekunden pro Cue. Einwort-Cues wirken abgehackt; Cues über 7 Sekunden erfordern eine zu hohe Lesegeschwindigkeit.
Eine Plattform, die SRT für die professionelle Auslieferung NICHT akzeptiert, ist Netflix. Netflix verlangt TTML1 (mit der Endung .xml oder .ttml) für die Untertitelauslieferung. SRT, VTT und SCC werden für Netflix-Auslieferungen ohne ausdrückliche Ausnahme durch einen Netflix-Ansprechpartner nicht akzeptiert. Das ist ein verbreiteter Irrtum.
Verwenden Sie SRT für YouTube-Uploads, den Import in Videobearbeitungsprogramme und die meisten Videoplattformen für Endnutzer.

VTT: Der webnative Verwandte von SRT
WebVTT. Der HTML5-Standard für Untertitel direkt im Browser, definiert in der W3C-Spezifikation. Funktional SRT sehr ähnlich, jedoch mit deutlichen Unterschieden in Struktur und Funktionsumfang.
Format:
WEBVTT
00:00:00.000 --> 00:00:03.500
Welcome back to the show.
00:00:03.500 --> 00:00:09.200
Today we're talking about pricing models for small businesses.
Die wichtigsten Unterschiede zu SRT:
- Punkt als Dezimaltrennzeichen, kein Komma.
00:00:03.500. Das Gegenteil von SRT. Dies ist die häufigste Quelle der Verwirrung bei der Konvertierung zwischen beiden. - Pflichtangabe
WEBVTT-Header. Die Datei muss mit der Zeichenfolge „WEBVTT“ beginnen, gefolgt von zwei oder mehr Zeilenumbrüchen. Ohne ihn ist die Datei kein gültiges VTT. - Cue-Kennzeichner sind optional. Anders als bei SRT, wo Cue-Nummern üblich sind (wenn nicht sogar streng erforderlich), verlangt VTT sie nicht.
- Unterstützt Voice-Tags.
<v Speaker 1>Welcome back.</v>ist der W3C-definierte Weg, Sprecher zu kennzeichnen. Player können jede Stimme über CSS-Pseudoelemente unterschiedlich gestalten. - Unterstützt Styling. HTML-ähnliche Tags für Kursivschrift, Fettdruck und Farbe funktionieren innerhalb von Cues.
- Unterstützt Cue-Einstellungen. Position, Ausrichtung und vertikaler Text lassen sich pro Cue festlegen.
VTT ist das, was das HTML5-Element <track> erwartet. Wenn Sie Untertitel auf einer Website über das native Videoelement einbinden, ist VTT das Format, das der Browser nativ versteht. YouTube akzeptiert VTT, empfiehlt aber SRT für neue Creator.
Für einen tieferen Vergleich dieser beiden Formate plus TTML siehe SRT vs. VTT vs. TTML.
TTML: Der Broadcast-Standard
Timed Text Markup Language. Das XML-basierte W3C-Format, das professionelle Rundfunkanstalten und Streaming-Plattformen verlangen. Auch bekannt als DFXP (Distribution Format Exchange Profile), ein bestimmtes Profil von TTML.
TTML unterstützt komplexes Styling, präzise Bildschirmpositionierung, Metadaten für Barrierefreiheit (SDH-Marker, Sprecheridentifikation) und mehrere Sprachspuren in einer einzigen Datei. Netflix verlangt TTML1 für alle Sprachen; BBC iPlayer und Hulu verlangen es ebenfalls für die professionelle Auslieferung.
Für die meisten Creator, die auf YouTube hochladen oder auf ihrer eigenen Website einbetten, wird TTML nicht benötigt. Es spielt eine Rolle, wenn Sie Inhalte an einen Broadcast-Partner oder eine Plattform mit formaler Auslieferungsspezifikation liefern. YouTube akzeptiert zwar TTML und DFXP, aber SRT oder VTT deckt die meisten Creator-Workflows ab.
JSON: Das maschinenlesbare Format
Für Entwickler ist JSON der verlustfreie Export. Alles, was die Transkriptions-Engine weiß, strukturiert und abfragbar.
{
"transcript": "Welcome back to the show...",
"words": [
{"word": "Welcome", "start": 0.020, "end": 0.380, "confidence": 0.998, "speaker": 0},
{"word": "back", "start": 0.380, "end": 0.640, "confidence": 0.997, "speaker": 0}
],
"utterances": [
{"speaker": 0, "text": "Welcome back to the show.", "start": 0.020, "end": 1.880}
],
"metadata": {
"duration": 1845.2,
"language": "en",
"model": "whisper-large-v3"
}
}
JSON enthält das, was SRT und TXT nicht transportieren können: Zeitstempel auf Wortebene, Confidence-Scores pro Wort, Sprecherzuordnungen, Utterance-Gruppierungen und Modell-Metadaten. Optionale Felder von KI-fähigen Engines umfassen Themen, Sentiments und Zusammenfassungen.
Verwenden Sie JSON, wenn Sie irgendetwas auf einem Transkript aufbauen: eigene Video-Player, Suchindizes, KI-Pipelines oder Datenanalysen. Das Format ist ausführlich, aber verlustfrei. Wenn Ihr Transkriptionsdienst das JSON speichert, können Sie später jederzeit nach SRT oder TXT re-exportieren, ohne das Audio erneut durch die Engine laufen zu lassen.
PDF: Das polierte Endergebnis
PDF-Transkripte entstehen durch den Export von DOCX zu PDF. Sie wirken professionell, frieren die Formatierung ein und sind das erwartete Ergebnis für viele juristische und akademische Kunden.
Verwenden Sie PDF für:
- Juristische Schriftsätze und Gerichtsdokumente.
- Ergebnisse akademischer Forschung.
- Kundenberichte, bei denen ein festes Layout zählt.
- Archivierung (sofern der Text eingebettet und nicht gescannt ist).
Verwenden Sie PDF nicht, wenn:
- Der Empfänger den Text bearbeiten wird. Die PDF-Bearbeitung ist langsam und fehleranfällig; geben Sie ihm stattdessen DOCX.
- Der Empfänger es in ein anderes Tool einspeisen wird. JSON oder TXT ist kompatibler.
Wann welches Format?
| Anwendungsfall | Passendes Format |
|---|---|
| Podcast-Shownotes | TXT |
| Blogartikel aus einem Interview | TXT oder DOCX |
| Untertitel für YouTube-Videos | SRT |
| HTML5-Video auf Ihrer Website | VTT |
| TikTok oder Instagram Reel | SRT |
| Netflix-Auslieferung | TTML (laut Auslieferungsspezifikation) |
| Juristisches oder gerichtliches Ergebnis | DOCX oder PDF |
| Akademische Forschungsdaten | JSON + TXT |
| Aufbau eines Suchindex | JSON |
| Eigene NLP- oder KI-Pipeline | JSON |
| Kunde möchte Inhalt bearbeiten | DOCX |
| E-Mail an Kollegen | TXT |
| Archivierung mit festem Layout |
Wenn Sie unsicher sind, exportieren Sie sowohl TXT als auch SRT. Es sind kleine Dateien; beide zu haben gibt Ihnen Flexibilität für Video- und Text-Workflows, ohne die Transkription erneut ausführen zu müssen.
Cue-Länge und Zeilenumbrüche
Genau dieses Thema beißt Untertitel-Einsteiger. Die Standardeinstellungen vieler Tools erzeugen SRT- oder VTT-Dateien mit Cues, die zu lang, zu kurz sind oder auf kleineren Bildschirmen ungeschickt umbrechen. Insbesondere bei Timing-Entscheidungen siehe wann Zeitstempel in der Transkription sinnvoll sind.
Bewährte Praktiken:
- Cue-Dauer: 2–6 Sekunden. Einwort-Cues wirken abgehackt; Cues über 7 Sekunden treiben die Lesegeschwindigkeit zu hoch.
- Zeichen pro Zeile: 32–42 ist die Konvention. Über 42 bricht die Zeile auf Mobilgeräten schlecht um.
- Zeilen pro Cue: maximal 2. Dreizeilige Cues verdecken zu viel vom Video.
- Wörter pro Minute: Zielen Sie auf eine Lesegeschwindigkeit von 160–180 wpm und passen Sie die Cue-Dauer an das Tempo des Sprechers an.
Die meisten modernen Tools liefern vernünftige Standardwerte. Wenn die Cues falsch herauskommen, suchen Sie nach einer Einstellung für „Zeilenlänge“ oder „Lesegeschwindigkeit“, bevor Sie manuell eingreifen.
Formatkonvertierung
Der Wechsel zwischen den Formaten ist meist unkompliziert, aber nicht immer verlustfrei:
- TXT zu/von DOCX: Word beherrscht beides nativ. Kein Informationsverlust.
- SRT zu/von VTT: Triviale Texttransformation: Kommas gegen Punkte tauschen (oder umgekehrt), WEBVTT-Header hinzufügen oder entfernen. Mit jeder Skriptsprache ein Einzeiler.
- JSON zu TXT/SRT/VTT: Die meisten Transkriptionstools machen das automatisch. JSON ist die maßgebliche Quelle; alle anderen Formate leiten sich daraus ab.
- TXT zu SRT/VTT: Erfordert, den Text wieder mit dem Audio abzugleichen, wofür die ursprünglichen Timing-Daten nötig sind. Ohne das Audio oder das ursprüngliche JSON nicht möglich.
- PDF zu allem anderen: Nur zuverlässig, wenn das PDF aus Text erzeugt wurde. Gescannte PDFs erfordern OCR und verlieren die Formatierung.
Wenn Sie ConvertAudioToText verwenden, exportiert es TXT, SRT, VTT, JSON und DOCX aus einem einzigen Transkriptionsauftrag, sodass Sie die Engine nur erneut ausführen müssen, wenn Sie Einstellungen wie Sprache oder Sprecheranzahl ändern. Untertiteldateien können Sie auch direkt im Untertitel-Generator-Tool erstellen.
FAQ
Was ist der Unterschied zwischen SRT und VTT?
Beide sind zeitgesteuerte Untertitelformate mit nahezu identischer Struktur. SRT verwendet ein Komma als Dezimaltrennzeichen in Zeitstempeln (00:00:03,500) und verlangt Cue-Nummern. VTT verwendet einen Punkt (00:00:03.500), macht Cue-Nummern optional, verlangt einen WEBVTT-Header am Dateianfang und unterstützt zusätzlich Voice-Tags, CSS-Styling und Bildschirmpositionierung. SRT funktioniert standardmäßig auf mehr Plattformen; VTT ist das native Format für HTML5-Videoelemente.
Welches Format sollte ich für YouTube verwenden?
SRT ist der praktische Standard für YouTube. YouTube akzeptiert auch VTT, SBV, TTML und mehrere Broadcast-Formate, aber SRT ist das Format, das YouTubes eigene Hilfedokumentation Einsteigern beim Untertiteln empfiehlt. Es wird von Export-Tools breit unterstützt und erfordert keine besondere Konfiguration.
Akzeptiert Netflix SRT-Dateien?
Nein, nicht für die professionelle Auslieferung. Netflix verlangt TTML1 (mit der Endung .xml oder .ttml) für Untertiteldateien. SRT, VTT und SCC werden ohne ausdrückliche Ausnahme durch einen Netflix-Ansprechpartner nicht akzeptiert. Wenn Sie Inhalte an Netflix liefern, prüfen Sie das Netflix Partner Help Center für die aktuelle TTML-Spezifikation.
Was enthält ein JSON-Transkript, das SRT und TXT nicht enthalten?
JSON enthält Zeitstempel auf Wortebene, Confidence-Scores pro Wort, Sprecherzuordnungen, Utterance-Gruppierungen und Modell-Metadaten. SRT enthält nur zeitgesteuerte Textblöcke ohne Details auf Wortebene. TXT enthält nur die Wörter mit optionalen Sprecherbezeichnungen und Absatz-Zeitstempeln. Wenn Sie eine Suche bauen, NLP-Analysen durchführen oder einen eigenen Player antreiben wollen, ist JSON das einzige Format mit den vollständigen Daten.
Kann ich zwischen Transkriptformaten konvertieren, ohne die Transkription erneut auszuführen?
Bei den meisten Konvertierungen ja. SRT, VTT, TXT und DOCX lassen sich alle aus dem ursprünglichen JSON neu erzeugen, ohne das Audio erneut anzufassen – sofern Ihr Transkriptionsdienst das JSON gespeichert hat. Die Konvertierung, die nicht rückwärts funktioniert, ist TXT zu SRT oder VTT: Ohne Timing-Daten auf Wortebene lässt sich kein Zeitstempel präzise platzieren.
Quellen
- W3C-WebVTT-Spezifikation: https://www.w3.org/TR/webvtt1/
- Netflix Timed Text Style Guide (Allgemeine Anforderungen): https://partnerhelp.netflixstudios.com/hc/en-us/articles/215758617-Timed-Text-Style-Guide-General-Requirements
- Netflix IMSC 1.1 Textprofil: https://partnerhelp.netflixstudios.com/hc/en-us/articles/360053755033-Netflix-IMSC-1-1-Text-Profile
- Von YouTube unterstützte Untertitel- und Closed-Caption-Dateien: https://support.google.com/youtube/answer/2734698
- MDN-Dokumentation zur WebVTT-API: https://developer.mozilla.org/en-US/docs/Web/API/WebVTT_API/Web_Video_Text_Tracks_Format
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Subtitle Translation for Video: The Reliable Path
Translate existing subtitles the reliable way: machine pass plus review, length expansion handling, and timing re-fit.

How to Create an SRT File: Format, Rules, Examples
Learn the exact SRT file format: index, timecodes, text blocks, blank lines. Plus encoding gotchas, hand-writing tips, and when to auto-generate instead.