Untertitel-Übersetzungs-Workflow: Ein Video, acht Sprachen (2026)
UntertitelÜbersetzungWorkflow

Untertitel-Übersetzungs-Workflow: Ein Video, acht Sprachen (2026)

BMMamane B. MoussaMay 26, 2026Updated July 2, 202613 min read

Summarize this article with:

TL;DR

Einmal in der Ausgangssprache transkribieren, dieses Transkript korrigieren, bevor eine andere Sprache angefasst wird, dann die SRT in jede Zielsprache übersetzen und dabei die Timecodes intakt halten. YouTube akzeptiert Sidecar-SRT-/VTT-Dateien pro Sprache; TikTok und Instagram erfordern eingebrannte Untertitel. Eine konsequente Konvention zur Dateibenennung (ISO-639-1-Code plus Länder-Suffix) erspart stundenlange Verwirrung über acht Sprachenordner hinweg. Die Quellqualität ist der einzige Engpass, der mit der Sprachanzahl skaliert – investieren Sie also zuerst dort.

Der skalierbare Workflow zur Untertitelübersetzung lautet: einmal transkribieren, viele Male übersetzen. Jede Übersetzung, die Sie nachgelagert ausliefern, hängt von einer einzigen Quell-SRT ab. Bringen Sie diese Datei erst in Ordnung, bevor Sie eine andere Sprache anfassen – dann läuft der Rest der Pipeline sauber, egal wie viele Sprachen Sie hinzufügen.

Dieser Beitrag behandelt die gesamte Produktions-Pipeline: Qualitätskontrolle der Quelle, Wahl des Übersetzungstools, QC pro Sprache, Dateibenennung und Versionierung sowie plattformspezifische Upload-Schritte. Der Beitrag Untertitel für Videos übersetzen geht auf die Übersetzungsmechanik im Detail ein; dieser hier konzentriert sich auf die Pipeline, die sie umschließt.

Warum einmal transkribieren statt einmal pro Sprache

Wenn man acht Sprachen anvisiert, liegt die Versuchung nahe, auf jeder Plattform separat Auto-Übersetzung laufen zu lassen. YouTube bietet beispielsweise Auto-Übersetzung aus automatischen Untertiteln an. Dieser Weg potenziert Fehler gleich zweifach: Zuerst macht der Spracherkenner der Plattform Fehler, dann baut der Auto-Übersetzer auf diesen Fehlern auf. Ab zwei oder drei Sprachen machen die kumulierten Fehler das Ergebnis unbrauchbar, und das Timing ist zwischen den Versionen inkonsistent.

Die richtige Pipeline: eine hochgenaue Quell-SRT mit verifizierten Timecodes, dann diese SRT in jede Zielsprache übersetzen. Die Timecodes bleiben in allen acht Sprachdateien identisch, weil Sie nur den Textinhalt austauschen und nichts neu timen. Eine Quelle, acht Ausgabedateien, dieselben Zeitstempel.

Schritt 1: Qualitätskontrolle des Quelltranskripts

Bevor irgendeine Übersetzung stattfindet, braucht die Quell-SRT einen menschlichen Prüfdurchlauf. Fehler in der Quelle pflanzen sich in jede Sprachversion fort; wer hier einen Fehler findet, eliminiert denselben Fehler gleich achtfach.

Worauf Sie prüfen sollten:

  • Eigennamen und Markennamen. KI-Transkriptionsmodelle verhören sich manchmal bei Namen, die selten in Trainingsdaten vorkommen. Ein falsch transkribierter Markenname wird in jeder Zielsprache zu einem selbstbewusst übersetzten falschen Markennamen.
  • Technische und domänenspezifische Begriffe. Fachjargon, Akronyme und Spezialvokabular sind häufige Fehlerquellen. Gleichen Sie sie mit dem Originalton ab.
  • Abschnitte mit schlechter Audioqualität. Hintergrundgeräusche, Überlappungen oder geringe Lautstärke verursachen Transkriptionsfehler. Markieren Sie diese vor der Übersetzung.
  • Sprecherzuordnung. Wenn Sie Diarisierung verwenden, stellen Sie sicher, dass die Sprecherlabels korrekt sind, bevor Übersetzer oder Übersetzungstools daraus Kontext ableiten.

Planen Sie 10 bis 15 Minuten Prüfung pro Stunde Quellaudio ein. Diese Investition spart mindestens das Achtfache der Zeit, die es kosten würde, dieselben Fehler nach der Übersetzung zu finden und zu beheben.

Der Untertitelgenerator von ConvertAudioToText erzeugt eine SRT, die Sie herunterladen und vor dem Übersetzen prüfen können. Welche Genauigkeit Sie unter verschiedenen Audiobedingungen erwarten können, erklärt der Beitrag Transkriptionsgenauigkeit erklärt: Er zeigt, wie Rauschen, Akzente und Überlappungen die Wortfehlerrate beeinflussen.

Jeder Sprachdurchlauf beginnt bei der korrigierten Quellspur
Jeder Sprachdurchlauf beginnt bei der korrigierten Quellspur

Schritt 2: Zielsprachen auswählen

Die Sprachauswahl sollte sich nach Zielgruppendaten richten, nicht nach Ehrgeiz. Jede Sprache kostet selbst mit Übersetzungsautomatisierung 5 bis 15 Minuten Bearbeitungszeit pro Video, denn jede Datei braucht mindestens einen kurzen Prüfdurchlauf.

Typische Sprachauswahlen 2026:

  • Englischsprachige Creator mit Fokus auf westliche Märkte: Spanisch, Französisch, Portugiesisch (Brasilien), Deutsch, Italienisch.
  • Englischsprachige Creator mit globalem Anspruch: Spanisch, Portugiesisch, Arabisch, Hindi, Mandarin.
  • Creator mit Fokus auf Afrika: Englisch, Französisch, Arabisch, Swahili, Hausa.
  • Creator mit Fokus nur auf Europa: Spanisch, Französisch, Deutsch, Italienisch, Polnisch, Niederländisch.

Meine Einschätzung: Wenn Sie noch keine Zielgruppendaten haben, starten Sie mit maximal drei Sprachen. Bauen Sie die Pipeline dafür auf, prüfen Sie die Qualität und fügen Sie weitere Sprachen hinzu, sobald das System zuverlässig läuft. Drei Sprachen gut auszuliefern schlägt acht Sprachen schlampig auszuliefern.

Schritt 3: Ein untertitelbewusstes Übersetzungstool wählen

Zwei Kategorien von Tools eignen sich für die SRT-Übersetzung: spezialisierte Untertitel-Übersetzungsdienste, die das SRT-Format nativ parsen, und allgemeine Übersetzungsmodelle, die mit strukturhaltenden Prompts verwendet werden.

Der spezialisierte Weg ist für den Produktiveinsatz sicherer. Speziell für SRT gebaute Tools lesen jeden Cue einzeln, übersetzen nur den Dialogtext und liefern eine Datei zurück, in der alle Timecodes und Cue-Nummern unangetastet sind. Die Alternative – eine SRT-Datei in die Textoberfläche von Google Translate einzufügen – führt nachweislich zu zusammengeführten Zeilen, übersetzten Zeitstempeln und fehlenden Leerzeilen-Trennern zwischen den Cues, besonders bei Dateien über wenige Minuten Länge.

DeepL unterstützt den SRT-Dateiupload nativ und erhält die Timecodes. Für die Dateiübersetzung ist ein bezahltes Pro-Abo nötig; im Gratis-Tarif wird SRT nicht unterstützt. Nutzer haben Timeout-Probleme bei Dateien mit etwa 1.500 Zeilen oder mehr gemeldet – teilen Sie die SRT bei Langformatinhalten daher vorher in Segmente auf.

Allgemeine LLMs (ChatGPT, Claude) können die SRT-Übersetzung zuverlässig bewältigen, wenn Sie sie im Prompt anweisen, die Struktur zu erhalten: Sequenznummern, Timecodes, Leerzeilen-Trenner und ausschließlich den Cue-Text. Dieser Ansatz funktioniert, erfordert aber einen Verifikationsdurchlauf, um zu bestätigen, dass die Ausgabedatei gültiges SRT ist. Für Einzelprojekte reicht das; für eine Produktions-Pipeline mit vielen Videos ist ein spezialisiertes Tool zuverlässiger.

Für welches Tool Sie sich auch entscheiden: Verwenden Sie niemals die Weboberfläche von Google Translate für eine SRT-Datei. Das Ergebnis bricht bei größeren Dateien regelmäßig die Struktur.

Schritt 4: Qualitätsprüfung pro Sprache

Die Übersetzungsqualität variiert erheblich je nach Sprachpaar. Englisch nach Spanisch, Französisch, Deutsch und Portugiesisch ist mit leichter Prüfung meist nahe an der Veröffentlichungsreife. Englisch nach Arabisch, Mandarin, Japanisch und Koreanisch erfordert sorgfältigere Prüfung, weil sich die grammatische Struktur deutlich unterscheidet und die Satzlänge in der Zielsprache oft von der Quelle abweicht.

Prüfprioritäten nach Sprachtyp:

  • Von rechts nach links geschriebene Sprachen (Arabisch, Hebräisch): Prüfen Sie, ob die Textrichtung korrekt erhalten bleibt. SRT-Dateien codieren keine RTL-Richtungsmetadaten; einige Untertitel-Renderer brauchen explizite bidirektionale Unicode-Steuerzeichen für eine korrekte Darstellung. Netflix verlangt für RTL-Sprachen ausdrücklich das TTML-Format, weil die SRT-RTL-Behandlung über Player hinweg inkonsistent ist.
  • Logografische Sprachen (Chinesisch, Japanisch): Die Platzierung von Zeilenumbrüchen ist wichtiger als in lateinischen Schriften. Umbrüche sollten an natürlichen grammatischen Grenzen erfolgen, nicht nur an Zeichenbegrenzungen. Übliche Untertitel-Konventionen für Japanisch zielen auf kürzere Zeilen als europäische Sprachen.
  • Stark flektierende Sprachen (Russisch, Polnisch, Ungarisch): Achten Sie auf grammatikalische Kasusfehler bei Eigennamen und Fachbegriffen – maschinelle Übersetzer produzieren dort häufig falsche Flexionen.
  • Tonsprachen (Mandarin, Vietnamesisch, Thai): Von Tönen abhängige Bedeutungen überstehen den Transkriptionsschritt nicht, sodass Homophon-Fehler in der Quelle die Bedeutung in der Übersetzung umkehren können. Die Prüfung durch Muttersprachler hat hier einen höheren Wert als bei anderen Sprachpaaren.

Wenn Sie keinen muttersprachlichen Prüfer für eine Zielsprache haben, fängt ein zweiter KI-Übersetzungsdurchlauf mit einem anderen Modell einen beträchtlichen Teil der Fehler, die das erste Modell produziert hat. Es ersetzt keine menschliche Prüfung, ist aber eine vernünftige Qualitätskontrolle für alle mit knappem Budget.

Schritt 5: Kulturelle Anpassung über die wörtliche Übersetzung hinaus

Wörtliche Übersetzung ist nicht immer das richtige Ergebnis. Einige Inhaltskategorien brauchen Anpassung:

  • Idiome. Die meisten KI-Übersetzungstools behandeln gängige Idiome bei großen Sprachpaaren korrekt. Prüfen Sie seltenere Idiome und kontrollieren Sie das Ergebnis, statt es anzunehmen.
  • Währungen und Maßeinheiten. Ein Dollarbetrag oder eine imperiale Maßeinheit in der englischen Quelle bleibt im Untertitel meist unverändert, mit einem Klammerzusatz zur lokalen Entsprechung, wenn das Publikum kein Gefühl für die Ausgangseinheit hätte.
  • Kulturelle Referenzen. Ein Witz, der an eine bestimmte Sendung oder einen kulturellen Moment geknüpft ist, kommt möglicherweise in einem anderen Markt nicht an. Die Untertitel-Lokalisierung ersetzt manchmal eine lokal erkennbare Referenz – dafür braucht es allerdings jemanden, der beide Kulturen kennt.
  • Namen und Titel. Manche Übersetzungstools ordnen Familienname und Vorname nach ostasiatischer Konvention um, andere nicht. Klären Sie Ihre bevorzugte Konvention und wenden Sie sie konsistent an.

Bei den meisten Creator-Inhalten ist die nötige Anpassung minimal. Bei Unternehmens-, Schulungs- oder Marketinginhalten entscheidet die Anpassung maßgeblich darüber, ob die lokalisierte Version ihren Zweck erfüllt.

Schritt 6: Dateibenennung und Versionierung

Eine klare Namenskonvention verhindert Verwirrung, wenn Sie pro Video acht Sprachdateien über Dutzende Videos hinweg verwalten.

Das Standardformat: videoname.LANG.srt, wobei LANG der zweibuchstabige ISO-639-1-Code in Kleinbuchstaben ist. Beispiele:

  • episode-42.en.srt
  • episode-42.fr.srt
  • episode-42.es.srt
  • episode-42.ar.srt
  • episode-42.zh.srt

Wenn Sie eine Unterscheidung auf Länderebene brauchen, hängen Sie einen Unterstrich und den Ländercode in Großbuchstaben an:

  • episode-42.pt_BR.srt (Brasilianisches Portugiesisch)
  • episode-42.pt_PT.srt (Europäisches Portugiesisch)
  • episode-42.zh_TW.srt (Traditionelles Chinesisch für Taiwan)
  • episode-42.zh_CN.srt (Vereinfachtes Chinesisch für Festlandchina)

Für Spuren für Hörgeschädigte mit Nicht-Sprach-Audiobeschreibungen hängen Sie -SDH vor die Dateiendung an: episode-42.en-SDH.srt.

Legen Sie einen _source-Ordner an, der die ursprüngliche SRT in der Ausgangssprache und die Audiodatei enthält. Bewahren Sie jede übersetzte Version in einem _translated-Ordner auf, gegliedert nach Sprachcode. Wenn Sie die Quell-SRT überarbeiten, erhöhen Sie ein Versions-Suffix (episode-42.en_v2.srt) und übersetzen Sie erneut aus der korrigierten Quelle, statt einzelne Sprachdateien zu patchen.

Schritt 7: Plattformspezifische Ausgabe und Upload

Die Zielplattform bestimmt das Dateiformat und die Liefermethode.

PlattformAkzeptierte FormateLiefermethodeHinweise
YouTubeSRT, VTT, SBV, TTMLSidecar-Datei pro Sprache„Sprache hinzufügen“ in Studio für jedes Ziel
TikTokNur Einbrennen (über In-App-Auto-Untertitel oder eingebranntes Video)Vorgerendertes Video hochladenKein externer SRT-Dateiupload
Instagram ReelsNur EinbrennenVorgerendertes Video hochladenKeine Sidecar-Untertiteldateien akzeptiert
NetflixTTML / IMSC 1.1 (.xml/.ttml)Partner-Liefer-SpezifikationSeparate Datei pro Sprache, max. 42 Zeichen/Zeile
Amazon PrimeSRT, VTT, TTML, SCC, STLPartner-Liefer-SpezifikationUTF-8-kodiert; gebietsspezifische Anforderungen gelten

YouTube: Mehrsprachiger Sidecar-Upload

YouTube akzeptiert separate SRT-, VTT- oder SBV-Dateien pro Sprache als Sidecar-Spuren. Die Schritte:

  1. Laden Sie das Originalvideo einmal hoch.
  2. Öffnen Sie in YouTube Studio das Video und gehen Sie zu „Untertitel“.
  3. Klicken Sie für jede Zielsprache auf „Sprache hinzufügen“.
  4. Klicken Sie unter „Untertitel“ auf „Hinzufügen“ und wählen Sie „Datei hochladen“.
  5. Wählen Sie „Mit Timing“ aus und laden Sie die entsprechende SRT für diese Sprache hoch.
  6. Veröffentlichen Sie. YouTube aktiviert den Sprachwechsel für Zuschauer automatisch.

YouTube empfiehlt SRT oder SBV für Nutzer, die mit Untertitelformaten nicht vertraut sind, weil sie nur grundlegende Timing-Informationen benötigen und sich in jedem Texteditor öffnen lassen.

TikTok und Instagram: Ein Render pro Sprache

Keine der beiden Plattformen akzeptiert externe SRT-Sidecar-Dateien über den Standard-Upload-Flow. Für mehrsprachige Inhalte ist der Workflow:

  1. Brennen Sie die Untertitel der Ausgangssprache mit FFmpeg oder einem Videoeditor ins Video ein.
  2. Ersetzen Sie die Quell-SRT durch die übersetzte SRT und rendern Sie neu.
  3. Laden Sie ein separates Video pro Sprache hoch oder laden Sie einmalig auf jedes sprachspezifische Konto hoch.

Der Beitrag Untertitel ins Video einbrennen behandelt den FFmpeg-Befehl für Batch-Einbrennen-Rendering – der schnellste Weg, wenn Sie mehrere Sprachversionen produzieren.

Streaming-Plattformen

Netflix verlangt TTML (mit der Endung .xml oder .ttml) für fast alle Sprachen und IMSC 1.1 für Japanisch. SRT oder SBV werden nicht akzeptiert. Maximale Lesegeschwindigkeit: 20 Zeichen pro Sekunde; maximal zwei Zeilen pro Untertitel; höchstens 42 Zeichen pro Zeile. Amazon Prime Video akzeptiert SRT, WebVTT, TTML und mehrere Broadcast-Formate, UTF-8-kodiert.

Prüfen Sie für Inhalte, die zu Streaming-Partnern gehen, die aktuelle Liefer-Spezifikation direkt bei jeder Plattform, bevor die Produktion beginnt. Die Anforderungen ändern sich, und plattformspezifische Anforderungen für Gebietsvarianten (Japan, USA usw.) sind strenger als die allgemeine Spezifikation.

Ein realer Zeitplan für eine Ausgabe in 8 Sprachen

Für einen 15-minütigen englischen Quellclip, der in acht Sprachen geht:

  • Quelltranskription: 5 Minuten
  • Prüfung und Korrektur der Quell-SRT: 12 Minuten
  • Übersetzung in 7 Zielsprachen: 5 Minuten (Batch-Übersetzungstool)
  • Prüfung pro Sprache mit je 3 Minuten: 21 Minuten
  • YouTube-Upload von 8 SRT-Dateien: 5 Minuten

Gesamt: rund 48 Minuten. Die Fixkosten (Transkription, Quellprüfung, Upload) liegen bei etwa 22 Minuten; jede zusätzliche Sprache nach der ersten kostet rund 3 Minuten mehr. Die Grenzkosten einer neunten oder zehnten Sprache sind gering, sobald die Pipeline steht.

Für TikTok oder Reels kommt pro Sprache noch die Renderzeit obendrauf. Ein 1-minütiger Clip braucht bei Standardeinstellungen typischerweise 3 bis 5 Minuten Rendering pro Sprachversion.

Was Sie nicht tun sollten

Drei Antimuster, die mehrsprachige Pipelines brechen:

  1. Auto-Übersetzen der YouTube-Auto-Untertitel. YouTubes automatische Untertitel enthalten bereits Transkriptionsfehler. Wer sie automatisch übersetzt, stapelt Übersetzungsfehler obendrauf. Die kumulierte Fehlerrate macht das Ergebnis für viele Sprachpaare schlechter als gar keine Untertitel.

  2. Eine Mega-SRT mit mehreren gestapelten Sprachen. Manche VTT- und TTML-Profile unterstützen mehrere Sprachspuren in einer einzigen Datei, aber die meisten Consumer-Plattformen parsen sie nicht korrekt. Liefern Sie eine Datei pro Sprache aus.

  3. Die Prüfung pro Sprache komplett auslassen. Schlechte Untertitel in einer Fremdsprache schaden der Glaubwürdigkeit mehr als keine Untertitel. Ist das Budget für die Prüfung pro Sprache null, liefern Sie weniger Sprachen aus. Drei Sprachen gut gemacht sind nützlicher als acht Sprachen mit ungeprüften Fehlern.

Wo Sie anfangen sollten

Die einzige Maßnahme mit dem größten Hebel ist, die Pipeline in der Ausgangssprache richtig aufzusetzen, bevor man an Übersetzung denkt. Eine saubere, geprüfte Quell-SRT in jeder Ausgangssprache ermöglicht jede nachgelagerte Übersetzung. Für eine tiefere Behandlung des Übersetzungsschritts selbst siehe Untertitel für Videos übersetzen.

Wenn Sie die Format-Tradeoffs verstehen wollen, bevor Sie einen Dateityp wählen, behandelt SRT vs. VTT Untertitelformate die funktionalen Unterschiede.

Starten Sie mit drei Sprachen, etablieren Sie Namenskonvention und Ordnerstruktur ab dem ersten Video und fügen Sie weitere Sprachen hinzu, sobald das System konsistent läuft.

Wenn Sie nur ein sauberes Quelltranskript brauchen, um die Pipeline zu starten, transkribiert ConvertAudioToText jede Audio- oder Videodatei und lässt Sie den vollständigen Text kostenlos kopieren oder die SRT mit einer kostenlosen 7-Tage-Testphase herunterladen.

Häufig gestellte Fragen

Kann ich Untertitel übersetzen, ohne die Audioaufnahme für jede Sprache neu zu transkribieren?

Ja, und Sie sollten genau das tun. Transkribieren Sie die Audioquelle einmal, korrigieren Sie dieses Transkript und geben Sie die SRT dann an ein untertitelbewusstes Übersetzungstool weiter. Die Timecodes bleiben in allen Sprachversionen identisch, weil Sie nur den Textinhalt ändern und nichts neu timen.

Funktioniert Google Translate zum Übersetzen einer SRT-Datei?

Nur bei sehr kurzen Dateien. Der Textmodus von Google Translate parst die SRT-Struktur nicht, sodass er Timecodes oft in den Text verschmilzt, die numerischen Zähler übersetzt oder die Leerzeilen-Trenner zwischen den Cues entfernt. Das Ergebnis erfordert umfangreiche manuelle Nacharbeit. Verwenden Sie ein Tool, das jeden SRT-Cue einzeln liest und die Datei mit allen unangetasteten Timecodes zurückgibt.

Wie lade ich Untertitel in mehreren Sprachen zu YouTube hoch?

Laden Sie das Originalvideo einmal hoch. Gehen Sie in YouTube Studio zu „Untertitel“, wählen Sie das Video aus, klicken Sie auf „Sprache hinzufügen“, wählen Sie die Zielsprache, klicken Sie dann unter „Untertitel“ auf „Hinzufügen“ und wählen Sie „Datei hochladen“. Wählen Sie die SRT- oder VTT-Datei für diese Sprache aus. Wiederholen Sie dies für jede Sprache. YouTube regelt den Sprachwechsel für Zuschauer automatisch.

Akzeptieren TikTok und Instagram separate Untertiteldateien wie SRT?

Instagram akzeptiert gar keine Sidecar-Untertiteldateien; Sie müssen die Untertitel vor dem Hochladen in die Videopixel einbrennen. TikTok hat sein eigenes In-App-Tool für automatische Untertitel, akzeptiert aber keine externen SRT-Uploads von Drittanbietern über den Standard-Upload-Flow. Für mehrsprachige TikTok- oder Reels-Inhalte brennen Sie einen separaten Render pro Sprache ein.

Welche Namenskonvention sollte ich für mehrsprachige Untertiteldateien verwenden?

Die weit verbreitete Konvention ist dateiname.LANG.srt, wobei LANG der zweibuchstabige ISO-639-1-Code in Kleinbuchstaben ist (en, fr, es, de, ar, zh). Wenn Sie eine Unterscheidung auf Länderebene benötigen, hängen Sie einen Unterstrich und den Ländercode in Großbuchstaben an: dateiname.pt_BR.srt für brasilianisches Portugiesisch gegenüber dateiname.pt_PT.srt für europäisches Portugiesisch. Ergänzen Sie -SDH im Dateinamen, wenn die Spur Beschreibungen für Hörgeschädigte enthält.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles