
MKV in Text umwandeln: Mehrspur-Audio & OBS-Aufnahmen
Summarize this article with:
Die Kurzfassung
Laden Sie Ihre MKV-Datei zu einem Transkriptions-Tool hoch, und es funktioniert – mit einem Haken: Enthält Ihre Datei mehrere Audiospuren (häufig bei OBS-Aufnahmen, Blu-ray-Rips und Setups mit mehreren Mikrofonen), müssen Sie wissen, welche Spur den Ton enthält, den Sie tatsächlich wollen. Führen Sie zuerst kurz ffprobe aus, ordnen Sie die richtige Spur zu, und der Rest ist Routine.

Was MKV ist und woher Ihre Dateien stammen
MKV (Matroska Video) ist der flexibelste Videocontainer im gängigen Gebrauch. Anders als MP4 setzt er keine harten Grenzen dafür, wie viele Audiospuren, Untertitelspuren oder Kapitel in einer einzigen Datei stecken dürfen. Diese Flexibilität ist der Grund, warum MKV verbreitet ist bei:
- OBS-Studio-Aufnahmen (für Mehrspur-Arbeit empfohlen, auch wenn OBS 32 den Standard für Neuinstallationen geändert hat)
- Gerippten DVDs und Blu-rays mit mehreren Audiosprachen
- Anime- und TV-Archiven mit Originalsprache plus synchronisiertem Ton
- Podcast-Setups mit mehreren Mikrofonen, bei denen jedes Mikrofon auf seiner eigenen Spur landet
- Konferenzmitschnitten mit separaten Mikrofonfeeds der Sprecher
- Linux-Bildschirmrekordern wie SimpleScreenRecorder und Kazam
Für die Transkription ist MKVs Mehrspur-Unterstützung zugleich ein Vorteil und eine Erschwernis. Sie müssen die richtige Spur auswählen, bevor Sie transkribieren.
Der OBS-Standard hat sich in Version 32 geändert
Der verbreitete Rat „OBS zeichnet standardmäßig MKV auf“ ist inzwischen überholt. OBS 30.2 führte Hybrid MP4 ein (ein absturzresistentes fragmentiertes MP4), und OBS 32.0 machte Hybrid MP4/MOV zum Standard-Container für Neuinstallationen. Wenn Sie OBS kürzlich installiert haben, erhalten Sie möglicherweise bereits Hybrid-MP4-Dateien statt MKV.
Dennoch bleibt MKV das empfohlene Format für Mehrspur-Aufnahmen. Hybrid MP4s Absturzschutz deckt den Anwendungsfall mit einer einzigen Spur ab. Mehrspuriges MKV ist weiterhin die bessere Wahl, wenn Sie isolierten Ton pro Quelle möchten, denn:
- MKV unterstützt in OBS bis zu 6 Audiospuren (Hybrid MP4 nimmt typischerweise als einzelner kombinierter Stream auf)
- Sie können MKV jederzeit ohne Neukodierung über Datei > Aufnahmen remuxen in MP4 umwandeln
- Editoren und Transkriptions-Tools können anschließend genau die Spur auswählen, die sie benötigen
Meine Einschätzung: Wenn Sie einen Podcast, ein Interview oder eine Konferenz mit separaten Mikrofonen aufnehmen, verwenden Sie in OBS ausdrücklich MKV. Wenn Sie eine Einzelquellen-Bildschirmaufnahme oder ein Game Capture machen, ist Hybrid MP4 völlig ausreichend und einfacher.
Was die Spuren in einem OBS-MKV tatsächlich enthalten
Die OBS-Dokumentation beschreibt Spur 1 als den voreingestellten kombinierten Mix „aller Quellen“. In den Spuren 2 bis 6 leiten Sie isolierte Quellen in den Erweiterten Audioeigenschaften weiter. Ein typisches Mehrspur-Setup in OBS könnte so aussehen:
- Spur 1: Kombinierter Stereomix von allem (Standard-Wiedergabespur)
- Spur 2: Nur Ihr Mikrofon
- Spur 3: Nur Desktop-/Spieleton
- Spur 4: Kommunikation (Discord, Anrufe)
Für die Transkription ist Spur 2 (nur Mikrofon) fast immer das, was Sie wollen. Spur 1 fängt Tastenanschläge, Spielsound und Hintergrundgeräusche zusammen mit Ihrer Stimme ein.
Schritt 1: Spuren vor dem Hochladen prüfen
Zehn Sekunden mit ffprobe ersparen Ihnen, die falsche Sprache oder einen rauschlastigen kombinierten Mix zu transkribieren. Führen Sie aus:
ffprobe -v error -show_streams -select_streams a -of json input.mkv
Dieser Befehl gibt jeden Audiostream mit seinem Index, dem Codec-Namen, der Kanalzahl und dem Sprach-Tag aus. Bei einem typischen Blu-ray-Rip könnten Sie sehen:
- Stream 0:1 - AC3, 6 Kanäle, lang: eng
- Stream 0:2 - AAC, 2 Kanäle, lang: spa
- Stream 0:3 - AC3, 2 Kanäle, lang: fra (Regiekommentar)
Bei einem typischen OBS-MKV mit mehreren Spuren:
- Stream 0:1 - AAC, 2 Kanäle (kombinierter Mix)
- Stream 0:2 - AAC, 1 Kanal (Mikrofon)
- Stream 0:3 - AAC, 2 Kanäle (Desktop-Ton)
Ermitteln Sie den Stream-Index, bevor Sie fortfahren. In ffmpeg sind die Spurindizes nullbasiert (die zweite Audiospur ist 0:a:1).
Schritt 2: Die richtige Spur extrahieren
Hat Ihr MKV nur eine einzige Audiospur, laden Sie es unverändert hoch. Enthält es mehrere Spuren, extrahieren Sie zunächst die benötigte. Das verkleinert die Dateigröße außerdem drastisch. Ein 90-minütiger Film als MKV kann 8 bis 15 GB groß sein; allein die Audiospur umfasst typischerweise 100 bis 300 MB.
Extrahieren Sie eine bestimmte Audiospur ohne Neukodierung:
ffmpeg -i video.mkv -map 0:a:1 -c:a copy track2.m4a
Ersetzen Sie 0:a:1 durch 0:a:2 für die dritte Audiospur und so weiter.
Ist die Datei wegen des Videos zu groß zum Hochladen, entfernen Sie das Video komplett:
ffmpeg -i in.mkv -vn -c:a copy audio.mka
Die Endung .mka steht für Matroska Audio, einen Container, den die meisten Transkriptions-Tools akzeptieren. Je nach Quell-Codec können Sie auch .aac, .mp3 oder .m4a verwenden.
Schritt 3: Codec-Kompatibilität behandeln
MKV kann Codecs enthalten, mit denen webbasierte Transkriptions-Tools Probleme haben. Die gängigsten:
AC3 und AAC funktionieren überall. Keine Maßnahme nötig.
Opus funktioniert überall. OBS-Aufnahmen verwenden häufig Opus.
FLAC funktioniert in den meisten Tools. Es ist verlustfrei und groß, aber Transkriptionsdienste kommen damit klar.
DTS und DTS-HD sind bei Blu-ray-Rips verbreitet und werden von Online-Tools oft abgelehnt. Konvertieren Sie zuerst:
ffmpeg -i bluray.mkv -map 0:a:0 -c:a libmp3lame -b:a 192k audio.mp3
TrueHD (Dolby Atmos) ist ebenfalls ein Blu-ray-Klassiker und hat dasselbe Problem. Gleiche Lösung, gleicher Befehl – geben Sie einfach den richtigen Stream-Index an.
Mehrkanal-Ton (5.1, 7.1) kann die Sprechererkennung verwirren. Für reines Speech-to-Text mischen Sie auf Stereo oder Mono herunter:
ffmpeg -i input.mkv -map 0:a:0 -ac 2 -c:a aac output.m4a
Schritt 4: Hochladen und Sprache festlegen
Passen Sie die Transkriptionssprache an die Audiospur an, die Sie extrahiert haben. Wenn Sie die spanische Spur transkribieren, stellen Sie Spanisch im Tool ein. Eine nicht übereinstimmende Sprache ist die häufigste Ursache für wirre Transkriptionsergebnisse.
Für Video-zu-Text-Workflows können Sie das Video-zu-Text-Tool auf ConvertAudioToText nutzen. Ziehen Sie die Datei hinein, stellen Sie die Sprache ein und lassen Sie es laufen. Eine 2-stündige Aufnahme ist je nach Auslastung der Warteschlange in etwa 10 bis 20 Minuten fertig.
Wenn Sie bei einer Aufnahme mit mehreren Mikrofonen Genauigkeit pro Sprecher wollen, statt auf automatische Diarisierung zu setzen, lesen Sie Speaker-Diarisierung erklärt, um zu erfahren, wann die Extraktion pro Spur die KI-Sprecheraufteilung schlägt.
Die Abkürzung über die Untertitelspur (wenn sie anwendbar ist)
MKV kann eingebettete Untertitelspuren neben seinem Ton mitführen. Es gibt zwei grundverschiedene Typen:
Textbasierte Untertitel (SRT, ASS, SSA): Diese liegen als lesbarer Textstream vor. Hat Ihr MKV bereits genaue Untertitel, können Sie diese direkt extrahieren, ganz ohne Transkription:
ffmpeg -i video.mkv -map 0:s:0 subtitles.srt
Das geht sofort und kostenlos. Es funktioniert nur, wenn die Untertitel bereits vorhanden und korrekt sind.
PGS-Untertitel (Blu-ray-Bilduntertitel): Diese liegen als Bitmap-Bilder vor, nicht als Text. ffmpeg -map 0:s:0 exportiert eine .sup-Datei, keinen lesbaren Text. Die Umwandlung von PGS in SRT erfordert OCR-Software (das OCR-Modul von Subtitle Edit ist das Standardwerkzeug), und das Ergebnis braucht üblicherweise manuelle Nachbearbeitung. Bei Blu-ray-Rips mit PGS-Untertiteln ist eine erneute Transkription des Tons meist schneller und genauer als OCR auf Bildbitmaps.
Um zu prüfen, welchen Untertiteltyp Ihr MKV hat:
ffprobe -v error -show_streams -select_streams s -of json input.mkv
Sehen Sie sich das Feld codec_name an. subrip oder ass bedeutet textbasiert. hdmv_pgs_subtitle bedeutet bildbasiertes Bitmap-PGS.
MKV-Workflows pro Quelle
OBS-Aufnahmen
Bei OBS-MKV-Dateien mit mehreren Spuren extrahieren Sie vor dem Transkribieren immer die Nur-Mikrofon-Spur (typischerweise Spur 2). Der kombinierte Mix auf Spur 1 enthält Tastaturgeräusche, Spielsound und Benachrichtigungstöne, die die Genauigkeit verschlechtern.
Wenn Sie Streams aufgenommen haben und nur die Stimme möchten, aktivieren Sie Mehrspur-Audio in OBS vor Ihrer nächsten Aufnahmesitzung: Einstellungen > Ausgabe > Aufnahme > Kontrollkästchen für Audiospuren. Einmal eingerichtet, legt das MKV jede Quelle getrennt ab.
Gerippte DVDs und Blu-rays
DVD-Rips haben typischerweise mehrere Sprachspuren plus Kommentar. Sprach-Tags sind Ihr Wegweiser, aber sie sind nicht immer korrekt. Machen Sie mit VLC eine Stichprobe, indem Sie manuell zwischen den Audiospuren wechseln, bevor Sie sich auf die Transkription festlegen. Überlegen Sie bei einem Film-Recherche-Projekt, ob Sie die Originalsprach-Spur wollen (maßgebliche Dialoge) oder eine Synchronspur (kann in Formulierung und Timing vom Originaldrehbuch abweichen).
Regiekommentar-Spuren werden oft versehentlich transkribiert, wenn Nutzer vergessen, eine Spur anzugeben. Prüfen Sie zuerst mit ffprobe.
Konferenz- und Multi-Mikrofon-Aufnahmen
Mehrraum- und Multi-Mikrofon-Aufnahmesysteme können MKV mit je einer Spur pro Mikrofon erzeugen. Für die Transkriptqualität ist es besser, einzelne Mikrofonspuren separat zu transkribieren, als sich auf Diarisierung zu verlassen, die auf einem verrauschten kombinierten Mix angewendet wird.
Extrahieren Sie jede Spur, transkribieren Sie jede separat und führen Sie die Ausgaben dann in Zeitstempel-Reihenfolge zusammen. Das ergibt eine saubere Sprecherzuordnung ohne jegliche Mehrdeutigkeit der Sprechererkennung. Mehr dazu, wann dieser Kompromiss die zusätzlichen Schritte wert ist, finden Sie unter Speaker-Diarisierung erklärt.
Linux-Bildschirmrekorder
OBS, SimpleScreenRecorder und Kazam erzeugen unter Linux alle MKV. Die Audioqualität hängt vom Audio-Backend ab. PipeWire (der moderne Standard auf den meisten aktuellen Distributionen) zeichnet sauber mit 48 kHz auf. Ältere PulseAudio-Setups können bei langen Aufnahmen alle paar Sekunden Aussetzer verursachen. Hat Ihr MKV periodische Tonaussetzer, prüfen Sie, ob eine PipeWire-Migration auf Ihrem System das beheben würde, bevor Sie dem Transkriptions-Tool die Schuld geben.
MKV im Vergleich zu anderen Mehrspur-Containern
| Container | Audiospuren | Untertitelspuren | Tool-Unterstützung | Am besten geeignet für |
|---|---|---|---|---|
| MKV | Unbegrenzt | Unbegrenzt (Text + PGS) | Gut | Archive, mehrsprachig, Multi-Mikrofon |
| MP4 | Mehrere | Begrenzt (kein PGS) | Hervorragend | Verbreitung in einer Sprache |
| MOV | Mehrere | Begrenzt | Apple-zentriert | iPhone, ProRes, Final Cut |
| WebM | Begrenzt | Nur VTT | Browser-nativ | Web-Einbettungen |
MKV ist der richtige Container für Inhalte mit mehreren Audio- oder Untertitelversionen. Es ist nicht die richtige Wahl, wenn Sie maximale Kompatibilität mit Consumer-Geräten oder Streaming-Plattformen brauchen, die MP4 erwarten. Unter Unterstützte Audioformate für die Transkription erfahren Sie, wie verschiedene Container die Upload-Kompatibilität über Tools hinweg beeinflussen.
Häufige Probleme bei der MKV-Transkription
Falsche Sprache im Transkript
Ihr Tool ist auf Spur 1 zurückgefallen. Hat Ihr MKV englischen und spanischen Ton und Sie brauchten Spanisch, extrahieren Sie erneut mit -map 0:a:1 und laden Sie neu hoch.
Fehler „Nicht unterstützter Codec“
Fast sicher DTS oder TrueHD aus einem Blu-ray-Rip. Konvertieren Sie mit dem ffmpeg-Befehl aus dem Codec-Abschnitt oben zu MP3 oder AAC.
Der Sprach-Tag ist falsch
Manche Encoder versehen Spuren mit falschen Tags. Eine als „eng“ getaggte Datei, die japanischen Ton abspielt, kommt in älteren Rips häufig vor. Vertrauen Sie dem Tag nicht blind. Verifizieren Sie, indem Sie in VLC ein 30-sekündiges Sample anhören.
MKV-Kapitelmarker verursachen Segmentfehler
Manche Tools stolpern über in der Datei eingebettete Matroska-Kapitelmarker. Entfernen Sie sie:
ffmpeg -i in.mkv -map 0 -map_chapters -1 -c copy out.mkv
Datei zu groß zum Hochladen
Der Videostream ist der Grund. Ein 2-stündiger Film in 1080p ist 8 bis 15 GB groß. Der Audiostream ist 100 bis 300 MB. Entfernen Sie das Video zuerst mit dem oben genannten -vn-Befehl.
Wenn Sie einen schnellen Weg ohne Registrierung für ein einzelnes MKV ohne Spur-Komplikationen suchen, akzeptiert ConvertAudioToText MKV-Uploads und verarbeitet sie ohne Konto bis zu 10 Minuten. Der kostenlose eingeloggte Tarif gibt 10 Transkriptionsminuten, einmalig bei der Registrierung statt monatlich; der Pro-Tarif für 9,99 $/Monat hebt die Obergrenze komplett auf.
FAQ
Kann ich mehrere Audiospuren gleichzeitig transkribieren?
Die meisten Tools transkribieren eine Spur pro Auftrag. Bei MKV-Dateien mit mehreren Spuren führen Sie pro Spur separate Transkriptionsaufträge aus und führen die Ergebnisse anschließend in Zeitstempel-Reihenfolge zusammen. Das ist der sauberste Ansatz für Podcasts mit mehreren Sprechern, bei denen jeder Sprecher seine eigene Spur hat, und zuverlässiger als die automatische Speaker-Diarisierung.
Ist die Audioqualität von MKV besser als die von MP4?
Der Container beeinflusst die Audioqualität nicht. MKV kann hochwertigere Codecs (FLAC, DTS-HD, TrueHD) enthalten als Standard-MP4, doch ein typisches OBS-MKV nutzt dasselbe AAC wie MP4. Die Wahl des Codecs zählt; die Wahl des Containers nicht.
Kann ich MKV kostenlos transkribieren?
Ja. ConvertAudioToText akzeptiert MKV-Dateien und verarbeitet bis zu 10 Minuten ohne Konto, und der kostenlose Plan fügt 10 Transkriptionsminuten hinzu, die einmalig bei der Registrierung vergeben werden. Für längere Dateien oder Mehrspur-Workflows pro Sprecher entfernt der Pro-Tarif für 9,99 $/Monat das Limit vollständig.
Was ist mit MKV-Dateien ohne Sprach-Tag in der Audiospur?
Öffnen Sie die Datei in VLC und hören Sie sich unter Audio > Audiospur einige Sekunden jeder Spur an. Oder vertrauen Sie der Reihenfolge: In den meisten Film-Rips ist Spur 1 die Originalsprache, die folgenden Spuren sind Synchronfassungen. Nicht garantiert, aber ein vernünftiger Ausgangspunkt, bevor Sie ffprobe ausführen.
Quellen
- Release Notes zu OBS Studio 32.0 - bestätigt, dass Hybrid MP4/MOV in OBS 32 zum Standard-Container wurde
- Hybrid-MP4- und Hybrid-MOV-Formate | OBS Knowledge Base - Formatdetails und Mechanik der Absturzwiederherstellung
- Leitfaden zur Aufnahme mit mehreren Audiospuren | OBS Knowledge Base - Spurenzuordnung und Verhalten von Spur 1
- Erweiterter Aufnahmeleitfaden und Mehrspur-Audio | OBS Knowledge Base - verifiziert Spur 1 als kombinierten Mix aller Quellen
- Leitfaden zur Standardaufnahme-Ausgabe | OBS Knowledge Base - MKV-Empfehlung für Mehrspur-Aufnahmen
- PGS-Untertitel verstehen | suptosrt.com - PGS als bitmapbasiertes Untertitelformat
- Untertitel und Captions aus Videodateien mit FFmpeg extrahieren | Mux - Workflow zur Extraktion von Textuntertiteln
- ConvertAudioToText Preise - verifizierter kostenloser Tarif (10 einmalige Minuten auf einem Konto, 10 Min. Vorschau ohne Registrierung) und Pro-Plan (9,99 $/Monat)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.