Unterstützte Audioformate: Die Kompatibilitätstabelle
TranskriptionAudioformateTechnisch

Unterstützte Audioformate: Die Kompatibilitätstabelle

BMMamane B. MoussaApril 14, 2026Updated July 2, 202612 min read

Summarize this article with:

Die Kompatibilitätstabelle

Jedes gängige Transkriptionstool akzeptiert MP3, WAV, M4A und MP4. Die Unterschiede zeigen sich bei den weniger verbreiteten Formaten, den Dateigrößenlimits und den Codec-Einschränkungen. Nutze die Tabelle unten, um dein Format vor dem Hochladen zu prüfen, und lies dann die Abschnitte darunter für den Kontext zu den Randfällen, die echte Fehler verursachen.

FormatTypCATTOtter.aiTurboScribeDescriptRev.comTrintFirefliesHappy ScribeAWS TranscribeOpenAI Whisper API
MP3AudioJaJaJaJaJaJaJaJaJaJa
WAVAudioJaJaJaJaJaJaJaJaJaJa
M4AAudioJaJaJaJaJaJaJaJaNein*Ja
FLACAudioJaNeinJaJaJaNeinNeinJaJaNein
AACAudioJaNeinJaJaJaJaNeinJaNeinNein
OGGAudioJaJaJaNeinNeinNeinNeinJaJaNein
OpusAudioJaNeinJaNeinNeinNeinNeinJaJa (über OGG/WebM)Nein
WMAAudioJaJaJaNeinNeinJaNeinJaNeinNein
AIFFAudioNeinNeinJaJaNeinNeinNeinJaNeinNein
MP4VideoJaJaJaJaJaJaJaJaJaJa
MOVVideoJaJaJaJaJaJaNeinJaNeinNein
AVIVideoJaJaJaNeinNeinJaNeinJaNeinNein
MKVVideoJaJaJaNeinNeinNeinNeinJaNeinNein
WebMVideoJaNeinJaNeinNeinNeinJaJaJaJa

*AWS Transcribe Batch unterstützt den MP4-Container (der AAC-Audio tragen kann), aber laut Dokumentation keine eigenständigen M4A-Dateien unter diesem Namen. Prüfe deinen konkreten Anwendungsfall.

Geprüft: Juli 2026. Quellen unten aufgeführt.

Dateigrößen- und Dauerlimits

Hier werden die meisten überrascht. Das unterstützte Format ist weniger wichtig als die Frage, ob Ihre Datei physisch in das Upload-Limit des Dienstes passt.

DienstDateigrößenlimitZeitlimitAnmerkungen
ConvertAudioToText100 MBKeine harte ObergrenzeMinutenkontingent gilt je nach Tarif
Otter.ai5 GBKein angegebenes Limit3 Importe kostenlos (lebenslang); 10/Monat bei Pro
TurboScribe5 GB10 StundenBis zu 50 Dateien gleichzeitig bei Unlimited
Descript50 GB pro Projekt15 Stunden für automatische Transkription3+ Audiokanäle werden auf Stereo heruntergemischt
Rev.com2 GB (API-Upload), 5 TB (URL)17 StundenJuristische Transkription: 20 GB gesamt
Trint3 GB (empfohlen)3 Stunden (empfohlen)Größere Dateien werden akzeptiert, sind aber fehleranfällig
Fireflies200 MB150 MinutenKostenloser Tarif auf 100 MB begrenzt
Happy ScribeKein angegebenes LimitKein angegebenes Limit31 Audio- und 16 Videoformate
AWS Transcribe2 GB4 StundenDateien müssen für Batch-Jobs in S3 liegen
OpenAI Whisper API25 MBKeine harte ObergrenzeBetrifft WAV am stärksten: Eine 25-MB-WAV-Datei entspricht etwa 25 Minuten Audio
Deepgram (API)2 GBKeine harte Obergrenze100+ Formate; Audioextraktion aus Video
AssemblyAI (API)2,2 GB (Upload), 5 GB (URL)10 StundenEmpfiehlt die Einreichung im nativen Format

Das 25-MB-Limit der OpenAI Whisper API ist die häufigste Quelle für Verwirrung. Ein zweistündiges Interview als WAV-Datei ist in der Regel 1 GB oder größer. Das Limit bezieht sich auf die Dateigröße, nicht auf die Dauer, daher scheitert auch eine zweistündige MP3 mit 96 kbps (etwa 86 MB). Der Ausweg ist, auf eine niedrigere Bitrate zu komprimieren oder einen Dienst zu nutzen, der auf Ihre Dateigröße ausgelegt ist.

Audio-Upload-Tool bei ConvertAudioToText
Audio-Upload-Tool bei ConvertAudioToText
Der Uploader von ConvertAudioToText akzeptiert MP3, WAV, M4A, FLAC, AAC, OGG, Opus, WMA sowie alle gängigen Video-Container. Das 100-MB-Limit pro Datei gilt für Uploads; Aufträge per URL (YouTube, Vimeo, direkte Links) unterliegen dieser Grenze nicht.

Audioformate: Was jedes einzelne tatsächlich bedeutet

MP3

MP3 ist der sichere Standard. Es wird überall akzeptiert, ist klein, und ab 128 kbps gibt es keinen messbaren Genauigkeitsverlust gegenüber WAV. Unter 64 kbps beginnen Kompressionsartefakte die Sprachverständlichkeit zu beeinträchtigen. Alte Voicemail-Aufnahmen mit 32 kbps sind der häufigste Übeltäter.

Praktische Dateigrößen: etwa 1 MB pro Minute bei 128 kbps. Eine 2-stündige Aufnahme hat rund 115 MB, was das Whisper-API-Limit überschreitet, aber überall sonst passt.

WAV

WAV ist verlustfrei, was für die Archivierung zählt, nicht für die Transkriptionsgenauigkeit. Eine WAV- und eine 128-kbps-MP3-Datei derselben Sprachaufnahme liefern bei jedem modernen KI-Modell praktisch identische Transkriptionsergebnisse. Der relevante Unterschied ist die Dateigröße: WAV benötigt bei CD-Qualität (44,1 kHz, 16-Bit-Stereo) etwa 10 MB pro Minute.

Wenn du an Dateigrößenlimits stößt, konvertiere vor dem Hochladen in MP3. Du verlierst dabei keine Genauigkeit.

M4A

iPhone-Sprachnotizen exportieren als M4A. Es nutzt AAC-Kompression in einem MP4-Container, was effizienter ist als MP3. Die Dateien sind etwas kleiner als vergleichbare MP3s in gleicher Qualität, und alle gängigen Transkriptionstools für Verbraucher unterstützen es.

AWS Transcribe listet M4A in seiner Batch-Dokumentation nicht als benanntes unterstütztes Format; wenn du die AWS-API direkt nutzt, konvertiere zuerst in MP3 oder WAV. Verbrauchertools (CATT, TurboScribe, Otter, Descript, Rev) verarbeiten es nativ.

FLAC

FLAC ist verlustfreie Kompression. Die Dateigrößen sind 50 bis 70 Prozent kleiner als bei WAV, während jedes Bit des Originalaudios erhalten bleibt. Für Transkriptionszwecke bietet es keinen Genauigkeitsvorteil gegenüber einem gut kodierten MP3, ist aber nützlich, wenn du das Original archivieren und eine einzelne Datei hochladen musst.

Nicht alle Dienste unterstützen es: Otter.ai, Fireflies und Trint akzeptieren kein FLAC. Prüfe das vor dem Hochladen.

OGG / Opus

OGG Vorbis und Opus sind Open-Source-Formate, die häufig in Android-Aufnahmen und Web-Apps vorkommen. Opus wird insbesondere in WebRTC verwendet (Browser-Aufnahmen, Sprachanrufe, Discord-Exporte). Die Unterstützung auf Verbraucherebene ist lückenhaft: Descript, Rev und Fireflies unterstützen OGG nicht direkt. AWS Transcribe und Deepgram verarbeiten beide über ihre jeweiligen Container.

Wenn Ihre Quelle eine Android-Aufnahme im OGG-Format ist, konvertieren Sie sie für maximale Kompatibilität zuerst in MP3.

WMA

Windows Media Audio verschwindet zunehmend aus der Produktion, taucht aber weiterhin in älteren Windows-Sprachrekorder-Exporten und Legacy-Callcenter-Aufnahmen auf. TurboScribe, Otter.ai und Trint akzeptieren das Format; Descript, Fireflies und Rev nicht.

AIFF

AIFF ist Apples unkomprimiertes Format, das typischerweise von GarageBand und Pro Tools erzeugt wird. Die Dateigrößen ähneln denen von WAV. Nur TurboScribe und Descript akzeptieren AIFF unter den Diensten in dieser Tabelle; wenn Ihre DAW AIFF exportiert, prüfen Sie vor dem Hochladen, ob Ihr Zielservice das Format unterstützt.

Videoformate und Audioextraktion

Alle Dienste in dieser Tabelle extrahieren die Tonspur aus Videos automatisch. Sie müssen eine Videodatei vor dem Hochladen nicht vorverarbeiten.

MP4 funktioniert überall. MOV funktioniert bei den meisten Verbraucherdiensten, aber nicht bei AWS Transcribe oder Fireflies. MKV hat begrenzte Unterstützung (CATT, Otter, TurboScribe, Happy Scribe). Wenn Ihre Quelle MKV oder AVI ist und Sie einen Dienst verwenden, der das Format nicht unterstützt, extrahieren Sie das Audio mit FFmpeg in MP3: ffmpeg -i input.mkv -vn -ab 192k output.mp3.

Weitere Details zur Untertitelausgabe aus Videodateien finden Sie unter SRT vs. VTT vs. TTML: Welches Untertitelformat Sie verwenden sollten.

Wann das Format die Genauigkeit beeinflusst (und wann nicht)

In fast allen realen Fällen hat das Format keinen Einfluss auf die Genauigkeit. Moderne KI-Transkriptionsmodelle verarbeiten Audio-Wellenformen nach der Dekodierung, daher machen Containerformat und Kompressionscodec bei normalen Qualitätseinstellungen keinen nennenswerten Unterschied.

Die drei Fälle, in denen das Format wirklich zählt:

Sehr niedrige MP3-Bitrate (unter 64 kbps). Kompressionsartefakte bei Audio unter 64 kbps können die Sprachverständlichkeit sowohl für menschliche Zuhörer als auch für KI-Modelle beeinträchtigen. Das tritt vor allem bei sehr alten Podcast-Archiven, komprimierten Voicemail-Exporten und extrem stark verkleinerten Streaming-Audiodateien auf.

Mehrfach-Re-Encoding über Generationen hinweg. Die Umwandlung von WAV zu MP3 zu OGG und zurück zu MP3 stapelt verlustbehaftete Kompression und verliert bei jedem Schritt an Qualität. Arbeiten Sie wann immer möglich mit der ursprünglichen Quelldatei.

Beschädigte oder abgeschnittene Dateien. Eine teilweise heruntergeladene Datei oder eine unterbrochene Aufnahme kann die Formatprüfung bestehen, aber mitten in der Transkription scheitern. Laden Sie die Quelle erneut herunter oder exportieren Sie sie neu.

Für einen tieferen Einblick, wie sich Abtastraten und Kanalzahlen auf die Genauigkeit auf API-Ebene auswirken, lesen Sie den Beitrag Transkriptionsgenauigkeit erklärt.

Codec-Eigenheiten, die man kennen sollte

Ein paar Besonderheiten, die stille Fehlschläge verursachen:

AWS Transcribe OGG erfordert den Opus-Codec. Der Dienst akzeptiert OGG- und WebM-Container, aber nur mit Opus-Audio darin. Eine OGG-Vorbis-Datei schlägt fehl. Das ist in den Eingabeanforderungen dokumentiert.

Google Cloud STT verlangt eine Encoding-Angabe. Anders als Deepgram verlangt die Google-API, dass Sie die Audio-Kodierung in Ihrer Anfrage angeben. Das Senden einer MP3 ohne Angabe von MP3 im Encoding-Feld führt zu einem Fehler. Die V2-API kann einige Formate automatisch erkennen, V1 jedoch nicht.

Mehrkanal-Audio (mehr als 2 Kanäle). AWS Transcribe unterstützt kein Audio mit mehr als zwei Kanälen. Descript mischt Dateien mit 3 oder mehr Kanälen beim Import automatisch auf Stereo herunter. Wenn Sie in Mehrkanal aufnehmen (4-Kanal-Konferenzrekorder, Ambisonic-Mikrofon), mischen Sie vor dem Hochladen auf einen beliebigen API-basierten Dienst auf Stereo herunter.

PCM-Kodierung in WAV. Die meisten WAV-Dateien verwenden PCM-Kodierung und funktionieren überall. WAV-Dateien mit ungewöhnlichen Kodierungen (GSM, ADPCM) können bei manchen Diensten fehlschlagen, auch wenn der Container erkannt wird. Mit FFmpegs ffprobe können Sie herausfinden, welche Kodierung in Ihrer WAV-Datei steckt.

Für einen umfassenderen Überblick über die Formatwahl entlang der gesamten Pipeline von der Aufnahme bis zum Archiv, siehe Transkriptionsdateiformate erklärt und WAV vs. MP3 für Transkription.

Konvertierung in ein unterstütztes Format

Wenn Sie eine Datei in einem nicht unterstützten Format haben oder die Dateigröße vor dem Hochladen reduzieren müssen, akzeptiert das Audio-zu-Text-Tool die Datei direkt und übernimmt die Konvertierung intern. Für programmatische Workflows deckt der folgende Einzeiler die meisten Fälle ab:

ffmpeg -i input.anyformat -vn -ar 16000 -ac 1 -ab 64k output.mp3

Dies extrahiert den Audioanteil, setzt eine Abtastrate von 16 kHz (ausreichend für Sprache), konvertiert auf Mono und kodiert mit 64 kbps. Dadurch wird eine einstündige WAV-Datei von etwa 600 MB auf rund 30 MB reduziert, ohne dass die Transkriptionsgenauigkeit leidet.

Wenn Sie das Original behalten möchten und nur eine kleinere Kopie für den Upload benötigen, funktioniert derselbe Befehl: -ab 128k bietet mehr Spielraum und bleibt trotzdem weit unter jedem Service-Limit.

Wenn Sie nur ein sauberes Transkript ohne Meeting-Bot oder Videoeditor benötigen, akzeptiert ConvertAudioToText alle Formate aus dieser Tabelle (außer AIFF) und verarbeitet die meisten Dateien in unter einer Minute.

Häufige Fragen

Welches Audioformat ist am besten für die Transkriptionsgenauigkeit geeignet?

Jedes verlustfreie Format (WAV, FLAC) oder hochwertige verlustbehaftete Format (MP3 mit 128 kbps oder höher, M4A in Standardqualität) liefert bei jedem modernen KI-Modell dieselbe Transkriptionsgenauigkeit. Die Aufnahmeumgebung und die Mikrofonqualität sind weitaus wichtiger als das Audioformat. Speichern Sie WAV oder FLAC für die Archivierung; laden Sie MP3 hoch, um die Dateigrößen überschaubar zu halten.

Warum lehnt die OpenAI Whisper API meine Datei ab, während andere Dienste sie akzeptieren?

Die Whisper API erzwingt ein Dateigrößenlimit von 25 MB, was deutlich niedriger ist als bei anderen Diensten. Eine 1-stündige MP3-Datei mit 128 kbps hat etwa 57 MB und wird daher abgelehnt. Die Lösung ist, auf eine niedrigere Bitrate zu komprimieren (64 kbps reichen für Sprache aus), die Datei in Stücke zu teilen oder einen Dienst ohne 25-MB-Limit zu nutzen.

Kann ich eine Videodatei direkt hochladen, oder muss ich zuerst den Ton extrahieren?

Sie können Videos direkt bei allen Diensten in dieser Tabelle hochladen. Sie extrahieren die Tonspur automatisch. MP4 funktioniert überall; MOV und MKV haben bei API-basierten Diensten wie AWS Transcribe nur lückenhafte Unterstützung. Wenn Sie eine API direkt verwenden und Ihr Videoformat nicht in der unterstützten Liste steht, extrahieren Sie den Ton zuerst mit FFmpeg.

Funktionieren Aufnahmen mit mehreren Kanälen (Surround Sound)?

Die meisten Transkriptionstools mischen automatisch auf Stereo herunter oder unterstützen explizit nicht mehr als zwei Kanäle. AWS Transcribe dokumentiert ein hartes Limit von zwei Kanälen. Descript mischt beim Import herunter. Für zuverlässige Ergebnisse konvertieren Sie jede Mehrkanalaufnahme vor dem Hochladen in Mono oder Stereo.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles