
Unterstützte Audioformate: Die Kompatibilitätstabelle
Summarize this article with:
Die Kompatibilitätstabelle
Jedes gängige Transkriptionstool akzeptiert MP3, WAV, M4A und MP4. Die Unterschiede zeigen sich bei den weniger verbreiteten Formaten, den Dateigrößenlimits und den Codec-Einschränkungen. Nutze die Tabelle unten, um dein Format vor dem Hochladen zu prüfen, und lies dann die Abschnitte darunter für den Kontext zu den Randfällen, die echte Fehler verursachen.
| Format | Typ | CATT | Otter.ai | TurboScribe | Descript | Rev.com | Trint | Fireflies | Happy Scribe | AWS Transcribe | OpenAI Whisper API |
|---|---|---|---|---|---|---|---|---|---|---|---|
| MP3 | Audio | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja |
| WAV | Audio | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja |
| M4A | Audio | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Nein* | Ja |
| FLAC | Audio | Ja | Nein | Ja | Ja | Ja | Nein | Nein | Ja | Ja | Nein |
| AAC | Audio | Ja | Nein | Ja | Ja | Ja | Ja | Nein | Ja | Nein | Nein |
| OGG | Audio | Ja | Ja | Ja | Nein | Nein | Nein | Nein | Ja | Ja | Nein |
| Opus | Audio | Ja | Nein | Ja | Nein | Nein | Nein | Nein | Ja | Ja (über OGG/WebM) | Nein |
| WMA | Audio | Ja | Ja | Ja | Nein | Nein | Ja | Nein | Ja | Nein | Nein |
| AIFF | Audio | Nein | Nein | Ja | Ja | Nein | Nein | Nein | Ja | Nein | Nein |
| MP4 | Video | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja | Ja |
| MOV | Video | Ja | Ja | Ja | Ja | Ja | Ja | Nein | Ja | Nein | Nein |
| AVI | Video | Ja | Ja | Ja | Nein | Nein | Ja | Nein | Ja | Nein | Nein |
| MKV | Video | Ja | Ja | Ja | Nein | Nein | Nein | Nein | Ja | Nein | Nein |
| WebM | Video | Ja | Nein | Ja | Nein | Nein | Nein | Ja | Ja | Ja | Ja |
*AWS Transcribe Batch unterstützt den MP4-Container (der AAC-Audio tragen kann), aber laut Dokumentation keine eigenständigen M4A-Dateien unter diesem Namen. Prüfe deinen konkreten Anwendungsfall.
Geprüft: Juli 2026. Quellen unten aufgeführt.
Dateigrößen- und Dauerlimits
Hier werden die meisten überrascht. Das unterstützte Format ist weniger wichtig als die Frage, ob Ihre Datei physisch in das Upload-Limit des Dienstes passt.
| Dienst | Dateigrößenlimit | Zeitlimit | Anmerkungen |
|---|---|---|---|
| ConvertAudioToText | 100 MB | Keine harte Obergrenze | Minutenkontingent gilt je nach Tarif |
| Otter.ai | 5 GB | Kein angegebenes Limit | 3 Importe kostenlos (lebenslang); 10/Monat bei Pro |
| TurboScribe | 5 GB | 10 Stunden | Bis zu 50 Dateien gleichzeitig bei Unlimited |
| Descript | 50 GB pro Projekt | 15 Stunden für automatische Transkription | 3+ Audiokanäle werden auf Stereo heruntergemischt |
| Rev.com | 2 GB (API-Upload), 5 TB (URL) | 17 Stunden | Juristische Transkription: 20 GB gesamt |
| Trint | 3 GB (empfohlen) | 3 Stunden (empfohlen) | Größere Dateien werden akzeptiert, sind aber fehleranfällig |
| Fireflies | 200 MB | 150 Minuten | Kostenloser Tarif auf 100 MB begrenzt |
| Happy Scribe | Kein angegebenes Limit | Kein angegebenes Limit | 31 Audio- und 16 Videoformate |
| AWS Transcribe | 2 GB | 4 Stunden | Dateien müssen für Batch-Jobs in S3 liegen |
| OpenAI Whisper API | 25 MB | Keine harte Obergrenze | Betrifft WAV am stärksten: Eine 25-MB-WAV-Datei entspricht etwa 25 Minuten Audio |
| Deepgram (API) | 2 GB | Keine harte Obergrenze | 100+ Formate; Audioextraktion aus Video |
| AssemblyAI (API) | 2,2 GB (Upload), 5 GB (URL) | 10 Stunden | Empfiehlt die Einreichung im nativen Format |
Das 25-MB-Limit der OpenAI Whisper API ist die häufigste Quelle für Verwirrung. Ein zweistündiges Interview als WAV-Datei ist in der Regel 1 GB oder größer. Das Limit bezieht sich auf die Dateigröße, nicht auf die Dauer, daher scheitert auch eine zweistündige MP3 mit 96 kbps (etwa 86 MB). Der Ausweg ist, auf eine niedrigere Bitrate zu komprimieren oder einen Dienst zu nutzen, der auf Ihre Dateigröße ausgelegt ist.

Audioformate: Was jedes einzelne tatsächlich bedeutet
MP3
MP3 ist der sichere Standard. Es wird überall akzeptiert, ist klein, und ab 128 kbps gibt es keinen messbaren Genauigkeitsverlust gegenüber WAV. Unter 64 kbps beginnen Kompressionsartefakte die Sprachverständlichkeit zu beeinträchtigen. Alte Voicemail-Aufnahmen mit 32 kbps sind der häufigste Übeltäter.
Praktische Dateigrößen: etwa 1 MB pro Minute bei 128 kbps. Eine 2-stündige Aufnahme hat rund 115 MB, was das Whisper-API-Limit überschreitet, aber überall sonst passt.
WAV
WAV ist verlustfrei, was für die Archivierung zählt, nicht für die Transkriptionsgenauigkeit. Eine WAV- und eine 128-kbps-MP3-Datei derselben Sprachaufnahme liefern bei jedem modernen KI-Modell praktisch identische Transkriptionsergebnisse. Der relevante Unterschied ist die Dateigröße: WAV benötigt bei CD-Qualität (44,1 kHz, 16-Bit-Stereo) etwa 10 MB pro Minute.
Wenn du an Dateigrößenlimits stößt, konvertiere vor dem Hochladen in MP3. Du verlierst dabei keine Genauigkeit.
M4A
iPhone-Sprachnotizen exportieren als M4A. Es nutzt AAC-Kompression in einem MP4-Container, was effizienter ist als MP3. Die Dateien sind etwas kleiner als vergleichbare MP3s in gleicher Qualität, und alle gängigen Transkriptionstools für Verbraucher unterstützen es.
AWS Transcribe listet M4A in seiner Batch-Dokumentation nicht als benanntes unterstütztes Format; wenn du die AWS-API direkt nutzt, konvertiere zuerst in MP3 oder WAV. Verbrauchertools (CATT, TurboScribe, Otter, Descript, Rev) verarbeiten es nativ.
FLAC
FLAC ist verlustfreie Kompression. Die Dateigrößen sind 50 bis 70 Prozent kleiner als bei WAV, während jedes Bit des Originalaudios erhalten bleibt. Für Transkriptionszwecke bietet es keinen Genauigkeitsvorteil gegenüber einem gut kodierten MP3, ist aber nützlich, wenn du das Original archivieren und eine einzelne Datei hochladen musst.
Nicht alle Dienste unterstützen es: Otter.ai, Fireflies und Trint akzeptieren kein FLAC. Prüfe das vor dem Hochladen.
OGG / Opus
OGG Vorbis und Opus sind Open-Source-Formate, die häufig in Android-Aufnahmen und Web-Apps vorkommen. Opus wird insbesondere in WebRTC verwendet (Browser-Aufnahmen, Sprachanrufe, Discord-Exporte). Die Unterstützung auf Verbraucherebene ist lückenhaft: Descript, Rev und Fireflies unterstützen OGG nicht direkt. AWS Transcribe und Deepgram verarbeiten beide über ihre jeweiligen Container.
Wenn Ihre Quelle eine Android-Aufnahme im OGG-Format ist, konvertieren Sie sie für maximale Kompatibilität zuerst in MP3.
WMA
Windows Media Audio verschwindet zunehmend aus der Produktion, taucht aber weiterhin in älteren Windows-Sprachrekorder-Exporten und Legacy-Callcenter-Aufnahmen auf. TurboScribe, Otter.ai und Trint akzeptieren das Format; Descript, Fireflies und Rev nicht.
AIFF
AIFF ist Apples unkomprimiertes Format, das typischerweise von GarageBand und Pro Tools erzeugt wird. Die Dateigrößen ähneln denen von WAV. Nur TurboScribe und Descript akzeptieren AIFF unter den Diensten in dieser Tabelle; wenn Ihre DAW AIFF exportiert, prüfen Sie vor dem Hochladen, ob Ihr Zielservice das Format unterstützt.
Videoformate und Audioextraktion
Alle Dienste in dieser Tabelle extrahieren die Tonspur aus Videos automatisch. Sie müssen eine Videodatei vor dem Hochladen nicht vorverarbeiten.
MP4 funktioniert überall. MOV funktioniert bei den meisten Verbraucherdiensten, aber nicht bei AWS Transcribe oder Fireflies. MKV hat begrenzte Unterstützung (CATT, Otter, TurboScribe, Happy Scribe). Wenn Ihre Quelle MKV oder AVI ist und Sie einen Dienst verwenden, der das Format nicht unterstützt, extrahieren Sie das Audio mit FFmpeg in MP3: ffmpeg -i input.mkv -vn -ab 192k output.mp3.
Weitere Details zur Untertitelausgabe aus Videodateien finden Sie unter SRT vs. VTT vs. TTML: Welches Untertitelformat Sie verwenden sollten.
Wann das Format die Genauigkeit beeinflusst (und wann nicht)
In fast allen realen Fällen hat das Format keinen Einfluss auf die Genauigkeit. Moderne KI-Transkriptionsmodelle verarbeiten Audio-Wellenformen nach der Dekodierung, daher machen Containerformat und Kompressionscodec bei normalen Qualitätseinstellungen keinen nennenswerten Unterschied.
Die drei Fälle, in denen das Format wirklich zählt:
Sehr niedrige MP3-Bitrate (unter 64 kbps). Kompressionsartefakte bei Audio unter 64 kbps können die Sprachverständlichkeit sowohl für menschliche Zuhörer als auch für KI-Modelle beeinträchtigen. Das tritt vor allem bei sehr alten Podcast-Archiven, komprimierten Voicemail-Exporten und extrem stark verkleinerten Streaming-Audiodateien auf.
Mehrfach-Re-Encoding über Generationen hinweg. Die Umwandlung von WAV zu MP3 zu OGG und zurück zu MP3 stapelt verlustbehaftete Kompression und verliert bei jedem Schritt an Qualität. Arbeiten Sie wann immer möglich mit der ursprünglichen Quelldatei.
Beschädigte oder abgeschnittene Dateien. Eine teilweise heruntergeladene Datei oder eine unterbrochene Aufnahme kann die Formatprüfung bestehen, aber mitten in der Transkription scheitern. Laden Sie die Quelle erneut herunter oder exportieren Sie sie neu.
Für einen tieferen Einblick, wie sich Abtastraten und Kanalzahlen auf die Genauigkeit auf API-Ebene auswirken, lesen Sie den Beitrag Transkriptionsgenauigkeit erklärt.
Codec-Eigenheiten, die man kennen sollte
Ein paar Besonderheiten, die stille Fehlschläge verursachen:
AWS Transcribe OGG erfordert den Opus-Codec. Der Dienst akzeptiert OGG- und WebM-Container, aber nur mit Opus-Audio darin. Eine OGG-Vorbis-Datei schlägt fehl. Das ist in den Eingabeanforderungen dokumentiert.
Google Cloud STT verlangt eine Encoding-Angabe. Anders als Deepgram verlangt die Google-API, dass Sie die Audio-Kodierung in Ihrer Anfrage angeben. Das Senden einer MP3 ohne Angabe von MP3 im Encoding-Feld führt zu einem Fehler. Die V2-API kann einige Formate automatisch erkennen, V1 jedoch nicht.
Mehrkanal-Audio (mehr als 2 Kanäle). AWS Transcribe unterstützt kein Audio mit mehr als zwei Kanälen. Descript mischt Dateien mit 3 oder mehr Kanälen beim Import automatisch auf Stereo herunter. Wenn Sie in Mehrkanal aufnehmen (4-Kanal-Konferenzrekorder, Ambisonic-Mikrofon), mischen Sie vor dem Hochladen auf einen beliebigen API-basierten Dienst auf Stereo herunter.
PCM-Kodierung in WAV. Die meisten WAV-Dateien verwenden PCM-Kodierung und funktionieren überall. WAV-Dateien mit ungewöhnlichen Kodierungen (GSM, ADPCM) können bei manchen Diensten fehlschlagen, auch wenn der Container erkannt wird. Mit FFmpegs ffprobe können Sie herausfinden, welche Kodierung in Ihrer WAV-Datei steckt.
Für einen umfassenderen Überblick über die Formatwahl entlang der gesamten Pipeline von der Aufnahme bis zum Archiv, siehe Transkriptionsdateiformate erklärt und WAV vs. MP3 für Transkription.
Konvertierung in ein unterstütztes Format
Wenn Sie eine Datei in einem nicht unterstützten Format haben oder die Dateigröße vor dem Hochladen reduzieren müssen, akzeptiert das Audio-zu-Text-Tool die Datei direkt und übernimmt die Konvertierung intern. Für programmatische Workflows deckt der folgende Einzeiler die meisten Fälle ab:
ffmpeg -i input.anyformat -vn -ar 16000 -ac 1 -ab 64k output.mp3
Dies extrahiert den Audioanteil, setzt eine Abtastrate von 16 kHz (ausreichend für Sprache), konvertiert auf Mono und kodiert mit 64 kbps. Dadurch wird eine einstündige WAV-Datei von etwa 600 MB auf rund 30 MB reduziert, ohne dass die Transkriptionsgenauigkeit leidet.
Wenn Sie das Original behalten möchten und nur eine kleinere Kopie für den Upload benötigen, funktioniert derselbe Befehl: -ab 128k bietet mehr Spielraum und bleibt trotzdem weit unter jedem Service-Limit.
Wenn Sie nur ein sauberes Transkript ohne Meeting-Bot oder Videoeditor benötigen, akzeptiert ConvertAudioToText alle Formate aus dieser Tabelle (außer AIFF) und verarbeitet die meisten Dateien in unter einer Minute.
Häufige Fragen
Welches Audioformat ist am besten für die Transkriptionsgenauigkeit geeignet?
Jedes verlustfreie Format (WAV, FLAC) oder hochwertige verlustbehaftete Format (MP3 mit 128 kbps oder höher, M4A in Standardqualität) liefert bei jedem modernen KI-Modell dieselbe Transkriptionsgenauigkeit. Die Aufnahmeumgebung und die Mikrofonqualität sind weitaus wichtiger als das Audioformat. Speichern Sie WAV oder FLAC für die Archivierung; laden Sie MP3 hoch, um die Dateigrößen überschaubar zu halten.
Warum lehnt die OpenAI Whisper API meine Datei ab, während andere Dienste sie akzeptieren?
Die Whisper API erzwingt ein Dateigrößenlimit von 25 MB, was deutlich niedriger ist als bei anderen Diensten. Eine 1-stündige MP3-Datei mit 128 kbps hat etwa 57 MB und wird daher abgelehnt. Die Lösung ist, auf eine niedrigere Bitrate zu komprimieren (64 kbps reichen für Sprache aus), die Datei in Stücke zu teilen oder einen Dienst ohne 25-MB-Limit zu nutzen.
Kann ich eine Videodatei direkt hochladen, oder muss ich zuerst den Ton extrahieren?
Sie können Videos direkt bei allen Diensten in dieser Tabelle hochladen. Sie extrahieren die Tonspur automatisch. MP4 funktioniert überall; MOV und MKV haben bei API-basierten Diensten wie AWS Transcribe nur lückenhafte Unterstützung. Wenn Sie eine API direkt verwenden und Ihr Videoformat nicht in der unterstützten Liste steht, extrahieren Sie den Ton zuerst mit FFmpeg.
Funktionieren Aufnahmen mit mehreren Kanälen (Surround Sound)?
Die meisten Transkriptionstools mischen automatisch auf Stereo herunter oder unterstützen explizit nicht mehr als zwei Kanäle. AWS Transcribe dokumentiert ein hartes Limit von zwei Kanälen. Descript mischt beim Import herunter. Für zuverlässige Ergebnisse konvertieren Sie jede Mehrkanalaufnahme vor dem Hochladen in Mono oder Stereo.
Quellen
- Deepgram unterstützte Audioformate: developers.deepgram.com/docs/supported-audio-formats (geprüft im Juli 2026)
- Amazon Transcribe Eingabeanforderungen: docs.aws.amazon.com/transcribe/latest/dg/how-input.html (geprüft im Juli 2026)
- OpenAI Whisper API Dokumentation: help.openai.com/en/articles/7031512-audio-api-faq (geprüft im Juli 2026)
- Google Cloud Speech-to-Text Kodierungen: docs.cloud.google.com/speech-to-text/docs/encoding (geprüft im Juli 2026)
- Otter.ai Import-Hilfe: help.otter.ai (geprüft im Juli 2026)
- TurboScribe Support: turboscribe.ai/support (geprüft im Juli 2026)
- Descript unterstützte Dateitypen: help.descript.com (geprüft im Juli 2026)
- Rev.com akzeptierte Dateiformate: support.rev.com (geprüft im Juli 2026)
- Trint unterstützte Dateispezifikationen: info.trint.com/knowledge/supported-file-specifications (geprüft im Juli 2026)
- Fireflies Upload-Anleitung: guide.fireflies.ai (geprüft im Juli 2026)
- Happy Scribe Formate: happyscribe.com/formats (geprüft im Juli 2026)
- AssemblyAI Dateilimits: assemblyai.com/docs/faq (geprüft im Juli 2026)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.