
Transkription von Zahlen korrigieren: Ein systematischer Leitfaden (2026)
Summarize this article with:
Zahlenfehler bei der KI-Transkription folgen wenigen wiederkehrenden Mustern: verwechselbare gesprochene Formen („fifteen“ vs. „fifty“), inkonsistente Formate (Ziffern vs. Wörter) und falsche Einheitenzuordnung. Die Lösung ist mehrstufig: Aktivieren Sie zunächst Smart Formatting in Ihrem Tool, wenden Sie dann Suchen-und-Ersetzen für domänenspezifische Fehler an und prüfen Sie abschließend nur die Zahlen manuell, bei denen wirklich etwas auf dem Spiel steht. Eine LLM-Nachbearbeitung erledigt die restlichen Formatinkonsistenzen, die Smart Formatting übersieht.
Zahlenfehler in der Transkription sind behebbar – aber die Lösung hängt davon ab, welche der drei Ursachen bei Ihnen vorliegt. Das Modell hat die falsche Zahl gehört (ein Hörfehler). Das Modell hat richtig gehört, aber falsch wiedergegeben (ein Formatierungsfehler). Oder die Formatierung ist im gesamten Transkript inkonsistent (ein Stilfehler). Jeder dieser Fehler erfordert eine andere Lösung, und wer sie vermischt, verschwendet Zeit.
Dieser Leitfaden geht jede Ursache und ihre Lösung durch – in der Reihenfolge, in der Sie es versuchen sollten.
Warum Zahlen anders fehlschlagen als andere Wörter
Zahlen sind die Kategorie, in der die KI-Transkription ihre teuersten Fehler macht. Diese Fehler sind spezifisch und wiederholen sich.
„Fifteen“ vs. „fifty“ ist der mit Abstand häufigste Hörfehler bei Zahlen. Dasselbe Muster zieht sich durch die Zahlenpaare aus Teens und Zehnern: thirteen/thirty, fourteen/forty, sixteen/sixty, seventeen/seventy. In schneller Sprache oder mit Akzent teilen diese Paare so viele akustische Merkmale, dass das Modell anhand des Kontexts und nicht allein nach dem Klang entscheidet. Begünstigt der umgebende Satz nicht klar eine der beiden Zahlen, rät das Modell – und rät manchmal falsch.
Zahlenfolgen erzeugen einen zweiten Fehlertyp. „Two five seven nine“, als Referenznummer gesprochen, wird zur Menge „2,579“. „One hundred fifty-two“ kann zu „152“ oder „one hundred, 52“ werden. Das Modell versucht, Ziffern zu einer sinnvollen Zahl zusammenzufassen, und weiß nicht immer, ob Sie ein Telefonnummernfragment, eine Menge oder einen Bezeichner meinen.
Die Einheitenzuordnung versagt auf eine dritte, ganz bestimmte Weise. „Five dollars fifty“ kann je nach Tool und aktiviertem Smart Formatting zu „$5.50“, „five-fifty“ oder „5 dollars, 50 cents“ werden. Die Zahl hat die richtigen Ziffern, aber das Format stimmt nicht – oder das Komma verrutscht.
Die Erkennung von Datums- und Dezimalwerten bildet den letzten großen Fehlerbereich. „May fifteen twenty twenty-six“ kann je nachdem, welches Format das Modell standardmäßig verwendet, zu „May 15, 2026“, „5/15/26“ oder „May 15th“ werden. „Point five“ kann zu „.5“, „0.5“ oder „five tenths“ werden.
Lösung 1: Smart Formatting aktivieren
Die meisten Darstellungsfehler bei Zahlen verschwinden, sobald Sie Smart Formatting aktivieren. Das ist die erste Lösung, die Sie ausprobieren sollten – und für viele Nutzer löst sie 80 Prozent des Problems.
Was jedes große Tool tatsächlich bietet, laut aktueller Herstellerdokumentation (Stand: Juli 2026):
| Tool | Parameter | Standard | Was abgedeckt wird |
|---|---|---|---|
| Deepgram | smart_format=true | Aus | Ziffern, Währungen, Datumswerte, Uhrzeiten, Telefonnummern, E-Mails (Englisch; ausgewählte weitere Sprachen) |
| AWS Transcribe | Automatisch (kein Parameter nötig) | Aktiv für unterstützte Sprachen | Zahlen, Währungen, Datumswerte, Uhrzeiten, Adressen |
| AssemblyAI | format_text=true | Aktiv | Textformatierung inklusive Zahlendarstellung |
| OpenAI Whisper API | Kein eigener Parameter | Gemischt | Kein integrierter Zahlenformatierer; Prompt oder Nachbearbeitung verwenden |
smart_format=true bei Deepgram ist die expliziteste Lösung: Übergibt man den Parameter in einer Batch- oder Streaming-Anfrage, werden gesprochene Zahlen im Englischen in ihre Ziffernform umgewandelt, einschließlich Währungssymbolen, AM/PM-Zeitangaben und Datumsangaben mit Ordnungszahlen. AWS Transcribe wendet dies automatisch für unterstützte Sprachen an, ohne dass eine Konfiguration nötig ist. format_text ist bei AssemblyAI standardmäßig aktiviert – wenn Sie bei AssemblyAI Rohausgaben erhalten, prüfen Sie, ob es nicht deaktiviert wurde.
OpenAI Whisper ist die Ausnahme. Einen smart_format-Parameter gibt es nicht. Die Ausgabe besteht je nach Kontext standardmäßig aus einer Mischung aus Ziffern und ausgeschriebenen Wörtern, und die Dokumentation empfiehlt, entweder den prompt-Parameter zur Stilsteuerung oder eine Nachbearbeitung für Konsistenz zu nutzen. Wenn Sie von Whisper eine konsistente Zahlendarstellung benötigen, müssen Sie das separat angehen.

Ein Detail, das man kennen sollte: Smart Formatting löst Darstellungsprobleme, keine Hörfehler. Hat das Modell „fifteen“ gehört, obwohl der Sprecher „fifty“ sagte, gibt smart_format=true die falsche Zahl sauber als „15“ wieder. Der Hörfehler bleibt.
Lösung 2: Suchen und Ersetzen für domänenspezifische Fehler
Wenn Sie regelmäßig Inhalte aus derselben Domäne transkribieren, wiederholen sich dieselben Zahlenfehler. Ein Finanz-Podcast, in dem der Moderator immer „fifty basis points“ sagt, erzeugt in jeder Folge denselben Fehler „15 basis points“. Erstellen Sie eine Ersetzungsliste.
Häufige Muster, für die sich eine Liste lohnt:
fifteen basis points → 50 basis points [verify against audio first]
thirteen percent → 13%
two zero two five → 2025
seventy-five thousand → 75,000
Die Einschränkung ist real: Suchen-und-Ersetzen kennt keinen Kontext. „Twenty“ ist die richtige Wiedergabe für „twenty people“, und „20“ ist im Finanzkontext oft richtig für „20 dollars“. Eine pauschale Ersetzung aller Vorkommen von „twenty“ durch „20“ zerstört auch die korrekten Stellen. Nutzen Sie diese Lösung nur für Fehler, die so stark an einen Domänenbegriff gebunden sind, dass falsch-positive Ersetzungen unwahrscheinlich sind.
Lösung 3: LLM-Nachbearbeitung für Formatkonsistenz
Bei Formatinkonsistenzen über ein langes Transkript hinweg (Datumswerte in drei verschiedenen Formaten, mal Zahlen als Wörter, mal als Ziffern ohne erkennbare Logik) schafft ein LLM-Nachbearbeitungsdurchlauf Abhilfe, ohne dass Sie das Audio prüfen müssen.
Ein Prompt, der funktioniert:
Read this transcript and fix number formatting for consistency.
Convert quantities to digits ($50, 25%, 1,500, 8:30 AM).
Write out numbers that start a sentence.
Fix obvious impossible numbers if context makes the correction clear.
Do not change any number you are uncertain about.
Transcript:
[paste here]
GPT-4o und Claude bewältigen solche Formatierungsaufgaben zuverlässig. Die wichtige Grenze: Das LLM sieht nur den Text. Enthält das Transkript einen Hörfehler, korrigiert das LLM die Formatierung um die falsche Zahl herum, behebt aber nicht den Hörfehler selbst. Nutzen Sie das für Stilfragen, nicht für die Faktenprüfung.
Lösung 4: Gezielte manuelle Überprüfung bei kritischen Inhalten
Bei Inhalten, bei denen eine falsche Zahl echte Konsequenzen hat, ist ein gezielter Hör- und Prüfdurchlauf die einzige verlässliche Lösung.
Der Workflow:
- Transkription mit aktiviertem Smart Formatting durchführen.
- Das Transkript nach allen Zahlen durchsuchen: nach Ziffern, Währungssymbolen, Prozentangaben und Datumswerten suchen.
- Für jede relevante Zahl zum entsprechenden Zeitpunkt im Audio springen und sie überprüfen.
- Falsche Angaben korrigieren.
Bei einer 30-minütigen Besprechung mit 10 bis 15 Zahlenangaben dauert das 5 bis 10 Minuten. Es ist der einzige Ansatz, der Hörfehler aufdeckt, die Smart Formatting nicht beheben kann.
Bei besonders kritischen Inhalten wie rechtlichen Verträgen, medizinischen Dosierungen oder veröffentlichten Finanzdaten lohnt es sich, wenn eine zweite Person denselben Durchlauf unabhängig vornimmt.
Zahlenkategorien und ihre typischen Fehlermuster
Verschiedene Kategorien scheitern auf unterschiedliche Weise. Wer weiß, mit welcher Kategorie er es zu tun hat, findet schneller die richtige Lösung.
Geld und Währungen
Häufige Fehler: falsche Größenordnung (15 statt 50), fehlendes Währungssymbol, Komma-Verrutscher („five fifty“ als 5,50 statt 550 gedeutet).
Lösung: zuerst Smart Formatting. Bei Finanzinhalten, deren Zahlen zitiert oder veröffentlicht werden, zusätzlich manuelle Überprüfung.
Prozentangaben
Häufige Fehler: falsche Größenordnung (3 % statt 30 %, was die Aussage eines Trends umkehrt). Ein Anstieg von 30 Prozent, der als 3 Prozent wiedergegeben wird, ist keine kleine Ungenauigkeit.
Lösung: Smart Formatting. Suchen Sie manuell nach jeder Prozentangabe, die eine Veränderung oder einen Satz beschreibt – hier ist das Risiko, dass sich die Bedeutung verschiebt, am größten.
Datumswerte
Häufige Fehler: falsches Jahr (2025 statt 2026), inkonsistentes Format innerhalb desselben Transkripts (May 15 in einem Absatz, 5/15 in einem anderen), Ordinal- versus Kardinalform („May fifteenth“ vs. „May 15“).
Lösung: Smart Formatting deckt die meisten Fälle ab. Datumswerte in rechtlichem oder vertraglichem Kontext immer manuell überprüfen.
Telefonnummern und ID-Nummern
Häufige Fehler: vertauschte Ziffern, fehlende Ziffern, falsche Gruppierung (555-12-34 statt 555-1234).
Lösung: manuelle Überprüfung ist Pflicht. Telefonnummern und Kennungen sind zu spezifisch, als dass man automatischen Korrekturen vertrauen könnte. Auch aus dem Kontext lassen sie sich nicht prüfen.
Mengen und Messwerte
Häufige Fehler: falsche Größenordnung („2 grams“ statt „20 grams“), die richtige Zahl mit der falschen Einheit („50 meters“, obwohl der Sprecher „50 millimeters“ sagte).
Lösung: Smart Formatting hilft bei der Darstellung. Bei technischen Inhalten (Medizin, Wissenschaft, Technik) behandeln Sie alle Messwerte wie kritische Finanzdaten: hören und überprüfen.
Verhältnisse und Bereiche
Häufige Fehler: vertauschte Endpunkte eines Bereichs, umgekehrte Richtung beim Verhältnis („two to one“ vs. „one to two“).
Lösung: Jedes Verhältnis und jeden Bereich gegen das Audio prüfen. Diese Angaben sind semantisch umkehrbar, und der Kontext liefert nicht immer eine eindeutige Unterscheidung.
Uhrzeiten
Häufige Fehler: 12-Stunden- gegenüber 24-Stunden-Format, fehlende AM/PM-Kennzeichnung, wegfallendes „o'clock“.
Lösung: Smart Formatting deckt das meiste ab. Bei Besprechungstranskripten, in denen exakte Zeiten zu Tagesordnungspunkten gehören, die relevanten überprüfen.
Ein Workflow für zahllastige Inhalte
Für alle, die regelmäßig Finanzberichte, technische Vorlesungen, Earnings Calls oder klinische Aufnahmen transkribieren:
- Nutzen Sie ein Tool, bei dem Smart Formatting standardmäßig aktiviert ist oder sich über einen expliziten Parameter einschalten lässt.
- Führen Sie nach der Transkription einen reinen Zahlen-Durchlauf durch: Suchen Sie nach Ziffern und überprüfen Sie diejenigen, die Bedeutung tragen.
- Pflegen Sie eine domänenspezifische Ersetzungsliste für Fehler, die in Ihren Inhalten immer wieder auftreten.
- Verankern Sie bei veröffentlichten oder rechtlich relevanten Inhalten einen zweiten Prüfschritt durch eine weitere Person für jede Zahl, die zitiert wird.
So erfassen Sie, was reine Automatisierung übersieht, ohne jedes Wort erneut prüfen zu müssen.
Wann sich der Wechsel zu menschlicher Transkription lohnt
Manche Inhalte enthalten Zahlen, die einfach nicht falsch sein dürfen: Berichte an Aufsichtsbehörden, Daten aus klinischen Studien, eidesstattliche Aussagen, Immobilienverträge.
Hierfür ist der praktische Stack: KI-Transkription als erster Durchlauf, sorgfältige manuelle Prüfung aller Zahlen gegen das Audio und optional eine menschliche Transkription über einen spezialisierten Dienst für die kritischsten Passagen. Der Beitrag KI- vs. menschliche Transkription erklärt, wann sich dieser zusätzliche Aufwand wirtschaftlich lohnt.
Wenn Sie zusätzlich zu Zahlen mit umfassenderen Genauigkeitsproblemen kämpfen, behandelt der Beitrag zur Behebung schlechter Transkriptionsgenauigkeit das Gesamtbild. Zahlen sind ein spezielles Teilproblem; die allgemeinen Lösungen zur Genauigkeit sind davon getrennt.
Wenn Sie einfach nur ein sauberes Ersttranskript ohne Meeting-Bot oder Konto-Einrichtung brauchen, wendet ConvertAudioToText Smart Formatting standardmäßig an und arbeitet direkt mit einem Upload oder einer URL – praktisch für einmalige Prüfaufträge.
FAQ
Warum steht in meinem Transkript „fifteen“, obwohl der Sprecher „fifty“ gesagt hat?
Die beiden Wörter teilen akustische Merkmale, insbesondere in schneller oder akzentbehafteter Sprache: Die betonte Silbe setzt anders an, aber beide haben einen /f/-Anlaut und einen ähnlichen Vokal. KI-Modelle wählen anhand akustischer Wahrscheinlichkeit und des umgebenden Kontexts zwischen ihnen. Begünstigt der umgebende Kontext nicht klar eine der beiden Zahlen, rät das Modell mit einer gewissen Fehlerrate falsch. Als praktische Lösungen bleiben: Smart Formatting aktivieren und für jede wichtige Zahl einen gezielten Hör- und Prüfdurchlauf machen.
Behebt aktiviertes Smart Formatting alle Zahlenfehler?
Nein. Smart Formatting stellt Konsistenz bei der Darstellung her: Es wandelt „fifty thousand dollars“ zuverlässig in „$50,000“ um, sobald das Modell die richtigen Wörter gehört hat. Einen Hörfehler kann es nicht beheben. Hat das Modell „fifteen“ gehört, während der Sprecher „fifty“ sagte, gibt Smart Formatting die falsche Zahl ordentlich formatiert wieder. Bei kritischen Zahlen benötigen Sie weiterhin eine manuelle Kontrolle.
Wann sollte ich LLM-Nachbearbeitung statt manueller Korrektur für Zahlen einsetzen?
Nutzen Sie LLM-Nachbearbeitung für Probleme mit der Formatkonsistenz über ein langes Transkript hinweg: uneinheitliche Datumsformate, gemischte Darstellung als Ziffern und Wörter, offensichtlich unmögliche Zahlen, die der Kontext eindeutig macht. Nutzen Sie manuelle Korrektur, wenn die exakte Zahl wichtig ist und ein Fehler echte Konsequenzen hätte – etwa bei Finanzdaten, Dosierungen, rechtlichen Beträgen oder technischen Spezifikationen. LLMs arbeiten ausschließlich mit dem Transkripttext, nicht mit dem Audio, und können daher einen Hörfehler nicht auflösen.
Welche Transkriptionstools behandeln Zahlen ab Werk am besten?
Deepgram mit smart_format=true ist für Englisch am stärksten: Es verarbeitet Ziffern, Währungen, Datumswerte, Telefonnummern und Uhrzeiten mit einer einzigen Einstellung. AWS Transcribe wendet die Zahlennormalisierung automatisch für unterstützte Sprachen an, ohne zusätzlichen Parameter. AssemblyAI hat format_text=true standardmäßig aktiviert und gibt Zahlen gut wieder. OpenAI Whisper bietet keinen eigenen Parameter zur Zahlenformatierung; seine Ausgabe ist je nach Kontext eine Mischung aus Ziffern und Wörtern, und als Lösung für Konsistenz wird Nachbearbeitung empfohlen.
Quellen
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.