Jargonfehler in der Transkription beheben: Der Glossar-Durchgang
JargonTechnikTranskriptionKorrektur

Jargonfehler in der Transkription beheben: Der Glossar-Durchgang

BMMamane B. MoussaMay 26, 2026Updated July 2, 202611 min read

Summarize this article with:

Warum Fachjargon scheitert

Die kurze Antwort: Das Wort war nie in der Trainingsverteilung des Modells. KI-Transkriptionsmodelle lernen aus Millionen Stunden Audio, aber diese Daten sind stark auf Alltagskonversation verzerrt. „Kubernetes“ kommt in einem Bruchteil eines Prozents der Trainingsäußerungen vor. „Elektrokardiogramm“ noch seltener. Wenn das akustische Signal eintrifft, ersetzt das Modell phonetisch ähnliche Wörter, die es kennt. Aus „Kubernetes“ wird „cuban itties“. Aus „PostgreSQL“ wird „postgrass quill“. „gRPC“ wird als „g-rpc“ mit einem überflüssigen Bindestrich geschrieben.

Die Ersetzungen sind vorhersehbar, nicht zufällig. Das Modell tut genau das, wofür es trainiert wurde: die wahrscheinlichste Wortfolge angesichts der Laute auszuwählen. Das Problem ist, dass diese Wahrscheinlichkeit allgemeines Englisch widerspiegelt, nicht Ihre Domäne. Das ist die Lücke in der Trainingsverteilung, und sie erklärt, warum die Verstümmelung konsistent ist und nicht verstreut auftritt. Jedes Mal, wenn ein Sprecher in dieser Aufnahme „Kubernetes“ sagt, steht im Transkript „cuban itties“.

Die gute Nachricht: Die Lösung ist strukturell. Schließen Sie die Verteilungslücke einmal, und das Problem verschwindet für alle nachfolgenden Transkripte in dieser Domäne weitgehend.

Drei Lösungswege, sortiert nach Einrichtungsaufwand

Weg 1: Suchen und Ersetzen (schnell, pro Transkript)

Für ein einzelnes Transkript mit einer Handvoll verstümmelter Begriffe dauert Suchen und Ersetzen unter 10 Minuten und funktioniert mit jedem Tool. Erstellen Sie beim Lesen der Ausgabe eine Ersetzungsliste:

cuban itties     → Kubernetes
postgrass quill  → PostgreSQL
g-rpc            → gRPC
docker compose   → Docker Compose
postgres equal   → PostgreSQL

Führen Sie Suchen und Ersetzen für jedes Paar aus. Speichern Sie die Liste. Beim nächsten Transkript zum gleichen Thema wenden Sie die Liste an, bevor Sie mit dem Lesen beginnen. Den größten Nutzen holen Sie aus den ersten 20 Ersetzungen.

Die Grenze ist klar: Das ist reaktiv und transkriptspezifisch. Für eine einmalige Aufnahme ist es die richtige Wahl. Für ein Team, das 50 Transkripte pro Woche produziert, ist es die falsche Architektur.

Weg 2: Benutzerdefiniertes Vokabular und Keyterm-Prompting (dauerhafte Lösung)

Benutzerdefiniertes Vokabular sagt der Engine, welche Begriffe priorisiert werden sollen, bevor sie überhaupt ein Wort hört. Die meisten produktionsreifen APIs unterstützen dies inzwischen nativ, und die Einrichtung ist ein einmaliger Aufwand.

Die Implementierungen unterscheiden sich je nach Plattform:

PlattformName der FunktionAPI-ParameterLimit
Deepgram Nova-3Keyterm Promptingkeyterm=TERM (wiederholbar)500 Tokens pro Anfrage (~100 Begriffe)
AssemblyAI (Streaming)Keyterms Promptingkeyterms_prompt100 Begriffe, je 50 Zeichen
AWS TranscribeCustom VocabularyVokabulardatei in S3 (Tabellenformat)50 KB pro Datei, 100 Dateien pro Konto
Google Cloud STT (Chirp 3)Speech AdaptationSpeechAdaptation-Objekt mit PhrasenPhrasenliste pro Anfrage
Azure Custom SpeechCustom-Speech-TrainingUpload eines TrainingsdatensatzesVollständiges Modell-Feintuning, höherer Einrichtungsaufwand
OpenAI Whisper APIPrompt-Parameterprompt-Stringmaximal 224 Tokens

Ein paar verifizierte Details, die man kennen sollte:

Deepgram Nova-3 Keyterm Prompting (verifiziert im Juli 2026): Übergeben Sie keyterm=TERM als Query-Parameter und wiederholen Sie ihn für jeden Begriff. Laut Deepgram-Dokumentation sind Begriffe auf insgesamt 500 Tokens pro Anfrage begrenzt; die praktische Empfehlung liegt bei 20–50 hochwertigen Begriffen. Keyterm Prompting ist spezifisch für Nova-3-Modelle und Flux; das ältere Nova-2 verwendet einen separaten keywords-Parameter.

AssemblyAI Keyterms Prompting ist derzeit für Streaming-Transkription dokumentiert, mit bis zu 100 Begriffen zu je 50 Zeichen. Der Parameter heißt keyterms_prompt in der Streaming-Konfiguration. Für Batch-Transkription gilt weiterhin AssemblyAIs Legacy-Parameter word_boost mit den boost_param-Werten low, default oder high.

Prompt-Parameter der OpenAI Whisper API: Das Prompt-Feld akzeptiert bis zu 224 Tokens und funktioniert, indem das Modell die Schreibmuster aus Ihrem Input nachahmt. Laut OpenAI-Cookbook (geprüft im Juli 2026) funktionieren natürliche Satz-Prompts besser als bloße Listen. Schreiben Sie „Der Ingenieur besprach Kubernetes-Cluster und PostgreSQL-Replikation“ statt „Kubernetes, PostgreSQL“. Das Modell übernimmt Ihre Schreibweisen. Es kann keine Informationen hinzufügen, die nicht im Audio enthalten sind, aber es wird die von Ihnen vorgegebenen Schreibweisen deutlich bevorzugen.

AWS Transcribe Custom Vocabulary: verwendet ein vierspaltiges Tabellenformat (Phrase, IPA, SoundsLike, DisplayAs), das in S3 hochgeladen wird. Bis zu 100 Vokabulardateien pro Konto, 50 KB pro Datei, 256 Zeichen pro Eintrag. Die medizinische Variante (Amazon Transcribe Medical) unterstützt ein separates Vokabular für klinische Begriffe, nur auf US-Englisch.

Der Arbeitsablauf für eine dauerhafte Lösung auf einer dieser Plattformen:

  1. Erstellen Sie eine Liste mit 30–100 Begriffen, die in Ihrer Domäne wiederkehren.
  2. Laden Sie die Liste hoch oder übergeben Sie sie an die Vokabularfunktion Ihrer Engine.
  3. Von da an profitiert jede Transkription in dieser Domäne.
  4. Überprüfen und erweitern Sie die Liste vierteljährlich, wenn sich Ihr Vokabular weiterentwickelt.

Audio-Transkriptionstool für jargonlastige technische Aufnahmen
Audio-Transkriptionstool für jargonlastige technische Aufnahmen

Für API-basierte Workflows finden Sie im Vergleich der besten Speech-to-Text-APIs für 2026 eine Gegenüberstellung, welche Engines benutzerdefiniertes Vokabular mit dem geringsten Reibungsverlust verarbeiten.

Weg 3: Domänenspezifisches Modelltraining (hoher Aufwand, beste Obergrenze)

Für sehr umfangreiche, eindomänige Transkription übertrifft ein feinabgestimmtes Modell Vokabularhinweise bei den schwierigsten Begriffen. Das ist es, was Deepgram Nova-3 Medical darstellt: ein Modell, das auf klinischem Audio vortrainiert wurde, und kein Basismodell mit angehängter Vokabelliste. AWS Transcribe Medical verfolgt einen ähnlichen Ansatz. Azure Custom Speech ermöglicht das Training mit eigenen gelabelten Audiodaten.

Der Kosten-Nutzen-Wendepunkt ist grob: Unter etwa 50.000 Minuten domänenspezifischem Audio pro Monat ist benutzerdefiniertes Vokabular auf einem starken Basismodell praktischer als Modelltraining. Darüber hinaus beginnen die Genauigkeits- und Wartungskompromisse ein feinabgestimmtes Modell zu begünstigen.

Für die meisten Teams, die das hier lesen, ist Weg 2 die Antwort.

Eine gute Vokabelliste aufbauen

Eine gut aufgebaute Liste hat über alle Fachbereiche hinweg gemeinsame Merkmale, unabhängig vom Transkriptionstool.

Produkt- und Technologienamen

Jedes Produkt, auf das sich Ihre Gespräche beziehen, einschließlich Ihrer eigenen, der Ihrer Wettbewerber und der Ihrer Anbieter. „Kubernetes“ und „K8s“ benötigen möglicherweise getrennte Einträge, weil das Modell beide phonetisch unterschiedlich wahrnimmt. „PostgreSQL“ und „Postgres“ sind aus demselben Grund getrennte Einträge wert.

Akronyme genau so, wie sie geschrieben werden sollen

Technische Akronyme, die das Modell sonst ausschreiben oder verunstalten würde. Schreiben Sie sie exakt so, wie sie im Transkript erscheinen sollen: „gRPC“, nicht „g-r-p-c“, „SaaS“, nicht „sass“, „DDoS“, nicht „duh-dos“, „LLM“, nicht „elm“. Die DisplayAs-Spalte in AWS Transcribe und das String-Format in Deepgram Keyterms ermöglichen beide, die Ausgabeform präzise festzulegen.

Zusammengesetzte Begriffe und mehrteilige Phrasen

Phrasen, die das Modell möglicherweise falsch auseinanderreißt. „Testgetriebene Entwicklung“ als Keyterm übergeben erzeugt exakt diese Phrase statt drei unverbundener Wörter. „Myokardinfarkt“ als Einheit wird zuverlässiger transkribiert als jedes Wort einzeln.

Spezialisierter Fachjargon

Die Begriffe, die nur Fachleute in Ihrem Bereich regelmäßig verwenden. Für Sicherheit: bestimmte CVE-Muster, Exploit-Frameworks, Protokollnamen. Für Medizin: Arzneimittelnamen nach ihrer klinischen Bezeichnung (nicht nur Markennamen), Verfahrensnamen, anatomische Begriffe. Für Recht: lateinische Phrasen, bestimmte Doktrinen, prozessuale Antragsarten.

Namen, die wie alltägliche Wörter klingen

Manche Namen für Personen, Unternehmen oder Technologien kollidieren phonetisch mit allgemeinem Englisch. „Apache“ das Serverprojekt versus das Alltagswort. „Vue“ das JavaScript-Framework. „Rust“ die Programmiersprache. „Swift“ die Sprache. Das Modell braucht eine starke A-priori-Annahme, um sie nicht als ihre Wörterbuchbedeutungen zu interpretieren.

Referenzlisten für Fachbereiche

Das sind Ausgangspunkte, keine vollständigen Lösungen. Lesen Sie Ihr erstes Transkript und ergänzen Sie alles, was das Modell falsch gemacht hat.

Softwareentwicklung

Kubernetes, k8s, PostgreSQL, Postgres, gRPC, GraphQL, Docker,
TypeScript, async/await, monorepo, microservices, OAuth, JWT,
SQLite, MongoDB, Cassandra, Kafka, Redis, Elasticsearch,
LangChain, OpenAI, Anthropic, Claude, GPT-4o,
WebAssembly, WASM, RAG, vector database, embedding

Medizin

electrocardiogram, ECG, EKG, echocardiogram, defibrillator,
endotracheal intubation, laparoscopic, cholecystectomy,
metformin, lisinopril, atorvastatin, amoxicillin, ondansetron,
hypertension, hyperlipidemia, hypothyroidism, diabetes mellitus,
osteoarthritis, atrial fibrillation, myocardial infarction

Recht

voir dire, habeas corpus, prima facie, mens rea, res ipsa loquitur,
amicus curiae, certiorari, en banc, stare decisis, sub judice,
deposition, interrogatory, subpoena, discovery, motion in limine,
summary judgment, demurrer, appellate, statute of limitations

Finanzen

EBITDA, ARR, MRR, churn, LTV, CAC, IRR, NPV, IPO, SPAC,
revenue recognition, accrual basis, deferred revenue, GAAP, IFRS,
preferred stock, common stock, dilution, cap table, term sheet,
liquidation preference, anti-dilution, mezzanine

Für Eigennamen, die zu einer bestimmten Person gehören und nicht zu einem Fachbereich, behandelt der Beitrag Behebung falsch transkribierter Namen denselben Mechanismus mit Beispielen für Personennamen.

Die Tool-Wahl ist bei jargonlastiger Arbeit entscheidend

Nicht alle Transkriptionstools stellen normalen Nutzern Vokabularsteuerungen zur Verfügung. Die Tools, die sich für spezialisierte Domänen lohnen:

Deepgram Nova-3 per API: Keyterm Prompting ist gut dokumentiert und wirkt sofort pro Anfrage. Kein Upload-Schritt, keine Wartezeit.

AssemblyAI per API: word_boost für Batch, keyterms_prompt für Streaming. Beides sind Parameter auf Anfrageebene.

AWS Transcribe: Custom-Vocabulary-Dateien erfordern einen S3-Upload und einen Erstellungsschritt, bevor sie nutzbar sind, aber sie bleiben bestehen und können über mehrere Jobs hinweg wiederverwendet werden.

AWS Transcribe Medical: ein separates Produkt mit vorinstalliertem klinischem Vokabular und Unterstützung für US-Englisch. Die medizinische Custom-Vocabulary-Funktion ergänzt diese Basis.

Google Cloud STT (Chirp 3): Speech-Adaptation-Phrasen werden pro Anfrage übergeben, ähnlich wie bei Deepgram. Chirp 3 ist seit Mitte 2026 die aktuelle Generation.

OpenAI Whisper API per Prompt-Parameter: schwächer als dedizierte Custom-Vocab-Funktionen, aber ohne Einrichtung. Nützlich, wenn die Jargonliste kurz ist (unter 30 Begriffen) und der Prompt in 224 Tokens passt.

Tools, die unabhängig von Ihrer Vokabulararbeit Schwierigkeiten haben werden: browserbasierte Tools mit der Web Speech API und alle kostenlosen Dienste, die überhaupt keine Vokabularparameter freigeben.

Meine Einschätzung: Für ein Team mit stabilem Domänenvokabular ist Deepgram Nova-3 Keyterm Prompting der reibungsärmste Weg von jargonverstümmelt zu sauber. Das Vokabular wirkt sofort, erfordert keinen Upload-Schritt und kostet nichts extra über den Minutenpreis hinaus. Speziell für Medizin ist Nova-3 Medical so zweckgebaut, dass es klinische Terminologie oft ganz ohne eigene Begriffe korrekt verarbeitet.

Wenn Sie nur ein sauberes Transkript benötigen, ohne eine API-Integration zu verwalten, unterstützt das Audio-zu-Text-Tool von ConvertAudioToText Datei-Uploads für eine direkte Verarbeitung. Nutzen Sie die korrigierte Ausgabe, um Ihre Ersetzungsliste zu erstellen, und steigen Sie dann auf Vokabularsteuerungen auf API-Ebene um, sobald Ihre Begriffsliste stabil ist.

Wenn KI immer noch gegen einen Menschen verliert

Manche Fachbegriffe bleiben für KI-Transkription selbst mit Vokabularsteuerungen wirklich unerreichbar:

  • Arzneimittelnamen aus klinischen Studien, die nach dem Trainingsstichtag eines Modells liegen.
  • Enge Teilgebiete des Ingenieurwesens, deren Vokabular noch nie in einem öffentlichen Audiokorpus vorgekommen ist (zum Beispiel Halbleiterprozesschemie).
  • Archaische Rechtsterminologie, die in wenigen modernen Aufnahmen vorkommt.

In diesen Fällen ist ein menschlicher Transkribierer mit Domänenexpertise die ehrliche Antwort. Der Beitrag KI vs. menschliche Transkription behandelt, wann diese Eskalation finanziell sinnvoll ist. Für alles andere im Jahr 2026 liefert benutzerdefiniertes Vokabular auf einem starken Basismodell plus ein leichtes manuelles Korrekturlesen publikationsreife Ergebnisse.

Häufige Fragen

Warum transkribiert das Modell allgemeine Wörter korrekt, scheitert aber bei Fachbegriffen?

Die Wahrscheinlichkeitsschätzungen des Modells stammen aus seinen Trainingsdaten. Allgemeine englische Wörter kommen millionenfach vor; Fachbegriffe erscheinen selten oder gar nicht. Wenn das Modell „Kubernetes“ hört, passt das phonetische Signal in der Trainingsverteilung stärker zu „cuban itties“ als zum korrekten Begriff, also gewinnt die falsche Ausgabe. Vokabularsteuerungen setzen diese Priorität außer Kraft, indem sie die Zielbegriffe explizit verstärken.

Unterstützt die Whisper-API benutzerdefiniertes Vokabular?

Nicht mit einer eigenen Vokabularfunktion. Der Parameter prompt (maximal 224 Tokens) akzeptiert Beispieltext, und das Modell versucht, die Schreibweisen aus Ihrem Prompt zu übernehmen. Ein natürlicher Satz, der Ihre Fachbegriffe in der gewünschten Schreibweise enthält („Das Team migrierte den PostgreSQL-Cluster zu Kubernetes“), ist effektiver als eine bloße Liste von Begriffen. Bei ernsthaften Jargonproblemen sind Deepgram oder AssemblyAI mit richtigen Vokabular-APIs zuverlässiger.

Wie viele Begriffe sollte ich in meine Vokabelliste aufnehmen?

Beginnen Sie mit den 20–30 Begriffen, die in Ihrem ersten Transkript die meisten Fehler verursacht haben. Deepgram Nova-3 unterstützt bis zu 500 Tokens (ca. 100 Begriffe) pro Anfrage. AssemblyAI Streaming erlaubt bis zu 100 Begriffe mit je 50 Zeichen. AWS-Transcribe-Dateien können mehr enthalten, aber größere Vokabellisten verschlechtern manchmal die Genauigkeit bei Begriffen, die im Audio gar nicht vorkommen. Kleinere, fokussierte Listen sind daher oft besser als Sammelsurium-Listen.

Hilft benutzerdefiniertes Vokabular nur bei ganzen Wörtern oder auch bei Akronymen?

Bei beidem. Akronyme sind oft die wertvollsten Einträge, weil das Modell sie häufig ausschreibt („SaaS“ zu „sass“, „gRPC“ zu „g rpc“). Übergeben Sie das Akronym im exakten Ausgabeformat, das Sie möchten: gRPC, DDoS, LLM. Auf Plattformen wie AWS Transcribe, wo Sie ein DisplayAs-Feld angeben, haben Sie präzise Kontrolle über Groß-/Kleinschreibung und Zeichensetzung in der Ausgabe.

Quellen

Try transcription free

Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.

Related Articles