
Fortgeschrittene ChatGPT-Prompts für bessere Antworten aus Transkripten
Summarize this article with:
Die Muster, die funktionieren
Der größte Hebel für bessere ChatGPT-Antworten ist keine clevere Formulierung, sondern dem Modell eine konkrete Quelle an die Hand zu geben. Wenn Sie ein Transkript in das Kontextfenster einfügen und sagen „ausschließlich auf Basis dieses Dokuments“, nehmen Sie dem Modell seinen Hauptfehlermodus: die Erzeugung plausibel klingender Texte aus Trainingsdaten statt aus Ihren tatsächlichen Inhalten. Die folgenden Muster sind danach sortiert, wie gut sie durch Forschung gestützt sind – nicht danach, wie beeindruckend sie klingen.
Dieser Leitfaden wendet diese Muster speziell auf Frage-und-Antwort-Aufgaben mit Transkripten an: das Extrahieren von Antworten, Zusammenfassungen und strukturierten Inhalten aus Audio- oder Videoaufnahmen, die Sie bereits in Text umgewandelt haben.
Warum Transkripte einen besseren Kontext liefern als Notizen
Bevor wir uns den Mustern zuwenden, ein Wort zur Quellenqualität. Eine grobe Paraphrase eines Meetings ist verlustbehaftetes Eingangsmaterial. Ein sauberes, mit Zeitstempeln versehenes Transkript ist das nicht.
Wenn Sie ChatGPT ein Transkript füttern, geben Sie ihm:
- Die tatsächlichen Worte der Sprechenden, nicht eine Zusammenfassung davon
- Impliziten Kontext (Zögern, Wiederholungen, Nachfragen), den Gliederungen entgeht
- Ein Ground-Truth-Dokument, auf das Sie das Modell verweisen lassen können
Ist Ihr Transkript ungenau oder fehlen Sprecher-Labels, verstärken sich diese Fehler in der Modellausgabe. Tools wie Audio-zu-Text und Meeting-Transkription liefern Ergebnisse, die sauber genug sind, um sie direkt als Prompt-Payload zu verwenden.
Muster 1: Das Grounding-Muster (höchste Konfidenz)
Dies ist das Muster mit der klarsten Beleglage. Sie weisen das Modell an, Ihr Transkript als alleinige Quelle zu behandeln, und verbieten Halluzinationen ausdrücklich.
You are reviewing a [podcast/interview/meeting] transcript.
The transcript is your single source of truth.
Do not use outside knowledge.
Based ONLY on the content below, [your task here].
If the transcript does not contain enough information to answer, say so explicitly.
[TRANSCRIPT START]
{paste transcript here}
[TRANSCRIPT END]
Die Grounding-Anweisung bewirkt zwei Dinge: Sie unterdrückt die Tendenz des Modells, Lücken mit Trainingsdaten zu füllen, und sie gibt Ihnen ein Instrument zur Qualitätsprüfung der Ausgabe. Zitiert das Modell etwas, das nicht in Ihrem Transkript steht, liefert Ihnen der Prompt einen Grund, die Ausgabe zurückzuweisen.
Der OpenAI-Prompt-Engineering-Guide empfiehlt genau dies: Fügen Sie proprietäre oder domänenspezifische Daten hinzu, die das Modell benötigt, und weisen Sie es an, seine Antworten auf diese Inhalte statt auf allgemeines Wissen zu stützen (laut developers.openai.com-Guide, überprüft im Juli 2026).
Muster 2: Das Format-zuerst-Muster (höchste Konfidenz)
Legen Sie Ihr Ausgabeformat fest, bevor Sie die Aufgabe beschreiben – das verbessert die Konsistenz zuverlässig. Forschung zu strukturierten Ausgaben zeigt, dass Modelle mit einem expliziten Schema oder durchgerechneten Beispiel dieses deutlich zuverlässiger einhalten als Modelle mit einer vagen Anweisung wie „Strukturiere das übersichtlich“.
Output a markdown document with this exact structure:
## Key Claims
- [claim 1]
- [claim 2]
## Open Questions
- [question 1]
## Action Items
- [owner]: [task]
Now, using only the transcript below, fill in each section.
Do not invent items not supported by the text.
[TRANSCRIPT]
{paste transcript here}
[/TRANSCRIPT]
Der Format-zuerst-Ansatz funktioniert, weil das Modell die Zielform sieht, bevor es Ihre Inhalte liest. Sie können das Schema an jede benötigte Ausgabe anpassen: Meeting-Protokolle, eine Blog-Gliederung, ein Q&A für eine Verkaufsseite, Sprecher-Zitate für Social Media.
Eine ausführlichere Diskussion der Formatentscheidungen finden Sie im Leitfaden zu strukturierter Ausgabe vs. zusammenfassendem Fließtext.
Muster 3: Das Constraint-Muster (hohe Konfidenz)
Explizite Constraints zu ergänzen, reduziert generisches Aufblähen. Die nützlichsten Constraints für die Arbeit mit Transkripten:
- Länge: „Nicht mehr als 150 Wörter.“
- Umfang: „Nur Themen abdecken, die der erste Sprecher erwähnt hat.“
- Tonalität: „Klare Sprache, kein Fachjargon, Leseniveau der 10. Klasse.“
- Zitate: „Das Transkript direkt zitieren, um jeden Punkt zu belegen.“
Using only the transcript below, write a three-paragraph summary.
Each paragraph must be under 80 words.
Every factual claim must include a verbatim quote from the transcript as evidence.
Do not add background context from outside the recording.
[TRANSCRIPT]
{paste transcript here}
[/TRANSCRIPT]
Diese Vorlage eignet sich gut für Interview-Zusammenfassungen, Podcast-Show-Notes und Forschungsinterviews, bei denen Sie unterscheiden müssen, was die Sprechenden tatsächlich gesagt haben, und was Sie daraus schließen.
Muster 4: Few-Shot-Beispiele (hohe Konfidenz)
Ein oder zwei Beispiele Ihres gewünschten Input/Output vor der eigentlichen Aufgabe einzufügen, ist eine der konsistenteren Techniken über Studien hinweg. In einer Sentiment-Analyse-Studie lag Few-Shot-Prompting bei der Genauigkeit rund 10 Prozentpunkte über Zero-Shot. Der Wert steigt damit, wie spezifisch Ihre Formatanforderungen sind.
Für die Arbeit mit Transkripten sieht ein Few-Shot-Setup so aus:
I will give you a transcript. Extract every action item in this format:
Example:
Transcript: "Sarah said she would send the contract by Friday and asked Mike to review the Q2 numbers."
Action items:
- Sarah: Send contract by Friday
- Mike: Review Q2 numbers
Now extract action items from this transcript:
[TRANSCRIPT]
{paste transcript here}
[/TRANSCRIPT]
Das Beispiel lehrt das Modell, was als Action Item zählt, welche Sprecherzuordnung zu verwenden ist und wie knapp die Formulierung sein soll – ohne dass Sie all das in abstrakten Regeln ausbuchstabieren müssten.
Muster 5: Explizite Rolle + Aufgabenrahmung (moderate Konfidenz)
Weist man dem Modell eine Rolle zu, verschieben sich sein Ausgabestil und sein Vokabular. Der praktische Effekt ist real: Bittet man ChatGPT, „als UX-Forscher, der ein Usability-Interview auswertet“ zu antworten, ergibt sich eine andere Wortwahl als bei der Bitte, als „Marketing-Copywriter“ zu antworten. Diese stilistische Verschiebung ist nützlich.
Was die Forschung nicht klar stützt, ist die stärkere Behauptung, Role Prompting verbessere faktische Genauigkeit oder Schlussfolgerungsqualität. Eine Studie aus dem Jahr 2025 mit 162 verschiedenen Rollenzuweisungen fand keinen konsistenten Genauigkeitsgewinn gegenüber einer neutralen Basislinie, und einige Rollen führten zu Verzerrungen. Der Effekt betrifft Ton und Rahmung, nicht das Wissen des Modells.
Meine Einschätzung: Nutzen Sie Rollenrahmung, um das richtige Register zu treffen – nicht, um Fachwissen herbeizubeschwören, über das das Modell nicht verfügt. Kombinieren Sie sie mit dem Grounding-Muster, wenn Ihnen Genauigkeit wichtig ist.
You are a [journalist/researcher/analyst/hiring manager] reviewing a transcript.
Your goal is to [task].
Use only what the speaker said. If you are uncertain, say so.
[TRANSCRIPT]
{paste transcript here}
Muster 6: Iterative Dekomposition für komplexe Transkripte (moderate Konfidenz)
Lange, dichte Transkripte lassen sich besser bearbeiten, wenn Sie die Aufgabe in Schritte zerlegen, statt alles auf einmal anzufordern. Ein einzelner Prompt, der Zusammenfassung, Themen, Zitate und Action Items verlangt, erzeugt oft oberflächliche Ergebnisse in allen vier Bereichen.
Step 1 prompt:
"Read the transcript below. List the five main topics discussed, in order of how much time was spent on each."
Step 2 prompt (after reviewing the list):
"For topic [X], what is the speaker's stated position? Quote the relevant section."
Step 3 prompt:
"Based on the discussion of [X], what follow-up questions were left unanswered?"
Anmerkung zu Chain-of-Thought: Ein Wharton-Working-Paper vom Juni 2025 („The Decreasing Value of Chain of Thought in Prompting“, Mollick et al.) fand, dass explizite Schritt-für-Schritt-CoT-Anweisungen bei aktuellen Modellen weniger nützen als bei früheren, weil neuere Modelle Probleme bereits implizit durchdenken. Die obige Dekomposition ist nicht dasselbe wie die Bitte an das Modell, mitten in der Antwort „seinen Rechenweg offenzulegen“. Es geht darum, dass Sie die Strukturierung über mehrere Aufrufe hinweg übernehmen, wodurch jede Aufgabe handhabbar bleibt.
Speziell zum Extrahieren von Zusammenfassungen behandelt der begleitende Beitrag zu wie man KI für bessere Zusammenfassungen promptet Vorlagenvarianten für diesen Workflow.
Welches Muster wofür
| Ziel | Primäres Muster | Ergänzung |
|---|---|---|
| Meeting-Protokoll aus einer Aufnahme | Format-zuerst | Grounding |
| Sprecher-Zitate für einen Blogbeitrag | Grounding | Constraint (wortgleich zitieren) |
| Action Items aus einem Anruf | Few-Shot | Explizite Rolle (Projektleitung) |
| Thematische Analyse von Interviews | Iterative Dekomposition | Constraint (Belege zitieren) |
| Show-Notes für einen Podcast | Format-zuerst | Constraint (maximale Wortzahl) |
| Forschungszusammenfassung aus einem Vortrag | Grounding | Format-zuerst |
Eine Anmerkung zur Größe des Kontextfensters
Aktuelle ChatGPT-Modelle unterstützen Kontextfenster von rund 128.000 Tokens (GPT-4o) bis zu höheren Grenzen bei neueren Versionen. Ein typisches einstündiges Transkript umfasst etwa 10.000 bis 15.000 Wörter und passt problemlos hinein. Fügen Sie das vollständige Transkript ein, nicht Auszüge, wenn Sie Fragen stellen, die vom Modell Schlussfolgerungen über die gesamte Konversation hinweg verlangen. Kürzungen erzeugen Lücken, die das Modell mit Vermutungen füllt.
Gibt Ihr Transkriptionstool eine Datei mit Zeitstempeln und Sprecher-Labels aus, behalten Sie diese bei. Sprecher-Labels verankern die Zuordnung, und Zeitstempel ermöglichen es, Zitate gegen das Original zu prüfen.

Wenn Sie ein Transkript als Ausgangsbasis brauchen, verarbeitet ConvertAudioToText Audiodateien und gibt einen sauberen Text mit Sprecher-Labels aus, den Sie direkt in jedes der oben genannten Muster einfügen können.
Häufige Fragen
Was ist das Wichtigste, das ich zu einem ChatGPT-Prompt hinzufügen kann?
Ein konkretes Quelldokument. Wenn Sie dem Modell ein Transkript geben und es anweisen, ausschließlich auf Basis dieses Dokuments zu antworten, eliminieren Sie seinen größten Fehlermodus: das Anknüpfen an Trainingsdaten statt an Ihre tatsächlichen Inhalte. Formatanweisungen und Rollenrahmungen helfen am Rand, aber die Verankerung des Modells in einem bestimmten Text hat den klarsten Effekt auf die Genauigkeit.
Funktioniert es noch, ChatGPT zu bitten, „Schritt für Schritt“ zu denken?
Weniger zuverlässig als früher. Ein Wharton-Working-Paper aus dem Jahr 2025 fand einen sinkenden Nutzen expliziter Chain-of-Thought-Anweisungen bei aktuellen Modellen, die einen Großteil dieser Denkschritte bereits implizit durchführen. Bei Transkript-Aufgaben führt es tendenziell zu besseren Ergebnissen, wenn Sie die Arbeit selbst über mehrere Prompts strukturieren und jeweils eine fokussierte Frage stellen, statt das Modell zu bitten, in einer einzigen Antwort laut zu denken.
Wie lang sollte mein Prompt sein?
OpenAIs eigene Empfehlungen und unabhängige Forschung verorten den praktischen Sweet Spot für den Anweisungsteil bei etwa 150 bis 300 Wörtern – ohne das Transkript selbst. Längere Anweisungen erhöhen das Risiko, dass das Modell wichtige Constraints aus den Augen verliert, insbesondere solche, die mitten im Prompt stehen. Stellen Sie die wichtigste Regel an den Anfang: Ihr Ausgabeformat oder Ihre Grounding-Anweisung.
Funktionieren diese Muster auch mit Claude oder Gemini?
Ja. Das Grounding-Muster, das Format-zuerst-Muster und der Few-Shot-Ansatz sind nicht ChatGPT-spezifisch. Sie funktionieren, weil sie Mehrdeutigkeiten in der Eingabe jedes großen Sprachmodells reduzieren. Die Syntaxpräferenzen unterscheiden sich leicht: Claude kommt gut mit XML-Tags als Abschnittstrennern zurecht, während ChatGPT gut mit Markdown-Überschriften umgeht. Passen Sie die Formatierung an, behalten Sie die Logik.
Quellen
- OpenAI Prompt Engineering Guide: developers.openai.com (überprüft im Juli 2026)
- Mollick et al., „The Decreasing Value of Chain of Thought in Prompting“, SSRN Working Paper, Juni 2025: papers.ssrn.com/sol3/papers.cfm?abstract_id=5285532
- „Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance“, arXiv 2025: arxiv.org/pdf/2508.19764
- OpenAI-Dokumentation zu Structured Output: platform.openai.com/docs
- „Enhancing structured data generation with GPT-4o“, Frontiers in AI, 2025: frontiersin.org
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.