Die meisten Menschen benutzen Sprachmodelle wie eine Suchmaschine. Sie tippen drei Wörter ein, bekommen etwas Allgemeines zurück und schließen daraus, das Werkzeug tauge wenig. Der Unterschied zwischen einem unbrauchbaren und einem verwendbaren Ergebnis liegt in den meisten Fällen im Prompt, also in dem Text, den du dem Modell gibst.
Dieser Ratgeber erklärt dir das Handwerk von Grund auf. Er zeigt, was technisch passiert, wenn du auf Senden drückst, aus welchen Bausteinen ein belastbarer Prompt besteht, wie Zero-Shot, Few-Shot und Chain-of-Thought funktionieren und warum ausgerechnet die bekannteste Technik bei der aktuellen Modellgeneration überflüssig geworden ist. Alle Angaben haben den Stand vom 31. August 2026.
Was ist Prompt Engineering überhaupt?
Prompt Engineering ist die Praxis, Eingaben für ein Sprachmodell so zu formulieren, dass das Ergebnis vorhersehbar brauchbar wird. Der Begriff klingt technischer, als die Sache ist. Im Kern geht es darum, eine Aufgabe so zu beschreiben, dass eine Maschine ohne Rückfragen weiß, was du willst, für wen es gedacht ist und wie das Ergebnis aussehen soll.
Die Formulierung mit „Engineering“ trägt trotzdem. Ein guter Prompt entsteht selten beim ersten Versuch. Du schreibst eine Fassung, siehst dir das Ergebnis an, findest die Stelle, an der das Modell falsch abgebogen ist, und änderst genau diese Stelle. Dieses systematische Vorgehen unterscheidet Prompt Engineering vom bloßen Herumprobieren.
Warum sich der Aufwand rechnet
Ein Prompt, den du einmal sauber baust, funktioniert bei jeder Wiederholung derselben Aufgabe. Wer wöchentlich zwanzig Produkttexte schreiben lässt, spart mit einem durchdachten Prompt nicht zwanzig Minuten, sondern die Nacharbeit an zwanzig Texten. Der Aufwand fällt einmal an, der Nutzen bei jedem Durchlauf.
Was passiert technisch, wenn du einen Prompt abschickst?
Ein Sprachmodell liest deinen Text nicht als Wörter. Es zerlegt ihn in Token, rechnet auf dieser Grundlage Wahrscheinlichkeiten für die Fortsetzung aus und schreibt Stück für Stück eine Antwort. Wer diese drei Begriffe versteht, versteht auch die meisten Eigenheiten im Umgang mit den Werkzeugen.
Was ein Token ist
Ein Token ist eine Zeichenfolge, häufig ein kurzes Wort oder ein Wortteil. Häufige Wörter belegen ein einzelnes Token, seltene und lange Wörter zerfallen in mehrere. Deutsche Texte brauchen für denselben Inhalt spürbar mehr Token als englische, weil Komposita wie Kraftfahrzeughaftpflichtversicherung in viele Bruchstücke zerlegt werden. Bei der Nutzung über eine Programmierschnittstelle schlägt sich das direkt in den Kosten nieder, weil dort nach Token abgerechnet wird.
Für dich als Anwender folgt daraus vor allem eines. Das Modell arbeitet auf einer Ebene unterhalb der Wörter, deshalb sind Aufgaben wie das Zählen von Buchstaben in einem Wort oder das Ausrechnen langer Zahlenkolonnen für die Technik ungünstig. Dazu weiter unten mehr.
Was das Kontextfenster begrenzt
Das Kontextfenster ist die Menge an Token, die ein Modell in einem Durchgang gleichzeitig berücksichtigen kann. Es umfasst deinen Prompt, alle hochgeladenen Dateien, den bisherigen Gesprächsverlauf und die Antwort. Ist das Fenster voll, fällt der Anfang des Gesprächs heraus. Genau das erlebst du, wenn ein Chat nach zwei Stunden plötzlich vergisst, was du zu Beginn festgelegt hast.
Die Fenstergrößen sind in den vergangenen Jahren stark gewachsen und unterscheiden sich je nach Modell und Tarif erheblich. Verlässliche Zahlen stehen in der Dokumentation des jeweiligen Anbieters, Angaben aus Ratgebern veralten binnen Wochen.
Warum ein großes Fenster nicht alles löst
Ein großes Kontextfenster verführt dazu, einfach alles hineinzukippen. Die Forschung rät davon ab. Die vielzitierte Untersuchung „Lost in the Middle“ von Nelson F. Liu und Kollegen aus dem Jahr 2023 zeigte, dass Modelle Informationen am Anfang und am Ende eines langen Eingabetextes deutlich zuverlässiger finden als solche in der Mitte. Der Effekt trat auch bei Modellen auf, die ausdrücklich für lange Kontexte gebaut waren.
Daraus ergibt sich eine praktische Regel für lange Eingaben. Anthropic empfiehlt in seiner Dokumentation für Eingaben ab etwa 20.000 Token, das lange Material nach oben zu stellen und die eigentliche Frage ans Ende zu setzen. Nach den dort genannten internen Tests verbessert das die Antwortqualität um bis zu 30 Prozent, besonders wenn mehrere Dokumente im Spiel sind.
Was unterscheidet Systemprompt und Nutzerprompt?
Jede Anfrage an ein Sprachmodell besteht technisch aus mehreren Rollen. Der Systemprompt legt die Rahmenbedingungen fest und gilt für das gesamte Gespräch. Der Nutzerprompt enthält die konkrete Aufgabe. Die Antwort des Modells läuft als dritte Rolle mit und bleibt im Verlauf stehen.
In den Chat-Oberflächen siehst du den Systemprompt nicht. Er wird vom Anbieter gesetzt und regelt Verhalten, Tonfall und Grenzen. Du kannst ihn trotzdem beeinflussen, denn die benutzerdefinierten Anweisungen in ChatGPT, die Projektanweisungen in Claude und die Gem-Anweisungen in Gemini landen an genau dieser Stelle. Alles, was dauerhaft gelten soll, gehört dorthin, alles Einmalige in den normalen Chat.
Was in den Systemprompt gehört
- Rolle und Fachgebiet: wer das Modell im Rahmen deiner Arbeit sein soll.
- Dauerhafte Sprachregeln: Anrede, Fachsprache, verbotene Formulierungen, Länge.
- Hintergrund zu dir: Branche, Zielgruppe, wiederkehrende Kunden oder Produkte.
- Standardformat: ob du Fließtext, Stichpunkte oder Tabellen erwartest.
Aus welchen Bausteinen besteht ein guter Prompt?
Die Anbieter beschreiben denselben Kern mit unterschiedlichen Worten. Google fasst ihn in der Prompting-Anleitung für Gemini als Persona, Aufgabe, Kontext und Format zusammen. In der Praxis haben sich sechs Bausteine bewährt, von denen du selten alle brauchst.
Rolle
Die Rolle legt Perspektive und Wortschatz fest. „Du bist Steuerberater mit Schwerpunkt Kleinunternehmen“ führt zu anderen Antworten als „Du bist Journalist“. Anthropic weist in seiner aktuellen Anleitung darauf hin, dass ausdrückliche Angaben zur gewünschten Perspektive inzwischen wirksamer sind als die Zuweisung einer Rolle allein. Die Rolle bleibt nützlich, sie ersetzt jedoch keine klare Aufgabenbeschreibung.
Aufgabe
Die Aufgabe beginnt mit einem Verb. Fasse zusammen, vergleiche, formuliere um, prüfe, sortiere, übersetze. Vage Formulierungen wie „mach etwas mit diesem Text“ erzeugen vage Ergebnisse. Je genauer das Verb, desto enger der Korridor, in dem sich das Modell bewegt.
Kontext
Kontext ist der Baustein, den Einsteiger am häufigsten weglassen. Das Modell weiß nichts über deine Firma, deine Zielgruppe und den Zweck des Textes. Anthropic empfiehlt ausdrücklich, die Begründung mitzuliefern. Statt „Verwende niemals Auslassungspunkte“ schreibst du besser, dass der Text von einer Sprachausgabe vorgelesen wird und Auslassungspunkte dort nicht ausgesprochen werden können. Das Modell verallgemeinert aus der Erklärung und trifft auch bei ähnlichen Fällen die richtige Entscheidung.
Format
Sag, wie das Ergebnis aussehen soll. Anzahl der Absätze, Zeichenzahl, Tabelle mit benannten Spalten, Stichpunkte oder durchgehender Fließtext. Ohne Formatvorgabe bekommst du die Hausform des jeweiligen Modells, und die ist bei jedem Anbieter anders.
Beispiele
Ein Beispiel wirkt stärker als drei Absätze Beschreibung. Wenn du erklären willst, wie deine Betreffzeilen klingen sollen, zeig zwei echte. Anthropic nennt in der Dokumentation drei bis fünf Beispiele als guten Bereich und rät dazu, sie vielfältig zu halten, damit das Modell keine unbeabsichtigten Muster übernimmt.
Einschränkungen
Einschränkungen sind Leitplanken. Maximale Länge, verbotene Wörter, Quellenpflicht, keine Erfindungen. Formuliere sie so weit wie möglich positiv, dazu gleich mehr im Abschnitt über typische Fehler.
Wie sieht der Unterschied an konkreten Beispielen aus?
Drei Fälle aus dem Arbeitsalltag zeigen die Wirkung deutlicher als jede Regel. Die Vorher-Fassungen sind echte Eingaben, wie sie täglich getippt werden.
Beispiel 1: E-Mail an einen Kunden
Vorher: Schreib eine E-Mail, dass der Termin verschoben werden muss.
Nachher: Du schreibst für ein Handwerksunternehmen mit zwölf Mitarbeitern. Formuliere eine E-Mail an eine Privatkundin, mit der wir seit vier Jahren zusammenarbeiten. Der für Donnerstag vereinbarte Einbau der Küche verschiebt sich um eine Woche, weil die Arbeitsplatte beim Zulieferer beschädigt wurde. Biete zwei Ersatztermine an, Dienstag und Mittwoch der Folgewoche. Der Ton ist verbindlich und knapp, ohne Entschuldigungsschleifen. Höchstens 150 Wörter, Anrede mit Sie, kein Betreff nötig.
Die zweite Fassung liefert vier Dinge, die in der ersten fehlen: den Absender, den Grund, die gewünschte Handlung und die Länge. Das Ergebnis ist damit ohne Nacharbeit versendbar.
Beispiel 2: Text zusammenfassen
Vorher: Fasse das zusammen.
Nachher: Fasse das folgende Sitzungsprotokoll für unsere Geschäftsführerin zusammen, die nicht dabei war. Struktur: erstens die getroffenen Entscheidungen, zweitens die offenen Punkte mit zuständiger Person, drittens die Termine. Nur Stichpunkte, höchstens zwölf Zeilen insgesamt. Wenn zu einem Punkt keine Zuständigkeit im Protokoll steht, schreib „offen“ dahinter, statt eine Person zu ergänzen.
Die letzte Anweisung ist der wichtigste Teil. Sie gibt dem Modell einen erlaubten Ausweg für Lücken. Ohne diesen Ausweg füllt es die Lücke gern mit einem plausiblen Namen aus dem Protokoll.
Beispiel 3: Social-Media-Beiträge aus einem Artikel
Vorher: Mach mir daraus ein paar LinkedIn-Posts.
Nachher: Erstelle aus dem folgenden Fachartikel drei Beiträge für LinkedIn, Zielgruppe sind Personalverantwortliche in mittelständischen Unternehmen. Jeder Beitrag: erste Zeile eine konkrete Beobachtung aus dem Artikel, danach drei bis vier Sätze Erläuterung, am Ende eine Frage an die Leser. Keine Hashtags, keine Emojis, kein Verweis auf den Artikel. Duze die Leser. Hier zwei Beiträge aus dem vergangenen Monat als Maßstab für den Ton: [Beispiel eins] [Beispiel zwei]
Die beiden angehängten Altbeiträge tragen mehr zum Ergebnis bei als jede Stilbeschreibung. Genau das meint Few-Shot-Prompting, um das es im nächsten Abschnitt geht.
Was bedeuten Zero-Shot, Few-Shot und Chain-of-Thought?
Diese drei Begriffe tauchen in jedem Ratgeber auf. Sie beschreiben, wie viele Beispiele du mitgibst und ob du das Modell zum schrittweisen Vorgehen aufforderst.
Zero-Shot
Zero-Shot heißt, du beschreibst die Aufgabe ohne ein einziges Beispiel. Das ist der Normalfall im Alltag und funktioniert bei allem, was klar benennbar ist. Für Übersetzungen, Zusammenfassungen und Umformulierungen reicht es fast immer.
Few-Shot
Few-Shot heißt, du legst zwei bis fünf gelöste Fälle bei. Das Verfahren wurde mit der GPT-3-Veröffentlichung 2020 bekannt und ist bis heute das zuverlässigste Mittel für Format und Tonfall. Wichtig ist die Vielfalt der Beispiele. Wenn alle deine Muster mit einer Frage beginnen, wird das Modell jede Ausgabe mit einer Frage beginnen, auch wenn du das nie verlangt hast.
Chain-of-Thought
Chain-of-Thought bedeutet, das Modell schreibt seinen Lösungsweg auf, bevor es das Ergebnis nennt. Jason Wei und Kollegen zeigten 2022, dass sich damit Rechen-, Logik- und Alltagsaufgaben deutlich besser lösen lassen. Kojima und Kollegen fanden im selben Jahr, dass schon der angehängte Satz „Let’s think step by step“ genügt. In ihrer Untersuchung stieg die Trefferquote bei einer Sammlung von Rechenaufgaben von 17,7 auf 78,7 Prozent.
Diese Zahlen stammen aus der Modellgeneration von 2022. Genau hier setzt der wichtigste Unterschied zur heutigen Lage an.
Warum ist Chain-of-Thought bei Reasoning-Modellen überflüssig?
Seit Ende 2024 gibt es eine eigene Klasse von Modellen, die vor der Antwort intern einen Denkvorgang ausführt. Diese Reasoning-Modelle erzeugen unsichtbare Denk-Token, prüfen Zwischenschritte und geben erst danach die eigentliche Antwort aus. Der Lösungsweg, den du bei älteren Modellen mit „denk Schritt für Schritt“ erzwingen musstest, läuft bei ihnen ab Werk.
Was die Anbieter dazu sagen
OpenAI schreibt in der Anleitung für Reasoning-Modelle ausdrücklich, dass Aufforderungen wie „think step by step“ oder „explain your reasoning“ unnötig sind. Ebenso rät der Text dazu, Few-Shot-Beispiele zunächst wegzulassen und den Prompt ohne Beispiele zu schreiben. Diese Modelle kommen mit kurzen, klaren Anweisungen am besten zurecht. Zur Abgrenzung verschiedener Teile der Eingabe empfiehlt OpenAI Trennzeichen wie Markdown-Überschriften oder XML-Tags.
Anthropic geht in dieselbe Richtung. In der aktuellen Anleitung heißt es, dass das eingebaute Denken dem von Hand geschriebenen Chain-of-Thought vorzuziehen ist, wo es zur Verfügung steht. Statt den Denkweg im Prompt zu beschreiben, stellst du bei neueren Modellen die Denkintensität über einen eigenen Parameter ein. Google bietet mit den Thinking Levels eine vergleichbare Steuerung.
Wann die Denkanweisung sogar schadet
Es bleibt nicht bei der Wirkungslosigkeit. Ryan Liu und Kollegen von der Princeton University untersuchten 2024 Aufgabentypen, bei denen bewusstes Nachdenken schon bei Menschen zu schlechteren Ergebnissen führt. Bei drei davon, dem impliziten Erkennen statistischer Muster, der visuellen Wiedererkennung und der Einordnung von Fällen mit Ausnahmen, brachen auch die Modelle mit Chain-of-Thought ein. Der größte gemessene Absturz lag bei 36,3 Prozentpunkten Genauigkeit.
Anthropic weist zusätzlich auf eine Nebenwirkung hin. Bei abgeschaltetem Denkmodus reagieren manche Modelle empfindlich auf das Wort „think“ und seine Varianten. Wer eine schnelle Antwort will, formuliert deshalb besser mit Verben wie prüfe oder bewerte.
Was daraus für deine Praxis folgt
- Reasoning-Modell: kurze, klare Aufgabe, keine Denkanweisung, erst ohne Beispiele probieren.
- Schnelles Chatmodell: Denkanweisung und Beispiele helfen weiterhin, besonders bei mehrstufigen Aufgaben.
- Einfache Aufgabe: Denkmodus abschalten oder ein schnelles Modell wählen, das spart Zeit und Geld.
Wie erkennst du, welches Modell du vor dir hast?
In den Chat-Oberflächen steht die Modellauswahl im Kopfbereich oder in einem Auswahlmenü. Reasoning-Modelle erkennst du an einem sichtbaren Hinweis wie „denkt nach“ oder an einer spürbar längeren Wartezeit vor dem ersten Wort. Manche Oberflächen zeigen eine Zusammenfassung des Denkvorgangs an, die du aufklappen kannst.
Wenn du dir unsicher bist, hilft ein Test. Stell eine Aufgabe mit einer versteckten Schwierigkeit, etwa eine Textaufgabe mit einer überflüssigen Zahl. Ein Reasoning-Modell braucht länger und benennt die überflüssige Angabe. Ein schnelles Chatmodell antwortet sofort und rechnet die Zahl oft mit ein. Einen Überblick über die verbreiteten Werkzeuge und ihre Ausrichtung findest du in unserer Übersicht der wichtigsten KI-Tools.
Welche Fehler machen Einsteiger beim Prompten am häufigsten?
Vier Muster tauchen in fast jedem misslungenen Prompt auf. Sie zu kennen erspart dir die halbe Lernkurve.
Zu vage formuliert
„Schreib etwas über Marketing“ enthält keine Aufgabe, keine Zielgruppe und kein Format. Das Modell entscheidet dann selbst, und es entscheidet sich für den Durchschnitt aus allem, was es zum Thema gelesen hat. Der Test ist einfach. Könnte ein neuer Mitarbeiter mit deiner Anweisung allein loslegen, kann es das Modell auch.
Zu viele Aufgaben in einem Prompt
Recherchiere, schreibe, kürze, übersetze und formatiere als Tabelle. Solche Ketten führen dazu, dass die hinteren Schritte nachlässig ausgeführt werden. Zerleg die Kette in einzelne Anfragen und prüfe nach jedem Schritt. Bei wiederkehrenden Abläufen lohnt es sich, jeden Schritt als eigenen gespeicherten Prompt abzulegen.
In Verboten gedacht
Anweisungen wie „schreib nicht zu werblich“ beschreiben, was du vermeiden willst. Das Modell hat danach immer noch keine Vorstellung davon, was du willst. Anthropic nennt genau das als erste Regel für die Formatsteuerung: sag, was du willst, statt zu sagen, was du vermeiden willst. Aus „nicht werblich“ wird „sachlicher Berichtston, jede Aussage mit einer konkreten Zahl oder einem Beispiel belegt“. Eine kurze Liste harter Verbote darf trotzdem stehen bleiben, sie sollte nur die Ausnahme sein.
Kontext im Kopf behalten
Der häufigste Fehler ist die stillschweigende Annahme, das Modell kenne die Vorgeschichte. Es kennt nur, was im aktuellen Kontextfenster steht. Wenn du eine Analyse deiner Konkurrenz willst, nenne die Konkurrenten. Wenn du einen Text im Stil deiner Website willst, füge einen Beispieltext an. Für Arbeit mit eigenen Dokumenten eignen sich Werkzeuge, die den Quelltext dauerhaft bereithalten, etwa Gemini Notebook (früher NotebookLM).
Wie verbesserst du einen Prompt, statt neu anzufangen?
Der Reflex nach einer schlechten Antwort ist, alles zu löschen und neu zu formulieren. Damit verlierst du die Information, die in der misslungenen Antwort steckt. Sinnvoller ist ein Vorgehen in vier Schritten.
- Fehler benennen: Schreib in einem Satz auf, was genau nicht stimmt. Zu lang, falscher Ton, erfundene Zahl, falsche Zielgruppe.
- Ursache zuordnen: Ordne den Fehler einem der sechs Bausteine zu. Falscher Ton heißt fehlende Rolle oder fehlendes Beispiel. Falsche Länge heißt fehlendes Format.
- Eine Sache ändern: Ergänze genau diesen Baustein und lass die übrigen unverändert. Wer fünf Dinge gleichzeitig ändert, weiß hinterher nicht, was gewirkt hat.
- Fassung sichern: Sobald das Ergebnis stimmt, speichere den Prompt an einem festen Ort.
Nachbessern im laufenden Gespräch
Innerhalb eines Chats kannst du korrigieren, ohne den Prompt neu zu schreiben. Sätze wie „Der zweite Absatz ist zu allgemein, ersetz ihn durch ein konkretes Beispiel aus dem Handwerk“ wirken zuverlässig, weil das Modell den Bezugstext noch im Kontext hat. Sobald du dieselbe Korrektur zum dritten Mal tippst, gehört sie in den Prompt selbst.
Das Modell den Prompt verbessern lassen
Ein Umweg, der oft übersehen wird: Gib dem Modell deinen Prompt und lass ihn kritisieren. Die Frage „Welche Angaben fehlen dir, um diese Aufgabe ohne Rückfrage zu lösen?“ liefert häufig eine brauchbare Lückenliste. Anthropic empfiehlt in derselben Logik, das Modell die eigenen Beispiele auf Vielfalt prüfen zu lassen.
Wie unterscheiden sich ChatGPT, Claude und Gemini beim Prompten?
Die Grundlagen gelten überall. Im Detail haben die drei großen Anbieter unterschiedliche Vorlieben, die sich in der jeweiligen Dokumentation niederschlagen.
ChatGPT
OpenAI trennt deutlich zwischen schnellen Chatmodellen und Reasoning-Modellen. Für die Reasoning-Modelle gilt die Regel, kurz und klar zu formulieren und auf Denkanweisungen zu verzichten. Trennzeichen wie Überschriften oder Tags helfen, verschiedene Teile der Eingabe auseinanderzuhalten. Was das Angebot kostet und welche Modelle in welchem Tarif stecken, steht in unserer Übersicht zu den ChatGPT-Kosten, die Praxis im Alltag beschreibt der ChatGPT-Test.
Claude
Anthropic hat XML-Tags lange als Standard empfohlen und stuft sie inzwischen als optional ein. Für die meisten Fälle reichen klare Überschriften und Absätze, Tags lohnen sich bei sehr komplexen Prompts mit vielen Bestandteilen. Auffällig ist die Betonung des Kontextes, denn Begründungen mitzuliefern wirkt bei Claude besonders stark. Wie sich das Werkzeug im Alltag schlägt, steht im Claude-Test.
Gemini
Google arbeitet mit der Formel Persona, Aufgabe, Kontext, Format und empfiehlt sie in der eigenen Prompting-Anleitung als Grundgerüst. Die Einbindung in Google Workspace macht Prompts interessant, die auf konkrete Dokumente oder Tabellen verweisen. Details stehen im Gemini-Test.
Weitere Anbieter
Neben den drei großen lohnt ein Blick auf spezialisierte Werkzeuge. Perplexity ist auf belegte Antworten mit Quellenangabe ausgelegt und verlangt entsprechend andere Prompts, weil die Rechercheanweisung dort im Vordergrund steht. DeepSeek und Mistral sind für preisbewusste Anwendungen und für europäische Datenhaltung interessant. Beim Programmieren gelten eigene Regeln, dort zählt die genaue Beschreibung der gewünschten Schnittstelle mehr als jede Stilvorgabe, wie der GitHub-Copilot-Test zeigt.
Wie speicherst du Prompts für wiederkehrende Aufgaben?
Sobald du eine Aufgabe zum dritten Mal stellst, gehört der Prompt in eine Ablage. Alle großen Anbieter haben dafür inzwischen eigene Bereiche, die Anweisungen und Dateien zusammenhalten. In ChatGPT heißen sie Projekte und Custom GPTs, in Claude Projekte, bei Google Gems. Die Anweisungen in diesen Bereichen gelten für jede Unterhaltung darin, ohne dass du sie erneut eingibst.
Was in eine eigene Prompt-Sammlung gehört
- Titel und Zweck: ein Satz, wofür der Prompt gedacht ist.
- Der Prompt selbst mit Platzhaltern für die wechselnden Teile.
- Das Modell, mit dem er getestet wurde, samt Datum.
- Eine Beispielausgabe, an der du erkennst, ob eine spätere Fassung schlechter geworden ist.
Der letzte Punkt wird gern übersprungen und ist der wichtigste. Modelle werden im Hintergrund aktualisiert, ein Prompt kann nach einem Update anders wirken als vorher. Ohne gespeicherte Beispielausgabe merkst du das erst, wenn ein Kunde sich beschwert.
Platzhalter sauber setzen
Markiere die wechselnden Stellen eindeutig, etwa in eckigen Klammern oder in geschweiften Klammern. Ein Prompt mit [KUNDENNAME], [PRODUKT] und [ANLASS] lässt sich in Sekunden befüllen und verhindert, dass Reste des letzten Auftrags im Text stehen bleiben. Für Fließtextarbeit gilt dasselbe Prinzip, unabhängig davon, ob du im Chat arbeitest oder in einem Schreibwerkzeug.
Was repariert auch der beste Prompt nicht?
Prompt Engineering hat harte Grenzen. Wer sie kennt, spart sich das Suchen nach dem magischen Satz, den es für diese Fälle nicht gibt.
Erfundene Angaben
Sprachmodelle geben auch dann eine flüssige Antwort, wenn ihnen die Grundlage fehlt. OpenAI hat 2025 in einer eigenen Veröffentlichung dargelegt, dass die üblichen Bewertungsverfahren dieses Verhalten begünstigen, weil sie eine geratene Antwort besser bewerten als das Eingeständnis von Unwissen. Ein Prompt kann das Verhalten dämpfen, indem er einen erlaubten Ausweg anbietet. Ein Satz wie „Wenn du eine Angabe nicht aus den beigefügten Unterlagen belegen kannst, schreib unbekannt“ wirkt besser als jede Ermahnung zur Wahrheit. Abschaffen lässt sich das Problem damit nicht.
Fehlendes Wissen
Kein Prompt bringt Wissen ins Modell, das nicht im Training und nicht im Kontext steht. Firmeninterne Zahlen, Ereignisse nach dem Trainingsstichtag und Inhalte hinter einer Anmeldeschranke sind unerreichbar. Die Lösung ist die Zufuhr von Material, über Dateianhang, Websuche oder eine Anbindung an eigene Datenquellen.
Rechnen und Zählen
Sprachmodelle rechnen nicht, sie sagen das nächste Token vorher. Bei mehrstelligen Multiplikationen und langen Zahlenreihen führt das zu Fehlern, die sich mit keiner Formulierung beseitigen lassen. Eine Forschungsgruppe von Apple zeigte 2024 mit dem Testverfahren GSM-Symbolic, dass schon das Austauschen von Zahlen und Namen in Textaufgaben die Trefferquote senkt und dass eine eingeschobene, sachlich irrelevante Zusatzangabe die Ergebnisse deutlich einbrechen lässt. Der verlässliche Weg führt über ein Werkzeug, das der Rechner tatsächlich ausführt, etwa eine Tabellenkalkulation oder die Code-Ausführung im Chat.
Fachliche Prüfung
Ein gut geschriebener Text ist kein geprüfter Text. Bei rechtlichen, medizinischen und steuerlichen Inhalten bleibt die Prüfung durch einen Menschen mit Zulassung erforderlich. Der Prompt kann diese Prüfung vorbereiten, indem er das Modell zwingt, Annahmen und Unsicherheiten ausdrücklich zu benennen.
Was musst du in Deutschland rechtlich beim Prompten beachten?
Dieser Teil fehlt in den meisten englischsprachigen Anleitungen und ist im beruflichen Einsatz der wichtigste. Ein Prompt ist eine Datenübermittlung an einen Dienstleister, und was dort hineingeht, verlässt dein Haus.
Personenbezogene Daten im Prompt
Sobald Namen, Adressen, Gesundheitsdaten, Bewerbungsunterlagen oder Kundendaten in einem Prompt stehen, greift die Datenschutz-Grundverordnung. Der Anbieter wird zum Auftragsverarbeiter, und Artikel 28 verlangt dafür einen Vertrag. Die kostenlosen Chat-Zugänge der großen Anbieter bieten diesen Vertrag in der Regel nicht, die Geschäftstarife dagegen schon. Für den Alltag heißt das: Daten vor dem Einfügen anonymisieren, wo es geht, und für echte Personendaten nur Zugänge nutzen, für die dein Unternehmen einen Vertrag abgeschlossen hat.
Geschäftsgeheimnisse und Kundenverträge
Unabhängig vom Datenschutz kann eine Vertraulichkeitsvereinbarung mit einem Kunden die Weitergabe an Dritte verbieten. Das Hochladen eines Angebots in einen Chatdienst ist eine solche Weitergabe. Prüf vor dem ersten Einsatz, ob in deinen Verträgen eine entsprechende Klausel steht, und kläre die Nutzung offen mit dem Kunden.
Pflicht zur KI-Kompetenz
Seit dem 2. Februar 2025 verlangt Artikel 4 der europäischen KI-Verordnung von Unternehmen, die KI-Systeme einsetzen, ein ausreichendes Maß an KI-Kompetenz bei den Beschäftigten. Ein festes Curriculum schreibt die Verordnung nicht vor, die Umsetzung liegt bei den Unternehmen. Eine kurze interne Handreichung zum Prompten, verbunden mit klaren Regeln zu erlaubten Daten und Werkzeugen, deckt einen guten Teil davon ab und ist ohnehin sinnvoll.
Wie fängst du in der Praxis an?
Such dir eine Aufgabe, die du mindestens wöchentlich erledigst und die aus Text besteht. Angebotsschreiben, Protokollzusammenfassungen, Produkttexte, Antworten auf wiederkehrende Anfragen. An dieser einen Aufgabe lernst du mehr als an zwanzig Beispiel-Prompts aus einer Sammlung.
Schreib die Aufgabe zuerst so auf, wie du sie einem neuen Kollegen erklären würdest. Ergänze Rolle, Kontext und Format. Lass das Modell arbeiten, benenne den größten Fehler und ändere genau einen Baustein. Nach drei bis vier Runden hast du eine Fassung, die du speichern kannst. Danach nimmst du dir die nächste Aufgabe vor.
Der Rest ist Übung. Prompt Engineering ist ein Handwerk mit wenigen Regeln und vielen Sonderfällen, und die Sonderfälle lernst du nur an eigenen Texten. Wichtig bleibt die Kontrolle am Ende. Ein Modell liefert dir einen Entwurf, die Verantwortung für das, was du verschickst, bleibt bei dir.