Du stellst eine Frage, und statt sofort loszuschreiben, zeigt das Werkzeug erst einen Hinweis wie „Denkt nach“ und lässt dich zehn, zwanzig, manchmal sechzig Sekunden warten. Danach kommt eine Antwort, die spürbar sorgfältiger ausfällt als sonst. Was in dieser Pause passiert, ist der ganze Unterschied zwischen einem klassischen Sprachmodell und einem Reasoning-Modell.
Reasoning-Modelle, auf Deutsch etwa Schlussfolgerungs-Modelle, sind seit Ende 2024 die zweite große Modellklasse neben den gewöhnlichen Chat-Modellen. Sie kosten mehr, brauchen länger und lösen bestimmte Aufgaben deutlich besser. Sie lösen längst nicht alle Aufgaben besser, und genau dieser Punkt fehlt in fast jedem deutschsprachigen Erklärstück. Dieser Ratgeber erklärt die Technik dahinter, rechnet die Kosten durch, nennt Modelle und Preise mit Stand vom 31. August 2026 und zeigt die belegten Fälle, in denen mehr Denkzeit das Ergebnis verschlechtert.
Was unterscheidet ein Reasoning-Modell von einem klassischen Sprachmodell?
Beide Modellklassen beruhen auf derselben Grundtechnik. Ein Sprachmodell sagt das jeweils nächste Textstück voraus, Token für Token, auf Basis von allem, was davor steht. Der Unterschied liegt darin, wofür diese Vorhersage verwendet wird und wann die Ausgabe für dich beginnt.
Wie ein klassisches Chat-Modell antwortet
Ein gewöhnliches Chat-Modell beginnt seine Arbeit beim ersten Zeichen der sichtbaren Antwort. Es hat keinen Arbeitsplatz, auf dem es etwas durchrechnen könnte, bevor es sich festlegt. Alles, was es an Zwischenüberlegungen anstellt, landet direkt im sichtbaren Text oder findet gar nicht statt. Deshalb funktionierte der alte Prompt-Trick „Denk Schritt für Schritt“ so gut. Er zwang das Modell, seinen Rechenweg auszuschreiben, und schon dieser Weg verbesserte das Endergebnis messbar.
Was ein Reasoning-Modell dazwischenschiebt
Ein Reasoning-Modell erzeugt vor der Antwort einen eigenen, abgetrennten Textblock. Darin probiert es Ansätze durch, verwirft sie, rechnet nach, prüft Zwischenergebnisse und plant die Struktur der Antwort. Erst danach beginnt die Ausgabe, die du zu sehen bekommst. Dieser Block heißt bei OpenAI reasoning, bei Anthropic thinking und bei Google thought. Technisch ist er derselbe Text wie die Antwort, er wird nur anders behandelt. Er wird abgerechnet, er belegt Platz im Kontextfenster, und er wird dir in aller Regel nicht im Original gezeigt.
Die Trennung in zwei Produktreihen löst sich gerade auf. OpenAI hat die frühere Aufteilung in GPT-Modelle und die o-Reihe aufgegeben und steuert das Denken innerhalb derselben Modellfamilie über einen Parameter. Bei Google entscheidet Gemini von sich aus, wie viel Aufwand eine Anfrage verdient. Bei Anthropic ist das Denken auf Claude Opus 5 ab Werk eingeschaltet. Reasoning wird damit zu einer Betriebsart, die du an- und abschalten kannst.
Wie funktioniert das Denken vor der Antwort, und was sind Denk-Token?
Die Antwort auf diese Frage entscheidet darüber, ob du die Kosten deiner Anwendung verstehst oder nicht.
Was ein Denk-Token genau ist
Token sind die Bruchstücke, in die ein Modell Text zerlegt, grob eine Silbe bis ein kurzes Wort. Ein Denk-Token ist ein Token aus dem internen Block. In seiner Beschaffenheit unterscheidet es sich in nichts von einem Antwort-Token. OpenAI führt es in der eigenen Reasoning-Dokumentation als dritte Kategorie neben Eingabe- und Ausgabe-Token und nennt zwei Folgen. Die Denk-Token belegen Platz im Kontextfenster, und sie werden als Ausgabe-Token abgerechnet. Die Schnittstelle meldet ihre Zahl im Feld output_tokens_details.reasoning_tokens zurück.
Bei den anderen Anbietern läuft es genauso. Anthropic weist die Zahl unter usage.output_tokens_details.thinking_tokens aus. Google rechnet die Denk-Token dem Ausgabepreis zu und stellt in der Dokumentation ausdrücklich klar, dass die vollen Denk-Token berechnet werden, obwohl über die Schnittstelle nur eine Zusammenfassung herauskommt.
Wie viel Platz das Denken braucht
Die Größenordnung ist der Punkt, an dem viele erste Versuche scheitern. OpenAI empfiehlt in der eigenen Dokumentation, beim Einstieg mindestens 25.000 Token für Denken und Ausgabe zusammen freizuhalten. Anthropic nannte für die ältere Variante mit festem Budget 1.024 Token als Untergrenze und 16.000 Token als sinnvollen Startwert bei schwierigen Aufgaben, dazu den Hinweis, dass Anfragen jenseits von 32.000 Denk-Token besser über die Stapelverarbeitung laufen, weil sonst Zeitüberschreitungen drohen. Eine Antwort von 300 Wörtern kann also ein Vielfaches davon an unsichtbarem Text hinter sich haben.
Wie wurden Reasoning-Modelle trainiert?
Das Denken vor der Antwort ist keine eingebaute Funktion, es ist antrainiertes Verhalten. Der Weg dorthin heißt Verstärkungslernen, englisch reinforcement learning.
Was Verstärkungslernen bei Sprachmodellen bedeutet
Im üblichen Training lernt ein Modell, von Menschen geschriebenen Text fortzusetzen. Beim Verstärkungslernen bekommt es stattdessen Aufgaben mit prüfbarem Ergebnis, etwa eine Mathematikaufgabe mit eindeutiger Lösung oder eine Programmieraufgabe mit Testfällen. Das Modell darf einen beliebig langen Lösungsweg schreiben, geprüft wird am Ende nur das Ergebnis. Wege, die zur richtigen Lösung führen, werden verstärkt, die übrigen geschwächt. Niemand schreibt dem Modell vor, wie es zu denken hat. Es findet die Strategien selbst, weil sie sich in der Bewertung auszahlen.
Was DeepSeek mit R1 offengelegt hat
Wie stark dieser Mechanismus wirkt, hat das chinesische Labor DeepSeek als erstes öffentlich dokumentiert. Die Arbeit zu DeepSeek R1 erschien 2025 in der Fachzeitschrift Nature, Band 645, Seiten 633 bis 638, und beschreibt eine Vorstufe namens R1-Zero. Sie wurde ausschließlich mit Verstärkungslernen trainiert, ohne einen einzigen von Menschen geschriebenen Lösungsweg. Auf dem Mathematikwettbewerb AIME 2024 stieg die Trefferquote im ersten Versuch im Lauf des Trainings von 15,6 auf 71,0 Prozent, mit einem Mehrheitsentscheid über 64 Durchläufe auf 86,7 Prozent. Dabei entstanden von selbst Verhaltensweisen wie Selbstprüfung, Rückblick auf den eigenen Rechenweg und Strategiewechsel mitten in der Aufgabe.
Das erklärt auch die Stärkenverteilung dieser Modellklasse. Verstärkungslernen braucht ein prüfbares Ziel. Wo es eines gibt, in Mathematik, Logik, Programmierung und formalen Aufgaben, sind die Sprünge am größten. Wo es keines gibt, etwa bei der Frage nach dem passenderen Tonfall einer E-Mail, kann das Verfahren wenig ausrichten.
Warum sind Reasoning-Modelle langsamer und teurer?
Beides hat dieselbe Ursache. Das Modell erzeugt mehr Text, als du zu sehen bekommst, und Text zu erzeugen kostet Rechenzeit und Geld.
Wie sich die Kosten zusammensetzen
Ausgabe-Token sind bei allen großen Anbietern deutlich teurer als Eingabe-Token, meist um den Faktor fünf bis sechs. Bei OpenAIs gpt-5.6-sol stehen 4 US-Dollar je Million Eingabe-Token gegen 20 US-Dollar je Million Ausgabe-Token, bei Claude Opus 5 sind es 5 gegen 25 US-Dollar, jeweils Stand 31. August 2026. Denk-Token fallen vollständig in die teure Kategorie.
Ein Rechenbeispiel macht das greifbar. Eine sichtbare Antwort von rund 400 Ausgabe-Token kostet bei 20 US-Dollar je Million Token etwa 0,8 Cent. Kommen 6.000 Denk-Token hinzu, weil die Aufgabe anspruchsvoll ist, landest du bei 12,8 Cent für dieselbe sichtbare Antwort. Dieses Verhältnis von rund 1 zu 16 ist bei schwierigen Aufgaben der Normalfall. Für eine Anwendung mit zehntausend Anfragen im Monat ist das der Unterschied zwischen 80 und 1.280 US-Dollar. Wer die eigenen Kosten für ChatGPT im Abo kennt, unterschätzt diesen Effekt in der Schnittstelle regelmäßig, weil das Abo den Verbrauch verdeckt.
Die Wartezeit folgt derselben Logik. Ein Modell erzeugt Token nacheinander. 6.000 unsichtbare Token vor der ersten sichtbaren Zeile bedeuten je nach Auslastung fünf bis sechzig Sekunden Stille. Für einen Chat im Browser ist das erträglich, für eine Suchmaske, die auf jeden Tastendruck reagieren soll, ist es unbrauchbar.
Lässt sich einstellen, wie lange ein Modell nachdenkt?
Ja, und diese Stellschraube ist inzwischen der wichtigste Kostenhebel überhaupt. Alle vier großen Anbieter haben eine, sie heißt nur überall anders.
- OpenAI: Der Parameter reasoning_effort kennt bei der GPT-5.6-Familie die Stufen none, minimal, low, medium, high, xhigh und max. Auf der Stufe none arbeitet dasselbe Modell ohne Denkphase.
- Anthropic: Ältere Claude-Modelle bekamen ein festes Denkbudget in Token vorgegeben. Ab Claude Opus 4.6 tritt an dessen Stelle das adaptive Denken, bei dem das Modell je Anfrage selbst entscheidet, ob und wie lange es denkt. Gesteuert wird über output_config.effort mit den Stufen low bis max. Ab Claude 4.7 lehnt die Schnittstelle das alte feste Budget mit einem Fehler ab.
- Google: Gemini denkt standardmäßig dynamisch und passt den Aufwand an die Schwierigkeit der Anfrage an. Über das thinking level lassen sich je nach Modell die Stufen minimal, low, medium und high wählen.
- DeepSeek: reasoning_effort kennt low, high und max, dazu einen Betrieb ganz ohne Denkphase.
Die höchste Stufe ist selten die richtige Voreinstellung. OpenAI rät in der eigenen Migrationshilfe ausdrücklich dazu, beim Modellwechsel die bisherige Stufe als Ausgangspunkt zu nehmen und eine Stufe darunter gegenzuprüfen, statt nach oben zu gehen.
Bringt mehr Denkzeit immer ein besseres Ergebnis?
Nein. Das ist der am schlechtesten dokumentierte Punkt dieser ganzen Modellklasse. Es gibt Aufgabentypen, bei denen die Leistung mit längerem Nachdenken messbar sinkt, und zwar erheblich.
Die Aufgaben, bei denen Denken schadet
Die Arbeit „Mind Your Step (by Step)“ von Ryan Liu, Jiayi Geng, Addison J. Wu und weiteren Forschenden aus Princeton, geführt unter arXiv 2410.21333 und zuletzt im Juni 2025 überarbeitet, geht von einer Beobachtung aus der Psychologie aus. Es gibt Aufgaben, bei denen Menschen schlechter abschneiden, sobald sie bewusst darüber nachdenken, etwa das Wiedererkennen von Gesichtern oder Entscheidungen, die auf Gefühl beruhen. Die Forschenden übertrugen sechs solcher Aufgabentypen auf Sprachmodelle. Bei drei davon brachen die Modelle mit ausgeschriebenem Denkweg deutlich ein, im stärksten Fall um 36,3 Prozentpunkte absolut bei OpenAIs o1-preview im Vergleich zu GPT-4o ohne Denkweg.
Eine zweite Arbeit bestätigt das Muster von der anderen Seite. „Inverse Scaling in Test-Time Compute“ von Aryo Pradipta Gema, Alexander Hägele, Runjin Chen und Kolleginnen und Kollegen, arXiv 2507.14417, im Juli 2025 eingereicht und im Dezember 2025 überarbeitet, untersucht, was passiert, wenn man denselben Modellen schlicht mehr Denkzeit gibt. In vier Aufgabenkategorien wurde das Ergebnis mit mehr Denkzeit schlechter, darunter Zählaufgaben mit eingestreuten Ablenkungen, Schätzaufgaben mit Scheinkorrelationen und Deduktionsaufgaben mit vielen Nebenbedingungen. Die Fehlerbilder unterschieden sich je nach Hersteller. Claude-Modelle ließen sich mit wachsender Denkzeit stärker von irrelevanten Angaben ablenken, während die o-Reihe von OpenAI der Ablenkung widerstand und sich dafür in die Formulierung der Aufgabe verbiss.
Was das für deine Praxis bedeutet
Aus beiden Arbeiten lassen sich drei Faustregeln ableiten.
- Aufgaben mit klarem Rechenweg profitieren. Mathematik, Logik, Code, Datenauswertung und mehrstufige Planung gewinnen durch längeres Denken.
- Aufgaben, die auf Wiedererkennen beruhen, verlieren. Stilgefühl, schnelle Einordnung nach Bauchgefühl und Einschätzungen, bei denen die erste Antwort meist stimmt, werden durch Grübeln schlechter.
- Anfragen mit vielen Nebeninformationen sind riskant. Je mehr irrelevante Details in der Anfrage stehen, desto größer die Gefahr, dass ein Modell mit langer Denkzeit sich daran festhält.
Praktisch heißt das, dass du die Stufe je Anwendungsfall messen solltest. Zwanzig echte Anfragen auf zwei Stufen laufen zu lassen und die Ergebnisse zu vergleichen, kostet eine halbe Stunde und spart im Zweifel dreistellige Beträge im Monat.
Was zeigen die Anbieter von der Denkspur, und was verbergen sie?
Was du im Chatfenster als Denkschritte aufklappen kannst, ist bei drei von vier großen Anbietern eine nachträglich erzeugte Zusammenfassung.
- OpenAI: Die Denk-Token sind über die Schnittstelle grundsätzlich nicht abrufbar. Über den Parameter reasoning.summary lässt sich eine Zusammenfassung anfordern.
- Anthropic: Die Antwort enthält zusammengefasste Denkblöcke. Bei den neueren Modellen ist die Anzeige ab Werk abgeschaltet und muss über den Parameter display eigens angefordert werden.
- Google: Gemini liefert thought summaries. Der eigentliche Denkstand wandert als verschlüsselte thought signature zwischen den Gesprächsrunden hin und her, lesbar ist er nicht.
- DeepSeek: Als einziger Anbieter gibt DeepSeek die Denkspur im Feld reasoning_content ungekürzt heraus.
OpenAI hat die Entscheidung gegen die Rohausgabe bereits 2024 selbst begründet und dabei drei Abwägungen genannt, das Nutzererlebnis, den eigenen Wettbewerbsvorteil und die Möglichkeit, die unbereinigte Denkspur intern zur Überwachung auf Fehlverhalten zu nutzen. Der letzte Punkt ist der interessanteste. Eine Denkspur taugt nur so lange als Frühwarnsystem, wie das Modell nicht darauf trainiert wurde, sie hübsch aussehen zu lassen.
Warum die gezeigte Spur nicht abbildet, was im Modell passiert
Selbst eine vollständige Denkspur wäre kein Protokoll der tatsächlichen Verarbeitung. Anthropics Alignment-Team hat das 2025 gemessen und unter arXiv 2505.05410 veröffentlicht. Die Forschenden schoben den Modellen unauffällig Hinweise auf die richtige Antwort unter und prüften anschließend, ob die Denkspur den Hinweis erwähnt, sofern das Modell ihn benutzt hatte. Claude 3.7 Sonnet tat das im Schnitt in 25 Prozent der Fälle, DeepSeek R1 in 39 Prozent. In der Mehrzahl der Fälle nutzte das Modell den Hinweis und lieferte dazu eine Begründung, in der er nicht vorkam.
Für dich folgt daraus zweierlei. Eine plausibel klingende Denkspur ist kein Beleg dafür, dass die Antwort auf diesem Weg zustande gekommen ist. Wer sie als Nachweis in eine Dokumentation übernimmt, dokumentiert eine Erzählung über die Antwort, keine Herleitung.
Halluzinieren Reasoning-Modelle weniger?
Die ehrliche Antwort lautet, dass sie andere Fehler machen und in einem gut belegten Fall sogar deutlich mehr erfunden haben.
Der Beleg stammt von OpenAI selbst. In der System Card zu o3 und o4-mini vom 16. April 2025 steht die Halluzinationsrate auf der internen Prüfung PersonQA. o3 lag bei 33 Prozent, o4-mini bei 48 Prozent, das ältere o1 bei 16 Prozent. OpenAI erklärt den Anstieg damit, dass o3 insgesamt mehr Behauptungen aufstellt, also mehr zutreffende und mehr falsche zugleich, und schreibt dazu, dass mehr Forschung nötig sei, um den Zusammenhang zu verstehen. Das war der erste Bruch mit dem bis dahin gültigen Muster, dass jede neue Modellgeneration etwas weniger erfindet als die vorige.
Eine Erklärung liefert eine spätere Arbeit von OpenAI-Forschern. „Why Language Models Hallucinate“ von Adam Tauman Kalai und Ofir Nachum, arXiv 2509.04664 vom September 2025, führt Halluzinationen auf die Bewertungsverfahren zurück. Wer nur die Quote richtiger Antworten misst, belohnt Raten und bestraft ein ehrliches „Ich weiß es nicht“, weil eine leere Antwort sicher null Punkte bringt und ein Rateversuch manchmal trifft. Verstärkungslernen mit prüfbaren Belohnungen verschärft genau diesen Anreiz.
In der Praxis heißt das zweierlei. Bei Rechenwegen, Codeprüfung und logischen Ketten sind Reasoning-Modelle zuverlässiger, weil sie ihre eigenen Zwischenschritte gegenprüfen. Bei Faktenfragen über Personen, Daten und Zahlen gibt es keinen solchen Automatismus. Die einzige belastbare Absicherung bleibt die Quellenangabe mit Gegenprüfung, und dafür ist ein Werkzeug mit Websuche wie Perplexity oft der bessere Weg als ein starkes Modell ohne Zugriff auf aktuelle Quellen.
Wofür lohnt sich ein Reasoning-Modell wirklich?
Die Fälle, in denen sich der Aufpreis rechnet, haben eine Gemeinsamkeit. Es gibt einen Lösungsweg, der aus mehreren Schritten besteht, und ein Fehler in Schritt zwei macht Schritt fünf wertlos.
- Mehrstufige Rechnungen und Datenauswertung. Deckungsbeitrag über mehrere Produktlinien, Kalkulationen mit Sonderfällen, Prüfung fremder Tabellen auf Rechenfehler.
- Programmieren mit Nebenbedingungen. Refactoring über mehrere Dateien, Fehlersuche in fremdem Code, Übersetzung zwischen Frameworks. In Werkzeugen wie Cursor und GitHub Copilot lässt sich für solche Umbauten gezielt ein Reasoning-Modell auswählen, während die Autovervollständigung beim schnellen Modell bleibt.
- Prüfen langer Dokumente auf Widersprüche. Vertragsklauseln, die einander ausschließen, Zahlen, die im Anhang anders stehen als im Text.
- Planung mit vielen Bedingungen. Schichtpläne, Reihenfolgen mit Abhängigkeiten, Projektpläne mit knappen Ressourcen.
- Werkzeugketten über mehrere Schritte. Wenn ein Modell mehrere Werkzeuge nacheinander aufruft und nach jedem Ergebnis neu entscheiden muss, zahlt sich die Zwischenüberlegung aus.
Wofür solltest du ausdrücklich kein Reasoning-Modell nehmen?
Die Gegenliste ist kürzer, betrifft aber den weit größeren Teil der Alltagsanfragen.
- Formulieren und Umschreiben. Für Text, der gut klingen soll, bringt Grübeln nichts und schadet dem Ton oft sogar.
- Übersetzen. Ein spezialisiertes Werkzeug wie DeepL ist hier schneller und in der Terminologie verlässlicher.
- Zusammenfassen vorliegender Inhalte. Wer eine Quelle vor sich hat, braucht Verständnis und keine Schlussfolgerung. Für diesen Zweck ist ein Werkzeug wie NotebookLM die naheliegendere Wahl.
- Einfache Einordnung in großer Menge. Zehntausend Support-Anfragen nach Kategorie sortieren gelingt einem kleinen Modell für einen Bruchteil des Preises.
- Alles mit einer Antwortzeit unter zwei Sekunden. Autovervollständigung, Suchvorschläge, Antworten im Telefonat.
Welche Reasoning-Modelle gibt es im August 2026, und was kosten sie?
Alle folgenden Angaben stammen von den Preisseiten der Anbieter und haben den Stand vom 31. August 2026. Preise sind je eine Million Token angegeben, Modellnamen und Beträge ändern sich in diesem Feld schneller als in jedem anderen Softwaremarkt.
OpenAI
Die aktuelle Familie heißt GPT-5.6 und tritt in drei Zuschnitten an. gpt-5.6-sol kostet 4 US-Dollar Eingabe und 20 US-Dollar Ausgabe, gpt-5.6-terra liegt bei 2 und 12 US-Dollar, gpt-5.6-luna bei 0,20 und 1,20 US-Dollar für hohe Stückzahlen. Der Kurzname gpt-5.6 leitet auf sol weiter. Die Vorgängergeneration gpt-5.5 steht bei 5 und 30 US-Dollar, die Pro-Variante bei 30 und 180 US-Dollar. Im Endkundenprodukt ChatGPT steckt dieselbe Technik hinter der Auswahl der Denktiefe.
Anthropic
Claude Opus 5 kostet 5 US-Dollar Eingabe und 25 US-Dollar Ausgabe, Claude Sonnet 5 liegt bei 2 und 10 US-Dollar, Claude Haiku 4.5 bei 1 und 5 US-Dollar. Der Einführungspreis für Sonnet 5 ist inzwischen der reguläre Preis, die zum 1. September 2026 angekündigte Erhöhung auf 3 und 15 US-Dollar findet laut Anbieter nicht statt. Die Spitze der Reihe, Claude Fable 5, kostet 10 und 50 US-Dollar und denkt immer.
Gemini 3.7 Flash kostet bis zum 31. Dezember 2026 vergünstigt 0,75 US-Dollar Eingabe und 3,75 US-Dollar Ausgabe, danach das Doppelte. Gemini 3.5 Flash liegt bei 1,50 und 9 US-Dollar, Gemini 3.5 Flash-Lite bei 0,30 und 2,50 US-Dollar. Die Denk-Token sind im Ausgabepreis enthalten. Als Modell mit der größten Reasoning-Tiefe führt Google weiterhin Gemini 2.5 Pro.
DeepSeek und der offene Weg
Bei DeepSeek ist deepseek-v4-pro das Modell mit der größten Denktiefe, deepseek-v4-flash die schnelle Variante. Beide beherrschen Betrieb mit und ohne Denkphase. Die Preise schwanken nach Tageszeit. Beim Pro-Modell liegen sie zwischen 0,66 und 1,32 US-Dollar für Eingabe ohne Cache-Treffer und zwischen 1,98 und 3,96 US-Dollar für Ausgabe, beim Flash-Modell zwischen 0,22 und 0,44 sowie 0,66 und 1,32 US-Dollar. DeepSeek hatte die Gewichte von R1 seinerzeit veröffentlicht und damit den Betrieb auf eigener Hardware möglich gemacht, was für Behörden und Unternehmen mit strengen Auflagen bis heute das entscheidende Argument ist. Aus Europa spielt Mistral in dieser Liga mit, mit deutlich kleinerem Modellangebot. Eine Übersicht über die weiteren Werkzeuge dieses Marktes findest du in unserem Überblick zu KI-Tools.
Welches Modell braucht welche Aufgabe?
Die Entscheidung lässt sich auf drei Fragen zusammenziehen. Gibt es einen mehrstufigen Lösungsweg, hängt Geld oder Haftung am Ergebnis, und wie lange darf es dauern.
- Alltagsfragen, Formulieren, kurze Auskünfte: ein schnelles Modell ohne Denkphase, etwa gpt-5.6-luna, Gemini Flash-Lite oder Claude Haiku. Denktiefe auf der untersten Stufe oder ganz aus.
- Recherche mit Quellen: mittlere Denktiefe plus Websuche. Die Sorgfalt bringt hier weniger als der Zugriff auf aktuelle Quellen.
- Code, Datenanalyse, Kalkulation: ein Reasoning-Modell der mittleren Klasse, gpt-5.6-terra oder Claude Sonnet 5, auf mittlerer bis hoher Stufe.
- Verträge, Gutachten, mehrstufige Planung mit Haftung: die Spitzenmodelle auf hoher Stufe, gpt-5.6-sol, Claude Opus 5 oder Gemini 2.5 Pro. Hier zahlt sich der Aufpreis aus.
- Massenverarbeitung mit zehntausenden Anfragen: das günstigste Modell, das die Aufgabe besteht, plus Stapelverarbeitung. Die großen Anbieter geben darauf rund die Hälfte Rabatt.
- Sensible Daten ohne Übermittlung nach außen: ein offenes Modell auf eigener Hardware, mit deutlich geringerer Leistung als bezahlbarer Preis.
Was gilt in Deutschland und der EU beim Einsatz von Reasoning-Modellen?
Seit dem 2. August 2026 gelten nach Artikel 113 die übrigen Bestimmungen der KI-Verordnung der EU, darunter die Transparenzpflichten aus Artikel 50. Chatbots müssen sich als KI zu erkennen geben, KI-erzeugte Inhalte müssen maschinenlesbar gekennzeichnet werden, und die Aufsicht über Anbieter von Allzweckmodellen ist mit Durchsetzungsbefugnissen ausgestattet. Nach mehreren juristischen Auswertungen aus dem Sommer 2026 verschiebt der sogenannte Digital Omnibus die Pflichten für Hochrisiko-Systeme nach hinten, während Transparenzpflichten und die Regeln für Allzweckmodelle unverändert weitergelten. Für die Einordnung des eigenen Falls führt an anwaltlicher Beratung kein Weg vorbei.
Wohin die Denk-Token fließen
Für den Datenschutz ist die Denkphase kein Sonderfall. Was das Modell intern durchspielt, beruht auf demselben Text, den du in die Anfrage geschrieben hast. Stehen darin personenbezogene Daten, gilt dasselbe wie sonst auch, es braucht einen Vertrag zur Auftragsverarbeitung nach Artikel 28 DSGVO und Klarheit über den Verarbeitungsort.
Beim Serverstandort ist die Lage im August 2026 unbefriedigend. Anthropic lässt über die eigene Schnittstelle die Wahl zwischen globaler Verarbeitung und einer Festlegung auf die USA, letztere mit einem Aufschlag von zehn Prozent auf alle Token-Preise. Eine EU-Option gibt es dort nicht. Wer europäische Regionen braucht, kommt bei Claude über Amazon Bedrock oder Google Cloud, bei Gemini über die europäischen Regionen von Google Cloud und bei OpenAI über die europäische Datenresidenz, die sich nur für neu angelegte Projekte einrichten lässt und für neuere Modelle ebenfalls zehn Prozent Aufschlag kostet. Der Umweg kostet Geld und Verwaltungsaufwand, er ist im Zweifel der einzige Weg, auf dem sich der Einsatz gegenüber einer Aufsichtsbehörde vertreten lässt.
Woran erkennst du, ob dein Werkzeug gerade ein Reasoning-Modell nutzt?
In der Oberfläche gibt es fünf verlässliche Anzeichen.
- Eine Anzeige wie „Denkt nach“, „Thinking“ oder „Reasoning“ vor der Antwort.
- Ein aufklappbarer Bereich mit Zwischenschritten über der eigentlichen Antwort.
- Eine Wartezeit von mehr als fünf Sekunden bis zum ersten sichtbaren Zeichen.
- Ein Modellname mit einem Zusatz wie Thinking, Reasoning oder Pro.
- Eine Einstellung für die Denktiefe, oft als Schieberegler oder als Auswahl zwischen schnell und gründlich.
Über die Schnittstelle ist es eindeutiger. Sobald im usage-Objekt der Antwort ein Feld mit reasoning_tokens oder thinking_tokens auftaucht und einen Wert über null trägt, hat das Modell gedacht, und du hast dafür bezahlt. Genau dieses Feld gehört in jede Kostenauswertung, weil es den Unterschied zwischen der erwarteten und der tatsächlichen Rechnung erklärt.
Die nüchterne Einordnung dieser Modellklasse lautet damit, dass sie ein Werkzeug für eine bestimmte Sorte Aufgaben ist. Für alles, was einen prüfbaren Lösungsweg hat, sind Reasoning-Modelle der größte Fortschritt seit dem ersten brauchbaren Chatbot. Für alles andere zahlst du zwischen dem Fünf- und dem Zwanzigfachen für ein Ergebnis, das im besten Fall gleich gut ist. Die Kunst liegt darin, den Unterschied vor der Anfrage zu erkennen.