KI & Werkzeuge

Denk Schritt für Schritt? Auf einer von vier Aufgaben schadet es

Gruppiertes Balkendiagramm der vollständig gelösten Zellen von 33 je Aufgabe, nackter Prompt gegen die Anweisung Schritt für Schritt. rechnung steigt von 19 auf 24, extrakt von 15 auf 25, plan fällt dagegen von 32 auf 25. Eine Seitenkarte nennt den Preis der Variante schritte: Median 10,2 statt 6,9 Sekunden (+49 Prozent), 769 statt 707 Token (+9 Prozent), 11 abgeschnittene Zellen gegenüber 3 bei nackt, Formtreue 115 von 132.
Dieselbe Anweisung bringt bei extrakt zehn Zellen und kostet bei plan sieben.

Drei Ratschläge stehen in jedem Prompt-Leitfaden: sag dem Modell, es soll Schritt für Schritt denken. Gib ihm eine Rolle. Zeig ihm ein Beispiel. Alle drei klingen vernünftig, alle drei kosten Tipparbeit, und keiner davon war auf meiner Hardware je geprüft. Also habe ich sie geprüft — vier Aufgaben, vier Prompt-Varianten, elf Modelle, 528 Messzellen auf einer einzigen Maschine.

Das Ergebnis in einem Satz: die Tricks helfen deutlich — außer dort, wo das Modell die Aufgabe ohnehin löst. Dann schaden sie.

Was gemessen wurde

Vier Aufgaben mit eindeutig richtiger Antwort, nicht mit gut aussehender: rechnung (mehrstufige Preisrechnung), plan (kleines Zuordnungsproblem), extrakt (sechs Felder als JSON, inklusive Datumsrechnung über die Monatsgrenze) und raetsel (fünf Personen auf Platz, Projekt und Getränk, elf Bedingungen). Die Eindeutigkeit der Rätsellösung habe ich per vollständiger Enumeration über 1.728.000 Belegungen bestätigt; jede der elf Bedingungen ist notwendig.

Dazu vier Varianten desselben Prompts, identischer Kern, identischer Formatblock: nackt (nur die Aufgabe), schritte („denk Schritt für Schritt“), rolle („du bist ein erfahrener …“) und beispiel (ein gelöstes Beispiel voran). Elf Modelle, je drei Durchgänge. Macht 528 Anfragen, null Fehler.

Warum der Formatblock eine abschließende ERGEBNIS:-Zeile verlangt statt Erklärtext zu verbieten: verböte ich Erklärungen, wäre schritte von vornherein kaputt. So darf jede Variante beliebig viel davor schreiben und wird gleich bewertet.

Die Regel stand vor den Daten fest

Damit ich mir hinterher nicht die passende Auswertung aussuche: „Der Trick hilft“ heißt, dass die Zahl vollständig gelöster Zellen gegenüber nackt um mindestens 3 von 33 steigt — auf derselben Aufgabe. Darunter ist es das Umkippen einzelner Modelle und wird als „kein Effekt“ berichtet. Bewertet wird je Aufgabe, nie im Gesamtmittel: die vier Aufgaben haben verschiedene Deckeneffekte, ein Mittelwert würde sie verwischen. Eine halb richtige Rechnung ist eine falsche Rechnung.

Das Ergebnis je Aufgabe

Vollständig gelöste Zellen, jeweils von 33:

Aufgabenacktschritterollebeispiel
rechnung19242421
plan32252727
extrakt15252123
raetsel11141414

Bei rechnung reißen schritte und rolle die Schwelle mit je +5, beispiel bleibt mit +2 darunter. Bei extrakt reißen alle drei sie deutlich — schritte mit +10 am stärksten. Bei raetsel schaffen alle drei exakt +3 und damit die Schwelle auf den Punkt; dort ist das Niveau aber so niedrig, dass ich das nicht überinterpretiere.

Die Stelle, an der es kippt

Und dann ist da plan. Nackt lösen die Modelle 32 von 33 Zellen — praktisch alles. Mit „denk Schritt für Schritt“ fallen sie auf 25. Mit Rolle auf 27. Mit Beispiel auf 27.

Alle drei Ratschläge machen die Aufgabe kaputt, die ohne sie am besten lief. Das ist der interessanteste Befund der Messreihe, und er ist unbequem, weil er die Ratschläge nicht widerlegt, sondern ihre Reichweite begrenzt: Ein Trick, der einem Modell beim Nachdenken hilft, stört es, wenn es nicht nachdenken muss. plan ist klein genug, dass die Modelle es direkt sehen. Wer sie zwingt, den Weg auszuformulieren, gibt ihnen sieben zusätzliche Gelegenheiten, sich zu vertun.

Ich habe die abweichenden Zellen einzeln gelesen, statt der Zahl zu glauben. Die Verluste sind echte Fehler in der Zuordnung, keine verrutschten Antwortmarker.

Der Preis

Ein Trick, der nichts bringt und nichts kostet, ist eine andere Nachricht als einer, der nichts bringt und die Zeit um die Hälfte streckt. Mediane über alle Zellen:

VarianteTokensvs. nacktSekundenvs. nackt
nackt707—6,9—
schritte769+9 %10,2+49 %
rolle711±0 %8,7+25 %
beispiel662−6 %7,3+6 %

Die auffälligste Zeile ist schritte: neun Prozent mehr Token, aber neunundvierzig Prozent mehr Wanduhrzeit. Die Differenz steckt nicht in der Länge der Antwort, sondern darin, dass längere Ausgaben häufiger ins Token-Limit laufen und der Lauf dann bis zum Anschlag weiterrechnet — schritte hat elf abgeschnittene Zellen gegenüber drei bei nackt.

beispiel ist der stille Gewinner der Kostentabelle: sechs Prozent weniger Token als nackt, nur sechs Prozent mehr Zeit — und bei extrakt trotzdem +8. Ein gelöstes Beispiel voranzustellen ist der einzige der drei Tricks, der in dieser Messung nennenswert hilft, ohne nennenswert zu kosten.

Formtreue

Getrennt gezählt, weil es ein Formfehler ist und kein Denkfehler: wie oft stand das Ergebnis wirklich in der letzten Zeile, wie gefordert? beispiel 123 von 132, nackt 120, rolle 117, schritte 115. Wer das Modell zum Ausformulieren bringt, bekommt häufiger Text nach dem Ergebnis.

Hierhin gehört auch ein Fehler von mir. Meine erste Prüfroutine erkannte ### ERGEBNIS: … nicht und hätte korrekt antwortende Modelle mit null Prozent bewertet. Gefunden habe ich das nur, weil ich die Ausgaben gelesen habe statt die Punktzahlen. Später kam derselbe Fall noch zweimal — einmal ein fehlendes Stopp-Token, einmal ein einzelner vertippter Buchstabe im Antwortmarker, sechs Zellen mit vollständig richtiger Lösung als null bewertet. Jede auffällig runde Null ist verdächtig, besonders ein exaktes null von N.

Was das nicht zeigt

  • Vier Aufgaben sind vier Aufgaben. Sie sind kurz, eindeutig prüfbar und decken kein offenes Schreiben ab.
  • Die Varianten liefen innerhalb eines Modells nacheinander; ein Reihenfolgeeffekt ist nicht ausgeschlossen, nur unwahrscheinlich gemacht.
  • Die drei Durchgänge je Zelle sind keine Seed-Variation. Nachgemessen liefern ornith:35b und qwen3.6:27b über alle drei Seeds byteidentische Ausgaben, während qwq:32b bei identischem Seed unterschiedlich antwortet. Die drei Durchgänge fangen Streuung ab, wo es welche gibt — sie prüfen nicht die Wirkung des Seeds.
  • Gemessen wurde mit think=false. Für qwq:32b und deepseek-r1:14b ist inzwischen belegt, dass dieser Schalter nicht steuert, ob gedacht wird — die Einschränkung „mit abgeschaltetem Denkmodus“ gilt also nicht für alle Modelle in dieser Tabelle.
  • laguna-xs-2.1 läuft hier in der reparierten Fassung mit ergänzter Stopp-Angabe. Ohne sie wären alle 48 Zellen ins Token-Limit gelaufen und die Zeile wäre eine Aussage über die Verpackung gewesen, nicht über das Modell.

Die Hardware und die Regeln, denen jede Messung auf dieser Seite folgt, stehen auf Wie ich messe.

Was ich davon mitnehme

Für Aufgaben, an denen ein Modell sichtbar arbeiten muss — Extraktion mit Zwischenschritten, mehrstufige Rechnung —, ist „denk Schritt für Schritt“ die stärkste der drei Anweisungen und ihre halbe Minute wert. Für Aufgaben, die das Modell direkt sieht, ist sie ein Rückschritt. Und ein gelöstes Beispiel voranzustellen kostet fast nichts und hilft fast überall ein bisschen.

Was ich nicht mehr tun werde: einen Prompt-Trick pauschal einschalten, weil er in einem Leitfaden steht. Auf plan hätte mich das sieben von dreiunddreißig Zellen gekostet.