Blog

Notizen aus der Werkstatt

Infrastruktur, KI, Werkzeuge – und die Entscheidungen dahinter.

Vier Aufgabenkarten — eine mehrstufige Preisrechnung, vier Vorträge auf vier Slots, sechs Felder nach JSON und ein Rätsel mit fünf Plätzen — über einem vollständig gefüllten Balken mit der Beschriftung 48 von 48. Ergebnis-Marken halten fest, dass alle 48 Zellen korrekt waren und das siegreiche Modell neunmal schneller und halb so groß war; ein Feld erklärt, dass ein Modell, das alles löst, nur aussagt, dass es nicht gescheitert ist.

48 von 48 — und warum das ein Problem ist

Bis heute lief jede Messung dieser Serie auf einer Grafikkarte. 24 Gigabyte, und damit war die Grenze klar: was mehr braucht, wurde nicht gemessen. Seit heute…

Zweigeteilte dunkle Fläche. Links unter 'Was ich notiert hatte': 65 von 176 Gruppen identisch, 111 Gruppen weichen ab, das Laufprotokoll meldete nur STREUT, drei Seeds sollten die Streuung abfangen. Rechts unter 'Was in den Daten stand': 0 Gruppen, in denen alle drei Ausgaben verschieden sind, in 111 von 111 Fällen ist die abweichende seed 42, die Seeds 43 und 44 stimmen ausnahmslos überein, abweichend ist stets der erste Lauf. Darunter ein Streifen zu den Prüfungen auf zwei Rechnern: fünf verschiedene Seeds ergeben bei sechs Modellen je fünfmal denselben Text, 108 Zellenpaare auf zwei Rechnern zeigen keinen einzigen Unterschied, Tokenzahlen 503, 508, 508, 508, 508. Marken: temperature 0, Ollama 0.32.5, RTX 3090 auf zwei Rechnern, 528 Zellen, 11 Modelle, byteweiser Vergleich.

Der Seed wirkt nicht. Der erste Lauf schon

Jede Messung dieser Serie läuft mit temperature 0 und drei Seeds. Der Gedanke dahinter war: falls das Modell doch streut, fangen drei Durchgänge es ab. Beim…

Zweigeteilte Tafel auf sehr dunklem Grund. Links der erste Befund: 73 Prozent gegen 99, ein Einbruch um 26 Punkte, im Logikrätsel 0 von 45 Punkten in zwei von vier Prompt-Varianten, die übrigen drei Aufgaben bei 100 Prozent. Rechts das korrigierte Ergebnis: die abliterierte Fassung erreicht 336 von 336 Punkten, die Basis 334 von 336 (99,4 Prozent); von 1320 neu bewerteten Zellen änderten sich genau sechs, fünfmal steht ERGEBNES und einmal ERGEBNET statt ERGEBNIS, alle sechs enthalten die richtige Lösung. Ein Streifen darunter zeigt die Formtreue mit 42 von 48 Zellen, aufgeschlüsselt in nackt 9 von 12, schritte 9 von 12, rolle 12 von 12, beispiel 12 von 12. Unten Marken: 48 Zellen gegen 48 Zellen, zweite Maschine Ziffer für Ziffer, Median 535 auf 564 Token, Median 5,6 auf 5,8 Sekunden.

Was Abliteration kostet — und was nicht

Ein abliteriertes Modell fiel im Logikrätsel auf exakt null von 45 Punkten. „Abliteration zerstört das Denken" wäre eine gute Überschrift gewesen. Sie war nur nicht wahr…