lokale LLMs

Zweigeteilte Tafel auf sehr dunklem Grund. Links der erste Befund: 73 Prozent gegen 99, ein Einbruch um 26 Punkte, im Logikrätsel 0 von 45 Punkten in zwei von vier Prompt-Varianten, die übrigen drei Aufgaben bei 100 Prozent. Rechts das korrigierte Ergebnis: die abliterierte Fassung erreicht 336 von 336 Punkten, die Basis 334 von 336 (99,4 Prozent); von 1320 neu bewerteten Zellen änderten sich genau sechs, fünfmal steht ERGEBNES und einmal ERGEBNET statt ERGEBNIS, alle sechs enthalten die richtige Lösung. Ein Streifen darunter zeigt die Formtreue mit 42 von 48 Zellen, aufgeschlüsselt in nackt 9 von 12, schritte 9 von 12, rolle 12 von 12, beispiel 12 von 12. Unten Marken: 48 Zellen gegen 48 Zellen, zweite Maschine Ziffer für Ziffer, Median 535 auf 564 Token, Median 5,6 auf 5,8 Sekunden.

Was Abliteration kostet — und was nicht

Ein abliteriertes Modell fiel im Logikrätsel auf exakt null von 45 Punkten. „Abliteration zerstört das Denken" wäre eine gute Überschrift gewesen. Sie war nur nicht wahr…

Gruppierte Balken vergleichen die Punkte je Aufgabe vor und nach der Stopp-Angabe, in Prozent: rechnung faellt von 88 auf 75, extrakt steigt von 0 auf 100, raetsel von 30 auf 39. Eine Seitenkarte nennt die Summen ueber alle 48 Zellen: 117 von 336 Punkten gegen 215 von 336, Zellen am Token-Limit 48 von 48 gegen 3 von 48, Formtreue 31 gegen 83 Prozent, 192 000 gegen 45 775 erzeugte Token, 1594 gegen 326 Sekunden Rechenzeit, die Aufgabe plan unveraendert bei 88 Prozent.

Das Modell, das nicht aufhören konnte

Ein Modell steht mit 35 Prozent am Tabellenende. Die Zahl ist echt gemessen — und trotzdem falsch, in beide Richtungen zugleich. Was passiert, wenn eine Ollama-Verpackung…