Die veröffentlichte Beobachtung
Arditi und Kollegen untersuchten 13 offene Chatmodelle mit bis zu 72B Parametern. In ihren Experimenten vermittelte eine dominante Richtung in Residual-Stream-Aktivierungen einen großen Teil der getesteten Weigerungen. Eingriffe in diese Richtung veränderten die Weigerungsrate. Das ist ein empirischer Befund für die untersuchten Modelle und Prompts, kein gemeinsamer universeller Schalter aller LLMs.
Eine Richtung ist kein Neuron und kein festes Layer
Die Richtung ist ein Vektor in einem Aktivierungsraum. Ort, Bestimmung und Wirkung hängen von Modell und Versuchsaufbau ab. Es gibt kein universelles Layer 16, in dem jedes Modell über eine Weigerung entscheidet. Eine zweidimensionale Zeichnung kann eine Projektion veranschaulichen, aber nicht den vollständigen gelernten Mechanismus zeigen.
Was sich verändert und was offenbleibt
Das Entfernen einer gemessenen Richtung kann eine Klasse von Weigerungen unterdrücken. Andere Repräsentationen, Trainingseffekte, Systeminstruktionen oder externe Prüfungen können das Verhalten weiterhin beeinflussen. Eine niedrige Weigerungsrate auf einem Testset belegt weder eine Antwort auf jede künftige Anfrage noch unveränderte übrige Fähigkeiten.
Wie sich die Evidenz prüfen lässt
Modell, Prompts, Vergleichsbasis und Eingriff festhalten. Weigerungsraten zusammen mit unabhängigen Fähigkeitstests berichten. Unterschiedliche Prompttypen und Wiederholungen einbeziehen. Neben Gesamtwerten auch Beispiele prüfen. Ursprünglichen und veränderten Checkpoint unter gleichen Inferenzbedingungen vergleichen.
Nachtraining ist ein weiteres Experiment
Fine-Tuning kann Nebenwirkungen eines Eingriffs verändern. DPO ist aber kein universeller Heilungsschritt mit garantierter Wiederherstellung. Nachtraining braucht eigene Daten, ein definiertes Ziel und eine Evaluation. Den ursprünglichen Checkpoint laden zu können ist etwas anderes als nachzuweisen, dass ein verändertes Modell seine ursprünglichen Fähigkeiten behält.
Konzeptuelle Projektion, keine Modellausführung
Ein Aktivierungsvektor hat eine Komponente entlang einer gewählten Richtung und eine dazu senkrechte Komponente. Eine Projektion kann die erste Komponente verändern. Diese Geometrie allein sagt noch nichts darüber, welches Verhalten die Richtung repräsentiert.
h = h∥ + h⊥