Mehr Rechenschritte vor dem nächsten Token
Ein normaler autoregressiver Transformer durchläuft für jedes neue Token seinen festen Schichtenstapel. Ein Modell mit rekurrenter Tiefe kann denselben Kern mehrfach anwenden, bevor es ein Token ausgibt. Diese Rekurrenz muss trainiert werden; eine Schleife um ein beliebiges fertiges Modell reicht nicht.
Ein kleines Modell zweimal. Ein großes einmal.
Der bewegte Punkt ist eine Token-Repräsentation. Zwei Schleifen und sechs unterschiedliche Schichten dienen der Erklärung; Animationszeit und Blockgröße sind keine Benchmarkwerte.
Kleineres Loop-Modell
2 Durchläufe · dieselben Gewichte θ
Kern-Durchläufe abgeschlossen: 0 / 2
Größeres Standardmodell
1 Durchlauf · eigene Gewichte je Schicht
Stapel-Durchläufe abgeschlossen: 0 / 1
Was verändert sich bei ähnlicher Qualität?
Gegenüber dem größeren Modell mit direkter Antwort, bei ähnlicher Aufgabenqualität. Das Ergebnis hängt von Modell, Aufgabe und Hardware ab.
- ModellspeicherGB Modellgewichte ↓
Weniger möglich
Ein kleinerer gemeinsamer Kern kann die Zielqualität durch Wiederholung erreichen. Voraussetzung ist ein Vergleich bei gleicher Zahlenpräzision.
- GeschwindigkeitSekunden pro vollständiger Antwort ↓
Kein fester Vorteil
Ein kleinerer Kern kann pro Durchlauf schneller sein; serielle Schleifen kosten Zeit. Gemessen wird die Zeit bis zur fertigen Antwort.
- ComputeTFLOP pro vollständiger Antwort ↓
Kann ähnlich oder höher sein
Weniger gespeicherte Parameter bedeuten nicht weniger Operationen. Jede Kernwiederholung und Attention-Berechnung zählt mit.
- SpeicherbandbreiteGB HBM-Transfer pro Antwort ↓
Weniger Gewichte ≠ weniger Transfers
Geteilte Gewichte sparen Kapazität, können aber pro Schleife erneut aus dem GPU-Speicher gelesen werden. Wiederverwendung im schnellen Cache ist nicht garantiert.
- InterpretabilityMonitor-Erkennungsrate bei fixer Fehlalarmrate ↑
Beide intern schwer lesbar
Direkte Antworten liefern in beiden Modellen kaum Textzwischenschritte. Eine allgemeine Rangfolge der Interpretierbarkeit gibt es nicht.
Latente Updates oder eine wachsende Chain of Thought
Derselbe schematische Ablauf zeigt unten den Unterschied: Rekurrente Tiefe aktualisiert einen begrenzten Zustand vor der Tokenausgabe. Explizite CoT erzeugt zusätzliche Tokens, jeweils mit einem weiteren Modelldurchlauf, und hält sie im Kontext fest.
Loop: Arbeitsbereich aktualisieren
Ergebnis folgt nach den latenten Durchläufen
Bis dahin: interne Zustandsupdates ohne ausgeschriebene Zwischenschritte.
Gleiche Form, neue Werte. Keine neue Textposition für jede interne Schleife.
CoT: Textzwischenschritte anhängen
Jede Kachel steht für eine Phrase aus mehreren Tokens. Der Text bleibt im Kontext; auch die Hidden States verändern sich bei jedem Durchlauf.
Beispielrechnung: (17 × 6) + 8. Die latenten Farben sind keine ausgelesenen Rechenschritte.
Wiederholte Updates können Informationen im latenten Zustand umformen und vermischen, ohne lesbaren Zwischentext zu hinterlassen. Ein Textmonitor sieht diese Updates deshalb nicht. Explizite CoT liefert eine zusätzliche Spur, aber keine vollständige oder garantiert getreue Erklärung. Aktivierungsanalysen müssen Schicht und Schleifenposition berücksichtigen.
Was passiert mit dem Hidden State?
Ein trainierter rekurrenter Kern transformiert seinen aktuellen Hidden State und führt das Ergebnis durch dieselben Gewichte zurück. In diesem Beispiel läuft er zweimal vor der Ausgabe. Ein Standard-Transformer durchläuft dagegen seine unterschiedlichen Schichten einmal pro neuem Token.
Der Zustand ist ein Tensor an Tokenpositionen, kein einzelner gespeicherter Satz. Mehr Schleifen vergrößern weder automatisch seine Kapazität noch verbessern sie zwingend die Antwort. Eingabeanbindung, Caches und Abbruchregeln hängen von der Architektur ab.
Scaling up Test-Time Compute with Latent ReasoningSpeicher und Compute setzen verschiedene Grenzen
Rekurrenz erlaubt mehr Rechenarbeit bei der Inferenz, ohne für jeden Tiefenschritt weitere Gewichte zu speichern. Wenn ausgeschriebene Zwischenschritte entfallen, wächst auch die Sequenz weniger. Parameterspeicher und ausgeführte Tiefe lassen sich so getrennt skalieren; die zusätzliche Arbeit kostet weiterhin Ressourcen.
Gewichtsspeicher
Passen die Parameter in den Gerätespeicher? Die Wiederverwendung eines Kerns kann Speicher gegenüber einem größeren Modell mit ähnlicher Qualität sparen.
Bandbreite und Rechenleistung
Wie viele Operationen laufen pro bewegtem Byte? Geteilte Gewichte garantieren keinen Wechsel zu einem Compute-Engpass. Batchgröße, Kernel, Caching und Hardware bestimmen die Grenze.
Kapazität des Hidden States
Ein gleich großer latenter Arbeitsbereich hat eine begrenzte Darstellungskapazität. Weitere Schleifen schaffen Rechenschritte, nicht automatisch mehr Arbeitsspeicher. Eine gespeicherte Zustandshistorie kostet ihrerseits Speicher.
Schwerer zu überwachen heißt nicht uninterpretierbar
Bei Zugriff auf das Modellinnere lassen sich latente Zustände weiterhin mit Aktivierungsproben und kausalen Eingriffen untersuchen. Huginn-Studien zeigen vom Ausleseverfahren abhängige Ergebnisse; LOTUS zeigt, dass gezieltes Training latente Schritte lesbarer machen kann. Wiederholte Transformation macht die Analyse anspruchsvoller, nicht grundsätzlich unmöglich.
Durch Astra im Rampenlicht
Astra-Berichte rückten Looped Transformers ins Rampenlicht. The Information
Die Astra System Card berichtet geringere CoT-Monitorbarkeit, dokumentiert aber keine Loop-Transformer-Architektur und belegt Rekurrenz nicht als Ursache. Diese Grafik erklärt das allgemeine Forschungsprinzip.
GPT-6 Astra System Card