Looped Transformers

Expertenniveau

Wie rekurrente Tiefe den Hidden State aktualisiert, Modellgewichte wiederverwendet und das Verhältnis von Speicher, Compute, Geschwindigkeit und Monitorbarkeit verändert.

Zuletzt aktualisiert: 7. Sept. 2026

Mehr Rechenschritte vor dem nächsten Token

Ein normaler autoregressiver Transformer durchläuft für jedes neue Token seinen festen Schichtenstapel. Ein Modell mit rekurrenter Tiefe kann denselben Kern mehrfach anwenden, bevor es ein Token ausgibt. Diese Rekurrenz muss trainiert werden; eine Schleife um ein beliebiges fertiges Modell reicht nicht.

Vergleichsziel: ungefähr gleiche Aufgabenqualität

Ein kleines Modell zweimal. Ein großes einmal.

Der bewegte Punkt ist eine Token-Repräsentation. Zwei Schleifen und sechs unterschiedliche Schichten dienen der Erklärung; Animationszeit und Blockgröße sind keine Benchmarkwerte.

Kleineres Loop-Modell

2 Durchläufe · dieselben Gewichte θ

Eingabe
Gemeinsamer Kernθ1θ2
Nächstes Token
Hidden Stateh0

Kern-Durchläufe abgeschlossen: 0 / 2

Größeres Standardmodell

1 Durchlauf · eigene Gewichte je Schicht

Eingabe
θ1θ2θ3θ4θ5θ6
Nächstes Token
Hidden Statez0

Stapel-Durchläufe abgeschlossen: 0 / 1

Token-Repräsentation
Pause

Was verändert sich bei ähnlicher Qualität?

Gegenüber dem größeren Modell mit direkter Antwort, bei ähnlicher Aufgabenqualität. Das Ergebnis hängt von Modell, Aufgabe und Hardware ab.

ModellspeicherGB Modellgewichte ↓

Weniger möglich

Ein kleinerer gemeinsamer Kern kann die Zielqualität durch Wiederholung erreichen. Voraussetzung ist ein Vergleich bei gleicher Zahlenpräzision.

GeschwindigkeitSekunden pro vollständiger Antwort ↓

Kein fester Vorteil

Ein kleinerer Kern kann pro Durchlauf schneller sein; serielle Schleifen kosten Zeit. Gemessen wird die Zeit bis zur fertigen Antwort.

ComputeTFLOP pro vollständiger Antwort ↓

Kann ähnlich oder höher sein

Weniger gespeicherte Parameter bedeuten nicht weniger Operationen. Jede Kernwiederholung und Attention-Berechnung zählt mit.

SpeicherbandbreiteGB HBM-Transfer pro Antwort ↓

Weniger Gewichte ≠ weniger Transfers

Geteilte Gewichte sparen Kapazität, können aber pro Schleife erneut aus dem GPU-Speicher gelesen werden. Wiederverwendung im schnellen Cache ist nicht garantiert.

InterpretabilityMonitor-Erkennungsrate bei fixer Fehlalarmrate ↑

Beide intern schwer lesbar

Direkte Antworten liefern in beiden Modellen kaum Textzwischenschritte. Eine allgemeine Rangfolge der Interpretierbarkeit gibt es nicht.

Latente Updates oder eine wachsende Chain of Thought

Derselbe schematische Ablauf zeigt unten den Unterschied: Rekurrente Tiefe aktualisiert einen begrenzten Zustand vor der Tokenausgabe. Explizite CoT erzeugt zusätzliche Tokens, jeweils mit einem weiteren Modelldurchlauf, und hält sie im Kontext fest.

Loop: Arbeitsbereich aktualisieren

Hidden Stateh0
h0 →h1 →h2

Ergebnis folgt nach den latenten Durchläufen

Bis dahin: interne Zustandsupdates ohne ausgeschriebene Zwischenschritte.

Gleiche Form, neue Werte. Keine neue Textposition für jede interne Schleife.

CoT: Textzwischenschritte anhängen

Hidden States0
Zwischentext erscheint während der Generierung.

Jede Kachel steht für eine Phrase aus mehreren Tokens. Der Text bleibt im Kontext; auch die Hidden States verändern sich bei jedem Durchlauf.

Beispielrechnung: (17 × 6) + 8. Die latenten Farben sind keine ausgelesenen Rechenschritte.

Wiederholte Updates können Informationen im latenten Zustand umformen und vermischen, ohne lesbaren Zwischentext zu hinterlassen. Ein Textmonitor sieht diese Updates deshalb nicht. Explizite CoT liefert eine zusätzliche Spur, aber keine vollständige oder garantiert getreue Erklärung. Aktivierungsanalysen müssen Schicht und Schleifenposition berücksichtigen.

Was passiert mit dem Hidden State?

Ein trainierter rekurrenter Kern transformiert seinen aktuellen Hidden State und führt das Ergebnis durch dieselben Gewichte zurück. In diesem Beispiel läuft er zweimal vor der Ausgabe. Ein Standard-Transformer durchläuft dagegen seine unterschiedlichen Schichten einmal pro neuem Token.

hᵣ₊₁ = Fθ(hᵣ, Eingabe)

Der Zustand ist ein Tensor an Tokenpositionen, kein einzelner gespeicherter Satz. Mehr Schleifen vergrößern weder automatisch seine Kapazität noch verbessern sie zwingend die Antwort. Eingabeanbindung, Caches und Abbruchregeln hängen von der Architektur ab.

Scaling up Test-Time Compute with Latent Reasoning

Speicher und Compute setzen verschiedene Grenzen

Rekurrenz erlaubt mehr Rechenarbeit bei der Inferenz, ohne für jeden Tiefenschritt weitere Gewichte zu speichern. Wenn ausgeschriebene Zwischenschritte entfallen, wächst auch die Sequenz weniger. Parameterspeicher und ausgeführte Tiefe lassen sich so getrennt skalieren; die zusätzliche Arbeit kostet weiterhin Ressourcen.

01

Gewichtsspeicher

Passen die Parameter in den Gerätespeicher? Die Wiederverwendung eines Kerns kann Speicher gegenüber einem größeren Modell mit ähnlicher Qualität sparen.

02

Bandbreite und Rechenleistung

Wie viele Operationen laufen pro bewegtem Byte? Geteilte Gewichte garantieren keinen Wechsel zu einem Compute-Engpass. Batchgröße, Kernel, Caching und Hardware bestimmen die Grenze.

03

Kapazität des Hidden States

Ein gleich großer latenter Arbeitsbereich hat eine begrenzte Darstellungskapazität. Weitere Schleifen schaffen Rechenschritte, nicht automatisch mehr Arbeitsspeicher. Eine gespeicherte Zustandshistorie kostet ihrerseits Speicher.

Schwerer zu überwachen heißt nicht uninterpretierbar

Bei Zugriff auf das Modellinnere lassen sich latente Zustände weiterhin mit Aktivierungsproben und kausalen Eingriffen untersuchen. Huginn-Studien zeigen vom Ausleseverfahren abhängige Ergebnisse; LOTUS zeigt, dass gezieltes Training latente Schritte lesbarer machen kann. Wiederholte Transformation macht die Analyse anspruchsvoller, nicht grundsätzlich unmöglich.

Durch Astra im Rampenlicht

Astra-Berichte rückten Looped Transformers ins Rampenlicht. The Information

Die Astra System Card berichtet geringere CoT-Monitorbarkeit, dokumentiert aber keine Loop-Transformer-Architektur und belegt Rekurrenz nicht als Ursache. Diese Grafik erklärt das allgemeine Forschungsprinzip.

GPT-6 Astra System Card

Quellen und weiterführende Literatur

Weiterlernen