Chat Compaction

Fortgeschritten

Wie man lange Agent-Chats verdichtet, ohne die Fähigkeit zur Wiederaufnahme, zum Retrieval und zur Rekonstruktion exakter Details zu verlieren.

Zuletzt aktualisiert: 21. Apr. 2026

Was ist Chat Compaction?

Chat Compaction ist die gezielte Verdichtung langer Agent-Gespräche in kleinere, strukturierte Repräsentationen. Es geht nicht nur darum, mehr Text in ein Kontextfenster zu pressen. Das eigentliche Ziel ist, alte Arbeit wiederauffindbar zu halten, damit ein Agent später an derselben Aufgabe weiterarbeiten kann, ohne jeden Roh-Turn erneut lesen zu müssen.

Compaction ist Navigation, nicht Wahrheit.

Warum Agenten das brauchen

Aktive Sessions

Lang laufende Agenten sammeln User-Turns, Tool-Calls, Ergebnisse, Retries und Zwischenstände an. Wenn nichts kompakt wird, läuft das Kontextfenster voll und der Agent verliert entweder nützlichen frischen Zustand oder zahlt immer mehr, um alles mitzuschleppen.

Inaktive Sessions

Alte Sessions fallen oft komplett aus dem heißen Cache. Compaction erzeugt eine wiederaufnehmbare Form kalter Historie, sodass ein Agent mit Summary plus gezieltem Recall neu ansetzen kann, statt den ganzen Thread zu rehydrieren.

Die vier Kernbausteine

Verdichten

Ältere Turns werden in Summaries überführt, sobald sie nicht mehr im heißen Kontextfenster leben müssen.

Strukturieren

Kompaktierte Historie wird in verlinkten Blöcken oder Hierarchien gespeichert, damit alte Arbeit navigierbar bleibt statt zu einem Blob zu werden.

Wiederfinden

Nur die relevanten kompaktierten Fragmente werden zurückgeholt, wenn die aktuelle Aufgabe von früheren Entscheidungen oder Fakten abhängt.

Expandieren

Exakte Formulierungen, Werte und Kausalketten werden bei Bedarf zurückgeholt, statt sie aus Summaries zu erraten.

Das Kernmuster

fresh_context = recent_messages + tool_results
compacted_history = summaries + recall_index

if context_too_large:
  compacted_history.add(compact(older_turns))

matches = retrieve(compacted_history, current_task)

if exact_details_needed:
  restored = expand(matches)
  context = fresh_context + restored
else:
  context = fresh_context + matches
🗜️

Interaktiver Compaction Explorer

Vergleiche überladene Live-Sessions mit alten inaktiven Sessions, die später wieder aufgenommen werden müssen.

Der Originalverlauf bleibt im Gesprächsarchiv. Die Zusammenfassung hilft, Belege wiederzufinden, und ersetzt keine exakten Originalaussagen.

Inhalt der nächsten Modellanfrage

  • Entscheidung vom 10. September: erst veröffentlichen, wenn der Integrationstest besteht.
  • Beleg: Der Integrationstest ist im Lauf test-42 fehlgeschlagen.
  • Aktuelle Aufgabe: eine Release-Notiz entwerfen.
Originales Gesprächsarchiv (bleibt durchgehend erhalten)
  1. Entscheidung vom 10. September: erst veröffentlichen, wenn der Integrationstest besteht.
  2. Beleg: Der Integrationstest ist im Lauf test-42 fehlgeschlagen.
  3. Aktuelle Aufgabe: eine Release-Notiz entwerfen.

Für die exakte Kennung des Testlaufs den Originalbeleg abrufen, statt ihn aus einer Zusammenfassung zu rekonstruieren.

Was naive Compaction kaputt macht

Naive Truncation wirft alten Kontext komplett weg. Naive Summaries behalten nur eine plausible Paraphrase. Beide Ansätze scheitern auf dieselbe Weise: Alte Arbeit wird billiger mitzuschleppen, aber schwerer zu vertrauen.

  • Wichtige Entscheidungen verlieren ihre Begründung.
  • Offene Loops verschwinden, sodass der Agent vergisst, was noch ungelöst war.
  • Exakte Commands, Pfade, Timestamps und Werte verschwimmen in Summary-Sprache.
  • Alte Summaries können neuerer Evidenz widersprechen, wenn man sie wie Ground Truth behandelt.

Gute Compaction in der Praxis

Designregeln

  • Halte einen frischen Tail für aktive Arbeit.
  • Verdichte alte Turns in strukturierte, abfragbare Einheiten.
  • Nutze Retrieval für Relevanz, Expansion für Präzision.
  • Lass neue Evidenz alte Summaries übersteuern.

Saubere Trennung der Ebenen

  • Frischer Kontext ist für unmittelbares Reasoning da.
  • Kompaktierte Historie ist für Navigation und Wiederaufnahme da.
  • Expansion ist für exakte Fakten und Kausalität da.
  • Langzeit-Memory speichert destillierte Fakten, nicht jeden Turn.

Wichtige Erkenntnisse

  • 1Compaction spart nicht nur Tokens, sondern erhält Wiederauffindbarkeit.
  • 2Gute Compaction hilft sowohl bei überladenen Live-Sessions als auch bei alten Sessions, die nicht mehr gecached sind.
  • 3Summaries sind Recall-Hilfen, keine Beweise. Exakte Claims sollten aus gezielter Expansion kommen.
  • 4Die besten Systeme trennen frischen Kontext, kompaktierte Historie, Retrieval und Langzeit-Memory sauber voneinander.