Context Rot

Fortgeschritten

Wie Länge, Position und Ablenkungen die Nutzung von Kontext beeinflussen können.

Zuletzt aktualisiert: 13. Sept. 2026

Was mit Context Rot gemeint ist

Ein großes Kontextfenster sagt, wie viel Eingabe ein Modell annehmen kann. Es garantiert nicht, dass jedes Detail zuverlässig genutzt wird. Je nach Modell und Aufgabe können zusätzliche Dokumente helfen, ablenken oder den Zugriff auf relevante Informationen erschweren. Das ist ein empirisches Verhalten und keine Regel, nach der Qualität mit jedem Token sinken muss.

Lost in the Middle: ein konkretes Experiment

Liu et al. (2023, revidiert 2024) prüften Fragen aus NaturalQuestions-Open. In der Multi-Dokument-Aufgabe enthielt ein Wikipedia-Text die Antwort, weitere Texte dienten als Ablenkung. Die Autoren variierten die Position der Antwortquelle und nutzten Greedy Decoding. Gemessen wurde, ob eine akzeptierte Antwort im Modelloutput vorkam.

Mehrere damals geprüfte Modelle schnitten bei Antwortquellen am Anfang oder Ende besser ab als in der Mitte. Die Kurven messen Aufgabenerfolg, keine Attentiongewichte. Andere Aufgaben und Modelle zeigten andere Verläufe.

Originalwerte aus Tabelle 1: Kontrollbedingungen, keine Positionskurve
ModellOhne DokumentNur Antwortdokument
LongChat-13B (16K)35%83.4%
MPT-30B-Instruct31.5%81.9%
GPT-3.5-Turbo (0613)56.1%88.3%
Claude-1.348.3%76.1%

Historische Messwerte für diese Aufgabe und Modellversionen. Daraus folgt keine Erfolgsquote für heutige Modelle oder eigene Dokumente.

Liu et al., §2, Tabelle 1, Abbildung 5

Länge und Ablenkung getrennt testen

Chromas Context-Rot-Untersuchung (2025) verglich 18 Modelle und variierte unter anderem Eingabelänge und Distraktoren. Die Ergebnisse hängen von Modell und Versuchsaufbau ab. Eine synthetische Suchaufgabe bildet nicht automatisch den Umgang mit widersprüchlichen Quellen oder langen Gesprächen ab.

Chroma: Context Rot

Rechenaufwand ist keine Erfolgsquote

Volle Score-Matrix pro Head
1.000.000
n²
Kausal erlaubte Einträge inklusive Diagonale
500.500
n(n+1)/2

Das sind Zählungen für dichte Self-Attention über eine ganze Sequenz, keine gemessenen Laufzeiten. FlashAttention muss die volle Matrix nicht im Hauptspeicher ablegen; ein Decode-Schritt mit KV-Cache hat andere Kosten. Gelernte Attention ist keine Gleichverteilung: Ein Token kann auch in langem Kontext ein hohes Gewicht erhalten.

So prüfst du deinen eigenen Workflow

  1. Lege Fragen, Referenzantworten und relevante Quellen fest. Friere Modellversion, Prompt und Decoding-Einstellungen ein.
  2. Vergleiche nur die Antwortquelle, dieselbe Quelle plus Distraktoren und unterschiedliche Positionen bei gleicher Gesamtlänge.
  3. Miss Antwortkorrektheit und Quellenbelege getrennt. Wiederhole stochastische Läufe und dokumentiere Streuung, Kosten und Latenz.
  4. Teste Retrieval, strukturierte Notizen oder Compaction gegen dieselben Fälle. Prüfe auch, ob dabei wichtige Einschränkungen verloren gehen.