Prompt-Caching belohnt stabile Präfixe.
Prompt-Caching ist kein Gedächtnis, kein Retrieval und keine Datenbank. Es ist ein Weg für einen Inferenz-Anbieter, den bereits berechneten KV-Zustand für den Anfang eines Prompts wiederzuverwenden, wenn spätere Anfragen mit denselben Tokens beginnen. Der veränderliche Teil muss weiterhin verarbeitet werden; der Gewinn entsteht dadurch, dass das wiederholte Präfix nicht neu berechnet wird.
Das Präfix ist der Vertrag
Ob etwas cachebar ist, entscheidet sich größtenteils, bevor das Modell die eigentliche Aufgabe sieht. Wenn der lange, teure Teil bei Token 500 beginnt, sich aber Token 20 bei jeder Anfrage ändert, ist das gemeinsame Präfix faktisch zerstört. Entwirf zuerst die Prompt-Struktur und justiere danach die Anbieter-Einstellungen.
Cache-Hit versus Cache-Miss
Bei einem Miss führt der Anbieter das teure Prefill für den gesamten Prompt aus und schreibt gegebenenfalls das wiederverwendbare Präfix. Bei einem Hit liest der Anbieter das gecachte Präfix und berechnet nur das Suffix. Das verändert Eingabekosten und Latenz, aber die Ausgabegenerierung kostet weiterhin, was sie kostet.
Rechenbeispiel mit Tokens: 8.000 stabile Prefix-Tokens und 2.000 neue Tokens. Wähle, ob der Prefix bereits gecacht ist. Die Zahlen zeigen Prefill-Arbeit und gespeicherte beziehungsweise gelesene Prefix-Tokens. Sie messen keine Zeit und versprechen keinen Geschwindigkeitsfaktor.
Probiere die Präfix-Regel aus
Der schnellste Weg, Prompt-Caching zu verstehen, ist, den Anfang eines Prompts zu bearbeiten. Winzige Änderungen ganz oben können den Cache-Hit zerstören; Änderungen nach dem stabilen Präfix erhalten ihn meist.
Bearbeite den Prompt unten und beobachte, wie Änderungen das Caching beeinflussen. Cache-Matching funktioniert Zeichen für Zeichen von Anfang an — jede Änderung invalidiert alles danach.
Anbieter verhalten sich unterschiedlich
Baue deine Architektur nicht um eine einzelne Marketing-Zahl herum. Anbieter unterscheiden sich darin, wie Caches erstellt werden, wie lange sie leben, welche Eingaben zählen und wie die Nutzung gemeldet wird. Die übertragbare Fähigkeit ist Prompt-Disziplin: stabiles Präfix zuerst, volatiles Suffix zuletzt, jedes Deployment messen.
Anthropic (Claude)
Cache-Verhalten, minimale Prefixlänge, Write- und Read-Preis sowie Lebensdauer hängen von Claude-Modell und Cache-Modus ab. Prüfe cache_creation_input_tokens und cache_read_input_tokens. Ein kalter Write und ein warmer Read kosten unterschiedlich viel.
QuellenOpenAI (GPT-4o)
Cache-Modi und Preise hängen vom Modell ab. GPT-5.6 und neuer unterstützen implizite und explizite Breakpoints mit getrennten Write- und Read-Kosten. Frühere Modelle nutzen implizites Caching. Prüfe Mindestlänge, Aufbewahrung und gecachte Tokens des konkreten Modells.
QuellenGoogle (Gemini)
Gemini bietet implizites Caching für geeignete Modelle und explizite Cached-Content-Ressourcen in unterstützten APIs. Mindestlänge, TTL, Speicherkosten und Rabatte hängen von Modell und Modus ab.
QuellenKostenmodell
Writes und Reads können unterschiedliche Preise haben. Die Ersparnis hängt von Wiederverwendung vor Ablauf ab. Der Rechner zeigt diese Gruppierung ausdrücklich. Ersetze seinen hypothetischen Tarif durch die Preise deines Modells.
Hypothetischer Tarif, kein Anbieterangebot. Eine Gruppe verwendet einen Prefix vor dem Ablauf erneut; jede neue Gruppe beginnt mit einem Write. TTL-Ablauf, Routing-Misses oder Prefix-Änderungen lassen sich durch weniger Anfragen pro Gruppe abbilden. Output-Kosten sind auf beiden Seiten ausgeschlossen.
Ersparnis: $1.8840
Implementierungs-Checkliste
Statischen Inhalt zuerst
Cache-Matching funktioniert auf Präfixen. Platziere deinen System-Prompt und Few-Shot-Beispiele vor dynamischem Inhalt, damit das Präfix über Anfragen hinweg stabil bleibt.
Minimale Token-Anzahl beachten
Prüfe die minimale cachebare Prefixlänge für das konkrete Modell. Ein Prefix kann stabil und trotzdem zu kurz sein.
TTL verstehen
Berücksichtige Lebensdauer, Verlängerung und Routing des Anbieters. Wiederverwendung nach Ablauf kann einen neuen Write erfordern. Miss Misses, statt bei jedem wiederholten Prompt einen Hit anzunehmen.
Cache-Hit-Raten überwachen
Prüfe die Usage-Felder in API-Antworten (cache_creation_input_tokens vs cache_read_input_tokens), um zu verifizieren, dass Caching funktioniert. Niedrige Hit-Raten bedeuten, dass sich dein Präfix zu oft ändert.