Prompt Caching

Fortgeschritten

KV-Caches über API-Anfragen hinweg wiederverwenden, um Kosten und Latenz bei wiederholten Prompt-Präfixen drastisch zu reduzieren.

Zuletzt aktualisiert: 13. Sept. 2026

Prompt-Caching belohnt stabile Präfixe.

Prompt-Caching ist kein Gedächtnis, kein Retrieval und keine Datenbank. Es ist ein Weg für einen Inferenz-Anbieter, den bereits berechneten KV-Zustand für den Anfang eines Prompts wiederzuverwenden, wenn spätere Anfragen mit denselben Tokens beginnen. Der veränderliche Teil muss weiterhin verarbeitet werden; der Gewinn entsteht dadurch, dass das wiederholte Präfix nicht neu berechnet wird.

Das Präfix ist der Vertrag

Ob etwas cachebar ist, entscheidet sich größtenteils, bevor das Modell die eigentliche Aufgabe sieht. Wenn der lange, teure Teil bei Token 500 beginnt, sich aber Token 20 bei jeder Anfrage ändert, ist das gemeinsame Präfix faktisch zerstört. Entwirf zuerst die Prompt-Struktur und justiere danach die Anbieter-Einstellungen.

Cache-Hit versus Cache-Miss

Bei einem Miss führt der Anbieter das teure Prefill für den gesamten Prompt aus und schreibt gegebenenfalls das wiederverwendbare Präfix. Bei einem Hit liest der Anbieter das gecachte Präfix und berechnet nur das Suffix. Das verändert Eingabekosten und Latenz, aber die Ausgabegenerierung kostet weiterhin, was sie kostet.

Rechenbeispiel mit Tokens: 8.000 stabile Prefix-Tokens und 2.000 neue Tokens. Wähle, ob der Prefix bereits gecacht ist. Die Zahlen zeigen Prefill-Arbeit und gespeicherte beziehungsweise gelesene Prefix-Tokens. Sie messen keine Zeit und versprechen keinen Geschwindigkeitsfaktor.

Prefill-Tokens
10000
Geschriebene Prefix-Tokens
8000
Gelesene Prefix-Tokens
0
Gecachtes Präfix: 8,000
Neue Tokens: 2,000

Probiere die Präfix-Regel aus

Der schnellste Weg, Prompt-Caching zu verstehen, ist, den Anfang eines Prompts zu bearbeiten. Winzige Änderungen ganz oben können den Cache-Hit zerstören; Änderungen nach dem stabilen Präfix erhalten ihn meist.

Präfix-Matching Explorer

Bearbeite den Prompt unten und beobachte, wie Änderungen das Caching beeinflussen. Cache-Matching funktioniert Zeichen für Zeichen von Anfang an — jede Änderung invalidiert alles danach.

Original-Prompt (gecacht)
You are a helpful AI assistant specializing in code review. Always provide constructive feedback. Focus on security, performance, and readability. Use markdown formatting in your responses. --- Review the following Python function: def calculate_total(items): total = 0 for item in items: total += item.price * item.quantity return total
Dein bearbeiteter Prompt
Cache-Grenze Vorschau
You are a helpful AI assistant specializing in code review. Always provide constructive feedback. Focus on security, performance, and readability. Use markdown formatting in your responses. --- Review the following Python function: def calculate_total(items): total = 0 for item in items: total += item.price * item.quantity return total
Gecachte Tokens
90
Neue Tokens
0
Ersparnis
100%
Gecachte TokensNeue Tokens

Anbieter verhalten sich unterschiedlich

Baue deine Architektur nicht um eine einzelne Marketing-Zahl herum. Anbieter unterscheiden sich darin, wie Caches erstellt werden, wie lange sie leben, welche Eingaben zählen und wie die Nutzung gemeldet wird. Die übertragbare Fähigkeit ist Prompt-Disziplin: stabiles Präfix zuerst, volatiles Suffix zuletzt, jedes Deployment messen.

Anthropic (Claude)

Cache-Verhalten, minimale Prefixlänge, Write- und Read-Preis sowie Lebensdauer hängen von Claude-Modell und Cache-Modus ab. Prüfe cache_creation_input_tokens und cache_read_input_tokens. Ein kalter Write und ein warmer Read kosten unterschiedlich viel.

Quellen

OpenAI (GPT-4o)

Cache-Modi und Preise hängen vom Modell ab. GPT-5.6 und neuer unterstützen implizite und explizite Breakpoints mit getrennten Write- und Read-Kosten. Frühere Modelle nutzen implizites Caching. Prüfe Mindestlänge, Aufbewahrung und gecachte Tokens des konkreten Modells.

Quellen

Google (Gemini)

Gemini bietet implizites Caching für geeignete Modelle und explizite Cached-Content-Ressourcen in unterstützten APIs. Mindestlänge, TTL, Speicherkosten und Rabatte hängen von Modell und Modus ab.

Quellen

Kostenmodell

Writes und Reads können unterschiedliche Preise haben. Die Ersparnis hängt von Wiederverwendung vor Ablauf ab. Der Rechner zeigt diese Gruppierung ausdrücklich. Ersetze seinen hypothetischen Tarif durch die Preise deines Modells.

Hypothetischer Tarif, kein Anbieterangebot. Eine Gruppe verwendet einen Prefix vor dem Ablauf erneut; jede neue Gruppe beginnt mit einem Write. TTL-Ablauf, Routing-Misses oder Prefix-Änderungen lassen sich durch weniger Anfragen pro Gruppe abbilden. Output-Kosten sind auf beiden Seiten ausgeschlossen.

Kalte Writes
10
Cache-Reads
90
Ohne Caching
$3.0000
Mit Caching
$1.1160

Ersparnis: $1.8840

Implementierungs-Checkliste

Statischen Inhalt zuerst

Cache-Matching funktioniert auf Präfixen. Platziere deinen System-Prompt und Few-Shot-Beispiele vor dynamischem Inhalt, damit das Präfix über Anfragen hinweg stabil bleibt.

Minimale Token-Anzahl beachten

Prüfe die minimale cachebare Prefixlänge für das konkrete Modell. Ein Prefix kann stabil und trotzdem zu kurz sein.

TTL verstehen

Berücksichtige Lebensdauer, Verlängerung und Routing des Anbieters. Wiederverwendung nach Ablauf kann einen neuen Write erfordern. Miss Misses, statt bei jedem wiederholten Prompt einen Hit anzunehmen.

Cache-Hit-Raten überwachen

Prüfe die Usage-Felder in API-Antworten (cache_creation_input_tokens vs cache_read_input_tokens), um zu verifizieren, dass Caching funktioniert. Niedrige Hit-Raten bedeuten, dass sich dein Präfix zu oft ändert.