Sofortantwort
Context Caching einfach erklärt
Zwischenspeichern von LLM-Kontexten für geringere Kosten und Latenz.
- Kurz gesagt
- Speichert verarbeitete Kontexte (Prefill) für wiederholte Nutzung
- Typischer Einsatz
- Chatbots mit großem System-Prompt, Dokumentenanalyse, Few-Shot-Learning im Produktionsbetrieb
- Wichtig zu wissen
- Verfügbar als Anbieterfeature, Prompt Caching oder Prefix-/KV-Cache in eigenen Inferenz-Stacks
Context Caching im Überblick
Context Caching speichert den verarbeiteten Kontext eines LLM-Aufrufs, sodass er bei der nächsten Anfrage nicht erneut berechnet werden muss.
Ohne Caching vs. mit Caching:
Ohne Caching (jeder Aufruf):
[System-Prompt] + [Dokument] + [Frage]
→ kompletter Kontext wird erneut verarbeitet
Nächste Frage: Dasselbe von vorn
→ wieder vollständige Kontextverarbeitung
Mit Caching:
Erster Aufruf: [System + Dokument] cachen + [Frage]
→ Kontext wird vorbereitet und gespeichert
Nächste Frage: [Cache-Hit] + [neue Frage]
→ nur der neue Teil muss vollständig verarbeitet werden
Anbieter- und Architekturvergleich
| Ansatz | Feature | Nutzen | Cache-Verhalten |
|---|---|---|---|
| Anbieter-API | Prompt oder Context Caching | reduzierte Kosten oder Latenz bei Cache-Hits | abhängig von Modell, TTL und API-Regeln |
| Managed Plattform | Caching für große Kontexte | wiederholte Dokument- oder Systemkontexte günstiger nutzen | oft konfigurierbar |
| Self-Hosted | KV-Cache / Prefix Caching | Latenz- und Durchsatzoptimierung | abhängig von Inferenz-Engine und Session-Handling |
Praxisbeispiel
import anthropic
client = anthropic.Anthropic()
# Großen Kontext einmal senden und cachen
response = client.messages.create(
model="chat-model",
max_tokens=response_token_limit,
system=[{
"type": "text",
"text": "Du bist ein Experte für..." + langes_dokument,
"cache_control": {"type": "ephemeral"} # ← Caching aktivieren
}],
messages=[{"role": "user", "content": "Frage 1"}]
)
# Zweiter Aufruf: Cache-Hit kann Kosten oder Latenz reduzieren
response2 = client.messages.create(
# Gleicher System-Prompt → wird aus Cache geladen
...
messages=[{"role": "user", "content": "Frage 2"}]
)
Wann cachen?
- ✅ Große System-Prompts die sich selten ändern
- ✅ Dokumente zu denen viele Fragen gestellt werden
- ✅ Few-Shot-Beispiele die bei allen Anfragen gleich sind
- ❌ Einmalige Anfragen ohne Wiederholung
- ❌ Sich ständig ändernder Kontext
Schritt für Schritt
Wiederverwendbaren Kontext gezielt cachen
Context Caching lohnt sich bei großen, stabilen Präfixen. Die Anwendung muss Trefferquote, Datenaktualität und Cache-Lebensdauer bewusst steuern.
Stabilen Kontext identifizieren
Auswahl
Systemregeln, häufige Beispiele oder ein unverändertes Dokument werden von der variablen Nutzerfrage getrennt.
stabiler Prefix + variabler SuffixKontext einmal vorbereiten
Warm-up
Der Anbieter oder die Inferenz-Engine verarbeitet den Prefix und speichert ein wiederverwendbares Zwischenergebnis.
Prefix → Cache-EintragGleiche Basis wiederverwenden
Cache-Hit
Neue Anfragen mit passendem Prefix verarbeiten nur den neuen Teil vollständig.
Cache + neue Frage → AntwortGültigkeit und Nutzen beobachten
Kontrolle
Versionen, Berechtigungen, Laufzeit und tatsächliche Trefferquote entscheiden, ob der Cache bestehen bleibt.
Hit-Rate + TTL + Aktualität
Konkretes Beispiel
Beispiel: Viele Fragen zu einem Handbuch
Ein Team stellt mehrere Fragen zu demselben, umfangreichen technischen Handbuch.
Vollständig wiederholen
Jede Frage sendet und verarbeitet das gesamte Handbuch neu, obwohl sich der Dokumentteil nicht geändert hat.
Dokumentkontext cachen
Das Handbuch wird als stabiler Kontext wiederverwendet. Pro Anfrage muss nur noch die neue Frage verarbeitet werden.
Der größte Nutzen entsteht bei hoher Wiederverwendung. Ein Cache ersetzt weder Aktualitätsprüfung noch Zugriffskontrolle.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Senkt wiederholte Verarbeitungskosten für stabile Kontexte.
- Kann die Zeit bis zur Antwort bei Cache-Hits verkürzen.
- Eignet sich für Dokument-QA, große Systemprompts und Few-Shot-Beispiele.
- Ergänzt Retrieval und Kontextplanung im Produktbetrieb.
Das solltest du beachten
- Bei wechselndem Kontext oder seltenen Treffern bleibt der Nutzen gering.
- Veraltete oder falsch versionierte Einträge können falschen Kontext liefern.
- Cache-Mechanismen und Abrechnung unterscheiden sich je Anbieter oder Engine.
- Berechtigungen müssen auch für wiederverwendete Inhalte gelten.
Vertiefung · für FortgeschritteneEin wiederverwendbarer Kontextpräfix
Nur der unveränderte Teil einer Anfrage eignet sich zuverlässig als Cache-Basis.
Prefix wiederverwenden