Context Caching

Wiederkehrende Modellkontexte zwischen Anfragen nutzbar machen

Eine Optimierungstechnik, die häufig verwendete Kontexte (System-Prompts, Dokumente, Beispiele) zwischen LLM-Aufrufen zwischenspeichert, um Kosten und Latenz bei wiederholten Anfragen zu reduzieren.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Speichert verarbeitete Kontexte (Prefill) für wiederholte Nutzung
  2. Kann Kosten und Latenz bei wiederholten Anfragen mit gleichem Kontext deutlich reduzieren
  3. Verfügbar als Anbieterfeature, Prompt Caching oder Prefix-/KV-Cache in eigenen Inferenz-Stacks

Sofortantwort

Context Caching einfach erklärt

Zwischenspeichern von LLM-Kontexten für geringere Kosten und Latenz.

Kurz gesagt
Speichert verarbeitete Kontexte (Prefill) für wiederholte Nutzung
Typischer Einsatz
Chatbots mit großem System-Prompt, Dokumentenanalyse, Few-Shot-Learning im Produktionsbetrieb
Wichtig zu wissen
Verfügbar als Anbieterfeature, Prompt Caching oder Prefix-/KV-Cache in eigenen Inferenz-Stacks

Context Caching im Überblick

Context Caching speichert den verarbeiteten Kontext eines LLM-Aufrufs, sodass er bei der nächsten Anfrage nicht erneut berechnet werden muss.

Ohne Caching vs. mit Caching:

Ohne Caching (jeder Aufruf):
  [System-Prompt] + [Dokument] + [Frage]
  → kompletter Kontext wird erneut verarbeitet

  Nächste Frage: Dasselbe von vorn
  → wieder vollständige Kontextverarbeitung

Mit Caching:
  Erster Aufruf: [System + Dokument] cachen + [Frage]
  → Kontext wird vorbereitet und gespeichert

  Nächste Frage: [Cache-Hit] + [neue Frage]
  → nur der neue Teil muss vollständig verarbeitet werden

Anbieter- und Architekturvergleich

AnsatzFeatureNutzenCache-Verhalten
Anbieter-APIPrompt oder Context Cachingreduzierte Kosten oder Latenz bei Cache-Hitsabhängig von Modell, TTL und API-Regeln
Managed PlattformCaching für große Kontextewiederholte Dokument- oder Systemkontexte günstiger nutzenoft konfigurierbar
Self-HostedKV-Cache / Prefix CachingLatenz- und Durchsatzoptimierungabhängig von Inferenz-Engine und Session-Handling

Praxisbeispiel

import anthropic

client = anthropic.Anthropic()

# Großen Kontext einmal senden und cachen
response = client.messages.create(
    model="chat-model",
    max_tokens=response_token_limit,
    system=[{
        "type": "text",
        "text": "Du bist ein Experte für..." + langes_dokument,
        "cache_control": {"type": "ephemeral"}  # ← Caching aktivieren
    }],
    messages=[{"role": "user", "content": "Frage 1"}]
)

# Zweiter Aufruf: Cache-Hit kann Kosten oder Latenz reduzieren
response2 = client.messages.create(
    # Gleicher System-Prompt → wird aus Cache geladen
    ...
    messages=[{"role": "user", "content": "Frage 2"}]
)

Wann cachen?

  • Große System-Prompts die sich selten ändern
  • Dokumente zu denen viele Fragen gestellt werden
  • Few-Shot-Beispiele die bei allen Anfragen gleich sind
  • Einmalige Anfragen ohne Wiederholung
  • Sich ständig ändernder Kontext

Schritt für Schritt

Wiederverwendbaren Kontext gezielt cachen

Context Caching lohnt sich bei großen, stabilen Präfixen. Die Anwendung muss Trefferquote, Datenaktualität und Cache-Lebensdauer bewusst steuern.

  1. Stabilen Kontext identifizieren

    Auswahl

    Systemregeln, häufige Beispiele oder ein unverändertes Dokument werden von der variablen Nutzerfrage getrennt.

    stabiler Prefix + variabler Suffix
  2. Kontext einmal vorbereiten

    Warm-up

    Der Anbieter oder die Inferenz-Engine verarbeitet den Prefix und speichert ein wiederverwendbares Zwischenergebnis.

    Prefix → Cache-Eintrag
  3. Gleiche Basis wiederverwenden

    Cache-Hit

    Neue Anfragen mit passendem Prefix verarbeiten nur den neuen Teil vollständig.

    Cache + neue Frage → Antwort
  4. Gültigkeit und Nutzen beobachten

    Kontrolle

    Versionen, Berechtigungen, Laufzeit und tatsächliche Trefferquote entscheiden, ob der Cache bestehen bleibt.

    Hit-Rate + TTL + Aktualität

Konkretes Beispiel

Beispiel: Viele Fragen zu einem Handbuch

Ein Team stellt mehrere Fragen zu demselben, umfangreichen technischen Handbuch.

Vollständig wiederholen

Jede Frage sendet und verarbeitet das gesamte Handbuch neu, obwohl sich der Dokumentteil nicht geändert hat.

Dokumentkontext cachen

Das Handbuch wird als stabiler Kontext wiederverwendet. Pro Anfrage muss nur noch die neue Frage verarbeitet werden.

Der größte Nutzen entsteht bei hoher Wiederverwendung. Ein Cache ersetzt weder Aktualitätsprüfung noch Zugriffskontrolle.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Senkt wiederholte Verarbeitungskosten für stabile Kontexte.
  • Kann die Zeit bis zur Antwort bei Cache-Hits verkürzen.
  • Eignet sich für Dokument-QA, große Systemprompts und Few-Shot-Beispiele.
  • Ergänzt Retrieval und Kontextplanung im Produktbetrieb.

Das solltest du beachten

  • Bei wechselndem Kontext oder seltenen Treffern bleibt der Nutzen gering.
  • Veraltete oder falsch versionierte Einträge können falschen Kontext liefern.
  • Cache-Mechanismen und Abrechnung unterscheiden sich je Anbieter oder Engine.
  • Berechtigungen müssen auch für wiederverwendete Inhalte gelten.
Vertiefung · für Fortgeschrittene

Ein wiederverwendbarer Kontextpräfix

Nur der unveränderte Teil einer Anfrage eignet sich zuverlässig als Cache-Basis.

Wissenskarte

Prefix wiederverwenden

Ein Cache-Hit ist nur wertvoll, wenn derselbe Kontext noch korrekt, erlaubt und für die aktuelle Frage passend ist. Context Caching gliedert sich in: Systemregeln, Dokumente, Cache-Key, Cache-Eintrag, Nutzerfrage, TTL.

01Einsatzbereiche

Wann ist Context Caching sinnvoll?

Geeignet für

  • Chatbots mit großem System-PromptSystem-Prompt + Wissensbasis einmal cachen, nur User-Nachrichten neu verarbeiten
  • DokumentenanalyseEin großes Dokument cachen und viele verschiedene Fragen dazu stellen
  • Few-Shot-Learning im ProduktionsbetriebBeispiele einmal cachen statt bei jeder Anfrage mitzusenden
  • RAG-SystemeHäufig abgerufene Kontexte zwischenspeichern

↑ Inhalt

02Werkzeuge

Womit Context Caching umgesetzt wird

↑ Inhalt

Merksatz

Context Caching ist wie ein Lehrer, der ein Lehrbuch einmal gründlich liest und sich Notizen macht

statt es für jeden Schüler von vorn zu lesen. Die Vorbereitung kostet einmal Zeit, aber danach kann er jede Frage schneller und günstiger beantworten.

  1. Speichert verarbeitete Kontexte (Prefill) für wiederholte Nutzung
  2. Kann Kosten und Latenz bei wiederholten Anfragen mit gleichem Kontext deutlich reduzieren
  3. Verfügbar als Anbieterfeature, Prompt Caching oder Prefix-/KV-Cache in eigenen Inferenz-Stacks

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Context Caching

Was ist der Unterschied zwischen Context Caching und KV-Cache?

KV-Cache speichert die berechneten Key-Value-Paare der Attention-Layer während einer einzelnen Generierung. Context Caching geht weiter: Es speichert den verarbeiteten Kontext über mehrere Anfragen hinweg – also zwischen verschiedenen API-Aufrufen.

Wie viel kann ich sparen?

Das hängt von Anbieter, Modell, Cache-Regeln, Token-Mix und Wiederverwendungsrate ab. Je größer und stabiler der wiederverwendete Kontext ist, desto eher lohnen sich Cache-Mechanismen.

Wann lohnt sich Context Caching?

Wenn derselbe Kontext – etwa System-Prompt, Dokumente oder Beispiele – über mehrere Anfragen stabil bleibt. Bei einmaligen Anfragen oder stark wechselndem Kontext ist der Nutzen meist gering.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Prompt Caching

    Wiederkehrende Prompt-Teile werden gecacht um Kosten und Latenz zu senken.

  • Technisch vertiefen

    KV-Cache

    Caching von Attention-Berechnungen für schnellere Inferenz.

↑ Inhalt