Sofortantwort
Prompt Caching einfach erklärt
Wiederkehrende Prompt-Teile werden gecacht um Kosten und Latenz zu senken.
- Kurz gesagt
- Spart bis zu 90% der Token-Kosten für wiederkehrende Prompt-Teile
- Typischer Einsatz
- Lange System-Prompts, Dokument-Analyse, Few-Shot-Beispiele
- Wichtig zu wissen
- Unterstützt von Anthropic Claude und OpenAI GPT-5
Prompt Caching im Überblick
Prompt Caching löst ein konkretes Kostenproblem bei LLM-Anwendungen: Viele Anfragen teilen denselben langen Kontext – einen ausführlichen System-Prompt, ein Dokument, das analysiert werden soll, oder eine umfangreiche Sammlung von Beispielen. Ohne Caching muss das Modell diesen Kontext bei jeder Anfrage neu verarbeiten und berechnet ihn als Input-Tokens.
Mit Prompt Caching wird der verarbeitete Kontext zwischengespeichert. Folge-Anfragen, die denselben Kontext nutzen, zahlen nur einen Bruchteil der normalen Token-Kosten – bei Anthropic 10% statt 100%. Bei einem System-Prompt mit 50.000 Tokens und hunderten täglichen Anfragen ist das ein erheblicher Kostenvorteil.
Wann Prompt Caching besonders lohnt:
- System-Prompts mit mehr als 1.000 Tokens
- Dokument-Analyse mit vielen Fragen zum selben Dokument
- RAG-Systeme, die dieselben Chunks häufig abrufen
- Chatbots mit langer Konversationshistorie als Kontext
Technisch betrachtet
Anthropic Prompt Caching
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=1024,
system=[
{
"type": "text",
"text": "Du bist ein hilfreicher Assistent...",
},
{
"type": "text",
"text": "<sehr_langes_dokument>...</sehr_langes_dokument>",
"cache_control": {"type": "ephemeral"} # Dieser Teil wird gecacht
}
],
messages=[{"role": "user", "content": "Fasse das Dokument zusammen."}]
)
# Bei der nächsten Anfrage mit demselben Dokument:
# → Cache Hit: 90% Kostenersparnis für den Dokument-Teil
print(response.usage.cache_read_input_tokens) # Tokens aus Cache
print(response.usage.cache_creation_input_tokens) # Tokens zum Cache hinzugefügt
OpenAI Automatisches Caching
OpenAI cached automatisch – keine Code-Änderungen nötig:
# Normaler API-Aufruf – OpenAI cached automatisch bei >1024 Tokens
response = client.chat.completions.create(
model="gpt-5",
messages=[
{"role": "system", "content": langer_system_prompt}, # Wird automatisch gecacht
{"role": "user", "content": "Neue Frage"}
]
)
# Kosten-Check
print(response.usage.prompt_tokens_details.cached_tokens)
Kostenvergleich
| Szenario | Ohne Caching | Mit Caching | Ersparnis |
|---|---|---|---|
| 10k Token System-Prompt, 100 Anfragen | 1.000.000 Input-Tokens | 100.000 Input-Tokens | 90% |
| 50k Token Dokument, 50 Fragen | 2.500.000 Input-Tokens | 250.000 Input-Tokens | 90% |
| 1k Token System-Prompt | Kein Caching sinnvoll | – | – |