Sofortantwort
Kontextfenster-Management einfach erklärt
Optimale Nutzung des begrenzten LLM-Kontextfensters.
- Kurz gesagt
- Kontextfenster ist begrenzt – nicht alles passt rein
- Typischer Einsatz
- Lange Dokumente, Chat-Historien, Multi-Document QA
- Wichtig zu wissen
- Techniken: Summarization, Chunking, RAG, Sliding Window
Kontextfenster-Management im Überblick
Context Window Management ist die Kunst, das begrenzte Kontextfenster eines LLMs optimal zu nutzen. Jedes Modell kann nur eine bestimmte Anzahl von Tokens gleichzeitig verarbeiten – Claude Sonnet 4.6 hat 1M (Beta), GPT-5 256k, ältere Modelle nur 4k-128k. Wenn Dokumente, Konversationshistorie oder Kontext dieses Limit überschreiten, müssen Informationen priorisiert, komprimiert oder ausgelagert werden. Gutes Context Management ist der Unterschied zwischen einem LLM, das die relevanten Informationen “sieht”, und einem, das im Dunkeln tappt.
Context Window Management beschreibt alle Strategien, um mit der begrenzten Kapazität des Kontextfensters eines LLMs umzugehen. Jedes Modell kann nur eine bestimmte Anzahl von Tokens gleichzeitig verarbeiten – wenn Dokumente, Konversationshistorie oder Kontext dieses Limit überschreiten, müssen Informationen priorisiert, komprimiert oder ausgelagert werden. Mit wachsenden Kontextfenstern (200k+ Tokens) wird das Problem kleiner, aber nicht verschwinden – und größere Kontexte sind teurer.
Context Engineering ist die strategische Nutzung des begrenzten Kontextfensters. Da LLMs nur eine bestimmte Menge Text gleichzeitig verarbeiten können, musst du entscheiden, was reinkommt.
Das Problem:
Kontextfenster: 128K Tokens
Deine Daten: 500K Tokens
-> Du musst auswählen, was relevant ist
Warum ist das wichtig?
Falsches Context Engineering führt zu:
- Irrelevanten Antworten (wichtige Info fehlt)
- Halluzinationen (Modell erfindet fehlende Details)
- Hohen Kosten (unnötig lange Kontexte)
- Langsamen Antworten (mehr Tokens = mehr Latenz)
Technisch betrachtet
Strategien
| Strategie | Beschreibung | Wann nutzen |
|---|---|---|
| Truncation | Älteste Nachrichten abschneiden | Einfache Chats |
| Summarization | Alte Nachrichten zusammenfassen | Lange Konversationen |
| RAG | Nur relevante Chunks einbeziehen | Große Wissensbasen |
| Sliding Window | Festes Fenster über Konversation | Streaming-Anwendungen |
| Hierarchical | Zusammenfassungen + Details on demand | Komplexe Dokumente |
Lost in the Middle
LLMs beachten Anfang und Ende des Kontexts mehr als die Mitte – bekannt als „Lost in the Middle”.
[Anfang: hohe Attention] ... [Mitte: niedrige Attention] ... [Ende: hohe Attention]
Konsequenz: Wichtige Informationen an Anfang oder Ende platzieren.
Praktisches Beispiel
def manage_context(messages, max_tokens=4000):
# System Prompt immer behalten
system = messages[0]
# Letzte N Nachrichten behalten
recent = messages[-10:]
# Ältere Nachrichten zusammenfassen
if len(messages) > 11:
old_messages = messages[1:-10]
summary = summarize(old_messages)
return [system, {"role": "system", "content": f"Bisheriger Verlauf: {summary}"}] + recent
return messages
Best Practices
- Relevanz vor Vollständigkeit: Lieber weniger, aber relevanter Kontext
- Strukturierte Prompts: Klare Abschnitte helfen dem Modell
- Dynamisches Retrieval: Bei Bedarf nachladen statt alles vorab
- Kosten im Blick: Längerer Kontext = höhere API-Kosten