Kontextfenster-Management

Die Kunst, das begrenzte Kontextfenster eines LLMs optimal zu nutzen – durch Priorisierung, Kompression und intelligente Auswahl relevanter Informationen.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Kontextfenster ist begrenzt – nicht alles passt rein
  2. Relevante Informationen priorisieren, irrelevante weglassen
  3. Techniken: Summarization, Chunking, RAG, Sliding Window

Sofortantwort

Kontextfenster-Management einfach erklärt

Optimale Nutzung des begrenzten LLM-Kontextfensters.

Kurz gesagt
Kontextfenster ist begrenzt – nicht alles passt rein
Typischer Einsatz
Lange Dokumente, Chat-Historien, Multi-Document QA
Wichtig zu wissen
Techniken: Summarization, Chunking, RAG, Sliding Window

Kontextfenster-Management im Überblick

Context Window Management ist die Kunst, das begrenzte Kontextfenster eines LLMs optimal zu nutzen. Jedes Modell kann nur eine bestimmte Anzahl von Tokens gleichzeitig verarbeiten – Claude Sonnet 4.6 hat 1M (Beta), GPT-5 256k, ältere Modelle nur 4k-128k. Wenn Dokumente, Konversationshistorie oder Kontext dieses Limit überschreiten, müssen Informationen priorisiert, komprimiert oder ausgelagert werden. Gutes Context Management ist der Unterschied zwischen einem LLM, das die relevanten Informationen “sieht”, und einem, das im Dunkeln tappt.

Context Window Management beschreibt alle Strategien, um mit der begrenzten Kapazität des Kontextfensters eines LLMs umzugehen. Jedes Modell kann nur eine bestimmte Anzahl von Tokens gleichzeitig verarbeiten – wenn Dokumente, Konversationshistorie oder Kontext dieses Limit überschreiten, müssen Informationen priorisiert, komprimiert oder ausgelagert werden. Mit wachsenden Kontextfenstern (200k+ Tokens) wird das Problem kleiner, aber nicht verschwinden – und größere Kontexte sind teurer.

Context Engineering ist die strategische Nutzung des begrenzten Kontextfensters. Da LLMs nur eine bestimmte Menge Text gleichzeitig verarbeiten können, musst du entscheiden, was reinkommt.

Das Problem:

Kontextfenster: 128K Tokens
Deine Daten: 500K Tokens
-> Du musst auswählen, was relevant ist

Warum ist das wichtig?

Falsches Context Engineering führt zu:

  • Irrelevanten Antworten (wichtige Info fehlt)
  • Halluzinationen (Modell erfindet fehlende Details)
  • Hohen Kosten (unnötig lange Kontexte)
  • Langsamen Antworten (mehr Tokens = mehr Latenz)

Technisch betrachtet

Strategien

StrategieBeschreibungWann nutzen
TruncationÄlteste Nachrichten abschneidenEinfache Chats
SummarizationAlte Nachrichten zusammenfassenLange Konversationen
RAGNur relevante Chunks einbeziehenGroße Wissensbasen
Sliding WindowFestes Fenster über KonversationStreaming-Anwendungen
HierarchicalZusammenfassungen + Details on demandKomplexe Dokumente

Lost in the Middle

LLMs beachten Anfang und Ende des Kontexts mehr als die Mitte – bekannt als „Lost in the Middle”.

[Anfang: hohe Attention] ... [Mitte: niedrige Attention] ... [Ende: hohe Attention]

Konsequenz: Wichtige Informationen an Anfang oder Ende platzieren.

Praktisches Beispiel

def manage_context(messages, max_tokens=4000):
    # System Prompt immer behalten
    system = messages[0]
    
    # Letzte N Nachrichten behalten
    recent = messages[-10:]
    
    # Ältere Nachrichten zusammenfassen
    if len(messages) > 11:
        old_messages = messages[1:-10]
        summary = summarize(old_messages)
        return [system, {"role": "system", "content": f"Bisheriger Verlauf: {summary}"}] + recent
    
    return messages

Best Practices

  • Relevanz vor Vollständigkeit: Lieber weniger, aber relevanter Kontext
  • Strukturierte Prompts: Klare Abschnitte helfen dem Modell
  • Dynamisches Retrieval: Bei Bedarf nachladen statt alles vorab
  • Kosten im Blick: Längerer Kontext = höhere API-Kosten

01Einsatzbereiche

Wann ist Kontextfenster-Management sinnvoll?

Geeignet für

  • Lange DokumenteRelevante Abschnitte extrahieren statt ganzes Dokument
  • Chat-HistorienAlte Nachrichten zusammenfassen, um Platz zu sparen
  • Multi-Document QANur relevante Chunks aus vielen Dokumenten einbeziehen

↑ Inhalt

02Werkzeuge

Womit Kontextfenster-Management umgesetzt wird

↑ Inhalt

Merksatz

Context Engineering ist wie das Packen eines Koffers mit Gewichtslimit

Du kannst nicht alles mitnehmen, also wählst du das Wichtigste aus, faltest effizient und priorisierst, was du wirklich brauchst.

  1. Kontextfenster ist begrenzt – nicht alles passt rein
  2. Relevante Informationen priorisieren, irrelevante weglassen
  3. Techniken: Summarization, Chunking, RAG, Sliding Window

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Kontextfenster-Management

Was passiert, wenn das Kontextfenster voll ist?

Bei den meisten APIs: Ältere Tokens werden abgeschnitten (von vorne). Das Modell 'vergisst' den Anfang der Konversation. Manche Systeme fassen stattdessen zusammen oder nutzen Sliding Windows.

Wie viel Kontext ist optimal?

Mehr ist nicht immer besser. Bei sehr langen Kontexten übersehen LLMs Informationen in der Mitte – das Phänomen läuft unter dem Namen 'Lost in the Middle'. Relevanz schlägt Quantität.

Sollte ich immer das maximale Kontextfenster nutzen?

Nein. Längerer Kontext = höhere Kosten und Latenz. Nutze so viel wie nötig, nicht so viel wie möglich.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Kontextfenster

    Maximale Textmenge, die ein Sprachmodell verarbeiten kann.

  • Technisch vertiefen

    Tokens

    Texteinheiten, die ein Sprachmodell verarbeiten kann.

↑ Inhalt