Prompt Compression

Eingaben kürzen, ohne den Arbeitsauftrag zu verlieren

Techniken, um Prompts zu verkürzen ohne wesentliche Informationen zu verlieren – für geringere Token-Kosten, niedrigere Latenz und bessere Nutzung des Kontextfensters.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Reduziert Token-Anzahl im Prompt – direkte Kostenersparnis bei API-Calls
  2. Besonders relevant bei RAG: Abgerufene Dokumente oft redundant oder irrelevant
  3. Methoden: Extraktion, Zusammenfassung, Selective Context, LLMLingua

Sofortantwort

Prompt Compression einfach erklärt

Prompts kürzen ohne Informationsverlust – für weniger Kosten und geringere Latenz.

Kurz gesagt
Reduziert Token-Anzahl im Prompt – direkte Kostenersparnis bei API-Calls
Typischer Einsatz
RAG-Optimierung, Long-Context-Verarbeitung, Kostenreduktion
Wichtig zu wissen
Methoden: Extraktion, Zusammenfassung, Selective Context, LLMLingua

Prompt Compression im Überblick

Jedes Token kostet Geld und Zeit. Bei RAG-Systemen werden oft mehrere Dokumente in den Prompt eingefügt – viele davon enthalten redundante oder irrelevante Informationen. Prompt Compression entfernt diese überflüssigen Teile, bevor der Prompt an das LLM gesendet wird.

Das Ziel: Gleiche oder bessere Antwortqualität bei deutlich weniger Tokens.

Kompressionsstrategien:

MethodeAnsatzKompressionsrate
ExtraktionWichtigste Sätze behalten2–5x
ZusammenfassungLLM fasst zusammen5–20x
LLMLinguaToken-Level-Kompression2–6x
Selective ContextSelf-Information-basiert2–4x

Technisch betrachtet

LLMLingua in Python

from llmlingua import PromptCompressor

compressor = PromptCompressor(
    model_name="microsoft/llmlingua-2-bert-base-multilingual-cased-meetingbank",
    use_llmlingua2=True,
)

# Langer RAG-Kontext
context = """
[Dokument 1] ... sehr langer Text ...
[Dokument 2] ... weiterer langer Text ...
[Dokument 3] ... noch mehr Text ...
"""

compressed = compressor.compress_prompt(
    context,
    rate=0.5,          # 50% der Tokens behalten
    force_tokens=['\n'],  # Zeilenumbrüche immer behalten
)

print(f"Original: {compressed['origin_tokens']} Tokens")
print(f"Komprimiert: {compressed['compressed_tokens']} Tokens")
print(f"Einsparung: {compressed['ratio']:.1f}x")

RAG-Pipeline mit Kompression

async def rag_with_compression(query: str) -> str:
    # 1. Dokumente abrufen
    docs = await vector_db.search(query, top_k=10)
    context = "\n\n".join([d.text for d in docs])

    # 2. Kontext komprimieren (vor LLM-Call)
    compressed = compressor.compress_prompt(
        context,
        question=query,  # Query-aware Kompression
        rate=0.4,
    )

    # 3. LLM mit komprimiertem Kontext aufrufen
    response = await llm.generate(
        f"Kontext:\n{compressed['compressed_prompt']}\n\nFrage: {query}"
    )
    return response

Schritt für Schritt

Einen Prompt vor dem Modellaufruf verdichten

Prompt Compression setzt kurz vor der Antwortgenerierung an. Sie reduziert die bereits ausgewählten Inhalte auf ihre Aufgabe hin.

  1. Aufgabe und Pflichtdetails erkennen

    Schutz

    Die Anwendung trennt Anweisungen, unverzichtbare Fakten, Quellen und optionale Hintergrundinformationen.

    Regeln + Pflichtfakten markieren
  2. Unnötige Tokens finden

    Auswahl

    Wiederholungen, Boilerplate und Passagen ohne Bezug zur aktuellen Frage werden identifiziert.

    Kontext → relevante Bestandteile
  3. Inhalte verdichten

    Kompression

    Extraktion, Zusammenfassung oder tokenbasierte Verfahren reduzieren die Menge bei möglichst gleichem Informationsgehalt.

    relevant → kompakt
  4. Mit Testfragen absichern

    Evaluation

    Die komprimierte Variante wird mit repräsentativen Fragen gegen den Ausgangskontext verglichen.

    Qualität + Tokens + Latenz

Konkretes Beispiel

Beispiel: RAG-Kontext für eine Fachfrage

Eine Suche liefert fünf passende Abschnitte, doch zwei davon wiederholen dieselbe Definition mehrfach.

Direkt in den Prompt

Alle Abschnitte samt Kopfzeilen, Einleitungen und wiederholten Beispielen werden unverändert an das Modell gesendet.

Komprimierter Arbeitskontext

Die Anwendung erhält Kernregeln, relevante Zahlen und Quellenverweise. Wiederholte Erklärungen und Layoutreste entfallen.

Kompression kann die Antwort schneller und günstiger machen. Kritische Fakten, Zahlen und Einschränkungen müssen dabei explizit geschützt werden.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Senkt Input-Tokens, Kosten und häufig auch die Antwortzeit.
  • Schafft Platz für zusätzliche relevante Quellen oder eine längere Antwort.
  • Reduziert Ablenkung durch Wiederholungen und Formatballast.
  • Ergänzt Chunking und Reranking direkt vor dem LLM-Aufruf.

Das solltest du beachten

  • Zu starke Verdichtung kann wichtige Ausnahmen entfernen.
  • Ein zusätzlicher Schritt kann selbst Rechenzeit und Fehler verursachen.
  • Die ideale Rate hängt stark von Aufgabe und Risiko ab.
  • Komprimierte Inhalte müssen an den Originalquellen rückprüfbar bleiben.
Vertiefung · für Fortgeschrittene

Prompt Compression in der Retrieval-Strecke

Die Methode verdichtet erst nach der Suche und vor der Generierung.

Wissenskarte

Relevanz verdichten

Die Methode optimiert nicht die Wissensquelle selbst, sondern den konkreten Kontext einer einzelnen Anfrage. Prompt Compression gliedert sich in: Nutzerfrage, Retrieval, Reranking, Schutzregeln, Kompressor, LLM.

01Einsatzbereiche

Wann ist Prompt Compression sinnvoll?

Geeignet für

  • RAG-OptimierungAbgerufene Dokumente vor dem Einfügen in den Prompt komprimieren – weniger Tokens, gleiche Qualität
  • Long-Context-VerarbeitungLange Dokumente auf das Wesentliche reduzieren, bevor sie ins Kontextfenster passen müssen
  • KostenreduktionBei hohem API-Volumen können 50% weniger Input-Tokens die Kosten halbieren

↑ Inhalt

02Werkzeuge

Womit Prompt Compression umgesetzt wird

↑ Inhalt

Merksatz

Prompt Compression ist wie das Packen eines Koffers für eine Reise

Du nimmst nicht alles mit, was du besitzt, sondern nur das Wesentliche. Ein erfahrener Packer (Kompressionsalgorithmus) weiß, was wirklich gebraucht wird und was weggelassen werden kann – ohne dass die Reise schlechter wird.

  1. Reduziert Token-Anzahl im Prompt – direkte Kostenersparnis bei API-Calls
  2. Besonders relevant bei RAG: Abgerufene Dokumente oft redundant oder irrelevant
  3. Methoden: Extraktion, Zusammenfassung, Selective Context, LLMLingua

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Prompt Compression

Verliert man durch Kompression wichtige Informationen?

Es gibt immer einen Trade-off zwischen Kompressionsrate und Informationserhalt. Gute Algorithmen wie LLMLingua erreichen 2-5x Kompression mit minimalem Qualitätsverlust. Für kritische Anwendungen sollte man die Kompressionsrate begrenzen und die Ausgabequalität evaluieren.

Wann lohnt sich Prompt Compression?

Besonders bei RAG-Systemen mit langen abgerufenen Dokumenten, bei hohem API-Volumen (Kostenersparnis), wenn das Kontextfenster ausgeschöpft ist, oder wenn Latenz kritisch ist. Für kurze Prompts ist der Overhead des Kompressionsschritts oft nicht gerechtfertigt.

Was ist der Unterschied zwischen Prompt Compression und Chunking?

Chunking teilt Dokumente in kleinere Teile auf, bevor sie in die Vektordatenbank gespeichert werden – ein Preprocessing-Schritt. Prompt Compression reduziert den bereits ausgewählten Text kurz vor dem LLM-Call – ein Inference-Schritt. Beide ergänzen sich in RAG-Pipelines.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt