Sofortantwort
CAG einfach erklärt
Wissensbasis komplett in den gecachten Kontext laden statt Retrieval.
- Kurz gesagt
- Lädt die gesamte Wissensbasis vorab in das Kontextfenster des Modells
- Typischer Einsatz
- Produkt- und FAQ-Wissen, Interne Assistenten, Latenzkritische Anwendungen
- Wichtig zu wissen
- Verzichtet komplett auf Retrieval-Infrastruktur (Vektordatenbank, Chunking, Reranking)
Cache-Augmented Generation im Überblick
CAG (Cache-Augmented Generation) ist eine Alternative zu RAG, die durch die großen Kontextfenster moderner LLMs möglich wurde. Die Idee: Statt eine Wissensbasis in eine Vektordatenbank zu legen und zur Laufzeit passende Ausschnitte zu suchen, wird die gesamte Wissensbasis direkt in den Kontext des Modells geladen – einmalig verarbeitet und dann gecacht.
Jede Nutzerfrage wird anschließend an diesen vorgeladenen Kontext angehängt. Das Modell „sieht” immer das komplette Wissen und beantwortet Fragen daraus, ohne dass ein Retrieval-Schritt nötig ist.
Technisch betrachtet
Wie CAG funktioniert
- Vorbereitung: Die gesamte Wissensbasis (Dokumente, FAQs, Richtlinien) wird als langer Prompt aufbereitet.
- Einmalige Verarbeitung: Das Modell verarbeitet diesen Prompt einmal; die internen Zwischenzustände (KV-Cache) werden gespeichert bzw. per Prompt Caching beim API-Anbieter vorgehalten.
- Anfragen: Jede Frage wird an den gecachten Kontext angehängt – nur die neuen Tokens müssen berechnet werden.
CAG vs. RAG im Überblick
| Aspekt | CAG | RAG |
|---|---|---|
| Wissensmenge | begrenzt durchs Kontextfenster | praktisch unbegrenzt |
| Infrastruktur | keine (nur Caching) | Vektordatenbank, Chunking, Embeddings |
| Latenz | niedrig (kein Retrieval) | Retrieval-Schritt vor jeder Antwort |
| Aktualisierung | Cache neu aufbauen | einzelne Dokumente neu indexieren |
| Fehlerquellen | „Lost in the Middle” bei sehr langem Kontext | schlechtes Retrieval → falsche Chunks |
Grenzen und typische Fehler
- Kontextfenster ist das harte Limit: Passt die Wissensbasis nicht hinein, ist CAG raus – kein Workaround.
- Lange Kontexte sind nicht gratis: Auch mit Caching sinkt bei manchen Modellen die Antwortqualität, wenn relevante Information tief in einem sehr langen Kontext vergraben ist.
- Dynamische Daten: Ändert sich das Wissen laufend, wird der Cache ständig invalidiert – dann verliert CAG seinen Kostenvorteil.
Wann CAG, wann RAG?
CAG lohnt sich für kleine, stabile, abgeschlossene Wissensbasen: Produkthandbücher, interne Richtlinien, Kurs-Materialien. RAG bleibt erste Wahl bei großen oder dynamischen Korpora. In der Praxis verbreitet sich auch der Mittelweg: RAG für die Breite, CAG-artiges Caching für den stabilen Kern (System-Prompts, Kernrichtlinien).