Retrieval Augmented Generation Cache-Augmented Generation

Wissensbasis abrufen oder komplett in den Kontext laden?

CAG ist die pragmatische Wahl, wenn die gesamte Wissensbasis bequem ins Kontextfenster passt und sich selten ändert – weniger Infrastruktur, keine Retrieval-Fehler. RAG bleibt gesetzt, sobald der Korpus groß ist, häufig aktualisiert wird oder Zugriffsrechte pro Nutzer nötig sind. Viele Teams starten mit CAG und wechseln zu RAG, wenn die Wissensbasis wächst.

8 KriterienFortgeschritten3 Min Lesezeit

Die beiden Seiten

01Kriterien

Wo sich die beiden unterscheiden

8 Kriterien im direkten Vergleich. Auf schmalen Bildschirmen wird die Tabelle zu Karten.
KriteriumRetrieval Augmented GenerationCache-Augmented Generation
GrundprinzipRelevante Chunks werden zur Laufzeit per Retrieval geholtGesamte Wissensbasis wird in den Kontext geladen und gecacht
InfrastrukturVektordatenbank, Embedding-Pipeline, Retrieval-LogikNur LLM mit großem Kontextfenster + Prompt Caching
Größe der WissensbasisPraktisch unbegrenzt (Millionen Dokumente)Begrenzt durch das Kontextfenster
LatenzRetrieval-Schritt kostet Zeit pro AnfrageKein Retrieval, gecachter Kontext antwortet schnell
FehlerquellenSchlechtes Retrieval = falsche/fehlende ChunksKein Retrieval-Fehler möglich, alles ist im Kontext
Aktualisierung der DatenEinzelne Dokumente neu embeddenCache muss bei jeder Änderung neu aufgebaut werden
Kosten pro AnfrageModerat (nur relevante Chunks als Tokens)Günstig bei gecachtem Kontext, teuer ohne Caching
KomplexitätChunking, Embeddings, Re-Ranking zu tunenSehr einfach: Dokumente rein, fertig
  • Grundprinzip

    Retrieval Augmented Generation

    Relevante Chunks werden zur Laufzeit per Retrieval geholt

    Cache-Augmented Generation

    Gesamte Wissensbasis wird in den Kontext geladen und gecacht

  • Infrastruktur

    Retrieval Augmented Generation

    Vektordatenbank, Embedding-Pipeline, Retrieval-Logik

    Cache-Augmented Generation

    Nur LLM mit großem Kontextfenster + Prompt Caching

  • Größe der Wissensbasis

    Retrieval Augmented Generation

    Praktisch unbegrenzt (Millionen Dokumente)

    Cache-Augmented Generation

    Begrenzt durch das Kontextfenster

  • Latenz

    Retrieval Augmented Generation

    Retrieval-Schritt kostet Zeit pro Anfrage

    Cache-Augmented Generation

    Kein Retrieval, gecachter Kontext antwortet schnell

  • Fehlerquellen

    Retrieval Augmented Generation

    Schlechtes Retrieval = falsche/fehlende Chunks

    Cache-Augmented Generation

    Kein Retrieval-Fehler möglich, alles ist im Kontext

  • Aktualisierung der Daten

    Retrieval Augmented Generation

    Einzelne Dokumente neu embedden

    Cache-Augmented Generation

    Cache muss bei jeder Änderung neu aufgebaut werden

  • Kosten pro Anfrage

    Retrieval Augmented Generation

    Moderat (nur relevante Chunks als Tokens)

    Cache-Augmented Generation

    Günstig bei gecachtem Kontext, teuer ohne Caching

  • Komplexität

    Retrieval Augmented Generation

    Chunking, Embeddings, Re-Ranking zu tunen

    Cache-Augmented Generation

    Sehr einfach: Dokumente rein, fertig

02Gemeinsamkeiten

Wo beide dasselbe leisten

  • Beide geben dem Modell externes Wissen zur Laufzeit mit, statt es ins Modell zu trainieren.
  • Beide brauchen dieselbe Vorarbeit: aufbereitete, aktuelle Dokumente.
  • Weil die Dokumentbasis dieselbe ist, ist der spätere Wechsel von CAG zu RAG ein Ausbau und kein Neuanfang.

Die Kernfrage

Du willst ein LLM mit eigenem Wissen versorgen. RAG ist der etablierte Weg – aber mit immer größeren Kontextfenstern und Prompt Caching ist eine Alternative entstanden: CAG (Cache-Augmented Generation).

  • RAG: Zur Laufzeit werden die relevantesten Chunks per Retrieval aus einer Wissensbasis geholt und dem Modell als Kontext mitgegeben
  • CAG: Die gesamte Wissensbasis wird vorab in den Kontext geladen und per KV-/Prompt-Caching wiederverwendet – ganz ohne Retrieval

Die Entscheidung hängt vor allem an einer Frage: Wie groß ist deine Wissensbasis – und wie oft ändert sie sich?

Wie RAG funktioniert

Bei RAG wird die Wissensbasis vorverarbeitet: Dokumente werden per Chunking in Abschnitte zerlegt, als Embeddings in eine Vektordatenbank geschrieben und zur Laufzeit über semantische Suche abgerufen. Nur die Top-Treffer landen im Prompt.

Stärken:

  • Skaliert auf beliebig große Korpora – Millionen Dokumente sind kein Problem
  • Updates sind billig: geändertes Dokument neu embedden, fertig
  • Zugriffskontrolle möglich: Retrieval kann pro Nutzer filtern
  • Schlanke Prompts: nur relevante Chunks kosten Tokens

Schwächen:

  • Eine ganze Pipeline will gepflegt werden: Chunking-Strategie, Embedding-Modell, Re-Ranking
  • Retrieval kann danebenliegen – dann fehlt dem Modell die entscheidende Information
  • Der Retrieval-Schritt kostet Latenz bei jeder Anfrage

Wie CAG funktioniert

CAG dreht den Spieß um: Statt zur Laufzeit zu suchen, wird die komplette Wissensbasis einmal in den Kontext geladen. Moderne Modelle mit großen Kontextfenstern machen das möglich, und KV-/Prompt-Caching macht es bezahlbar – der statische Wissensblock wird nur einmal verarbeitet und danach aus dem Cache bedient.

Stärken:

  • Keine Retrieval-Infrastruktur: keine Vektordatenbank, keine Embedding-Pipeline, kein Chunking-Tuning
  • Keine Retrieval-Fehler: das Modell sieht garantiert alle Informationen
  • Niedrige Latenz pro Anfrage, weil der Suchschritt entfällt
  • In Minuten aufgesetzt statt in Tagen

Schwächen:

  • Funktioniert nur bei begrenztem Korpus – das Kontextfenster ist die harte Grenze
  • Bei jeder Datenänderung muss der Cache neu aufgebaut werden
  • Sehr lange Kontexte können die Antwortqualität drücken (Lost in the Middle)
  • Keine feingranulare Zugriffskontrolle: alle Nutzer sehen denselben Kontext

Wann was?

CAG wählen, wenn:

  • Die Wissensbasis klein und stabil ist (Handbuch, FAQ, Richtlinien-Sammlung, Produktdoku eines einzelnen Produkts)
  • Du schnell und ohne Infrastruktur starten willst
  • Alle Nutzer auf dasselbe Wissen zugreifen dürfen
  • Latenz wichtiger ist als Korpusgröße

RAG wählen, wenn:

  • Der Korpus groß ist oder wächst (Wikis, Ticketsysteme, Dokumentenarchive)
  • Sich Inhalte häufig ändern
  • Berechtigungen pro Nutzer oder Mandant nötig sind
  • Du Quellenangaben pro Antwort gezielt nachverfolgen willst

Typische Praxis-Szenarien

CAG in Aktion: Ein Support-Assistent für ein einzelnes SaaS-Produkt. Die gesamte Produktdokumentation, die FAQ und die Onboarding-Guides ergeben zusammen einen überschaubaren Textbestand, der bequem ins Kontextfenster passt. Das Team lädt alles einmal in den Kontext, aktiviert Prompt Caching und ist nach einem Nachmittag produktiv – ohne eine einzige Zeile Retrieval-Code.

RAG in Aktion: Ein interner Wissensassistent für ein Unternehmen mit Confluence-Wiki, Ticketsystem und Vertragsarchiv. Hunderttausende Dokumente, tägliche Änderungen, dazu Berechtigungen: Die Rechtsabteilung darf Verträge sehen, das Marketing nicht. Hier führt kein Weg an einer Retrieval-Pipeline mit Vektordatenbank, sauberem Chunking und Rechte-Filterung vorbei.

Der Graubereich dazwischen ist die eigentlich interessante Zone: Eine Wissensbasis, die gerade noch in den Kontext passt. Hier lohnt der Blick auf die Änderungsrate – bei täglichen Updates frisst der ständige Cache-Neuaufbau die Ersparnis schnell auf, und RAG wird trotz kleinerem Korpus zur wirtschaftlicheren Lösung.

Entscheidungsbaum

Passt die gesamte Wissensbasis komfortabel ins Kontextfenster?
├── Nein → RAG
└── Ja
    └── Ändern sich die Daten häufig oder brauchst du Rechte-Filter?
        ├── Ja → RAG (oder Hybrid)
        └── Nein → CAG

Die Kombination

RAG und CAG schließen sich nicht aus. Ein bewährtes Hybrid-Muster:

  1. Kern-Wissen (stabil, für alle gleich) liegt dauerhaft gecacht im Kontext
  2. Long-Tail-Wissen (groß, dynamisch, rechtegebunden) kommt per Retrieval aus der Vektordatenbank dazu

So kombinierst du die Zuverlässigkeit von CAG für das Wichtigste mit der Skalierbarkeit von RAG für den Rest – und sparst gleichzeitig Tokens, weil der gecachte Teil nicht bei jeder Anfrage neu berechnet wird.

Faustregel: Starte mit dem einfachsten Ansatz, der funktioniert. Für viele kleine Wissensbasen ist das heute CAG – RAG wird erst nötig, wenn Umfang, Änderungsrate oder Zugriffsrechte es erzwingen. Und weil beide Ansätze dieselben aufbereiteten Dokumente nutzen, ist der spätere Wechsel von CAG zu RAG kein Neuanfang, sondern ein Ausbau.

03Entscheidungshilfe

Was passt zu welchem Vorhaben?

Keine Gesamtnote – die Empfehlung hängt am Anwendungsfall.
  • Kleine, selten geänderte Wissensbasis

    Cache-Augmented Generation

    Wenn alles ins Kontextfenster passt, entfallen Infrastruktur und Retrieval-Fehler.

  • Großer oder häufig aktualisierter Korpus

    Retrieval Augmented Generation

    RAG lädt nur das Passende und bleibt bei wachsenden Datenmengen bezahlbar.

  • Zugriffsrechte pro Nutzer

    Retrieval Augmented Generation

    Nur beim Abruf lässt sich filtern, was jemand sehen darf.

04Begriffe

Die Begriffe hinter dem Vergleich

Künstliche Intelligenz29.08.

Retrieval Augmented Generation

auch: RAG

Kombination von LLMs mit externen Wissensdatenbanken für Genauigkeit.

3 MinFortgeschritten

Künstliche Intelligenz29.08.

Cache-Augmented Generation

auch: CAG

Wissensbasis komplett in den gecachten Kontext laden statt Retrieval.

2 MinFortgeschritten

05FAQ

Häufige Fragen

Ab welcher Korpusgröße ist CAG keine Option mehr?

Sobald die Wissensbasis das Kontextfenster des Modells sprengt – oder schon deutlich vorher, wenn die Antwortqualität durch sehr lange Kontexte leidet (Lost in the Middle). Als Faustregel: Passt der gesamte relevante Textbestand nicht mit komfortablem Puffer in den Kontext, brauchst du Retrieval.

Warum ist Prompt Caching für CAG so wichtig?

Ohne Caching müsste das Modell die komplette Wissensbasis bei jeder Anfrage neu verarbeiten – das wäre langsam und teuer. Mit KV-/Prompt-Caching wird der statische Teil des Kontexts einmal verarbeitet und wiederverwendet, sodass nur die eigentliche Frage neue Rechenarbeit kostet.

Kann ich RAG und CAG kombinieren?

Ja. Ein verbreitetes Muster: Häufig gebrauchte Kern-Dokumente (FAQ, Richtlinien, Produktbasics) liegen dauerhaft gecacht im Kontext, während seltener benötigtes Wissen per Retrieval aus der Vektordatenbank dazugeholt wird.

Ist CAG genauer als RAG?

Bei kleinen Korpora oft ja, weil kein Retrieval-Schritt danebenliegen kann – das Modell sieht garantiert alle Informationen. Bei großen Korpora kippt das Bild: Sehr lange Kontexte verwässern die Aufmerksamkeit, und gezieltes Retrieval liefert dann die besseren Antworten.

06Redaktion

Stand und Methodik

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Vergleiche veralten schneller als Begriffe. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald der Vergleich nach seiner letzten Änderung geprüft wurde.

07Mehr Vergleiche

Passt thematisch dazu

Künstliche IntelligenzEntscheidung

Claude (Anthropic) Gemini

Verlässliche Agenten oder native Multimodalität?

Claude und Gemini spielen beide in der Spitzengruppe – mit klar unterschiedlichen Profilen. Claude überzeugt bei Coding, agentischen Workflows und überall dort, wo Ehrlichkeit und Zuverlässigkeit kritisch sind. Gemini punktet mit nativer Multimodalität bei der Eingabe und der nahtlosen Google-Integration. Beim Kontextfenster liegen beide bei einer Million Tokens. Wer bereits im Google-Ökosystem arbeitet oder Video und Audio verarbeitet, greift zu Gemini; wer Software baut oder verlässliche Agenten braucht, fährt mit Claude oft besser.

8 Kriterien · 4 Min
Künstliche IntelligenzEntscheidung

Mistral AI Llama

Europäische Offenheit oder größtes Ökosystem?

Beide Familien haben Open-Weight-KI auf Spitzenniveau gebracht – die Wahl ist eine Frage der Prioritäten. Mistral überzeugt mit europäischer DSGVO-Nähe, effizienten MoE-Modellen und der kompromisslos offenen Apache-2.0-Lizenz von Large 3. Llama 4 bietet das mit Abstand größte Ökosystem, native Multimodalität und mit Scout einen Rekord-Kontext von bis zu 10M Tokens – allerdings unter der restriktiveren Community License. Für EU-regulierte Branchen spricht viel für Mistral, für maximale Tooling-Auswahl und Community-Support für Llama.

8 Kriterien · 4 Min
Künstliche IntelligenzEntscheidung

ChatGPT / GPT Claude (Anthropic)

Welche Modellfamilie erfüllt deine Anforderungen an Kontext, Werkzeuge und Betrieb besser?

Beide Familien bieten aktuelle Spitzenmodelle für Text, Bilder, Werkzeuge und Reasoning. Entscheide nach Aufgabenprofil, benötigtem Kontext, Schnittstellen und einem Test mit eigenen Beispielen – nicht nach einem pauschalen Sieger.