Agent Memory

Erinnerungen gezielt speichern, abrufen und vergessen

Mechanismen, die KI-Agenten ermöglichen, Informationen über Konversationen und Sitzungen hinweg zu speichern und abzurufen – für kontextbewusstes Handeln.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Short-term Memory: Aktueller Kontext innerhalb einer Sitzung
  2. Long-term Memory: Persistente Informationen über Sitzungen hinweg
  3. Working Memory: Aktive Informationen für die aktuelle Aufgabe

Sofortantwort

Agent Memory einfach erklärt

Speicher-Systeme für KI-Agenten: kurzfristig und langfristig.

Kurz gesagt
Short-term Memory: Aktueller Kontext innerhalb einer Sitzung
Typischer Einsatz
Persönliche Assistenten, Kundenservice-Bots, Coding-Assistenten
Wichtig zu wissen
Working Memory: Aktive Informationen für die aktuelle Aufgabe

Agent Memory im Überblick

Agent Memory ermöglicht KI-Agenten, sich an Dinge zu erinnern – innerhalb eines Gesprächs, über Gespräche hinweg, und über lange Zeiträume.

Die drei Memory-Typen:

┌─────────────────────────────────────────────────────┐
│                   Agent Memory                       │
├─────────────────┬─────────────────┬─────────────────┤
│  Short-term     │  Working        │  Long-term      │
│  Memory         │  Memory         │  Memory         │
├─────────────────┼─────────────────┼─────────────────┤
│ Aktuelle        │ Aktive Aufgabe  │ Persistente     │
│ Konversation    │ und Zwischener- │ Informationen   │
│                 │ gebnisse        │                 │
├─────────────────┼─────────────────┼─────────────────┤
│ Aktuelle Sitzung│ Aufgabe/Workflow│ Sitzungsübergreifend │
├─────────────────┼─────────────────┼─────────────────┤
│ Context Window  │ Scratchpad      │ Vektordatenbank │
└─────────────────┴─────────────────┴─────────────────┘

Beispiel – Persönlicher Assistent:

Session 1 (Montag):
User: "Ich bin Vegetarier und mag italienisch."
Agent: [Speichert in Long-term Memory]

Session 2 (Freitag):
User: "Empfiehl mir ein Restaurant für heute Abend."
Agent: [Ruft ab: Vegetarier, italienisch]
       "Wie wäre es mit dem 'Verde' – vegetarisch-italienisch, 
        hat heute Abend noch Plätze."

Ohne Memory müsste der User jedes Mal seine Präferenzen wiederholen.

Technisch betrachtet

Memory-Architekturen

1. Buffer Memory (einfachste Form):

class BufferMemory:
    def __init__(self, max_messages=10):
        self.messages = []
        self.max = max_messages
    
    def add(self, message):
        self.messages.append(message)
        if len(self.messages) > self.max:
            self.messages.pop(0)  # FIFO
    
    def get_context(self):
        return "\n".join(self.messages)

2. Summary Memory:

class SummaryMemory:
    def __init__(self, llm):
        self.summary = ""
        self.llm = llm
    
    def add(self, conversation):
        # LLM fasst zusammen
        self.summary = self.llm.summarize(
            f"Bisherige Zusammenfassung: {self.summary}\n"
            f"Neue Konversation: {conversation}"
        )

3. Vector Memory (Long-term):

class VectorMemory:
    def __init__(self, vector_db):
        self.db = vector_db
    
    def store(self, text, metadata):
        embedding = embed(text)
        self.db.upsert(embedding, text, metadata)
    
    def recall(self, query, k=5):
        query_embedding = embed(query)
        return self.db.search(query_embedding, top_k=k)

Memory-Strategien

Was speichern?

InformationSpeichern?Warum
User-Präferenzen✓ Long-termPersonalisierung
Fakten über User✓ Long-termKontext
Aufgaben-Ergebnisse✓ WorkingAktuelle Arbeit
Small TalkIrrelevant
Sensible Daten⚠️ VorsichtDSGVO

Wann abrufen?

def should_recall(query):
    # Semantische Relevanz prüfen
    if is_personal_question(query):
        return recall_user_preferences()
    if references_past(query):
        return recall_conversation_history()
    if is_task_continuation(query):
        return recall_working_memory()
    return None

Memory mit RAG kombinieren

User Query

    ├──→ Long-term Memory (User-spezifisch)
    │         │
    ├──→ Knowledge Base (RAG, allgemein)
    │         │
    └──→ Working Memory (aktuelle Aufgabe)


        Kombinierter Kontext


           LLM Response

Vergessens-Mechanismen

Zeitbasiert:

def decay_memory(memories, decay_rate=0.1):
    for memory in memories:
        memory.relevance *= (1 - decay_rate)
        if memory.relevance < threshold:
            delete(memory)

Relevanzbasiert:

def prune_memory(memories, max_size):
    if len(memories) > max_size:
        # Niedrigste Relevanz löschen
        memories.sort(key=lambda m: m.relevance)
        memories = memories[-max_size:]

Zusammenfassung:

def consolidate_memory(old_memories):
    # Ähnliche Erinnerungen zusammenfassen
    summary = llm.summarize(old_memories)
    delete(old_memories)
    store(summary)

Herausforderungen

ProblemLösung
Memory BloatVergessens-Mechanismen
Falsche ErinnerungenConfidence Scores, Verification
Langsamer AbrufIndexierung, Caching
DatenschutzEinwilligung, Encryption, Retention Policies, Löschkonzepte
InkonsistenzKonflikt-Resolution

Schritt für Schritt

Wie ein Agent mit Erinnerungen arbeitet

Memory ist keine vollständige Gesprächskopie. Ein gutes System entscheidet, was dauerhaft nützlich ist, wann es passt und wann es gelöscht wird.

  1. Information bewerten

    Auswahl

    Der Agent unterscheidet flüchtige Chatdetails von stabilen Präferenzen, Entscheidungen oder offenen Aufgaben.

    Ereignis → speichern oder verwerfen
  2. Strukturiert ablegen

    Speichern

    Eine Erinnerung erhält Inhalt, Zeit, Herkunft, Gültigkeit und gegebenenfalls Berechtigungen oder einen Embedding-Vektor.

    Fakt + Metadaten + Zugriff
  3. Situativ abrufen

    Retrieval

    Bei einer neuen Aufgabe sucht der Agent nur nach Erinnerungen, die zur Person, zum Projekt und zur Frage passen.

    Aufgabe → relevante Erinnerung
  4. Aktualisieren oder vergessen

    Pflege

    Neue Fakten ersetzen alte, abgelaufene Informationen werden entfernt und die Kontrolle bleibt bei der Person.

    neu → prüfen → ersetzen oder löschen

Konkretes Beispiel

Beispiel: Ein Projektassistent

Ein Team arbeitet über mehrere Sitzungen an einer Produkteinführung.

Ohne Memory

Zu Beginn jeder Sitzung muss das Team Ziele, bereits getroffene Entscheidungen und offene Risiken erneut erklären.

Mit kontrolliertem Memory

Der Assistent ruft nur die aktuellen Entscheidungen, Verantwortlichkeiten und offenen Risiken dieses Projekts ab und zeigt ihre Herkunft an.

Nützliches Memory ist selektiv und korrigierbar. Es darf keine unkontrollierte Sammlung von Gesprächsdaten werden.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Ermöglicht konsistente Zusammenarbeit über einzelne Sitzungen hinaus.
  • Reduziert Wiederholungen und spart Kontextfenster für die aktuelle Aufgabe.
  • Kann Präferenzen, Entscheidungen und Projekthistorie situationsbezogen bereitstellen.
  • Macht längere Agenten-Workflows robuster gegenüber Unterbrechungen.

Das solltest du beachten

  • Falsche oder veraltete Erinnerungen können Antworten verfälschen.
  • Zugriffsrechte, Löschung und Transparenz sind zentrale Produktanforderungen.
  • Unklare Speicherregeln führen zu Memory Bloat.
  • Die Auswahl relevanter Erinnerungen braucht Evaluation wie jedes Retrieval.
Vertiefung · für Fortgeschrittene

Kontrollierter Memory-Kreislauf

Kurzzeit-, Arbeits- und Langzeitgedächtnis erfüllen unterschiedliche Aufgaben.

Wissenskarte

Erinnerungen steuern

Persistenz ist nur dann hilfreich, wenn Herkunft, Gültigkeit und Kontrolle jeder Erinnerung sichtbar bleiben. Agent Memory gliedert sich in: Ereignisse, Bewertung, Arbeitsgedächtnis, Langzeitmemory, Retrieval, Löschung.

01Einsatzbereiche

Wann ist Agent Memory sinnvoll?

Geeignet für

  • Persönliche AssistentenErinnern sich an Nutzerpräferenzen und vergangene Gespräche
  • Kundenservice-BotsKennen Kundenhistorie und frühere Tickets
  • Coding-AssistentenVerstehen Projektkontext über Sessions hinweg
  • Research-AgentenAkkumulieren Wissen während langer Recherchen

↑ Inhalt

02Werkzeuge

Womit Agent Memory umgesetzt wird

↑ Inhalt

Merksatz

Agent Memory ist wie das Gedächtnis eines persönlichen Assistenten

Er erinnert sich an deine Vorlieben (Langzeit), an das aktuelle Gespräch (Kurzzeit), und an die Aufgabe, an der ihr gerade arbeitet (Arbeitsgedächtnis).

  1. Short-term Memory: Aktueller Kontext innerhalb einer Sitzung
  2. Long-term Memory: Persistente Informationen über Sitzungen hinweg
  3. Working Memory: Aktive Informationen für die aktuelle Aufgabe

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

Quellen (1)

↑ Inhalt

05FAQ

Häufige Fragen zu Agent Memory

Warum reicht das Context Window nicht als Memory?

Context Windows sind trotz wachsender Größen begrenzt, kostenintensiv und nicht automatisch persistent. Memory-Systeme speichern selektiv, abrufbar und kontrollierbar über Sessions hinweg.

Wie funktioniert Long-term Memory technisch?

Meist über Vektordatenbanken: Wichtige Informationen werden als Embeddings gespeichert und bei Bedarf semantisch abgerufen (ähnlich wie RAG).

Kann ein Agent zu viel erinnern?

Ja, 'Memory Bloat' ist ein Problem. Gute Systeme haben Vergessens-Mechanismen: Unwichtiges wird gelöscht, Altes wird zusammengefasst, Relevanz wird bewertet.

Ist Agent Memory DSGVO-relevant?

Ja, wenn personenbezogene Daten gespeichert werden. Löschrechte, Auskunftsrechte und Zweckbindung müssen beachtet werden.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt