Feature Drift

Eine Veränderung in der statistischen Verteilung der Eingabe-Features eines ML-Modells über Zeit – kann zu Leistungseinbußen führen, auch wenn das Modell selbst unverändert ist.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Eingabedaten verändern sich, Modell bleibt gleich → Performance sinkt
  2. Unterschied zu Concept Drift: Features ändern sich, nicht die Beziehung zum Target
  3. Erfordert kontinuierliches Monitoring und ggf. Retraining

Sofortantwort

Feature Drift einfach erklärt

Veränderung der Eingabedaten-Verteilung über Zeit.

Kurz gesagt
Eingabedaten verändern sich, Modell bleibt gleich → Performance sinkt
Typischer Einsatz
Marketing, Finanzwesen, Fraud Detection
Wichtig zu wissen
Erfordert kontinuierliches Monitoring und ggf. Retraining

Feature Drift im Überblick

Feature Drift ist eine spezifische Form von Data Drift: Die statistischen Eigenschaften der Input-Features eines ML-Modells verändern sich über die Zeit. Das Modell wurde auf einer bestimmten Feature-Verteilung trainiert – wenn sich diese Verteilung in Produktion verschiebt, werden die Vorhersagen unzuverlässig. Feature Drift ist oft der erste Indikator, bevor sich Modell-Performance-Metriken verschlechtern.

Feature Drift bedeutet, dass sich die Eingabedaten deines Modells verändern, obwohl das Modell selbst unverändert bleibt. Das Modell wurde auf Daten von “gestern” trainiert, aber die Daten von “heute” sehen anders aus.

Beispiel:

Training (2023): Durchschnittsalter der Kunden = 35 Jahre
Produktion (2024): Durchschnittsalter der Kunden = 28 Jahre
-> Modell wurde nie auf jüngere Kunden trainiert
-> Vorhersagen werden unzuverlässig

Warum passiert das?

  • Saisonale Veränderungen (Weihnachten vs. Sommer)
  • Marktveränderungen (neue Konkurrenz, Trends)
  • Nutzerverhalten ändert sich
  • Datenquellen ändern sich (neues Tracking, andere Formate)

Technisch betrachtet

Drift-Typen

TypWas ändert sichBeispiel
Feature DriftP(X)Altersverteilung der Kunden
Concept DriftP(Y|X)Was “Kaufwahrscheinlich” bedeutet
Label DriftP(Y)Anteil positiver Klassen

Erkennung mit PSI (Population Stability Index)

import numpy as np

def calculate_psi(expected, actual, bins=10):
    """Population Stability Index berechnen"""
    expected_percents = np.histogram(expected, bins=bins)[0] / len(expected)
    actual_percents = np.histogram(actual, bins=bins)[0] / len(actual)
    
    psi = np.sum((actual_percents - expected_percents) * 
                  np.log(actual_percents / expected_percents))
    return psi

# PSI < 0.1: Kein Drift
# PSI 0.1-0.2: Leichter Drift
# PSI > 0.2: Signifikanter Drift

Monitoring-Pipeline

Produktion-Daten → Feature-Statistiken berechnen

                   Mit Baseline vergleichen

              Drift erkannt? → Alert + Dashboard

              Schwellwert überschritten? → Retraining triggern

Best Practices

  • Baseline definieren: Referenz-Verteilung aus Trainingsdaten speichern
  • Automatisches Monitoring: Drift-Checks in Pipeline integrieren
  • Alerts konfigurieren: Bei signifikantem Drift benachrichtigen
  • Retraining-Strategie: Wann und wie wird neu trainiert?

01Einsatzbereiche

Wann ist Feature Drift sinnvoll?

Geeignet für

  • MarketingKaufverhalten ändert sich saisonal oder durch Trends
  • FinanzwesenMarktbedingungen und Kundenverhalten ändern sich
  • Fraud DetectionBetrugsmuster entwickeln sich weiter

↑ Inhalt

02Werkzeuge

Womit Feature Drift umgesetzt wird

↑ Inhalt

Merksatz

Feature Drift ist wie ein Wetterbericht, der auf historischen Daten basiert

Wenn sich das Klima ändert, werden die alten Muster unzuverlässig – auch wenn das Vorhersagemodell selbst perfekt funktioniert.

  1. Eingabedaten verändern sich, Modell bleibt gleich → Performance sinkt
  2. Unterschied zu Concept Drift: Features ändern sich, nicht die Beziehung zum Target
  3. Erfordert kontinuierliches Monitoring und ggf. Retraining

04Anwenden

Feature Drift praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Feature Drift

Was ist der Unterschied zwischen Feature Drift und Concept Drift?

Feature Drift: Die Eingabedaten ändern sich (z.B. Kunden werden älter). Concept Drift: Die Beziehung zwischen Features und Target ändert sich (z.B. was 'guter Kunde' bedeutet, ändert sich). Beides erfordert Retraining.

Wie erkenne ich Feature Drift?

Statistische Tests (KS-Test, PSI) vergleichen die Verteilung der aktuellen Daten mit den Trainingsdaten. Signifikante Abweichungen deuten auf Drift hin.

Wie oft sollte ich auf Drift prüfen?

Abhängig von der Anwendung: Echtzeit für kritische Systeme, täglich/wöchentlich für die meisten Anwendungen. Automatisiertes Monitoring mit Alerts ist empfehlenswert.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt