Feature Engineering

Wie aus Rohdaten aussagekräftige Signale für Machine-Learning-Modelle werden

Der Prozess, aus Rohdaten aussagekräftige Merkmale (Features) zu extrahieren oder zu erstellen, die einem ML-Modell helfen, bessere Vorhersagen zu treffen.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Transformation von Rohdaten in informative Merkmale für ML-Modelle
  2. Oft entscheidender für die Modellqualität als die Wahl des Algorithmus
  3. Bei Deep Learning weniger nötig, da das Modell Features selbst lernt

Sofortantwort

Feature Engineering einfach erklärt

Merkmale werden aus Rohdaten für ML-Modelle erstellt.

Kurz gesagt
Transformation von Rohdaten in informative Merkmale für ML-Modelle
Typischer Einsatz
Tabellarische Daten, Textanalyse, Marketing
Wichtig zu wissen
Bei Deep Learning weniger nötig, da das Modell Features selbst lernt

Feature Engineering im Überblick

Feature Engineering wandelt Rohdaten in nützliche Merkmale um, die ein ML-Modell besser verarbeiten kann. Oft ist Feature Engineering wichtiger als die Wahl des Algorithmus!

Warum ist das wichtig?

Ein Modell kann nur lernen, was in den Daten steckt. Gute Features machen versteckte Muster sichtbar und können den Unterschied zwischen einem mittelmäßigen und einem exzellenten Modell ausmachen.

Beispiel: Aus einem Datumsstempel “2026-02-17 14:30:00” kannst du extrahieren:

  • Wochentag: Dienstag
  • Stunde: 14 (Nachmittag)
  • Monat: Februar (Winter)
  • Ist Wochenende: Nein
  • Tage seit letztem Kauf: 12

Bei Deep Learning weniger nötig: Neuronale Netze lernen Features automatisch aus Rohdaten. Aber bei tabellarischen Daten oder wenig Trainingsdaten hilft Feature Engineering auch hier.

Technisch betrachtet

Techniken

  • Numerische Features: Skalierung (Min-Max, Z-Score), Log-Transformation, Binning
  • Kategorische Features: One-Hot Encoding, Target Encoding, Frequency Encoding
  • Text Features: TF-IDF, Bag of Words, Embeddings
  • Zeitbasierte Features: Wochentag, Saison, Zeitdifferenzen, Rolling Averages
  • Interaktions-Features: Produkt, Verhältnis oder Differenz zweier Features

Automatisiertes Feature Engineering

Tools wie Featuretools generieren automatisch Features aus relationalen Daten durch:

  • Deep Feature Synthesis: Automatische Aggregation über Relationen
  • Feature Selection: Irrelevante Features automatisch entfernen
  • Feature Importance: Ranking der wichtigsten Features

Praxisbeispiele

Beispiel 1: Kreditrisikoanalyse

In der Kreditrisikoanalyse kann Feature Engineering entscheidend sein. Aus den Rohdaten eines Antragstellers, wie Einkommen, Beschäftigungsdauer und Kreditgeschichte, können Features wie:

  • Verhältnis von Schulden zu Einkommen
  • Anzahl der vorherigen Kredite
  • Durchschnittliche Rückzahlungsdauer extrahiert werden, um das Risiko eines Zahlungsausfalls besser zu bewerten.

Beispiel 2: Kundenverhalten im E-Commerce

Im E-Commerce können aus den Transaktionsdaten Features wie:

  • Durchschnittlicher Bestellwert
  • Häufigkeit der Käufe pro Monat
  • Zeit seit dem letzten Kauf generiert werden, um personalisierte Empfehlungen zu erstellen und das Kaufverhalten vorherzusagen.

Vor- und Nachteile

Vorteile

  • Verbesserte Modellleistung: Gut gestaltete Features können die Genauigkeit und Vorhersagekraft von Modellen erheblich steigern.
  • Erhöhte Interpretierbarkeit: Durch die Auswahl relevanter Features wird das Modell oft verständlicher und nachvollziehbarer.
  • Anpassungsfähigkeit: Feature Engineering ermöglicht es, Modelle an spezifische Probleme und Datensätze anzupassen.

Nachteile

  • Zeitaufwendig: Der Prozess kann viel Zeit in Anspruch nehmen, insbesondere bei großen Datensätzen.
  • Überanpassung: Zu viele Features können zu Overfitting führen, wo das Modell die Trainingsdaten zu gut lernt und auf neuen Daten schlecht abschneidet.
  • Komplexität: Die Auswahl und Erstellung der richtigen Features erfordert tiefes Fachwissen und Erfahrung.

Historischer Kontext

Feature Engineering hat sich parallel zur Entwicklung von Machine Learning und Data Science entwickelt. In den frühen Tagen der Datenanalyse lag der Fokus oft auf der Datenbereinigung und -vorbereitung. Mit der zunehmenden Komplexität von ML-Algorithmen und der Verfügbarkeit großer Datenmengen wurde die Bedeutung von Features erkannt. In den letzten Jahren haben sich automatisierte Techniken und Tools etabliert, die den Prozess erleichtern und beschleunigen, was zu einem verstärkten Einsatz von Feature Engineering in der Industrie geführt hat.

Schritt für Schritt

Wie aus Rohdaten brauchbare Merkmale werden

Feature Engineering beginnt mit einer fachlichen Frage und endet erst, wenn Merkmale in der späteren Anwendung zuverlässig verfügbar sind.

  1. Entscheidung und Zeitpunkt klären

    Rahmen

    Das Team definiert, was vorhergesagt werden soll und welche Informationen zum Zeitpunkt der Vorhersage tatsächlich vorliegen dürfen.

    Entscheidung + Zeitpunkt → erlaubte Daten
  2. Rohdaten untersuchen

    Verstehen

    Verteilungen, Lücken, Ausreißer und zeitliche Abhängigkeiten zeigen, welche Signale belastbar sein könnten.

    Rohdaten → Qualitätsprofil
  3. Merkmale ableiten

    Ableiten

    Aus Ereignissen und Stammdaten entstehen etwa Zeitabstände, Verhältnisse, Kategorien oder zusammengefasste Werte.

    Rohdaten → Features
  4. Mit einer Baseline vergleichen

    Prüfen

    Nur Merkmale, die auf getrennten Daten messbar helfen und im Betrieb erzeugbar sind, gehören in die Pipeline.

    Features → Evaluation → Auswahl

Konkretes Beispiel

Beispiel: Nachfrage im Handel prognostizieren

Ein Händler möchte die Bestellmenge für die kommende Woche planen.

Rohdaten allein

Die Tabelle enthält Bestellungen mit Datum, Produkt und Menge. Ein Modell erkennt daraus saisonale Muster nur eingeschränkt.

Kontextreiche Merkmale

Zusätzliche Features bilden Wochentag, Feiertage, Verkäufe der letzten Wochen und Lieferzeit ab. Die Prognose wird gegen eine einfache Vorjahres-Baseline getestet.

Ein gutes Feature bildet Information ab, die zum Entscheidungszeitpunkt verfügbar ist – es darf keine Zukunft verraten.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Macht fachliches Wissen für klassische ML-Modelle nutzbar.
  • Verbessert Qualität häufig stärker als ein früher Wechsel zu komplexeren Algorithmen.
  • Kann Modelle verständlicher machen, weil Merkmale klar benannt und geprüft sind.
  • Schafft wiederverwendbare Datenbausteine für mehrere Modelle und Teams.

Das solltest du beachten

  • Falsche Zeitbezüge können Data Leakage verursachen und Tests künstlich gut aussehen lassen.
  • Viele Merkmale erhöhen Pflegeaufwand, Komplexität und das Risiko widersprüchlicher Definitionen.
  • Merkmale können im Betrieb fehlen oder sich anders verhalten als im Training.
  • Automatisch erzeugte Features brauchen fachliche Prüfung, damit sie sinnvoll und fair bleiben.
Vertiefung · für Fortgeschrittene

Feature Engineering zwischen Daten und Modell

Merkmale verbinden Rohdaten mit einem lernenden Modell und brauchen eine überprüfbare, wiederholbare Pipeline.

Wissenskarte

Signale für Modelle

Dataset
Eine Sammlung strukturierter Daten für das Training von KI-Modellen.
Trainingsdaten
Datensätze, die das Lernen und die Leistung von Modellen bestimmen.
Data Quality
Messung und Sicherstellung der Qualität von Daten.
Machine Learning
Algorithmen, die aus Daten lernen und Vorhersagen treffen.
Feature Store
Zentrale Plattform zur Verwaltung von ML-Features.
Ein Feature ist nur dann wertvoll, wenn seine Definition, Verfügbarkeit und Wirkung auf unabhängigen Daten nachvollziehbar bleiben. Features gliedert sich in: Dataset, Trainingsdaten, Data Quality, Machine Learning, Feature Store.

01Einsatzbereiche

Wann ist Feature Engineering sinnvoll?

Geeignet für

  • Tabellarische DatenAus Zeitstempeln Features wie Wochentag, Stunde, Saison extrahieren
  • TextanalyseTF-IDF, Wortanzahl, Sentiment-Score als Features berechnen
  • MarketingAus Kaufhistorie Features wie Durchschnittsbestellwert, Kauffrequenz ableiten

↑ Inhalt

02Werkzeuge

Womit Feature Engineering umgesetzt wird

↑ Inhalt

Merksatz

Feature Engineering ist wie die Vorbereitung von Zutaten beim Kochen

Statt dem Koch (Modell) eine ganze Kartoffel zu geben, schneidest du sie in Würfel, schälst sie und würzt sie – so kann er ein besseres Gericht daraus machen.

  1. Transformation von Rohdaten in informative Merkmale für ML-Modelle
  2. Oft entscheidender für die Modellqualität als die Wahl des Algorithmus
  3. Bei Deep Learning weniger nötig, da das Modell Features selbst lernt

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Feature Engineering spielt.

↑ Inhalt

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Feature Engineering

Braucht man Feature Engineering bei Deep Learning?

Weniger als bei klassischem ML. Deep Learning lernt Features automatisch aus Rohdaten. Aber gutes Feature Engineering kann auch bei Deep Learning helfen, besonders bei tabellarischen Daten oder wenn wenig Trainingsdaten vorhanden sind.

Was sind die wichtigsten Feature-Engineering-Techniken?

Skalierung (Normalisierung, Standardisierung), Encoding (One-Hot, Label Encoding für Kategorien), Aggregation (Mittelwert, Summe über Gruppen), Interaktionen (Feature A × Feature B) und zeitbasierte Features.

Welche Techniken sind am effektivsten für Feature Engineering?

Effektive Techniken für Feature Engineering umfassen die Erstellung von Interaktionen zwischen Variablen, die Verwendung von Aggregationen und die Transformation von Variablen in geeignete Formate. Domain-Wissen spielt eine entscheidende Rolle bei der Auswahl der richtigen Features.

Wie kann ich die Bedeutung von Features bewerten?

Die Bedeutung von Features kann durch Techniken wie Feature Importance Scores, Permutation Feature Importance oder SHAP-Werte bewertet werden. Diese Methoden helfen, die Auswirkungen einzelner Features auf die Modellleistung zu quantifizieren.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Dataset

    Eine Sammlung strukturierter Daten für das Training von KI-Modellen.

  • Technisch vertiefen

    AutoML

    Automatisierung des Machine Learning-Prozesses.

↑ Inhalt