Datenvorverarbeitung (Preprocessing)

Wie Teams Rohdaten nachvollziehbar bereinigen, transformieren und als reproduzierbare Pipeline für Modelltraining und Betrieb bereitstellen.

Datenvorverarbeitung umfasst alle Schritte, mit denen Rohdaten für ein Machine-Learning-Modell aufbereitet werden – von der Bereinigung über die Skalierung bis zur Kodierung. Sie entscheidet oft mehr über den Erfolg als das Modell selbst.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Aufbereitung von Rohdaten in eine für Modelle nutzbare, saubere Form
  2. Umfasst Bereinigung, Umgang mit fehlenden Werten, Skalierung und Kodierung
  3. Oft der zeitaufwendigste und ergebnisentscheidendste Schritt im ML-Workflow

Sofortantwort

Datenvorverarbeitung einfach erklärt

Aufbereitung von Rohdaten in eine für ML-Modelle nutzbare Form.

Kurz gesagt
Aufbereitung von Rohdaten in eine für Modelle nutzbare, saubere Form
Typischer Einsatz
Fehlende Werte behandeln, Merkmale skalieren, Kategorien kodieren
Wichtig zu wissen
Oft der zeitaufwendigste und ergebnisentscheidendste Schritt im ML-Workflow

Datenvorverarbeitung im Überblick

Datenvorverarbeitung (englisch Preprocessing) umfasst alle Schritte, mit denen Rohdaten so aufbereitet werden, dass ein Machine-Learning-Modell gut damit arbeiten kann. Echte Daten sind selten sauber: Sie enthalten Lücken, Fehler, unterschiedliche Maßeinheiten und Kategorien in Textform. Bevor ein Modell daraus lernen kann, müssen diese Probleme behoben werden.

In der Praxis ist die Vorverarbeitung oft der zeitaufwendigste Teil eines Projekts – und derjenige, der am stärksten über Erfolg oder Misserfolg entscheidet. Das beste Modell nützt nichts, wenn es mit schlechten Daten gefüttert wird.

Technisch betrachtet

Typische Schritte

SchrittZweck
BereinigungTippfehler, Duplikate, fehlerhafte Einträge entfernen
Fehlende Werteauffüllen (Imputation) oder entfernen
SkalierungWerte in vergleichbare Bereiche bringen
KodierungKategorien in Zahlen umwandeln (One-Hot, Label-Encoding)
Ausreißerextreme Werte erkennen und behandeln

Skalierung und Normalisierung

Viele Algorithmen reagieren empfindlich auf die Größenordnung der Merkmale. Wenn ein Merkmal in Tausendern und ein anderes zwischen 0 und 1 liegt, dominiert das größere unverhältnismäßig. Feature Scaling und Normalisierung gleichen das aus.

Vorsicht vor Data Leakage

Eine zentrale Regel: Die Parameter der Vorverarbeitung (z. B. Mittelwerte zum Skalieren) werden nur aus den Trainingsdaten gelernt und dann auf Validierungs- und Testdaten angewendet. Wird der gesamte Datensatz gemeinsam vorverarbeitet, sickert Wissen über die Testdaten ins Training – die Bewertung wird trügerisch gut.

Schritt für Schritt

Datenvorverarbeitung als kontrollierte Pipeline gestalten

Vorverarbeitung ist Teil des Modellsystems. Jeder Schritt braucht einen Zweck, eine dokumentierte Regel und dieselbe Anwendung in Training, Test und Betrieb.

  1. Daten und Zielgröße verstehen

    01

    Prüfe Herkunft, Bedeutung, Qualität, fehlende Werte und mögliche Verzerrungen, bevor Regeln festgelegt werden.

    Datenfeld → Bedeutung → Qualität → Risiko
  2. Split vor lernenden Transformationen erstellen

    02

    Trenne Training, Validierung und Test so früh, dass Informationen aus späteren Daten nicht zurück in das Training gelangen.

    Rohdaten → Train / Validierung / Test
  3. Transformationsregeln definieren

    03

    Bereinige, kodiere und skaliere mit expliziten Regeln statt mit stillen Einzelfallentscheidungen.

    fehlend → Regel | Kategorie → Encoding | Zahl → Skalierung
  4. Parameter nur auf Trainingsdaten lernen

    04

    Mittelwerte, Kategorien oder Imputationswerte werden im Training bestimmt und unverändert auf andere Daten angewendet.

    fit(train) → transform(validation / test / production)
  5. Pipeline testen und überwachen

    05

    Prüfe Schema, Wertebereiche und Ausfälle; Änderungen an Datenquellen lösen eine erneute Bewertung aus.

    Datencheck → Transformation → Modell → Monitoring

Konkretes Beispiel

Beispiel: Priorisierung eingehender Anfragen

Ein Modell nutzt Angaben aus Formularen, deren Qualität und Format sich zwischen Kanälen unterscheiden.

Rohdatenproblem

Einige Felder fehlen, Kategorien sind uneinheitlich geschrieben und numerische Werte liegen auf sehr verschiedenen Skalen.

Reproduzierbare Vorbereitung

Eine versionierte Pipeline vereinheitlicht Werte, behandelt fehlende Angaben nach dokumentierten Regeln und prüft neue Eingaben auf Schemaabweichungen.

Preprocessing ist nicht Aufräumarbeit am Rand, sondern ein überprüfbarer Teil der Produkt- und Modellqualität.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Bessere Modellgrundlage: Konsistente Eingaben verringern zufällige Fehler und unerklärliche Leistungsschwankungen.
  • Reproduzierbarkeit: Training, Evaluation und Betrieb können dieselben Regeln nachvollziehbar nutzen.
  • Frühere Datenprobleme: Fehlende Werte, Ausreißer und Schemaänderungen werden sichtbar, bevor sie still das Modell beeinflussen.

Das solltest du beachten

  • Regeln verändern Daten: Jede Imputation oder Bereinigung kann Informationen verlieren oder neue Verzerrungen einführen.
  • Mehr Pflege: Datenquellen und Transformationen müssen versioniert, getestet und betrieben werden.
  • Leakage-Risiko: Falsch platzierte Schritte können die Evaluation unbemerkt zu optimistisch machen.
Vertiefung · für Fortgeschrittene

Die Datenpipeline vor dem Modell

Rohdaten werden über kontrollierte Transformationen zu Modelleningaben – mit denselben Regeln in allen Phasen.

Wissenskarte

Versionierte Regeln, die Daten in eine nutzbare und prüfbare Form bringen.

Eine stabile Pipeline macht Datenqualität und Modellverhalten gemeinsam beobachtbar. Preprocessing Pipeline gliedert sich in: Datenquelle, Validierung, Bereinigung, Kodierung, Skalierung, Modellinput.

01Einsatzbereiche

Wann ist Datenvorverarbeitung sinnvoll?

Geeignet für

  • Fehlende Werte behandelnLücken im Datensatz auffüllen oder betroffene Zeilen entfernen
  • Merkmale skalierenWerte in vergleichbare Bereiche bringen, damit kein Merkmal dominiert
  • Kategorien kodierenTextkategorien in Zahlen umwandeln (z. B. One-Hot-Encoding)
  • Ausreißer behandelnExtreme oder fehlerhafte Werte erkennen und bereinigen

↑ Inhalt

02Werkzeuge

Womit Datenvorverarbeitung umgesetzt wird

↑ Inhalt

Merksatz

Datenvorverarbeitung ist wie die Vorbereitung der Zutaten beim Kochen

Bevor irgendetwas in die Pfanne kommt, wird gewaschen, geschält und klein geschnitten. Überspringt man das, wird das beste Rezept – das beste Modell – nicht gelingen.

  1. Aufbereitung von Rohdaten in eine für Modelle nutzbare, saubere Form
  2. Umfasst Bereinigung, Umgang mit fehlenden Werten, Skalierung und Kodierung
  3. Oft der zeitaufwendigste und ergebnisentscheidendste Schritt im ML-Workflow

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Datenvorverarbeitung

Warum ist Preprocessing so wichtig?

Modelle lernen aus den Daten, die sie bekommen. Sind diese unsauber, inkonsistent oder schlecht skaliert, leidet die Leistung – nach dem Prinzip ‚Garbage in, garbage out'. In der Praxis steckt oft der größte Teil der Arbeit in der Vorverarbeitung, nicht im Modell.

Was ist der Unterschied zwischen Preprocessing und Feature Engineering?

Preprocessing bringt Daten in eine saubere, nutzbare Form (Bereinigen, Skalieren, Kodieren). Feature Engineering geht weiter und erzeugt aus vorhandenen Daten neue, aussagekräftigere Merkmale. Die Grenzen sind fließend, Feature Engineering ist kreativer.

Sollte man Trainings- und Testdaten gemeinsam vorverarbeiten?

Nein. Parameter wie Mittelwert und Standardabweichung für die Skalierung dürfen nur aus den Trainingsdaten gelernt und dann auf die Testdaten angewendet werden. Sonst fließt Wissen über die Testdaten ein (Data Leakage) und die Bewertung wird zu optimistisch.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt