Sofortantwort
Datenvorverarbeitung einfach erklärt
Aufbereitung von Rohdaten in eine für ML-Modelle nutzbare Form.
- Kurz gesagt
- Aufbereitung von Rohdaten in eine für Modelle nutzbare, saubere Form
- Typischer Einsatz
- Fehlende Werte behandeln, Merkmale skalieren, Kategorien kodieren
- Wichtig zu wissen
- Oft der zeitaufwendigste und ergebnisentscheidendste Schritt im ML-Workflow
Datenvorverarbeitung im Überblick
Datenvorverarbeitung (englisch Preprocessing) umfasst alle Schritte, mit denen Rohdaten so aufbereitet werden, dass ein Machine-Learning-Modell gut damit arbeiten kann. Echte Daten sind selten sauber: Sie enthalten Lücken, Fehler, unterschiedliche Maßeinheiten und Kategorien in Textform. Bevor ein Modell daraus lernen kann, müssen diese Probleme behoben werden.
In der Praxis ist die Vorverarbeitung oft der zeitaufwendigste Teil eines Projekts – und derjenige, der am stärksten über Erfolg oder Misserfolg entscheidet. Das beste Modell nützt nichts, wenn es mit schlechten Daten gefüttert wird.
Technisch betrachtet
Typische Schritte
| Schritt | Zweck |
|---|---|
| Bereinigung | Tippfehler, Duplikate, fehlerhafte Einträge entfernen |
| Fehlende Werte | auffüllen (Imputation) oder entfernen |
| Skalierung | Werte in vergleichbare Bereiche bringen |
| Kodierung | Kategorien in Zahlen umwandeln (One-Hot, Label-Encoding) |
| Ausreißer | extreme Werte erkennen und behandeln |
Skalierung und Normalisierung
Viele Algorithmen reagieren empfindlich auf die Größenordnung der Merkmale. Wenn ein Merkmal in Tausendern und ein anderes zwischen 0 und 1 liegt, dominiert das größere unverhältnismäßig. Feature Scaling und Normalisierung gleichen das aus.
Vorsicht vor Data Leakage
Eine zentrale Regel: Die Parameter der Vorverarbeitung (z. B. Mittelwerte zum Skalieren) werden nur aus den Trainingsdaten gelernt und dann auf Validierungs- und Testdaten angewendet. Wird der gesamte Datensatz gemeinsam vorverarbeitet, sickert Wissen über die Testdaten ins Training – die Bewertung wird trügerisch gut.
Schritt für Schritt
Datenvorverarbeitung als kontrollierte Pipeline gestalten
Vorverarbeitung ist Teil des Modellsystems. Jeder Schritt braucht einen Zweck, eine dokumentierte Regel und dieselbe Anwendung in Training, Test und Betrieb.
Daten und Zielgröße verstehen
01
Prüfe Herkunft, Bedeutung, Qualität, fehlende Werte und mögliche Verzerrungen, bevor Regeln festgelegt werden.
Datenfeld → Bedeutung → Qualität → RisikoSplit vor lernenden Transformationen erstellen
02
Trenne Training, Validierung und Test so früh, dass Informationen aus späteren Daten nicht zurück in das Training gelangen.
Rohdaten → Train / Validierung / TestTransformationsregeln definieren
03
Bereinige, kodiere und skaliere mit expliziten Regeln statt mit stillen Einzelfallentscheidungen.
fehlend → Regel | Kategorie → Encoding | Zahl → SkalierungParameter nur auf Trainingsdaten lernen
04
Mittelwerte, Kategorien oder Imputationswerte werden im Training bestimmt und unverändert auf andere Daten angewendet.
fit(train) → transform(validation / test / production)Pipeline testen und überwachen
05
Prüfe Schema, Wertebereiche und Ausfälle; Änderungen an Datenquellen lösen eine erneute Bewertung aus.
Datencheck → Transformation → Modell → Monitoring
Konkretes Beispiel
Beispiel: Priorisierung eingehender Anfragen
Ein Modell nutzt Angaben aus Formularen, deren Qualität und Format sich zwischen Kanälen unterscheiden.
Rohdatenproblem
Einige Felder fehlen, Kategorien sind uneinheitlich geschrieben und numerische Werte liegen auf sehr verschiedenen Skalen.
Reproduzierbare Vorbereitung
Eine versionierte Pipeline vereinheitlicht Werte, behandelt fehlende Angaben nach dokumentierten Regeln und prüft neue Eingaben auf Schemaabweichungen.
Preprocessing ist nicht Aufräumarbeit am Rand, sondern ein überprüfbarer Teil der Produkt- und Modellqualität.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Bessere Modellgrundlage: Konsistente Eingaben verringern zufällige Fehler und unerklärliche Leistungsschwankungen.
- Reproduzierbarkeit: Training, Evaluation und Betrieb können dieselben Regeln nachvollziehbar nutzen.
- Frühere Datenprobleme: Fehlende Werte, Ausreißer und Schemaänderungen werden sichtbar, bevor sie still das Modell beeinflussen.
Das solltest du beachten
- Regeln verändern Daten: Jede Imputation oder Bereinigung kann Informationen verlieren oder neue Verzerrungen einführen.
- Mehr Pflege: Datenquellen und Transformationen müssen versioniert, getestet und betrieben werden.
- Leakage-Risiko: Falsch platzierte Schritte können die Evaluation unbemerkt zu optimistisch machen.
Vertiefung · für FortgeschritteneDie Datenpipeline vor dem Modell
Rohdaten werden über kontrollierte Transformationen zu Modelleningaben – mit denselben Regeln in allen Phasen.
Versionierte Regeln, die Daten in eine nutzbare und prüfbare Form bringen.