Der fundamentale Unterschied
Die zwei Hauptkategorien des Machine Learning unterscheiden sich in einer Frage: Hast du die richtigen Antworten (Labels)?
- Supervised: Ja, ich habe Input-Output-Paare zum Lernen
- Unsupervised: Nein, ich habe nur Inputs und suche Muster
Supervised Learning
Das Modell lernt aus Beispielen mit bekannten Antworten.
Trainingsdaten:
| E-Mail-Text | Label |
|-----------------------|----------|
| "Gewinn 1 Million..." | Spam |
| "Meeting morgen 10h" | Kein Spam|
| "Klicke hier sofort" | Spam |
-> Modell lernt: Welche Muster führen zu "Spam"?
-> Kann neue E-Mails klassifizieren
Typische Algorithmen:
- Lineare/Logistische Regression
- Decision Trees, Random Forest
- Support Vector Machines
- Neuronale Netze (für Klassifikation/Regression)
Unsupervised Learning
Das Modell findet Strukturen ohne vorgegebene Antworten.
Daten:
| Kunde | Alter | Einkommen | Käufe/Monat |
|-------|-------|-----------|-------------|
| A | 25 | 30k | 2 |
| B | 45 | 80k | 8 |
| C | 23 | 28k | 3 |
-> Modell findet: "Es gibt 3 Kundengruppen"
-> Du interpretierst: "Jung/Wenig", "Mittel", "Premium"
Typische Algorithmen:
- K-Means Clustering
- Hierarchisches Clustering
- PCA (Dimensionsreduktion)
- Autoencoders
Wann welche Methode?
| Situation | Methode |
|---|---|
| ”Ist diese E-Mail Spam?” | Supervised (Klassifikation) |
| “Wie viel kostet das Haus?” | Supervised (Regression) |
| “Welche Kundengruppen gibt es?” | Unsupervised (Clustering) |
| “Welche Features sind wichtig?” | Unsupervised (Dimensionsreduktion) |
| “Ist dieser Datenpunkt ungewöhnlich?” | Unsupervised (Anomalieerkennung) |
In der Praxis: Kombination
Oft nutzt man beide Ansätze zusammen:
1. Unsupervised: Clustering zur Kundensegmentierung
2. Supervised: Vorhersage, in welches Segment neue Kunden fallen
Oder:
1. Unsupervised: PCA zur Dimensionsreduktion
2. Supervised: Klassifikation auf reduzierten Features