<EbeneX/>
Aspekt Supervised Learning Unsupervised Learning
Trainingsdaten Gelabelte Daten (Input + Output) Nur Inputs (keine Labels)
Ziel Vorhersage von Labels/Werten Muster und Strukturen finden
Typische Aufgaben Klassifikation, Regression Clustering, Dimensionsreduktion
Beispiele Spam-Erkennung, Preisvorhersage Kundensegmentierung, Anomalieerkennung
Daten-Aufwand Hoch (Labeling nötig) Niedriger (keine Labels)
Evaluation Klar (Accuracy, F1, etc.) Schwieriger (Silhouette, etc.)
Interpretierbarkeit Klare Vorhersagen Cluster müssen interpretiert werden
Fazit Kommt auf den Use Case an

Supervised für klare Vorhersage-Aufgaben mit gelabelten Daten. Unsupervised für Exploration und wenn keine Labels verfügbar sind.

Der fundamentale Unterschied

Die zwei Hauptkategorien des Machine Learning unterscheiden sich in einer Frage: Hast du die richtigen Antworten (Labels)?

  • Supervised: Ja, ich habe Input-Output-Paare zum Lernen
  • Unsupervised: Nein, ich habe nur Inputs und suche Muster

Supervised Learning

Das Modell lernt aus Beispielen mit bekannten Antworten.

Trainingsdaten:
| E-Mail-Text           | Label    |
|-----------------------|----------|
| "Gewinn 1 Million..." | Spam     |
| "Meeting morgen 10h"  | Kein Spam|
| "Klicke hier sofort"  | Spam     |

-> Modell lernt: Welche Muster führen zu "Spam"?
-> Kann neue E-Mails klassifizieren

Typische Algorithmen:

  • Lineare/Logistische Regression
  • Decision Trees, Random Forest
  • Support Vector Machines
  • Neuronale Netze (für Klassifikation/Regression)

Unsupervised Learning

Das Modell findet Strukturen ohne vorgegebene Antworten.

Daten:
| Kunde | Alter | Einkommen | Käufe/Monat |
|-------|-------|-----------|-------------|
| A     | 25    | 30k       | 2           |
| B     | 45    | 80k       | 8           |
| C     | 23    | 28k       | 3           |

-> Modell findet: "Es gibt 3 Kundengruppen"
-> Du interpretierst: "Jung/Wenig", "Mittel", "Premium"

Typische Algorithmen:

  • K-Means Clustering
  • Hierarchisches Clustering
  • PCA (Dimensionsreduktion)
  • Autoencoders

Wann welche Methode?

SituationMethode
”Ist diese E-Mail Spam?”Supervised (Klassifikation)
“Wie viel kostet das Haus?”Supervised (Regression)
“Welche Kundengruppen gibt es?”Unsupervised (Clustering)
“Welche Features sind wichtig?”Unsupervised (Dimensionsreduktion)
“Ist dieser Datenpunkt ungewöhnlich?”Unsupervised (Anomalieerkennung)

In der Praxis: Kombination

Oft nutzt man beide Ansätze zusammen:

1. Unsupervised: Clustering zur Kundensegmentierung
2. Supervised: Vorhersage, in welches Segment neue Kunden fallen

Oder:

1. Unsupervised: PCA zur Dimensionsreduktion
2. Supervised: Klassifikation auf reduzierten Features

Häufige Fragen

Was ist Semi-Supervised Learning?

Eine Kombination: Wenige gelabelte + viele ungelabelte Daten. Das Modell lernt Strukturen aus den ungelabelten Daten und nutzt die Labels zur Feinabstimmung. Nützlich wenn Labeling teuer ist.

Ist Deep Learning supervised oder unsupervised?

Beides möglich. CNNs für Bildklassifikation sind supervised. Autoencoders und GANs sind unsupervised. LLM Pre-Training ist self-supervised (eine Form von unsupervised).

Welche Methode brauche ich für mein Problem?

Hast du Labels und willst Vorhersagen machen? → Supervised. Willst du Muster finden oder hast keine Labels? → Unsupervised. Oft nutzt man beide: Unsupervised für Feature Engineering, dann Supervised für Vorhersage.