Supervised Learning

Aus Beispielen mit bekannten Zielwerten lernen

Eine Machine-Learning-Methode, bei der ein Modell aus gelabelten Beispieldaten lernt – also aus Eingaben mit bekannter korrekter Ausgabe.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Das Modell lernt aus Eingabe-Ausgabe-Paaren mit bekannter korrekter Antwort
  2. Zwei Hauptaufgaben: Klassifikation (Kategorien) und Regression (Zahlenwerte)
  3. Häufigste und am besten verstandene Form des Machine Learning

Sofortantwort

Supervised Learning einfach erklärt

Das Modell lernt aus gelabelten Daten mit bekannten Ausgaben.

Kurz gesagt
Das Modell lernt aus Eingabe-Ausgabe-Paaren mit bekannter korrekter Antwort
Typischer Einsatz
Spam-Erkennung, Immobilienpreise, Medizinische Diagnose
Wichtig zu wissen
Häufigste und am besten verstandene Form des Machine Learning

Supervised Learning im Überblick

Supervised Learning ist die häufigste Form des Machine Learning. Das Prinzip ist einfach: Du gibst dem Modell Beispiele mit der richtigen Antwort, und es lernt daraus Muster, um bei neuen Daten die richtige Antwort vorherzusagen. Supervised Learning ist die Grundlage der meisten produktiven KI-Systeme – Spam-Filter, Betrugserkennung, Bildklassifikation, Übersetzung. Der entscheidende Faktor ist die Qualität und Menge der gelabelten Trainingsdaten. Supervised Learning skaliert gut: Mehr Daten führen fast immer zu besseren Modellen, solange die Labels korrekt sind. Für viele Aufgaben ist Supervised Learning die erste Wahl – es ist gut verstanden, gut tooled und liefert zuverlässige Ergebnisse, wenn ausreichend gelabelte Daten vorhanden sind.

Die zwei Hauptaufgaben:

AufgabeAusgabeBeispielAlgorithmen
KlassifikationKategorieSpam/Kein SpamLogistic Regression, SVM, Random Forest
RegressionZahlenwertHauspreis: 350.000€Linear Regression, Gradient Boosting

Der Ablauf:

  1. Daten sammeln: Eingaben mit korrekten Labels versehen
  2. Modell trainieren: Algorithmus lernt Muster aus den Daten
  3. Evaluieren: Modell auf ungesehenen Testdaten prüfen
  4. Anwenden: Vorhersagen für neue, unbekannte Daten treffen

Technisch betrachtet

Klassische Algorithmen

Lineare Modelle:

  • Logistische Regression (Klassifikation)
  • Lineare Regression (Regression)
  • Schnell, interpretierbar, gut als Baseline

Baumbasierte Modelle:

  • Decision Trees: Einfach, aber anfällig für Overfitting
  • Random Forest: Ensemble aus vielen Bäumen, robust
  • Gradient Boosting (XGBoost, LightGBM): State-of-the-Art für tabellarische Daten

Support Vector Machines (SVM):

  • Findet optimale Trennebene zwischen Klassen
  • Kernel-Trick für nichtlineare Probleme
  • Gut bei kleinen bis mittleren Datensätzen

Evaluation

  • Accuracy: Anteil korrekter Vorhersagen
  • Precision/Recall: Wichtig bei unbalancierten Klassen
  • F1-Score: Harmonisches Mittel aus Precision und Recall
  • MSE/RMSE: Fehlermaße für Regression
  • Cross-Validation: Robuste Evaluation durch mehrfache Train/Test-Splits

Herausforderungen

  • Labeling-Aufwand: Gelabelte Daten sind teuer und zeitaufwändig
  • Overfitting: Modell lernt Trainingsdaten auswendig
  • Class Imbalance: Ungleiche Verteilung der Klassen
  • Feature Engineering: Relevante Merkmale müssen oft manuell erstellt werden

Schritt für Schritt

Ein überwachtes Modell trainieren und prüfen

Die Qualität überwachter Modelle hängt wesentlich davon ab, ob die Labels fachlich sinnvoll, vollständig und für neue Fälle repräsentativ sind.

  1. Ziel und Labelregeln definieren

    Definition

    Das Team beschreibt genau, was vorhergesagt werden soll und wie Menschen mehrdeutige Fälle einheitlich kennzeichnen.

    Eingabe → eindeutiger Zielwert
  2. Beispiele erfassen und prüfen

    Datenqualität

    Gelabelte Daten werden auf Fehler, fehlende Gruppen, Doppelungen und zeitliche Verzerrungen untersucht.

    Beispiele + Labels → Qualitätscheck
  3. Zusammenhang lernen

    Training

    Das Modell passt seine Parameter an, um Eingabe-Ausgabe-Paare im Training möglichst gut vorherzusagen.

    Merkmale → Klassifikation oder Regression
  4. Auf neuen Fällen bewerten

    Test

    Testdaten und fachliche Kennzahlen zeigen, ob das Modell generalisiert und welche Fehlerarten noch kritisch sind.

    Ungesehene Beispiele → Metriken

Konkretes Beispiel

Beispiel: Support-Tickets vorsortieren

Ein Service-Team möchte Tickets den Kategorien Rechnung, Zugang und technische Störung zuordnen.

Uneinheitliche Labels

Ähnliche Tickets wurden in der Vergangenheit unterschiedlich kategorisiert. Das Modell lernt dadurch widersprüchliche Muster.

Klare Labelrichtlinie

Fachleute definieren Kategorien und prüfen Beispiele. Das Modell wird auf späteren, unbekannten Tickets getestet und bei Unsicherheit an Menschen eskaliert.

Supervised Learning lernt die Entscheidungen in den Labels mit. Eine gute Labelrichtlinie ist deshalb Teil des eigentlichen Modells.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Liefert für klar definierte Zielwerte gut messbare Modelle.
  • Unterstützt Kategorien, Wahrscheinlichkeiten und Zahlenprognosen.
  • Erlaubt Evaluation auf getrennten Testdaten.
  • Ist mit vielen ausgereiften Algorithmen und Werkzeugen verfügbar.

Das solltest du beachten

  • Beschriftete Daten sind oft teuer und zeitaufwendig zu erstellen.
  • Fehlerhafte oder verzerrte Labels werden mitgelernt.
  • Neue Klassen und veränderte Daten können die Leistung stark senken.
  • Eine hohe Kennzahl kann problematische Teilgruppen verbergen.
Vertiefung · für Fortgeschrittene

Der Kreislauf gelabelter Daten

Labels verbinden fachliche Entscheidung und Modelltraining.

Wissenskarte

Aus Zielwerten lernen

Vor dem Skalieren von Datenmenge lohnt sich fast immer eine Prüfung, ob Ziel und Labelpraxis wirklich zur Aufgabe passen. Supervised Learning gliedert sich in: Rohdaten, Labelrichtlinie, Annotierte Daten, Modell, Testdaten, Feedback.

01Einsatzbereiche

Wann ist Supervised Learning sinnvoll?

Geeignet für

  • Spam-ErkennungE-Mails werden als 'Spam' oder 'Kein Spam' klassifiziert basierend auf gelabelten Beispielen
  • ImmobilienpreiseVorhersage von Hauspreisen basierend auf Merkmalen wie Größe, Lage und Baujahr
  • Medizinische DiagnoseErkennung von Krankheiten in Röntgenbildern anhand annotierter Beispiele

↑ Inhalt

02Werkzeuge

Womit Supervised Learning umgesetzt wird

↑ Inhalt

Merksatz

Supervised Learning ist wie Lernen mit Lösungsbuch

Du bearbeitest Aufgaben, vergleichst deine Antwort mit der Musterlösung und verbesserst dich mit jeder Übung.

  1. Das Modell lernt aus Eingabe-Ausgabe-Paaren mit bekannter korrekter Antwort
  2. Zwei Hauptaufgaben: Klassifikation (Kategorien) und Regression (Zahlenwerte)
  3. Häufigste und am besten verstandene Form des Machine Learning

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Supervised Learning spielt.

↑ Inhalt

04Anwenden

Supervised Learning praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Supervised Learning

Was bedeutet 'supervised' in Supervised Learning?

Der Begriff kommt von 'Supervision' (Aufsicht). Die gelabelten Trainingsdaten fungieren als 'Lehrer', der dem Modell die richtige Antwort zeigt. Das Modell lernt unter dieser Aufsicht.

Was ist der Unterschied zwischen Klassifikation und Regression?

Klassifikation ordnet Daten in Kategorien ein (z.B. Spam/Kein Spam, Katze/Hund). Regression sagt einen kontinuierlichen Zahlenwert vorher (z.B. Preis, Temperatur, Alter).

Wie viele gelabelte Daten braucht man?

Das hängt von der Komplexität ab. Einfache Aufgaben: 100-1.000 Beispiele. Komplexe Bildklassifikation: 10.000+. Transfer Learning kann den Bedarf drastisch reduzieren.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt