Klassifikation (Classification)

Klassifikation ist eine Machine-Learning-Aufgabe, bei der ein Modell Eingaben einer von mehreren festen Kategorien zuordnet – etwa E-Mails als Spam oder Nicht-Spam, oder Bilder nach ihrem Inhalt.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Ordnet Eingaben einer von mehreren diskreten Klassen zu (im Gegensatz zur Regression)
  2. Binär (zwei Klassen) oder multiklassen (mehrere Kategorien)
  3. Bewertung über Metriken wie Accuracy, Precision, Recall und F1-Score

Sofortantwort

Klassifikation einfach erklärt

ML-Aufgabe, bei der Eingaben festen Kategorien zugeordnet werden.

Kurz gesagt
Ordnet Eingaben einer von mehreren diskreten Klassen zu (im Gegensatz zur Regression)
Typischer Einsatz
Spam-Erkennung, Medizinische Diagnose, Sentiment-Analyse
Wichtig zu wissen
Bewertung über Metriken wie Accuracy, Precision, Recall und F1-Score

Klassifikation im Überblick

Klassifikation ist eine der grundlegendsten Aufgaben im Machine Learning. Ein Modell lernt aus Beispielen, Eingaben einer von mehreren festen Kategorien (Klassen) zuzuordnen. Im Unterschied zur Regression, die einen Zahlenwert vorhersagt, ist das Ergebnis hier eine Kategorie.

Typische Beispiele: Ist diese E-Mail Spam? Zeigt dieses Bild eine Katze, einen Hund oder ein Auto? Wird dieser Kunde kündigen oder nicht? Das Modell wird mit vielen bereits korrekt zugeordneten Beispielen trainiert (überwachtes Lernen) und lernt dabei, welche Merkmale für welche Klasse sprechen.

Technisch betrachtet

Arten der Klassifikation

  • Binär – zwei Klassen (Spam / Nicht-Spam)
  • Multiklassen – mehr als zwei sich ausschließende Klassen (Ziffer 0–9)
  • Multilabel – eine Eingabe kann mehreren Klassen zugleich angehören (Tags eines Artikels)

Gängige Algorithmen

AlgorithmusStärke
Logistische Regressioneinfach, gut interpretierbar
Naive Bayesschnell, robust bei Text
Entscheidungsbäume / Random Forestnichtlinear, wenig Vorverarbeitung nötig
Neuronale Netzekomplexe Muster, große Datenmengen

Bewertung

Die reine Trefferquote (Accuracy) täuscht bei unausgewogenen Daten. Aussagekräftiger sind:

  • Precision – wie viele der als positiv vorhergesagten Fälle stimmen?
  • Recall – wie viele der tatsächlich positiven Fälle wurden gefunden?
  • F1-Score – das harmonische Mittel aus beiden
  • ROC-Kurve / AUC – Verhalten über alle Schwellenwerte hinweg

01Einsatzbereiche

Wann ist Klassifikation sinnvoll?

Geeignet für

  • Spam-ErkennungE-Mails automatisch in Spam und Nicht-Spam einteilen
  • Medizinische DiagnoseAuffälligkeiten in Bildern oder Laborwerten als gutartig oder bösartig einstufen
  • Sentiment-AnalyseTexte als positiv, neutral oder negativ klassifizieren
  • BilderkennungObjekte auf Fotos einer von vielen Kategorien zuordnen

↑ Inhalt

02Werkzeuge

Womit Klassifikation umgesetzt wird

↑ Inhalt

Merksatz

Klassifikation ist wie das Sortieren der Post

Jeder Brief landet in genau einem Fach – Rechnung, Werbung oder Privat. Das Modell lernt aus vielen vorsortierten Beispielen, welche Merkmale für welches Fach sprechen.

  1. Ordnet Eingaben einer von mehreren diskreten Klassen zu (im Gegensatz zur Regression)
  2. Binär (zwei Klassen) oder multiklassen (mehrere Kategorien)
  3. Bewertung über Metriken wie Accuracy, Precision, Recall und F1-Score

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Klassifikation

Was ist der Unterschied zwischen Klassifikation und Regression?

Klassifikation sagt eine diskrete Kategorie voraus (z. B. Spam/Nicht-Spam), Regression einen kontinuierlichen Zahlenwert (z. B. einen Preis). Beide sind überwachte Lernaufgaben, unterscheiden sich aber in der Art der Zielgröße.

Warum ist Accuracy nicht immer die beste Metrik?

Bei unausgewogenen Datensätzen kann ein Modell hohe Accuracy erreichen, indem es einfach immer die häufigste Klasse vorhersagt. Metriken wie Precision, Recall und F1-Score zeigen dann besser, wie gut das Modell wirklich ist.

Was ist binäre versus multiklassen Klassifikation?

Bei binärer Klassifikation gibt es genau zwei mögliche Klassen (ja/nein). Bei multiklassen Klassifikation sind es drei oder mehr. Multilabel-Klassifikation erlaubt zudem, dass eine Eingabe gleichzeitig mehreren Klassen angehört.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    SMOTE

    Synthetische Datenpunkte für unterrepräsentierte Klassen erzeugen.

  • Technisch vertiefen

    ROC Curve

    Visualisiert Klassifikator-Performance über alle Schwellenwerte.

↑ Inhalt