Sofortantwort
Klassifikation einfach erklärt
ML-Aufgabe, bei der Eingaben festen Kategorien zugeordnet werden.
- Kurz gesagt
- Ordnet Eingaben einer von mehreren diskreten Klassen zu (im Gegensatz zur Regression)
- Typischer Einsatz
- Spam-Erkennung, Medizinische Diagnose, Sentiment-Analyse
- Wichtig zu wissen
- Bewertung über Metriken wie Accuracy, Precision, Recall und F1-Score
Klassifikation im Überblick
Klassifikation ist eine der grundlegendsten Aufgaben im Machine Learning. Ein Modell lernt aus Beispielen, Eingaben einer von mehreren festen Kategorien (Klassen) zuzuordnen. Im Unterschied zur Regression, die einen Zahlenwert vorhersagt, ist das Ergebnis hier eine Kategorie.
Typische Beispiele: Ist diese E-Mail Spam? Zeigt dieses Bild eine Katze, einen Hund oder ein Auto? Wird dieser Kunde kündigen oder nicht? Das Modell wird mit vielen bereits korrekt zugeordneten Beispielen trainiert (überwachtes Lernen) und lernt dabei, welche Merkmale für welche Klasse sprechen.
Technisch betrachtet
Arten der Klassifikation
- Binär – zwei Klassen (Spam / Nicht-Spam)
- Multiklassen – mehr als zwei sich ausschließende Klassen (Ziffer 0–9)
- Multilabel – eine Eingabe kann mehreren Klassen zugleich angehören (Tags eines Artikels)
Gängige Algorithmen
| Algorithmus | Stärke |
|---|---|
| Logistische Regression | einfach, gut interpretierbar |
| Naive Bayes | schnell, robust bei Text |
| Entscheidungsbäume / Random Forest | nichtlinear, wenig Vorverarbeitung nötig |
| Neuronale Netze | komplexe Muster, große Datenmengen |
Bewertung
Die reine Trefferquote (Accuracy) täuscht bei unausgewogenen Daten. Aussagekräftiger sind:
- Precision – wie viele der als positiv vorhergesagten Fälle stimmen?
- Recall – wie viele der tatsächlich positiven Fälle wurden gefunden?
- F1-Score – das harmonische Mittel aus beiden
- ROC-Kurve / AUC – Verhalten über alle Schwellenwerte hinweg