Sofortantwort
Confusion Matrix einfach erklärt
Tabelle zur Auswertung der Klassifikationsgenauigkeit.
- Kurz gesagt
- Vier Felder: True Positive, False Positive, True Negative, False Negative
- Typischer Einsatz
- Spam-Erkennung, Medizinische Diagnose, Content Moderation
- Wichtig zu wissen
- Zeigt nicht nur ob ein Modell gut ist, sondern WIE es Fehler macht
Confusion Matrix im Überblick
Vorhersage
Positiv Negativ
Tatsächlich Pos │ TP │ FN │
Neg │ FP │ TN │
TP = Richtig erkannt FP = Fehlalarm
FN = Übersehen TN = Richtig abgelehnt
Spam-Filter Beispiel:
- TP (True Positive): Spam korrekt als Spam erkannt ✅
- FP (False Positive): Normale Mail als Spam markiert ❌
- FN (False Negative): Spam nicht erkannt, im Posteingang ❌
- TN (True Negative): Normale Mail korrekt durchgelassen ✅
Technisch betrachtet
Abgeleitete Metriken
- Accuracy: (TP + TN) / Gesamt – Gesamtgenauigkeit
- Precision: TP / (TP + FP) – Wie viele Positive sind wirklich positiv?
- Recall: TP / (TP + FN) – Wie viele echte Positive wurden gefunden?
- F1-Score: Harmonisches Mittel von Precision und Recall
Multi-Class Confusion Matrix
Bei mehr als 2 Klassen wird die Matrix größer (N×N). Man sieht genau welche Klassen verwechselt werden – z.B. ob ein Modell Hunde und Wölfe verwechselt.
Normalisierung
Confusion Matrices können normalisiert werden:
- Zeilen-Normalisierung: Jede Zeile summiert zu 1 → zeigt Recall pro Klasse
- Spalten-Normalisierung: Jede Spalte summiert zu 1 → zeigt Precision pro Klasse
- Gesamt-Normalisierung: Alle Zellen summieren zu 1 → zeigt Verteilung
Typische Fehleranalyse
Hohe False Positives (FP)?
- Modell ist zu “optimistisch” / sensitiv
- Schwellwert erhöhen oder mehr negative Beispiele trainieren
Hohe False Negatives (FN)?
- Modell übersieht zu viele positive Fälle
- Schwellwert senken oder Klasse besser repräsentieren
Asymmetrische Fehler?
- Klassenungleichgewicht in den Trainingsdaten
- Resampling oder Class Weights verwenden
Code-Beispiel (Python)
from sklearn.metrics import confusion_matrix, ConfusionMatrixDisplay
import matplotlib.pyplot as plt
y_true = [0, 1, 1, 0, 1, 0, 1, 1]
y_pred = [0, 1, 0, 0, 1, 1, 1, 1]
cm = confusion_matrix(y_true, y_pred)
disp = ConfusionMatrixDisplay(cm, display_labels=['Negativ', 'Positiv'])
disp.plot(cmap='Blues')
plt.show()Schritt für Schritt
Fehlerbilder mit einer Confusion Matrix untersuchen
Die Matrix ist der Ausgangspunkt für die Evaluation: Sie zeigt, welche Art von Fehlern ein Modell produziert, bevor Kennzahlen diese Fehler zu einer Zahl verdichten.
Positive Klasse und Entscheidung klären
01
Definiere, was als positiver Fall gilt, wer die Vorhersage nutzt und welche Folge beide Fehlertypen haben.
Positive Klasse + Entscheidung + FehlerfolgenRepräsentatives Testset vorbereiten
02
Halte Testdaten getrennt von Training und prüfe, ob relevante Fälle und Gruppen ausreichend abgebildet sind.
Testdaten → Labels prüfen → Segmente festhaltenSchwellenwert transparent wählen
03
Ein Score wird erst durch eine Grenze zur positiven oder negativen Entscheidung; diese Grenze ist eine fachliche Abwägung.
Score + Schwelle → Positiv / NegativVier Fehlerfelder lesen
04
Untersuche True Positives, False Positives, False Negatives und True Negatives getrennt nach Kontexten.
TP | FP | FN | TN → FehlermusterMaßnahmen und Fallbacks ableiten
05
Verbessere Daten, Modell, Schwelle oder menschliche Prüfung auf Basis der tatsächlich problematischen Fehler.
Fehlerbild → Maßnahme → Re-Evaluation
Konkretes Beispiel
Beispiel: Priorisierung von Support-Tickets
Ein Modell markiert Tickets, die möglichst schnell von Spezialisten geprüft werden sollen.
Fehlerfrage
Ist es problematischer, ein dringendes Ticket zu übersehen, oder ein normales Ticket zusätzlich prüfen zu lassen?
Bewertbarer Trade-off
Die Matrix zeigt beide Fehlerarten auf realen Testfällen. Das Team wählt die Schwelle so, dass die gewünschte Prüfpraxis und Ressourcenplanung zusammenpassen.
Die richtige Matrix ist nicht die mit den wenigsten Fehlern insgesamt, sondern die mit einem verantwortbaren Fehlerprofil im Einsatzkontext.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Fehler werden konkret: Teams sehen, ob das Modell eher übersieht oder zu viele Fehlalarme erzeugt.
- Gute Grundlage für Kennzahlen: Precision, Recall und F1 lassen sich auf ein verständliches Fehlerbild zurückführen.
- Segmentierbar: Unterschiede nach Falltyp oder Zielgruppe können gezielt geprüft werden.
Das solltest du beachten
- Schwellenabhängig: Eine Matrix beschreibt immer eine konkrete Entscheidungsgrenze.
- Datenabhängig: Verzerrte oder fehlerhafte Labels führen zu einem falschen Bild der Modellgüte.
- Keine Ursachenanalyse: Die Matrix zeigt ein Fehlerbild, nicht automatisch den Grund dafür.
Vertiefung · für FortgeschritteneVon Vorhersagen zum Fehlerprofil
Scores, wahre Labels und eine Entscheidungsgrenze ergeben das konkrete Fehlerbild eines Klassifikators.
Vier Felder machen richtige und falsche Klassifikationen sichtbar.