Confusion Matrix

Wie Teams Klassifikationsfehler sichtbar machen, ihre Folgen bewerten und daraus passende Modell- und Prozessentscheidungen ableiten.

Eine Tabelle, die zeigt wie oft ein Klassifikationsmodell richtig und falsch lag – aufgeschlüsselt nach True/False Positives und Negatives.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Vier Felder: True Positive, False Positive, True Negative, False Negative
  2. Grundlage für Precision, Recall, F1-Score und Accuracy
  3. Zeigt nicht nur ob ein Modell gut ist, sondern WIE es Fehler macht

Sofortantwort

Confusion Matrix einfach erklärt

Tabelle zur Auswertung der Klassifikationsgenauigkeit.

Kurz gesagt
Vier Felder: True Positive, False Positive, True Negative, False Negative
Typischer Einsatz
Spam-Erkennung, Medizinische Diagnose, Content Moderation
Wichtig zu wissen
Zeigt nicht nur ob ein Modell gut ist, sondern WIE es Fehler macht

Confusion Matrix im Überblick

                    Vorhersage
                  Positiv  Negativ
Tatsächlich  Pos │  TP    │  FN   │
             Neg │  FP    │  TN   │

TP = Richtig erkannt    FP = Fehlalarm
FN = Übersehen          TN = Richtig abgelehnt

Spam-Filter Beispiel:

  • TP (True Positive): Spam korrekt als Spam erkannt ✅
  • FP (False Positive): Normale Mail als Spam markiert ❌
  • FN (False Negative): Spam nicht erkannt, im Posteingang ❌
  • TN (True Negative): Normale Mail korrekt durchgelassen ✅

Technisch betrachtet

Abgeleitete Metriken

  • Accuracy: (TP + TN) / Gesamt – Gesamtgenauigkeit
  • Precision: TP / (TP + FP) – Wie viele Positive sind wirklich positiv?
  • Recall: TP / (TP + FN) – Wie viele echte Positive wurden gefunden?
  • F1-Score: Harmonisches Mittel von Precision und Recall

Multi-Class Confusion Matrix

Bei mehr als 2 Klassen wird die Matrix größer (N×N). Man sieht genau welche Klassen verwechselt werden – z.B. ob ein Modell Hunde und Wölfe verwechselt.

Normalisierung

Confusion Matrices können normalisiert werden:

  • Zeilen-Normalisierung: Jede Zeile summiert zu 1 → zeigt Recall pro Klasse
  • Spalten-Normalisierung: Jede Spalte summiert zu 1 → zeigt Precision pro Klasse
  • Gesamt-Normalisierung: Alle Zellen summieren zu 1 → zeigt Verteilung

Typische Fehleranalyse

Hohe False Positives (FP)?

  • Modell ist zu “optimistisch” / sensitiv
  • Schwellwert erhöhen oder mehr negative Beispiele trainieren

Hohe False Negatives (FN)?

  • Modell übersieht zu viele positive Fälle
  • Schwellwert senken oder Klasse besser repräsentieren

Asymmetrische Fehler?

  • Klassenungleichgewicht in den Trainingsdaten
  • Resampling oder Class Weights verwenden

Code-Beispiel (Python)

from sklearn.metrics import confusion_matrix, ConfusionMatrixDisplay
import matplotlib.pyplot as plt

y_true = [0, 1, 1, 0, 1, 0, 1, 1]
y_pred = [0, 1, 0, 0, 1, 1, 1, 1]

cm = confusion_matrix(y_true, y_pred)
disp = ConfusionMatrixDisplay(cm, display_labels=['Negativ', 'Positiv'])
disp.plot(cmap='Blues')
plt.show()

Schritt für Schritt

Fehlerbilder mit einer Confusion Matrix untersuchen

Die Matrix ist der Ausgangspunkt für die Evaluation: Sie zeigt, welche Art von Fehlern ein Modell produziert, bevor Kennzahlen diese Fehler zu einer Zahl verdichten.

  1. Positive Klasse und Entscheidung klären

    01

    Definiere, was als positiver Fall gilt, wer die Vorhersage nutzt und welche Folge beide Fehlertypen haben.

    Positive Klasse + Entscheidung + Fehlerfolgen
  2. Repräsentatives Testset vorbereiten

    02

    Halte Testdaten getrennt von Training und prüfe, ob relevante Fälle und Gruppen ausreichend abgebildet sind.

    Testdaten → Labels prüfen → Segmente festhalten
  3. Schwellenwert transparent wählen

    03

    Ein Score wird erst durch eine Grenze zur positiven oder negativen Entscheidung; diese Grenze ist eine fachliche Abwägung.

    Score + Schwelle → Positiv / Negativ
  4. Vier Fehlerfelder lesen

    04

    Untersuche True Positives, False Positives, False Negatives und True Negatives getrennt nach Kontexten.

    TP | FP | FN | TN → Fehlermuster
  5. Maßnahmen und Fallbacks ableiten

    05

    Verbessere Daten, Modell, Schwelle oder menschliche Prüfung auf Basis der tatsächlich problematischen Fehler.

    Fehlerbild → Maßnahme → Re-Evaluation

Konkretes Beispiel

Beispiel: Priorisierung von Support-Tickets

Ein Modell markiert Tickets, die möglichst schnell von Spezialisten geprüft werden sollen.

Fehlerfrage

Ist es problematischer, ein dringendes Ticket zu übersehen, oder ein normales Ticket zusätzlich prüfen zu lassen?

Bewertbarer Trade-off

Die Matrix zeigt beide Fehlerarten auf realen Testfällen. Das Team wählt die Schwelle so, dass die gewünschte Prüfpraxis und Ressourcenplanung zusammenpassen.

Die richtige Matrix ist nicht die mit den wenigsten Fehlern insgesamt, sondern die mit einem verantwortbaren Fehlerprofil im Einsatzkontext.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Fehler werden konkret: Teams sehen, ob das Modell eher übersieht oder zu viele Fehlalarme erzeugt.
  • Gute Grundlage für Kennzahlen: Precision, Recall und F1 lassen sich auf ein verständliches Fehlerbild zurückführen.
  • Segmentierbar: Unterschiede nach Falltyp oder Zielgruppe können gezielt geprüft werden.

Das solltest du beachten

  • Schwellenabhängig: Eine Matrix beschreibt immer eine konkrete Entscheidungsgrenze.
  • Datenabhängig: Verzerrte oder fehlerhafte Labels führen zu einem falschen Bild der Modellgüte.
  • Keine Ursachenanalyse: Die Matrix zeigt ein Fehlerbild, nicht automatisch den Grund dafür.
Vertiefung · für Fortgeschrittene

Von Vorhersagen zum Fehlerprofil

Scores, wahre Labels und eine Entscheidungsgrenze ergeben das konkrete Fehlerbild eines Klassifikators.

Wissenskarte

Vier Felder machen richtige und falsche Klassifikationen sichtbar.

Die Matrix verbindet technische Modellvorhersagen mit der Frage, welche Fehler im realen Ablauf tragbar sind. Confusion Matrix gliedert sich in: Testdaten, Wahre Labels, Modellscore, Schwellenwert, Fehlerkosten, Folgeprozess.

01Einsatzbereiche

Wann ist Confusion Matrix sinnvoll?

Geeignet für

  • Spam-ErkennungWie viele Spam-Mails werden erkannt vs. wie viele normale Mails fälschlich blockiert
  • Medizinische DiagnoseFalse Negatives (Krankheit übersehen) vs. False Positives (Fehlalarm)
  • Content ModerationWie oft wird harmloser Content fälschlich gesperrt

↑ Inhalt

02Werkzeuge

Womit Confusion Matrix umgesetzt wird

↑ Inhalt

Merksatz

Eine Confusion Matrix ist wie die Auswertung eines Spam-Filters

Wie viele Spam-Mails hat er korrekt erkannt? Wie viele normale Mails hat er fälschlich als Spam markiert?

  1. Vier Felder: True Positive, False Positive, True Negative, False Negative
  2. Grundlage für Precision, Recall, F1-Score und Accuracy
  3. Zeigt nicht nur ob ein Modell gut ist, sondern WIE es Fehler macht

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Confusion Matrix

Was ist schlimmer: False Positive oder False Negative?

Kommt auf den Kontext an. Bei Krebs-Screening ist ein False Negative (Krebs übersehen) viel schlimmer. Bei Spam-Filtern ist ein False Positive (wichtige Mail im Spam) ärgerlicher.

Wie lese ich eine Confusion Matrix ab?

Die Diagonale zeigt korrekte Vorhersagen (TP, TN), die anderen Felder zeigen Fehler. Lies zeilenweise: Zeile 'Positiv' zeigt, was mit echten Positiven passiert ist. Spaltenweise: Spalte 'Positiv' zeigt, was als positiv vorhergesagt wurde.

Wie funktioniert die Confusion Matrix bei mehr als zwei Klassen?

Bei N Klassen wird sie zu einer N×N-Matrix. Die Diagonale zeigt korrekte Klassifikationen, alle anderen Zellen zeigen Verwechslungen. So siehst du z.B. ob ein Bildklassifikator Katzen häufig mit Hunden verwechselt.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Area Under Curve

    Fläche unter der ROC-Kurve – misst Klassifikator-Qualität von 0 bis 1.

  • Technisch vertiefen

    Bias (Verzerrung)

    Verzerrungen in KI, die zu unfairen Ergebnissen führen.

↑ Inhalt