Sofortantwort
Precision, Recall & F1-Score einfach erklärt
Wichtige Metriken zur Bewertung der Leistung von Klassifikationsmodellen.
- Kurz gesagt
- Precision: Von allen positiven Vorhersagen – wie viele waren korrekt?
- Typischer Einsatz
- Information Retrieval, Medizin, RAG-Evaluation
- Wichtig zu wissen
- F1-Score: Harmonisches Mittel von Precision und Recall – Balance beider Metriken
Precision, Recall & F1-Score im Überblick
Precision, Recall und F1-Score sind die drei wichtigsten Metriken für Klassifikationsmodelle – und deutlich aussagekräftiger als einfache Accuracy. Sie sind besonders relevant bei unausgewogenen Datensätzen: Ein Betrugserkennungs-Modell, das immer “kein Betrug” vorhersagt, hat 99% Accuracy, aber 0% Recall für Betrug. Precision misst, wie präzise die positiven Vorhersagen sind. Recall misst, wie viele der tatsächlich positiven Fälle gefunden wurden.
Precision = TP / (TP + FP) → "Wie präzise sind meine Treffer?"
Recall = TP / (TP + FN) → "Wie viele habe ich gefunden?"
F1 = 2 × (P × R) / (P + R) → "Balance aus beiden"
Suchmaschinen-Beispiel:
- 10 relevante Dokumente existieren
- Suche liefert 8 Ergebnisse, davon 6 relevant
Precision = 6/8 = 75% (6 von 8 Ergebnissen sind relevant)
Recall = 6/10 = 60% (6 von 10 relevanten wurden gefunden)
F1 = 2 × (0.75 × 0.60) / (0.75 + 0.60) = 66.7%
Technisch betrachtet
Trade-off
Precision und Recall stehen oft im Konflikt:
- Schwellwert hoch → Weniger Vorhersagen, aber präziser (↑ Precision, ↓ Recall)
- Schwellwert niedrig → Mehr Vorhersagen, aber mehr Fehler (↓ Precision, ↑ Recall)
Wann welche Metrik?
| Situation | Wichtigste Metrik |
|---|---|
| Balanced Dataset | F1-Score |
| Imbalanced Dataset | Precision-Recall AUC |
| Kosten für FP hoch | Precision |
| Kosten für FN hoch | Recall |
| Ranking-Aufgaben | Average Precision (AP) |
Precision-Recall-Kurve
Die PR-Kurve zeigt den Trade-off bei verschiedenen Schwellwerten:
- X-Achse: Recall (0 bis 1)
- Y-Achse: Precision (0 bis 1)
- Ideale Kurve: Oben rechts (hohe Precision bei hohem Recall)
- AUC-PR: Fläche unter der Kurve, zusammenfassende Metrik
Code-Beispiel (Python)
from sklearn.metrics import precision_score, recall_score, f1_score
from sklearn.metrics import classification_report
y_true = [1, 0, 1, 1, 0, 1, 0, 0, 1, 0]
y_pred = [1, 0, 1, 0, 0, 1, 1, 0, 1, 0]
print(f"Precision: {precision_score(y_true, y_pred):.2f}")
print(f"Recall: {recall_score(y_true, y_pred):.2f}")
print(f"F1-Score: {f1_score(y_true, y_pred):.2f}")
# Detaillierter Report
print(classification_report(y_true, y_pred))
F-Beta Score
F1 gewichtet Precision und Recall gleich. F-Beta erlaubt andere Gewichtungen:
- F0.5: Precision doppelt so wichtig wie Recall
- F2: Recall doppelt so wichtig wie Precision
F_β = (1 + β²) × (Precision × Recall) / (β² × Precision + Recall)Schritt für Schritt
Precision, Recall und F1 passend einsetzen
Keine der drei Kennzahlen ist pauschal die richtige. Ihr Wert entsteht aus der Verbindung von Fehlerfolgen, Datenverteilung und einem klaren Einsatzprozess.
Fehlerfolgen priorisieren
01
Kläre zuerst, ob ein Fehlalarm oder ein übersehener Fall im gegebenen Prozess schwerer wiegt.
False Positive Kosten ↔ False Negative KostenDatensatz und Klassenverteilung prüfen
02
Bei seltenen positiven Fällen kann eine hohe Accuracy wenig aussagen; die positive Klasse braucht eigene Betrachtung.
Klassenanteil → geeignete Metrik → BaselineMetrikziel definieren
03
Lege fest, ob Precision, Recall, F1 oder eine gewichtete Variante die gewünschte Abwägung abbildet.
Ziel → Mindestwert → tolerierter Trade-offSchwellenwerte mit Validierungsdaten wählen
04
Variiere die Entscheidungsschwelle auf separaten Daten und beobachte, wie sich Precision und Recall gemeinsam verändern.
Schwelle → Precision / Recall → AuswahlIm Betrieb erneut prüfen
05
Datenverteilung und Fehlermuster können sich verändern; Qualität wird daher segmentiert und fortlaufend evaluiert.
Monitoring → Abweichung → Review → Anpassung
Konkretes Beispiel
Beispiel: Suche in einem Wissensportal
Eine Suche soll hilfreiche Dokumente zeigen, ohne Nutzende mit vielen unpassenden Ergebnissen zu überfordern.
Metrik-Trade-off
Ein niedriger Schwellenwert findet mehr mögliche Treffer, erhöht aber auch den Anteil irrelevanter Ergebnisse.
Nutzungsnahe Entscheidung
Das Team prüft Precision und Recall mit typischen Suchanfragen, ergänzt Nutzerfeedback und wählt eine Grenze, die Relevanz und Auffindbarkeit sinnvoll ausbalanciert.
F1 ist eine hilfreiche Zusammenfassung, ersetzt aber nicht die Frage, welcher Fehler Nutzer und Prozess stärker belastet.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Klarer Fehlerfokus: Precision und Recall machen unterschiedliche Qualitätsdimensionen sichtbar.
- Besser bei Ungleichgewicht: Sie zeigen Schwächen, die eine hohe Gesamtgenauigkeit verstecken kann.
- Flexible Abwägung: Schwellen und gewichtete Kennzahlen lassen sich an verschiedene Ziele anpassen.
Das solltest du beachten
- Trade-off bleibt: Mehr gefundene positive Fälle können mehr Fehlalarme bedeuten.
- F1 vereinfacht: Eine Balance-Kennzahl kann unterschiedliche Fehlerfolgen zu stark glätten.
- Ohne Kontext unvollständig: Metriken erklären nicht, wie Menschen mit den Ergebnissen im Prozess umgehen.
Vertiefung · für FortgeschritteneDie Kennzahlen als Entscheidungsmodell
Aus dem Fehlerprofil und der Schwelle entstehen Metriken, die unterschiedliche Aspekte der Klassifikationsqualität beleuchten.
Ein Modell vergibt Scores, die erst durch eine Schwelle zu Entscheidungen werden.