Precision, Recall & F1-Score

Wie Teams Trefferqualität, Vollständigkeit und ihren unvermeidlichen Trade-off an den realen Folgen von Fehlentscheidungen ausrichten.

Die drei wichtigsten Metriken zur Bewertung von Klassifikationsmodellen – Precision misst Genauigkeit, Recall misst Vollständigkeit, F1 kombiniert beide.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Precision: Von allen positiven Vorhersagen – wie viele waren korrekt?
  2. Recall: Von allen tatsächlich positiven Fällen – wie viele wurden gefunden?
  3. F1-Score: Harmonisches Mittel von Precision und Recall – Balance beider Metriken

Sofortantwort

Precision, Recall & F1-Score einfach erklärt

Wichtige Metriken zur Bewertung der Leistung von Klassifikationsmodellen.

Kurz gesagt
Precision: Von allen positiven Vorhersagen – wie viele waren korrekt?
Typischer Einsatz
Information Retrieval, Medizin, RAG-Evaluation
Wichtig zu wissen
F1-Score: Harmonisches Mittel von Precision und Recall – Balance beider Metriken

Precision, Recall & F1-Score im Überblick

Precision, Recall und F1-Score sind die drei wichtigsten Metriken für Klassifikationsmodelle – und deutlich aussagekräftiger als einfache Accuracy. Sie sind besonders relevant bei unausgewogenen Datensätzen: Ein Betrugserkennungs-Modell, das immer “kein Betrug” vorhersagt, hat 99% Accuracy, aber 0% Recall für Betrug. Precision misst, wie präzise die positiven Vorhersagen sind. Recall misst, wie viele der tatsächlich positiven Fälle gefunden wurden.

Precision = TP / (TP + FP)  → "Wie präzise sind meine Treffer?"
Recall    = TP / (TP + FN)  → "Wie viele habe ich gefunden?"
F1        = 2 × (P × R) / (P + R)  → "Balance aus beiden"

Suchmaschinen-Beispiel:

  • 10 relevante Dokumente existieren
  • Suche liefert 8 Ergebnisse, davon 6 relevant
Precision = 6/8 = 75%  (6 von 8 Ergebnissen sind relevant)
Recall    = 6/10 = 60% (6 von 10 relevanten wurden gefunden)
F1        = 2 × (0.75 × 0.60) / (0.75 + 0.60) = 66.7%

Technisch betrachtet

Trade-off

Precision und Recall stehen oft im Konflikt:

  • Schwellwert hoch → Weniger Vorhersagen, aber präziser (↑ Precision, ↓ Recall)
  • Schwellwert niedrig → Mehr Vorhersagen, aber mehr Fehler (↓ Precision, ↑ Recall)

Wann welche Metrik?

SituationWichtigste Metrik
Balanced DatasetF1-Score
Imbalanced DatasetPrecision-Recall AUC
Kosten für FP hochPrecision
Kosten für FN hochRecall
Ranking-AufgabenAverage Precision (AP)

Precision-Recall-Kurve

Die PR-Kurve zeigt den Trade-off bei verschiedenen Schwellwerten:

  • X-Achse: Recall (0 bis 1)
  • Y-Achse: Precision (0 bis 1)
  • Ideale Kurve: Oben rechts (hohe Precision bei hohem Recall)
  • AUC-PR: Fläche unter der Kurve, zusammenfassende Metrik

Code-Beispiel (Python)

from sklearn.metrics import precision_score, recall_score, f1_score
from sklearn.metrics import classification_report

y_true = [1, 0, 1, 1, 0, 1, 0, 0, 1, 0]
y_pred = [1, 0, 1, 0, 0, 1, 1, 0, 1, 0]

print(f"Precision: {precision_score(y_true, y_pred):.2f}")
print(f"Recall: {recall_score(y_true, y_pred):.2f}")
print(f"F1-Score: {f1_score(y_true, y_pred):.2f}")

# Detaillierter Report
print(classification_report(y_true, y_pred))

F-Beta Score

F1 gewichtet Precision und Recall gleich. F-Beta erlaubt andere Gewichtungen:

  • F0.5: Precision doppelt so wichtig wie Recall
  • F2: Recall doppelt so wichtig wie Precision
F_β = (1 + β²) × (Precision × Recall) / (β² × Precision + Recall)

Schritt für Schritt

Precision, Recall und F1 passend einsetzen

Keine der drei Kennzahlen ist pauschal die richtige. Ihr Wert entsteht aus der Verbindung von Fehlerfolgen, Datenverteilung und einem klaren Einsatzprozess.

  1. Fehlerfolgen priorisieren

    01

    Kläre zuerst, ob ein Fehlalarm oder ein übersehener Fall im gegebenen Prozess schwerer wiegt.

    False Positive Kosten ↔ False Negative Kosten
  2. Datensatz und Klassenverteilung prüfen

    02

    Bei seltenen positiven Fällen kann eine hohe Accuracy wenig aussagen; die positive Klasse braucht eigene Betrachtung.

    Klassenanteil → geeignete Metrik → Baseline
  3. Metrikziel definieren

    03

    Lege fest, ob Precision, Recall, F1 oder eine gewichtete Variante die gewünschte Abwägung abbildet.

    Ziel → Mindestwert → tolerierter Trade-off
  4. Schwellenwerte mit Validierungsdaten wählen

    04

    Variiere die Entscheidungsschwelle auf separaten Daten und beobachte, wie sich Precision und Recall gemeinsam verändern.

    Schwelle → Precision / Recall → Auswahl
  5. Im Betrieb erneut prüfen

    05

    Datenverteilung und Fehlermuster können sich verändern; Qualität wird daher segmentiert und fortlaufend evaluiert.

    Monitoring → Abweichung → Review → Anpassung

Konkretes Beispiel

Beispiel: Suche in einem Wissensportal

Eine Suche soll hilfreiche Dokumente zeigen, ohne Nutzende mit vielen unpassenden Ergebnissen zu überfordern.

Metrik-Trade-off

Ein niedriger Schwellenwert findet mehr mögliche Treffer, erhöht aber auch den Anteil irrelevanter Ergebnisse.

Nutzungsnahe Entscheidung

Das Team prüft Precision und Recall mit typischen Suchanfragen, ergänzt Nutzerfeedback und wählt eine Grenze, die Relevanz und Auffindbarkeit sinnvoll ausbalanciert.

F1 ist eine hilfreiche Zusammenfassung, ersetzt aber nicht die Frage, welcher Fehler Nutzer und Prozess stärker belastet.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Klarer Fehlerfokus: Precision und Recall machen unterschiedliche Qualitätsdimensionen sichtbar.
  • Besser bei Ungleichgewicht: Sie zeigen Schwächen, die eine hohe Gesamtgenauigkeit verstecken kann.
  • Flexible Abwägung: Schwellen und gewichtete Kennzahlen lassen sich an verschiedene Ziele anpassen.

Das solltest du beachten

  • Trade-off bleibt: Mehr gefundene positive Fälle können mehr Fehlalarme bedeuten.
  • F1 vereinfacht: Eine Balance-Kennzahl kann unterschiedliche Fehlerfolgen zu stark glätten.
  • Ohne Kontext unvollständig: Metriken erklären nicht, wie Menschen mit den Ergebnissen im Prozess umgehen.
Vertiefung · für Fortgeschrittene

Die Kennzahlen als Entscheidungsmodell

Aus dem Fehlerprofil und der Schwelle entstehen Metriken, die unterschiedliche Aspekte der Klassifikationsqualität beleuchten.

Wissenskarte

Ein Modell vergibt Scores, die erst durch eine Schwelle zu Entscheidungen werden.

Die passende Kennzahl folgt aus der Bedeutung der Fehler, nicht aus der Gewohnheit, eine Zahl zu maximieren. Klassifikator gliedert sich in: True Positives, False Positives, False Negatives, Precision, Recall, F1-Score.

01Einsatzbereiche

Wann ist Precision, Recall & F1-Score sinnvoll?

Geeignet für

  • Information RetrievalSuchmaschinen: Precision = relevante Ergebnisse, Recall = alle relevanten gefunden
  • MedizinHoher Recall kritisch: Keine Krankheit übersehen (auch wenn mehr Fehlalarme)
  • RAG-EvaluationRetrieval-Precision: Wie relevant sind die gefundenen Chunks?

↑ Inhalt

02Werkzeuge

Womit Precision, Recall & F1-Score umgesetzt wird

↑ Inhalt

Merksatz

Ein Arzt mit hoher Precision stellt selten Fehldiagnosen. Ein Arzt mit hohem Recall übersieht selten eine Krankheit. Der ideale Arzt hat beides – das ist ein hoher F1-Score.

  1. Precision: Von allen positiven Vorhersagen – wie viele waren korrekt?
  2. Recall: Von allen tatsächlich positiven Fällen – wie viele wurden gefunden?
  3. F1-Score: Harmonisches Mittel von Precision und Recall – Balance beider Metriken

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Precision, Recall & F1-Score

Wann ist Precision wichtiger als Recall?

Wenn Fehlalarme teuer sind: Spam-Filter (wichtige Mail im Spam), Empfehlungssysteme (irrelevante Empfehlungen nerven).

Wann ist Recall wichtiger als Precision?

Wenn Übersehen teuer ist: Krebs-Screening (Krankheit nicht erkennen), Sicherheitssysteme (Bedrohung übersehen).

Was ist der Unterschied zwischen Micro- und Macro-Averaging?

Micro-Averaging behandelt alle Samples gleich (gut bei Klassenungleichgewicht). Macro-Averaging mittelt über alle Klassen (jede Klasse zählt gleich). Bei stark unbalancierten Daten können beide Werte sehr unterschiedlich sein.

Warum ist Accuracy bei unbalancierten Daten irreführend?

Bei 99% negativen Samples erreicht ein Modell, das immer 'negativ' sagt, 99% Accuracy – obwohl es nutzlos ist. Precision und Recall zeigen das wahre Bild: 0% Recall für die positive Klasse.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Confusion Matrix

    Tabelle zur Auswertung der Klassifikationsgenauigkeit.

  • Technisch vertiefen

    Supervised Learning

    Das Modell lernt aus gelabelten Daten mit bekannten Ausgaben.

↑ Inhalt