Area Under Curve (AUC)

Wie AUC die Rangqualität eines Klassifikators zusammenfasst – und warum sie für produktive Entscheidungen immer weitere Kennzahlen braucht.

Die Fläche unter der ROC-Kurve – ein einzelner Wert zwischen 0 und 1, der die Gesamtqualität eines Klassifikators misst.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Wert zwischen 0 und 1 (0.5 = Zufall)
  2. Unabhängig vom gewählten Schwellenwert
  3. Wahrscheinlichkeit, dass positives Beispiel höher gerankt wird

Sofortantwort

AUC einfach erklärt

Fläche unter der ROC-Kurve – misst Klassifikator-Qualität von 0 bis 1.

Kurz gesagt
Wert zwischen 0 und 1 (0.5 = Zufall)
Typischer Einsatz
Modellvergleich, Feature-Selektion, Hyperparameter-Tuning
Wichtig zu wissen
Wahrscheinlichkeit, dass positives Beispiel höher gerankt wird

Area Under Curve im Überblick

AUC fasst die ROC-Kurve in einer Zahl zusammen: Wie gut trennt das Modell positive von negativen Beispielen?

AUC nahe 1.0: Sehr gute Trennung
AUC nahe 0.5: Kaum besser als zufälliges Raten
AUC unter 0.5: Ranking möglicherweise invertiert oder fehlerhaft

Interpretation:

AUC = P(score(positiv) > score(negativ))

"Wenn ich zufällig ein positives und ein negatives 
Beispiel wähle, wie wahrscheinlich rankt das Modell 
das positive höher?"

Technisch betrachtet

AUC berechnen

from sklearn.metrics import roc_auc_score

y_true = [0, 0, 1, 1, 1, 0, 1, 0]
y_scores = [0.1, 0.4, 0.35, 0.8, 0.7, 0.3, 0.9, 0.2]

auc = roc_auc_score(y_true, y_scores)
print(f"AUC: {auc:.3f}")

Multi-Class AUC

from sklearn.metrics import roc_auc_score

# One-vs-Rest für Multi-Class
auc_ovr = roc_auc_score(y_true, y_proba, multi_class='ovr')

# One-vs-One
auc_ovo = roc_auc_score(y_true, y_proba, multi_class='ovo')

Mathematische Intuition

Die probabilistische Interpretation lässt sich direkt nachrechnen: AUC entspricht dem Anteil aller Positiv-Negativ-Paare, bei denen das positive Beispiel den höheren Score erhält (Gleichstände zählen halb):

AUC = (Anzahl korrekt gerankter Paare + 0.5 × Gleichstände)
      / (Anzahl Positive × Anzahl Negative)

Das macht AUC zu einer reinen Ranking-Metrik: Sie ist identisch mit der Mann-Whitney-U-Statistik (normalisiert) und invariant gegenüber jeder monotonen Transformation der Scores. Ein Modell mit AUC 0.9 kann trotzdem völlig unkalibrierte Wahrscheinlichkeiten liefern – AUC sagt nichts darüber aus, ob ein Score von 0.8 wirklich „80 % Wahrscheinlichkeit” bedeutet.

import numpy as np

def auc_by_pairs(y_true, y_scores):
    y_true, y_scores = np.asarray(y_true), np.asarray(y_scores)
    pos, neg = y_scores[y_true == 1], y_scores[y_true == 0]
    diffs = pos[:, None] - neg[None, :]   # alle Paare
    return ((diffs > 0).sum() + 0.5 * (diffs == 0).sum()) / diffs.size

Was AUC nicht misst

FrageBeantwortet AUC?Bessere Metrik
Rankt das Modell Positive über Negative?Ja
Sind die Wahrscheinlichkeiten kalibriert?NeinBrier Score, Kalibrierungskurve
Wie gut ist das Modell am gewählten Threshold?NeinPrecision, Recall, F1
Performance bei seltener positiver Klasse?Nur eingeschränktAUC-PR (Average Precision)

Der letzte Punkt ist in der Praxis der wichtigste: Bei stark unbalancierten Daten kann ein hoher AUC-ROC-Wert über eine schwache Precision hinwegtäuschen, weil die vielen True Negatives die False Positive Rate klein halten. Für Fraud Detection oder Anomalie-Erkennung ist die Fläche unter der Precision-Recall-Kurve meist aussagekräftiger.

AUC unter 0.5 – was ist da los?

Ein AUC-Wert deutlich unter 0.5 bedeutet nicht „schlechter als nichts”, sondern dass das Modell systematisch invers rankt. Häufige Ursachen: vertauschte Labels beim Einlesen, predict_proba[:, 0] statt [:, 1] verwendet, oder ein Vorzeichenfehler im Score. Ein Wert nahe 0 ist daher fast immer ein Bug, kein Modellproblem – nach der Korrektur wäre das Ranking sogar sehr gut.

Typische Fehler in der Praxis

  • Harte Vorhersagen übergeben: roc_auc_score(y_true, model.predict(X)) verschenkt die Ranking-Information. Richtig sind Scores oder Wahrscheinlichkeiten: model.predict_proba(X)[:, 1].
  • AUC-Werte über verschiedene Datensätze vergleichen: AUC hängt von der Schwierigkeit des Problems ab; derselbe Wert kann je nach Anwendung stark oder schwach sein.
  • Nur auf AUC optimieren: Für das produktive System zählt die Performance am tatsächlich eingesetzten Threshold – ein Modell mit leicht niedrigerem AUC kann dort besser abschneiden.

Schritt für Schritt

AUC als Vergleichssignal richtig einsetzen

AUC bewertet, wie gut ein Modell positive über negative Beispiele rankt. Sie ist ein nützliches Signal für Vergleiche, aber kein vollständiger Nachweis für Einsatzqualität.

  1. Vergleichsfrage festlegen

    01

    Nutze AUC für Modelle, Varianten oder Features, die auf derselben Aufgabe und denselben unabhängigen Testdaten bewertet werden.

    gleiches Problem + gleiches Testset + Scores
  2. Ranking-Scores statt Labels auswerten

    02

    AUC braucht die Reihenfolge der Scores, weil harte Vorhersagen wichtige Qualitätsinformation verlieren.

    Scores → Rangfolge positiver und negativer Fälle
  3. Konfidenz und Segmente prüfen

    03

    Untersuche, ob Unterschiede stabil sind und ob einzelne wichtige Gruppen ein anderes Ergebnis zeigen.

    AUC → Unsicherheit → Segmentvergleich
  4. Mit ergänzenden Kennzahlen kombinieren

    04

    Prüfe Kalibrierung, Precision/Recall und die Güte am geplanten Schwellenwert zusätzlich.

    AUC + PR + Kalibrierung + Threshold-Metriken
  5. Entscheidung für den Einsatz validieren

    05

    Wähle eine Schwelle anhand der Fehlerfolgen und prüfe den Prozess mit realistischen Fällen, bevor das Modell produktiv wirkt.

    Ranking → Schwelle → Fehlerprofil → Betriebsfreigabe

Konkretes Beispiel

Beispiel: Zwei Modelle für Ticket-Priorisierung

Beide Modelle ordnen Tickets nach erwarteter Dringlichkeit, bevor ein Team die endgültige Prüfung durchführt.

Vergleich

Modell A erzielt eine höhere AUC, doch das Team bearbeitet nur die obersten Fälle und braucht dort besonders wenige Fehlalarme.

Vollständige Bewertung

AUC dient als erstes Vergleichssignal; danach werden Precision, Recall und das Fehlerprofil im tatsächlich genutzten Bereich geprüft.

Eine höhere AUC ist ein Hinweis auf besseres Ranking, aber keine automatische Antwort auf die Frage, welches Modell im Prozess besser funktioniert.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Kompakter Modellvergleich: Ranking-Güte lässt sich auf ein verständliches Signal verdichten.
  • Schwellenunabhängig: Frühe Vergleiche werden nicht durch eine zufällig gewählte Grenze verzerrt.
  • Mathematisch klar: AUC beschreibt die Wahrscheinlichkeit, dass ein positiver Fall höher gerankt wird als ein negativer.

Das solltest du beachten

  • Nicht ausreichend für Produktion: AUC sagt nichts über die gewählte Schwelle oder konkrete Fehlerzahlen.
  • Schwächer bei Imbalance: Bei sehr seltenen positiven Fällen kann AUC-ROC ein zu freundliches Bild vermitteln.
  • Keine Wahrscheinlichkeitsqualität: Ein gutes Ranking kann trotzdem schlecht kalibrierte Scores liefern.
Vertiefung · für Fortgeschrittene

AUC im Evaluationssystem

AUC ist eine Sicht auf Modellqualität und wird erst zusammen mit Daten, Schwelle und Prozessanforderungen entscheidungsrelevant.

Wissenskarte

Fläche unter einer Ranking-Kurve als Zusammenfassung der Trennfähigkeit.

Eine robuste Evaluation nutzt AUC als Teil eines Kennzahlenpakets, nicht als alleinige Optimierungszahl. AUC gliedert sich in: Testdaten, Scores, ROC-Kurve, Klassenanteil, Kalibrierung, Threshold-Metriken.

01Einsatzbereiche

Wann ist AUC sinnvoll?

Geeignet für

  • ModellvergleichWelches Modell ist insgesamt besser?
  • Feature-SelektionWelche Features verbessern AUC?
  • Hyperparameter-TuningAUC als Optimierungsziel

↑ Inhalt

Merksatz

AUC ist wie eine zusammenfassende Bewertung für deinen Klassifikator

Ein hoher Wert bedeutet bessere Trennung, ein Wert nahe Zufall bedeutet kaum nutzbares Ranking.

  1. Wert zwischen 0 und 1 (0.5 = Zufall)
  2. Unabhängig vom gewählten Schwellenwert
  3. Wahrscheinlichkeit, dass positives Beispiel höher gerankt wird

03Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

04FAQ

Häufige Fragen zu AUC

Was ist ein guter AUC-Wert?

Ein guter AUC-Wert hängt vom Problem, Datenrauschen, Klassenverteilung und Fehlkosten ab. Werte nahe 0.5 deuten auf kaum nutzbare Trennung hin; höhere Werte sind besser, müssen aber im Kontext bewertet werden.

AUC-ROC vs. AUC-PR?

AUC-ROC bei balancierten Daten. AUC-PR (Precision-Recall) bei stark unbalancierten Daten besser geeignet.

↑ Inhalt

05Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    ROC Curve

    Visualisiert Klassifikator-Performance über alle Schwellenwerte.

  • Technisch vertiefen

    Klassifikation (Classification)

    ML-Aufgabe, bei der Eingaben festen Kategorien zugeordnet werden.

↑ Inhalt