Cross-Entropy
Eine Loss Function, die misst, wie gut eine vorhergesagte Wahrscheinlichkeitsverteilung mit der tatsächlichen Verteilung übereinstimmt – Standard für Klassifikation und LLMs.
Ein Maß für Unsicherheit oder Informationsgehalt einer Wahrscheinlichkeitsverteilung – fundamental für Informationstheorie, Entscheidungsbäume und Sprachmodelle.
Entropy ist ein fundamentales Konzept aus der Informationstheorie, das in der KI allgegenwärtig ist: als Loss Function (Cross-Entropy), als Evaluierungsmetrik (Perplexity), als Grundlage für Entscheidungsbäume (Information Gain) und als Steuerungsparameter für Sampling (Temperatur). Das Konzept wurde 1948 von Claude Shannon eingeführt und misst den durchschnittlichen Informationsgehalt einer Wahrscheinlichkeitsverteilung.
Entropy misst, wie unsicher oder überraschend eine Wahrscheinlichkeitsverteilung ist. Je gleichmäßiger die Verteilung, desto höher die Entropy.
Beispiele:
Münzwurf (fair): [0.5, 0.5]
-> Entropy = 1 bit (maximale Unsicherheit für 2 Optionen)
Gezinkte Münze: [0.99, 0.01]
-> Entropy ≈ 0.08 bit (fast sicher, wenig Überraschung)
Würfel (fair): [1/6, 1/6, 1/6, 1/6, 1/6, 1/6]
-> Entropy ≈ 2.58 bit
In der Praxis:
H(X) = -Σ p(x) × log₂(p(x))
import numpy as np
def entropy(probs):
# Vermeidet log(0)
probs = np.array(probs)
probs = probs[probs > 0]
return -np.sum(probs * np.log2(probs))
# Beispiele
print(entropy([0.5, 0.5])) # 1.0 bit
print(entropy([0.99, 0.01])) # 0.08 bit
print(entropy([0.25, 0.25, 0.25, 0.25])) # 2.0 bit
| Anwendung | Verwendung |
|---|---|
| Entscheidungsbäume | Split mit höchstem Information Gain wählen |
| Sprachmodelle | Perplexity = 2^(mittlere Entropy) |
| Sampling | Min-Entropy Sampling für Diversität |
| Anomalieerkennung | Ungewöhnlich hohe/niedrige Entropy |
Für n Klassen: H_max = log₂(n)
2 Klassen: max 1 bit
10 Klassen: max 3.32 bit
50.000 Tokens (LLM Vokabular): max 15.6 bit Entropy ist wie die Überraschung beim Würfeln: Ein fairer Würfel (hohe Entropy) überrascht mehr als ein gezinkter, der immer 6 zeigt (niedrige Entropy). Je unvorhersehbarer, desto höher die Entropy.
Misst Unsicherheit/Informationsgehalt einer Verteilung
Hohe Entropy = viel Unsicherheit, niedrige = vorhersehbar
Basis für Cross-Entropy, Perplexity und Entscheidungsbäume
Entscheidungsbäume
Information Gain basiert auf Entropy-Reduktion
Sprachmodelle
Perplexity = 2^Entropy
Sampling
Entropy der Ausgabeverteilung steuern
Hohe Entropy: Viele Optionen gleich wahrscheinlich (unsicher). Niedrige Entropy: Eine Option dominiert (sicher). Beispiel: [0.25, 0.25, 0.25, 0.25] hat höhere Entropy als [0.97, 0.01, 0.01, 0.01].
Höhere Temperatur → flachere Verteilung → höhere Entropy → mehr Zufälligkeit. Niedrigere Temperatur → spitzere Verteilung → niedrigere Entropy → deterministischer.
Entropy misst die Unsicherheit einer einzelnen Verteilung. Cross-Entropy misst den Unterschied zwischen zwei Verteilungen (vorhergesagt vs. wahr). Cross-Entropy ≥ Entropy.