Sofortantwort
Entropy einfach erklärt
Maß für Unsicherheit in Wahrscheinlichkeitsverteilungen.
- Kurz gesagt
- Misst Unsicherheit/Informationsgehalt einer Verteilung
- Typischer Einsatz
- Entscheidungsbäume, Sprachmodelle, Sampling
- Wichtig zu wissen
- Basis für Cross-Entropy, Perplexity und Entscheidungsbäume
Entropy im Überblick
Entropy ist ein fundamentales Konzept aus der Informationstheorie, das in der KI allgegenwärtig ist: als Loss Function (Cross-Entropy), als Evaluierungsmetrik (Perplexity), als Grundlage für Entscheidungsbäume (Information Gain) und als Steuerungsparameter für Sampling (Temperatur). Das Konzept wurde 1948 von Claude Shannon eingeführt und misst den durchschnittlichen Informationsgehalt einer Wahrscheinlichkeitsverteilung.
Entropy misst, wie unsicher oder überraschend eine Wahrscheinlichkeitsverteilung ist. Je gleichmäßiger die Verteilung, desto höher die Entropy.
Beispiele:
Münzwurf (fair): [0.5, 0.5]
-> Entropy = 1 bit (maximale Unsicherheit für 2 Optionen)
Gezinkte Münze: [0.99, 0.01]
-> Entropy ≈ 0.08 bit (fast sicher, wenig Überraschung)
Würfel (fair): [1/6, 1/6, 1/6, 1/6, 1/6, 1/6]
-> Entropy ≈ 2.58 bit
In der Praxis:
- LLM mit niedriger Entropy: “Das nächste Wort ist fast sicher ‘ist’”
- LLM mit hoher Entropy: “Viele Wörter sind möglich, unsicher welches”
Technisch betrachtet
Formel
H(X) = -Σ p(x) × log₂(p(x))
Python Beispiel
import numpy as np
def entropy(probs):
# Vermeidet log(0)
probs = np.array(probs)
probs = probs[probs > 0]
return -np.sum(probs * np.log2(probs))
# Beispiele
print(entropy([0.5, 0.5])) # 1.0 bit
print(entropy([0.99, 0.01])) # 0.08 bit
print(entropy([0.25, 0.25, 0.25, 0.25])) # 2.0 bit
Entropy in ML
| Anwendung | Verwendung |
|---|---|
| Entscheidungsbäume | Split mit höchstem Information Gain wählen |
| Sprachmodelle | Perplexity = 2^(mittlere Entropy) |
| Sampling | Min-Entropy Sampling für Diversität |
| Anomalieerkennung | Ungewöhnlich hohe/niedrige Entropy |
Maximum Entropy
Für n Klassen: H_max = log₂(n)
2 Klassen: max 1 bit
10 Klassen: max 3.32 bit
50.000 Tokens (LLM Vokabular): max 15.6 bit