<EbeneX/>
Grundlagen Architektur · Updated 3. März 2026

Entropy

Definition

Ein Maß für Unsicherheit oder Informationsgehalt einer Wahrscheinlichkeitsverteilung – fundamental für Informationstheorie, Entscheidungsbäume und Sprachmodelle.

Fortgeschritten 2 Min. Lesezeit EN: Entropy

Einfach erklärt

Entropy ist ein fundamentales Konzept aus der Informationstheorie, das in der KI allgegenwärtig ist: als Loss Function (Cross-Entropy), als Evaluierungsmetrik (Perplexity), als Grundlage für Entscheidungsbäume (Information Gain) und als Steuerungsparameter für Sampling (Temperatur). Das Konzept wurde 1948 von Claude Shannon eingeführt und misst den durchschnittlichen Informationsgehalt einer Wahrscheinlichkeitsverteilung.

Entropy misst, wie unsicher oder überraschend eine Wahrscheinlichkeitsverteilung ist. Je gleichmäßiger die Verteilung, desto höher die Entropy.

Beispiele:

Münzwurf (fair): [0.5, 0.5]
-> Entropy = 1 bit (maximale Unsicherheit für 2 Optionen)

Gezinkte Münze: [0.99, 0.01]
-> Entropy ≈ 0.08 bit (fast sicher, wenig Überraschung)

Würfel (fair): [1/6, 1/6, 1/6, 1/6, 1/6, 1/6]
-> Entropy ≈ 2.58 bit

In der Praxis:

  • LLM mit niedriger Entropy: “Das nächste Wort ist fast sicher ‘ist’”
  • LLM mit hoher Entropy: “Viele Wörter sind möglich, unsicher welches”

Technischer Deep Dive

Formel

H(X) = -Σ p(x) × log₂(p(x))

Python Beispiel

import numpy as np

def entropy(probs):
    # Vermeidet log(0)
    probs = np.array(probs)
    probs = probs[probs > 0]
    return -np.sum(probs * np.log2(probs))

# Beispiele
print(entropy([0.5, 0.5]))      # 1.0 bit
print(entropy([0.99, 0.01]))    # 0.08 bit
print(entropy([0.25, 0.25, 0.25, 0.25]))  # 2.0 bit

Entropy in ML

AnwendungVerwendung
EntscheidungsbäumeSplit mit höchstem Information Gain wählen
SprachmodellePerplexity = 2^(mittlere Entropy)
SamplingMin-Entropy Sampling für Diversität
AnomalieerkennungUngewöhnlich hohe/niedrige Entropy

Maximum Entropy

Für n Klassen: H_max = log₂(n)

2 Klassen: max 1 bit
10 Klassen: max 3.32 bit
50.000 Tokens (LLM Vokabular): max 15.6 bit

Entropy ist wie die Überraschung beim Würfeln: Ein fairer Würfel (hohe Entropy) überrascht mehr als ein gezinkter, der immer 6 zeigt (niedrige Entropy). Je unvorhersehbarer, desto höher die Entropy.

Misst Unsicherheit/Informationsgehalt einer Verteilung

Hohe Entropy = viel Unsicherheit, niedrige = vorhersehbar

Basis für Cross-Entropy, Perplexity und Entscheidungsbäume

Entscheidungsbäume

Information Gain basiert auf Entropy-Reduktion

Sprachmodelle

Perplexity = 2^Entropy

Sampling

Entropy der Ausgabeverteilung steuern

Was bedeutet hohe vs. niedrige Entropy?

Hohe Entropy: Viele Optionen gleich wahrscheinlich (unsicher). Niedrige Entropy: Eine Option dominiert (sicher). Beispiel: [0.25, 0.25, 0.25, 0.25] hat höhere Entropy als [0.97, 0.01, 0.01, 0.01].

Wie hängen Entropy und Temperatur zusammen?

Höhere Temperatur → flachere Verteilung → höhere Entropy → mehr Zufälligkeit. Niedrigere Temperatur → spitzere Verteilung → niedrigere Entropy → deterministischer.

Was ist der Unterschied zwischen Entropy und Cross-Entropy?

Entropy misst die Unsicherheit einer einzelnen Verteilung. Cross-Entropy misst den Unterschied zwischen zwei Verteilungen (vorhergesagt vs. wahr). Cross-Entropy ≥ Entropy.

Dein persönliches Share-Bild für Instagram – 1080×1080px, bereit zum Posten.