Entropy

Ein Maß für Unsicherheit oder Informationsgehalt einer Wahrscheinlichkeitsverteilung – fundamental für Informationstheorie, Entscheidungsbäume und Sprachmodelle.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Misst Unsicherheit/Informationsgehalt einer Verteilung
  2. Hohe Entropy = viel Unsicherheit, niedrige = vorhersehbar
  3. Basis für Cross-Entropy, Perplexity und Entscheidungsbäume

Sofortantwort

Entropy einfach erklärt

Maß für Unsicherheit in Wahrscheinlichkeitsverteilungen.

Kurz gesagt
Misst Unsicherheit/Informationsgehalt einer Verteilung
Typischer Einsatz
Entscheidungsbäume, Sprachmodelle, Sampling
Wichtig zu wissen
Basis für Cross-Entropy, Perplexity und Entscheidungsbäume

Entropy im Überblick

Entropy ist ein fundamentales Konzept aus der Informationstheorie, das in der KI allgegenwärtig ist: als Loss Function (Cross-Entropy), als Evaluierungsmetrik (Perplexity), als Grundlage für Entscheidungsbäume (Information Gain) und als Steuerungsparameter für Sampling (Temperatur). Das Konzept wurde 1948 von Claude Shannon eingeführt und misst den durchschnittlichen Informationsgehalt einer Wahrscheinlichkeitsverteilung.

Entropy misst, wie unsicher oder überraschend eine Wahrscheinlichkeitsverteilung ist. Je gleichmäßiger die Verteilung, desto höher die Entropy.

Beispiele:

Münzwurf (fair): [0.5, 0.5]
-> Entropy = 1 bit (maximale Unsicherheit für 2 Optionen)

Gezinkte Münze: [0.99, 0.01]
-> Entropy ≈ 0.08 bit (fast sicher, wenig Überraschung)

Würfel (fair): [1/6, 1/6, 1/6, 1/6, 1/6, 1/6]
-> Entropy ≈ 2.58 bit

In der Praxis:

  • LLM mit niedriger Entropy: “Das nächste Wort ist fast sicher ‘ist’”
  • LLM mit hoher Entropy: “Viele Wörter sind möglich, unsicher welches”

Technisch betrachtet

Formel

H(X) = -Σ p(x) × log₂(p(x))

Python Beispiel

import numpy as np

def entropy(probs):
    # Vermeidet log(0)
    probs = np.array(probs)
    probs = probs[probs > 0]
    return -np.sum(probs * np.log2(probs))

# Beispiele
print(entropy([0.5, 0.5]))      # 1.0 bit
print(entropy([0.99, 0.01]))    # 0.08 bit
print(entropy([0.25, 0.25, 0.25, 0.25]))  # 2.0 bit

Entropy in ML

AnwendungVerwendung
EntscheidungsbäumeSplit mit höchstem Information Gain wählen
SprachmodellePerplexity = 2^(mittlere Entropy)
SamplingMin-Entropy Sampling für Diversität
AnomalieerkennungUngewöhnlich hohe/niedrige Entropy

Maximum Entropy

Für n Klassen: H_max = log₂(n)

2 Klassen: max 1 bit
10 Klassen: max 3.32 bit
50.000 Tokens (LLM Vokabular): max 15.6 bit

01Einsatzbereiche

Wann ist Entropy sinnvoll?

Geeignet für

  • EntscheidungsbäumeInformation Gain basiert auf Entropy-Reduktion
  • SprachmodellePerplexity = 2^Entropy
  • SamplingEntropy der Ausgabeverteilung steuern

↑ Inhalt

02Werkzeuge

Womit Entropy umgesetzt wird

↑ Inhalt

Merksatz

Entropy ist wie die Überraschung beim Würfeln

Ein fairer Würfel (hohe Entropy) überrascht mehr als ein gezinkter, der immer 6 zeigt (niedrige Entropy). Je unvorhersehbarer, desto höher die Entropy.

  1. Misst Unsicherheit/Informationsgehalt einer Verteilung
  2. Hohe Entropy = viel Unsicherheit, niedrige = vorhersehbar
  3. Basis für Cross-Entropy, Perplexity und Entscheidungsbäume

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

Quellen (1)

↑ Inhalt

05FAQ

Häufige Fragen zu Entropy

Was bedeutet hohe vs. niedrige Entropy?

Hohe Entropy: Viele Optionen gleich wahrscheinlich (unsicher). Niedrige Entropy: Eine Option dominiert (sicher). Beispiel: [0.25, 0.25, 0.25, 0.25] hat höhere Entropy als [0.97, 0.01, 0.01, 0.01].

Wie hängen Entropy und Temperatur zusammen?

Höhere Temperatur → flachere Verteilung → höhere Entropy → mehr Zufälligkeit. Niedrigere Temperatur → spitzere Verteilung → niedrigere Entropy → deterministischer.

Was ist der Unterschied zwischen Entropy und Cross-Entropy?

Entropy misst die Unsicherheit einer einzelnen Verteilung. Cross-Entropy misst den Unterschied zwischen zwei Verteilungen (vorhergesagt vs. wahr). Cross-Entropy ≥ Entropy.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Cross-Entropy

    Loss Function für Klassifikation und Sprachmodelle.

  • Technisch vertiefen

    Perplexity

    Eine Metrik für das Verständnis von Text durch Sprachmodelle.

↑ Inhalt