Bayes' Theorem
Die mathematische Grundlage für probabilistisches Denken – wie wir Überzeugungen basierend auf neuen Beweisen aktualisieren. Fundament für ML und Statistik.
Die zwei Seiten des Bayesian Learning – Prior ist das Vorwissen vor den Daten, Posterior ist die aktualisierte Überzeugung nach den Daten.
Prior und Posterior beschreiben Überzeugungen vor und nach dem Sehen von Daten.
PRIOR DATEN POSTERIOR
Was glaube ich? + Was sehe ich? = Was glaube ich jetzt?
(Vorwissen) (Beweise) (Aktualisiert)
Beispiel: Münzwurf
Prior: Münze ist fair (50% Kopf)
Daten: 7 von 10 Würfen sind Kopf
Posterior: Münze ist leicht unfair (~60% Kopf)
Mit mehr Daten (700 von 1000 Kopf):
Posterior: Münze ist definitiv unfair (~70% Kopf)
| Likelihood | Conjugate Prior | Posterior |
|---|---|---|
| Bernoulli | Beta | Beta |
| Poisson | Gamma | Gamma |
| Normal (μ) | Normal | Normal |
| Normal (σ²) | Inverse-Gamma | Inverse-Gamma |
import numpy as np
from scipy import stats
# Prior: Beta(2, 2) - leicht informativ, zentriert bei 0.5
alpha_prior, beta_prior = 2, 2
# Daten: 7 Erfolge, 3 Misserfolge
successes, failures = 7, 3
# Posterior: Beta(alpha + successes, beta + failures)
alpha_post = alpha_prior + successes # 9
beta_post = beta_prior + failures # 5
posterior = stats.beta(alpha_post, beta_post)
print(f"Posterior Mean: {posterior.mean():.2f}") # 0.64
print(f"95% CI: {posterior.ppf([0.025, 0.975])}") # [0.38, 0.85] Prior ist wie deine Erwartung vor einem Restaurantbesuch (basierend auf Bewertungen). Posterior ist deine Meinung danach (nach dem Essen). Die Erfahrung aktualisiert deine Erwartung.
Prior: Wahrscheinlichkeitsverteilung VOR den Daten
Posterior: Wahrscheinlichkeitsverteilung NACH den Daten
Posterior = Prior × Likelihood (normalisiert)
Bayesian Neural Networks
Unsicherheit in Gewichten modellieren
A/B-Testing
Prior aus historischen Tests nutzen
Hyperparameter-Tuning
Bayesian Optimization mit Priors
Uninformativ (flat) wenn kein Vorwissen. Informativ wenn Domänenwissen existiert. Conjugate Priors für mathematische Einfachheit.
Der Prior wird unwichtig, die Likelihood dominiert. Bei wenig Daten ist der Prior entscheidend.