Bayes' Theorem
Die mathematische Grundlage für probabilistisches Denken – wie wir Überzeugungen basierend auf neuen Beweisen aktualisieren. Fundament für ML und Statistik.
Die Plausibilität beobachteter Daten unter einem bestimmten Modell – wichtig für Maximum Likelihood Estimation und Bayesian Inference.
Likelihood misst, wie gut ein Modell die beobachteten Daten erklärt.
Probability: Gegeben Modell, wie wahrscheinlich sind Daten?
P(Daten | Modell) → Vorhersage
Likelihood: Gegeben Daten, wie plausibel ist das Modell?
L(Modell | Daten) → Schätzung
Beispiel: Münzwurf
Beobachtung: mehrere Erfolge und Misserfolge
Likelihood für Parameter p_a:
L(p_a) = Wahrscheinlichkeit der beobachteten Daten unter p_a
Likelihood für Parameter p_b:
L(p_b) = Wahrscheinlichkeit der beobachteten Daten unter p_b
→ Der Parameter mit höherer Likelihood erklärt diese Daten im Modell besser
import numpy as np
from scipy.optimize import minimize
def negative_log_likelihood(theta, data):
# Bernoulli Likelihood
p = theta[0]
successes = data.sum()
failures = len(data) - successes
# Log-Likelihood (negativ für Minimierung)
ll = successes * np.log(p) + failures * np.log(1-p)
return -ll
# MLE finden
data = np.array(observed_binary_outcomes)
result = minimize(negative_log_likelihood, x0=[initial_p], args=(data,),
bounds=[(min_p, max_p)])
print(f"MLE: p = {result.x[0]:.2f}")
# Produkt → kann numerisch instabil bei vielen Daten werden
likelihood = np.prod([p**x * (1-p)**(1-x) for x in data])
# Log-Likelihood → meist numerisch stabiler
log_likelihood = np.sum([x*np.log(p) + (1-x)*np.log(1-p) for x in data]) Likelihood fragt: 'Wenn meine Theorie stimmt, wie wahrscheinlich wären dann diese Beobachtungen?' Es ist wie ein Detektiv, der prüft, ob die Beweise zur Theorie passen.
L(θ|x) = P(x|θ) – Daten gegeben Parameter
Nicht dasselbe wie Wahrscheinlichkeit!
Maximum Likelihood: Finde θ, das L maximiert
Maximum Likelihood Estimation
Parameter schätzen, die Daten am besten erklären
Modellvergleich
Welches Modell erklärt Daten besser?
Bayesian Inference
Likelihood × Prior = Posterior
Probability: P(Daten|Parameter) summiert zu 1 über Daten. Likelihood: L(Parameter|Daten) summiert NICHT zu 1 über Parameter. Gleiche Formel, andere Perspektive.
Produkte werden zu Summen, was numerisch stabiler ist. Die Maximierung bleibt gleich, weil der Logarithmus monoton ist. Deshalb wird Log-Likelihood in vielen ML- und Statistikverfahren genutzt.