Sofortantwort
Naive Bayes einfach erklärt
Schneller Klassifikationsalgorithmus auf Basis des Satzes von Bayes.
- Kurz gesagt
- Klassifikationsalgorithmus, der den Satz von Bayes anwendet
- Typischer Einsatz
- Spam-Filter, Sentiment-Analyse, Dokumentenkategorisierung
- Wichtig zu wissen
- Sehr schnell, ressourcenschonend und stark bei Textklassifikation
Naive Bayes im Überblick
Naive Bayes ist ein einfacher, aber überraschend wirksamer Algorithmus zur Klassifikation. Er beruht auf dem Satz von Bayes aus der Wahrscheinlichkeitsrechnung und schätzt, wie wahrscheinlich eine Eingabe zu jeder möglichen Klasse gehört. Die Klasse mit der höchsten Wahrscheinlichkeit gewinnt.
Das „Naive” steckt in einer bewusst vereinfachenden Annahme: Der Algorithmus behandelt alle Merkmale so, als wären sie völlig unabhängig voneinander. In Wirklichkeit ist das selten der Fall – trotzdem liefert das Verfahren besonders bei Textdaten sehr gute Ergebnisse und ist dabei extrem schnell.
Technisch betrachtet
Die Grundidee
Gesucht wird die wahrscheinlichste Klasse C für eine Eingabe mit Merkmalen x₁ … xₙ. Nach dem Satz von Bayes gilt:
P(C | x) ∝ P(C) · P(x₁|C) · P(x₂|C) · … · P(xₙ|C)
Die Faktorisierung in einzelne P(xᵢ|C) ist nur dank der Unabhängigkeitsannahme möglich – genau das macht die Berechnung so schnell.
Warum es trotz der „naiven” Annahme funktioniert
Auch wenn die geschätzten Wahrscheinlichkeiten ungenau sind, reicht für die Klassifikation oft die richtige Rangfolge der Klassen. Naive Bayes muss nicht exakt sein, nur die korrekte Klasse muss an der Spitze landen.
Varianten
| Variante | Geeignet für |
|---|---|
| Gaussian NB | kontinuierliche, normalverteilte Merkmale |
| Multinomial NB | Häufigkeiten, z. B. Wortzählungen in Texten |
| Bernoulli NB | binäre Merkmale (vorhanden / nicht vorhanden) |
Als Baseline für Klassifikationsaufgaben ist Naive Bayes erste Wahl: Er ist in Sekunden trainiert und zeigt, welche Genauigkeit ein komplexeres Modell überhaupt übertreffen muss.