Naive Bayes

Naive Bayes ist ein einfacher, schneller Klassifikationsalgorithmus auf Basis des Satzes von Bayes. Trotz seiner stark vereinfachenden Annahme liefert er besonders bei Textdaten erstaunlich gute Ergebnisse.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Klassifikationsalgorithmus, der den Satz von Bayes anwendet
  2. ‚Naiv', weil er alle Merkmale als voneinander unabhängig annimmt
  3. Sehr schnell, ressourcenschonend und stark bei Textklassifikation

Sofortantwort

Naive Bayes einfach erklärt

Schneller Klassifikationsalgorithmus auf Basis des Satzes von Bayes.

Kurz gesagt
Klassifikationsalgorithmus, der den Satz von Bayes anwendet
Typischer Einsatz
Spam-Filter, Sentiment-Analyse, Dokumentenkategorisierung
Wichtig zu wissen
Sehr schnell, ressourcenschonend und stark bei Textklassifikation

Naive Bayes im Überblick

Naive Bayes ist ein einfacher, aber überraschend wirksamer Algorithmus zur Klassifikation. Er beruht auf dem Satz von Bayes aus der Wahrscheinlichkeitsrechnung und schätzt, wie wahrscheinlich eine Eingabe zu jeder möglichen Klasse gehört. Die Klasse mit der höchsten Wahrscheinlichkeit gewinnt.

Das „Naive” steckt in einer bewusst vereinfachenden Annahme: Der Algorithmus behandelt alle Merkmale so, als wären sie völlig unabhängig voneinander. In Wirklichkeit ist das selten der Fall – trotzdem liefert das Verfahren besonders bei Textdaten sehr gute Ergebnisse und ist dabei extrem schnell.

Technisch betrachtet

Die Grundidee

Gesucht wird die wahrscheinlichste Klasse C für eine Eingabe mit Merkmalen x₁ … xₙ. Nach dem Satz von Bayes gilt:

P(C | x) ∝ P(C) · P(x₁|C) · P(x₂|C) · … · P(xₙ|C)

Die Faktorisierung in einzelne P(xᵢ|C) ist nur dank der Unabhängigkeitsannahme möglich – genau das macht die Berechnung so schnell.

Warum es trotz der „naiven” Annahme funktioniert

Auch wenn die geschätzten Wahrscheinlichkeiten ungenau sind, reicht für die Klassifikation oft die richtige Rangfolge der Klassen. Naive Bayes muss nicht exakt sein, nur die korrekte Klasse muss an der Spitze landen.

Varianten

VarianteGeeignet für
Gaussian NBkontinuierliche, normalverteilte Merkmale
Multinomial NBHäufigkeiten, z. B. Wortzählungen in Texten
Bernoulli NBbinäre Merkmale (vorhanden / nicht vorhanden)

Als Baseline für Klassifikationsaufgaben ist Naive Bayes erste Wahl: Er ist in Sekunden trainiert und zeigt, welche Genauigkeit ein komplexeres Modell überhaupt übertreffen muss.

01Einsatzbereiche

Wann ist Naive Bayes sinnvoll?

Geeignet für

  • Spam-FilterKlassiker: E-Mails anhand der Wortwahrscheinlichkeiten als Spam einstufen
  • Sentiment-AnalyseTexte schnell als positiv oder negativ einordnen
  • DokumentenkategorisierungArtikel oder Tickets automatisch Themen zuordnen

↑ Inhalt

02Werkzeuge

Womit Naive Bayes umgesetzt wird

↑ Inhalt

Merksatz

Naive Bayes ist wie ein Arzt, der jedes Symptom einzeln bewertet, als hätte es nichts mit den anderen zu tun, und dann die Wahrscheinlichkeiten zusammenrechnet. Die Annahme ist offensichtlich vereinfacht – Symptome hängen zusammen –, aber für eine schnelle erste Einschätzung funktioniert sie verblüffend gut.

  1. Klassifikationsalgorithmus, der den Satz von Bayes anwendet
  2. ‚Naiv', weil er alle Merkmale als voneinander unabhängig annimmt
  3. Sehr schnell, ressourcenschonend und stark bei Textklassifikation

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Naive Bayes

Warum heißt der Algorithmus ‚naiv'?

Weil er annimmt, dass alle Merkmale völlig unabhängig voneinander zur Klasse beitragen. In der Realität stimmt das fast nie – Wörter in einem Text hängen zusammen. Trotz dieser ‚naiven' Annahme funktioniert der Algorithmus in der Praxis oft erstaunlich gut.

Wofür eignet sich Naive Bayes besonders?

Für Textklassifikation wie Spam-Filterung und Sentiment-Analyse. Er ist extrem schnell, braucht wenig Trainingsdaten und Speicher und liefert eine starke Baseline, an der sich komplexere Modelle messen lassen müssen.

Welche Varianten von Naive Bayes gibt es?

Gaussian NB für kontinuierliche Merkmale, Multinomial NB für Häufigkeiten (typisch bei Text), und Bernoulli NB für binäre Merkmale (Wort vorhanden ja/nein). Die Wahl hängt von der Art der Eingabedaten ab.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Bayes' Theorem

    Formel zur Aktualisierung von Wahrscheinlichkeiten basierend auf neuen Beweisen.

  • Technisch vertiefen

    Feature Engineering

    Merkmale werden aus Rohdaten für ML-Modelle erstellt.

↑ Inhalt