Naive Bayes (Klassifikation)

Bayes plus eine fragwürdige Unabhängigkeitsannahme — und es funktioniert trotzdem.

Was ist Naive Bayes?

AnalogieDefinition

Stell dir vor, du bist ein erfahrener Postsortierer. Nach Jahren weißt du: Briefe mit 'GRATIS' und 'GEWINN' landen meist im Papierkorb.

Naive Bayes funktioniert genauso: Der Algorithmus lernt, welche Wörter typisch für Spam sind und welche für normale E-Mails. Bei jeder neuen E-Mail prüft er die Wörter und berechnet: Wie wahrscheinlich ist das Spam?

Das 'Naive' bedeutet: Wir tun so, als hätten die Wörter nichts miteinander zu tun. Das ist zwar nicht ganz korrekt, funktioniert aber erstaunlich gut!

Diese Demo zeigt, wie ein Naive Bayes Spam-Filter E-Mails Wort für Wort analysiert. Beobachte, wie sich die Spam-Wahrscheinlichkeit bei jedem Wort verändert.

Wichtige Begriffe
  • Prior (Vorwissen):Die Basis-Wahrscheinlichkeit, dass eine beliebige E-Mail Spam ist - bevor wir sie lesen.
  • Likelihood (Beweiskraft):Wie typisch ist jedes Wort für Spam vs. normale E-Mails?
  • Posterior (Endergebnis):Die aktualisierte Spam-Wahrscheinlichkeit, nachdem wir die Wörter analysiert haben.
Die 'Naive' Annahme

Wir tun so, als wären alle Wörter voneinander unabhängig. 'GRATIS' und 'GEWINN' werden separat betrachtet, obwohl sie oft zusammen auftreten. Diese Vereinfachung macht die Berechnung einfach und funktioniert trotzdem gut.

Warum heißt es 'Spam'?

Der Begriff stammt von einem Sketch der britischen Komikertruppe Monty Python aus dem Jahr 1970. In einem Café wiederholt eine Gruppe Wikinger ständig das Wort 'SPAM' (eine Dosenfleischmarke), bis es alle anderen Gespräche übertönt. Genau wie im Sketch überschwemmen Spam-E-Mails unsere Postfächer mit unerwünschten, sich wiederholenden Nachrichten.

Die Wahrscheinlichkeiten oben sind nicht magisch - sie wurden aus echten E-Mails gelernt. Probier es selbst: Sortiere die Beispiele unten in Spam oder Ham. Dein Filter baut sich aus reinen Wort-Zählungen auf, und du kannst ihn anschließend testen.

GLÜCKWUNSCH! Du hast 500.000 Euro im Lotto gewonnen! Klicke jetzt sofort hier um deinen Gewinn abzuholen - dringend, nur heute kostenlos!
Mein Krypto-Roboter macht 10000 Euro pro Tag - garantiert! Klicke sofort für gratis Zugang. Geheimnis nicht weitersagen!
Exklusives Angebot - nur heute! Verdiene Millionen mit unserem geheimen System. Sofort kostenlos starten und Geld sichern!
Dringend: Klicken Sie hier für kostenlosen Kredit. Garantiert ohne Schufa, sofort verfügbar. Limitiertes Angebot!
Hallo Team, das Meeting morgen um 10 Uhr ist bestätigt. Bitte den Bericht zum Projekt vorbereiten. Viele Grüße
Hallo, kurze Frage zum Projekt: Können wir morgen einen Termin einplanen? Bitte gib kurz Bescheid. Danke!
Liebes Team, der Bericht für den Kunden liegt im Anhang. Besprechung dazu am Mittwoch im Büro. Grüße aus der Buchhaltung.
Hallo Kollege, der Chef fragt nach dem Dokument. Kannst du es bis morgen vorbereiten? Danke für deine Arbeit!
Als Ham markiert: 0 Als Spam markiert: 0
Mindestens 1 Spam und 1 Ham nötig, um den Filter zu aktivieren.

Spam-Detektor

Was die Wahrscheinlichkeits-Reise zeigt

Der Spam-O-Meter ist eine liegende Skala: links steht kein Spam, rechts steht Spam. Ein runder Marker wandert darauf, während der Filter die Nachricht Wort für Wort liest.

Was du siehst
Einen waagerechten Balken, links grün für harmlose Post, rechts rot für Spam, dazwischen eine Skala von 0 bis 100 Prozent. Darauf sitzt ein runder Marker, der seine Farbe von Grün über Gelb bis Rot wechselt, je nachdem wo er gerade steht.
Was passiert
Die Wörter der Nachricht ziehen nacheinander durch die Prüfung. Jedes Wort schiebt den Marker ein Stück nach rechts, wenn es verdächtig ist, oder nach links, wenn es harmlos wirkt. So ruckelt der Marker Schritt für Schritt über den Balken, bis alle Wörter dran waren.
Was du tun kannst
Wähle eine Beispiel-Mail oder tippe eigenen Text, dann starte die Reise mit Start und halte sie mit Pause an. Mit Einzelschritt gehst du Wort für Wort weiter, mit Zurücksetzen fängst du von vorne an. Der Regler für die Grundannahme verschiebt den Startpunkt des Markers.
Worauf du achtest
Kein einzelnes Wort entscheidet allein. Der Filter sammelt viele kleine Hinweise und zählt sie zu einer Gesamt-Wahrscheinlichkeit zusammen. Erst wo der Marker am Ende stehen bleibt, links oder rechts von der Mitte, fällt das Urteil.

Spam-O-Meter

HAM (Legitim)SPAM
Bereit zur Analyse
Bereit zur Analyse

Steuerung

Prior: Basis-Spam-Rate 50%
WenigViel
Verändere den Prior, um zu sehen, wie die Basis-Annahme die Klassifikation beeinflusst.
Aktiv: Du tippst zuerst, dann rechnet Bayes.
Tastatur: Leertaste = Start/Pause, Pfeil rechts = Schritt, R = Reset

Wort-Scanner

Bekannte Wörter im Wörterbuch
🚨Spam-Indikatoren
gratis sp4m gewinn kostenlos millionen garantiert dringend klicken klick sofort geld jetzt geheimnis exklusiv limitiert angebot euro dollar kredit verdienen gewinnen
Ham-Indikatoren
meeting projekt kollege kollegen termin besprechung team bericht frage danke grüße freundlich morgen büro arbeit chef kunde kunden dokument anhang

Naive Bayes erklärt

TheoriePseudo-CodeSchritt für SchrittFlussdiagramm

Das Bayes-Theorem

Naive Bayes basiert auf dem Bayes-Theorem von Thomas Bayes (1763): P(A|B) = P(B|A) × P(A) / P(B). Es berechnet die Wahrscheinlichkeit einer Hypothese (z.B. "Spam") gegeben bestimmter Beobachtungen (z.B. Wörter in einer E-Mail).

Die "naive" Annahme: Alle Features (Wörter) sind voneinander unabhängig. Das stimmt nicht ganz - "kostenloses Geld" kommt häufiger zusammen vor als zufällig. Trotzdem funktioniert der Algorithmus überraschend gut!

Schlüsselkonzepte

  • Prior P(Spam): Basiswahrscheinlichkeit für Spam (z.B. 20% aller E-Mails)
  • Likelihood P(Wort|Spam): Wie wahrscheinlich erscheint ein Wort in Spam?
  • Evidence P(Wort): Wie häufig kommt das Wort insgesamt vor?
  • Posterior P(Spam|Wörter): Endgültige Spam-Wahrscheinlichkeit nach Analyse

Warum 'Naive'?

Die Unabhängigkeitsannahme vereinfacht die Berechnung enorm: Statt P(W₁,W₂,...|Spam) berechnen wir einfach P(W₁|Spam) × P(W₂|Spam) × ... Dies ermöglicht schnelle Klassifikation auch bei vielen Features.

Vorteile

  • Schnell: Training und Vorhersage sind sehr effizient
  • Wenig Daten nötig: Funktioniert auch mit kleinen Datensätzen gut
  • Interpretierbar: Man kann sehen, welche Wörter zur Entscheidung beitragen
  • Robust: Unempfindlich gegen irrelevante Features

Anwendungen

Spam-Filter (Gmail, Outlook), Sentiment-Analyse (positiv/negativ), Dokumentenklassifikation, medizinische Diagnose, Empfehlungssysteme und Spracherkennung.

Probiere die Demo aus! Gib eine E-Mail ein und sieh Schritt für Schritt, wie der Algorithmus die Spam-Wahrscheinlichkeit berechnet.

Teste dein Wissen

Frage 1 / 4
Noch offen

Was bedeutet 'Naive' im Namen 'Naive Bayes'?

Wählen Sie eine Antwort
Auflösung: 1) B · 2) C · 3) A · 4) D