Sofortantwort
Self-Supervised Learning einfach erklärt
Das Modell erstellt selbst Trainingsaufgaben aus unbeschrifteten Daten.
- Kurz gesagt
- Das Modell generiert seine eigenen Labels aus den Rohdaten (z.B. verdeckte Wörter vorhersagen)
- Typischer Einsatz
- LLM Pre-Training, Computer Vision, Sprachmodelle
- Wichtig zu wissen
- Grundlage für GPT (Next Token Prediction) und BERT (Masked Language Modeling)
Self-Supervised Learning im Überblick
Self-Supervised Learning ist der Trick, mit dem moderne KI-Modelle aus riesigen Datenmengen lernen, ohne dass ein Mensch jedes Beispiel labeln muss. Das Modell erstellt sich seine Trainingsaufgaben selbst. Diese Methode ist der Schlüssel zu den enormen Fähigkeiten moderner Foundation Models: GPT-5 wurde auf Billionen von Tokens trainiert, ohne dass ein einziges davon manuell gelabelt wurde. Das Modell lernte einfach, das nächste Wort vorherzusagen – und entwickelte dabei ein tiefes Verständnis von Sprache, Logik und Weltwissen. Self-Supervised Learning ist auch der Schlüssel für andere Modalitäten: Für Bilder lernen Modelle, maskierte Bildausschnitte zu rekonstruieren (MAE). Für Audio lernen sie, maskierte Zeitabschnitte vorherzusagen (wav2vec). Das Prinzip ist immer dasselbe: Die Daten selbst liefern das Lern-Signal.
Die zwei wichtigsten Varianten:
| Methode | Prinzip | Verwendet in |
|---|---|---|
| Next Token Prediction | Sage das nächste Wort vorher | GPT, Llama, Gemini |
| Masked Language Modeling | Fülle verdeckte Wörter ein | BERT, RoBERTa |
Beispiel Next Token Prediction:
Eingabe: "Die Katze sitzt auf dem"
Ziel: "Dach" (oder "Tisch", "Sofa", ...)
Das Modell lernt dabei automatisch Grammatik, Fakten, Logik und Zusammenhänge – alles aus der Aufgabe, das nächste Wort vorherzusagen.
Technisch betrachtet
Pretext Tasks
- Next Token Prediction: Autoregressive Modelle (GPT-Familie)
- Masked Language Modeling: Bidirektionale Modelle (BERT-Familie)
- Contrastive Learning: Ähnliche Daten zusammen, verschiedene auseinander (SimCLR, CLIP)
- Denoising: Verrauschte Eingabe rekonstruieren (Diffusionsmodelle)
Warum es funktioniert
Um das nächste Wort korrekt vorherzusagen, muss das Modell implizit lernen:
- Grammatik und Syntax
- Semantische Zusammenhänge
- Weltwissen und Fakten
- Logisches Schlussfolgern
Diese “emergenten Fähigkeiten” entstehen als Nebenprodukt der einfachen Vorhersageaufgabe – besonders bei großen Modellen mit vielen Parametern.