Sofortantwort
Distillation einfach erklärt
Ein kleines Modell lernt, ein großes Modell zu imitieren.
- Kurz gesagt
- Großes Lehrer-Modell trainiert ein kleines Schüler-Modell
- Typischer Einsatz
- Modellkompression, Edge Deployment, Kostenreduktion
- Wichtig zu wissen
- Ergebnis: Kleineres, schnelleres Modell mit 80-95% der Lehrer-Qualität
Distillation im Überblick
Knowledge Distillation ist eine Modell-Komprimierungstechnik, bei der ein kleines “Schüler”-Modell lernt, das Verhalten eines großen “Lehrer”-Modells zu imitieren. Statt aus den Originaldaten zu lernen, trainiert der Schüler auf den “weichen” Ausgaben des Lehrers – den Wahrscheinlichkeitsverteilungen über alle Klassen, nicht nur dem finalen Label. Diese weichen Labels enthalten mehr Information als harte Labels und ermöglichen es dem Schüler, das Wissen des Lehrers effizienter zu übernehmen.
Knowledge Distillation überträgt das Wissen eines großen Modells in ein kleines. Das kleine Modell lernt nicht aus den Originaldaten, sondern aus den Vorhersagen des großen Modells.
Der Prozess:
Großes Modell (Lehrer) Kleines Modell (Schüler)
Frontier-Modell → kompaktes Schnell-Modell
Langsam, teuer, genau Schnell, günstig, fast so gut
Warum Soft Labels?
Statt nur “Katze” (Hard Label) lernt der Schüler:
- Katze: 85%, Hund: 10%, Fuchs: 5% (Soft Label)
Die Soft Labels enthalten mehr Information – der Schüler lernt auch, dass Katzen und Hunde ähnlicher sind als Katzen und Autos.
Technisch betrachtet
Distillation Loss
L = α · L_hard(y, y_student) + (1-α) · L_soft(y_teacher, y_student)
- L_hard: Standard Cross-Entropy mit echten Labels
- L_soft: KL-Divergenz zwischen Lehrer- und Schüler-Verteilungen
- α: Gewichtung zwischen Hard und Soft Loss
- Temperature T: Weichere Verteilungen für mehr Information
Distillation-Varianten
- Response Distillation: Schüler lernt die Ausgaben des Lehrers
- Feature Distillation: Schüler lernt die internen Repräsentationen
- Self-Distillation: Modell destilliert sich selbst (tiefe → flache Schichten)
- Online Distillation: Lehrer und Schüler trainieren gleichzeitig
Bekannte destillierte Modelle
| Lehrer | Schüler | Kompression | Qualitätserhalt |
|---|---|---|---|
| BERT | DistilBERT | 40% kleiner | 97% |
| Frontier-GPT | kompakte GPT-Variante | deutlich kleiner (Parameterzahlen nicht veröffentlicht) | hoch, aber aufgabenabhängig |
| Llama 4 Maverick | Llama 4 Scout | MoE-Kompression | aufgabenabhängig |