Distillation (Knowledge Distillation)

Eine Technik, bei der ein kleines 'Schüler'-Modell trainiert wird, das Verhalten eines großen 'Lehrer'-Modells nachzuahmen – für effizientere Inferenz bei ähnlicher Qualität.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Großes Lehrer-Modell trainiert ein kleines Schüler-Modell
  2. Schüler lernt die 'Soft Labels' (Wahrscheinlichkeitsverteilungen) des Lehrers
  3. Ergebnis: Kleineres, schnelleres Modell mit 80-95% der Lehrer-Qualität

Sofortantwort

Distillation einfach erklärt

Ein kleines Modell lernt, ein großes Modell zu imitieren.

Kurz gesagt
Großes Lehrer-Modell trainiert ein kleines Schüler-Modell
Typischer Einsatz
Modellkompression, Edge Deployment, Kostenreduktion
Wichtig zu wissen
Ergebnis: Kleineres, schnelleres Modell mit 80-95% der Lehrer-Qualität

Distillation im Überblick

Knowledge Distillation ist eine Modell-Komprimierungstechnik, bei der ein kleines “Schüler”-Modell lernt, das Verhalten eines großen “Lehrer”-Modells zu imitieren. Statt aus den Originaldaten zu lernen, trainiert der Schüler auf den “weichen” Ausgaben des Lehrers – den Wahrscheinlichkeitsverteilungen über alle Klassen, nicht nur dem finalen Label. Diese weichen Labels enthalten mehr Information als harte Labels und ermöglichen es dem Schüler, das Wissen des Lehrers effizienter zu übernehmen.

Knowledge Distillation überträgt das Wissen eines großen Modells in ein kleines. Das kleine Modell lernt nicht aus den Originaldaten, sondern aus den Vorhersagen des großen Modells.

Der Prozess:

Großes Modell (Lehrer)          Kleines Modell (Schüler)
Frontier-Modell           →    kompaktes Schnell-Modell
Langsam, teuer, genau           Schnell, günstig, fast so gut

Warum Soft Labels?

Statt nur “Katze” (Hard Label) lernt der Schüler:

  • Katze: 85%, Hund: 10%, Fuchs: 5% (Soft Label)

Die Soft Labels enthalten mehr Information – der Schüler lernt auch, dass Katzen und Hunde ähnlicher sind als Katzen und Autos.

Technisch betrachtet

Distillation Loss

L = α · L_hard(y, y_student) + (1-α) · L_soft(y_teacher, y_student)
  • L_hard: Standard Cross-Entropy mit echten Labels
  • L_soft: KL-Divergenz zwischen Lehrer- und Schüler-Verteilungen
  • α: Gewichtung zwischen Hard und Soft Loss
  • Temperature T: Weichere Verteilungen für mehr Information

Distillation-Varianten

  • Response Distillation: Schüler lernt die Ausgaben des Lehrers
  • Feature Distillation: Schüler lernt die internen Repräsentationen
  • Self-Distillation: Modell destilliert sich selbst (tiefe → flache Schichten)
  • Online Distillation: Lehrer und Schüler trainieren gleichzeitig

Bekannte destillierte Modelle

LehrerSchülerKompressionQualitätserhalt
BERTDistilBERT40% kleiner97%
Frontier-GPTkompakte GPT-Variantedeutlich kleiner (Parameterzahlen nicht veröffentlicht)hoch, aber aufgabenabhängig
Llama 4 MaverickLlama 4 ScoutMoE-Kompressionaufgabenabhängig

01Einsatzbereiche

Wann ist Distillation sinnvoll?

Geeignet für

  • ModellkompressionDie Qualität eines Frontier-Modells in einem deutlich kleineren Modell annähern
  • Edge DeploymentGroße Modelle für Smartphones und IoT-Geräte komprimieren
  • KostenreduktionGünstigere Inferenz durch kleinere, schnellere Modelle
  • SpezialisierungEin kleines Modell für eine spezifische Aufgabe aus einem großen Generalisten destillieren

↑ Inhalt

02Werkzeuge

Womit Distillation umgesetzt wird

↑ Inhalt

Merksatz

Distillation ist wie ein erfahrener Professor, der sein Wissen an einen Studenten weitergibt

Der Student lernt nicht alles von Grund auf, sondern übernimmt die destillierten Erkenntnisse des Professors – schneller und kompakter.

  1. Großes Lehrer-Modell trainiert ein kleines Schüler-Modell
  2. Schüler lernt die 'Soft Labels' (Wahrscheinlichkeitsverteilungen) des Lehrers
  3. Ergebnis: Kleineres, schnelleres Modell mit 80-95% der Lehrer-Qualität

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

Quellen (1)

↑ Inhalt

05FAQ

Häufige Fragen zu Distillation

Was ist der Unterschied zwischen Distillation und Quantisierung?

Quantisierung reduziert die Bit-Präzision der Gewichte (gleiches Modell, weniger Bits). Distillation trainiert ein komplett neues, kleineres Modell (weniger Parameter). Beide können kombiniert werden für maximale Kompression.

Kann ich ein kommerzielles Frontier-Modell destillieren?

Indirekt ja: Du kannst ein kleineres Modell auf dessen Ausgaben fine-tunen. Das ist eine Form der Distillation. OpenAI bietet dies über ihre Fine-Tuning-API an. Beachte die Nutzungsbedingungen bezüglich der Verwendung von Modell-Ausgaben.

Wie viel Qualität geht bei Distillation verloren?

Typisch 5-20% auf Benchmarks, abhängig vom Größenverhältnis. DistilBERT behält 97% der BERT-Qualität bei 40% weniger Parametern. Bei stärkerer Kompression (10x kleiner) sind größere Einbußen zu erwarten.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Synthetische Daten

    Künstliche Daten, die echte Daten ergänzen oder ersetzen können.

  • Technisch vertiefen

    Modell

    Mathematische Repräsentation zur Vorhersage neuer Eingaben.

↑ Inhalt