Sofortantwort
Scaling Laws einfach erklärt
Gesetzmäßigkeiten zur Skalierung von LLM-Leistung.
- Kurz gesagt
- Performance skaliert vorhersagbar mit Modellgröße, Daten und Compute
- Typischer Einsatz
- Trainings-Planung, Modell-Design, Kosten-Nutzen-Analyse
- Wichtig zu wissen
- Grundlage für Entscheidungen über Trainings-Budgets und Modellarchitekturen
Scaling Laws im Überblick
Scaling Laws sind empirische Gesetzmäßigkeiten, die beschreiben, wie die Performance von LLMs mit mehr Parametern, mehr Trainingsdaten und mehr Rechenleistung wächst. Die bahnbrechenden Erkenntnisse von OpenAI (2020) und DeepMind (Chinchilla, 2022) zeigten: Die Verbesserung folgt vorhersehbaren Power Laws. Das ermöglicht es, die Performance eines Modells vorherzusagen, bevor es trainiert wird – und optimale Verhältnisse von Parametern zu Trainingsdaten zu berechnen.
Scaling Laws beschreiben, wie LLM-Performance mit Ressourcen wächst. Mehr Parameter, mehr Daten, mehr Compute → bessere Performance. Aber: Die Verbesserung folgt einem Power Law – jede Verdopplung bringt nur konstante Verbesserung.
Die Kernformel:
Loss ∝ 1 / (Parameter^α × Daten^β × Compute^γ)
α, β, γ ≈ 0.05-0.1 (je nach Studie)
Was bedeutet das praktisch?
Um den Loss um 10% zu senken, brauchst du etwa 10x mehr Ressourcen. Das erklärt, warum GPT-5 so viel teurer zu trainieren war als GPT-4.
Technisch betrachtet
Die drei Skalierungsdimensionen
| Dimension | Beschreibung | Kosten |
|---|---|---|
| Parameter (N) | Anzahl der Modellgewichte | VRAM, Inferenz-Kosten |
| Daten (D) | Anzahl der Trainings-Tokens | Daten-Beschaffung |
| Compute (C) | FLOPs für Training | GPU-Stunden |
Chinchilla Scaling
Das Chinchilla-Paper zeigte: Optimale Skalierung bedeutet gleichermaßen Parameter und Daten erhöhen.
Optimal: Tokens ≈ 20 × Parameter
Beispiel:
- 7B Modell → 140B Tokens Training
- 70B Modell → 1.4T Tokens Training
Viele frühere Modelle (GPT-3, Gopher) waren “undertrained” – zu viele Parameter, zu wenig Training.
Emergent Abilities
Manche Fähigkeiten erscheinen plötzlich ab einer bestimmten Größe:
Modellgröße: 1B 10B 100B
Arithmetik: ❌ ❌ ✅
CoT Reasoning: ❌ ❌ ✅
Diese “emergent abilities” sind schwer vorherzusagen und ein aktives Forschungsgebiet.
Praktische Implikationen
- Für Training: Budget zwischen Modellgröße und Trainings-Tokens aufteilen
- Für Inferenz: Kleinere, länger trainierte Modelle können effizienter sein
- Für Forschung: Trends an kleinen Modellen testen, dann skalieren