Sofortantwort
Lernrate einfach erklärt
Hyperparameter, der die Schrittweite beim Modelltraining steuert.
- Kurz gesagt
- Bestimmt, wie stark die Modellparameter bei jedem Trainingsschritt angepasst werden
- Typischer Einsatz
- Modelltraining, Hyperparameter-Tuning, Fine-Tuning
- Wichtig zu wissen
- Wird oft über einen Zeitplan (Learning Rate Schedule) während des Trainings angepasst
Lernrate im Überblick
Die Lernrate (englisch Learning Rate) ist einer der wichtigsten Hyperparameter beim Training von Machine-Learning-Modellen. Sie legt fest, wie groß die Schritte sind, mit denen das Modell seine Parameter bei jedem Trainingsschritt anpasst.
Beim Training berechnet das Modell über den Gradienten, in welche Richtung die Parameter geändert werden sollten, um den Fehler zu verringern. Die Lernrate bestimmt, wie weit das Modell in diese Richtung geht. Sie ist damit die Stellschraube zwischen „schnell, aber riskant” und „sicher, aber langsam”.
Technisch betrachtet
Die Gratwanderung
| Lernrate | Effekt |
|---|---|
| zu hoch | Loss springt oder explodiert, Training divergiert |
| zu niedrig | Training extrem langsam, bleibt evtl. in flachem Minimum stecken |
| passend | zügige, stabile Konvergenz zu einer guten Lösung |
Im Gradient-Descent-Update taucht sie als Faktor η auf:
w_neu = w_alt − η · ∂L/∂w
Ein größeres η bedeutet größere Schritte.
Learning Rate Schedules
Eine feste Lernrate ist selten optimal. Üblich ist, anfangs größere Schritte zu machen und sie mit der Zeit zu verkleinern:
- Warm-up – sanfter Start mit ansteigender Lernrate
- Step Decay – stufenweise Reduktion nach festen Epochen
- Cosine Annealing – sanftes Auslaufen entlang einer Kosinuskurve
Adaptive Optimierer
Verfahren wie Adam passen die effektive Schrittweite pro Parameter automatisch an. Sie machen die Wahl der Lernrate robuster, ersetzen aber nicht ganz das Gefühl für eine sinnvolle Ausgangsgröße.
Schritt für Schritt
So findest du eine belastbare Lernrate
Mit einem konservativen Bereich starten
Leite einen kleinen Bereich aus Modelltyp, Optimierer und Aufgabenstellung ab. Bei Fine-Tuning ist er meist deutlich niedriger als beim Training eines Modells von Grund auf.
Kurzen Range-Test durchführen
Erhöhe die Lernrate über einen begrenzten Probelauf schrittweise und beobachte den Loss. Der sinnvolle Bereich liegt vor dem Punkt, an dem der Verlauf sprunghaft oder instabil wird.
Zeitplan für die Trainingsphasen wählen
Nutze ein Warm-up für den Start und reduziere die Lernrate später. Große Schritte beschleunigen den Anfang, kleinere Schritte helfen beim kontrollierten Annähern an eine gute Lösung.
Mit Validierungsdaten absichern
Prüfe nicht nur den Trainings-Loss. Eine Lernrate ist erst dann gut gewählt, wenn sich auch die Leistung auf unbekannten Beispielen stabil entwickelt.
Konkretes Beispiel
Fine-Tuning eines Dokumentenklassifikators
Ein vortrainiertes Sprachmodell soll Rechnungen, Verträge und Support-Anfragen unterscheiden. Das Team will vorhandenes Wissen bewahren und trotzdem die neue Aufgabe schnell lernen.
Testreihe
Drei kurze Läufe mit unterschiedlichen Startwerten: 1e-4, 3e-5 und 5e-6. Alle Läufe nutzen Warm-up, dieselbe Batch Size und denselben Validierungssplit.
Entscheidung
Bei 1e-4 schwankt der Validierungs-Loss stark. 5e-6 lernt zuverlässig, aber zu langsam. 3e-5 verbessert beide Metriken stabil und wird mit sanftem Decay weitertrainiert.
Die Lernrate wird nicht geraten: Ein kleiner, vergleichbarer Test und die Validierung machen die Wahl nachvollziehbar.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Eine passende Lernrate verkürzt die Trainingszeit deutlich und stabilisiert Updates.
- Schedules erlauben unterschiedliche Schrittweiten für Start, Lernen und Feinschliff.
Das solltest du beachten
- Ein Wert, der bei einem Modell funktioniert, ist nicht automatisch auf andere Aufgaben übertragbar.
- Adaptive Optimierer ersetzen weder Monitoring noch eine Prüfung auf Validierungsdaten.
Vertiefung · für FortgeschritteneDie Lernrate zwischen Richtung und Schrittweite
Sie übersetzt den berechneten Gradienten in eine konkrete Parameteränderung.
Steuert, wie weit ein Optimierer bei jedem Update dem Gradienten folgt.
- Gradient Descent
- Algorithmus zur schrittweisen Fehlerminimierung im ML.
- Backpropagation
- Algorithmus zur Fehlerberechnung in neuronalen Netzen.
- Gradient Clipping
- Begrenzt zu große Gradienten für stabiles Training.
- Hyperparameter
- Manuell festgelegte Einstellungen für das KI-Training.
- Loss Function
- Eine Funktion, die die Genauigkeit von Modellvorhersagen misst.