Lernrate (Learning Rate)

Wie die Schrittweite ein stabiles Modelltraining ermöglicht

Die Lernrate steuert, wie große Schritte ein Modell beim Training macht, um seine Parameter anzupassen – einer der wichtigsten und sensibelsten Hyperparameter im Machine Learning.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Bestimmt, wie stark die Modellparameter bei jedem Trainingsschritt angepasst werden
  2. Zu hoch: Training divergiert; zu niedrig: Training ist quälend langsam
  3. Wird oft über einen Zeitplan (Learning Rate Schedule) während des Trainings angepasst

Sofortantwort

Lernrate einfach erklärt

Hyperparameter, der die Schrittweite beim Modelltraining steuert.

Kurz gesagt
Bestimmt, wie stark die Modellparameter bei jedem Trainingsschritt angepasst werden
Typischer Einsatz
Modelltraining, Hyperparameter-Tuning, Fine-Tuning
Wichtig zu wissen
Wird oft über einen Zeitplan (Learning Rate Schedule) während des Trainings angepasst

Lernrate im Überblick

Die Lernrate (englisch Learning Rate) ist einer der wichtigsten Hyperparameter beim Training von Machine-Learning-Modellen. Sie legt fest, wie groß die Schritte sind, mit denen das Modell seine Parameter bei jedem Trainingsschritt anpasst.

Beim Training berechnet das Modell über den Gradienten, in welche Richtung die Parameter geändert werden sollten, um den Fehler zu verringern. Die Lernrate bestimmt, wie weit das Modell in diese Richtung geht. Sie ist damit die Stellschraube zwischen „schnell, aber riskant” und „sicher, aber langsam”.

Technisch betrachtet

Die Gratwanderung

LernrateEffekt
zu hochLoss springt oder explodiert, Training divergiert
zu niedrigTraining extrem langsam, bleibt evtl. in flachem Minimum stecken
passendzügige, stabile Konvergenz zu einer guten Lösung

Im Gradient-Descent-Update taucht sie als Faktor η auf:

w_neu = w_alt − η · ∂L/∂w

Ein größeres η bedeutet größere Schritte.

Learning Rate Schedules

Eine feste Lernrate ist selten optimal. Üblich ist, anfangs größere Schritte zu machen und sie mit der Zeit zu verkleinern:

  • Warm-up – sanfter Start mit ansteigender Lernrate
  • Step Decay – stufenweise Reduktion nach festen Epochen
  • Cosine Annealing – sanftes Auslaufen entlang einer Kosinuskurve

Adaptive Optimierer

Verfahren wie Adam passen die effektive Schrittweite pro Parameter automatisch an. Sie machen die Wahl der Lernrate robuster, ersetzen aber nicht ganz das Gefühl für eine sinnvolle Ausgangsgröße.

Schritt für Schritt

So findest du eine belastbare Lernrate

  1. Mit einem konservativen Bereich starten

    Leite einen kleinen Bereich aus Modelltyp, Optimierer und Aufgabenstellung ab. Bei Fine-Tuning ist er meist deutlich niedriger als beim Training eines Modells von Grund auf.

  2. Kurzen Range-Test durchführen

    Erhöhe die Lernrate über einen begrenzten Probelauf schrittweise und beobachte den Loss. Der sinnvolle Bereich liegt vor dem Punkt, an dem der Verlauf sprunghaft oder instabil wird.

  3. Zeitplan für die Trainingsphasen wählen

    Nutze ein Warm-up für den Start und reduziere die Lernrate später. Große Schritte beschleunigen den Anfang, kleinere Schritte helfen beim kontrollierten Annähern an eine gute Lösung.

  4. Mit Validierungsdaten absichern

    Prüfe nicht nur den Trainings-Loss. Eine Lernrate ist erst dann gut gewählt, wenn sich auch die Leistung auf unbekannten Beispielen stabil entwickelt.

Konkretes Beispiel

Fine-Tuning eines Dokumentenklassifikators

Ein vortrainiertes Sprachmodell soll Rechnungen, Verträge und Support-Anfragen unterscheiden. Das Team will vorhandenes Wissen bewahren und trotzdem die neue Aufgabe schnell lernen.

Testreihe

Drei kurze Läufe mit unterschiedlichen Startwerten: 1e-4, 3e-5 und 5e-6. Alle Läufe nutzen Warm-up, dieselbe Batch Size und denselben Validierungssplit.

Entscheidung

Bei 1e-4 schwankt der Validierungs-Loss stark. 5e-6 lernt zuverlässig, aber zu langsam. 3e-5 verbessert beide Metriken stabil und wird mit sanftem Decay weitertrainiert.

Die Lernrate wird nicht geraten: Ein kleiner, vergleichbarer Test und die Validierung machen die Wahl nachvollziehbar.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Eine passende Lernrate verkürzt die Trainingszeit deutlich und stabilisiert Updates.
  • Schedules erlauben unterschiedliche Schrittweiten für Start, Lernen und Feinschliff.

Das solltest du beachten

  • Ein Wert, der bei einem Modell funktioniert, ist nicht automatisch auf andere Aufgaben übertragbar.
  • Adaptive Optimierer ersetzen weder Monitoring noch eine Prüfung auf Validierungsdaten.
Vertiefung · für Fortgeschrittene

Die Lernrate zwischen Richtung und Schrittweite

Sie übersetzt den berechneten Gradienten in eine konkrete Parameteränderung.

Wissenskarte

Steuert, wie weit ein Optimierer bei jedem Update dem Gradienten folgt.

Gradient Descent
Algorithmus zur schrittweisen Fehlerminimierung im ML.
Backpropagation
Algorithmus zur Fehlerberechnung in neuronalen Netzen.
Gradient Clipping
Begrenzt zu große Gradienten für stabiles Training.
Hyperparameter
Manuell festgelegte Einstellungen für das KI-Training.
Loss Function
Eine Funktion, die die Genauigkeit von Modellvorhersagen misst.
Die Lernrate wirkt nicht isoliert: Gradienten, Optimierer, Batch Size und die Form des Loss bestimmen gemeinsam, ob ein Update hilfreich ist. Lernrate gliedert sich in: Gradient Descent, Backpropagation, Gradient Clipping, Hyperparameter, Loss Function.

01Einsatzbereiche

Wann ist Lernrate sinnvoll?

Geeignet für

  • ModelltrainingGrundlegende Einstellung bei jedem Training mit Gradient Descent
  • Hyperparameter-TuningMeist der erste und wirkungsvollste Parameter, der optimiert wird
  • Fine-TuningBeim Nachtrainieren vortrainierter Modelle werden bewusst sehr kleine Lernraten gewählt

↑ Inhalt

02Werkzeuge

Womit Lernrate umgesetzt wird

↑ Inhalt

Merksatz

Die Lernrate ist wie die Schrittweite beim Abstieg von einem Berg im Nebel

Zu große Schritte und du springst über das Tal hinweg oder stürzt; zu kleine Schritte und du brauchst ewig, bis du unten ankommst. Die richtige Schrittweite bringt dich zügig und sicher ans Ziel.

  1. Bestimmt, wie stark die Modellparameter bei jedem Trainingsschritt angepasst werden
  2. Zu hoch: Training divergiert; zu niedrig: Training ist quälend langsam
  3. Wird oft über einen Zeitplan (Learning Rate Schedule) während des Trainings angepasst

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Lernrate

Was passiert bei einer zu hohen Lernrate?

Das Modell macht zu große Schritte und überspringt das Optimum immer wieder. Der Fehler (Loss) springt unkontrolliert oder wächst sogar – das Training divergiert und konvergiert nie zu einer guten Lösung.

Was ist ein Learning Rate Schedule?

Ein Zeitplan, der die Lernrate während des Trainings verändert – typischerweise startet man höher und reduziert sie schrittweise (Decay). Verbreitete Varianten sind Step Decay, Cosine Annealing und ein anfängliches Warm-up.

Wie findet man eine gute Lernrate?

Häufig per Learning-Rate-Range-Test: Man lässt die Lernrate testweise ansteigen und beobachtet, wo der Loss am schnellsten fällt, bevor er instabil wird. Alternativ helfen adaptive Optimierer wie Adam, die die effektive Schrittweite teilweise selbst regeln.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Backpropagation

    Algorithmus zur Fehlerberechnung in neuronalen Netzen.

  • Technisch vertiefen

    Loss Function

    Eine Funktion, die die Genauigkeit von Modellvorhersagen misst.

↑ Inhalt