Gradient Descent

Wie Modelle ihre Parameter schrittweise in Richtung eines geringeren Fehlers anpassen

Der fundamentale Optimierungsalgorithmus im Machine Learning, der die Parameter eines Modells schrittweise anpasst, um den Fehler zu minimieren.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Minimiert die Loss Function durch iterative Anpassung der Modellparameter
  2. Folgt dem negativen Gradienten – der Richtung des steilsten Abstiegs
  3. Varianten: SGD, Mini-Batch, Adam, AdamW – mit unterschiedlichen Eigenschaften

Sofortantwort

Gradient Descent einfach erklärt

Algorithmus zur schrittweisen Fehlerminimierung im ML.

Kurz gesagt
Minimiert die Loss Function durch iterative Anpassung der Modellparameter
Typischer Einsatz
Neuronale Netze, Lineare Modelle, LLM-Training
Wichtig zu wissen
Varianten: SGD, Mini-Batch, Adam, AdamW – mit unterschiedlichen Eigenschaften

Gradient Descent im Überblick

Gradient Descent ist der fundamentale Optimierungsalgorithmus, der das Training aller neuronalen Netze antreibt. Das Ziel: Die Parameter des Modells so anpassen, dass der Fehler (Loss) auf den Trainingsdaten minimiert wird. Der Algorithmus berechnet den Gradienten – die Richtung des steilsten Anstiegs der Loss-Funktion – und bewegt die Parameter in die entgegengesetzte Richtung. Schritt für Schritt, Iteration für Iteration, nähert sich das Modell einem Minimum.

Gradient Descent ist der Motor hinter dem Training von KI-Modellen. Er passt die Parameter Schritt für Schritt an, um den Fehler (Loss) zu minimieren.

Der Ablauf:

  1. Berechne den Fehler (Loss) für aktuelle Parameter
  2. Berechne den Gradienten (Richtung des steilsten Anstiegs)
  3. Gehe einen Schritt in die entgegengesetzte Richtung (bergab)
  4. Wiederhole, bis der Fehler minimal ist

Varianten:

VarianteDaten pro SchrittGeschwindigkeitStabilität
Batch GDGesamter DatensatzLangsamSehr stabil
SGD1 BeispielSchnellInstabil
Mini-Batch16-512 BeispieleAusgewogenGut

Technisch betrachtet

Update-Regel

θ_new = θ_old - η * ∇L(θ)
  • θ: Parameter
  • η: Learning Rate
  • ∇L: Gradient der Loss Function

Moderne Optimizer

SGD mit Momentum: Fügt einen “Schwung”-Term hinzu, der über vergangene Gradienten mittelt. Hilft bei Plateaus und Sattelpunkten.

Adam (Adaptive Moment Estimation): Kombiniert Momentum mit adaptiver Learning Rate pro Parameter. Standard für die meisten Deep-Learning-Aufgaben.

AdamW: Adam mit korrektem Weight Decay (decoupled). Standard für Transformer-Training.

Herausforderungen

  • Lokale Minima: Gradient Descent kann in suboptimalen Lösungen stecken bleiben
  • Sattelpunkte: Gradienten nahe Null, obwohl kein Minimum erreicht ist
  • Vanishing/Exploding Gradients: Gradienten werden in tiefen Netzen zu klein oder zu groß
  • Learning Rate Wahl: Zu hoch → Divergenz, zu niedrig → zu langsam

Learning Rate Finder

Eine bewährte Methode zur Wahl der Learning Rate:

# PyTorch Lightning LR Finder
from pytorch_lightning.tuner import Tuner

tuner = Tuner(trainer)
lr_finder = tuner.lr_find(model, datamodule)
fig = lr_finder.plot(suggest=True)
model.learning_rate = lr_finder.suggestion()

Visualisierung: Loss Landscape

Loss

│     █
│    █ █
│   █   █
│  █     ███
│ █         ██
│█            ████  ← Lokales Minimum
│               ██████  ← Globales Minimum
└────────────────────────── Parameter

Optimizer-Vergleich

OptimizerVorteileNachteileTypische LR
SGDEinfach, gute GeneralisierungLangsam, sensitiv0.01-0.1
SGD+MomentumSchneller, überwindet PlateausEin Hyperparameter mehr0.01-0.1
AdamSchnelle Konvergenz, adaptivKann übergeneralisieren1e-4 bis 3e-4
AdamWKorrektes Weight Decay-1e-4 bis 3e-4

Schritt für Schritt

Wie Gradient Descent beim Training wirkt

Der Algorithmus nutzt den Fehler eines Modells als Richtungssignal. Die Größe und Stabilität der Schritte entscheiden mit über das Ergebnis.

  1. Fehler berechnen

    Messen

    Das Modell erzeugt eine Vorhersage; die Loss Function misst ihre Abweichung vom gewünschten Ergebnis.

    Vorhersage → Loss
  2. Richtung ableiten

    Ableiten

    Gradienten zeigen für jeden Parameter, wie er sich ändern müsste, damit der Loss bei einem kleinen Schritt sinkt.

    Loss → Gradienten
  3. Kontrolliert aktualisieren

    Anpassen

    Learning Rate, Optimizer und Batches bestimmen die Schrittgröße. Validierungsdaten zeigen, ob die Verbesserung auch außerhalb des Trainings trägt.

    Gradienten → neue Parameter

Konkretes Beispiel

Beispiel: Fehler beim Training begrenzen

Ein Modell soll Bilder in zwei Kategorien einordnen, doch der Trainings-Loss springt stark.

Zu große Schritte

Eine hohe Learning Rate führt dazu, dass die Parameter immer wieder über ein günstiges Gebiet hinausschießen. Der Loss bleibt instabil.

Kontrollierte Optimierung

Das Team reduziert die Learning Rate, beobachtet Trainings- und Validierungskurve und vergleicht eine stabile Baseline mit unterschiedlichen Optimierern.

Gradient Descent minimiert eine mathematische Zielfunktion – die fachliche Qualität muss zusätzlich mit passenden Testdaten geprüft werden.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Skaliert die Anpassung vieler Parameter über klare, wiederholbare Optimierungsschritte.
  • Bildet die Grundlage für das Training moderner neuronaler Netze.
  • Lässt sich mit Lernkurven und Validierung sichtbar überwachen.

Das solltest du beachten

  • Schrittgröße und Optimierer müssen zum Problem und Datenumfang passen.
  • Instabile oder schlechte Gradienten können Training ausbremsen oder scheitern lassen.
  • Ein geringer Trainingsfehler kann durch Overfitting ein falsches Sicherheitsgefühl geben.
Vertiefung · für Fortgeschrittene

Gradient Descent im Trainingskreislauf

Optimierung verbindet Fehlermaß, Gradienten und Modellparameter zu wiederholten Lernschritten.

Wissenskarte

Parameter schrittweise verbessern

Loss Function
Eine Funktion, die die Genauigkeit von Modellvorhersagen misst.
Backpropagation
Algorithmus zur Fehlerberechnung in neuronalen Netzen.
Hyperparameter
Manuell festgelegte Einstellungen für das KI-Training.
Parameter
Werte, die das Wissen eines KI-Modells während des Trainings repräsentieren.
Overfitting
Probleme, die beim Machine Learning die Modellgenauigkeit beeinflussen.
Die Optimierung kann nur so gut sein wie Ziel, Daten und Kontrolle der Qualität auf unabhängigen Fällen. Gradient Descent gliedert sich in: Loss Function, Backpropagation, Hyperparameter, Parameter, Overfitting.

01Einsatzbereiche

Wann ist Gradient Descent sinnvoll?

Geeignet für

  • Neuronale NetzeTraining aller neuronalen Netze basiert auf Gradient Descent
  • Lineare ModelleOptimierung von linearer und logistischer Regression
  • LLM-TrainingAdamW ist der Standard-Optimizer für das Training von Transformern

↑ Inhalt

02Werkzeuge

Womit Gradient Descent umgesetzt wird

↑ Inhalt

Merksatz

Gradient Descent ist wie ein Wanderer, der im Nebel den Weg ins Tal sucht

Er fühlt die Neigung des Bodens unter seinen Füßen und geht immer in die steilste Abwärtsrichtung – Schritt für Schritt, bis er den tiefsten Punkt erreicht.

  1. Minimiert die Loss Function durch iterative Anpassung der Modellparameter
  2. Folgt dem negativen Gradienten – der Richtung des steilsten Abstiegs
  3. Varianten: SGD, Mini-Batch, Adam, AdamW – mit unterschiedlichen Eigenschaften

04Anwenden

Gradient Descent praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Gradient Descent

Was ist ein Gradient?

Der Gradient ist ein Vektor, der die Richtung und Stärke der steilsten Steigung einer Funktion angibt. Beim Training zeigt er, wie die Loss Function auf Änderungen jedes Parameters reagiert. Wir gehen in die entgegengesetzte Richtung (bergab).

Was ist die Learning Rate?

Die Schrittgröße bei jedem Update. Zu groß: Das Modell springt über das Minimum hinweg. Zu klein: Training dauert ewig. Die Learning Rate ist der wichtigste Hyperparameter.

Was ist der Unterschied zwischen SGD und Adam?

SGD nutzt eine feste Learning Rate für alle Parameter. Adam passt die Learning Rate pro Parameter adaptiv an und nutzt Momentum. Adam konvergiert oft schneller, SGD kann aber bessere Endresultate liefern.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Aktivierungsfunktion

    Funktionen, die Nicht-Linearität in neuronalen Netzen ermöglichen.

  • Technisch vertiefen

    Parameter

    Werte, die das Wissen eines KI-Modells während des Trainings repräsentieren.

  • In der Praxis anwenden

    Grundlagen Machine Learning

    Wie Maschinen aus Daten lernen – der komplette Einstieg ohne Vorkenntnisse.

↑ Inhalt