ReLU und GELU

Die wichtigsten Aktivierungsfunktionen für neuronale Netze – ReLU für Effizienz, GELU für Transformer und moderne Architekturen.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. ReLU: max(0, x) – einfach und effizient
  2. GELU: x × Φ(x) – smooth, Standard in Transformern
  3. Lösen das Vanishing Gradient Problem von Sigmoid

Sofortantwort

ReLU und GELU einfach erklärt

Aktivierungsfunktionen: ReLU (einfach, schnell) und GELU (smooth, für Transformer).

Kurz gesagt
ReLU: max(0, x) – einfach und effizient
Typischer Einsatz
CNNs, Transformer/LLMs, Tiefe Netze
Wichtig zu wissen
Lösen das Vanishing Gradient Problem von Sigmoid

ReLU und GELU im Überblick

ReLU und GELU sind Aktivierungsfunktionen – sie entscheiden, wie stark ein Neuron “feuert”.

ReLU: f(x) = max(0, x)

    y │      /
      │     /
      │    /
    0 │───●

      └─────────────
          0    x

GELU: f(x) = x × Φ(x)  (Φ = Normalverteilung CDF)

    y │       _/
      │     _/
      │   _/
    0 │__/

      └─────────────
          0    x

Technisch betrachtet

Implementation

import numpy as np

def relu(x):
    return np.maximum(0, x)

def gelu(x):
    # Approximation (schneller)
    return 0.5 * x * (1 + np.tanh(np.sqrt(2/np.pi) * (x + 0.044715 * x**3)))

# PyTorch
import torch.nn.functional as F
F.relu(x)
F.gelu(x)

Vergleich

FunktionFormelVorteileNachteile
ReLUmax(0,x)Schnell, einfachDying ReLU
Leaky ReLUmax(0.01x, x)Kein DyingHyperparameter
GELUx×Φ(x)Smooth, beste PerformanceLangsamer
SiLU/Swishx×σ(x)Smooth, selbst-gatedLangsamer

01Einsatzbereiche

Wann ist ReLU und GELU sinnvoll?

Geeignet für

  • CNNsReLU ist Standard in Convolutional Networks
  • Transformer/LLMsGELU ist Standard (GPT, BERT)
  • Tiefe NetzeErmöglichen Training sehr tiefer Architekturen

↑ Inhalt

Merksatz

ReLU ist wie ein Türsteher

Negative Werte werden abgewiesen (0), positive dürfen durch. GELU ist ein freundlicherer Türsteher: Kleine negative Werte haben noch eine Chance.

  1. ReLU: max(0, x) – einfach und effizient
  2. GELU: x × Φ(x) – smooth, Standard in Transformern
  3. Lösen das Vanishing Gradient Problem von Sigmoid

03Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

04FAQ

Häufige Fragen zu ReLU und GELU

Warum GELU statt ReLU in Transformern?

GELU ist smooth (differenzierbar überall), hat bessere Gradienten-Eigenschaften und performt empirisch besser in NLP.

Was ist das 'Dying ReLU' Problem?

Neuronen mit negativem Input haben Gradient 0 und lernen nie wieder. Leaky ReLU oder GELU vermeiden das.

↑ Inhalt

05Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Sigmoid

    Aktivierungsfunktion, die Werte auf 0-1 abbildet (S-Kurve).

  • Technisch vertiefen

    Aktivierungsfunktion

    Funktionen, die Nicht-Linearität in neuronalen Netzen ermöglichen.

↑ Inhalt