<EbeneX/>
LLM Grundlagen · Updated 3. März 2026

RLHF (Reinforcement Learning from Human Feedback)

Definition

Eine Trainingsmethode, bei der ein KI-Modell durch menschliches Feedback lernt, hilfreiche, harmlose und ehrliche Antworten zu generieren.

Experte 3 Min. Lesezeit EN: Reinforcement Learning from Human Feedback

Einfach erklärt

RLHF (Reinforcement Learning from Human Feedback) ist die Trainingsmethode, die aus einem rohen Sprachmodell einen hilfreichen, harmlosen und ehrlichen Assistenten macht. Sie ist der Grund, warum ChatGPT, Claude und Gemini so anders wirken als reine Basismodelle. Ein Basismodell lernt nur, Text fortzusetzen – RLHF lehrt es, was “gute” Antworten sind, indem menschliche Bewerter Antwortpaare vergleichen und das Modell auf diese Präferenzen trainiert wird.

RLHF ist die Methode, die aus einem rohen Sprachmodell einen hilfreichen Assistenten macht. Ohne RLHF würde GPT-5 wirre Textfortsetzungen generieren statt nützliche Antworten.

Warum reicht normales Training nicht?

Ein Basismodell lernt nur, Text vorherzusagen – nicht, GUTEN Text zu generieren. RLHF lehrt das Modell, was Menschen als hilfreich, harmlos und ehrlich empfinden.

Die drei Schritte:

  1. Supervised Fine-Tuning (SFT): Modell lernt aus menschlich geschriebenen Beispiel-Antworten
  2. Reward Model Training: Ein zweites Modell lernt, gute von schlechten Antworten zu unterscheiden
  3. PPO-Optimierung: Das LLM wird mit dem Reward Model optimiert

Alternativen: DPO (Direct Preference Optimization) ist einfacher und günstiger. Constitutional AI (Claude) nutzt KI-Feedback statt menschlichem.

Technischer Deep Dive

Schritt 1: Supervised Fine-Tuning

Menschliche Annotatoren schreiben hochwertige Antworten auf Prompts. Das Basismodell wird auf diesen Daten fine-getuned. Ergebnis: Ein Modell, das Anweisungen folgen kann, aber noch nicht optimal ist.

Schritt 2: Reward Model

Annotatoren bewerten Paare von Antworten (A ist besser als B). Aus diesen Präferenzen wird ein Reward Model trainiert, das jeder Antwort einen Score gibt.

Schritt 3: PPO-Training

Das LLM wird mit Proximal Policy Optimization trainiert:

  • LLM generiert Antworten
  • Reward Model bewertet sie
  • PPO passt das LLM an, um höhere Rewards zu erzielen
  • KL-Divergenz-Penalty verhindert, dass das Modell zu weit vom Basismodell abweicht

Alternativen

MethodeReward ModelKomplexitätStabilität
RLHF (PPO)JaHochMittel
DPONeinNiedrigHoch
ORPONeinNiedrigHoch
KTONeinNiedrigHoch

DPO: Die einfachere Alternative

Direct Preference Optimization (DPO) ist mittlerweile oft die bevorzugte Methode:

# DPO braucht nur Preference-Paare, kein Reward Model
training_data = [
    {"prompt": "Erkläre Quantenphysik", 
     "chosen": "Quantenphysik beschreibt...",  # Bessere Antwort
     "rejected": "Quantenphysik ist kompliziert..."  # Schlechtere Antwort
    },
    # ... mehr Paare
]

# Training mit TRL
from trl import DPOTrainer

trainer = DPOTrainer(
    model=model,
    ref_model=ref_model,
    train_dataset=dataset,
    beta=0.1,  # KL-Penalty
)
trainer.train()

Kosten und Aufwand

AspektRLHF (PPO)DPO
Menschliche Annotationen50k-100k+ Vergleiche10k-50k Vergleiche
Reward Model TrainingErforderlichNicht nötig
Training-StabilitätSchwierig zu tunenStabiler
GPU-KostenHoch (3 Modelle im Speicher)Niedriger (2 Modelle)
QualitätSehr gutVergleichbar

Typischer RLHF-Workflow

  1. Basis-Modell vortrainieren (Milliarden $)
  2. SFT-Daten sammeln: ~10k hochwertige Beispiele
  3. Preference-Daten sammeln: ~50k A/B-Vergleiche
  4. Reward Model trainieren auf Preferences
  5. PPO-Training mit Reward Model als Feedback
  6. Evaluation mit menschlichen Testern
  7. Iteration basierend auf Feedback

RLHF ist wie ein Koch, der seine Gerichte von Gästen bewerten lässt: Statt nur Rezepte zu befolgen, lernt er aus den Bewertungen, welche Gerichte am besten ankommen, und passt seinen Kochstil entsprechend an.

Trainiert LLMs mit menschlichem Feedback statt nur mit Textdaten

Die Methode hinter ChatGPT, Claude und anderen Assistenz-Modellen

Macht aus einem Basismodell einen hilfreichen, sicheren Assistenten

Chat-Modelle

ChatGPT und Claude wurden mit RLHF trainiert, um hilfreiche Assistenten zu sein

Sicherheits-Training

Modelle lernen, schädliche Anfragen abzulehnen

Qualitätsverbesserung

Antworten werden natürlicher, strukturierter und nützlicher

Warum reicht normales Fine-Tuning nicht?

Fine-Tuning auf Textdaten lehrt das Modell, Text zu generieren. RLHF lehrt es, GUTEN Text zu generieren – hilfreich, sicher und im gewünschten Stil. Es optimiert auf menschliche Präferenzen, nicht nur auf Textvorhersage.

Was sind Alternativen zu RLHF?

DPO (Direct Preference Optimization) ist einfacher und stabiler. ORPO kombiniert SFT und Preference Optimization. KTO braucht nur binäres Feedback. Constitutional AI nutzt KI-Feedback statt menschlichem.

Wie teuer ist RLHF?

Sehr teuer. Es braucht menschliche Annotatoren für Tausende von Vergleichen, Training eines Reward Models und PPO-Training des LLMs. Das ist einer der Gründe, warum DPO als einfachere Alternative populär wurde.

Dein persönliches Share-Bild für Instagram – 1080×1080px, bereit zum Posten.