LLM
Der Prozess, KI-Systeme so auszurichten, dass sie menschliche Werte, Absichten und Sicherheitsanforderungen zuverlässig befolgen.
Eine Trainingsmethode, bei der ein KI-Modell durch menschliches Feedback lernt, hilfreiche, harmlose und ehrliche Antworten zu generieren.
RLHF (Reinforcement Learning from Human Feedback) ist die Trainingsmethode, die aus einem rohen Sprachmodell einen hilfreichen, harmlosen und ehrlichen Assistenten macht. Sie ist der Grund, warum ChatGPT, Claude und Gemini so anders wirken als reine Basismodelle. Ein Basismodell lernt nur, Text fortzusetzen – RLHF lehrt es, was “gute” Antworten sind, indem menschliche Bewerter Antwortpaare vergleichen und das Modell auf diese Präferenzen trainiert wird.
RLHF ist die Methode, die aus einem rohen Sprachmodell einen hilfreichen Assistenten macht. Ohne RLHF würde GPT-5 wirre Textfortsetzungen generieren statt nützliche Antworten.
Warum reicht normales Training nicht?
Ein Basismodell lernt nur, Text vorherzusagen – nicht, GUTEN Text zu generieren. RLHF lehrt das Modell, was Menschen als hilfreich, harmlos und ehrlich empfinden.
Die drei Schritte:
Alternativen: DPO (Direct Preference Optimization) ist einfacher und günstiger. Constitutional AI (Claude) nutzt KI-Feedback statt menschlichem.
Menschliche Annotatoren schreiben hochwertige Antworten auf Prompts. Das Basismodell wird auf diesen Daten fine-getuned. Ergebnis: Ein Modell, das Anweisungen folgen kann, aber noch nicht optimal ist.
Annotatoren bewerten Paare von Antworten (A ist besser als B). Aus diesen Präferenzen wird ein Reward Model trainiert, das jeder Antwort einen Score gibt.
Das LLM wird mit Proximal Policy Optimization trainiert:
| Methode | Reward Model | Komplexität | Stabilität |
|---|---|---|---|
| RLHF (PPO) | Ja | Hoch | Mittel |
| DPO | Nein | Niedrig | Hoch |
| ORPO | Nein | Niedrig | Hoch |
| KTO | Nein | Niedrig | Hoch |
Direct Preference Optimization (DPO) ist mittlerweile oft die bevorzugte Methode:
# DPO braucht nur Preference-Paare, kein Reward Model
training_data = [
{"prompt": "Erkläre Quantenphysik",
"chosen": "Quantenphysik beschreibt...", # Bessere Antwort
"rejected": "Quantenphysik ist kompliziert..." # Schlechtere Antwort
},
# ... mehr Paare
]
# Training mit TRL
from trl import DPOTrainer
trainer = DPOTrainer(
model=model,
ref_model=ref_model,
train_dataset=dataset,
beta=0.1, # KL-Penalty
)
trainer.train()
| Aspekt | RLHF (PPO) | DPO |
|---|---|---|
| Menschliche Annotationen | 50k-100k+ Vergleiche | 10k-50k Vergleiche |
| Reward Model Training | Erforderlich | Nicht nötig |
| Training-Stabilität | Schwierig zu tunen | Stabiler |
| GPU-Kosten | Hoch (3 Modelle im Speicher) | Niedriger (2 Modelle) |
| Qualität | Sehr gut | Vergleichbar |
RLHF ist wie ein Koch, der seine Gerichte von Gästen bewerten lässt: Statt nur Rezepte zu befolgen, lernt er aus den Bewertungen, welche Gerichte am besten ankommen, und passt seinen Kochstil entsprechend an.
Trainiert LLMs mit menschlichem Feedback statt nur mit Textdaten
Die Methode hinter ChatGPT, Claude und anderen Assistenz-Modellen
Macht aus einem Basismodell einen hilfreichen, sicheren Assistenten
Chat-Modelle
ChatGPT und Claude wurden mit RLHF trainiert, um hilfreiche Assistenten zu sein
Sicherheits-Training
Modelle lernen, schädliche Anfragen abzulehnen
Qualitätsverbesserung
Antworten werden natürlicher, strukturierter und nützlicher
Fine-Tuning auf Textdaten lehrt das Modell, Text zu generieren. RLHF lehrt es, GUTEN Text zu generieren – hilfreich, sicher und im gewünschten Stil. Es optimiert auf menschliche Präferenzen, nicht nur auf Textvorhersage.
DPO (Direct Preference Optimization) ist einfacher und stabiler. ORPO kombiniert SFT und Preference Optimization. KTO braucht nur binäres Feedback. Constitutional AI nutzt KI-Feedback statt menschlichem.
Sehr teuer. Es braucht menschliche Annotatoren für Tausende von Vergleichen, Training eines Reward Models und PPO-Training des LLMs. Das ist einer der Gründe, warum DPO als einfachere Alternative populär wurde.