Sofortantwort
Instruction Tuning einfach erklärt
Training von LLMs, um Anweisungen zu befolgen.
- Kurz gesagt
- Trainiert LLMs, natürlichsprachliche Anweisungen zu verstehen und zu befolgen
- Typischer Einsatz
- Chat-Assistenten, Task-Completion, Multi-Task Learning
- Wichtig zu wissen
- Nutzt Datensätze aus Anweisung-Antwort-Paaren
Instruction Tuning im Überblick
Instruction Tuning trainiert LLMs, Anweisungen zu verstehen und zu befolgen. Ein Basis-LLM kann Text vervollständigen, aber es weiß nicht, dass “Fasse zusammen” eine Aufforderung ist. Nach Instruction Tuning versteht es das.
Vorher (Basis-LLM):
Input: "Fasse diesen Text zusammen: [langer Text]"
Output: "Der Text handelt von..." (oder: vervollständigt einfach weiter)
Nachher (Instruction-Tuned):
Input: "Fasse diesen Text zusammen: [langer Text]"
Output: [Präzise Zusammenfassung des Textes]
Der Trainings-Prozess:
Datensatz:
{"instruction": "Übersetze ins Englische", "input": "Hallo Welt", "output": "Hello World"}
{"instruction": "Schreibe ein Gedicht über", "input": "Herbst", "output": "Die Blätter fallen..."}
...
-> Supervised Fine-Tuning auf diesen Paaren
-> Modell lernt, Anweisungen zu befolgen
Technisch betrachtet
Datenformat
{
"instruction": "Erkläre das Konzept einfach",
"input": "Quantenverschränkung",
"output": "Quantenverschränkung ist wie zwei magische Würfel..."
}
Oder im Chat-Format:
{
"messages": [
{"role": "user", "content": "Erkläre Quantenverschränkung einfach"},
{"role": "assistant", "content": "Quantenverschränkung ist wie..."}
]
}
Der LLM-Training-Stack
1. Pre-Training (Basis-LLM)
→ Lernt Sprache aus riesigen Textmengen
2. Instruction Tuning (SFT)
→ Lernt, Anweisungen zu befolgen
3. RLHF / DPO (Alignment)
→ Lernt menschliche Präferenzen
Wichtige Datensätze
| Datensatz | Größe | Besonderheit |
|---|---|---|
| FLAN | 1.8M | Multi-Task, diverse Aufgaben |
| Alpaca | 52K | GPT-generiert, kompakt |
| Dolly | 15K | Menschlich geschrieben |
| OpenAssistant | 160K | Community-erstellt, multilingual |
Best Practices
- Qualität > Quantität: Wenige gute Beispiele schlagen viele schlechte
- Diversität: Viele verschiedene Aufgabentypen abdecken
- Konsistenz: Einheitliches Format und Stil
- Negative Beispiele: Was das Modell NICHT tun soll