Sofortantwort
Pre-Training einfach erklärt
Erste Trainingsphase, in der ein Modell grundlegende Fähigkeiten erlernt.
- Kurz gesagt
- Trainiert auf Billionen von Tokens aus dem Internet, Büchern, Code etc.
- Typischer Einsatz
- Foundation Models, Domain-spezifische Modelle, Multimodale Modelle
- Wichtig zu wissen
- Kostet Millionen Dollar und dauert Wochen auf tausenden GPUs
Pre-Training im Überblick
Pre-Training ist die erste und wichtigste Phase beim Training eines Sprachmodells. Das Modell liest Milliarden von Texten und lernt dabei, das nächste Wort vorherzusagen.
Die Trainingsphasen eines modernen LLMs:
1. Pre-Training → Allgemeines Wissen (Billionen Tokens)
2. Supervised FT → Instruktionen befolgen (Tausende Beispiele)
3. RLHF / DPO → Menschliche Präferenzen lernen
4. Safety Training → Schädliche Ausgaben vermeiden
Was das Modell im Pre-Training lernt:
- Grammatik und Sprachstruktur
- Faktenwissen über die Welt
- Logische Zusammenhänge und Reasoning-Ansätze
- Code-Syntax und Programmierkonzepte
- Mehrsprachige Fähigkeiten
Technisch betrachtet
Training Objective
Die meisten LLMs nutzen Causal Language Modeling (Next Token Prediction):
Eingabe: "Die Katze sitzt auf dem"
Ziel: "Katze sitzt auf dem Dach"
Loss = -log P("Dach" | "Die Katze sitzt auf dem")
Das Modell minimiert den Loss über Billionen solcher Vorhersagen.
Typische Pre-Training-Daten
| Quelle | Anteil | Beispiel |
|---|---|---|
| Webseiten | ~60 % | Common Crawl, gefiltert |
| Bücher | ~10 % | Books3, Project Gutenberg |
| Code | ~10 % | GitHub, Stack Overflow |
| Wissenschaft | ~10 % | ArXiv, PubMed |
| Sonstiges | ~10 % | Wikipedia, Reddit, News |
Scaling Laws
Pre-Training folgt vorhersagbaren Scaling Laws (Chinchilla):
Optimale Tokens ≈ 20 × Parameter
7B-Modell → ~140B Tokens
70B-Modell → ~1.4T Tokens
Mehr Daten und mehr Parameter → bessere Leistung, aber mit abnehmenden Erträgen.