Pre-Training

Die erste und aufwändigste Trainingsphase eines Foundation Models, in der es auf riesigen Datenmengen grundlegende Sprachverständnis- und Reasoning-Fähigkeiten erlernt – bevor Fine-Tuning oder RLHF folgen.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Trainiert auf Billionen von Tokens aus dem Internet, Büchern, Code etc.
  2. Lernt Sprachstruktur, Weltwissen und Reasoning-Grundlagen
  3. Kostet Millionen Dollar und dauert Wochen auf tausenden GPUs

Sofortantwort

Pre-Training einfach erklärt

Erste Trainingsphase, in der ein Modell grundlegende Fähigkeiten erlernt.

Kurz gesagt
Trainiert auf Billionen von Tokens aus dem Internet, Büchern, Code etc.
Typischer Einsatz
Foundation Models, Domain-spezifische Modelle, Multimodale Modelle
Wichtig zu wissen
Kostet Millionen Dollar und dauert Wochen auf tausenden GPUs

Pre-Training im Überblick

Pre-Training ist die erste und wichtigste Phase beim Training eines Sprachmodells. Das Modell liest Milliarden von Texten und lernt dabei, das nächste Wort vorherzusagen.

Die Trainingsphasen eines modernen LLMs:

1. Pre-Training      → Allgemeines Wissen (Billionen Tokens)
2. Supervised FT     → Instruktionen befolgen (Tausende Beispiele)
3. RLHF / DPO       → Menschliche Präferenzen lernen
4. Safety Training   → Schädliche Ausgaben vermeiden

Was das Modell im Pre-Training lernt:

  • Grammatik und Sprachstruktur
  • Faktenwissen über die Welt
  • Logische Zusammenhänge und Reasoning-Ansätze
  • Code-Syntax und Programmierkonzepte
  • Mehrsprachige Fähigkeiten

Technisch betrachtet

Training Objective

Die meisten LLMs nutzen Causal Language Modeling (Next Token Prediction):

Eingabe:  "Die Katze sitzt auf dem"
Ziel:     "Katze sitzt auf dem Dach"

Loss = -log P("Dach" | "Die Katze sitzt auf dem")

Das Modell minimiert den Loss über Billionen solcher Vorhersagen.

Typische Pre-Training-Daten

QuelleAnteilBeispiel
Webseiten~60 %Common Crawl, gefiltert
Bücher~10 %Books3, Project Gutenberg
Code~10 %GitHub, Stack Overflow
Wissenschaft~10 %ArXiv, PubMed
Sonstiges~10 %Wikipedia, Reddit, News

Scaling Laws

Pre-Training folgt vorhersagbaren Scaling Laws (Chinchilla):

Optimale Tokens ≈ 20 × Parameter

7B-Modell  → ~140B Tokens
70B-Modell → ~1.4T Tokens

Mehr Daten und mehr Parameter → bessere Leistung, aber mit abnehmenden Erträgen.

01Einsatzbereiche

Wann ist Pre-Training sinnvoll?

Geeignet für

  • Foundation ModelsGPT-4, Claude, Llama werden alle zunächst mit Pre-Training auf riesigen Textkorpora trainiert
  • Domain-spezifische ModelleContinued Pre-Training auf Fachliteratur (Medizin, Recht, Finanzen) für spezialisierte Modelle
  • Multimodale ModellePre-Training auf Text-Bild-Paaren für Vision-Language-Modelle

↑ Inhalt

02Werkzeuge

Womit Pre-Training umgesetzt wird

↑ Inhalt

Merksatz

Pre-Training ist wie die Schulausbildung eines Menschen

Du lernst Lesen, Schreiben, Rechnen und allgemeines Weltwissen – nicht für einen bestimmten Job, sondern als Grundlage für alles, was danach kommt. Fine-Tuning ist dann die Spezialisierung im Beruf.

  1. Trainiert auf Billionen von Tokens aus dem Internet, Büchern, Code etc.
  2. Lernt Sprachstruktur, Weltwissen und Reasoning-Grundlagen
  3. Kostet Millionen Dollar und dauert Wochen auf tausenden GPUs

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Pre-Training

Wie teuer ist Pre-Training?

GPT-4-Klasse-Modelle kosten geschätzt 50–100 Millionen Dollar für einen Training-Run. Kleinere Modelle (7B Parameter) lassen sich ab ~100.000 Dollar trainieren. Die Kosten sinken durch bessere Hardware und effizientere Algorithmen.

Was ist der Unterschied zwischen Pre-Training und Fine-Tuning?

Pre-Training lernt allgemeines Wissen auf riesigen Datenmengen (unsupervised). Fine-Tuning spezialisiert das Modell auf eine bestimmte Aufgabe mit kleineren, kuratierten Datensätzen (supervised). Pre-Training ist die Basis, Fine-Tuning die Spezialisierung.

Kann ich selbst ein Modell von Grund auf pre-trainen?

Theoretisch ja, praktisch braucht man enorme Compute-Ressourcen. Für die meisten Anwendungen ist es sinnvoller, ein existierendes Pre-Trained-Modell per Fine-Tuning oder RAG anzupassen.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Scaling Laws

    Gesetzmäßigkeiten zur Skalierung von LLM-Leistung.

  • Technisch vertiefen

    Trainingsdaten

    Datensätze, die das Lernen und die Leistung von Modellen bestimmen.

↑ Inhalt