Sofortantwort
Parameter einfach erklärt
Werte, die das Wissen eines KI-Modells während des Trainings repräsentieren.
- Kurz gesagt
- Werden automatisch während des Trainings durch den Algorithmus gelernt
- Typischer Einsatz
- Modellvergleich, Hardware-Planung, Modellkompression
- Wichtig zu wissen
- Moderne LLMs haben Milliarden bis Billionen Parameter
Parameter im Überblick
Parameter sind die lernbaren Zahlenwerte in einem KI-Modell – die Gewichte und Biases der neuronalen Netze. Sie sind das “Gedächtnis” des Modells: Alles, was das Modell aus den Trainingsdaten gelernt hat, ist in diesen Zahlen kodiert.
Beispiel: Bei einer einfachen linearen Regression y = mx + b sind m (Steigung) und b (Achsenabschnitt) die Parameter. Bei einem LLM sind es Milliarden solcher Werte in den Gewichtsmatrizen des neuronalen Netzes.
Aktuelle Modellgrößen (März 2026):
| Modell | Parameter | Architektur | Speicher (FP16) |
|---|---|---|---|
| Llama 3.3 | 70B | Dense | ~140 GB |
| Llama 4 Scout | 17B aktiv / 109B total | MoE | ~34 GB (aktiv) |
| Llama 4 Maverick | 17B aktiv / 400B total | MoE | ~34 GB (aktiv) |
| Mistral Large 3 | 41B aktiv / 675B total | MoE | ~82 GB (aktiv) |
| Claude Sonnet 4.6 | ~175B (geschätzt) | Dense | ~350 GB |
| GPT-5.4 | ~1.5T (geschätzt) | MoE | ~500 GB (aktiv) |
| Gemini 3.5 Pro | ~1T+ (geschätzt) | MoE | ~400 GB (aktiv) |
Dense vs. MoE:
- Dense: Alle Parameter bei jedem Token aktiv (Llama 3, Claude)
- MoE (Mixture of Experts): Nur Teil der Parameter aktiv, Rest “schläft” (Llama 4, Mistral, GPT-5)
Die Anzahl der Parameter ist ein grober Indikator für die Kapazität – aber Trainingsqualität, Datenmenge und Architektur sind genauso wichtig. Kleinere, gut trainierte Modelle können größere übertreffen.
Technisch betrachtet
Arten von Parametern
- Gewichte (Weights): Multiplikatoren in den Matrixoperationen
- Biases: Verschiebungswerte, die zu den Gewichten addiert werden
- Embedding-Matrizen: Vektoren für Token-Repräsentationen
- Attention-Parameter: Q, K, V Projektionsmatrizen
Initialisierung
Parameter werden vor dem Training initialisiert:
- Xavier/Glorot: Standard für Sigmoid/Tanh-Aktivierungen
- He/Kaiming: Optimiert für ReLU-Aktivierungen
- Zufällig: Kleine Zufallswerte um 0
Schlechte Initialisierung kann das Training komplett verhindern (Vanishing/Exploding Gradients).
Parameterzahl berechnen
Für einen Transformer-Block:
- Self-Attention: 4 × d² (Q, K, V, Output-Projektion)
- Feed-Forward: 2 × d × 4d = 8d²
- Gesamt pro Block: ~12d²
- Gesamtmodell: ~12 × d² × N_layers + Vocab × d
Schritt für Schritt
Wie Modellparameter entstehen und genutzt werden
Parameter sind trainierte Werte, keine Inhaltsdatenbank. Ihre Anzahl beschreibt Kapazität und Betriebskosten nur sehr grob.
Parameter initialisieren
Start
Vor dem Training erhalten Gewichte und weitere lernbare Werte passende Startwerte.
Architektur → initiale GewichteVorhersage berechnen
Forward Pass
Bei jedem Trainingsbeispiel transformieren Parameter die Eingabe zu einer Modellvorhersage.
Eingabe × Gewichte → AusgabeFehler in Änderungen übersetzen
Training
Gradienten zeigen, wie einzelne Parameter verändert werden sollten, um den Loss zu verringern.
Loss → Gradienten → UpdatesGewichte im Betrieb verwenden
Inferenz
Nach dem Training bleiben Parameter während der Inferenz fest und bestimmen Speicherbedarf, Rechenaufwand und Modellverhalten.
feste Gewichte → neue Vorhersage
Konkretes Beispiel
Beispiel: Zwei Modelle für dieselbe Aufgabe
Ein Team vergleicht ein großes und ein kompaktes Modell für eine interne Suche.
Parameterzahl als einziges Kriterium
Das Team nimmt automatisch das größte Modell an und ignoriert Latenz, Kosten, Datenlage und Qualität auf echten Suchanfragen.
Eignung im Kontext
Beide Modelle werden auf relevanten Fällen evaluiert. Das kompaktere Modell liefert ausreichende Qualität bei geringeren Kosten und kürzerer Antwortzeit.
Mehr Parameter bedeuten mehr Kapazität, aber nicht automatisch bessere Qualität für jede Aufgabe.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Speichern die während des Trainings gelernten Muster eines Modells.
- Bestimmen zusammen mit der Architektur die Modellkapazität.
- Machen verschiedene Formen der Anpassung wie Fine-Tuning möglich.
- Lassen sich für effizienteren Betrieb quantisieren oder teilweise reduzieren.
Das solltest du beachten
- Eine hohe Zahl allein ist kein belastbares Qualitätsmaß.
- Viele Parameter erhöhen häufig Speicher- und Rechenbedarf.
- Gelerntes Wissen ist nicht direkt als einzelne Regel auslesbar.
- Parameter können Verzerrungen und Fehler aus den Trainingsdaten mittragen.
Vertiefung · für FortgeschritteneParameter zwischen Training und Einsatz
Die Werte werden durch Training angepasst und im Betrieb für jede neue Eingabe genutzt.
Gelernte Gewichte