Parameter

Die gelernten Zahlenwerte, mit denen ein Modell Muster verarbeitet

Die internen Zahlenwerte eines KI-Modells, die während des Trainings gelernt werden und das 'Wissen' des Modells repräsentieren.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Werden automatisch während des Trainings durch den Algorithmus gelernt
  2. Die Anzahl der Parameter bestimmt die Kapazität und Größe eines Modells
  3. Moderne LLMs haben Milliarden bis Billionen Parameter

Sofortantwort

Parameter einfach erklärt

Werte, die das Wissen eines KI-Modells während des Trainings repräsentieren.

Kurz gesagt
Werden automatisch während des Trainings durch den Algorithmus gelernt
Typischer Einsatz
Modellvergleich, Hardware-Planung, Modellkompression
Wichtig zu wissen
Moderne LLMs haben Milliarden bis Billionen Parameter

Parameter im Überblick

Parameter sind die lernbaren Zahlenwerte in einem KI-Modell – die Gewichte und Biases der neuronalen Netze. Sie sind das “Gedächtnis” des Modells: Alles, was das Modell aus den Trainingsdaten gelernt hat, ist in diesen Zahlen kodiert.

Beispiel: Bei einer einfachen linearen Regression y = mx + b sind m (Steigung) und b (Achsenabschnitt) die Parameter. Bei einem LLM sind es Milliarden solcher Werte in den Gewichtsmatrizen des neuronalen Netzes.

Aktuelle Modellgrößen (März 2026):

ModellParameterArchitekturSpeicher (FP16)
Llama 3.370BDense~140 GB
Llama 4 Scout17B aktiv / 109B totalMoE~34 GB (aktiv)
Llama 4 Maverick17B aktiv / 400B totalMoE~34 GB (aktiv)
Mistral Large 341B aktiv / 675B totalMoE~82 GB (aktiv)
Claude Sonnet 4.6~175B (geschätzt)Dense~350 GB
GPT-5.4~1.5T (geschätzt)MoE~500 GB (aktiv)
Gemini 3.5 Pro~1T+ (geschätzt)MoE~400 GB (aktiv)

Dense vs. MoE:

  • Dense: Alle Parameter bei jedem Token aktiv (Llama 3, Claude)
  • MoE (Mixture of Experts): Nur Teil der Parameter aktiv, Rest “schläft” (Llama 4, Mistral, GPT-5)

Die Anzahl der Parameter ist ein grober Indikator für die Kapazität – aber Trainingsqualität, Datenmenge und Architektur sind genauso wichtig. Kleinere, gut trainierte Modelle können größere übertreffen.

Technisch betrachtet

Arten von Parametern

  • Gewichte (Weights): Multiplikatoren in den Matrixoperationen
  • Biases: Verschiebungswerte, die zu den Gewichten addiert werden
  • Embedding-Matrizen: Vektoren für Token-Repräsentationen
  • Attention-Parameter: Q, K, V Projektionsmatrizen

Initialisierung

Parameter werden vor dem Training initialisiert:

  • Xavier/Glorot: Standard für Sigmoid/Tanh-Aktivierungen
  • He/Kaiming: Optimiert für ReLU-Aktivierungen
  • Zufällig: Kleine Zufallswerte um 0

Schlechte Initialisierung kann das Training komplett verhindern (Vanishing/Exploding Gradients).

Parameterzahl berechnen

Für einen Transformer-Block:

  • Self-Attention: 4 × d² (Q, K, V, Output-Projektion)
  • Feed-Forward: 2 × d × 4d = 8d²
  • Gesamt pro Block: ~12d²
  • Gesamtmodell: ~12 × d² × N_layers + Vocab × d

Schritt für Schritt

Wie Modellparameter entstehen und genutzt werden

Parameter sind trainierte Werte, keine Inhaltsdatenbank. Ihre Anzahl beschreibt Kapazität und Betriebskosten nur sehr grob.

  1. Parameter initialisieren

    Start

    Vor dem Training erhalten Gewichte und weitere lernbare Werte passende Startwerte.

    Architektur → initiale Gewichte
  2. Vorhersage berechnen

    Forward Pass

    Bei jedem Trainingsbeispiel transformieren Parameter die Eingabe zu einer Modellvorhersage.

    Eingabe × Gewichte → Ausgabe
  3. Fehler in Änderungen übersetzen

    Training

    Gradienten zeigen, wie einzelne Parameter verändert werden sollten, um den Loss zu verringern.

    Loss → Gradienten → Updates
  4. Gewichte im Betrieb verwenden

    Inferenz

    Nach dem Training bleiben Parameter während der Inferenz fest und bestimmen Speicherbedarf, Rechenaufwand und Modellverhalten.

    feste Gewichte → neue Vorhersage

Konkretes Beispiel

Beispiel: Zwei Modelle für dieselbe Aufgabe

Ein Team vergleicht ein großes und ein kompaktes Modell für eine interne Suche.

Parameterzahl als einziges Kriterium

Das Team nimmt automatisch das größte Modell an und ignoriert Latenz, Kosten, Datenlage und Qualität auf echten Suchanfragen.

Eignung im Kontext

Beide Modelle werden auf relevanten Fällen evaluiert. Das kompaktere Modell liefert ausreichende Qualität bei geringeren Kosten und kürzerer Antwortzeit.

Mehr Parameter bedeuten mehr Kapazität, aber nicht automatisch bessere Qualität für jede Aufgabe.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Speichern die während des Trainings gelernten Muster eines Modells.
  • Bestimmen zusammen mit der Architektur die Modellkapazität.
  • Machen verschiedene Formen der Anpassung wie Fine-Tuning möglich.
  • Lassen sich für effizienteren Betrieb quantisieren oder teilweise reduzieren.

Das solltest du beachten

  • Eine hohe Zahl allein ist kein belastbares Qualitätsmaß.
  • Viele Parameter erhöhen häufig Speicher- und Rechenbedarf.
  • Gelerntes Wissen ist nicht direkt als einzelne Regel auslesbar.
  • Parameter können Verzerrungen und Fehler aus den Trainingsdaten mittragen.
Vertiefung · für Fortgeschrittene

Parameter zwischen Training und Einsatz

Die Werte werden durch Training angepasst und im Betrieb für jede neue Eingabe genutzt.

Wissenskarte

Gelernte Gewichte

Beim Vergleich von Modellen sind Parameterzahl, aktive Parameter, Präzision und reale Messwerte gemeinsam zu betrachten. Parameter gliedert sich in: Architektur, Initialisierung, Trainingsdaten, Gradienten, Optimizer, Inferenz.

01Einsatzbereiche

Wann ist Parameter sinnvoll?

Geeignet für

  • ModellvergleichDie Parameterzahl dient als grober Indikator für die Leistungsfähigkeit eines Modells
  • Hardware-PlanungDie Parameterzahl bestimmt den Speicherbedarf für Training und Inferenz
  • ModellkompressionQuantisierung und Pruning reduzieren die effektive Parameterzahl

↑ Inhalt

02Werkzeuge

Womit Parameter umgesetzt wird

↑ Inhalt

Merksatz

Parameter sind wie die Synapsenverbindungen im Gehirn

Jede Verbindung hat eine bestimmte Stärke, und die Gesamtheit aller Verbindungsstärken bestimmt, was das Gehirn (oder Modell) kann.

  1. Werden automatisch während des Trainings durch den Algorithmus gelernt
  2. Die Anzahl der Parameter bestimmt die Kapazität und Größe eines Modells
  3. Moderne LLMs haben Milliarden bis Billionen Parameter

04Anwenden

Parameter praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Parameter

Was ist der Unterschied zwischen Parametern und Hyperparametern?

Parameter werden automatisch beim Training gelernt (z.B. Gewichte im Netz). Hyperparameter werden manuell vor dem Training festgelegt (z.B. Learning Rate, Anzahl Schichten). Parameter sind das Ergebnis, Hyperparameter die Einstellungen.

Sind mehr Parameter immer besser?

Nicht unbedingt. Mehr Parameter erhöhen die Kapazität, aber auch den Speicher- und Rechenbedarf. Kleinere, gut trainierte Modelle können größere übertreffen (z.B. Phi-3 von Microsoft). Die Datenqualität ist oft wichtiger.

Wie viel Speicher braucht ein Modell?

Faustregel: 1B Parameter ≈ 2 GB in FP16 (Half Precision) oder ≈ 4 GB in FP32. Ein 70B-Modell braucht also ca. 140 GB in FP16. Quantisierung (4-Bit) reduziert das auf ca. 35 GB.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Modell

    Mathematische Repräsentation zur Vorhersage neuer Eingaben.

  • Technisch vertiefen

    Deep Learning

    Ein Machine Learning-Bereich, der tiefe neuronale Netze nutzt.

  • In der Praxis anwenden

    Grundlagen Machine Learning

    Wie Maschinen aus Daten lernen – der komplette Einstieg ohne Vorkenntnisse.

↑ Inhalt