Quantisierung

Modellwerte mit weniger Präzision effizienter speichern und berechnen

Eine Optimierungstechnik, die die Präzision der Gewichte eines KI-Modells reduziert (z.B. von 32-Bit auf 4-Bit), um Speicherbedarf und Rechenaufwand drastisch zu senken.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Reduziert die Bit-Präzision von Modellgewichten (FP32 → INT8/INT4)
  2. Senkt Speicherbedarf um 2-8x und beschleunigt Inferenz
  3. Ermöglicht das Ausführen großer Modelle auf Consumer-Hardware

Sofortantwort

Quantisierung einfach erklärt

Gewichte eines KI-Modells werden zur Effizienz reduziert.

Kurz gesagt
Reduziert die Bit-Präzision von Modellgewichten (FP32 → INT8/INT4)
Typischer Einsatz
Lokale LLMs, Mobile KI, Kostenreduktion
Wichtig zu wissen
Ermöglicht das Ausführen großer Modelle auf Consumer-Hardware

Quantisierung im Überblick

Quantisierung ist eine Modell-Komprimierungstechnik, die die numerische Präzision der Modellgewichte reduziert – von 32-Bit-Fließkommazahlen (FP32) auf 16-Bit (FP16), 8-Bit (INT8) oder sogar 4-Bit (INT4). Das klingt nach einem Qualitätsverlust, ist aber in der Praxis erstaunlich verlustfrei: Modelle behalten 95-99% ihrer Qualität, werden aber 2-8× kleiner und schneller. Quantisierung ist der Hauptgrund, warum 70-Milliarden-Parameter-Modelle heute auf einem einzigen Consumer-GPU laufen können.

Quantisierung macht KI-Modelle kleiner und schneller, indem die Genauigkeit der gespeicherten Zahlen reduziert wird. Jedes Gewicht in einem neuronalen Netz ist eine Zahl – standardmäßig mit 32-Bit-Gleitkomma-Präzision (FP32). Quantisierung reduziert diese Präzision auf 16, 8 oder sogar 4 Bit.

Das klingt nach einem Kompromiss – und das ist es auch. Aber der Qualitätsverlust ist bei modernen Methoden überraschend gering, während die Einsparungen enorm sind: Ein 70-Milliarden-Parameter-Modell benötigt in FP16 rund 140 GB VRAM. Mit 4-Bit-Quantisierung schrumpft das auf 35 GB – und passt damit auf eine einzelne High-End-GPU. Das hat lokale LLMs erst möglich gemacht.

Bit-Präzision im Vergleich:

PräzisionBytes pro Gewicht70B-ModellQualität
FP324 Bytes280 GBReferenz
FP162 Bytes140 GB~Identisch
INT81 Byte70 GBMinimal schlechter
INT40.5 Bytes35 GBLeicht schlechter
INT20.25 Bytes17.5 GBSpürbar schlechter

Technisch betrachtet

Quantisierungsmethoden

Post-Training Quantization (PTQ): Quantisierung nach dem Training, ohne Retraining.

  • GPTQ: Gewichte werden schichtweise optimal quantisiert
  • AWQ: Activation-Aware Quantization, schützt wichtige Gewichte
  • GGUF: Format für CPU/GPU-Inferenz mit llama.cpp

Quantization-Aware Training (QAT): Quantisierung wird ins Training integriert.

  • Bessere Qualität als PTQ
  • Erfordert Retraining (teuer)
  • Standard bei Modellen für Edge-Deployment

GGUF-Varianten

  • Q2_K: 2-Bit, sehr klein, spürbare Qualitätseinbuße
  • Q4_K_M: 4-Bit, guter Kompromiss aus Größe und Qualität
  • Q5_K_M: 5-Bit, kaum Qualitätsverlust
  • Q8_0: 8-Bit, fast identisch mit Original

Lokale LLMs mit Ollama

# Quantisiertes Modell herunterladen und starten
ollama pull llama3:8b-instruct-q4_K_M
ollama run llama3:8b-instruct-q4_K_M

# Oder via API
curl http://localhost:11434/api/generate -d '{
  "model": "llama3:8b-instruct-q4_K_M",
  "prompt": "Erkläre Quantisierung"
}'

Hardware-Anforderungen

ModellQuantisierungVRAMBeispiel-GPU
7BQ4_K_M~4 GBRTX 3060
13BQ4_K_M~8 GBRTX 3070
70BQ4_K_M~35 GBRTX 4090 / A100
70BQ8_0~70 GB2x RTX 4090

Schritt für Schritt

Ein Modell für effizientere Inferenz quantisieren

Quantisierung tauscht einen Teil numerischer Genauigkeit gegen weniger Speicherbedarf und oft mehr Geschwindigkeit. Der Trade-off muss auf der Zielhardware gemessen werden.

  1. Zielumgebung bestimmen

    Planung

    Hardware, Speichergrenze, gewünschte Latenz und Qualitätsanforderung legen fest, welche Präzision überhaupt sinnvoll ist.

    Hardware + Qualität → Zielpräzision
  2. Werte abbilden

    Konvertierung

    Gewichte oder weitere Modellwerte werden in einer niedrigeren Bitbreite mit geeigneten Skalen repräsentiert.

    FP16 → INT8 oder INT4
  3. Qualität vergleichen

    Evaluation

    Das quantisierte Modell wird auf denselben realistischen Fällen gegen die Referenz geprüft.

    Referenz ↔ quantisierte Variante
  4. Im Betrieb überwachen

    Betrieb

    Speicher, Durchsatz, Latenz und Fehlerbilder entscheiden, ob die gewählte Variante im Produkt bleibt.

    Qualität + Kosten + Geschwindigkeit

Konkretes Beispiel

Beispiel: Ein lokaler Assistent

Ein Team möchte ein Modell auf einer begrenzten GPU ausführen.

Höchste Präzision

Das Modell passt nicht in den verfügbaren Speicher oder lässt zu wenig Kapazität für Kontext und parallele Anfragen.

Getestete Quantisierung

Eine kleinere Präzisionsvariante passt in die Hardware. Das Team überprüft Antworten auf kritischen Aufgaben und misst den tatsächlichen Geschwindigkeitsgewinn.

Quantisierung ist kein pauschaler Qualitätsverlust, sondern eine technische Entscheidung, die je Modell, Hardware und Aufgabe evaluiert werden muss.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Senkt Speicherbedarf für Gewichte und oft auch Betriebskosten.
  • Ermöglicht größere Modelle auf begrenzter Hardware.
  • Kann Inferenz auf geeigneter Hardware beschleunigen.
  • Unterstützt lokale und Edge-nahe KI-Anwendungen.

Das solltest du beachten

  • Niedrigere Präzision kann Qualität und Stabilität beeinträchtigen.
  • Der tatsächliche Geschwindigkeitsgewinn hängt von Hardware und Engine ab.
  • Nicht jede Schicht oder jeder Modelltyp reagiert gleich auf Quantisierung.
  • Zusätzliche Varianten erhöhen Test- und Betriebsaufwand.
Vertiefung · für Fortgeschrittene

Der Trade-off der Quantisierung

Die Wahl der Präzision verbindet Modellgröße, verfügbare Hardware und akzeptierte Qualitätsgrenzen.

Wissenskarte

Präzision reduzieren

Die niedrigste Bitbreite ist nicht automatisch optimal – entscheidend ist die gemessene Eignung für die reale Aufgabe. Quantisierung gliedert sich in: Referenzmodell, Kalibrierung, Bitbreite, Speicher, Hardware, Evaluation.

01Einsatzbereiche

Wann ist Quantisierung sinnvoll?

Geeignet für

  • Lokale LLMs70B-Parameter-Modelle auf Consumer-GPUs durch 4-Bit-Quantisierung
  • Mobile KIModelle auf Smartphones und Edge-Geräten ausführen
  • KostenreduktionWeniger GPU-Speicher = günstigere Inferenz in der Cloud
  • Schnellere InferenzNiedrigere Präzision = schnellere Berechnung auf GPUs

↑ Inhalt

02Werkzeuge

Womit Quantisierung umgesetzt wird

↑ Inhalt

Merksatz

Quantisierung ist wie das Runden von Zahlen

Statt 3,14159265 speicherst du 3,14 – du verlierst etwas Genauigkeit, brauchst aber viel weniger Platz und rechnest schneller.

  1. Reduziert die Bit-Präzision von Modellgewichten (FP32 → INT8/INT4)
  2. Senkt Speicherbedarf um 2-8x und beschleunigt Inferenz
  3. Ermöglicht das Ausführen großer Modelle auf Consumer-Hardware

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Quantisierung

Wie viel Qualität verliert man durch Quantisierung?

Bei 8-Bit: fast keine Qualitätseinbuße. Bei 4-Bit: minimaler Verlust (1-3% auf Benchmarks). Bei 2-Bit: spürbarer Qualitätsverlust. Die Qualität hängt auch von der Quantisierungsmethode ab (GPTQ, AWQ, GGUF).

Wie viel Speicher spart Quantisierung?

FP32 → FP16: 2x weniger. FP16 → INT8: 2x weniger. INT8 → INT4: 2x weniger. Ein 70B-Modell: FP16 = 140GB, INT4 = 35GB. Damit passt es auf eine einzelne GPU mit 48GB VRAM.

Welche Quantisierung sollte ich verwenden?

Für lokale Nutzung: GGUF Q4_K_M (guter Kompromiss). Für GPU-Inferenz: AWQ oder GPTQ INT4. Für Produktion: INT8 oder FP8 für minimalen Qualitätsverlust.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Inferenz

    Einsatz eines KI-Modells zur Vorhersage neuer Daten.

  • Technisch vertiefen

    Modell

    Mathematische Repräsentation zur Vorhersage neuer Eingaben.

↑ Inhalt