Sofortantwort
Quantisierung einfach erklärt
Gewichte eines KI-Modells werden zur Effizienz reduziert.
- Kurz gesagt
- Reduziert die Bit-Präzision von Modellgewichten (FP32 → INT8/INT4)
- Typischer Einsatz
- Lokale LLMs, Mobile KI, Kostenreduktion
- Wichtig zu wissen
- Ermöglicht das Ausführen großer Modelle auf Consumer-Hardware
Quantisierung im Überblick
Quantisierung ist eine Modell-Komprimierungstechnik, die die numerische Präzision der Modellgewichte reduziert – von 32-Bit-Fließkommazahlen (FP32) auf 16-Bit (FP16), 8-Bit (INT8) oder sogar 4-Bit (INT4). Das klingt nach einem Qualitätsverlust, ist aber in der Praxis erstaunlich verlustfrei: Modelle behalten 95-99% ihrer Qualität, werden aber 2-8× kleiner und schneller. Quantisierung ist der Hauptgrund, warum 70-Milliarden-Parameter-Modelle heute auf einem einzigen Consumer-GPU laufen können.
Quantisierung macht KI-Modelle kleiner und schneller, indem die Genauigkeit der gespeicherten Zahlen reduziert wird. Jedes Gewicht in einem neuronalen Netz ist eine Zahl – standardmäßig mit 32-Bit-Gleitkomma-Präzision (FP32). Quantisierung reduziert diese Präzision auf 16, 8 oder sogar 4 Bit.
Das klingt nach einem Kompromiss – und das ist es auch. Aber der Qualitätsverlust ist bei modernen Methoden überraschend gering, während die Einsparungen enorm sind: Ein 70-Milliarden-Parameter-Modell benötigt in FP16 rund 140 GB VRAM. Mit 4-Bit-Quantisierung schrumpft das auf 35 GB – und passt damit auf eine einzelne High-End-GPU. Das hat lokale LLMs erst möglich gemacht.
Bit-Präzision im Vergleich:
| Präzision | Bytes pro Gewicht | 70B-Modell | Qualität |
|---|---|---|---|
| FP32 | 4 Bytes | 280 GB | Referenz |
| FP16 | 2 Bytes | 140 GB | ~Identisch |
| INT8 | 1 Byte | 70 GB | Minimal schlechter |
| INT4 | 0.5 Bytes | 35 GB | Leicht schlechter |
| INT2 | 0.25 Bytes | 17.5 GB | Spürbar schlechter |
Technisch betrachtet
Quantisierungsmethoden
Post-Training Quantization (PTQ): Quantisierung nach dem Training, ohne Retraining.
- GPTQ: Gewichte werden schichtweise optimal quantisiert
- AWQ: Activation-Aware Quantization, schützt wichtige Gewichte
- GGUF: Format für CPU/GPU-Inferenz mit llama.cpp
Quantization-Aware Training (QAT): Quantisierung wird ins Training integriert.
- Bessere Qualität als PTQ
- Erfordert Retraining (teuer)
- Standard bei Modellen für Edge-Deployment
GGUF-Varianten
- Q2_K: 2-Bit, sehr klein, spürbare Qualitätseinbuße
- Q4_K_M: 4-Bit, guter Kompromiss aus Größe und Qualität
- Q5_K_M: 5-Bit, kaum Qualitätsverlust
- Q8_0: 8-Bit, fast identisch mit Original
Lokale LLMs mit Ollama
# Quantisiertes Modell herunterladen und starten
ollama pull llama3:8b-instruct-q4_K_M
ollama run llama3:8b-instruct-q4_K_M
# Oder via API
curl http://localhost:11434/api/generate -d '{
"model": "llama3:8b-instruct-q4_K_M",
"prompt": "Erkläre Quantisierung"
}'
Hardware-Anforderungen
| Modell | Quantisierung | VRAM | Beispiel-GPU |
|---|---|---|---|
| 7B | Q4_K_M | ~4 GB | RTX 3060 |
| 13B | Q4_K_M | ~8 GB | RTX 3070 |
| 70B | Q4_K_M | ~35 GB | RTX 4090 / A100 |
| 70B | Q8_0 | ~70 GB | 2x RTX 4090 |
Schritt für Schritt
Ein Modell für effizientere Inferenz quantisieren
Quantisierung tauscht einen Teil numerischer Genauigkeit gegen weniger Speicherbedarf und oft mehr Geschwindigkeit. Der Trade-off muss auf der Zielhardware gemessen werden.
Zielumgebung bestimmen
Planung
Hardware, Speichergrenze, gewünschte Latenz und Qualitätsanforderung legen fest, welche Präzision überhaupt sinnvoll ist.
Hardware + Qualität → ZielpräzisionWerte abbilden
Konvertierung
Gewichte oder weitere Modellwerte werden in einer niedrigeren Bitbreite mit geeigneten Skalen repräsentiert.
FP16 → INT8 oder INT4Qualität vergleichen
Evaluation
Das quantisierte Modell wird auf denselben realistischen Fällen gegen die Referenz geprüft.
Referenz ↔ quantisierte VarianteIm Betrieb überwachen
Betrieb
Speicher, Durchsatz, Latenz und Fehlerbilder entscheiden, ob die gewählte Variante im Produkt bleibt.
Qualität + Kosten + Geschwindigkeit
Konkretes Beispiel
Beispiel: Ein lokaler Assistent
Ein Team möchte ein Modell auf einer begrenzten GPU ausführen.
Höchste Präzision
Das Modell passt nicht in den verfügbaren Speicher oder lässt zu wenig Kapazität für Kontext und parallele Anfragen.
Getestete Quantisierung
Eine kleinere Präzisionsvariante passt in die Hardware. Das Team überprüft Antworten auf kritischen Aufgaben und misst den tatsächlichen Geschwindigkeitsgewinn.
Quantisierung ist kein pauschaler Qualitätsverlust, sondern eine technische Entscheidung, die je Modell, Hardware und Aufgabe evaluiert werden muss.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Senkt Speicherbedarf für Gewichte und oft auch Betriebskosten.
- Ermöglicht größere Modelle auf begrenzter Hardware.
- Kann Inferenz auf geeigneter Hardware beschleunigen.
- Unterstützt lokale und Edge-nahe KI-Anwendungen.
Das solltest du beachten
- Niedrigere Präzision kann Qualität und Stabilität beeinträchtigen.
- Der tatsächliche Geschwindigkeitsgewinn hängt von Hardware und Engine ab.
- Nicht jede Schicht oder jeder Modelltyp reagiert gleich auf Quantisierung.
- Zusätzliche Varianten erhöhen Test- und Betriebsaufwand.
Vertiefung · für FortgeschritteneDer Trade-off der Quantisierung
Die Wahl der Präzision verbindet Modellgröße, verfügbare Hardware und akzeptierte Qualitätsgrenzen.
Präzision reduzieren