Sofortantwort
LoRA / QLoRA einfach erklärt
Methoden zur effizienten Anpassung von Modellparametern beim Fine-Tuning.
- Kurz gesagt
- LoRA: Fügt kleine trainierbare Matrizen ein, Originalmodell bleibt eingefroren
- Typischer Einsatz
- Domänen-Anpassung, Stil-Anpassung, Multi-Adapter
- Wichtig zu wissen
- Typisch 0.1-1% der Parameter trainiert, aber 90-95% der Qualität von Full Fine-Tuning
LoRA / QLoRA im Überblick
LoRA (Low-Rank Adaptation) ist die wichtigste Technik für effizientes Fine-Tuning großer Sprachmodelle. Das Problem mit klassischem Fine-Tuning: Alle Milliarden Parameter eines Modells zu trainieren erfordert enorme GPU-Ressourcen und Speicher. LoRA löst das elegant: Statt die originalen Gewichte zu verändern, werden kleine trainierbare Matrizen eingefügt, die die Gewichtsänderungen approximieren. Das Originalmodell bleibt eingefroren – nur die LoRA-Adapter werden trainiert.
Full Fine-Tuning ändert alle Milliarden Parameter eines Modells – teuer und speicherintensiv. LoRA fügt stattdessen kleine, trainierbare Matrizen ein und lässt das Originalmodell unverändert.
Der Unterschied:
Full Fine-Tuning: Alle 7B Parameter trainieren → 28GB VRAM
LoRA: ~7M Parameter trainieren → 8GB VRAM
QLoRA: LoRA + 4-Bit Quantisierung → 6GB VRAM
Warum ist das revolutionär?
- Kosten: Fine-Tuning auf Consumer-Hardware möglich (RTX 3090 statt A100)
- Geschwindigkeit: Training in Stunden statt Tagen
- Flexibilität: Mehrere LoRA-Adapter für verschiedene Aufgaben, schnell austauschbar
- Qualität: 90-95% der Qualität von Full Fine-Tuning
Praxis-Tipp: Für die meisten Anwendungen ist QLoRA die beste Wahl – es kombiniert LoRA mit 4-Bit Quantisierung für minimalen Speicherbedarf.
Technisch betrachtet
Wie LoRA funktioniert
Statt eine große Gewichtsmatrix W direkt zu ändern, wird eine kleine Änderung ΔW als Produkt zweier kleiner Matrizen dargestellt:
Original: W (4096 × 4096) = 16M Parameter
LoRA: ΔW = A × B wobei A (4096 × 16), B (16 × 4096)
= 2 × 65K = 130K Parameter (statt 16M)
Der Rang r (hier 16) bestimmt die Kapazität des Adapters.
QLoRA
Kombiniert drei Techniken:
- 4-Bit NormalFloat: Quantisiert das Basismodell auf 4 Bit
- Double Quantization: Quantisiert auch die Quantisierungs-Konstanten
- Paged Optimizers: Lagert Optimizer-States in CPU-RAM aus
Adapter-Stacking
Mehrere LoRA-Adapter können kombiniert werden:
- Adapter A: Deutsch-Spezialisierung
- Adapter B: Medizin-Spezialisierung
- A + B: Deutsches Medizin-Modell
Schritt für Schritt
Ein Modell effizient spezialisieren
LoRA hält die Basisgewichte fest und trainiert kleine zusätzliche Komponenten für eine klar definierte Aufgabe.
Ziel und Daten festlegen
Zielbild
Das Team definiert, welche Fähigkeit verbessert werden soll und wie sich Erfolg an getrennten Beispielen prüfen lässt.
aufgabe + daten + evaluationAdapter trainieren
Training
Das Basismodell bleibt weitgehend unverändert; nur die zusätzlichen Adapterparameter werden angepasst.
basismodell + adapter -> spezialisierungAdapter evaluieren
Prüfung
Der Adapter wird gegen Ausgangsmodell und Anforderungen geprüft, bevor er versioniert bereitgestellt wird.
adapter -> qualitaet + sicherheit + kosten
Konkretes Beispiel
Einen Fachstil ergänzen
Ein Team möchte ein vorhandenes Modell auf eine klar abgegrenzte Schreibaufgabe anpassen.
Alle Gewichte neu trainieren
Das vollständige Modell wird verändert, was viel Rechenaufwand und eine eigene Modellkopie verursacht.
Kleinen Adapter trainieren
Die Basis bleibt erhalten. Der fachliche Unterschied liegt in einem getrennt versionierbaren Adapter.
LoRA reduziert Trainingsaufwand, ersetzt aber nicht die Prüfung von Datenqualität und Modellwirkung.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Weniger Trainingsaufwand: Es werden deutlich weniger Parameter angepasst als beim vollständigen Fine-Tuning.
- Modulare Varianten: Mehrere spezialisierte Adapter können dieselbe Modellbasis ergänzen.
- Geringerer Speicherbedarf: Besonders mit Quantisierung lassen sich Anpassungen auf begrenzter Hardware erproben.
- Basis bleibt stabil: Das ursprüngliche Modell wird nicht direkt überschrieben.
Das solltest du beachten
- Datenqualität bleibt entscheidend: Ein effizienter Adapter kann schlechte oder ungeeignete Beispiele nicht ausgleichen.
- Nicht jede Fähigkeit ist gleich gut anpassbar: Manche tiefgreifenden Änderungen verlangen andere Methoden.
- Adapter brauchen Versionierung: Aufgabe, Datenbasis und Kompatibilität müssen gemeinsam dokumentiert werden.
- Evaluation bleibt Pflicht: Gute Trainingswerte garantieren keine zuverlässige Wirkung im Einsatz.
Vertiefung · für FortgeschritteneBasis und Adapter getrennt halten
LoRA ergänzt ein eingefrorenes Basismodell um kleine trainierbare Komponenten.
parameter-effiziente Modellanpassung