LoRA / QLoRA

LoRA passt ein Basismodell über kleine Adapter an, statt alle Gewichte neu zu trainieren.

Effiziente Fine-Tuning-Methoden, die nur einen Bruchteil der Modellparameter anpassen – LoRA (Low-Rank Adaptation) macht Fine-Tuning auf Consumer-Hardware möglich.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. LoRA: Fügt kleine trainierbare Matrizen ein, Originalmodell bleibt eingefroren
  2. QLoRA: Kombiniert LoRA mit 4-Bit Quantisierung – Fine-Tuning auf einer einzelnen GPU
  3. Typisch 0.1-1% der Parameter trainiert, aber 90-95% der Qualität von Full Fine-Tuning

Sofortantwort

LoRA / QLoRA einfach erklärt

Methoden zur effizienten Anpassung von Modellparametern beim Fine-Tuning.

Kurz gesagt
LoRA: Fügt kleine trainierbare Matrizen ein, Originalmodell bleibt eingefroren
Typischer Einsatz
Domänen-Anpassung, Stil-Anpassung, Multi-Adapter
Wichtig zu wissen
Typisch 0.1-1% der Parameter trainiert, aber 90-95% der Qualität von Full Fine-Tuning

LoRA / QLoRA im Überblick

LoRA (Low-Rank Adaptation) ist die wichtigste Technik für effizientes Fine-Tuning großer Sprachmodelle. Das Problem mit klassischem Fine-Tuning: Alle Milliarden Parameter eines Modells zu trainieren erfordert enorme GPU-Ressourcen und Speicher. LoRA löst das elegant: Statt die originalen Gewichte zu verändern, werden kleine trainierbare Matrizen eingefügt, die die Gewichtsänderungen approximieren. Das Originalmodell bleibt eingefroren – nur die LoRA-Adapter werden trainiert.

Full Fine-Tuning ändert alle Milliarden Parameter eines Modells – teuer und speicherintensiv. LoRA fügt stattdessen kleine, trainierbare Matrizen ein und lässt das Originalmodell unverändert.

Der Unterschied:

Full Fine-Tuning:  Alle 7B Parameter trainieren → 28GB VRAM
LoRA:              ~7M Parameter trainieren      → 8GB VRAM
QLoRA:             LoRA + 4-Bit Quantisierung    → 6GB VRAM

Warum ist das revolutionär?

  • Kosten: Fine-Tuning auf Consumer-Hardware möglich (RTX 3090 statt A100)
  • Geschwindigkeit: Training in Stunden statt Tagen
  • Flexibilität: Mehrere LoRA-Adapter für verschiedene Aufgaben, schnell austauschbar
  • Qualität: 90-95% der Qualität von Full Fine-Tuning

Praxis-Tipp: Für die meisten Anwendungen ist QLoRA die beste Wahl – es kombiniert LoRA mit 4-Bit Quantisierung für minimalen Speicherbedarf.

Technisch betrachtet

Wie LoRA funktioniert

Statt eine große Gewichtsmatrix W direkt zu ändern, wird eine kleine Änderung ΔW als Produkt zweier kleiner Matrizen dargestellt:

Original:  W (4096 × 4096) = 16M Parameter
LoRA:      ΔW = A × B  wobei A (4096 × 16), B (16 × 4096)
           = 2 × 65K = 130K Parameter (statt 16M)

Der Rang r (hier 16) bestimmt die Kapazität des Adapters.

QLoRA

Kombiniert drei Techniken:

  1. 4-Bit NormalFloat: Quantisiert das Basismodell auf 4 Bit
  2. Double Quantization: Quantisiert auch die Quantisierungs-Konstanten
  3. Paged Optimizers: Lagert Optimizer-States in CPU-RAM aus

Adapter-Stacking

Mehrere LoRA-Adapter können kombiniert werden:

  • Adapter A: Deutsch-Spezialisierung
  • Adapter B: Medizin-Spezialisierung
  • A + B: Deutsches Medizin-Modell

Schritt für Schritt

Ein Modell effizient spezialisieren

LoRA hält die Basisgewichte fest und trainiert kleine zusätzliche Komponenten für eine klar definierte Aufgabe.

  1. Ziel und Daten festlegen

    Zielbild

    Das Team definiert, welche Fähigkeit verbessert werden soll und wie sich Erfolg an getrennten Beispielen prüfen lässt.

    aufgabe + daten + evaluation
  2. Adapter trainieren

    Training

    Das Basismodell bleibt weitgehend unverändert; nur die zusätzlichen Adapterparameter werden angepasst.

    basismodell + adapter -> spezialisierung
  3. Adapter evaluieren

    Prüfung

    Der Adapter wird gegen Ausgangsmodell und Anforderungen geprüft, bevor er versioniert bereitgestellt wird.

    adapter -> qualitaet + sicherheit + kosten

Konkretes Beispiel

Einen Fachstil ergänzen

Ein Team möchte ein vorhandenes Modell auf eine klar abgegrenzte Schreibaufgabe anpassen.

Alle Gewichte neu trainieren

Das vollständige Modell wird verändert, was viel Rechenaufwand und eine eigene Modellkopie verursacht.

Kleinen Adapter trainieren

Die Basis bleibt erhalten. Der fachliche Unterschied liegt in einem getrennt versionierbaren Adapter.

LoRA reduziert Trainingsaufwand, ersetzt aber nicht die Prüfung von Datenqualität und Modellwirkung.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Weniger Trainingsaufwand: Es werden deutlich weniger Parameter angepasst als beim vollständigen Fine-Tuning.
  • Modulare Varianten: Mehrere spezialisierte Adapter können dieselbe Modellbasis ergänzen.
  • Geringerer Speicherbedarf: Besonders mit Quantisierung lassen sich Anpassungen auf begrenzter Hardware erproben.
  • Basis bleibt stabil: Das ursprüngliche Modell wird nicht direkt überschrieben.

Das solltest du beachten

  • Datenqualität bleibt entscheidend: Ein effizienter Adapter kann schlechte oder ungeeignete Beispiele nicht ausgleichen.
  • Nicht jede Fähigkeit ist gleich gut anpassbar: Manche tiefgreifenden Änderungen verlangen andere Methoden.
  • Adapter brauchen Versionierung: Aufgabe, Datenbasis und Kompatibilität müssen gemeinsam dokumentiert werden.
  • Evaluation bleibt Pflicht: Gute Trainingswerte garantieren keine zuverlässige Wirkung im Einsatz.
Vertiefung · für Fortgeschrittene

Basis und Adapter getrennt halten

LoRA ergänzt ein eingefrorenes Basismodell um kleine trainierbare Komponenten.

Wissenskarte

parameter-effiziente Modellanpassung

Die Trennung von Basis und Adapter macht spezialisierte Varianten leichter zu trainieren, zu vergleichen und bereitzustellen. LoRA gliedert sich in: Basismodell, Adapter, Trainingsdaten, Konfiguration, Evaluation, Modellversion.

01Einsatzbereiche

Wann ist LoRA / QLoRA sinnvoll?

Geeignet für

  • Domänen-AnpassungLLM auf medizinische, juristische oder technische Texte spezialisieren
  • Stil-AnpassungModell an einen bestimmten Schreibstil oder Tonfall anpassen
  • Multi-AdapterMehrere LoRA-Adapter für verschiedene Aufgaben, schnell austauschbar
  • Consumer Fine-Tuning7B-Modelle auf einer RTX 3090 fine-tunen dank QLoRA

↑ Inhalt

02Werkzeuge

Womit LoRA / QLoRA umgesetzt wird

↑ Inhalt

Merksatz

Statt ein ganzes Haus umzubauen (Full Fine-Tuning), baust du nur einen kleinen Anbau (LoRA). Das Originalhaus bleibt unverändert, aber der Anbau gibt dir genau die Funktion die du brauchst.

  1. LoRA: Fügt kleine trainierbare Matrizen ein, Originalmodell bleibt eingefroren
  2. QLoRA: Kombiniert LoRA mit 4-Bit Quantisierung – Fine-Tuning auf einer einzelnen GPU
  3. Typisch 0.1-1% der Parameter trainiert, aber 90-95% der Qualität von Full Fine-Tuning

04Anwenden

LoRA / QLoRA praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu LoRA / QLoRA

Wie viel GPU-Speicher braucht QLoRA?

Ein 7B-Modell braucht ~6GB VRAM mit QLoRA (statt ~28GB für Full Fine-Tuning). Ein 70B-Modell passt mit QLoRA auf eine 48GB GPU.

Ist LoRA so gut wie Full Fine-Tuning?

Fast. Bei den meisten Aufgaben erreicht LoRA 90-95% der Qualität von Full Fine-Tuning bei einem Bruchteil der Kosten. Für sehr spezialisierte Aufgaben kann Full Fine-Tuning noch besser sein.

Wie funktioniert das Fine-Tuning mit LoRA?

LoRA funktioniert, indem es nur einen Teil der Modellparameter anpasst, während der Großteil des Modells unverändert bleibt. Dies ermöglicht eine effiziente Anpassung an spezifische Aufgaben, ohne die gesamte Modellarchitektur neu trainieren zu müssen.

Was sind die Vorteile von QLoRA im Vergleich zu LoRA?

QLoRA bietet zusätzliche Effizienz durch Quantisierung, was bedeutet, dass es weniger Speicher benötigt und schneller arbeitet. Dies ist besonders vorteilhaft für den Einsatz auf Geräten mit begrenzten Ressourcen, während es dennoch eine hohe Leistung beim Fine-Tuning ermöglicht.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt