Fine-Tuning

Ein Basismodell gezielt auf Verhalten und Format ausrichten

Das gezielte Nachtrainieren eines vortrainierten KI-Modells auf spezifische Daten oder Aufgaben, um es für einen bestimmten Einsatzzweck zu optimieren.

Fortgeschritten3 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Passt ein vortrainiertes Modell an spezifische Aufgaben oder Domänen an
  2. Deutlich günstiger und schneller als das Training eines Modells von Grund auf
  3. Alternative zu RAG, wenn das Modell dauerhaft neues Verhalten lernen soll

Sofortantwort

Fine-Tuning einfach erklärt

Nachtrainieren eines Modells für spezifische Aufgaben.

Kurz gesagt
Passt ein vortrainiertes Modell an spezifische Aufgaben oder Domänen an
Typischer Einsatz
Domänenanpassung, Stil und Tonalität, Klassifikation
Wichtig zu wissen
Alternative zu RAG, wenn das Modell dauerhaft neues Verhalten lernen soll

Fine-Tuning im Überblick

Fine-Tuning bedeutet, ein bereits trainiertes KI-Modell mit eigenen Daten weiterzutrainieren, um es für eine bestimmte Aufgabe zu spezialisieren. Statt ein Modell von Null aufzubauen, nutzt du das vorhandene Wissen und passt es an. Fine-Tuning ist der Kompromiss zwischen Prompt Engineering (kein Training, aber begrenzte Kontrolle) und vollständigem Training (maximale Kontrolle, aber extrem teuer). Es eignet sich besonders, wenn ein Modell konsistent in einem bestimmten Stil antworten soll oder domänenspezifisches Verhalten zeigen muss, das sich durch Prompts allein nicht zuverlässig steuern lässt. Techniken wie LoRA und QLoRA machen Fine-Tuning auch auf Consumer-Hardware möglich: Ein 7B-Modell kann mit einer RTX 3090 in wenigen Stunden fine-getuned werden. Für viele Anwendungsfälle ist Fine-Tuning heute die kosteneffizienteste Methode, ein Modell zu spezialisieren.

Warum Fine-Tuning?

  • Spezialisierung: Das Modell lernt Fachbegriffe, Stil oder Verhaltensweisen deiner Domäne
  • Konsistenz: Gleichbleibende Ausgabequalität und -format
  • Effizienz: Kürzere Prompts nötig, da das Wissen im Modell steckt
  • Kosten: Geringere Inferenz-Kosten durch kürzere Prompts

Fine-Tuning vs. RAG vs. Prompt Engineering:

AspektPrompt EngineeringRAGFine-Tuning
AufwandGeringMittelHoch
KostenNiedrigMittelMittel-Hoch
AktualitätManuellAutomatischErfordert Retraining
Stil/VerhaltenBegrenztBegrenztSehr gut
FachwissenIm PromptIn DatenbankIm Modell

Wann Fine-Tuning sinnvoll ist:

  • Du brauchst einen bestimmten Ausgabestil oder Tonalität
  • Das Modell soll domänenspezifisches Verhalten zeigen
  • Du willst Inferenz-Kosten durch kürzere Prompts senken
  • Prompt Engineering allein liefert nicht die gewünschte Qualität

Technisch betrachtet

Fine-Tuning-Methoden

Full Fine-Tuning:

  • Alle Parameter des Modells werden aktualisiert
  • Beste Ergebnisse, aber höchster Ressourcenbedarf
  • Nur für große Organisationen mit entsprechender Hardware praktikabel

LoRA (Low-Rank Adaptation):

  • Fügt kleine trainierbare Matrizen zu den bestehenden Gewichten hinzu
  • Nur 0,1-1% der Parameter werden trainiert
  • Drastisch reduzierter Speicher- und Rechenbedarf
  • Standard-Methode für die meisten Fine-Tuning-Aufgaben

QLoRA (Quantized LoRA):

  • Kombiniert LoRA mit 4-Bit-Quantisierung des Basismodells
  • Ermöglicht Fine-Tuning von 70B-Modellen auf einer einzelnen GPU
  • Minimaler Qualitätsverlust gegenüber Full Fine-Tuning

Adapter-Methoden:

  • Kleine Adapter-Module werden zwischen bestehende Schichten eingefügt
  • Basismodell bleibt unverändert
  • Mehrere Adapter für verschiedene Aufgaben möglich

Der Fine-Tuning-Prozess

1. Daten vorbereiten:

  • Format: JSONL mit Instruction/Input/Output-Paaren
  • Qualitätskontrolle: Inkonsistente oder fehlerhafte Beispiele entfernen
  • Aufteilung: 80% Training, 10% Validation, 10% Test

Beispiel-Datenformat:

{"messages": [
  {"role": "system", "content": "Du bist ein technischer Redakteur."},
  {"role": "user", "content": "Erkläre Docker in einem Satz."},
  {"role": "assistant", "content": "Docker ist eine Plattform, die Anwendungen in isolierten Containern verpackt, sodass sie überall gleich laufen."}
]}

2. Hyperparameter wählen:

  • Learning Rate: 1e-5 bis 5e-5 (niedriger als Pre-Training)
  • Epochs: 1-5 (mehr kann zu Overfitting führen)
  • Batch Size: 4-32 (abhängig von GPU-Speicher)
  • LoRA Rank: 8-64 (höher = mehr Kapazität, mehr Speicher)

3. Training durchführen:

  • Validation Loss überwachen
  • Early Stopping bei steigendem Validation Loss
  • Checkpoints speichern

4. Evaluation:

  • Automatische Metriken (Perplexity, BLEU, ROUGE)
  • Menschliche Evaluation für Qualität und Stil
  • A/B-Tests gegen das Basismodell

RLHF (Reinforcement Learning from Human Feedback)

Die Methode, mit der ChatGPT und Claude trainiert wurden:

  1. Supervised Fine-Tuning (SFT): Modell lernt aus menschlich geschriebenen Beispielen
  2. Reward Model Training: Ein zweites Modell lernt menschliche Präferenzen
  3. PPO-Training: Das Modell wird mit dem Reward Model optimiert

Alternativen zu RLHF:

  • DPO (Direct Preference Optimization): Einfacher, ohne separates Reward Model
  • ORPO: Kombiniert SFT und Preference Optimization in einem Schritt
  • KTO: Benötigt nur binäres Feedback (gut/schlecht)

Catastrophic Forgetting vermeiden

  • Niedrige Learning Rate: Kleine Änderungen an den Gewichten
  • LoRA/QLoRA: Basismodell bleibt unverändert
  • Regularisierung: Weight Decay und Dropout
  • Diverse Trainingsdaten: Nicht nur Spezialwissen, auch allgemeine Beispiele
  • Evaluation auf allgemeinen Benchmarks: Sicherstellen, dass Basiswissen erhalten bleibt

Schritt für Schritt

So wird ein Modell nachtrainiert

Fine-Tuning ergänzt kein beliebiges neues Wissen. Es passt die Modellgewichte mit sorgfältigen Beispielen an ein gewünschtes Verhalten an.

  1. Ziel und Datensatz festlegen

    Daten

    Definiere konkrete Fehlerfälle, Zielverhalten und hochwertige Ein- und Ausgabe-Beispiele. Qualität und Konsistenz zählen mehr als bloße Menge.

    Beispiele: Eingabe → gewünschte Ausgabe
  2. Modell angepasst trainieren

    Training

    Ein Basismodell wird mit niedriger Lernrate weitertrainiert. Verfahren wie LoRA verändern nur einen kleinen Teil der Parameter.

    Basismodell + Datensatz → angepasste Gewichte
  3. Gegen einen Testsatz prüfen

    Evaluation

    Vergleiche das Ergebnis mit dem Ausgangsmodell und prüfe Nebenwirkungen wie Ausreißer oder vergessenes Allgemeinwissen.

    Testfälle → Qualität + Risiken
  4. Kontrolliert ausrollen

    Betrieb

    Überwache Kosten, Sicherheit und reale Ausgaben. Neue Anforderungen brauchen neue Beispiele und möglicherweise ein neues Training.

    Monitoring → Feedback → nächste Version

Konkretes Beispiel

Ein konsistentes Antwortformat trainieren

Ein Support-Modell soll Antworten immer in einer festgelegten, fachlich geprüften Struktur formulieren.

Nur per Prompt steuern

Ein langer System-Prompt kann das Format gut anleiten, aber einzelne Antworten weichen bei komplexen Fällen dennoch ab.

Mit Fine-Tuning ergänzen

Ein Trainingsdatensatz mit geprüften Beispielen macht die gewünschte Struktur zum Modellverhalten. Der Prompt kann dadurch kürzer bleiben.

Fine-Tuning lohnt sich erst, wenn ein getesteter Prompt die Anforderungen nicht zuverlässig genug erfüllt und hochwertige Beispiele verfügbar sind.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Das Modell kann Stil, Format und spezialisierte Verhaltensmuster konsistenter ausgeben.
  • Wiederkehrende lange Anweisungen lassen sich oft verkürzen, was bei hohem Volumen Kosten senken kann.
  • Parameter-effiziente Verfahren wie LoRA reduzieren den Trainingsaufwand erheblich.
  • Ein eigener Testsatz macht Qualitätsverbesserungen gegenüber dem Basismodell messbar.

Das solltest du beachten

  • Fine-Tuning braucht kuratierte Daten, Evaluation und Infrastruktur statt nur eines guten Prompts.
  • Es ist ungeeignet, um häufig wechselnde Fakten zuverlässig in ein Modell zu schreiben.
  • Schlechte oder einseitige Trainingsdaten können Verhalten verschlechtern oder Risiken verstärken.
  • Neue Anforderungen oder Fehlerfälle erfordern Pflege des Datensatzes und erneute Trainingsläufe.
Vertiefung · für Fortgeschrittene

Vom Basismodell zur Spezialisierung

Das Basismodell liefert die allgemeinen Fähigkeiten. Trainingsdaten und Evaluation bestimmen, ob die Anpassung tatsächlich besser wird.

Wissenskarte

Verhalten anpassen

Eine sichere Anpassung verbindet Beispiele, kontrolliertes Training und Messung. Das Ergebnis ist eine neue Modellversion, keine dauerhafte Wahrheit. Fine-Tuning gliedert sich in: Basismodell, Trainingsdaten, LoRA oder Training, Testsatz, Modellversion, Monitoring.

Entscheidungshilfe

Fine-Tuning im Vergleich

Fine-Tuning im Vergleich mit Prompt Engineering
Fine-TuningPrompt Engineering
Zeit bis zum ErgebnisTage bis Wochen (Daten, Training, Evaluation)Minuten bis Stunden (schreiben, testen, iterieren)
Kosten-CharakterVorab-Investition: Daten-Aufbereitung + TrainingKaum Vorab-Kosten, ggf. mehr Tokens pro Anfrage
Benötigte DatenHunderte bis tausende hochwertige BeispieleKeine – wenige Beispiele im Prompt reichen (Few-Shot)
Tiefe der AnpassungVerändert das Modellverhalten dauerhaftSteuert Verhalten pro Anfrage, Grenzen beim Modell selbst
Stil & Format erzwingenSehr konsistent, auch bei kurzen PromptsGut steuerbar, aber gelegentliche Ausreißer

Alle 8 Kriterien im Vergleich

01Einsatzbereiche

Wann ist Fine-Tuning sinnvoll?

Geeignet für

  • DomänenanpassungEin LLM auf medizinische, juristische oder technische Fachsprache spezialisieren
  • Stil und TonalitätEin Modell an den Kommunikationsstil eines Unternehmens anpassen
  • KlassifikationEin Modell für spezifische Kategorisierungsaufgaben wie Sentiment-Analyse trainieren
  • Instruction FollowingEin Basismodell darauf trainieren, Anweisungen besser zu befolgen (RLHF)

↑ Inhalt

02Werkzeuge

Womit Fine-Tuning umgesetzt wird

↑ Inhalt

Merksatz

Fine-Tuning ist wie ein Allgemeinmediziner, der eine Facharztausbildung macht

Das Grundwissen ist bereits vorhanden, und durch spezialisiertes Training wird er zum Experten in einem bestimmten Bereich.

  1. Passt ein vortrainiertes Modell an spezifische Aufgaben oder Domänen an
  2. Deutlich günstiger und schneller als das Training eines Modells von Grund auf
  3. Alternative zu RAG, wenn das Modell dauerhaft neues Verhalten lernen soll

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Fine-Tuning spielt.

↑ Inhalt

04Anwenden

Fine-Tuning praktisch anwenden

↑ Inhalt

05Direkt anwenden

Mit diesem Prompt weiterarbeiten

Eine fertige Vorlage, die Fine-Tuning in eine konkrete Aufgabe übersetzt.
KIExperte

Fine-Tuning-Datensatz erstellen

Trainingsbeispiele für das Fine-Tuning eines Sprachmodells strukturieren.

2 Variablen · 3 Min

↑ Inhalt

06Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

07FAQ

Häufige Fragen zu Fine-Tuning

Wann sollte ich Fine-Tuning statt RAG verwenden?

Fine-Tuning eignet sich, wenn das Modell einen bestimmten Stil, Tonalität oder Verhaltensweise dauerhaft lernen soll. RAG ist besser für aktuelle, sich ändernde Informationen. Oft ist eine Kombination aus beiden am effektivsten.

Wie viele Trainingsdaten braucht man für Fine-Tuning?

Das hängt von der Aufgabe ab. Für einfache Stilanpassungen reichen oft 50-100 Beispiele. Für komplexe Domänenanpassungen sind 1.000-10.000+ hochwertige Beispiele empfehlenswert. Qualität ist wichtiger als Quantität.

Was kostet Fine-Tuning?

Bei OpenAI ab ca. $8 pro 1M Training-Tokens. Eigenes Fine-Tuning mit Open-Source-Modellen erfordert GPU-Zugang (ab ca. $1/Stunde in der Cloud). LoRA/QLoRA reduziert die Hardware-Anforderungen erheblich.

Kann Fine-Tuning ein Modell verschlechtern?

Ja, das nennt sich 'Catastrophic Forgetting' – das Modell vergisst allgemeines Wissen beim Spezialisieren. Techniken wie LoRA und niedrige Learning Rates minimieren dieses Risiko.

↑ Inhalt

08Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt