Sofortantwort
Temperatur einfach erklärt
Ein Parameter, der die Kreativität der Textausgabe eines Modells beeinflusst.
- Kurz gesagt
- Niedrige Temperatur (0-0.3): Deterministische, fokussierte Ausgaben
- Typischer Einsatz
- Faktische Antworten, Kreatives Schreiben, Code-Generierung
- Wichtig zu wissen
- Beeinflusst die Wahrscheinlichkeitsverteilung bei der Token-Auswahl
Temperatur im Überblick
Die Temperatur ist ein numerischer Parameter zwischen 0 und 2, der steuert, wie “mutig” ein Sprachmodell bei der Wahl des nächsten Wortes ist. Niedrige Werte machen das Modell präzise und vorhersehbar, hohe Werte machen es kreativer und überraschender – aber auch fehleranfälliger. Für faktische Aufgaben wie Code-Generierung empfiehlt sich 0.0–0.3, für kreatives Schreiben 0.7–1.0. Werte über 1.0 produzieren oft inkohärente Ausgaben und sind selten sinnvoll. Die Temperatur ist einer der wichtigsten Parameter beim Einsatz von LLMs – und einer der ersten, den man anpassen sollte, wenn die Ausgaben zu repetitiv oder zu chaotisch sind.
Die Temperatur steuert, wie “mutig” ein Sprachmodell bei der Wahl des nächsten Wortes ist.
Beispiel: Auf die Frage “Die Hauptstadt von Frankreich ist…”
- Temperatur 0: “Paris” (immer die wahrscheinlichste Antwort)
- Temperatur 0.5: “Paris” (meistens, gelegentlich Variationen in der Formulierung)
- Temperatur 1.5: “Paris, die Stadt der Lichter und…” (kreativere, längere Antwort)
| Temperatur | Verhalten | Ideal für |
|---|---|---|
| 0 | Deterministisch | Fakten, Code, Datenextraktion |
| 0.3 | Leicht variabel | Zusammenfassungen, Übersetzungen |
| 0.7 | Ausgewogen | Allgemeine Aufgaben, Chat |
| 1.0 | Kreativ | Kreatives Schreiben, Brainstorming |
| 1.5+ | Sehr kreativ/chaotisch | Experimentell, oft weniger kohärent |
Technisch betrachtet
Mathematische Wirkung
Die Temperatur T skaliert die Logits vor der Softmax-Funktion:
P(token_i) = exp(logit_i / T) / Σ exp(logit_j / T)
- T < 1: Verteilung wird “schärfer” → wahrscheinliche Tokens werden noch wahrscheinlicher
- T = 1: Originalverteilung des Modells
- T > 1: Verteilung wird “flacher” → unwahrscheinliche Tokens bekommen mehr Chance
Zusammenspiel mit anderen Parametern
- Top-p: Begrenzt die Auswahl auf die wahrscheinlichsten Tokens (kumulativ)
- Top-k: Begrenzt auf die k wahrscheinlichsten Tokens
- Frequency Penalty: Bestraft Wiederholungen
- Presence Penalty: Fördert neue Themen
Visualisierung der Verteilung
Token-Wahrscheinlichkeiten für "Die Katze sitzt auf der ___"
T=0.3 (scharf) T=1.0 (normal) T=2.0 (flach)
Matte ████████████ 85% ████████ 45% ████ 25%
Couch ██ 10% ████ 25% ███ 20%
Bank █ 3% ██ 15% ███ 18%
Wolke ░ 1% █ 8% ██ 15%
Mond ░ 1% █ 7% ██ 12%
Code-Beispiel (OpenAI API)
from openai import OpenAI
client = OpenAI()
# Gleiche Frage, verschiedene Temperaturen
for temp in [0, 0.5, 1.0, 1.5]:
response = client.chat.completions.create(
model="gpt-5",
messages=[{"role": "user", "content": "Nenne eine Farbe"}],
temperature=temp,
max_tokens=10
)
print(f"T={temp}: {response.choices[0].message.content}")
# Typische Ausgabe:
# T=0: Blau
# T=0.5: Blau
# T=1.0: Grün
# T=1.5: Koralle
Häufige Fehler
- Temperatur zu hoch für Code: Führt zu Syntaxfehlern und erfundenen Funktionen
- Temperatur 0 für Kreativität: Immer gleiche, langweilige Ausgaben
- Temperatur ignorieren: Standardwert (oft 1.0) ist nicht für jeden Use Case optimal
Schritt für Schritt
Wie Temperatur für eine Aufgabe gewählt wird
Temperatur steuert die Auswahlwahrscheinlichkeit möglicher Tokens. Sie verbessert keine Faktenlage, sondern verändert die Varianz der Ausgabe.
Aufgabe und Fehlertoleranz klären
Einordnen
Eine Datenextraktion benötigt meist Wiederholbarkeit; Ideensuche kann von unterschiedlichen Vorschlägen profitieren.
Zweck → gewünschte VarianzMit einer Baseline starten
Testen
Das Team testet eine moderate oder niedrige Einstellung mit repräsentativen Prompts, statt nur einzelne Beispiele zu beurteilen.
Promptset → Baseline-AusgabenQualität und Streuung vergleichen
Abwägen
Fachliche Korrektheit, Format, Wiederholbarkeit und Vielfalt werden gemeinsam bewertet. Bei Bedarf wird gezielt eine Einstellung verändert.
Temperatur → Qualität + Varianz
Konkretes Beispiel
Beispiel: Informationen aus Rechnungen extrahieren
Ein Team möchte Betrag, Datum und Rechnungsnummer in ein festes Schema überführen.
Kreative Einstellung
Eine hohe Temperatur erzeugt unterschiedliche Formulierungen und gelegentlich abweichende Struktur. Das erschwert die automatisierte Weiterverarbeitung.
Reproduzierbarer Ablauf
Eine niedrige Temperatur, ein klares Schema und Validierungsregeln sorgen für stabile Ausgaben. Unsichere Felder werden markiert statt geraten.
Für verlässliche Automatisierung sind klare Vorgaben, Validierung und Prüfung wichtiger als ein einzelner Sampling-Wert.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Erlaubt, Ausgabevielfalt an Kreativ- oder Wiederholbarkeitsbedarf anzupassen.
- Ist ein einfacher, gezielt testbarer Parameter im Generierungsablauf.
- Hilft, Varianten für Ideation und kreative Entwürfe bewusst zu erzeugen.
Das solltest du beachten
- Niedrige Temperatur verhindert keine falschen Fakten oder Halluzinationen.
- Hohe Werte können Format, Konsistenz und Prüfbarkeit verschlechtern.
- Die passende Einstellung hängt von Modell, Prompt und Aufgabe ab und muss getestet werden.
Vertiefung · für FortgeschritteneTemperatur im Ablauf der Textgenerierung
Nach der Modellvorhersage beeinflussen Sampling-Parameter, welches der möglichen nächsten Tokens gewählt wird.
Auswahlwahrscheinlichkeiten steuern
- Logits
- Unnormalisierte Ausgabewerte eines neuronalen Netzes vor der Umwandlung.
- Top-p
- Sampling-Methode, die die wahrscheinlichsten Tokens auswählt.
- Tokens
- Texteinheiten, die ein Sprachmodell verarbeiten kann.
- Prompt Engineering
- Die Technik, Anweisungen für KI-Modelle optimal zu gestalten.
- Large Language Model
- Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.