Temperatur

Wie ein Sampling-Parameter die Vielfalt und Wiederholbarkeit von Modellantworten beeinflusst

Ein Parameter bei der Textgenerierung, der steuert, wie kreativ oder deterministisch die Ausgabe eines Sprachmodells ist.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Niedrige Temperatur (0-0.3): Deterministische, fokussierte Ausgaben
  2. Hohe Temperatur (0.7-1.5): Kreativere, vielfältigere Ausgaben
  3. Beeinflusst die Wahrscheinlichkeitsverteilung bei der Token-Auswahl

Sofortantwort

Temperatur einfach erklärt

Ein Parameter, der die Kreativität der Textausgabe eines Modells beeinflusst.

Kurz gesagt
Niedrige Temperatur (0-0.3): Deterministische, fokussierte Ausgaben
Typischer Einsatz
Faktische Antworten, Kreatives Schreiben, Code-Generierung
Wichtig zu wissen
Beeinflusst die Wahrscheinlichkeitsverteilung bei der Token-Auswahl

Temperatur im Überblick

Die Temperatur ist ein numerischer Parameter zwischen 0 und 2, der steuert, wie “mutig” ein Sprachmodell bei der Wahl des nächsten Wortes ist. Niedrige Werte machen das Modell präzise und vorhersehbar, hohe Werte machen es kreativer und überraschender – aber auch fehleranfälliger. Für faktische Aufgaben wie Code-Generierung empfiehlt sich 0.0–0.3, für kreatives Schreiben 0.7–1.0. Werte über 1.0 produzieren oft inkohärente Ausgaben und sind selten sinnvoll. Die Temperatur ist einer der wichtigsten Parameter beim Einsatz von LLMs – und einer der ersten, den man anpassen sollte, wenn die Ausgaben zu repetitiv oder zu chaotisch sind.

Die Temperatur steuert, wie “mutig” ein Sprachmodell bei der Wahl des nächsten Wortes ist.

Beispiel: Auf die Frage “Die Hauptstadt von Frankreich ist…”

  • Temperatur 0: “Paris” (immer die wahrscheinlichste Antwort)
  • Temperatur 0.5: “Paris” (meistens, gelegentlich Variationen in der Formulierung)
  • Temperatur 1.5: “Paris, die Stadt der Lichter und…” (kreativere, längere Antwort)
TemperaturVerhaltenIdeal für
0DeterministischFakten, Code, Datenextraktion
0.3Leicht variabelZusammenfassungen, Übersetzungen
0.7AusgewogenAllgemeine Aufgaben, Chat
1.0KreativKreatives Schreiben, Brainstorming
1.5+Sehr kreativ/chaotischExperimentell, oft weniger kohärent

Technisch betrachtet

Mathematische Wirkung

Die Temperatur T skaliert die Logits vor der Softmax-Funktion:

P(token_i) = exp(logit_i / T) / Σ exp(logit_j / T)
  • T < 1: Verteilung wird “schärfer” → wahrscheinliche Tokens werden noch wahrscheinlicher
  • T = 1: Originalverteilung des Modells
  • T > 1: Verteilung wird “flacher” → unwahrscheinliche Tokens bekommen mehr Chance

Zusammenspiel mit anderen Parametern

  • Top-p: Begrenzt die Auswahl auf die wahrscheinlichsten Tokens (kumulativ)
  • Top-k: Begrenzt auf die k wahrscheinlichsten Tokens
  • Frequency Penalty: Bestraft Wiederholungen
  • Presence Penalty: Fördert neue Themen

Visualisierung der Verteilung

Token-Wahrscheinlichkeiten für "Die Katze sitzt auf der ___"

         T=0.3 (scharf)    T=1.0 (normal)    T=2.0 (flach)
Matte    ████████████ 85%  ████████ 45%      ████ 25%
Couch    ██ 10%            ████ 25%          ███ 20%
Bank     █ 3%              ██ 15%            ███ 18%
Wolke    ░ 1%              █ 8%              ██ 15%
Mond     ░ 1%              █ 7%              ██ 12%

Code-Beispiel (OpenAI API)

from openai import OpenAI

client = OpenAI()

# Gleiche Frage, verschiedene Temperaturen
for temp in [0, 0.5, 1.0, 1.5]:
    response = client.chat.completions.create(
        model="gpt-5",
        messages=[{"role": "user", "content": "Nenne eine Farbe"}],
        temperature=temp,
        max_tokens=10
    )
    print(f"T={temp}: {response.choices[0].message.content}")

# Typische Ausgabe:
# T=0: Blau
# T=0.5: Blau
# T=1.0: Grün
# T=1.5: Koralle

Häufige Fehler

  • Temperatur zu hoch für Code: Führt zu Syntaxfehlern und erfundenen Funktionen
  • Temperatur 0 für Kreativität: Immer gleiche, langweilige Ausgaben
  • Temperatur ignorieren: Standardwert (oft 1.0) ist nicht für jeden Use Case optimal

Schritt für Schritt

Wie Temperatur für eine Aufgabe gewählt wird

Temperatur steuert die Auswahlwahrscheinlichkeit möglicher Tokens. Sie verbessert keine Faktenlage, sondern verändert die Varianz der Ausgabe.

  1. Aufgabe und Fehlertoleranz klären

    Einordnen

    Eine Datenextraktion benötigt meist Wiederholbarkeit; Ideensuche kann von unterschiedlichen Vorschlägen profitieren.

    Zweck → gewünschte Varianz
  2. Mit einer Baseline starten

    Testen

    Das Team testet eine moderate oder niedrige Einstellung mit repräsentativen Prompts, statt nur einzelne Beispiele zu beurteilen.

    Promptset → Baseline-Ausgaben
  3. Qualität und Streuung vergleichen

    Abwägen

    Fachliche Korrektheit, Format, Wiederholbarkeit und Vielfalt werden gemeinsam bewertet. Bei Bedarf wird gezielt eine Einstellung verändert.

    Temperatur → Qualität + Varianz

Konkretes Beispiel

Beispiel: Informationen aus Rechnungen extrahieren

Ein Team möchte Betrag, Datum und Rechnungsnummer in ein festes Schema überführen.

Kreative Einstellung

Eine hohe Temperatur erzeugt unterschiedliche Formulierungen und gelegentlich abweichende Struktur. Das erschwert die automatisierte Weiterverarbeitung.

Reproduzierbarer Ablauf

Eine niedrige Temperatur, ein klares Schema und Validierungsregeln sorgen für stabile Ausgaben. Unsichere Felder werden markiert statt geraten.

Für verlässliche Automatisierung sind klare Vorgaben, Validierung und Prüfung wichtiger als ein einzelner Sampling-Wert.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Erlaubt, Ausgabevielfalt an Kreativ- oder Wiederholbarkeitsbedarf anzupassen.
  • Ist ein einfacher, gezielt testbarer Parameter im Generierungsablauf.
  • Hilft, Varianten für Ideation und kreative Entwürfe bewusst zu erzeugen.

Das solltest du beachten

  • Niedrige Temperatur verhindert keine falschen Fakten oder Halluzinationen.
  • Hohe Werte können Format, Konsistenz und Prüfbarkeit verschlechtern.
  • Die passende Einstellung hängt von Modell, Prompt und Aufgabe ab und muss getestet werden.
Vertiefung · für Fortgeschrittene

Temperatur im Ablauf der Textgenerierung

Nach der Modellvorhersage beeinflussen Sampling-Parameter, welches der möglichen nächsten Tokens gewählt wird.

Wissenskarte

Auswahlwahrscheinlichkeiten steuern

Logits
Unnormalisierte Ausgabewerte eines neuronalen Netzes vor der Umwandlung.
Top-p
Sampling-Methode, die die wahrscheinlichsten Tokens auswählt.
Tokens
Texteinheiten, die ein Sprachmodell verarbeiten kann.
Prompt Engineering
Die Technik, Anweisungen für KI-Modelle optimal zu gestalten.
Large Language Model
Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.
Sampling bestimmt die Auswahl unter möglichen Antworten; die inhaltliche Verlässlichkeit entsteht aus Kontext, Quellen und Prüfung. Temperatur gliedert sich in: Logits, Top-p, Tokens, Prompt Engineering, Large Language Model.

01Einsatzbereiche

Wann ist Temperatur sinnvoll?

Geeignet für

  • Faktische AntwortenNiedrige Temperatur (0-0.2) für präzise, konsistente Antworten bei Fakten-Fragen
  • Kreatives SchreibenHöhere Temperatur (0.7-1.0) für abwechslungsreiche Texte und Ideen
  • Code-GenerierungNiedrige Temperatur (0-0.3) für korrekten, vorhersehbaren Code
  • BrainstormingHohe Temperatur (0.8-1.2) für vielfältige Ideen und unerwartete Vorschläge

↑ Inhalt

02Werkzeuge

Womit Temperatur umgesetzt wird

↑ Inhalt

Merksatz

Die Temperatur ist wie der Kreativitätsregler eines Autors

Bei niedriger Temperatur schreibt er vorhersehbar und präzise (Sachbuch), bei hoher Temperatur experimentell und überraschend (Lyrik).

  1. Niedrige Temperatur (0-0.3): Deterministische, fokussierte Ausgaben
  2. Hohe Temperatur (0.7-1.5): Kreativere, vielfältigere Ausgaben
  3. Beeinflusst die Wahrscheinlichkeitsverteilung bei der Token-Auswahl

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Temperatur spielt.

↑ Inhalt

04Anwenden

Temperatur praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Temperatur

Was ist die beste Temperatur?

Es gibt keinen universell besten Wert. Für Fakten und Code: 0-0.3. Für allgemeine Aufgaben: 0.5-0.7. Für kreative Aufgaben: 0.7-1.0. Experimentiere mit deinem Use Case.

Was passiert bei Temperatur 0?

Das Modell wählt immer das wahrscheinlichste Token. Die Ausgabe ist (fast) deterministisch – gleiche Eingabe ergibt gleiche Ausgabe. Ideal für reproduzierbare Ergebnisse.

Kann man Temperatur und Top-p kombinieren?

Ja, aber OpenAI empfiehlt, nur einen der beiden Parameter zu ändern und den anderen auf dem Standardwert zu lassen, um unvorhersehbare Interaktionen zu vermeiden.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Logits

    Unnormalisierte Ausgabewerte eines neuronalen Netzes vor der Umwandlung.

  • Technisch vertiefen

    Large Language Model

    Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.

  • In der Praxis anwenden

    Was sind Large Language Models?

    Von GPT bis Llama – wie LLMs funktionieren, was sie können und wo ihre Grenzen liegen.

↑ Inhalt