Sofortantwort
Top-p einfach erklärt
Sampling-Methode, die die wahrscheinlichsten Tokens auswählt.
- Kurz gesagt
- Wählt aus den wahrscheinlichsten Tokens, deren kumulative Wahrscheinlichkeit ≤ p ist
- Typischer Einsatz
- Kontrollierte Kreativität, Deterministische Ausgabe, API-Konfiguration
- Wichtig zu wissen
- p=0.9 ist ein guter Standard – p=1.0 bedeutet keine Einschränkung
Top-p im Überblick
Top-p (auch Nucleus Sampling) ist eine Methode, die steuert, aus wie vielen Token-Kandidaten das Modell bei der Textgenerierung wählen darf.
Beispiel: Das Modell soll das nächste Wort nach “Der Hund” vorhersagen:
"bellt" → 40% Wahrscheinlichkeit
"rennt" → 25%
"schläft" → 15%
"frisst" → 10%
"tanzt" → 5%
"fliegt" → 3%
"singt" → 2%
- Top-p = 0.8: Wählt aus schläft (kumulativ 80%)
- Top-p = 0.95: Wählt aus tanzt (kumulativ 95%)
- Top-p = 1.0: Alle Tokens möglich
Technisch betrachtet
Algorithmus
- Sortiere Tokens nach Wahrscheinlichkeit (absteigend)
- Berechne kumulative Wahrscheinlichkeit
- Schneide ab, sobald die kumulative Wahrscheinlichkeit p überschreitet
- Normalisiere die verbleibenden Wahrscheinlichkeiten
- Sample aus der reduzierten Verteilung
Vorteile gegenüber Top-k
Top-p passt sich dynamisch an den Kontext an:
- Bei eindeutigen Kontexten (z.B. “Die Hauptstadt von Frankreich ist”): Wenige Tokens im Nucleus
- Bei mehrdeutigen Kontexten (z.B. “Heute möchte ich”): Viele Tokens im Nucleus
Top-k hat immer eine feste Anzahl, was in eindeutigen Kontexten zu viele und in mehrdeutigen zu wenige Optionen bieten kann.
Praktische Empfehlungen
| Use Case | Top-p | Temperatur | Begründung |
|---|---|---|---|
| Fakten/Code | 0.1-0.3 | 0 | Nur beste Tokens, deterministisch |
| Allgemein | 0.9 | 0.7 | Guter Standard |
| Kreativ | 0.95 | 1.0 | Mehr Vielfalt |
| Brainstorming | 1.0 | 1.2 | Maximale Variation |
Code-Beispiel (OpenAI API)
from openai import OpenAI
client = OpenAI()
# Faktisch/Deterministisch
response = client.chat.completions.create(
model="gpt-5",
messages=[{"role": "user", "content": "Was ist die Hauptstadt von Frankreich?"}],
temperature=0,
top_p=0.1
)
# Kreativ
response = client.chat.completions.create(
model="gpt-5",
messages=[{"role": "user", "content": "Schreibe ein Haiku über KI"}],
temperature=1.0,
top_p=0.95
)
Wichtige Hinweise
- Nicht beide stark ändern: OpenAI empfiehlt, entweder Temperatur ODER Top-p anzupassen, nicht beide gleichzeitig extrem
- Top-p=1.0: Keine Einschränkung, alle Tokens möglich (Temperatur bestimmt dann allein)
- Top-p=0: Würde nur das wahrscheinlichste Token erlauben (praktisch nie verwendet)
Schritt für Schritt
Wie Top-p Sampling sinnvoll eingestellt wird
Varianzbedarf der Aufgabe bestimmen
Kläre, ob mehrere Formulierungen oder Ideen willkommen sind oder ob eine streng wiederholbare Ausgabe gebraucht wird. Sampling ist eine bewusste Qualitätsentscheidung und sollte nicht unbemerkt für jede Aufgabe gleich eingestellt bleiben.
Wahrscheinlichkeitsmenge begrenzen
Top-p wählt eine dynamische Menge von Token, deren gemeinsame Wahrscheinlichkeit einen festgelegten Anteil erreicht. Dieser Wert bestimmt, wie weit das Modell von den wahrscheinlichsten Optionen abweichen darf.
Parameter gemeinsam testen
Prüfe Top-p zusammen mit Temperatur, Eingabe und Formatvorgaben auf repräsentativen Fällen. Ein einzelner Parameter erklärt die Qualität selten allein; Kombinationen können unerwartete Vielfalt oder Wiederholung erzeugen.
Risiko und Qualität je Einsatz prüfen
Für kreative Entwürfe kann mehr Variation hilfreich sein, für strukturierte oder folgenreiche Aufgaben oft nicht. Bewerte Ausgaben auf Faktenbezug, Sicherheit und Nutzbarkeit statt auf Neuheit allein.
Konkretes Beispiel
Ideen werden vielfältig, aber nicht beliebig
Ein Content-Team möchte mehrere Ansätze für einen erklärenden Einstieg entwickeln. Die Vorschläge sollen verschieden sein, aber weiterhin zum Thema und zur Zielgruppe passen.
Unkontrollierte Vielfalt
Ein sehr offenes Sampling liefert kreative, aber teils unpassende Ideen. Das Team kann nicht nachvollziehen, welche Einstellungen zur nützlichen Vielfalt beitragen und wann die Grenzen überschritten werden.
Getestete Auswahl
Das Team vergleicht begrenzte Top-p- und Temperaturwerte mit klaren Bewertungskriterien. Gute Vorschläge werden als Ausgangspunkt genutzt, während Fakten, Ton und Zielgruppe vor der Veröffentlichung weiterhin geprüft werden.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Ermöglicht kontrollierte Vielfalt, indem nur eine plausible Auswahl möglicher Tokens berücksichtigt wird.
- Passt die Kandidatenmenge dynamisch an die Unsicherheit der jeweiligen Modellentscheidung an.
- Unterstützt kreative oder explorative Aufgaben, wenn Ergebnisse anschließend geprüft werden.
Das solltest du beachten
- Mehr Variation kann Fehler, unpassende Formulierungen oder schwer reproduzierbare Ergebnisse erhöhen.
- Top-p ist ohne passende Aufgabe, Temperatur und Evaluierung schwer sinnvoll zu beurteilen.
- Plausible Tokenfolgen sind kein Beweis für Faktentreue oder verantwortbare Inhalte.
Vertiefung · für FortgeschrittenePlausible Vielfalt im Ausgaberaum
Dynamische Auswahl
- Temperatur
- Ein Parameter, der die Kreativität der Textausgabe eines Modells beeinflusst.
- Greedy Decoding
- Wählt immer das wahrscheinlichste nächste Token.
- Beam Search
- Decoding-Algorithmus, der mehrere Kandidaten parallel verfolgt.
- Logits
- Unnormalisierte Ausgabewerte eines neuronalen Netzes vor der Umwandlung.
- LLM Evaluation
- Systematische Bewertung von LLM-Qualität, Zuverlässigkeit und Sicherheit.