Top-p (Nucleus Sampling)

Wie ein Modell aus einer begrenzten Menge plausibler Fortsetzungen auswählt und Vielfalt kontrollierbar macht

Eine Sampling-Methode bei der Textgenerierung, die nur die wahrscheinlichsten Tokens berücksichtigt, deren kumulative Wahrscheinlichkeit einen Schwellenwert p erreicht.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Wählt aus den wahrscheinlichsten Tokens, deren kumulative Wahrscheinlichkeit ≤ p ist
  2. Alternative zur Temperatur für die Steuerung der Ausgabe-Vielfalt
  3. p=0.9 ist ein guter Standard – p=1.0 bedeutet keine Einschränkung

Sofortantwort

Top-p einfach erklärt

Sampling-Methode, die die wahrscheinlichsten Tokens auswählt.

Kurz gesagt
Wählt aus den wahrscheinlichsten Tokens, deren kumulative Wahrscheinlichkeit ≤ p ist
Typischer Einsatz
Kontrollierte Kreativität, Deterministische Ausgabe, API-Konfiguration
Wichtig zu wissen
p=0.9 ist ein guter Standard – p=1.0 bedeutet keine Einschränkung

Top-p im Überblick

Top-p (auch Nucleus Sampling) ist eine Methode, die steuert, aus wie vielen Token-Kandidaten das Modell bei der Textgenerierung wählen darf.

Beispiel: Das Modell soll das nächste Wort nach “Der Hund” vorhersagen:

"bellt"   → 40% Wahrscheinlichkeit
"rennt"   → 25%
"schläft" → 15%
"frisst"  → 10%
"tanzt"   → 5%
"fliegt"  → 3%
"singt"   → 2%
  • Top-p = 0.8: Wählt aus schläft (kumulativ 80%)
  • Top-p = 0.95: Wählt aus tanzt (kumulativ 95%)
  • Top-p = 1.0: Alle Tokens möglich

Technisch betrachtet

Algorithmus

  1. Sortiere Tokens nach Wahrscheinlichkeit (absteigend)
  2. Berechne kumulative Wahrscheinlichkeit
  3. Schneide ab, sobald die kumulative Wahrscheinlichkeit p überschreitet
  4. Normalisiere die verbleibenden Wahrscheinlichkeiten
  5. Sample aus der reduzierten Verteilung

Vorteile gegenüber Top-k

Top-p passt sich dynamisch an den Kontext an:

  • Bei eindeutigen Kontexten (z.B. “Die Hauptstadt von Frankreich ist”): Wenige Tokens im Nucleus
  • Bei mehrdeutigen Kontexten (z.B. “Heute möchte ich”): Viele Tokens im Nucleus

Top-k hat immer eine feste Anzahl, was in eindeutigen Kontexten zu viele und in mehrdeutigen zu wenige Optionen bieten kann.

Praktische Empfehlungen

Use CaseTop-pTemperaturBegründung
Fakten/Code0.1-0.30Nur beste Tokens, deterministisch
Allgemein0.90.7Guter Standard
Kreativ0.951.0Mehr Vielfalt
Brainstorming1.01.2Maximale Variation

Code-Beispiel (OpenAI API)

from openai import OpenAI

client = OpenAI()

# Faktisch/Deterministisch
response = client.chat.completions.create(
    model="gpt-5",
    messages=[{"role": "user", "content": "Was ist die Hauptstadt von Frankreich?"}],
    temperature=0,
    top_p=0.1
)

# Kreativ
response = client.chat.completions.create(
    model="gpt-5",
    messages=[{"role": "user", "content": "Schreibe ein Haiku über KI"}],
    temperature=1.0,
    top_p=0.95
)

Wichtige Hinweise

  • Nicht beide stark ändern: OpenAI empfiehlt, entweder Temperatur ODER Top-p anzupassen, nicht beide gleichzeitig extrem
  • Top-p=1.0: Keine Einschränkung, alle Tokens möglich (Temperatur bestimmt dann allein)
  • Top-p=0: Würde nur das wahrscheinlichste Token erlauben (praktisch nie verwendet)

Schritt für Schritt

Wie Top-p Sampling sinnvoll eingestellt wird

  1. Varianzbedarf der Aufgabe bestimmen

    Kläre, ob mehrere Formulierungen oder Ideen willkommen sind oder ob eine streng wiederholbare Ausgabe gebraucht wird. Sampling ist eine bewusste Qualitätsentscheidung und sollte nicht unbemerkt für jede Aufgabe gleich eingestellt bleiben.

  2. Wahrscheinlichkeitsmenge begrenzen

    Top-p wählt eine dynamische Menge von Token, deren gemeinsame Wahrscheinlichkeit einen festgelegten Anteil erreicht. Dieser Wert bestimmt, wie weit das Modell von den wahrscheinlichsten Optionen abweichen darf.

  3. Parameter gemeinsam testen

    Prüfe Top-p zusammen mit Temperatur, Eingabe und Formatvorgaben auf repräsentativen Fällen. Ein einzelner Parameter erklärt die Qualität selten allein; Kombinationen können unerwartete Vielfalt oder Wiederholung erzeugen.

  4. Risiko und Qualität je Einsatz prüfen

    Für kreative Entwürfe kann mehr Variation hilfreich sein, für strukturierte oder folgenreiche Aufgaben oft nicht. Bewerte Ausgaben auf Faktenbezug, Sicherheit und Nutzbarkeit statt auf Neuheit allein.

Konkretes Beispiel

Ideen werden vielfältig, aber nicht beliebig

Ein Content-Team möchte mehrere Ansätze für einen erklärenden Einstieg entwickeln. Die Vorschläge sollen verschieden sein, aber weiterhin zum Thema und zur Zielgruppe passen.

Unkontrollierte Vielfalt

Ein sehr offenes Sampling liefert kreative, aber teils unpassende Ideen. Das Team kann nicht nachvollziehen, welche Einstellungen zur nützlichen Vielfalt beitragen und wann die Grenzen überschritten werden.

Getestete Auswahl

Das Team vergleicht begrenzte Top-p- und Temperaturwerte mit klaren Bewertungskriterien. Gute Vorschläge werden als Ausgangspunkt genutzt, während Fakten, Ton und Zielgruppe vor der Veröffentlichung weiterhin geprüft werden.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Ermöglicht kontrollierte Vielfalt, indem nur eine plausible Auswahl möglicher Tokens berücksichtigt wird.
  • Passt die Kandidatenmenge dynamisch an die Unsicherheit der jeweiligen Modellentscheidung an.
  • Unterstützt kreative oder explorative Aufgaben, wenn Ergebnisse anschließend geprüft werden.

Das solltest du beachten

  • Mehr Variation kann Fehler, unpassende Formulierungen oder schwer reproduzierbare Ergebnisse erhöhen.
  • Top-p ist ohne passende Aufgabe, Temperatur und Evaluierung schwer sinnvoll zu beurteilen.
  • Plausible Tokenfolgen sind kein Beweis für Faktentreue oder verantwortbare Inhalte.
Vertiefung · für Fortgeschrittene

Plausible Vielfalt im Ausgaberaum

Wissenskarte

Dynamische Auswahl

Temperatur
Ein Parameter, der die Kreativität der Textausgabe eines Modells beeinflusst.
Greedy Decoding
Wählt immer das wahrscheinlichste nächste Token.
Beam Search
Decoding-Algorithmus, der mehrere Kandidaten parallel verfolgt.
Logits
Unnormalisierte Ausgabewerte eines neuronalen Netzes vor der Umwandlung.
LLM Evaluation
Systematische Bewertung von LLM-Qualität, Zuverlässigkeit und Sicherheit.
Top-p Sampling begrenzt die Auswahl auf eine dynamische Menge plausibler Fortsetzungen; die passende Vielfalt wird immer gegen die konkrete Aufgabe und ihre Risiken geprüft. Top-p gliedert sich in: Temperatur, Greedy Decoding, Beam Search, Logits, LLM Evaluation.

01Einsatzbereiche

Wann ist Top-p sinnvoll?

Geeignet für

  • Kontrollierte KreativitätTop-p=0.9 erlaubt Vielfalt, schließt aber sehr unwahrscheinliche Tokens aus
  • Deterministische AusgabeTop-p=0.1 beschränkt die Auswahl auf die allerbesten Tokens
  • API-KonfigurationFeinsteuerung der Textgenerierung bei LLM-API-Aufrufen

↑ Inhalt

02Werkzeuge

Womit Top-p umgesetzt wird

↑ Inhalt

Merksatz

Top-p ist wie ein Budget beim Einkaufen

Du nimmst die besten Produkte, bis dein Budget (p) aufgebraucht ist. Bei p=0.9 nimmst du die Top-Produkte, die zusammen 90% des Werts ausmachen.

  1. Wählt aus den wahrscheinlichsten Tokens, deren kumulative Wahrscheinlichkeit ≤ p ist
  2. Alternative zur Temperatur für die Steuerung der Ausgabe-Vielfalt
  3. p=0.9 ist ein guter Standard – p=1.0 bedeutet keine Einschränkung

04Anwenden

Top-p praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Top-p

Was ist der Unterschied zwischen Top-p und Temperatur?

Temperatur skaliert alle Wahrscheinlichkeiten (macht die Verteilung schärfer oder flacher). Top-p schneidet die Verteilung ab – nur Tokens innerhalb des Schwellenwerts werden berücksichtigt. Beide steuern die Vielfalt, aber auf unterschiedliche Weise.

Was ist Top-k im Vergleich zu Top-p?

Top-k wählt immer aus den k wahrscheinlichsten Tokens (feste Anzahl). Top-p passt die Anzahl dynamisch an – bei eindeutigen Kontexten weniger Tokens, bei mehrdeutigen mehr. Top-p ist daher flexibler.

Sollte ich Top-p oder Temperatur verwenden?

Für die meisten Anwendungen reicht einer der beiden Parameter. OpenAI empfiehlt, nicht beide gleichzeitig stark zu verändern. Top-p ist intuitiver für die Kontrolle der Vielfalt.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Logits

    Unnormalisierte Ausgabewerte eines neuronalen Netzes vor der Umwandlung.

  • Technisch vertiefen

    Inferenz

    Einsatz eines KI-Modells zur Vorhersage neuer Daten.

  • In der Praxis anwenden

    Was sind Large Language Models?

    Von GPT bis Llama – wie LLMs funktionieren, was sie können und wo ihre Grenzen liegen.

↑ Inhalt