Next-Token-Prediction

Next-Token-Prediction ist das Grundprinzip moderner Sprachmodelle: Sie sagen wiederholt das wahrscheinlichste nächste Token voraus. Aus dieser einfachen Aufgabe entstehen erstaunlich allgemeine Sprachfähigkeiten.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Trainingsziel und Generierungsprinzip moderner Sprachmodelle zugleich
  2. Das Modell schätzt eine Wahrscheinlichkeitsverteilung über alle möglichen nächsten Tokens
  3. Aus dem simplen Ziel entstehen Grammatik, Wissen und Reasoning als Nebenprodukt

Sofortantwort

Next-Token-Prediction einfach erklärt

Grundprinzip von LLMs: wiederholt das wahrscheinlichste nächste Token vorhersagen.

Kurz gesagt
Trainingsziel und Generierungsprinzip moderner Sprachmodelle zugleich
Typischer Einsatz
Textgenerierung, Autovervollständigung, Pre-Training
Wichtig zu wissen
Aus dem simplen Ziel entstehen Grammatik, Wissen und Reasoning als Nebenprodukt

Next-Token-Prediction im Überblick

Next-Token-Prediction (die Vorhersage des nächsten Tokens) ist das Herzstück moderner großer Sprachmodelle. Das Prinzip klingt fast zu simpel: Gegeben ein Stück Text, sagt das Modell voraus, welches Token am wahrscheinlichsten als Nächstes folgt. Dann hängt es dieses Token an und wiederholt den Vorgang – Token für Token entsteht so ein ganzer Text.

Das Erstaunliche: Aus dieser einen Aufgabe erwachsen all die Fähigkeiten, die LLMs auszeichnen. Denn um wirklich gut vorherzusagen, was als Nächstes kommt, muss ein Modell Sprache, Wissen und Zusammenhänge verstehen.

Technisch betrachtet

Ein Ziel, zwei Rollen

Next-Token-Prediction ist zugleich:

  • Trainingsziel – das Modell lernt aus riesigen Textmengen, indem es immer wieder das nächste Token erraten und sich korrigieren muss.
  • Generierungsprinzip – nach dem Training erzeugt dasselbe Verfahren neue Texte.

Von der Verteilung zum Token

Das Modell gibt keine einzelne Antwort aus, sondern eine Wahrscheinlichkeitsverteilung über den gesamten Wortschatz – berechnet über eine Softmax-Funktion. Daraus wählt ein Decoding-Verfahren das nächste Token:

VerfahrenVerhalten
Greedy Decodingimmer das wahrscheinlichste Token
Temperature Samplingmehr Zufall, mehr Kreativität
Top-k / Top-pAuswahl auf die plausibelsten Tokens begrenzt

Warum daraus Intelligenz entsteht

Die Vorhersage des nächsten Tokens zwingt das Modell, Grammatik, Faktenwissen und logische Muster zu lernen – schlicht weil all das hilft, besser vorherzusagen. Genau deshalb ist ein so einfaches Ziel die Grundlage erstaunlich allgemeiner Sprachfähigkeiten.

01Einsatzbereiche

Wann ist Next-Token-Prediction sinnvoll?

Geeignet für

  • TextgenerierungJede Antwort eines Chatbots entsteht durch wiederholte Next-Token-Vorhersage
  • AutovervollständigungCode- und Texteditoren schlagen die wahrscheinliche Fortsetzung vor
  • Pre-TrainingDas Vortrainieren großer Modelle nutzt fast ausschließlich dieses Ziel

↑ Inhalt

02Werkzeuge

Womit Next-Token-Prediction umgesetzt wird

↑ Inhalt

Merksatz

Next-Token-Prediction ist wie das Autovervollständigen auf dem Handy – nur in extrem

Das Modell hat Milliarden Texte gelesen und schätzt für jedes Wort, was am wahrscheinlichsten als Nächstes kommt. Reiht man diese Vorhersagen aneinander, entstehen ganze Antworten.

  1. Trainingsziel und Generierungsprinzip moderner Sprachmodelle zugleich
  2. Das Modell schätzt eine Wahrscheinlichkeitsverteilung über alle möglichen nächsten Tokens
  3. Aus dem simplen Ziel entstehen Grammatik, Wissen und Reasoning als Nebenprodukt

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Next-Token-Prediction

Wenn LLMs nur das nächste Wort raten – wie können sie dann denken?

Um das nächste Token zuverlässig vorherzusagen, muss ein Modell Grammatik, Fakten, Zusammenhänge und sogar logische Schlüsse implizit erfassen. Diese Fähigkeiten entstehen als Nebenprodukt des Trainings, weil sie die Vorhersage verbessern – nicht weil sie explizit einprogrammiert wurden.

Was ist ein Token genau?

Ein Token ist eine kleine Texteinheit – oft ein Wortteil, manchmal ein ganzes Wort oder ein Satzzeichen. Modelle arbeiten nicht mit Buchstaben oder ganzen Wörtern, sondern mit diesen Tokens, die ein Tokenizer aus dem Text bildet.

Wie wird aus der Vorhersage konkreter Text?

Das Modell gibt eine Wahrscheinlichkeit für jedes mögliche nächste Token aus. Ein Sampling-Verfahren wählt daraus eines aus – mal das wahrscheinlichste (Greedy Decoding), mal zufälliger gesteuert über die Temperatur. Das gewählte Token wird angehängt und der Vorgang wiederholt sich.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Tokenisierung

    Text wird in kleinere Einheiten für die Verarbeitung zerlegt.

  • Technisch vertiefen

    Softmax

    Wandelt Zahlen in Wahrscheinlichkeiten um (Summe = 1).

↑ Inhalt