Speculative Decoding

Schnelle Tokenvorschläge durch ein Zielmodell prüfen lassen

Eine Optimierungstechnik, bei der ein kleines Modell Tokens vorschlägt und ein großes Modell sie parallel verifiziert – für deutlich schnellere Inferenz.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Kleines 'Draft'-Modell generiert mehrere Tokens schnell
  2. Großes 'Target'-Modell verifiziert alle Tokens parallel
  3. 2-3x Speedup ohne Qualitätsverlust möglich

Sofortantwort

Speculative Decoding einfach erklärt

Kleines Modell schlägt vor, großes verifiziert – schnellere Inferenz.

Kurz gesagt
Kleines 'Draft'-Modell generiert mehrere Tokens schnell
Typischer Einsatz
Latenz-Reduktion, Kosten-Optimierung, Batch-Verarbeitung
Wichtig zu wissen
2-3x Speedup ohne Qualitätsverlust möglich

Speculative Decoding im Überblick

Speculative Decoding beschleunigt LLM-Inferenz durch parallele Verifikation. Ein kleines, schnelles Modell schlägt mehrere Tokens vor, das große Modell prüft sie alle auf einmal.

Warum ist das schneller?

Normale Inferenz: Token für Token, jedes braucht einen vollen Forward Pass. Speculative Decoding: Mehrere Tokens werden parallel verifiziert – ein Forward Pass für viele Tokens.

Der Ablauf:

1. Draft-Modell (klein, schnell) generiert 5 Tokens: "Der Himmel ist heute blau"
2. Target-Modell (groß, langsam) prüft alle 5 parallel
3. Target akzeptiert: "Der Himmel ist heute" ✓ (4 Tokens)
4. Target lehnt ab: "blau" ✗ → generiert stattdessen "bewölkt"
5. Ergebnis: "Der Himmel ist heute bewölkt"
-> 5 Tokens mit ~2 Forward Passes statt 5

Technisch betrachtet

Mathematische Garantie

Speculative Decoding ist mathematisch äquivalent zu normalem Decoding. Die Akzeptanz-/Ablehnungs-Logik stellt sicher, dass die Ausgabeverteilung identisch bleibt.

Akzeptanzkriterium

Ein Token wird akzeptiert, wenn:

r < min(1, p_target(token) / p_draft(token))

Wobei r eine Zufallszahl ist. Tokens, die das Draft-Modell “zu optimistisch” vorschlägt, werden mit höherer Wahrscheinlichkeit abgelehnt.

Varianten

VarianteBeschreibung
StandardSeparates Draft-Modell
Self-SpeculativeFrühe Layers als Draft
MedusaMehrere Prediction Heads
LookaheadN-Gram basierte Vorhersage

Wann lohnt es sich?

  • Gut: Lange Generierungen, latenz-kritische Anwendungen
  • Weniger gut: Sehr kurze Antworten, Batch-Größe > 1 (Parallelisierung konkurriert)

Schritt für Schritt

Generierung mit Entwurf und Verifikation beschleunigen

Ein schneller Entwurf liefert mehrere Kandidaten; das Zielmodell bleibt die maßgebliche Instanz und akzeptiert nur passende Fortsetzungen.

  1. Passenden Entwurf wählen

    Setup

    Ein kleines oder spezialisiertes Draft-Modell wird so gewählt, dass seine Vorschläge oft zum Zielmodell passen.

    Target + Draft → Akzeptanzrate
  2. Mehrere Tokens vorschlagen

    Draft

    Das Draft-Modell erzeugt einen kurzen Entwurf schneller als das große Zielmodell Schritt für Schritt.

    Kontext → Tokenblock
  3. Block verifizieren

    Verify

    Das Zielmodell bewertet den Vorschlag effizient und übernimmt die akzeptierte Fortsetzung nach der festgelegten Decoding-Logik.

    Vorschlag → akzeptieren oder ersetzen
  4. Wirkung messen

    Evaluation

    Akzeptanzrate, Latenz, Durchsatz und Betriebskosten zeigen, ob sich die zusätzliche Architektur lohnt.

    Speedup ↔ Komplexität

Konkretes Beispiel

Beispiel: Viele längere Chat-Antworten

Ein Dienst generiert regelmäßig längere, gut strukturierte Antworten.

Nur Zielmodell

Das große Modell erzeugt jedes Token nacheinander und nutzt dabei viel Zeit für die Decode-Phase.

Entwurf plus Verifikation

Ein kleineres Modell schlägt mehrere Tokens vor. Das große Modell bestätigt passende Teile und erzeugt bei Abweichungen eine eigene Fortsetzung.

Speculative Decoding kann die Generierung beschleunigen, wenn Entwurf und Zielmodell gut zusammenpassen. Es lohnt sich nicht automatisch für jede Antwortlänge oder Last.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Kann die Decode-Phase bei passenden Modellen deutlich beschleunigen.
  • Lässt das Zielmodell weiterhin die endgültige Verteilung bestimmen.
  • Verbessert Tokens pro Sekunde ohne ein größeres Zielmodell zu ersetzen.
  • Lässt sich mit weiteren Inferenzoptimierungen kombinieren.

Das solltest du beachten

  • Ein zusätzlicher Modellpfad erhöht Komplexität und Ressourcenbedarf.
  • Niedrige Akzeptanzraten verringern oder eliminieren den Nutzen.
  • Für kurze Antworten überwiegt möglicherweise der Overhead.
  • Der Gewinn hängt stark von Hardware, Modellpaar und Traffic ab.
Vertiefung · für Fortgeschrittene

Zwei Modelle, ein kontrollierter Output

Das Zielmodell bleibt verantwortlich für die endgültige Fortsetzung.

Wissenskarte

Vorschlag prüfen

Der relevante Wert ist nicht nur der theoretische Speedup, sondern die gemessene End-to-End-Latenz für reale Anfragen. Speculative Decoding gliedert sich in: Kontext, Draft-Modell, Tokenblock, Target-Modell, Akzeptanz, Fallback.

01Einsatzbereiche

Wann ist Speculative Decoding sinnvoll?

Geeignet für

  • Latenz-ReduktionSchnellere Antwortzeiten für Chat-Anwendungen
  • Kosten-OptimierungMehr Tokens pro Sekunde bei gleicher Hardware
  • Batch-VerarbeitungHöherer Durchsatz bei großen Textmengen

↑ Inhalt

02Werkzeuge

Womit Speculative Decoding umgesetzt wird

↑ Inhalt

Merksatz

Speculative Decoding ist wie ein Assistent, der einen Entwurf schreibt, den der Chef nur noch absegnet. Statt dass der Chef jeden Satz selbst formuliert, prüft er nur, ob der Entwurf passt – das geht viel schneller.

  1. Kleines 'Draft'-Modell generiert mehrere Tokens schnell
  2. Großes 'Target'-Modell verifiziert alle Tokens parallel
  3. 2-3x Speedup ohne Qualitätsverlust möglich

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Speculative Decoding

Wie viel schneller ist Speculative Decoding?

Typisch 1.5-3x Speedup, abhängig von der Akzeptanzrate. Wenn das Draft-Modell gut zum Target-Modell passt, werden mehr Tokens akzeptiert und der Speedup ist höher.

Ändert sich die Ausgabequalität?

Nein. Die Ausgabe ist mathematisch identisch zum normalen Decoding. Das Target-Modell hat das letzte Wort – abgelehnte Tokens werden neu generiert.

Welches Draft-Modell sollte ich verwenden?

Idealerweise eine kleinere Version desselben Modells (z.B. Llama-7B als Draft für Llama-70B) oder ein speziell trainiertes Draft-Modell.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Inferenz

    Einsatz eines KI-Modells zur Vorhersage neuer Daten.

  • Technisch vertiefen

    Inference Optimization

    Techniken zur Beschleunigung und Kostensenkung von KI-Modellen.

↑ Inhalt