Sofortantwort
Speculative Decoding einfach erklärt
Kleines Modell schlägt vor, großes verifiziert – schnellere Inferenz.
- Kurz gesagt
- Kleines 'Draft'-Modell generiert mehrere Tokens schnell
- Typischer Einsatz
- Latenz-Reduktion, Kosten-Optimierung, Batch-Verarbeitung
- Wichtig zu wissen
- 2-3x Speedup ohne Qualitätsverlust möglich
Speculative Decoding im Überblick
Speculative Decoding beschleunigt LLM-Inferenz durch parallele Verifikation. Ein kleines, schnelles Modell schlägt mehrere Tokens vor, das große Modell prüft sie alle auf einmal.
Warum ist das schneller?
Normale Inferenz: Token für Token, jedes braucht einen vollen Forward Pass. Speculative Decoding: Mehrere Tokens werden parallel verifiziert – ein Forward Pass für viele Tokens.
Der Ablauf:
1. Draft-Modell (klein, schnell) generiert 5 Tokens: "Der Himmel ist heute blau"
2. Target-Modell (groß, langsam) prüft alle 5 parallel
3. Target akzeptiert: "Der Himmel ist heute" ✓ (4 Tokens)
4. Target lehnt ab: "blau" ✗ → generiert stattdessen "bewölkt"
5. Ergebnis: "Der Himmel ist heute bewölkt"
-> 5 Tokens mit ~2 Forward Passes statt 5
Technisch betrachtet
Mathematische Garantie
Speculative Decoding ist mathematisch äquivalent zu normalem Decoding. Die Akzeptanz-/Ablehnungs-Logik stellt sicher, dass die Ausgabeverteilung identisch bleibt.
Akzeptanzkriterium
Ein Token wird akzeptiert, wenn:
r < min(1, p_target(token) / p_draft(token))
Wobei r eine Zufallszahl ist. Tokens, die das Draft-Modell “zu optimistisch” vorschlägt, werden mit höherer Wahrscheinlichkeit abgelehnt.
Varianten
| Variante | Beschreibung |
|---|---|
| Standard | Separates Draft-Modell |
| Self-Speculative | Frühe Layers als Draft |
| Medusa | Mehrere Prediction Heads |
| Lookahead | N-Gram basierte Vorhersage |
Wann lohnt es sich?
- Gut: Lange Generierungen, latenz-kritische Anwendungen
- Weniger gut: Sehr kurze Antworten, Batch-Größe > 1 (Parallelisierung konkurriert)
Schritt für Schritt
Generierung mit Entwurf und Verifikation beschleunigen
Ein schneller Entwurf liefert mehrere Kandidaten; das Zielmodell bleibt die maßgebliche Instanz und akzeptiert nur passende Fortsetzungen.
Passenden Entwurf wählen
Setup
Ein kleines oder spezialisiertes Draft-Modell wird so gewählt, dass seine Vorschläge oft zum Zielmodell passen.
Target + Draft → AkzeptanzrateMehrere Tokens vorschlagen
Draft
Das Draft-Modell erzeugt einen kurzen Entwurf schneller als das große Zielmodell Schritt für Schritt.
Kontext → TokenblockBlock verifizieren
Verify
Das Zielmodell bewertet den Vorschlag effizient und übernimmt die akzeptierte Fortsetzung nach der festgelegten Decoding-Logik.
Vorschlag → akzeptieren oder ersetzenWirkung messen
Evaluation
Akzeptanzrate, Latenz, Durchsatz und Betriebskosten zeigen, ob sich die zusätzliche Architektur lohnt.
Speedup ↔ Komplexität
Konkretes Beispiel
Beispiel: Viele längere Chat-Antworten
Ein Dienst generiert regelmäßig längere, gut strukturierte Antworten.
Nur Zielmodell
Das große Modell erzeugt jedes Token nacheinander und nutzt dabei viel Zeit für die Decode-Phase.
Entwurf plus Verifikation
Ein kleineres Modell schlägt mehrere Tokens vor. Das große Modell bestätigt passende Teile und erzeugt bei Abweichungen eine eigene Fortsetzung.
Speculative Decoding kann die Generierung beschleunigen, wenn Entwurf und Zielmodell gut zusammenpassen. Es lohnt sich nicht automatisch für jede Antwortlänge oder Last.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Kann die Decode-Phase bei passenden Modellen deutlich beschleunigen.
- Lässt das Zielmodell weiterhin die endgültige Verteilung bestimmen.
- Verbessert Tokens pro Sekunde ohne ein größeres Zielmodell zu ersetzen.
- Lässt sich mit weiteren Inferenzoptimierungen kombinieren.
Das solltest du beachten
- Ein zusätzlicher Modellpfad erhöht Komplexität und Ressourcenbedarf.
- Niedrige Akzeptanzraten verringern oder eliminieren den Nutzen.
- Für kurze Antworten überwiegt möglicherweise der Overhead.
- Der Gewinn hängt stark von Hardware, Modellpaar und Traffic ab.
Vertiefung · für FortgeschritteneZwei Modelle, ein kontrollierter Output
Das Zielmodell bleibt verantwortlich für die endgültige Fortsetzung.
Vorschlag prüfen