Sofortantwort
Inferenz einfach erklärt
Einsatz eines KI-Modells zur Vorhersage neuer Daten.
- Kurz gesagt
- Die Phase, in der ein trainiertes Modell Vorhersagen für neue Eingaben trifft
- Typischer Einsatz
- ChatGPT-Antworten, Echtzeit-Bilderkennung, Empfehlungssysteme
- Wichtig zu wissen
- Optimierungen: Quantisierung, Batching, KV-Cache, Speculative Decoding
Inferenz im Überblick
Inferenz ist der Produktionsbetrieb eines KI-Modells: Das trainierte Modell bekommt neue, ungesehene Eingaben und generiert Vorhersagen. Training passiert einmal – Inferenz passiert millionenfach täglich. Bei einem Dienst wie ChatGPT ist jede Antwort ein Inferenz-Vorgang. Die Kosten, Latenz und Skalierbarkeit von KI-Produkten werden fast ausschließlich durch die Inferenz-Effizienz bestimmt – nicht durch das Training. Deshalb ist Inference Optimization eines der wichtigsten Felder in der KI-Produktion.
Inferenz ist der Moment, in dem ein KI-Modell tatsächlich arbeitet. Nach dem Training wird das Modell eingesetzt, um für neue Eingaben Vorhersagen zu treffen – das ist Inferenz. Training passiert einmal; Inferenz passiert millionenfach.
Inferenz-Optimierung ist deshalb oft wichtiger als Training-Optimierung. Ein Modell, das in der Produktion 500ms pro Anfrage braucht, ist für Echtzeit-Anwendungen unbrauchbar. Techniken wie Quantisierung, Batching, Caching und spezielle Inferenz-Hardware (wie Nvidias TensorRT oder Apples Neural Engine) reduzieren Latenz und Kosten. Bei LLMs ist Inferenz besonders teuer, weil jedes Token sequenziell generiert wird – deshalb ist KV-Caching eine der wichtigsten Optimierungen.
Training vs. Inferenz:
| Aspekt | Training | Inferenz |
|---|---|---|
| Ziel | Modell lernt | Modell wird angewendet |
| Häufigkeit | Einmalig/selten | Millionenfach |
| Kosten | Sehr hoch (einmalig) | Gering (pro Anfrage) |
| Hardware | Viele GPUs | Weniger GPUs/CPUs |
| Geschwindigkeit | Stunden-Monate | Millisekunden-Sekunden |
Technisch betrachtet
LLM-Inferenz
Bei LLMs besteht Inferenz aus zwei Phasen:
1. Prefill (Prompt-Verarbeitung):
- Alle Input-Tokens werden parallel verarbeitet
- KV-Cache wird aufgebaut
- Compute-bound (GPU-Rechenleistung ist der Flaschenhals)
2. Decode (Token-Generierung):
- Tokens werden nacheinander generiert
- Jedes neue Token nutzt den KV-Cache
- Memory-bound (Speicherbandbreite ist der Flaschenhals)
Optimierungen
- KV-Cache: Speichert berechnete Key/Value-Vektoren für schnellere Generierung
- Continuous Batching: Mehrere Anfragen gleichzeitig verarbeiten
- Quantisierung: Reduzierte Präzision (FP16 → INT8 → INT4)
- Speculative Decoding: Kleines Modell schlägt Tokens vor, großes verifiziert
- PagedAttention: Effiziente Speicherverwaltung (vLLM)
Metriken
- TTFT (Time to First Token): Latenz bis zum ersten generierten Token
- TPS (Tokens per Second): Generierungsgeschwindigkeit
- Throughput: Anfragen pro Sekunde
- Latency P50/P95/P99: Antwortzeiten-Verteilung
Schritt für Schritt
Von der Anfrage zur Modellantwort
Inferenz nutzt feste Modellgewichte für neue Eingaben. Im Produkt zählen dabei Qualität, Zeit bis zur Antwort, Durchsatz und Kosten zugleich.
Anfrage vorbereiten
Prefill
Eingabe, Systemregeln und gegebenenfalls abgerufene Quellen werden tokenisiert und in ein Kontextpaket überführt.
Kontext → Tokens + KV-CacheModell berechnet Vorhersagen
Compute
Das Modell verarbeitet den Kontext mit seinen trainierten Parametern und erstellt Wahrscheinlichkeiten für mögliche Ausgaben.
Tokens + Gewichte → LogitsAusgabe schrittweise erzeugen
Decode
Bei generativen Modellen entstehen Tokens nacheinander; Caching vermeidet wiederholte Berechnungen für den bisherigen Kontext.
Token → Cache → nächstes TokenErgebnis liefern und beobachten
Betrieb
Die Anwendung misst Latenz, Fehler, Kosten und Qualität und reagiert mit Limits, Fallbacks oder Skalierung.
Antwort → Metriken + Monitoring
Konkretes Beispiel
Beispiel: Eine Antwort im Kundenservice
Ein Assistent soll eine kurze Antwort auf Basis einer aktuellen Richtlinie erzeugen.
Nur Modellantwort
Die Anwendung misst ausschließlich die sichtbare Textqualität und bemerkt erst spät steigende Antwortzeiten und Kosten.
Produktionsfähige Inferenz
Sie bereitet Kontext schlank vor, begrenzt die Ausgabelänge, misst Zeit bis zum ersten Token und nutzt Fallbacks bei Überlastung.
Inferenz ist nicht nur Modellrechnung. Erst die Betriebsarchitektur macht eine Modellfähigkeit zu einer verlässlichen Nutzererfahrung.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Macht trainierte Fähigkeiten für neue Anfragen unmittelbar nutzbar.
- Lässt sich über Caching, Batching und Hardware auf verschiedene Lasten optimieren.
- Erlaubt Messung von Latenz, Durchsatz und Kosten im realen Einsatz.
- Unterstützt lokale, gehostete und hybride Betriebsmodelle.
Das solltest du beachten
- Generative Modelle verursachen bei langen Ausgaben oft hohe Latenz.
- Modellgröße und Kontextlänge bestimmen Speicherbedarf und Kosten.
- Optimierungen können Qualität oder Flexibilität beeinträchtigen.
- Eine schnelle Antwort ist nicht automatisch eine richtige oder sichere Antwort.
Vertiefung · für FortgeschritteneInferenz im Produktbetrieb
Die Antwortzeit setzt sich aus Vorbereitung, Modellrechnung, Generierung und Infrastruktur zusammen.
Modell im Einsatz