Inferenz

Wie ein trainiertes Modell neue Eingaben im Betrieb verarbeitet

Die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen oder Ausgaben zu generieren – der produktive Einsatz nach dem Training.

Einsteiger2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Die Phase, in der ein trainiertes Modell Vorhersagen für neue Eingaben trifft
  2. Muss schnell und kosteneffizient sein, da sie bei jeder Nutzeranfrage ausgeführt wird
  3. Optimierungen: Quantisierung, Batching, KV-Cache, Speculative Decoding

Sofortantwort

Inferenz einfach erklärt

Einsatz eines KI-Modells zur Vorhersage neuer Daten.

Kurz gesagt
Die Phase, in der ein trainiertes Modell Vorhersagen für neue Eingaben trifft
Typischer Einsatz
ChatGPT-Antworten, Echtzeit-Bilderkennung, Empfehlungssysteme
Wichtig zu wissen
Optimierungen: Quantisierung, Batching, KV-Cache, Speculative Decoding

Inferenz im Überblick

Inferenz ist der Produktionsbetrieb eines KI-Modells: Das trainierte Modell bekommt neue, ungesehene Eingaben und generiert Vorhersagen. Training passiert einmal – Inferenz passiert millionenfach täglich. Bei einem Dienst wie ChatGPT ist jede Antwort ein Inferenz-Vorgang. Die Kosten, Latenz und Skalierbarkeit von KI-Produkten werden fast ausschließlich durch die Inferenz-Effizienz bestimmt – nicht durch das Training. Deshalb ist Inference Optimization eines der wichtigsten Felder in der KI-Produktion.

Inferenz ist der Moment, in dem ein KI-Modell tatsächlich arbeitet. Nach dem Training wird das Modell eingesetzt, um für neue Eingaben Vorhersagen zu treffen – das ist Inferenz. Training passiert einmal; Inferenz passiert millionenfach.

Inferenz-Optimierung ist deshalb oft wichtiger als Training-Optimierung. Ein Modell, das in der Produktion 500ms pro Anfrage braucht, ist für Echtzeit-Anwendungen unbrauchbar. Techniken wie Quantisierung, Batching, Caching und spezielle Inferenz-Hardware (wie Nvidias TensorRT oder Apples Neural Engine) reduzieren Latenz und Kosten. Bei LLMs ist Inferenz besonders teuer, weil jedes Token sequenziell generiert wird – deshalb ist KV-Caching eine der wichtigsten Optimierungen.

Training vs. Inferenz:

AspektTrainingInferenz
ZielModell lerntModell wird angewendet
HäufigkeitEinmalig/seltenMillionenfach
KostenSehr hoch (einmalig)Gering (pro Anfrage)
HardwareViele GPUsWeniger GPUs/CPUs
GeschwindigkeitStunden-MonateMillisekunden-Sekunden

Technisch betrachtet

LLM-Inferenz

Bei LLMs besteht Inferenz aus zwei Phasen:

1. Prefill (Prompt-Verarbeitung):

  • Alle Input-Tokens werden parallel verarbeitet
  • KV-Cache wird aufgebaut
  • Compute-bound (GPU-Rechenleistung ist der Flaschenhals)

2. Decode (Token-Generierung):

  • Tokens werden nacheinander generiert
  • Jedes neue Token nutzt den KV-Cache
  • Memory-bound (Speicherbandbreite ist der Flaschenhals)

Optimierungen

  • KV-Cache: Speichert berechnete Key/Value-Vektoren für schnellere Generierung
  • Continuous Batching: Mehrere Anfragen gleichzeitig verarbeiten
  • Quantisierung: Reduzierte Präzision (FP16 → INT8 → INT4)
  • Speculative Decoding: Kleines Modell schlägt Tokens vor, großes verifiziert
  • PagedAttention: Effiziente Speicherverwaltung (vLLM)

Metriken

  • TTFT (Time to First Token): Latenz bis zum ersten generierten Token
  • TPS (Tokens per Second): Generierungsgeschwindigkeit
  • Throughput: Anfragen pro Sekunde
  • Latency P50/P95/P99: Antwortzeiten-Verteilung

Schritt für Schritt

Von der Anfrage zur Modellantwort

Inferenz nutzt feste Modellgewichte für neue Eingaben. Im Produkt zählen dabei Qualität, Zeit bis zur Antwort, Durchsatz und Kosten zugleich.

  1. Anfrage vorbereiten

    Prefill

    Eingabe, Systemregeln und gegebenenfalls abgerufene Quellen werden tokenisiert und in ein Kontextpaket überführt.

    Kontext → Tokens + KV-Cache
  2. Modell berechnet Vorhersagen

    Compute

    Das Modell verarbeitet den Kontext mit seinen trainierten Parametern und erstellt Wahrscheinlichkeiten für mögliche Ausgaben.

    Tokens + Gewichte → Logits
  3. Ausgabe schrittweise erzeugen

    Decode

    Bei generativen Modellen entstehen Tokens nacheinander; Caching vermeidet wiederholte Berechnungen für den bisherigen Kontext.

    Token → Cache → nächstes Token
  4. Ergebnis liefern und beobachten

    Betrieb

    Die Anwendung misst Latenz, Fehler, Kosten und Qualität und reagiert mit Limits, Fallbacks oder Skalierung.

    Antwort → Metriken + Monitoring

Konkretes Beispiel

Beispiel: Eine Antwort im Kundenservice

Ein Assistent soll eine kurze Antwort auf Basis einer aktuellen Richtlinie erzeugen.

Nur Modellantwort

Die Anwendung misst ausschließlich die sichtbare Textqualität und bemerkt erst spät steigende Antwortzeiten und Kosten.

Produktionsfähige Inferenz

Sie bereitet Kontext schlank vor, begrenzt die Ausgabelänge, misst Zeit bis zum ersten Token und nutzt Fallbacks bei Überlastung.

Inferenz ist nicht nur Modellrechnung. Erst die Betriebsarchitektur macht eine Modellfähigkeit zu einer verlässlichen Nutzererfahrung.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Macht trainierte Fähigkeiten für neue Anfragen unmittelbar nutzbar.
  • Lässt sich über Caching, Batching und Hardware auf verschiedene Lasten optimieren.
  • Erlaubt Messung von Latenz, Durchsatz und Kosten im realen Einsatz.
  • Unterstützt lokale, gehostete und hybride Betriebsmodelle.

Das solltest du beachten

  • Generative Modelle verursachen bei langen Ausgaben oft hohe Latenz.
  • Modellgröße und Kontextlänge bestimmen Speicherbedarf und Kosten.
  • Optimierungen können Qualität oder Flexibilität beeinträchtigen.
  • Eine schnelle Antwort ist nicht automatisch eine richtige oder sichere Antwort.
Vertiefung · für Fortgeschrittene

Inferenz im Produktbetrieb

Die Antwortzeit setzt sich aus Vorbereitung, Modellrechnung, Generierung und Infrastruktur zusammen.

Wissenskarte

Modell im Einsatz

Die passende Inferenzarchitektur hängt von Antwortlänge, Lastprofil, Datenschutz und erwarteter Nutzerinteraktion ab. Inferenz gliedert sich in: Anfrage, Tokenizer, Prefill, Decode, Optimierung, Monitoring.

01Einsatzbereiche

Wann ist Inferenz sinnvoll?

Geeignet für

  • ChatGPT-AntwortenJede Antwort von ChatGPT ist ein Inferenz-Vorgang des GPT-Modells
  • Echtzeit-BilderkennungGesichtserkennung auf dem Smartphone in Millisekunden
  • EmpfehlungssystemePersonalisierte Vorschläge in Echtzeit bei Netflix oder Spotify

↑ Inhalt

02Werkzeuge

Womit Inferenz umgesetzt wird

↑ Inhalt

Merksatz

Wenn Training das Studium ist, dann ist Inferenz die Prüfung

Das Modell wendet sein gelerntes Wissen auf neue, unbekannte Aufgaben an.

  1. Die Phase, in der ein trainiertes Modell Vorhersagen für neue Eingaben trifft
  2. Muss schnell und kosteneffizient sein, da sie bei jeder Nutzeranfrage ausgeführt wird
  3. Optimierungen: Quantisierung, Batching, KV-Cache, Speculative Decoding

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Inferenz spielt.

↑ Inhalt

04Anwenden

Inferenz praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Inferenz

Was ist der Unterschied zwischen Training und Inferenz?

Training: Das Modell lernt aus Daten (teuer, langsam, einmalig). Inferenz: Das trainierte Modell wird angewendet (günstig pro Anfrage, schnell, millionenfach). Training passt Gewichte an, Inferenz nutzt sie nur.

Warum ist Inferenz-Geschwindigkeit wichtig?

Nutzer erwarten schnelle Antworten. Bei LLMs bestimmt die Inferenz-Geschwindigkeit, wie schnell Tokens generiert werden (Tokens/Sekunde). Langsame Inferenz = schlechte Nutzererfahrung und hohe Kosten.

Was kostet Inferenz?

Bei API-Anbietern: pro Token (z.B. $2–10/1M Tokens bei GPT-5). Selbst gehostet: GPU-Kosten ($1-10/Stunde). Optimierungen wie Quantisierung und Batching senken die Kosten erheblich.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Modell

    Mathematische Repräsentation zur Vorhersage neuer Eingaben.

  • Technisch vertiefen

    Parameter

    Werte, die das Wissen eines KI-Modells während des Trainings repräsentieren.

  • In der Praxis anwenden

    Die KI-Technologie-Landschaft verstehen

    Wer macht was in der KI-Welt – und was davon ist Hype, was ist real?

↑ Inhalt