LLM Router

Ein System, das eingehende LLM-Anfragen basierend auf Komplexität, Kosten oder Anforderungen automatisch an das optimale Modell weiterleitet – für bessere Performance bei geringeren Kosten.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Leitet Anfragen basierend auf Komplexität, Kosten oder Latenz an verschiedene Modelle
  2. Einfache Anfragen → kleines, günstiges Modell; komplexe → großes, leistungsstarkes Modell
  3. Kann die Inferenzkosten spürbar senken, wenn ein großer Teil der Anfragen einfach ist

Sofortantwort

LLM Router einfach erklärt

Verteilt LLM-Anfragen automatisch ans optimale Modell – nach Komplexität und Kosten.

Kurz gesagt
Leitet Anfragen basierend auf Komplexität, Kosten oder Latenz an verschiedene Modelle
Typischer Einsatz
Kostenoptimierung, Latenz-Optimierung, Fallback-Strategie
Wichtig zu wissen
Kann die Inferenzkosten spürbar senken, wenn ein großer Teil der Anfragen einfach ist

LLM Router im Überblick

Ein Frontier-Modell kostet pro Token deutlich mehr als ein kleines Schnell-Modell derselben Familie. Aber braucht jede Anfrage das stärkste Modell? Eine einfache FAQ-Antwort, eine kurze Zusammenfassung oder eine Klassifizierungsaufgabe – das kann ein kleines Modell genauso gut.

Ein LLM Router analysiert jede eingehende Anfrage und entscheidet: Welches Modell ist gut genug und gleichzeitig günstig? Das Ergebnis: Gleiche oder bessere Gesamtqualität bei deutlich geringeren Kosten.

Routing-Strategien:

StrategieFunktionsweiseVorteil
RegelbasiertToken-Länge, KeywordsEinfach, vorhersehbar
ClassifierML-Modell schätzt KomplexitätGenauer
CascadeKlein → Groß bei UnsicherheitQualitätssicherung
Cost-basedGünstigstes Modell mit MindestqualitätMaximale Ersparnis

Technisch betrachtet

LiteLLM als Router

import litellm
from litellm import Router

router = Router(
    model_list=[
        {
            "model_name": "fast-model",
            "litellm_params": {
                "model": "gpt-5.6-luna",
                "api_key": os.getenv("OPENAI_API_KEY"),
            },
        },
        {
            "model_name": "powerful-model",
            "litellm_params": {
                "model": "claude-sonnet-4-6",
                "api_key": os.getenv("ANTHROPIC_API_KEY"),
            },
        },
    ],
    routing_strategy="cost-based-routing",
)

# Einfache Anfrage → günstiges Modell
response = await router.acompletion(
    model="fast-model",
    messages=[{"role": "user", "content": "Was ist die Hauptstadt von Frankreich?"}],
)

Eigener Complexity-Router

def route_request(prompt: str) -> str:
    token_count = len(prompt.split())
    has_code = "```" in prompt or "def " in prompt
    needs_reasoning = any(w in prompt.lower() for w in ["analysiere", "vergleiche", "erkläre warum"])

    if token_count > 2000 or has_code or needs_reasoning:
        return "gpt-5.6-sol"       # Komplex → starkes Modell
    elif token_count > 500:
        return "gpt-5.6-terra"     # Mittel → ausgewogenes Modell
    else:
        return "gpt-5.6-luna"      # Einfach → günstigstes Modell

Fallback-Konfiguration

router = Router(
    model_list=[...],
    fallbacks=[
        {"gpt-5.6-sol": ["claude-sonnet-4-6"]},  # OpenAI down → Anthropic
        {"claude-sonnet-4-6": ["gpt-5.6-sol"]},
    ],
    context_window_fallbacks=[
        {"gpt-5.6-sol": ["claude-sonnet-4-6"]},  # Context zu lang → größeres Fenster
    ],
)

01Einsatzbereiche

Wann ist LLM Router sinnvoll?

Geeignet für

  • KostenoptimierungFAQ-Anfragen an ein kleines Schnell-Modell, komplexe Analysen an ein Frontier-Modell – automatisch und transparent
  • Latenz-OptimierungZeitkritische Anfragen an schnelle Modelle, Qualitätskritische an leistungsstarke
  • Fallback-StrategieWenn OpenAI nicht erreichbar ist, automatisch auf Anthropic oder lokale Modelle ausweichen

↑ Inhalt

02Werkzeuge

Womit LLM Router umgesetzt wird

↑ Inhalt

Merksatz

Ein LLM Router ist wie ein Triagesystem in der Notaufnahme

Einfache Fälle (Pflaster kleben) gehen zur Krankenschwester, mittlere Fälle zum Allgemeinmediziner, komplexe Fälle zum Spezialisten. Nicht jede Anfrage braucht den teuersten Experten.

  1. Leitet Anfragen basierend auf Komplexität, Kosten oder Latenz an verschiedene Modelle
  2. Einfache Anfragen → kleines, günstiges Modell; komplexe → großes, leistungsstarkes Modell
  3. Kann die Inferenzkosten spürbar senken, wenn ein großer Teil der Anfragen einfach ist

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu LLM Router

Wie entscheidet ein Router, welches Modell genutzt wird?

Verschiedene Strategien: Regelbasiert (Anfragen unter X Tokens → kleines Modell), Classifier-basiert (ML-Modell schätzt Komplexität), Cost-based (günstigstes Modell das die Qualitätsanforderung erfüllt), oder Cascade (erst kleines Modell, bei Unsicherheit großes).

Was ist LiteLLM?

LiteLLM ist eine Open-Source-Bibliothek, die eine einheitliche OpenAI-kompatible API für über 100 LLM-Provider bereitstellt. Statt für jeden Provider eigenen Code zu schreiben, nutzt man immer dieselbe API – LiteLLM übersetzt die Anfragen. Es bietet auch Routing, Fallbacks, Caching und Kostentracking.

Leidet die Qualität unter Routing?

Bei guter Konfiguration kaum. In vielen Anwendungen lässt sich ein erheblicher Teil der Anfragen von kleineren Modellen genauso gut beantworten – wie groß dieser Anteil ist, hängt stark vom Use Case ab. Der Schlüssel ist, die Grenze anhand eigener Daten zu ziehen und das Routing regelmäßig zu evaluieren.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Large Language Model

    Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.

  • Technisch vertiefen

    Inferenz

    Einsatz eines KI-Modells zur Vorhersage neuer Daten.

↑ Inhalt