<EbeneX/>
LLM Praxis · Updated 10. Juli 2026

Llama

Definition

Metas Familie von Open-Weight-Sprachmodellen, die das KI-Ökosystem demokratisiert haben – von Llama 1 (2023) bis Llama 4 (2026, MoE & nativ multimodal) das meistgenutzte Open-Weight-Modell weltweit.

Fortgeschritten 2 Min. Lesezeit EN: Llama (Large Language Model Meta AI)

Einfach erklärt

Llama ist Metas Familie von Sprachmodellen mit öffentlich verfügbaren Gewichten. Seit der Veröffentlichung von Llama 1 im Februar 2023 hat Meta das Open-Weight-Ökosystem maßgeblich geprägt. Die aktuelle Generation Llama 4 (2026) setzt erstmals auf eine Mixture-of-Experts-Architektur und ist nativ multimodal.

Llama-Evolution:

2023-02: Llama 1    → 7B–65B, nur Forschung
2023-07: Llama 2    → 7B–70B, kommerziell nutzbar
2024-04: Llama 3    → 8B–70B, deutlicher Qualitätssprung
2024-07: Llama 3.1  → 8B–405B, erstmals >400B Open Weight
2024-09: Llama 3.2  → 1B–90B, multimodal + Edge-Modelle
2025-01: Llama 3.3  → 8B–70B, optimiert, Reasoning verbessert
2026-04: Llama 4    → Scout & Maverick (MoE, multimodal, bis 10M Kontext);
                       Behemoth noch im Training

Ökosystem

Llama hat das größte Ökosystem aller Open-Weight-Modelle:

BereichBeispiele
Fine-Tuned-Varianten>10.000 auf Hugging Face
SpezialisiertCode Llama, Llama Guard, Med-Llama
Inference-Enginesllama.cpp, vLLM, TGI, Ollama
Fine-Tuning-ToolsLoRA, QLoRA, Axolotl, Unsloth
QuantisierungGGUF, GPTQ, AWQ, EXL2

Lokal betreiben

# Mit Ollama (2 Befehle)
ollama pull llama4
ollama run llama4 "Erkläre Transformer in 3 Sätzen"

# Als API-Server
ollama serve  # localhost:11434 – OpenAI-kompatible API

Llama vs. andere Open-Weight-Modelle

ModellAnbieterStärkeSchwäche
Llama 4MetaAllround, MoE, ÖkosystemNicht vollständig offen
Mistral Large 3MistralEffizienz, EUKleineres Ökosystem
Qwen 3AlibabaMehrsprachig, CodeWeniger westliche Community
Gemma 3GoogleKompakt, effizientNur kleine Größen
DeepSeek R1DeepSeekReasoningPrimär Reasoning-fokussiert

Llama ist wie ein Lehrbuch, das kostenlos an alle verteilt wird: Jeder kann daraus lernen, es kopieren und für eigene Zwecke anpassen – während proprietäre Modelle wie GPT eher einem kostenpflichtigen Kurs entsprechen.

Open-Weight-Modell: Gewichte frei verfügbar für Forschung und kommerzielle Nutzung

Aktuelle Generation Llama 4 (2026): Mixture-of-Experts, nativ multimodal, sehr langes Kontextfenster

Riesiges Ökosystem: Tausende Fine-Tuned-Varianten auf Hugging Face

Self-Hosted LLM

Llama auf eigener Infrastruktur betreiben für Datenschutz und Kostenkontrolle

Custom Fine-Tuning

Llama auf domänenspezifische Daten anpassen (Medizin, Recht, Code)

Forschung

Offene Gewichte ermöglichen akademische Forschung zu Interpretierbarkeit und Sicherheit

Edge Deployment

Kleine Llama-Varianten (1B, 3B) auf Mobilgeräten und Edge-Hardware

Ist Llama wirklich Open Source?

Streng genommen nein: Die Gewichte sind offen (Open Weight), aber Trainingsdaten und vollständiger Trainingscode sind nicht veröffentlicht. Die Meta Community License erlaubt kommerzielle Nutzung bis 700M monatliche Nutzer.

Welche Llama-Version sollte ich verwenden?

Aktuell (2026): Llama 4 Maverick für beste Allround-Qualität, Llama 4 Scout für günstigere Inferenz und sehr langen Kontext. Das größte Modell Llama 4 Behemoth befand sich Mitte 2026 noch im Training. Für kleinere/Edge-Setups bleiben die Llama-3.x-Modelle (3B/8B) eine gute Wahl; dazu gibt es spezialisierte Varianten wie Code Llama und Llama Guard.

Wie vergleicht sich Llama mit den proprietären Spitzenmodellen?

Llama 4 Maverick schlägt in seiner Klasse Modelle wie GPT-4o und Gemini 2.0 Flash bei vielen Benchmarks. An die jeweils aktuellen Flaggschiffe (GPT-5.6 Sol, Gemini 3.5, Claude Opus 4.8) reicht es nicht überall heran, bietet dafür aber volle Kontrolle, Datenschutz und keine API-Kosten.

Dein persönliches Share-Bild für Instagram – 1080×1080px, bereit zum Posten.