<EbeneX/>
DevOps Daten · Updated 1. Juli 2026

Apache Kafka

Definition

Eine verteilte Streaming-Plattform für zeitnahe Datenströme zwischen Systemen – häufig genutzt in ML-Pipelines, Feature Stores und Event-Driven Architectures.

Experte 2 Min. Lesezeit EN: Apache Kafka

Einfach erklärt

Apache Kafka ist eine verteilte Streaming-Plattform, die Datenströme zeitnah zwischen Systemen transportiert. Sie wird breit in Dateninfrastruktur, Event-Driven Architectures und Streaming-Analytics eingesetzt.

Kernkonzepte:

  • Topic: Ein benannter Datenstrom (z. B. „user-clicks”, „model-predictions”)
  • Producer: Schreibt Events in Topics
  • Consumer: Liest Events aus Topics
  • Partition: Topics werden aufgeteilt für Parallelität
  • Consumer Group: Mehrere Consumer teilen sich die Last
Producer A ──▶ ┌─────────────────┐ ──▶ Consumer 1 (ML-Modell)
Producer B ──▶ │  Topic: events  │ ──▶ Consumer 2 (Dashboard)
Producer C ──▶ │  (3 Partitions) │ ──▶ Consumer 3 (Data Lake)
               └─────────────────┘

Kafka in ML-Architekturen

Use CasePattern
Zeitnahe InferenzRequest → Kafka → Model Service → Kafka → Response
Feature StoreRaw Events → Kafka → Feature Computation → Store
MonitoringPredictions → Kafka → Drift Detection → Alert
RetrainingKafka Topics als Training-Data-Source

Alternativen

ToolStärkeSchwäche
KafkaDurchsatz, Persistenz, ÖkosystemBetriebsaufwand
RabbitMQRouting, Job-Queues, Einfachheitweniger Fokus auf Replay-Logs
Redis Streamsniedrige Latenz und einfache Integrationandere Persistenz- und Skalierungsprofile
Kafka-kompatible Alternativenähnliche APIs, oft vereinfachter BetriebÖkosystem und Feature-Abdeckung prüfen
Managed StreamsBetrieb ausgelagertAnbieterbindung und Kostenmodell prüfen

Kafka ist wie ein Förderband in einer Fabrik: Daten werden am einen Ende aufgelegt und von mehreren Stationen abgegriffen – mit Persistenz, Reihenfolge innerhalb von Partitionen und kontrollierter Verarbeitung.

Kann sehr hohe Event-Durchsätze mit niedriger Latenz ermöglichen

Persistente Event-Logs für Replay, Integration und Audit-Szenarien

Wichtiger Baustein für Streaming-ML-Pipelines und Feature-Engineering

Echtzeit-Feature-Engineering

Features für ML-Modelle zeitnah aus Streaming-Daten berechnen

Model Serving Pipeline

Inferenz-Anfragen über Kafka verteilen und Ergebnisse asynchron zurückliefern

Data Integration

Daten aus verschiedenen Quellen (Datenbanken, APIs, IoT) in einem zentralen Stream bündeln

Wann brauche ich Kafka statt einer normalen Message Queue?

Wenn hoher Durchsatz, persistente Logs, Replay-Fähigkeit oder mehrere unabhängige Consumer für dieselben Daten wichtig sind. Für einfache Job-Queues können leichtere Message-Queues oft ausreichen.

Ist Kafka schwer zu betreiben?

Self-Hosted Kafka kann komplex sein, etwa wegen Partitionierung, Replikation, Skalierung und Betrieb. Managed Services oder Kafka-kompatible Alternativen können den Betrieb vereinfachen, bringen aber eigene Abhängigkeiten mit.

Wie nutzen ML-Teams Kafka?

Für zeitnahe Feature-Pipelines, Streaming-Inferenz, Model-Monitoring und als Event-Quelle für Trainingsdaten- oder Analyse-Pipelines.

Dein persönliches Share-Bild für Instagram – 1080×1080px, bereit zum Posten.