Apache Kafka

Eine verteilte Streaming-Plattform für zeitnahe Datenströme zwischen Systemen – häufig genutzt in ML-Pipelines, Feature Stores und Event-Driven Architectures.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Kann sehr hohe Event-Durchsätze mit niedriger Latenz ermöglichen
  2. Persistente Event-Logs für Replay, Integration und Audit-Szenarien
  3. Wichtiger Baustein für Streaming-ML-Pipelines und Feature-Engineering

Sofortantwort

Apache Kafka einfach erklärt

Verteilte Streaming-Plattform für zeitnahe Datenverarbeitung.

Kurz gesagt
Kann sehr hohe Event-Durchsätze mit niedriger Latenz ermöglichen
Typischer Einsatz
Echtzeit-Feature-Engineering, Model Serving Pipeline, Data Integration
Wichtig zu wissen
Wichtiger Baustein für Streaming-ML-Pipelines und Feature-Engineering

Apache Kafka im Überblick

Apache Kafka ist eine verteilte Streaming-Plattform, die Datenströme zeitnah zwischen Systemen transportiert. Sie wird breit in Dateninfrastruktur, Event-Driven Architectures und Streaming-Analytics eingesetzt.

Kernkonzepte:

  • Topic: Ein benannter Datenstrom (z. B. „user-clicks”, „model-predictions”)
  • Producer: Schreibt Events in Topics
  • Consumer: Liest Events aus Topics
  • Partition: Topics werden aufgeteilt für Parallelität
  • Consumer Group: Mehrere Consumer teilen sich die Last
Producer A ──▶ ┌─────────────────┐ ──▶ Consumer 1 (ML-Modell)
Producer B ──▶ │  Topic: events  │ ──▶ Consumer 2 (Dashboard)
Producer C ──▶ │  (3 Partitions) │ ──▶ Consumer 3 (Data Lake)
               └─────────────────┘

Kafka in ML-Architekturen

Use CasePattern
Zeitnahe InferenzRequest → Kafka → Model Service → Kafka → Response
Feature StoreRaw Events → Kafka → Feature Computation → Store
MonitoringPredictions → Kafka → Drift Detection → Alert
RetrainingKafka Topics als Training-Data-Source

Alternativen

ToolStärkeSchwäche
KafkaDurchsatz, Persistenz, ÖkosystemBetriebsaufwand
RabbitMQRouting, Job-Queues, Einfachheitweniger Fokus auf Replay-Logs
Redis Streamsniedrige Latenz und einfache Integrationandere Persistenz- und Skalierungsprofile
Kafka-kompatible Alternativenähnliche APIs, oft vereinfachter BetriebÖkosystem und Feature-Abdeckung prüfen
Managed StreamsBetrieb ausgelagertAnbieterbindung und Kostenmodell prüfen

01Einsatzbereiche

Wann ist Apache Kafka sinnvoll?

Geeignet für

  • Echtzeit-Feature-EngineeringFeatures für ML-Modelle zeitnah aus Streaming-Daten berechnen
  • Model Serving PipelineInferenz-Anfragen über Kafka verteilen und Ergebnisse asynchron zurückliefern
  • Data IntegrationDaten aus verschiedenen Quellen (Datenbanken, APIs, IoT) in einem zentralen Stream bündeln

↑ Inhalt

02Werkzeuge

Womit Apache Kafka umgesetzt wird

↑ Inhalt

Merksatz

Kafka ist wie ein Förderband in einer Fabrik

Daten werden am einen Ende aufgelegt und von mehreren Stationen abgegriffen – mit Persistenz, Reihenfolge innerhalb von Partitionen und kontrollierter Verarbeitung.

  1. Kann sehr hohe Event-Durchsätze mit niedriger Latenz ermöglichen
  2. Persistente Event-Logs für Replay, Integration und Audit-Szenarien
  3. Wichtiger Baustein für Streaming-ML-Pipelines und Feature-Engineering

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Apache Kafka

Wann brauche ich Kafka statt einer normalen Message Queue?

Wenn hoher Durchsatz, persistente Logs, Replay-Fähigkeit oder mehrere unabhängige Consumer für dieselben Daten wichtig sind. Für einfache Job-Queues können leichtere Message-Queues oft ausreichen.

Ist Kafka schwer zu betreiben?

Self-Hosted Kafka kann komplex sein, etwa wegen Partitionierung, Replikation, Skalierung und Betrieb. Managed Services oder Kafka-kompatible Alternativen können den Betrieb vereinfachen, bringen aber eigene Abhängigkeiten mit.

Wie nutzen ML-Teams Kafka?

Für zeitnahe Feature-Pipelines, Streaming-Inferenz, Model-Monitoring und als Event-Quelle für Trainingsdaten- oder Analyse-Pipelines.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Event Sourcing

    Zustand als Sequenz von Events speichern und bei Bedarf rekonstruieren.

  • Technisch vertiefen

    Message Queue

    Warteschlange für asynchrone Service-Kommunikation.

↑ Inhalt