Federated Learning

Wie Modelle aus verteilten Daten lernen können, ohne alle Rohdaten an einem Ort zusammenzuführen

Eine Trainingsmethode, bei der das Modell zu den Daten kommt statt umgekehrt – Daten bleiben lokal, nur Modell-Updates werden geteilt.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Daten bleiben auf dem Gerät/Server – nur Modell-Gradienten werden geteilt
  2. Ideal für datenschutzsensible Bereiche: Medizin, Finanzen, Mobile
  3. Google nutzt es für Gboard (Tastatur-Vorhersagen) ohne Nutzerdaten zu sammeln

Sofortantwort

Federated Learning einfach erklärt

Das Modell bleibt lokal und erhält nur Updates.

Kurz gesagt
Daten bleiben auf dem Gerät/Server – nur Modell-Gradienten werden geteilt
Typischer Einsatz
Medizin, Mobile Keyboards, Finanzsektor
Wichtig zu wissen
Google nutzt es für Gboard (Tastatur-Vorhersagen) ohne Nutzerdaten zu sammeln

Federated Learning im Überblick

Federated Learning ist eine Trainingsmethode, bei der das Modell zu den Daten kommt – nicht umgekehrt. Die Daten bleiben lokal, nur Modell-Updates werden geteilt.

Warum ist das wichtig?

In vielen Bereichen (Medizin, Finanzen, Mobile) dürfen Daten nicht zentralisiert werden. Federated Learning ermöglicht trotzdem gemeinsames Training.

Zentral:     [Daten A] + [Daten B] + [Daten C] → Server → Modell
Federated:   [Daten A → Update A] ↘
             [Daten B → Update B] → Server aggregiert → Globales Modell
             [Daten C → Update C] ↗

Praxis-Beispiel: Google nutzt Federated Learning für Gboard (Tastatur-Vorhersagen) – das Modell lernt aus deinem Tippverhalten, ohne dass deine Eingaben an Google gesendet werden.

Technisch betrachtet

FedAvg (Federated Averaging)

  1. Server sendet globales Modell an alle Clients
  2. Jeder Client trainiert lokal auf eigenen Daten
  3. Clients senden Modell-Updates (Gradienten) zurück
  4. Server mittelt die Updates → neues globales Modell
  5. Wiederholen

Herausforderungen

  • Non-IID Data: Daten sind ungleich verteilt (ein Krankenhaus hat andere Krankheiten als ein anderes)
  • Communication Cost: Modell-Updates sind groß → Kompression nötig
  • Stragglers: Langsame Clients bremsen das Training
  • Privacy Attacks: Gradient Inversion kann Trainingsdaten rekonstruieren

Praxisbeispiele

  1. Gesundheitswesen: Verschiedene Krankenhäuser können ihre Patientendaten nutzen, um ein gemeinsames Modell zur Krankheitsvorhersage zu trainieren, ohne sensible Daten zu teilen.

  2. Smartphones: Mobile Geräte können lokale Tastatureingaben verwenden, um ein personalisiertes Sprachmodell zu trainieren, das die Privatsphäre der Nutzer respektiert.

  3. Finanzsektor: Banken können gemeinsam an einem Modell zur Betrugserkennung arbeiten, ohne dass Kundendaten das jeweilige Institut verlassen.

Vor- und Nachteile

Vorteile

  • Datenschutz: Daten bleiben lokal und werden nicht zentralisiert, was die Privatsphäre der Nutzer schützt.
  • Skalierbarkeit: Das Training kann auf einer Vielzahl von Geräten erfolgen, was die Rechenlast verteilt.
  • Vielfalt der Daten: Das Modell profitiert von einer breiteren Datenbasis, ohne dass Daten aggregiert werden müssen.

Nachteile

  • Komplexität: Die Implementierung von Federated Learning erfordert spezielle Algorithmen und Infrastruktur.
  • Latenz: Die Kommunikation zwischen Clients und Server kann zeitaufwendig sein, insbesondere bei großen Modellen.
  • Ungleichgewicht: Unterschiede in den Datenverteilungen können die Modellleistung beeinträchtigen.

Historischer Kontext

Federated Learning wurde erstmals 2016 von Google eingeführt, um maschinelles Lernen auf mobilen Geräten zu ermöglichen, ohne dass persönliche Daten die Geräte verlassen. Diese Methode hat sich seitdem weiterentwickelt und findet Anwendung in verschiedenen Bereichen, von der Gesundheitsforschung bis hin zu Finanzdienstleistungen. Die wachsende Bedeutung von Datenschutz und Datensicherheit hat das Interesse an Federated Learning in den letzten Jahren erheblich gesteigert.

Schritt für Schritt

Wie verteiltes Lernen verantwortbar vorbereitet wird

  1. Nutzen und Datenverteilung prüfen

    Kläre, ob Daten tatsächlich an unterschiedlichen Orten bleiben müssen und ob die beteiligten Umgebungen eine sinnvolle gemeinsame Lernaufgabe haben. Verteiltes Lernen löst keine unklare Datenqualität oder fehlende Rechtsgrundlage.

  2. Lokales Training und Aggregation gestalten

    Definiere, welche Modellupdates erzeugt, übertragen und zusammengeführt werden. Berücksichtige ungleiche Datenverteilungen, Ausfälle und die Möglichkeit, dass Updates selbst sensible oder manipulierte Informationen enthalten.

  3. Schutz und Prüfung mehrschichtig ergänzen

    Kombiniere sichere Übertragung, Zugriffskontrolle, Aggregationsschutz und gegebenenfalls weitere Datenschutzverfahren. Prüfe zudem, wie manipulierte oder fehlerhafte Beiträge erkannt und begrenzt werden können.

  4. Wirkung über alle Beteiligten bewerten

    Bewerte Qualität und mögliche Nachteile nicht nur im Durchschnitt, sondern auch für unterschiedliche Datenquellen und Gruppen. Transparente Regeln für Teilnahme, Updates und Rückzug schaffen verantwortbare Zusammenarbeit.

Konkretes Beispiel

Mehrere Standorte verbessern ein gemeinsames Modell

Mehrere Organisationseinheiten möchten ein Modell für wiederkehrende Abläufe verbessern. Rohdaten sollen aus Schutz- und Governance-Gründen bei den jeweiligen Einheiten bleiben.

Zentraler Datenwunsch

Ein zentraler Datenspeicher würde die Auswertung erleichtern, erhöht aber Zugriffs-, Transfer- und Verantwortungsfragen. Zudem unterscheiden sich die Daten der Standorte deutlich voneinander.

Verteilte Zusammenarbeit

Jede Einheit trainiert nach vereinbarten Regeln lokal; nur geschützte Updates fließen in die Aggregation. Das Team prüft Qualität, Unterschiede und mögliche Angriffe fortlaufend und hält Austritt oder Pausen technisch möglich.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Kann gemeinsame Modellverbesserung ermöglichen, ohne alle Rohdaten zentral zu sammeln.
  • Macht Datenlokalität und Verantwortung der beteiligten Einheiten besser vereinbar.
  • Unterstützt verteilte Lernaufgaben, wenn Schutz, Qualität und Governance gemeinsam geplant werden.

Das solltest du beachten

  • Modellupdates können weiterhin sensible Informationen oder manipulative Beiträge enthalten.
  • Unterschiedliche Datenquellen und schwankende Verfügbarkeit erschweren Training und Bewertung.
  • Federated Learning ersetzt keine Einwilligung, Zweckbindung oder rechtliche Prüfung der Zusammenarbeit.
Vertiefung · für Fortgeschrittene

Lokale Daten, gemeinsames Lernen

Wissenskarte

Verteilte Updates

Differential Privacy
Ein Framework, das individuelle Rückschlüsse aus Datenanalysen verhindert.
Data Residency
Anforderung, Daten in bestimmten geografischen Regionen zu speichern.
Data Governance
Framework für Datenqualität, Sicherheit und Compliance.
Model Risk Management
Systematisches Management von Risiken durch ML-Modelle in Produktion.
Security
Schutz von Systemen, Daten und Anwendungen vor Angriffen und Ausfall.
Federated Learning verbindet lokale Datenhaltung mit kontrollierter Update-Aggregation und braucht zusätzliche Schutz-, Qualitäts- und Governance-Maßnahmen. Federated Learning gliedert sich in: Differential Privacy, Data Residency, Data Governance, Model Risk Management, Security.

01Einsatzbereiche

Wann ist Federated Learning sinnvoll?

Geeignet für

  • MedizinKrankenhäuser trainieren gemeinsam ein Diagnose-Modell ohne Patientendaten zu teilen
  • Mobile KeyboardsTastatur-Vorhersagen verbessern ohne Nutzereingaben an Server zu senden
  • FinanzsektorBanken erkennen gemeinsam Betrug ohne Transaktionsdaten auszutauschen

↑ Inhalt

02Werkzeuge

Womit Federated Learning umgesetzt wird

↑ Inhalt

Merksatz

Federated Learning ist wie eine Studie mit mehreren Krankenhäusern

Kein Krankenhaus gibt Patientendaten heraus. Stattdessen trainiert jedes lokal und teilt nur die Erkenntnisse (Modell-Updates).

  1. Daten bleiben auf dem Gerät/Server – nur Modell-Gradienten werden geteilt
  2. Ideal für datenschutzsensible Bereiche: Medizin, Finanzen, Mobile
  3. Google nutzt es für Gboard (Tastatur-Vorhersagen) ohne Nutzerdaten zu sammeln

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

Quellen (1)

↑ Inhalt

05FAQ

Häufige Fragen zu Federated Learning

Ist Federated Learning wirklich privat?

Besser als zentrales Training, aber nicht perfekt. Aus Modell-Updates können theoretisch Informationen über die Daten rekonstruiert werden. Kombination mit Differential Privacy erhöht den Schutz.

Ist Federated Learning langsamer?

Ja, durch Kommunikations-Overhead und heterogene Datenverteilung. Aber für datenschutzsensible Anwendungen ist es oft die einzige Option.

Wie wird die Privatsphäre der Daten im Federated Learning gewährleistet?

Im Federated Learning bleiben die Daten lokal auf den Geräten der Nutzer. Nur die Modell-Updates, die aus den lokalen Daten abgeleitet werden, werden an den zentralen Server gesendet, wodurch die Privatsphäre der Daten geschützt bleibt.

Welche Anwendungsfälle eignen sich besonders gut für Federated Learning?

Federated Learning ist besonders nützlich in Bereichen wie Gesundheitswesen, wo sensible Patientendaten nicht zentralisiert werden sollten, oder in mobilen Anwendungen, wo Nutzerdaten lokal verarbeitet werden müssen, um die Privatsphäre zu wahren.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt