Trainingsdaten

Die Beispiele, aus denen ein Modell Fähigkeiten und Verzerrungen lernt

Die Datensätze, mit denen KI-Modelle trainiert werden – sie bestimmen maßgeblich, was ein Modell lernt, wie gut es funktioniert und welche Verzerrungen es aufweist.

Einsteiger3 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Grundlage jedes KI-Modells – die Qualität der Daten bestimmt die Qualität des Modells
  2. Umfasst Texte, Bilder, Audio oder andere Daten, aus denen das Modell Muster lernt
  3. Bias in Trainingsdaten führt zu Bias in den Ergebnissen des Modells

Sofortantwort

Trainingsdaten einfach erklärt

Datensätze, die das Lernen und die Leistung von Modellen bestimmen.

Kurz gesagt
Grundlage jedes KI-Modells – die Qualität der Daten bestimmt die Qualität des Modells
Typischer Einsatz
LLM Pre-Training, Bilderkennung, Spracherkennung
Wichtig zu wissen
Bias in Trainingsdaten führt zu Bias in den Ergebnissen des Modells

Trainingsdaten im Überblick

Trainingsdaten sind die Informationen, aus denen ein KI-Modell lernt. So wie ein Mensch aus Erfahrungen und Büchern lernt, lernt eine KI aus den Daten, die ihr zum Training gegeben werden. Die Qualität und Quantität der Trainingsdaten ist oft wichtiger als die Wahl des Modells oder der Architektur. Ein einfaches Modell mit exzellenten Daten schlägt regelmäßig ein komplexes Modell mit schlechten Daten. Das Sammeln, Bereinigen und Annotieren von Trainingsdaten ist deshalb oft der aufwändigste Teil eines KI-Projekts. Für Foundation Models wurden Billionen von Tokens aus dem Internet gesammelt. Für spezialisierte Anwendungen reichen oft wenige tausend hochwertiger Beispiele – wenn sie sorgfältig kuratiert und gelabelt sind. Datenschutz und Urheberrecht sind dabei wichtige rechtliche Rahmenbedingungen.

Warum sind Trainingsdaten so wichtig?

  • Garbage In, Garbage Out: Schlechte Daten = schlechtes Modell
  • Bias: Einseitige Daten führen zu einseitigen Ergebnissen
  • Abdeckung: Das Modell kann nur lernen, was in den Daten vorkommt
  • Aktualität: Veraltete Daten führen zu veralteten Antworten

Arten von Trainingsdaten:

TypBeschreibungBeispiel
GelabeltDaten mit korrekter AntwortBild + Label “Katze”
UngelabeltRohdaten ohne AnnotationMillionen Webseiten
SynthetischKI-generierte TrainingsdatenVon GPT-5 erzeugte Beispiele
KuratiertManuell ausgewählte, hochwertige DatenInstruction-Datensätze

Für LLMs:

Moderne LLMs werden auf riesigen Textmengen trainiert:

  • GPT-5: Geschätzt 13+ Billionen Tokens
  • Llama 4: 15+ Billionen Tokens
  • Das entspricht Millionen von Büchern

Technisch betrachtet

Datenquellen für LLMs

Web-Daten:

  • Common Crawl: Petabytes an Webseiten
  • Filterung nötig: Spam, Duplikate, toxische Inhalte entfernen
  • Qualitätsfilter: Perplexity-basiert, Classifier-basiert

Kuratierte Quellen:

  • Wikipedia: Hohe Qualität, aber begrenzt
  • Bücher: Project Gutenberg, Books3 (rechtlich umstritten)
  • Wissenschaftliche Paper: ArXiv, PubMed, Semantic Scholar
  • Code: GitHub, Stack Overflow

Synthetische Daten:

  • Von stärkeren Modellen generierte Trainingsdaten
  • Beispiel: GPT-5 generiert Instruction-Daten für kleinere Modelle
  • Vorsicht: “Model Collapse” bei zu vielen synthetischen Daten

Datenaufbereitung

1. Sammlung und Filterung:

  • Deduplizierung (MinHash, SimHash)
  • Qualitätsfilterung (Perplexity, Textlänge, Sprache)
  • Toxizitätsfilterung (Classifier-basiert)
  • PII-Entfernung (persönliche Daten)

2. Tokenisierung:

  • Text in Tokens umwandeln
  • Tokenizer auf dem Datensatz trainieren (BPE, SentencePiece)
  • Spezielle Tokens hinzufügen (BOS, EOS, PAD)

3. Datenmischung:

  • Verschiedene Quellen in bestimmten Verhältnissen mischen
  • Beispiel: 50% Web, 25% Bücher, 15% Code, 10% Wissenschaft
  • Die Mischung beeinflusst die Stärken des Modells

Datenqualität vs. Quantität

Datenqualität schlägt Menge – dafür stehen zwei bekannte Beispiele:

Phi-Modelle (Microsoft):

  • Kleine Modelle (1.3B-14B Parameter) mit hochwertigen Daten
  • Konkurrieren mit deutlich größeren Modellen
  • “Textbook-quality” Daten als Schlüssel

LIMA-Paper:

  • Nur 1.000 sorgfältig kuratierte Beispiele für Fine-Tuning
  • Ergebnisse vergleichbar mit RLHF auf großen Datensätzen
  • “Less Is More for Alignment”

Bias und Fairness

Quellen von Bias:

  • Repräsentations-Bias: Bestimmte Gruppen sind über-/unterrepräsentiert
  • Historischer Bias: Daten spiegeln historische Ungleichheiten wider
  • Measurement Bias: Fehlerhafte Datenerhebung
  • Aggregation Bias: Unterschiede zwischen Subgruppen werden ignoriert

Gegenmaßnahmen:

  • Diverse und repräsentative Datensätze zusammenstellen
  • Bias-Audits vor und nach dem Training
  • Debiasing-Techniken (Counterfactual Data Augmentation)
  • Transparenz über Datenquellen und -zusammensetzung

Rechtliche Aspekte

  • Urheberrecht: Nutzung urheberrechtlich geschützter Texte für Training ist rechtlich umstritten
  • DSGVO: Personenbezogene Daten in Trainingsdaten sind problematisch
  • Opt-Out: Einige Anbieter bieten Opt-Out-Möglichkeiten für Webseitenbetreiber
  • Transparenz: EU AI Act fordert Offenlegung der Trainingsdaten für bestimmte Modelle

Schritt für Schritt

Trainingsdaten verantwortungsvoll aufbauen

Gute Daten sind nicht nur groß. Sie sind für die Aufgabe passend, nachvollziehbar, rechtlich geklärt und auf ihre Verzerrungen geprüft.

  1. Ziel und Datenbedarf bestimmen

    Planung

    Das Team leitet aus der Aufgabe ab, welche Fälle, Gruppen, Zeiträume und Zielwerte im Datensatz vorkommen müssen.

    Aufgabe → Datenanforderungen
  2. Herkunft und Rechte prüfen

    Governance

    Quellen, Lizenzen, Datenschutz, Einwilligungen und Aufbewahrungsregeln werden dokumentiert, bevor Daten verwendet werden.

    Quelle → Zweck + Rechtsgrundlage
  3. Bereinigen und annotieren

    Qualität

    Duplikate, Fehler und sensible Inhalte werden behandelt. Labelregeln schaffen eine einheitliche fachliche Bedeutung.

    Rohdaten → geprüfte Beispiele
  4. Abdeckung messen und pflegen

    Monitoring

    Tests auf Repräsentativität, Datenlücken und zeitliche Veränderungen begleiten den Datensatz auch nach dem ersten Training.

    Datensatz → Audit → Aktualisierung

Konkretes Beispiel

Beispiel: Bilder für eine Qualitätsprüfung

Ein Betrieb will Fehler auf Produktfotos erkennen.

Bequeme Stichprobe

Die Trainingsbilder stammen fast nur aus einer Produktionslinie bei gutem Licht. Andere Varianten fehlen.

Geplanter Datensatz

Das Team erfasst unterschiedliche Linien, Lichtbedingungen, Kameras und seltene Fehler. Fachleute dokumentieren die Labels und bewahren Testdaten getrennt auf.

Ein Modell kann nur auf Varianten zuverlässig reagieren, die in Daten und Evaluation ausreichend repräsentiert sind.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Passende Daten sind oft der stärkste Hebel für Modellqualität.
  • Klare Herkunft und Dokumentation machen Risiken prüfbar.
  • Gute Labelrichtlinien verbinden Fachwissen direkt mit dem Modell.
  • Getrennte Testdaten ermöglichen realistischere Qualitätsaussagen.

Das solltest du beachten

  • Sammlung, Rechteklärung und Annotation sind zeit- und kostenintensiv.
  • Historische Daten können Fehler und gesellschaftliche Verzerrungen enthalten.
  • Seltene, aber kritische Fälle sind häufig unterrepräsentiert.
  • Daten werden mit der Zeit unpassend, wenn sich das Umfeld verändert.
Vertiefung · für Fortgeschrittene

Vom Rohmaterial zum trainierbaren Datensatz

Datenqualität entsteht entlang einer Kette aus Herkunft, Bearbeitung und Prüfung.

Wissenskarte

Beispiele gestalten

Datenquellen
Zentrales Verzeichnis aller Datenbestände mit Metadaten und Beschreibungen.
Rechte
Der Schutz personenbezogener Daten im Kontext der DSGVO bei KI.
Bereinigung
Aufbereitung von Rohdaten in eine für ML-Modelle nutzbare Form.
Labeling
Das Beschriften von Datenpunkten mit Kategorien oder Tags.
Splits
Verfahren zur zuverlässigen Schätzung der Modellleistung durch mehrfache Datenaufteilung.
Datenaudit
Messung und Sicherstellung der Qualität von Daten.
Die Auswahl dessen, was im Datensatz fehlt, ist für die spätere Modellqualität oft ebenso wichtig wie die Auswahl dessen, was enthalten ist. Trainingsdaten gliedert sich in: Datenquellen, Rechte, Bereinigung, Labeling, Splits, Datenaudit.

01Einsatzbereiche

Wann ist Trainingsdaten sinnvoll?

Geeignet für

  • LLM Pre-TrainingBillionen von Tokens aus dem Internet, Büchern und Code für das Training von Sprachmodellen
  • BilderkennungMillionen gelabelter Bilder für das Training von Computer-Vision-Modellen
  • SpracherkennungTausende Stunden transkribierter Sprache für Speech-to-Text-Modelle
  • Fine-Tuning-DatensätzeKuratierte Instruction-Response-Paare für die Spezialisierung von Modellen

↑ Inhalt

02Werkzeuge

Womit Trainingsdaten umgesetzt wird

↑ Inhalt

Merksatz

Trainingsdaten sind wie die Lehrbücher eines Studenten

Die Qualität und Vielfalt der Bücher bestimmt, wie gut und breit gefächert das Wissen ist. Fehlerhafte Lehrbücher führen zu falschem Wissen.

  1. Grundlage jedes KI-Modells – die Qualität der Daten bestimmt die Qualität des Modells
  2. Umfasst Texte, Bilder, Audio oder andere Daten, aus denen das Modell Muster lernt
  3. Bias in Trainingsdaten führt zu Bias in den Ergebnissen des Modells

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Trainingsdaten spielt.

↑ Inhalt

04Anwenden

Trainingsdaten praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Trainingsdaten

Wie viele Trainingsdaten braucht ein KI-Modell?

Das variiert enorm. Klassisches ML kann mit hunderten Datenpunkten funktionieren. LLMs werden auf Billionen von Tokens trainiert. Für Fine-Tuning reichen oft 100-10.000 Beispiele. Generell gilt: Qualität ist wichtiger als Quantität.

Woher kommen die Trainingsdaten für LLMs?

Hauptsächlich aus dem Internet (Common Crawl), Büchern (Books3), Wikipedia, Code-Repositories (GitHub), wissenschaftlichen Papern und kuratierten Datensätzen. Die genaue Zusammensetzung ist bei kommerziellen Modellen oft nicht öffentlich.

Was ist Daten-Bias?

Wenn Trainingsdaten bestimmte Gruppen, Perspektiven oder Themen über- oder unterrepräsentieren, lernt das Modell diese Verzerrung. Beispiel: Ein Modell, das hauptsächlich auf englischen Texten trainiert wurde, versteht Deutsch schlechter.

Darf man beliebige Daten zum Training verwenden?

Nein. Urheberrecht, Datenschutz (DSGVO) und Lizenzbedingungen müssen beachtet werden. Die rechtliche Lage ist noch in Entwicklung – mehrere Klagen gegen KI-Unternehmen wegen Urheberrechtsverletzungen sind anhängig.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Data Governance

    Framework für Datenqualität, Sicherheit und Compliance.

  • Technisch vertiefen

    Labeling

    Das Beschriften von Datenpunkten mit Kategorien oder Tags.

  • In der Praxis anwenden

    Fine-Tuning in der Praxis

    Wann lohnt sich Fine-Tuning wirklich – und wie setzt du es in der Praxis um?

↑ Inhalt