Sofortantwort
Trainingsdaten einfach erklärt
Datensätze, die das Lernen und die Leistung von Modellen bestimmen.
- Kurz gesagt
- Grundlage jedes KI-Modells – die Qualität der Daten bestimmt die Qualität des Modells
- Typischer Einsatz
- LLM Pre-Training, Bilderkennung, Spracherkennung
- Wichtig zu wissen
- Bias in Trainingsdaten führt zu Bias in den Ergebnissen des Modells
Trainingsdaten im Überblick
Trainingsdaten sind die Informationen, aus denen ein KI-Modell lernt. So wie ein Mensch aus Erfahrungen und Büchern lernt, lernt eine KI aus den Daten, die ihr zum Training gegeben werden. Die Qualität und Quantität der Trainingsdaten ist oft wichtiger als die Wahl des Modells oder der Architektur. Ein einfaches Modell mit exzellenten Daten schlägt regelmäßig ein komplexes Modell mit schlechten Daten. Das Sammeln, Bereinigen und Annotieren von Trainingsdaten ist deshalb oft der aufwändigste Teil eines KI-Projekts. Für Foundation Models wurden Billionen von Tokens aus dem Internet gesammelt. Für spezialisierte Anwendungen reichen oft wenige tausend hochwertiger Beispiele – wenn sie sorgfältig kuratiert und gelabelt sind. Datenschutz und Urheberrecht sind dabei wichtige rechtliche Rahmenbedingungen.
Warum sind Trainingsdaten so wichtig?
- Garbage In, Garbage Out: Schlechte Daten = schlechtes Modell
- Bias: Einseitige Daten führen zu einseitigen Ergebnissen
- Abdeckung: Das Modell kann nur lernen, was in den Daten vorkommt
- Aktualität: Veraltete Daten führen zu veralteten Antworten
Arten von Trainingsdaten:
| Typ | Beschreibung | Beispiel |
|---|---|---|
| Gelabelt | Daten mit korrekter Antwort | Bild + Label “Katze” |
| Ungelabelt | Rohdaten ohne Annotation | Millionen Webseiten |
| Synthetisch | KI-generierte Trainingsdaten | Von GPT-5 erzeugte Beispiele |
| Kuratiert | Manuell ausgewählte, hochwertige Daten | Instruction-Datensätze |
Für LLMs:
Moderne LLMs werden auf riesigen Textmengen trainiert:
- GPT-5: Geschätzt 13+ Billionen Tokens
- Llama 4: 15+ Billionen Tokens
- Das entspricht Millionen von Büchern
Technisch betrachtet
Datenquellen für LLMs
Web-Daten:
- Common Crawl: Petabytes an Webseiten
- Filterung nötig: Spam, Duplikate, toxische Inhalte entfernen
- Qualitätsfilter: Perplexity-basiert, Classifier-basiert
Kuratierte Quellen:
- Wikipedia: Hohe Qualität, aber begrenzt
- Bücher: Project Gutenberg, Books3 (rechtlich umstritten)
- Wissenschaftliche Paper: ArXiv, PubMed, Semantic Scholar
- Code: GitHub, Stack Overflow
Synthetische Daten:
- Von stärkeren Modellen generierte Trainingsdaten
- Beispiel: GPT-5 generiert Instruction-Daten für kleinere Modelle
- Vorsicht: “Model Collapse” bei zu vielen synthetischen Daten
Datenaufbereitung
1. Sammlung und Filterung:
- Deduplizierung (MinHash, SimHash)
- Qualitätsfilterung (Perplexity, Textlänge, Sprache)
- Toxizitätsfilterung (Classifier-basiert)
- PII-Entfernung (persönliche Daten)
2. Tokenisierung:
- Text in Tokens umwandeln
- Tokenizer auf dem Datensatz trainieren (BPE, SentencePiece)
- Spezielle Tokens hinzufügen (BOS, EOS, PAD)
3. Datenmischung:
- Verschiedene Quellen in bestimmten Verhältnissen mischen
- Beispiel: 50% Web, 25% Bücher, 15% Code, 10% Wissenschaft
- Die Mischung beeinflusst die Stärken des Modells
Datenqualität vs. Quantität
Datenqualität schlägt Menge – dafür stehen zwei bekannte Beispiele:
Phi-Modelle (Microsoft):
- Kleine Modelle (1.3B-14B Parameter) mit hochwertigen Daten
- Konkurrieren mit deutlich größeren Modellen
- “Textbook-quality” Daten als Schlüssel
LIMA-Paper:
- Nur 1.000 sorgfältig kuratierte Beispiele für Fine-Tuning
- Ergebnisse vergleichbar mit RLHF auf großen Datensätzen
- “Less Is More for Alignment”
Bias und Fairness
Quellen von Bias:
- Repräsentations-Bias: Bestimmte Gruppen sind über-/unterrepräsentiert
- Historischer Bias: Daten spiegeln historische Ungleichheiten wider
- Measurement Bias: Fehlerhafte Datenerhebung
- Aggregation Bias: Unterschiede zwischen Subgruppen werden ignoriert
Gegenmaßnahmen:
- Diverse und repräsentative Datensätze zusammenstellen
- Bias-Audits vor und nach dem Training
- Debiasing-Techniken (Counterfactual Data Augmentation)
- Transparenz über Datenquellen und -zusammensetzung
Rechtliche Aspekte
- Urheberrecht: Nutzung urheberrechtlich geschützter Texte für Training ist rechtlich umstritten
- DSGVO: Personenbezogene Daten in Trainingsdaten sind problematisch
- Opt-Out: Einige Anbieter bieten Opt-Out-Möglichkeiten für Webseitenbetreiber
- Transparenz: EU AI Act fordert Offenlegung der Trainingsdaten für bestimmte Modelle
Schritt für Schritt
Trainingsdaten verantwortungsvoll aufbauen
Gute Daten sind nicht nur groß. Sie sind für die Aufgabe passend, nachvollziehbar, rechtlich geklärt und auf ihre Verzerrungen geprüft.
Ziel und Datenbedarf bestimmen
Planung
Das Team leitet aus der Aufgabe ab, welche Fälle, Gruppen, Zeiträume und Zielwerte im Datensatz vorkommen müssen.
Aufgabe → DatenanforderungenHerkunft und Rechte prüfen
Governance
Quellen, Lizenzen, Datenschutz, Einwilligungen und Aufbewahrungsregeln werden dokumentiert, bevor Daten verwendet werden.
Quelle → Zweck + RechtsgrundlageBereinigen und annotieren
Qualität
Duplikate, Fehler und sensible Inhalte werden behandelt. Labelregeln schaffen eine einheitliche fachliche Bedeutung.
Rohdaten → geprüfte BeispieleAbdeckung messen und pflegen
Monitoring
Tests auf Repräsentativität, Datenlücken und zeitliche Veränderungen begleiten den Datensatz auch nach dem ersten Training.
Datensatz → Audit → Aktualisierung
Konkretes Beispiel
Beispiel: Bilder für eine Qualitätsprüfung
Ein Betrieb will Fehler auf Produktfotos erkennen.
Bequeme Stichprobe
Die Trainingsbilder stammen fast nur aus einer Produktionslinie bei gutem Licht. Andere Varianten fehlen.
Geplanter Datensatz
Das Team erfasst unterschiedliche Linien, Lichtbedingungen, Kameras und seltene Fehler. Fachleute dokumentieren die Labels und bewahren Testdaten getrennt auf.
Ein Modell kann nur auf Varianten zuverlässig reagieren, die in Daten und Evaluation ausreichend repräsentiert sind.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Passende Daten sind oft der stärkste Hebel für Modellqualität.
- Klare Herkunft und Dokumentation machen Risiken prüfbar.
- Gute Labelrichtlinien verbinden Fachwissen direkt mit dem Modell.
- Getrennte Testdaten ermöglichen realistischere Qualitätsaussagen.
Das solltest du beachten
- Sammlung, Rechteklärung und Annotation sind zeit- und kostenintensiv.
- Historische Daten können Fehler und gesellschaftliche Verzerrungen enthalten.
- Seltene, aber kritische Fälle sind häufig unterrepräsentiert.
- Daten werden mit der Zeit unpassend, wenn sich das Umfeld verändert.
Vertiefung · für FortgeschritteneVom Rohmaterial zum trainierbaren Datensatz
Datenqualität entsteht entlang einer Kette aus Herkunft, Bearbeitung und Prüfung.
Beispiele gestalten
- Datenquellen
- Zentrales Verzeichnis aller Datenbestände mit Metadaten und Beschreibungen.
- Rechte
- Der Schutz personenbezogener Daten im Kontext der DSGVO bei KI.
- Bereinigung
- Aufbereitung von Rohdaten in eine für ML-Modelle nutzbare Form.
- Labeling
- Das Beschriften von Datenpunkten mit Kategorien oder Tags.
- Splits
- Verfahren zur zuverlässigen Schätzung der Modellleistung durch mehrfache Datenaufteilung.
- Datenaudit
- Messung und Sicherstellung der Qualität von Daten.