Kreuzvalidierung (Cross-Validation)

Wie du die Leistungsfähigkeit eines Modells über mehrere Datenaufteilungen hinweg realistischer einschätzt

Kreuzvalidierung ist ein Verfahren, um die Leistung eines Machine-Learning-Modells zuverlässig zu schätzen, indem die Daten mehrfach in Trainings- und Testteile aufgeteilt und die Ergebnisse gemittelt werden.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Teilt die Daten mehrfach in Trainings- und Validierungsmengen, um die Leistung robust zu schätzen
  2. Reduziert die Abhängigkeit von einer einzelnen, womöglich glücklichen Datenaufteilung
  3. k-fache Kreuzvalidierung ist die gängigste Variante

Sofortantwort

Kreuzvalidierung einfach erklärt

Verfahren zur zuverlässigen Schätzung der Modellleistung durch mehrfache Datenaufteilung.

Kurz gesagt
Teilt die Daten mehrfach in Trainings- und Validierungsmengen, um die Leistung robust zu schätzen
Typischer Einsatz
Modellvergleich, Hyperparameter-Tuning, Kleine Datensätze
Wichtig zu wissen
k-fache Kreuzvalidierung ist die gängigste Variante

Kreuzvalidierung im Überblick

Kreuzvalidierung (englisch Cross-Validation) ist ein Verfahren, um abzuschätzen, wie gut ein Machine-Learning-Modell auf neuen, ungesehenen Daten funktionieren wird. Das Problem: Wer ein Modell nur an einem einzigen Test-Datensatz misst, riskiert ein zufälliges Ergebnis – die Aufteilung könnte zufällig besonders leicht oder besonders schwer ausgefallen sein.

Kreuzvalidierung löst das, indem sie die Daten mehrfach unterschiedlich aufteilt, das Modell mehrmals trainiert und testet, und die Ergebnisse mittelt. Das Resultat ist eine deutlich verlässlichere Einschätzung der echten Leistung.

Technisch betrachtet

k-fache Kreuzvalidierung

Das gängigste Verfahren teilt die Daten in k Folds:

  1. Daten in k gleich große Teile zerlegen.
  2. Modell k-mal trainieren – jeweils ein Fold als Validierung, der Rest als Training.
  3. Die k Leistungswerte mitteln (und ggf. die Streuung betrachten).

Bei k=5 wird das Modell also fünfmal trainiert, jeder Datenpunkt ist genau einmal Validierung und viermal Training.

Varianten

VarianteEinsatz
Stratified k-Foldunausgewogene Klassen – Verteilung pro Fold erhalten
Leave-One-Outsehr kleine Datensätze – k = Anzahl Datenpunkte
Time Series SplitZeitreihen – nur Vergangenheit darf Zukunft vorhersagen

Wichtige Regel

Die Kreuzvalidierung dient dem Modell- und Hyperparameter-Vergleich. Der finale, unberührte Testdatensatz wird erst ganz am Ende verwendet – sonst fließt Wissen über die Testdaten ins Modell ein und die Schätzung wird zu optimistisch.

Schritt für Schritt

Wie Kreuzvalidierung belastbare Modellvergleiche ermöglicht

  1. Ziel und Datenstruktur verstehen

    Kläre, welche reale Zukunftssituation die Bewertung abbilden soll. Zeitreihen, zusammengehörige Personen oder seltene Klassen brauchen andere Aufteilungen als unabhängige, gleichartige Beispiele.

  2. Folds passend aufteilen

    Teile Daten so in mehrere Trainings- und Prüfgruppen, dass keine unzulässige Information zwischen ihnen übergeht. Jede Gruppe sollte die relevante Verteilung und die spätere Nutzung möglichst ehrlich repräsentieren.

  3. Pipeline innerhalb jedes Folds ausführen

    Lerne Skalierung, Auswahl oder andere Vorverarbeitung immer nur aus den Trainingsdaten des jeweiligen Folds. So verhindert das Team, dass Informationen aus der Prüfung unbemerkt das Training verbessern.

  4. Streuung und Grenzen auswerten

    Vergleiche nicht nur den Durchschnitt, sondern auch die Unterschiede zwischen den Folds und Fehlergruppen. Große Schwankungen zeigen, wo zusätzliche Daten, ein anderes Modell oder vorsichtigere Aussagen nötig sind.

Konkretes Beispiel

Ein Modell wird nicht nur an einer Aufteilung gemessen

Ein Team vergleicht zwei Modelle für die Klassifikation eingehender Dokumente. Eine zufällig günstige Testaufteilung könnte einen Kandidaten besser aussehen lassen, als er im Alltag ist.

Einzelner Test

Ein Modell erzielt in einer einzigen Aufteilung eine hohe Kennzahl. Das Team weiß jedoch nicht, ob das Ergebnis bei anderen, vergleichbaren Datenabschnitten stabil bleibt oder von wenigen besonderen Fällen abhängt.

Mehrere Prüfungen

Die Modelle werden über passende Folds hinweg bewertet und ihre Fehlergruppen verglichen. Das Team wählt nicht nur den höchsten Mittelwert, sondern berücksichtigt Stabilität, Aufwand und Risiken in wichtigen Fällen.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Liefert eine stabilere Einschätzung als eine einzige zufällige Trainings- und Testaufteilung.
  • Macht Unterschiede zwischen Datenabschnitten und Fehlergruppen sichtbar.
  • Unterstützt nachvollziehbare Modellwahl mit dokumentierten Bewertungsregeln.

Das solltest du beachten

  • Unpassende Folds können Datenleckagen oder eine unrealistische Bewertung erzeugen.
  • Die wiederholte Ausführung erhöht Rechenaufwand und Komplexität der Pipeline.
  • Gute Kreuzvalidierung ersetzt keinen abschließenden Test gegen eine echte Einsatzsituation.
Vertiefung · für Fortgeschrittene

Vom Datensatz zur belastbaren Bewertung

Wissenskarte

Mehrere Datenaufteilungen

Dataset
Eine Sammlung strukturierter Daten für das Training von KI-Modellen.
Preprocessing
Aufbereitung von Rohdaten in eine für ML-Modelle nutzbare Form.
Feature Scaling
Features auf vergleichbare Wertebereiche transformieren.
Benchmark
Tests zur objektiven Bewertung von KI-Modellen.
Imbalanced Data
Ungleiche Klassenverteilung in Trainingsdaten.
Kreuzvalidierung wiederholt Training und Prüfung auf sauber getrennten Datenaufteilungen, damit das Team Stabilität und Grenzen eines Modells besser einordnen kann. Cross-Validation gliedert sich in: Dataset, Preprocessing, Feature Scaling, Benchmark, Imbalanced Data.

01Einsatzbereiche

Wann ist Kreuzvalidierung sinnvoll?

Geeignet für

  • ModellvergleichMehrere Modelle fair vergleichen, ohne dass eine zufällige Aufteilung das Ergebnis verfälscht
  • Hyperparameter-TuningBeste Einstellungen wählen, ohne die Testdaten zu verbrauchen
  • Kleine DatensätzeBei wenig Daten jeden Datenpunkt sowohl zum Training als auch zur Validierung nutzen

↑ Inhalt

02Werkzeuge

Womit Kreuzvalidierung umgesetzt wird

↑ Inhalt

Merksatz

Kreuzvalidierung ist wie eine Prüfung mit mehreren Probeläufen

Statt das Wissen nur an einer einzigen Aufgabe zu testen, prüft man es an mehreren verschiedenen Aufgabensätzen und nimmt den Durchschnitt. So erkennt man echtes Können statt zufälligen Glücks bei einer leichten Aufgabe.

  1. Teilt die Daten mehrfach in Trainings- und Validierungsmengen, um die Leistung robust zu schätzen
  2. Reduziert die Abhängigkeit von einer einzelnen, womöglich glücklichen Datenaufteilung
  3. k-fache Kreuzvalidierung ist die gängigste Variante

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Kreuzvalidierung

Was ist k-fache Kreuzvalidierung?

Die Daten werden in k gleich große Teile (Folds) zerlegt. Das Modell wird k-mal trainiert: Jedes Mal dient ein anderer Fold als Validierungsmenge, die übrigen k-1 als Training. Die k Ergebnisse werden gemittelt. Üblich sind k=5 oder k=10.

Warum nicht einfach einmal in Training und Test aufteilen?

Ein einzelner Split kann zufällig günstig oder ungünstig ausfallen und so ein verzerrtes Bild der Modellleistung liefern. Kreuzvalidierung mittelt über mehrere Aufteilungen und liefert dadurch eine stabilere, verlässlichere Schätzung.

Was ist stratifizierte Kreuzvalidierung?

Bei unausgewogenen Klassen sorgt die stratifizierte Variante dafür, dass in jedem Fold die Klassenverteilung der Gesamtdaten erhalten bleibt. Das verhindert, dass ein Fold versehentlich kaum Beispiele einer seltenen Klasse enthält.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Feature Engineering

    Merkmale werden aus Rohdaten für ML-Modelle erstellt.

  • Technisch vertiefen

    Supervised Learning

    Das Modell lernt aus gelabelten Daten mit bekannten Ausgaben.

↑ Inhalt