Sofortantwort
Test-Time Compute einfach erklärt
KI-Modelle nutzen zur Anfragezeit mehr Rechenleistung für bessere Ergebnisse.
- Kurz gesagt
- Verlagert Rechenaufwand vom Training zur Inferenz für bessere Ergebnisse
- Typischer Einsatz
- Mathematik & Logik, Code-Generierung, Wissenschaftliche Analyse
- Wichtig zu wissen
- Techniken: Chain-of-Thought, Best-of-N, Process Reward Models
Test-Time Compute im Überblick
Test-Time Compute (TTC) ist eine der wichtigsten Entwicklungen in der KI seit 2024. Die Idee: Statt ein Modell immer größer zu machen (mehr Parameter, mehr Training), lässt man es zur Anfragezeit länger nachdenken. Das Ergebnis sind Reasoning-Modelle wie OpenAI o1, o3 und DeepSeek R1, die bei komplexen Aufgaben dramatisch besser abschneiden als klassische LLMs.
Der Paradigmenwechsel ist fundamental: Bisher war die Qualität eines Modells durch seine Trainingszeit fixiert. Mit Test-Time Compute wird Qualität dynamisch – für eine einfache Frage reicht eine schnelle Antwort, für ein komplexes Mathe-Problem kann das Modell Minuten lang nachdenken, Lösungswege ausprobieren und sich selbst korrigieren.
Warum das wichtig ist:
- Training-Compute skaliert schlecht: Ein 10x größeres Modell kostet 10x mehr, wird aber nicht 10x besser
- Test-Time Compute skaliert besser: Mehr Denkzeit verbessert Reasoning-Aufgaben überproportional
- Reasoning-Modelle können für schwierige Aufgaben mehr Ressourcen einsetzen als für einfache
Technisch betrachtet
Techniken für Test-Time Compute
Chain-of-Thought (CoT): Das Modell denkt laut nach, bevor es antwortet. Jeder Denkschritt ist ein Token – mehr Tokens = mehr Rechenzeit = bessere Antworten.
Best-of-N Sampling: Das Modell generiert N verschiedene Antworten und wählt die beste aus – entweder durch ein Reward Model oder durch Mehrheitsentscheid.
Process Reward Models (PRM): Statt nur das Endergebnis zu bewerten, bewertet ein PRM jeden Denkschritt. Das Modell kann schlechte Gedankengänge frühzeitig verwerfen.
Monte Carlo Tree Search (MCTS): Aus der Spieltheorie adaptiert – das Modell exploriert einen Baum von möglichen Denkpfaden und wählt den vielversprechendsten.
Skalierungsverhalten
Klassisches Scaling: Modellgröße ↑ → Performance ↑ (logarithmisch)
Test-Time Compute: Denkzeit ↑ → Performance ↑ (bei Reasoning-Tasks stark)
OpenAI o1 auf AIME 2024:
GPT-4o (ohne Thinking): 13% korrekt
o1: 83% korrekt (durch ~15x mehr Test-Time Compute)
Wann lohnt sich Test-Time Compute?
| Aufgabentyp | TTC-Nutzen | Beispiel |
|---|---|---|
| Faktenfragen | Gering | “Was ist die Hauptstadt von Frankreich?” |
| Kreatives Schreiben | Mittel | Gedicht schreiben |
| Mathematik | Sehr hoch | Olympiade-Aufgaben |
| Code-Debugging | Hoch | Komplexe Bugs finden |
| Logik-Rätsel | Sehr hoch | Mehrstufige Schlussfolgerungen |