Skalierung der Rechenleistung während des Tests
Bei der Berechnungsskalierung während des Tests wird einem Modell bei der Beantwortung einer Frage mehr Zeit zum Nachdenken und Rechnen gegeben, anstatt es während des Trainings nur zu vergrößern.
Übersicht
It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.
Tiefer Einblick
Jahrelang bedeutete der KI-Fortschritt eine Skalierung des Trainings: mehr Daten, mehr Parameter, mehr Rechenleistung vor dem Training. Durch die Berechnungsskalierung zur Testzeit wird eine zweite Achse hinzugefügt, wodurch mehr Berechnungen bei der Inferenz erforderlich sind. Anstatt sofort eine Antwort zu geben, generiert ein Argumentationsmodell eine lange interne Gedankenkette, in der Schritte untersucht, die Arbeit überprüft und zurückverfolgt wird. Zu den Techniken gehören eine erweiterte Gedankenkette, das Ausprobieren vieler Kandidatenlösungen und die Auswahl der besten (Selbstkonsistenz oder Best-of-N) sowie eine baumartige Suche, die von einem Verifizierer oder Belohnungsmodell geleitet wird. o1 und o3 von OpenAI, DeepSeek-R1 und das erweiterte Denken von Claude haben dies populär gemacht: Die Genauigkeit der Wettbewerbsmathematik und -programmierung steigt stark an, wenn Sie das Modell „länger nachdenken“ lassen und bei Problemen, bei denen eine schnelle Antwort fehlschlägt, Latenz und Kosten gegen Korrektheit eintauschen.
Technischer Einblick
Das Modell wird durch verstärkendes Lernen trainiert, um nützliche Argumentationstokens zu erzeugen. Bei der Schlussfolgerung weisen Sie dann ein „Denkbudget“ zu. Mit mehr Token kann es Probleme zerlegen, eigene Fehler erkennen und sich selbst überprüfen. Best-of-N-Stichproben und verifizierergesteuerte Suche fügen parallele Berechnungen hinzu: Generieren Sie viele Versuche, bewerten Sie sie und behalten Sie den Gewinner. Entscheidend ist, dass kleinere Modelle mit großzügiger Rechenleistung während der Testzeit mit viel größeren Modellen mithalten können, die sofort antworten und so die Kostenkurve verändern.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.
Zugang und Erreichbarkeit
Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.
Klarere Entscheidungen
Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.
Die Zukunft der Testzeit-Rechenskalierung
Die Testzeitberechnung ist heute neben dem Training ein primärer Skalierungshebel. Erwarten Sie adaptive Budgets, bei denen das Modell anhand der Schwierigkeit entscheidet, wie schwer zu denken ist, billigeres Denken durch die Destillation langer Ketten in kürzere und „agentische“ Schleifen, die das Denken mit Toolaufrufen und Websuchen verschränken. Mit der Verbesserung der Inferenz-Hardware wird bewusstes Denken zum Standard für anspruchsvolle Aufgaben wie wissenschaftliche Forschung, Softwareentwicklung und komplexe Planung, während schnelle Suchvorgänge schnell und kostengünstig bleiben.
Reale Umsetzung
Die o1- und o3-Modelle von OpenAI durchdenken mathematische Probleme auf Olympia-Niveau Schritt für Schritt und übertreffen Instant-Antwort-Modelle bei den AIME- und Wettbewerbs-Benchmarks deutlich.
DeepSeek-R1 nutzte Verstärkungslernen, um das Denken über lange Gedankenketten zu lehren, und demonstrierte offen die großen Genauigkeitsgewinne durch zusätzliche Inferenzberechnungen.
Mit dem erweiterten Denkmodus von Claude können Entwickler ein Token-Budget festlegen, damit das Modell länger über komplexe Codierungs- oder Analyseaufgaben nachdenkt, bevor es antwortet.
AlphaCode und ähnliche Systeme testen zum Testzeitpunkt Tausende von Kandidatenprogrammen, filtern und bewerten sie dann, um konkurrierende Programmierherausforderungen zu lösen.
Risiken und Leitplanken
Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.
Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.
Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.
Implementierungs-Roadmap
Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.
Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.
Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.
Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Test-Time Compute Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Testzeiterweiterung
Häufig gestellte Fragen
What is Test-Time Compute Scaling?
Bei der Berechnungsskalierung während des Tests wird einem Modell bei der Beantwortung einer Frage mehr Zeit zum Nachdenken und Rechnen gegeben, anstatt es während des Trainings nur zu vergrößern. Es ist der Durchbruch hinter „Reasoning-Modellen“, die schwierige Mathematik- und Codierungsprobleme lösen können, indem man überlegt, bevor man reagiert.
Worauf bezieht sich „Testzeitberechnung“?
Die Berechnung während der Testzeit (Inferenzzeit) ist die Arbeit, die beim Generieren einer Antwort geleistet wird, und unterscheidet sich von der während des Vortrainings verwendeten Berechnung.
Wie nutzen Argumentationsmodelle wie o1 zusätzliche Testzeitberechnungen?
Sie führen ausführliche Schritt-für-Schritt-Begründungen durch, erkunden und prüfen Lösungen, bevor sie sich zu einer endgültigen Antwort verpflichten.
Was ist der Hauptkompromiss bei der Rechenskalierung während der Testzeit?
Ein Modell länger denken zu lassen, verbessert die Korrektheit bei schwierigen Problemen, erhöht jedoch die Reaktionszeit und den Rechenaufwand.
Was ist „Best-of-N“-Sampling?
Best-of-N generiert mehrere Lösungsversuche parallel und verwendet einen Scorer oder Verifizierer, um den stärksten zu behalten, eine Form der Testzeitskalierung.
Warum wird die Testzeitberechnung als neue „Skalierungsachse“ betrachtet?
Jahrelang bedeutete die Skalierung größere Trainingsläufe; Die Testzeitberechnung bietet eine zweite Möglichkeit, die Leistungsfähigkeit zu steigern, indem mehr bei der Inferenz berechnet wird.