Sprach-KI-GUIDE

Skalierung der Rechenleistung während des Tests

Bei der Berechnungsskalierung während des Tests wird einem Modell bei der Beantwortung einer Frage mehr Zeit zum Nachdenken und Rechnen gegeben, anstatt es während des Trainings nur zu vergrößern.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.

Tiefer Einblick

Jahrelang bedeutete der KI-Fortschritt eine Skalierung des Trainings: mehr Daten, mehr Parameter, mehr Rechenleistung vor dem Training. Durch die Berechnungsskalierung zur Testzeit wird eine zweite Achse hinzugefügt, wodurch mehr Berechnungen bei der Inferenz erforderlich sind. Anstatt sofort eine Antwort zu geben, generiert ein Argumentationsmodell eine lange interne Gedankenkette, in der Schritte untersucht, die Arbeit überprüft und zurückverfolgt wird. Zu den Techniken gehören eine erweiterte Gedankenkette, das Ausprobieren vieler Kandidatenlösungen und die Auswahl der besten (Selbstkonsistenz oder Best-of-N) sowie eine baumartige Suche, die von einem Verifizierer oder Belohnungsmodell geleitet wird. o1 und o3 von OpenAI, DeepSeek-R1 und das erweiterte Denken von Claude haben dies populär gemacht: Die Genauigkeit der Wettbewerbsmathematik und -programmierung steigt stark an, wenn Sie das Modell „länger nachdenken“ lassen und bei Problemen, bei denen eine schnelle Antwort fehlschlägt, Latenz und Kosten gegen Korrektheit eintauschen.

Technischer Einblick

Das Modell wird durch verstärkendes Lernen trainiert, um nützliche Argumentationstokens zu erzeugen. Bei der Schlussfolgerung weisen Sie dann ein „Denkbudget“ zu. Mit mehr Token kann es Probleme zerlegen, eigene Fehler erkennen und sich selbst überprüfen. Best-of-N-Stichproben und verifizierergesteuerte Suche fügen parallele Berechnungen hinzu: Generieren Sie viele Versuche, bewerten Sie sie und behalten Sie den Gewinner. Entscheidend ist, dass kleinere Modelle mit großzügiger Rechenleistung während der Testzeit mit viel größeren Modellen mithalten können, die sofort antworten und so die Kostenkurve verändern.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft der Testzeit-Rechenskalierung

Die Testzeitberechnung ist heute neben dem Training ein primärer Skalierungshebel. Erwarten Sie adaptive Budgets, bei denen das Modell anhand der Schwierigkeit entscheidet, wie schwer zu denken ist, billigeres Denken durch die Destillation langer Ketten in kürzere und „agentische“ Schleifen, die das Denken mit Toolaufrufen und Websuchen verschränken. Mit der Verbesserung der Inferenz-Hardware wird bewusstes Denken zum Standard für anspruchsvolle Aufgaben wie wissenschaftliche Forschung, Softwareentwicklung und komplexe Planung, während schnelle Suchvorgänge schnell und kostengünstig bleiben.

Reale Umsetzung

Die o1- und o3-Modelle von OpenAI durchdenken mathematische Probleme auf Olympia-Niveau Schritt für Schritt und übertreffen Instant-Antwort-Modelle bei den AIME- und Wettbewerbs-Benchmarks deutlich.

DeepSeek-R1 nutzte Verstärkungslernen, um das Denken über lange Gedankenketten zu lehren, und demonstrierte offen die großen Genauigkeitsgewinne durch zusätzliche Inferenzberechnungen.

Mit dem erweiterten Denkmodus von Claude können Entwickler ein Token-Budget festlegen, damit das Modell länger über komplexe Codierungs- oder Analyseaufgaben nachdenkt, bevor es antwortet.

AlphaCode und ähnliche Systeme testen zum Testzeitpunkt Tausende von Kandidatenprogrammen, filtern und bewerten sie dann, um konkurrierende Programmierherausforderungen zu lösen.

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Compute Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

What is Test-Time Compute Scaling?

Bei der Berechnungsskalierung während des Tests wird einem Modell bei der Beantwortung einer Frage mehr Zeit zum Nachdenken und Rechnen gegeben, anstatt es während des Trainings nur zu vergrößern. Es ist der Durchbruch hinter „Reasoning-Modellen“, die schwierige Mathematik- und Codierungsprobleme lösen können, indem man überlegt, bevor man reagiert.

Worauf bezieht sich „Testzeitberechnung“?

Die Berechnung während der Testzeit (Inferenzzeit) ist die Arbeit, die beim Generieren einer Antwort geleistet wird, und unterscheidet sich von der während des Vortrainings verwendeten Berechnung.

Wie nutzen Argumentationsmodelle wie o1 zusätzliche Testzeitberechnungen?

Sie führen ausführliche Schritt-für-Schritt-Begründungen durch, erkunden und prüfen Lösungen, bevor sie sich zu einer endgültigen Antwort verpflichten.

Was ist der Hauptkompromiss bei der Rechenskalierung während der Testzeit?

Ein Modell länger denken zu lassen, verbessert die Korrektheit bei schwierigen Problemen, erhöht jedoch die Reaktionszeit und den Rechenaufwand.

Was ist „Best-of-N“-Sampling?

Best-of-N generiert mehrere Lösungsversuche parallel und verwendet einen Scorer oder Verifizierer, um den stärksten zu behalten, eine Form der Testzeitskalierung.

Warum wird die Testzeitberechnung als neue „Skalierungsachse“ betrachtet?

Jahrelang bedeutete die Skalierung größere Trainingsläufe; Die Testzeitberechnung bietet eine zweite Möglichkeit, die Leistungsfähigkeit zu steigern, indem mehr bei der Inferenz berechnet wird.