Sprach-KI-GUIDE

Chinchilla-Skalierungsgesetze

Die Chinchilla-Skalierungsgesetze von DeepMind aus dem Jahr 2022 zeigten, dass die meisten großen Sprachmodelle stark untertrainiert waren: Für ein festes Rechenbudget sollten Sie Modellgröße und Trainingsdaten ungefähr im gleichen Verhältnis skalieren.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Tiefer Einblick

Vor Chinchilla bestand der Trend darin, immer größere Modelle (wie das 175B-Parameter-GPT-3) zu erstellen und gleichzeitig mit relativ bescheidenen Datenmengen zu trainieren. DeepMind trainierte über 400 Modelle in vielen Größen und Datenbudgets und passte dann Kurven an, die den Verlust als Funktion von Parametern und Token unter einem festen Rechenbudget (FLOP) vorhersagen. Ihr Ergebnis: Parameter und Trainingstokens sollten zusammen ungefähr ein Verhältnis von 1 zu 1 aufweisen, was etwa 20 Tokens an Trainingsdaten pro Parameter impliziert. Um dies zu beweisen, trainierten sie Chinchilla, ein 70B-Parameter-Modell auf 1,4 Billionen Tokens, das den viel größeren 280B-Parameter-Gopher trotz der gleichen Rechenleistung übertraf, weil es auf weitaus mehr Daten trainiert wurde.

Technischer Einblick

Die Gesetze ergeben sich aus der Anpassung einer parametrischen Verlustfunktion L(N, D), wobei N Parameter und D Token sind, einschließlich der Terme irreduzibler Verlust, Modellgröße und Datengröße. Die Minimierung des Verlusts, der einer Rechenbeschränkung unterliegt (Berechnung ist ungefähr proportional zu N mal D), führt zu dem Ergebnis, dass das optimale N und D beide als Rechenleistung mit ähnlichen Exponenten wachsen, sodass das rechenoptimale Verhältnis bei etwa 20 Token pro Parameter bleibt.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft der Chinchilla-Skalierungsgesetze

Chinchilla verlagerte das Feld von der Suche nach Parameterzählungen hin zur Versorgung von Modellen mit weitaus hochwertigeren Daten, und moderne Modelle trainieren oft weit über den „rechenoptimalen“ Punkt hinaus, um Inferenzen billiger zu machen. Da qualitativ hochwertiger Webtext knapp wird, richtet sich die Aufmerksamkeit auf die Datenkuratierung, synthetische Daten, mehrere Epochen und multimodale Daten, um die Skalierung fortzusetzen. Die Kernlektion bleibt bestehen: Daten und Parameter müssen ausgewogen sein, und die bloße Größe allein ist nicht mehr das Ziel.

Reale Umsetzung

DeepMinds Chinchilla mit 70B-Parametern schlägt den 280B-Gopher bei Benchmarks mit gleicher Rechenleistung, indem er auf weitaus mehr Daten trainiert

Anleitung der Teams, bei der Planung eines völlig neuen Modells etwa 20 Trainingstoken pro Parameter einzuplanen

Begründung kleinerer, datenreicher Modelle wie LLaMA, deren Ausführung zur Inferenzzeit kostengünstiger ist

Schätzung, ob ein geplantes Modell „untertrainiert“ ist und mehr von zusätzlichen Daten als von zusätzlichen Parametern profitieren würde

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

Skalierungsgesetze für neuronale Netze

Häufig gestellte Fragen

What is Chinchilla Scaling Laws?

Die Chinchilla-Skalierungsgesetze von DeepMind aus dem Jahr 2022 zeigten, dass die meisten großen Sprachmodelle stark untertrainiert waren: Für ein festes Rechenbudget sollten Sie Modellgröße und Trainingsdaten ungefähr im gleichen Verhältnis skalieren. Es ist wichtig, weil es neu definiert hat, was „optimale“ Modellgröße bedeutet, und die Art und Weise verändert hat, wie Labore Rechenleistung ausgeben.

Was war die zentrale Erkenntnis der Chinchilla-Skalierungsgesetze?

Chinchilla zeigte, dass bei einem festen Rechenbudget Parameter und Trainingstokens ungefähr im Verhältnis 1:1 zusammenwachsen sollten.

Wie viele Trainingstokens pro Parameter sind laut Chinchilla ungefähr rechenoptimal?

Das rechenoptimale Verhältnis ergibt ungefähr 20 Trainingstokens für jeden Modellparameter.

Welches Modell übertraf Chinchilla, obwohl es viel kleiner war?

Der Chinchilla mit 70B-Parametern schlug DeepMinds eigenen Gopher mit 280B-Parametern mit der gleichen Rechenleistung, weil er auf weitaus mehr Daten trainierte.

Was meinte Chinchilla damals über Modelle wie GPT-3?

Viele große Modelle dieser Zeit waren unzureichend trainiert, was bedeutet, dass sie mit viel mehr Daten für ihre Parameteranzahl eine bessere Leistung erbracht hätten.

Wie wurde die Berechnung in der Chinchilla-Analyse ungefähr angenähert?

Die Trainingsberechnung (FLOPs) ist ungefähr proportional zur Anzahl der Parameter multipliziert mit der Anzahl der Trainingstokens.