Taal AI-GIDS

Chinchilla-schaalwetten

De Chinchilla-schaalwetten, van DeepMind in 2022, lieten zien dat de meeste grote taalmodellen slecht getraind waren: voor een vast computerbudget moet je de modelgrootte en trainingsgegevens ongeveer in gelijke verhoudingen schalen.

2 min readLaatst bijgewerkt

Overzicht

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Diepe duik

Vóór Chinchilla was de trend om steeds grotere modellen te bouwen (zoals de 175B-parameter GPT-3) terwijl werd getraind op relatief bescheiden hoeveelheden gegevens. DeepMind heeft meer dan 400 modellen getraind in vele formaten en databudgetten, en vervolgens curves aangepast die verlies voorspellen als een functie van parameters en tokens onder een vast computerbudget (FLOP). Hun bevinding: parameters en trainingstokens moeten samen worden geschaald, grofweg een verhouding van 1 op 1, wat neerkomt op ongeveer 20 tokens aan trainingsgegevens per parameter. Om dit te bewijzen trainden ze Chinchilla, een model met 70B-parameters op 1,4 biljoen tokens, dat beter presteerde dan de veel grotere Gopher met 280B-parameters, ondanks het gebruik van dezelfde rekenkracht, omdat het op veel meer gegevens was getraind.

Technisch inzicht

De wetten komen voort uit het aanpassen van een parametrische verliesfunctie L(N, D), waarbij N parameters is en D tokens, inclusief termen voor onherleidbaar verlies, modelgrootte en datagrootte. Het minimaliseren van verliezen die onderhevig zijn aan een rekenbeperking (rekenkracht is ruwweg evenredig met N keer D) levert het resultaat op dat de optimale N en D beide groeien als een rekenkracht met vergelijkbare exponenten, zodat de rekenoptimale verhouding in de buurt van 20 tokens per parameter blijft.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van de chinchilla-schaalwetten

Chinchilla heeft het veld verschoven van het najagen van parametertellingen naar het voeden van modellen met veel meer hoogwaardige gegevens, en moderne modellen trainen vaak ver voorbij het 'compute-optimale' punt om gevolgtrekkingen goedkoper te maken. Nu webteksten van hoge kwaliteit schaars worden, verschuift de aandacht naar datacuratie, synthetische data, meerdere tijdperken en multimodale data om te blijven schalen. De kernles blijft bestaan: gegevens en parameters moeten in evenwicht zijn, en de ruwe omvang alleen is niet langer het doel.

Implementatie in de echte wereld

DeepMind's Chinchilla met 70B-parameter verslaat de 280B Gopher op benchmarks met gelijke rekenkracht, door op veel meer data te trainen

Begeleiden van teams bij het budgetteren van ongeveer 20 trainingstokens per parameter bij het plannen van een volledig nieuw model

Ter rechtvaardiging van kleinere, datarijke modellen zoals LLaMA die goedkoper zijn om uit te voeren op het moment van inferentie

Inschatten of een gepland model 'ondergetraind' is en meer baat zou hebben bij extra data dan bij extra parameters

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Schaalwetten voor neurale netwerken

Frequently asked questions

What is Chinchilla Scaling Laws?

De Chinchilla-schaalwetten, van DeepMind in 2022, lieten zien dat de meeste grote taalmodellen slecht getraind waren: voor een vast computerbudget moet je de modelgrootte en trainingsgegevens ongeveer in gelijke verhoudingen schalen. Het is belangrijk omdat het opnieuw definieerde wat 'optimale' modelgrootte betekent en een nieuwe vorm gaf aan de manier waarop laboratoria rekenkracht besteden.

Wat was de centrale bevinding van de Chinchilla-schaalwetten?

Chinchilla liet zien dat voor een vast rekenbudget parameters en trainingtokens samen zouden moeten groeien, ongeveer 1-op-1.

Hoeveel trainingstokens per parameter suggereerde Chinchilla dat deze rekenoptimaal zijn?

De rekenoptimale verhouding komt neer op ongeveer 20 trainingstokens voor elke modelparameter.

Welk model presteerde beter ondanks dat Chinchilla veel kleiner was?

De Chinchilla met 70B-parameter versloeg DeepMind's eigen Gopher met 280B-parameter met dezelfde rekenkracht, omdat hij op veel meer gegevens trainde.

Wat impliceerde Chinchilla destijds over modellen als GPT-3?

Veel grote modellen uit die tijd waren onvoldoende getraind, wat betekent dat ze beter zouden hebben gepresteerd met veel meer gegevens voor hun parametertelling.

Hoe werd de berekening grofweg benaderd in de Chinchilla-analyse?

Training Compute (FLOP's) is ongeveer evenredig met het aantal parameters vermenigvuldigd met het aantal trainingstokens.