Chinchilla-schaalwetten
De Chinchilla-schaalwetten, van DeepMind in 2022, lieten zien dat de meeste grote taalmodellen slecht getraind waren: voor een vast computerbudget moet je de modelgrootte en trainingsgegevens ongeveer in gelijke verhoudingen schalen.
Overzicht
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Diepe duik
Vóór Chinchilla was de trend om steeds grotere modellen te bouwen (zoals de 175B-parameter GPT-3) terwijl werd getraind op relatief bescheiden hoeveelheden gegevens. DeepMind heeft meer dan 400 modellen getraind in vele formaten en databudgetten, en vervolgens curves aangepast die verlies voorspellen als een functie van parameters en tokens onder een vast computerbudget (FLOP). Hun bevinding: parameters en trainingstokens moeten samen worden geschaald, grofweg een verhouding van 1 op 1, wat neerkomt op ongeveer 20 tokens aan trainingsgegevens per parameter. Om dit te bewijzen trainden ze Chinchilla, een model met 70B-parameters op 1,4 biljoen tokens, dat beter presteerde dan de veel grotere Gopher met 280B-parameters, ondanks het gebruik van dezelfde rekenkracht, omdat het op veel meer gegevens was getraind.
Technisch inzicht
De wetten komen voort uit het aanpassen van een parametrische verliesfunctie L(N, D), waarbij N parameters is en D tokens, inclusief termen voor onherleidbaar verlies, modelgrootte en datagrootte. Het minimaliseren van verliezen die onderhevig zijn aan een rekenbeperking (rekenkracht is ruwweg evenredig met N keer D) levert het resultaat op dat de optimale N en D beide groeien als een rekenkracht met vergelijkbare exponenten, zodat de rekenoptimale verhouding in de buurt van 20 tokens per parameter blijft.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van de chinchilla-schaalwetten
Chinchilla heeft het veld verschoven van het najagen van parametertellingen naar het voeden van modellen met veel meer hoogwaardige gegevens, en moderne modellen trainen vaak ver voorbij het 'compute-optimale' punt om gevolgtrekkingen goedkoper te maken. Nu webteksten van hoge kwaliteit schaars worden, verschuift de aandacht naar datacuratie, synthetische data, meerdere tijdperken en multimodale data om te blijven schalen. De kernles blijft bestaan: gegevens en parameters moeten in evenwicht zijn, en de ruwe omvang alleen is niet langer het doel.
Implementatie in de echte wereld
DeepMind's Chinchilla met 70B-parameter verslaat de 280B Gopher op benchmarks met gelijke rekenkracht, door op veel meer data te trainen
Begeleiden van teams bij het budgetteren van ongeveer 20 trainingstokens per parameter bij het plannen van een volledig nieuw model
Ter rechtvaardiging van kleinere, datarijke modellen zoals LLaMA die goedkoper zijn om uit te voeren op het moment van inferentie
Inschatten of een gepland model 'ondergetraind' is en meer baat zou hebben bij extra data dan bij extra parameters
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Schaalwetten voor neurale netwerken
Frequently asked questions
What is Chinchilla Scaling Laws?
De Chinchilla-schaalwetten, van DeepMind in 2022, lieten zien dat de meeste grote taalmodellen slecht getraind waren: voor een vast computerbudget moet je de modelgrootte en trainingsgegevens ongeveer in gelijke verhoudingen schalen. Het is belangrijk omdat het opnieuw definieerde wat 'optimale' modelgrootte betekent en een nieuwe vorm gaf aan de manier waarop laboratoria rekenkracht besteden.
Wat was de centrale bevinding van de Chinchilla-schaalwetten?
Chinchilla liet zien dat voor een vast rekenbudget parameters en trainingtokens samen zouden moeten groeien, ongeveer 1-op-1.
Hoeveel trainingstokens per parameter suggereerde Chinchilla dat deze rekenoptimaal zijn?
De rekenoptimale verhouding komt neer op ongeveer 20 trainingstokens voor elke modelparameter.
Welk model presteerde beter ondanks dat Chinchilla veel kleiner was?
De Chinchilla met 70B-parameter versloeg DeepMind's eigen Gopher met 280B-parameter met dezelfde rekenkracht, omdat hij op veel meer gegevens trainde.
Wat impliceerde Chinchilla destijds over modellen als GPT-3?
Veel grote modellen uit die tijd waren onvoldoende getraind, wat betekent dat ze beter zouden hebben gepresteerd met veel meer gegevens voor hun parametertelling.
Hoe werd de berekening grofweg benaderd in de Chinchilla-analyse?
Training Compute (FLOP's) is ongeveer evenredig met het aantal parameters vermenigvuldigd met het aantal trainingstokens.