Chinchillas skalningslagar
Chinchilla-skalningslagarna, från DeepMind 2022, visade att de flesta stora språkmodeller var dåligt undertränade: för en fast beräkningsbudget bör du skala modellstorlek och träningsdata ungefär i samma proportion.
Översikt
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Djupdykning
Innan Chinchilla var trenden att bygga allt större modeller (som 175B-parametern GPT-3) samtidigt som man tränade på relativt blygsamma mängder data. DeepMind tränade över 400 modeller i många storlekar och databudgetar, och anpassade sedan kurvor som förutsäger förlust som en funktion av parametrar och tokens under en fast beräkningsbudget (FLOP). Deras upptäckt: parametrar och träningstokens bör skalas ihop, ungefär ett 1-till-1-förhållande, vilket innebär cirka 20 tokens träningsdata per parameter. För att bevisa det tränade de Chinchilla, en 70B-parametermodell på 1,4 biljoner tokens, som överträffade den mycket större 280B-parametern Gopher trots att den använde samma dator, eftersom den tränades på mycket mer data.
Teknisk insikt
Lagarna kommer från att anpassa en parametrisk förlustfunktion L(N, D) där N är parametrar och D är tokens, inklusive irreducible-förlust, modellstorlek och datastorlekstermer. Att minimera förluster som är föremål för en beräkningsrestriktion (beräkningen är ungefär proportionell mot N gånger D) ger resultatet att det optimala N och D båda växer som en beräkningskraft med liknande exponenter, så det beräkningsoptimala förhållandet förblir nära 20 tokens per parameter.
Strategisk inverkan
Speed and scale
Språkarbetsflöden kan gå snabbare utan att offra konsekvens.
Access and reach
Det utökar åtkomsten över språk och kommunikationsstilar.
Clearer decisions
Team kan lägga mer tid på bedömning medan automatisering hanterar upprepning.
Framtiden för Chinchillas skalningslagar
Chinchilla flyttade fältet från att jaga parameterräkning till att mata modeller med mycket mer högkvalitativ data, och moderna modeller tränar ofta långt förbi den "beräkningsoptimala" punkten för att göra slutsatser billigare. När högkvalitativ webbtext blir knapp, vänds uppmärksamheten mot datakurering, syntetisk data, flera epoker och multimodal data för att fortsätta skala. Kärnläxan består: data och parametrar måste balanseras, och enbart råstorlek är inte längre målet.
Real-World Implementation
DeepMinds 70B-parameter Chinchilla slår 280B Gopher på benchmarks med hjälp av lika beräkningar, genom att träna på mycket mer data
Guida team att budgetera ungefär 20 träningstoken per parameter när de planerar en ny modell
Att motivera mindre, datarika modeller som LLaMA som är billigare att köra vid slutledningstidpunkten
Uppskattning av om en planerad modell är "undertränad" och skulle dra mer nytta av extra data än extra parametrar
Risker & skyddsräcken
Hallucinerade fakta kan tyst lägga in rapporter, stödflöden eller forskningsresultat.
Snabb känslighet kan skapa inkonsekventa resultat över liknande förfrågningar.
Känsliga textdata kan exponeras om åtkomstkontrollerna är svaga.
Färdplan för genomförande
Definiera utdataformat, ton och kvalitetsstandarder innan lansering.
Marksvar med pålitliga källor närhelst noggrannhet är viktig.
Håll en kontrollpunkt för mänsklig granskning för höga insatser.
Spåra felmönster och träna om uppmaningar eller arbetsflöden regelbundet.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Skalningslagar för neurala nätverk
Frequently asked questions
What is Chinchilla Scaling Laws?
Chinchilla-skalningslagarna, från DeepMind 2022, visade att de flesta stora språkmodeller var dåligt undertränade: för en fast beräkningsbudget bör du skala modellstorlek och träningsdata ungefär i samma proportion. Det är viktigt eftersom det omdefinierade vad "optimal" modellstorlek betyder och omformade hur labbens spenderar beräkna.
Vad var det centrala fyndet av chinchillas skalningslagar?
Chinchilla visade att för en fast beräkningsbudget borde parametrar och träningstokens växa tillsammans, ungefär 1-till-1.
Ungefär hur många träningstokens per parameter föreslog Chinchilla är beräkningsoptimal?
Det beräkningsoptimala förhållandet går ut på ungefär 20 träningstokens för varje modellparameter.
Vilken modell överträffade Chinchilla trots att den var mycket mindre?
70B-parametern Chinchilla slog DeepMinds egen 280B-parameter Gopher med samma dator, eftersom den tränade på mycket mer data.
Vad antydde Chinchilla om modeller som GPT-3 på den tiden?
Många stora modeller från den eran var undertränade, vilket innebär att de skulle ha presterat bättre med mycket mer data för deras parameterantal.
Ungefär hur uppskattades beräkningen i Chinchilla-analysen?
Training compute (FLOPs) är ungefär proportionell mot antalet parametrar multiplicerat med antalet träningstokens.