Språk AI GUIDE

Chinchilla-skaleringslover

Chinchilla-skaleringslovene, fra DeepMind i 2022, viste at de fleste store språkmodeller var dårlig undertrent: for et fast regnebudsjett bør du skalere modellstørrelse og treningsdata omtrent i like store forhold.

2 min lesingSist oppdatert

Oversikt

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Dypdykk

Før Chinchilla var trenden å bygge stadig større modeller (som 175B-parameteren GPT-3) mens man trente på relativt beskjedne mengder data. DeepMind trente opp over 400 modeller på tvers av mange størrelser og databudsjetter, og tilpasset deretter kurver som forutsier tap som en funksjon av parametere og tokens under et fast beregningsbudsjett (FLOP). Funnene deres: parametere og treningssymboler bør skaleres sammen, omtrent et 1-til-1-forhold, noe som innebærer omtrent 20 tokens med treningsdata per parameter. For å bevise det trente de Chinchilla, en 70B-parametermodell på 1,4 billioner tokens, som overgikk den mye større 280B-parameteren Gopher til tross for at den brukte samme datamaskin, fordi den ble trent på langt mer data.

Teknisk innsikt

Lovene kommer fra å tilpasse en parametrisk tapsfunksjon L(N, D) der N er parametere og D er tokens, inkludert irreducible-tap, modell-størrelse og datastørrelse termer. Minimering av tap underlagt en beregningsbegrensning (beregning er omtrent proporsjonal med N ganger D) gir resultatet at den optimale N og D begge vokser som en beregningskraft med lignende eksponenter, slik at det beregningsoptimale forholdet forblir nær 20 tokens per parameter.

Strategisk innvirkning

Speed and scale

Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.

Access and reach

Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.

Tydeligere avgjørelser

Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.

Fremtiden for Chinchilla-skaleringslover

Chinchilla flyttet feltet fra å jage parametertellinger til å mate modeller med langt mer høykvalitetsdata, og moderne modeller trener ofte langt forbi det "beregningsoptimale" punktet for å gjøre slutninger billigere. Ettersom netttekst av høy kvalitet blir knapp, rettes oppmerksomheten mot datakurering, syntetiske data, flere epoker og multimodale data for å fortsette å skalere. Kjerneleksjonen varer: data og parametere må balanseres, og råstørrelse alene er ikke lenger målet.

Real-World Implementering

DeepMinds 70B-parameter Chinchilla slo 280B Gopher på benchmarks ved å bruke lik beregning, ved å trene på langt mer data

Veilede team til å budsjettere omtrent 20 treningsmerker per parameter når de planlegger en helt fra bunnen av modell

Rettferdiggjør mindre, datarike modeller som LLaMA som er billigere å kjøre på slutningstidspunkt

Estimere om en planlagt modell er "undertrent" og vil ha mer nytte av ekstra data enn ekstra parametere

Risikoer og rekkverk

Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.

Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.

Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.

Veikart for implementering

1

Definer utdataformat, tone og kvalitetsstandarder før utrulling.

2

Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.

3

Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.

4

Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Skaleringslover for nevrale nettverk

Ofte stilte spørsmål

What is Chinchilla Scaling Laws?

Chinchilla-skaleringslovene, fra DeepMind i 2022, viste at de fleste store språkmodeller var dårlig undertrent: for et fast regnebudsjett bør du skalere modellstørrelse og treningsdata omtrent i like store forhold. Det er viktig fordi det omdefinerte hva "optimal" modellstørrelse betyr og omformet hvordan laboratoriene bruker beregninger.

Hva var det sentrale funnet i Chinchilla-skaleringslovene?

Chinchilla viste at for et fast beregningsbudsjett burde parametere og treningssymboler vokse sammen, omtrent 1-til-1.

Omtrent hvor mange treningssymboler per parameter foreslo Chinchilla er beregningsoptimal?

Det beregningsoptimale forholdet tilsvarer omtrent 20 treningssymboler for hver modellparameter.

Hvilken modell klarte Chinchilla til tross for at den var mye mindre?

70B-parameteren Chinchilla slo DeepMinds egen 280B-parameter Gopher ved å bruke den samme datamaskinen, fordi den trente på langt mer data.

Hva antydet Chinchilla om modeller som GPT-3 på den tiden?

Mange store modeller fra den tiden var undertrent, noe som betyr at de ville ha prestert bedre med mye mer data for parameterantallet.

Hvordan ble omtrentlig beregnet i Chinchilla-analysen?

Treningsberegning (FLOPs) er omtrent proporsjonal med antall parametere multiplisert med antall treningssymboler.