Sheria za Kupunguza Chinchilla
Sheria za kuongeza kiwango cha Chinchilla, kutoka kwa DeepMind mwaka wa 2022, zilionyesha kuwa miundo mingi mikubwa ya lugha haikufunzwa vibaya: kwa bajeti isiyobadilika ya kukokotoa, unapaswa kuongeza ukubwa wa modeli na data ya mafunzo kwa takribani uwiano sawa.
Muhtasari
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Dive ya kina
Kabla ya Chinchilla, mwelekeo ulikuwa wa kuunda miundo mikubwa zaidi (kama vile kigezo cha 175B-GPT-3) wakati wa mafunzo kuhusu kiasi kidogo cha data. DeepMind ilifunza zaidi ya miundo 400 katika saizi na bajeti nyingi za data, kisha kutosheleza mikondo inayotabiri upotevu kama utendaji wa vigezo na tokeni chini ya bajeti isiyobadilika ya kukokotoa (FLOP). Utafutaji wao: vigezo na ishara za mafunzo zinapaswa kupima pamoja, takriban uwiano wa 1 hadi 1, ikimaanisha kuhusu tokeni 20 za data ya mafunzo kwa kila parameta. Ili kuthibitisha hilo, walimfundisha Chinchilla, kielelezo cha 70B-parameta kwenye tokeni trilioni 1.4, ambayo ilifanya kazi zaidi kuliko Gopher kubwa zaidi ya 280B licha ya kutumia komputa sawa, kwa sababu ilifunzwa kwenye data zaidi.
Ufahamu wa Kiufundi
Sheria zinatokana na kuangazia kipengele cha upotezaji wa vigezo L(N, D) ambapo N ni vigezo na D ni tokeni, ikijumuisha hasara isiyoweza kupunguzwa, ukubwa wa modeli na masharti ya ukubwa wa data. Kupunguza hasara kulingana na kikwazo cha kukokotoa (kokotoo ni takriban sawia na N mara D) hutoa matokeo kwamba N na D mojawapo hukua kama nguvu ya kukokotoa na viambajengo sawa, kwa hivyo uwiano bora zaidi wa kukokotoa hukaa karibu tokeni 20 kwa kila kigezo.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Sheria za Kuongeza Kiwango cha Chinchilla
Chinchilla alihamisha uga kutoka kwa kufuata hesabu za vigezo hadi modeli za kulisha data za ubora zaidi, na miundo ya kisasa mara nyingi hufunza kupita kiwango cha 'compute-optimal' ili kufanya makisio kuwa nafuu. Maandishi ya ubora wa juu ya wavuti yanapopungua, umakini unaelekezwa kwenye uratibu wa data, data ya sanisi, nyakati nyingi, na data ya aina nyingi ili kuendelea kuongeza. Somo la msingi hudumu: data na vigezo lazima zisawazishwe, na saizi mbichi pekee sio lengo tena.
Utekelezaji wa Ulimwengu Halisi
DeepMind's 70B-parameta Chinchilla ikishinda Gopher 280B kwenye viwango kwa kutumia compute sawa, kwa mafunzo juu ya data nyingi zaidi.
Timu zinazoongoza kupanga bajeti takriban tokeni 20 za mafunzo kwa kila kigezo wakati wa kupanga muundo wa kuanzia mwanzo
Kuhalalisha mifano ndogo, yenye utajiri wa data kama LLaMA ambayo ni nafuu kuendesha kwa wakati wa makisio
Kukadiria kama muundo uliopangwa 'huna mafunzo duni' na utafaidika zaidi kutokana na data ya ziada kuliko vigezo vya ziada
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Sheria za Kuongeza Mitandao ya Neural
Maswali yanayoulizwa mara kwa mara
What is Chinchilla Scaling Laws?
Sheria za kuongeza kiwango cha Chinchilla, kutoka kwa DeepMind mwaka wa 2022, zilionyesha kuwa miundo mingi mikubwa ya lugha haikufunzwa vibaya: kwa bajeti isiyobadilika ya kukokotoa, unapaswa kuongeza ukubwa wa modeli na data ya mafunzo kwa takribani uwiano sawa. Ni muhimu kwa sababu ilifafanua upya ukubwa wa "mojawapo" wa mfano unamaanisha nini na kuunda upya jinsi maabara hutumia kuhesabu.
Ni nini kilichopatikana katika sheria za kuongeza kiwango cha Chinchilla?
Chinchilla ilionyesha kuwa kwa bajeti ya hesabu iliyowekwa, vigezo na ishara za mafunzo zinapaswa kukua pamoja, takriban 1 hadi 1.
Takriban tokeni ngapi za mafunzo kwa kila parameta Chinchilla alipendekeza kuwa ni bora zaidi?
Uwiano wa kukokotoa-kabisa hufanya kazi kwa takriban tokeni 20 za mafunzo kwa kila kigezo cha mfano.
Je, Chinchilla alishinda mtindo gani licha ya kuwa mdogo zaidi?
Chinchilla ya kigezo cha 70B ilishinda Gopher ya DeepMind ya 280B kwa kutumia komputa sawa, kwa sababu ilipata mafunzo kwenye data nyingi zaidi.
Chinchilla ilimaanisha nini kuhusu mifano kama GPT-3 wakati huo?
Miundo mingi mikubwa ya enzi hiyo haikufunzwa, ikimaanisha kwamba wangefanya vyema zaidi na data zaidi kwa hesabu yao ya vigezo.
Takriban ni jinsi gani hesabu ilikadiriwa katika uchanganuzi wa Chinchilla?
Kokotoo la mafunzo (FLOPs) ni takriban sawia na idadi ya vigezo vinavyozidishwa na idadi ya tokeni za mafunzo.