Chinchilla Compute-Mafunzo Bora
Chinchilla ni utafiti wa 2022 wa DeepMind kwamba miundo mikubwa ya lugha haikufunzwa vibaya: kwa bajeti isiyobadilika ya kukokotoa unapaswa kuongeza vigezo na data takriban kwa usawa, sio tu kuunda muundo mkubwa zaidi.
Muhtasari
It reshaped how the industry balances model size against training data.
Dive ya kina
Karatasi ya DeepMind ya Chinchilla ilipitia upya vipimo na kutoa mafunzo zaidi ya miundo 400 ili kupata salio la kukokotoa. Kanuni ya kichwa cha kidole gumba: saizi ya mfano na ishara za mafunzo zinapaswa kukua katika hatua ya kufuli, takriban tokeni 20 za mafunzo kwa kila kigezo. Ili kuthibitisha hilo, walimfundisha Chinchilla, mfano wa parameta bilioni 70 kwenye tokeni trilioni 1.4, kwa kutumia hesabu sawa na Gopher ya bilioni 280 iliyofunzwa kwa tokeni chache sana. Chinchilla, licha ya kuwa ndogo mara nne, ilifanya vizuri zaidi Gopher, GPT-3, na majitu mengine karibu kila kigezo. Somo lilibatilisha hitimisho la awali la OpenAI kwamba ukubwa ulipendelea zaidi ya data, ikionyesha miundo mingi bora ilikuwa ikiacha utendaji kwenye jedwali kwa kuwa kubwa sana na kukosa data.
Ufahamu wa Kiufundi
Chinchilla inafaa hasara kama L(N,D) = E + A·N^(-α) + B·D^(-β), na α na β zote zikiwa karibu na 0.34, kumaanisha vigezo na data huchangia karibu kwa ulinganifu. Kuboresha hii chini ya kizuizi cha kokotoo kisichobadilika (hesabu ≈ 6·N·D kwa vibadilishaji umeme) hutoa matokeo ya kiwango sawa. Muundo mdogo, ulio na utajiri wa data pia ni wa bei rahisi kuendesha kwa makisio, kwa hivyo faida yake huchanganyika katika upelekaji, sio mafunzo tu.
Athari za kimkakati
Maamuzi ya wazi zaidi
Inakusaidia kutenganisha madai ya wazi ya kiufundi kutoka kwa lugha ya uuzaji.
Cost and budget
Unaweza kuuliza maswali ya utekelezaji bora kabla ya kutumia pesa au wakati.
Timu na mtiririko wa kazi
Timu zenye uelewa wa pamoja hufanya maamuzi bora ya bidhaa, sera na mafunzo.
Mustakabali wa Mafunzo Bora ya Kuhesabu kwa Chinchilla
Miundo ya kisasa kama Llama 3 inasukuma kimakusudi uwiano wa tokeni 20 kwa kila kigezo cha Chinchilla, inafunza miundo midogo juu ya matrilioni ya tokeni ili kufanya makisio kuwa nafuu, na kukubali kokotoo ndogo ya mafunzo. Kadiri data nzuri inavyozidi kuwa haba, maslahi yanaongezeka katika nyakati zinazorudiwa, data ya sanisi na uchujaji wa ubora. Chinchilla inasalia kuwa sehemu ya marejeleo, lakini bora zaidi inategemea gharama ya uelekezaji wa maisha, sio tu bajeti ya mafunzo ya wakati mmoja.
Utekelezaji wa Ulimwengu Halisi
Kuchagua kutoa mafunzo kwa muundo wa vigezo bilioni 7 kwa tokeni trilioni 2 badala ya muundo wa bilioni 30 kwenye data ndogo sana kwa bajeti sawa.
Kukadiria kuwa kielelezo cha kigezo cha bilioni 10 kinataka takriban tokeni bilioni 200 kufikia sehemu tamu ya kukokotoa.
Kuhalalisha muundo mdogo uliotumiwa ili kupunguza gharama za marejeleo ya kila hoja huku ikilinganisha ubora wa mpinzani mkubwa.
Kukagua muundo uliopo na kuhitimisha haukufunzwa, kisha kupanga mafunzo ya muda mrefu badala ya ongezeko la parameta.
Hatari & Walinzi
Timu tofauti zinaweza kutumia neno moja tofauti, kwa hivyo fafanua upeo mapema.
Vigezo vinaweza kuonekana kuwa na nguvu ilhali utendakazi wa ulimwengu halisi haufanani.
Kupuuza ubora wa data na mipango ya tathmini mara nyingi huleta matokeo tete.
Ramani ya Utekelezaji
Anza na ufafanuzi wa lugha rahisi wa matokeo unayohitaji.
Chagua kipimo kimoja cha mafanikio na hali moja ya kutofaulu kabla ya kujaribu.
Tekeleza majaribio madogo yenye data wakilishi, si seti ya onyesho iliyoboreshwa.
Hati ambapo Chinchilla Compute-Optimal Training husaidia na ambapo mbinu rahisi ni bora zaidi.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Mafunzo ya Wakati wa Mtihani
Maswali yanayoulizwa mara kwa mara
What is Chinchilla Compute-Optimal Training?
Chinchilla ni utafiti wa 2022 wa DeepMind kwamba miundo mikubwa ya lugha haikufunzwa vibaya: kwa bajeti isiyobadilika ya kukokotoa unapaswa kuongeza vigezo na data takriban kwa usawa, sio tu kuunda muundo mkubwa zaidi. Ilirekebisha jinsi tasnia inavyosawazisha ukubwa wa kielelezo dhidi ya data ya mafunzo.
Je, ni kanuni gani maarufu ya Chinchilla ya kukokotoa mafunzo bora zaidi?
DeepMind imepata vigezo na tokeni zinapaswa kukua pamoja kwa takriban tokeni 20 kwa kila kigezo kwa bajeti ya kukokotoa.
Je, Chinchilla ya parameta 70B ililinganishwaje na Gopher ya parameta 280B?
Akiwa amefunzwa kwa tokeni nyingi zaidi kwa kutumia komputa sawa, Chinchilla alishinda Gopher kubwa zaidi katika vigezo vingi.
Karatasi ya Chinchilla ilifichua tatizo gani kuu kuhusu miundo mikubwa ya hapo awali?
Miundo kama GPT-3 na Gopher ilikuwa kubwa sana ikilinganishwa na data yao ya mafunzo, hivyo basi utendakazi haujatekelezwa.
Takriban ni ishara ngapi ambazo sheria ya Chinchilla inapendekeza kwa mfano wa parameta ya bilioni 10?
Kwa ishara 20 kwa kila parameta, vigezo bilioni 10 vinamaanisha tokeni za mafunzo bilioni 200.
Kando na ufanisi wa mafunzo, kwa nini kielelezo kidogo, chenye utajiri wa data kinavutia katika kupelekwa?
Vigezo vichache vinamaanisha hesabu ya chini kwa kila swala, kwa hivyo mkusanyiko wa akiba kila wakati mtindo unatumiwa.