Legile de scalare a Chinchilla
Legile de scalare Chinchilla, de la DeepMind în 2022, au arătat că majoritatea modelelor de limbaj mari au fost slab antrenate: pentru un buget de calcul fix, ar trebui să scalați dimensiunea modelului și datele de antrenament aproximativ în proporție egală.
Prezentare generală
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Scufundare în profunzime
Înainte de Chinchilla, tendința a fost de a construi modele din ce în ce mai mari (cum ar fi parametrul 175B GPT-3) în timp ce se antrenează pe cantități relativ modeste de date. DeepMind a antrenat peste 400 de modele în mai multe dimensiuni și bugete de date, apoi a încadrat curbele care prevăd pierderea în funcție de parametri și token-uri într-un buget fix de calcul (FLOP). Constatarea lor: parametrii și jetoanele de antrenament ar trebui să se scaleze împreună, aproximativ un raport de 1 la 1, ceea ce implică aproximativ 20 de jetoane de date de antrenament per parametru. Pentru a dovedi acest lucru, au antrenat Chinchilla, un model cu parametrii 70B pe 1,4 trilioane de jetoane, care a depășit-o pe Gopher, cu parametrii mult mai mari, de 280B, în ciuda faptului că a folosit același calcul, deoarece a fost antrenat pe mult mai multe date.
Perspectivă tehnică
Legile provin din ajustarea unei funcții de pierdere parametrică L(N, D) unde N este parametri și D este simboluri, inclusiv termeni de pierdere ireductibilă, dimensiunea modelului și dimensiunea datelor. Minimizarea pierderii supuse unei constrângeri de calcul (calcularea este aproximativ proporțională cu N ori D) conduce la rezultatul că N și D optime cresc ambele ca putere de calcul cu exponenți similari, astfel încât raportul optim de calcul rămâne aproape de 20 de jetoane pe parametru.
Impact strategic
Viteză și scară
Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.
Acces și acoperire
Extinde accesul în diferite limbi și stiluri de comunicare.
Decizii mai clare
Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.
Viitorul legilor de scalare a chinchillei
Chinchilla a schimbat domeniul de la urmărirea numărului de parametri la furnizarea modelelor de date mult mai de înaltă calitate, iar modelele moderne se antrenează adesea cu mult peste punctul „optim de calcul” pentru a face inferența mai ieftină. Pe măsură ce textul web de înaltă calitate devine rar, atenția se îndreaptă către conservarea datelor, date sintetice, epoci multiple și date multimodale pentru a continua scalarea. Lecția de bază durează: datele și parametrii trebuie echilibrați, iar dimensiunea brută nu mai este scopul.
Implementare în lumea reală
Chinchilla cu parametrii 70B de la DeepMind îl învinge pe 280B Gopher la benchmarkuri folosind calcule egale, antrenându-se pe mult mai multe date
Îndrumarea echipelor să bugeteze aproximativ 20 de jetoane de antrenament per parametru atunci când planifică un model de la zero
Justificarea modelelor mai mici, bogate în date, cum ar fi LLaMA, care sunt mai ieftin de rulat la momentul deducerii
Estimarea dacă un model planificat este „subantrenat” și ar beneficia mai mult de date suplimentare decât de parametri suplimentari
Riscuri și balustrade
Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.
Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.
Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.
Foaia de parcurs de implementare
Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.
Răspunsurile la sol cu surse de încredere ori de câte ori acuratețea contează.
Păstrați un punct de control uman pentru rezultate cu mize mari.
Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Legile de scalare pentru rețelele neuronale
Întrebări frecvente
What is Chinchilla Scaling Laws?
Legile de scalare Chinchilla, de la DeepMind în 2022, au arătat că majoritatea modelelor de limbaj mari au fost slab antrenate: pentru un buget de calcul fix, ar trebui să scalați dimensiunea modelului și datele de antrenament aproximativ în proporție egală. Este important pentru că a redefinit ce înseamnă dimensiunea „optimă” a modelului și a remodelat modul în care laboratoarele cheltuiesc calculul.
Care a fost concluzia centrală a legilor de scalare a Chinchilla?
Chinchilla a arătat că, pentru un buget de calcul fix, parametrii și jetoanele de antrenament ar trebui să crească împreună, aproximativ 1-la-1.
Aproximativ câte jetoane de antrenament per parametru a sugerat Chinchilla că este optim pentru calcul?
Raportul optim de calcul este de aproximativ 20 de jetoane de antrenament pentru fiecare parametru de model.
Ce model a depășit Chinchilla în ciuda faptului că era mult mai mic?
Chinchilla cu parametrii 70B a învins propriul Gopher cu parametrii 280B al DeepMind folosind același calcul, deoarece s-a antrenat pe mult mai multe date.
Ce a implicat Chinchilla despre modele precum GPT-3 la acea vreme?
Multe modele mari din acea epocă au fost subantrenate, ceea ce înseamnă că ar fi funcționat mai bine cu mult mai multe date pentru numărul de parametri.
Cum a fost calculată aproximativ în analiza Chinchilla?
Training compute (FLOP) este aproximativ proporțional cu numărul de parametri înmulțit cu numărul de jetoane de antrenament.