Chinchilla Compute - Antrenament optim
Chinchilla este o descoperire DeepMind din 2022 că majoritatea modelelor de limbaj mari au fost slab antrenate: pentru un buget de calcul fix, ar trebui să scalați parametrii și datele aproximativ în mod egal, nu doar să construiți un model mai mare.
Prezentare generală
It reshaped how the industry balances model size against training data.
Scufundare în profunzime
Lucrarea Chinchilla de la DeepMind a revizuit scalarea și a antrenat peste 400 de modele pentru a găsi echilibrul optim de calcul. Regula generală: dimensiunea modelului și jetoanele de antrenament ar trebui să crească în trepte, aproximativ 20 de jetoane de antrenament per parametru. Pentru a dovedi acest lucru, au antrenat Chinchilla, un model cu 70 de miliarde de parametri pe 1,4 trilioane de jetoane, folosind același calcul ca și Gopher cu 280 de miliarde de parametri antrenat pe mult mai puține jetoane. Chinchilla, în ciuda faptului că era de patru ori mai mic, a depășit Gopher, GPT-3 și alți giganți la aproape fiecare benchmark. Lecția a răsturnat concluzia anterioară OpenAI, care a favorizat dimensiunea în detrimentul datelor, arătând că multe modele emblematice lăsau performanța pe masă, fiind prea mari și prea lipsite de date.
Perspectivă tehnică
Pierderea potrivirii chinchilla ca L(N,D) = E + A·N^(-α) + B·D^(-β), cu α și β ambele aproape de 0,34, ceea ce înseamnă că parametrii și datele contribuie aproape simetric. Optimizarea acestui lucru sub o constrângere de calcul fixă (calculați ≈ 6·N·D pentru transformatoare) dă rezultatul de scalare egală. Un model mai mic, bogat în date, este, de asemenea, mai ieftin de rulat la inferență, astfel încât avantajul său este compus în implementare, nu doar în antrenament.
Impact strategic
Decizii mai clare
Vă ajută să separați afirmațiile tehnice clare de limbajul de marketing.
Cost și buget
Puteți pune întrebări de implementare mai bune înainte de a cheltui bani sau timp.
Echipa și fluxul de lucru
Echipele cu înțelegere comună iau decizii mai bune despre produse, politici și învățare.
Viitorul Chinchilla Compute-Instruire optimă
Modelele moderne precum Llama 3 depășesc în mod deliberat raportul de 20 de jetoane pe parametru al lui Chinchilla, antrenând modele mici pe trilioane de jetoane pentru a face inferența ieftină, acceptând calculul de antrenament suboptim. Pe măsură ce datele bune devin rare, interesul crește în epoci repetate, date sintetice și filtrare de calitate. Chinchilla rămâne punctul de referință, dar optimul depinde din ce în ce mai mult de costul de inferență pe viață, nu doar de bugetul unic de antrenament.
Implementare în lumea reală
Alegerea de a antrena un model cu 7 miliarde de parametri pe 2 trilioane de jetoane, mai degrabă decât un model de 30 de miliarde pe date prea puține pentru același buget.
Se estimează că un model cu 10 miliarde de parametri vrea aproximativ 200 de miliarde de jetoane pentru a atinge punctul optim de calcul.
Justificarea unui model implementat mai mic pentru a reduce costurile de inferență pe interogare, în același timp egalând calitatea unui rival mai mare.
Auditarea unui model existent și concluzia că acesta a fost insuficient antrenat, apoi planificarea unei curse de antrenament mai lungă în loc de creșterea parametrilor.
Riscuri și balustrade
Echipe diferite pot folosi același termen în mod diferit, așa că definiți domeniul de aplicare din timp.
Benchmark-urile pot părea puternice, în timp ce performanța în lumea reală este neuniformă.
Ignorarea calității datelor și a planurilor de evaluare generează adesea rezultate fragile.
Foaia de parcurs de implementare
Începeți cu o definiție simplă a rezultatului de care aveți nevoie.
Alegeți o măsură de succes și o condiție de eșec înainte de testare.
Rulați un pilot mic cu date reprezentative, nu un set demonstrativ bine definit.
Document unde ajută Chinchilla Compute-Optimal Training și unde metodele mai simple sunt mai bune.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Antrenament la timpul testului
Întrebări frecvente
What is Chinchilla Compute-Optimal Training?
Chinchilla este o descoperire DeepMind din 2022 că majoritatea modelelor de limbaj mari au fost slab antrenate: pentru un buget de calcul fix, ar trebui să scalați parametrii și datele aproximativ în mod egal, nu doar să construiți un model mai mare. A remodelat modul în care industria echilibrează dimensiunea modelului cu datele de antrenament.
Care este faimoasa regulă de bază a lui Chinchilla pentru antrenamentul optim pentru calcul?
Parametrii și tokenurile găsite de DeepMind ar trebui să fie scalate împreună la aproximativ 20 de simboluri per parametru pentru un anumit buget de calcul.
Cum s-a comparat Chinchilla cu parametrul 70B cu Gopher cu parametrul 280B?
Antrenat pe mult mai multe jetoane cu același calcul, Chinchilla l-a învins pe Gopher mult mai mare în majoritatea benchmark-urilor.
Ce problemă cheie a dezvăluit lucrarea Chinchilla despre modelele mari anterioare?
Modele precum GPT-3 și Gopher erau prea mari în raport cu datele lor de antrenament, lăsând performanța nerealizată.
Aproximativ câte jetoane sugerează regula Chinchilla pentru un model cu 10 miliarde de parametri?
La 20 de jetoane per parametru, 10 miliarde de parametri implică aproximativ 200 de miliarde de jetoane de antrenament.
Pe lângă eficiența antrenamentului, de ce este un model mai mic, bogat în date, atractiv în implementare?
Mai puțini parametri înseamnă un calcul mai mic pe interogare, astfel încât economiile se agravează de fiecare dată când este utilizat modelul.