Chinchilla Compute-optimale training
Chinchilla is een bevinding van DeepMind uit 2022 dat de meeste grote taalmodellen slecht getraind waren: voor een vast rekenbudget moet je parameters en gegevens ongeveer gelijk schalen, en niet alleen een groter model bouwen.
Overzicht
It reshaped how the industry balances model size against training data.
Diepe duik
In het Chinchilla-paper van DeepMind werd de schaal opnieuw bekeken en meer dan 400 modellen getraind om de computeroptimale balans te vinden. De belangrijkste vuistregel: de modelgrootte en trainingstokens moeten in lockstep groeien, ongeveer 20 trainingstokens per parameter. Om dit te bewijzen, trainden ze Chinchilla, een model met 70 miljard parameters op 1,4 biljoen tokens, met behulp van dezelfde rekenkracht als de Gopher met 280 miljard parameters die op veel minder tokens trainde. Ondanks dat Chinchilla vier keer kleiner was, presteerde hij beter dan Gopher, GPT-3 en andere giganten op bijna elke benchmark. De les maakte een einde aan de eerdere OpenAI conclusie, waarin de voorkeur werd gegeven aan grootte boven data, en liet zien dat veel vlaggenschipmodellen de prestaties op tafel lieten liggen omdat ze te groot waren en te weinig data gebruikten.
Technisch inzicht
Chinchilla-fitverlies als L(N,D) = E + A·N^(-α) + B·D^(-β), waarbij α en β beide dichtbij 0,34 liggen, wat betekent dat parameters en gegevens bijna symmetrisch bijdragen. Het optimaliseren hiervan onder een vaste rekenbeperking (berekening ≈ 6·N·D voor transformatoren) levert het resultaat op gelijke schaal op. Een kleiner, datarijk model is ook goedkoper om op basis van gevolgtrekkingen uit te voeren, dus het voordeel ervan komt tot uiting in de implementatie, en niet alleen in training.
Strategische impact
Clearer decisions
Het helpt u duidelijke technische claims te scheiden van marketingtaal.
Cost and budget
U kunt betere implementatievragen stellen voordat u geld of tijd uitgeeft.
Team and workflow
Teams met gedeeld begrip nemen betere product-, beleids- en leerbeslissingen.
De toekomst van Chinchilla Compute-optimale training
Moderne modellen zoals Llama 3 gaan opzettelijk ver voorbij Chinchilla's verhouding van 20 tokens per parameter, trainen kleine modellen op biljoenen tokens om gevolgtrekkingen goedkoop te maken en accepteren suboptimale trainingscomputers. Naarmate goede data schaarser worden, groeit de belangstelling voor herhaalde tijdperken, synthetische data en kwaliteitsfiltering. Chinchilla blijft het referentiepunt, maar het optimale hangt steeds meer af van de kosten van de gevolgtrekking tijdens de levensduur, en niet alleen van het eenmalige trainingsbudget.
Implementatie in de echte wereld
Ervoor kiezen om een model van 7 miljard parameters te trainen op 2 biljoen tokens in plaats van een model van 30 miljard op te weinig data voor hetzelfde budget.
Geschat wordt dat een model met 10 miljard parameters ongeveer 200 miljard tokens nodig heeft om de rekenoptimale sweet spot te bereiken.
Het rechtvaardigen van een kleiner geïmplementeerd model om de kosten per query-inferentie te verlagen en tegelijkertijd de kwaliteit van een grotere concurrent te evenaren.
Een bestaand model controleren en concluderen dat het te weinig getraind was, en vervolgens een langere trainingsrun plannen in plaats van een parameterverhoging.
Risico's en vangrails
Verschillende teams kunnen dezelfde term verschillend gebruiken, dus definieer de reikwijdte vroeg.
Benchmarks kunnen er sterk uitzien, terwijl de prestaties in de echte wereld ongelijkmatig zijn.
Het negeren van datakwaliteit en evaluatieplannen zorgt vaak voor fragiele resultaten.
Implementatie routekaart
Begin met een definitie in duidelijke taal van het gewenste resultaat.
Kies één successtatistiek en één faalconditie voordat u gaat testen.
Voer een kleine pilot uit met representatieve gegevens, niet met een gepolijste demoset.
Documenteer waar Chinchilla Compute-Optimal Training helpt en waar eenvoudigere methoden beter zijn.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Testtijdtraining
Frequently asked questions
What is Chinchilla Compute-Optimal Training?
Chinchilla is een bevinding van DeepMind uit 2022 dat de meeste grote taalmodellen slecht getraind waren: voor een vast rekenbudget moet je parameters en gegevens ongeveer gelijk schalen, en niet alleen een groter model bouwen. Het heeft een nieuwe vorm gegeven aan de manier waarop de industrie de modelomvang afzet tegen trainingsgegevens.
Wat is de beroemde vuistregel van Chinchilla voor computeroptimale training?
DeepMind ontdekte dat parameters en tokens samen moeten worden geschaald met ongeveer 20 tokens per parameter voor een bepaald rekenbudget.
Hoe verhield de 70B-parameter Chinchilla zich tot de 280B-parameter Gopher?
Getraind op veel meer tokens met dezelfde rekenkracht, versloeg Chinchilla de veel grotere Gopher in de meeste benchmarks.
Welk belangrijk probleem onthulde het Chinchilla-artikel over eerdere grote modellen?
Modellen als GPT-3 en Gopher waren te groot in verhouding tot hun trainingsgegevens, waardoor de prestaties niet werden gerealiseerd.
Hoeveel tokens suggereert de Chinchilla-regel grofweg voor een model met 10 miljard parameters?
Bij 20 tokens per parameter impliceren 10 miljard parameters ongeveer 200 miljard trainingstokens.
Waarom is, afgezien van de trainingsefficiëntie, een kleiner, datarijk model aantrekkelijk in gebruik?
Minder parameters betekenen een lagere rekenkracht per query, zodat de besparingen toenemen telkens wanneer het model wordt gebruikt.