Zákony o škálování činčily
Zákony o škálování činčily z DeepMind v roce 2022 ukázaly, že většina velkých jazykových modelů byla špatně vyškolena: pro pevný výpočetní rozpočet byste měli velikost modelu a trénovací data zhruba ve stejném poměru.
Přehled
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Hluboký ponor
Před Chinchillou bylo trendem stavět stále větší modely (jako GPT-3 s parametrem 175B) a přitom trénovat na relativně skromném množství dat. Společnost DeepMind trénovala více než 400 modelů v mnoha velikostech a rozpočtech na data, poté přizpůsobila křivky předpovídající ztrátu jako funkci parametrů a tokenů v rámci rozpočtu s pevným výpočtem (FLOP). Jejich zjištění: parametry a tréninkové tokeny by se měly škálovat společně, zhruba v poměru 1:1, což znamená asi 20 tokenů tréninkových dat na parametr. Aby to dokázali, vycvičili Chinchillu, model s parametry 70B na 1,4 bilionu tokenů, který překonal mnohem větší Gopher s parametrem 280B navzdory použití stejného výpočtu, protože byl natrénován na mnohem více datech.
Technický přehled
Zákony vycházejí z přizpůsobení parametrické ztrátové funkce L(N, D), kde N jsou parametry a D jsou tokeny, včetně termínů neredukovatelná ztráta, velikost modelu a velikost dat. Minimalizace ztráty podléhající omezení výpočtu (výpočet je zhruba úměrný N krát D) vede k výsledku, že optimální N i D rostou jako výpočetní síla s podobnými exponenty, takže výpočetně optimální poměr zůstává blízko 20 tokenů na parametr.
Strategický dopad
Rychlost a měřítko
Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.
Přístup a dosah
Rozšiřuje přístup napříč jazyky a komunikačními styly.
Jasnější rozhodnutí
Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.
Budoucnost zákonů škálování činčil
Činčila posunula pole od pronásledování počítání parametrů k poskytování mnohem kvalitnějších dat modelům a moderní modely často trénují daleko za „výpočetně optimální“ bod, aby bylo odvození levnější. Vzhledem k tomu, že vysoce kvalitní webový text ubývá, pozornost se obrací ke správě dat, syntetickým datům, více epochám a multimodálním datům, aby bylo možné nadále škálovat. Základní poučka přetrvává: data a parametry musí být vyvážené a samotná nezpracovaná velikost již není cílem.
Real-World Implementace
Činčila s parametrem 70B společnosti DeepMind porazila 280B Gopher ve srovnávacích testech za použití stejných výpočtů, protože trénoval na mnohem více datech
Vedení týmů k rozpočtu zhruba 20 školicích tokenů na parametr při plánování modelu od začátku
Zdůvodnění menších modelů bohatých na data, jako je LLaMA, které jsou levnější na provoz v době odvození
Odhad, zda je plánovaný model „nedostatečně proškolený“ a měl by větší užitek z extra dat než z extra parametrů
Rizika a zábradlí
Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.
Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.
Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.
Plán implementace
Před zavedením definujte výstupní formát, tón a standardy kvality.
Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.
Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.
Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Zákony škálování pro neuronové sítě
Často kladené otázky
What is Chinchilla Scaling Laws?
Zákony o škálování činčily z DeepMind v roce 2022 ukázaly, že většina velkých jazykových modelů byla špatně vyškolena: pro pevný výpočetní rozpočet byste měli velikost modelu a trénovací data zhruba ve stejném poměru. Je to důležité, protože nově definovalo, co znamená „optimální“ velikost modelu, a přetvořilo způsob, jakým laboratoře tráví výpočty.
Co bylo hlavním zjištěním zákonů o škálování činčil?
Činčila ukázala, že pro pevný výpočetní rozpočet by parametry a tréninkové tokeny měly růst společně, zhruba 1:1.
Přibližně, kolik tréninkových tokenů na parametr Chinchilla navrhla jako výpočetně optimální?
Výpočetně optimální poměr vychází zhruba na 20 tréninkových tokenů pro každý parametr modelu.
Který model Činčila překonala, přestože byla mnohem menší?
Činčila s parametrem 70B porazila vlastní Gopher s parametrem 280B společnosti DeepMind pomocí stejného výpočtu, protože trénovala na mnohem více datech.
Co v té době Činčila naznačovala o modelech jako GPT-3?
Mnoho velkých modelů té doby bylo nedotrénovaných, což znamená, že by fungovaly lépe s mnohem větším množstvím dat pro počet svých parametrů.
Jak byl přibližně aproximován výpočet v analýze činčily?
Tréninkový výpočet (FLOP) je přibližně úměrný počtu parametrů vynásobenému počtem tréninkových žetonů.