Jazyk AI GUIDE

Zákony o škálování činčily

Zákony o škálování činčily z DeepMind v roce 2022 ukázaly, že většina velkých jazykových modelů byla špatně vyškolena: pro pevný výpočetní rozpočet byste měli velikost modelu a trénovací data zhruba ve stejném poměru.

2 minuty čteníNaposledy aktualizováno

Přehled

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Hluboký ponor

Před Chinchillou bylo trendem stavět stále větší modely (jako GPT-3 s parametrem 175B) a přitom trénovat na relativně skromném množství dat. Společnost DeepMind trénovala více než 400 modelů v mnoha velikostech a rozpočtech na data, poté přizpůsobila křivky předpovídající ztrátu jako funkci parametrů a tokenů v rámci rozpočtu s pevným výpočtem (FLOP). Jejich zjištění: parametry a tréninkové tokeny by se měly škálovat společně, zhruba v poměru 1:1, což znamená asi 20 tokenů tréninkových dat na parametr. Aby to dokázali, vycvičili Chinchillu, model s parametry 70B na 1,4 bilionu tokenů, který překonal mnohem větší Gopher s parametrem 280B navzdory použití stejného výpočtu, protože byl natrénován na mnohem více datech.

Technický přehled

Zákony vycházejí z přizpůsobení parametrické ztrátové funkce L(N, D), kde N jsou parametry a D jsou tokeny, včetně termínů neredukovatelná ztráta, velikost modelu a velikost dat. Minimalizace ztráty podléhající omezení výpočtu (výpočet je zhruba úměrný N krát D) vede k výsledku, že optimální N i D rostou jako výpočetní síla s podobnými exponenty, takže výpočetně optimální poměr zůstává blízko 20 tokenů na parametr.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost zákonů škálování činčil

Činčila posunula pole od pronásledování počítání parametrů k poskytování mnohem kvalitnějších dat modelům a moderní modely často trénují daleko za „výpočetně optimální“ bod, aby bylo odvození levnější. Vzhledem k tomu, že vysoce kvalitní webový text ubývá, pozornost se obrací ke správě dat, syntetickým datům, více epochám a multimodálním datům, aby bylo možné nadále škálovat. Základní poučka přetrvává: data a parametry musí být vyvážené a samotná nezpracovaná velikost již není cílem.

Real-World Implementace

Činčila s parametrem 70B společnosti DeepMind porazila 280B Gopher ve srovnávacích testech za použití stejných výpočtů, protože trénoval na mnohem více datech

Vedení týmů k rozpočtu zhruba 20 školicích tokenů na parametr při plánování modelu od začátku

Zdůvodnění menších modelů bohatých na data, jako je LLaMA, které jsou levnější na provoz v době odvození

Odhad, zda je plánovaný model „nedostatečně proškolený“ a měl by větší užitek z extra dat než z extra parametrů

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Zákony škálování pro neuronové sítě

Často kladené otázky

What is Chinchilla Scaling Laws?

Zákony o škálování činčily z DeepMind v roce 2022 ukázaly, že většina velkých jazykových modelů byla špatně vyškolena: pro pevný výpočetní rozpočet byste měli velikost modelu a trénovací data zhruba ve stejném poměru. Je to důležité, protože nově definovalo, co znamená „optimální“ velikost modelu, a přetvořilo způsob, jakým laboratoře tráví výpočty.

Co bylo hlavním zjištěním zákonů o škálování činčil?

Činčila ukázala, že pro pevný výpočetní rozpočet by parametry a tréninkové tokeny měly růst společně, zhruba 1:1.

Přibližně, kolik tréninkových tokenů na parametr Chinchilla navrhla jako výpočetně optimální?

Výpočetně optimální poměr vychází zhruba na 20 tréninkových tokenů pro každý parametr modelu.

Který model Činčila překonala, přestože byla mnohem menší?

Činčila s parametrem 70B porazila vlastní Gopher s parametrem 280B společnosti DeepMind pomocí stejného výpočtu, protože trénovala na mnohem více datech.

Co v té době Činčila naznačovala o modelech jako GPT-3?

Mnoho velkých modelů té doby bylo nedotrénovaných, což znamená, že by fungovaly lépe s mnohem větším množstvím dat pro počet svých parametrů.

Jak byl přibližně aproximován výpočet v analýze činčily?

Tréninkový výpočet (FLOP) je přibližně úměrný počtu parametrů vynásobenému počtem tréninkových žetonů.