Nyelvi AI ÚTMUTATÓ

A csincsilla méretezési törvényei

A DeepMind 2022-es Chinchilla skálázási törvényei kimutatták, hogy a legtöbb nagy nyelvi modell erősen alulképzett volt: fix számítási költségkerethez a modell méretét és a betanítási adatokat nagyjából egyenlő arányban kell méretezni.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Mély merülés

A Chinchilla előtt a tendencia az volt, hogy egyre nagyobb modelleket (például a 175B-s paraméterű GPT-3-at) építsenek, miközben viszonylag szerény adatmennyiségre oktattak. A DeepMind több mint 400 modellt tanított ki számos méretben és adatköltségvetésben, majd fix számítási (FLOP) költségvetés mellett a paraméterek és a tokenek függvényében a veszteséget előrejelző görbéket illesztette. Megállapításuk: a paramétereknek és a betanítási jelzőknek együtt kell skálázniuk, nagyjából 1:1 arányban, ami körülbelül 20 token betanítási adatot jelent paraméterenként. Ennek bizonyítására 1,4 billió tokenre oktatták a Chinchillát, egy 70B-s paraméterű modellt, amely felülmúlta a sokkal nagyobb, 280B-s paraméterű Gopher-t annak ellenére, hogy ugyanazt a számítást használta, mert sokkal több adatra tanították.

Technikai betekintés

A törvények egy L(N, D) paraméteres veszteségfüggvény illesztéséből származnak, ahol N a paraméterek és D a tokenek, beleértve az irreducibilis veszteséget, a modellméretet és az adatméretet. A számítási kényszerhez kötött veszteség minimalizálása (a számítás nagyjából N-szeres D-vel arányos) azt az eredményt adja, hogy az optimális N és D egyaránt növekszik a számítási hatványként hasonló kitevőkkel, így a számítási optimális arány paraméterenként 20 token közelében marad.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A csincsilla méretezési törvényeinek jövője

A Chinchilla a paraméterek számlálásának üldözéséről a modellek sokkal jó minőségű adatokkal való táplálására helyezte át a terepet, és a modern modellek gyakran jóval túlhaladják a „számítási optimális” pontot, hogy olcsóbbá tegyék a következtetéseket. Amint a jó minőségű webszöveg egyre ritkább, a figyelem az adatkezelésre, a szintetikus adatokra, a több korszakra és a multimodális adatokra irányul a folyamatos méretezés érdekében. Az alapvető tanulság megmarad: az adatoknak és a paramétereknek egyensúlyban kell lenniük, és már nem a nyers méret a cél.

Valós megvalósítás

A DeepMind 70B-s paraméterű Chinchilla a benchmarkokon verte meg a 280B-s Gophert, egyenlő számítással, sokkal több adatra oktatva

Útmutató a csapatoknak, hogy paraméterenként nagyjából 20 képzési token költségvetését tervezzék meg a semmiből

A kisebb, adatban gazdag modellek igazolása, mint például a LLaMA, amelyek futtatása olcsóbb a következtetési időben

Annak becslése, hogy egy tervezett modell „alulképzett”-e, és többet profitálna-e a többletadatokból, mint a plusz paraméterekből

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Neurális hálózatok méretezési törvényei

Gyakran ismételt kérdések

What is Chinchilla Scaling Laws?

A DeepMind 2022-es Chinchilla skálázási törvényei kimutatták, hogy a legtöbb nagy nyelvi modell erősen alulképzett volt: fix számítási költségkerethez a modell méretét és a betanítási adatokat nagyjából egyenlő arányban kell méretezni. Ez azért fontos, mert újradefiniálta, hogy mit jelent az „optimális” modellméret, és átformálta a laborok költésének számítását.

Mi volt a csincsilla méretezési törvényeinek központi megállapítása?

Chinchilla megmutatta, hogy egy rögzített számítási költségvetéshez a paramétereknek és a képzési tokeneknek együtt kell növekedniük, nagyjából 1-1 arányban.

Körülbelül hány képzési token paraméterenként javasolta Chinchilla számítási szempontból optimálisnak?

A számítási optimális arány nagyjából 20 betanítási tokennek felel meg minden modellparaméterhez.

Melyik modell teljesített jobban Chinchilla annak ellenére, hogy sokkal kisebb?

A 70B-s paraméterű Chinchilla ugyanazzal a számítással verte a DeepMind saját 280B-s Gopher-jét, mert sokkal több adatra edzett.

Mit mondott Chinchilla akkoriban az olyan modellekről, mint a GPT-3?

A korszak számos nagy modellje alulképzett volt, ami azt jelenti, hogy jobban teljesítettek volna, ha sokkal több adatot kaptak volna a paramétereikhez.

Körülbelül hogyan közelítették a számítást a Chinchilla elemzésben?

A képzési számítás (FLOP) megközelítőleg arányos a paraméterek számának és a képzési tokenek számának szorzatával.