PRŮVODCE Základy

Optimální počítačový výcvik činčily

Činčila je zjištěním DeepMind z roku 2022, že většina velkých jazykových modelů byla špatně proškolena: pro pevný výpočetní rozpočet byste měli parametry a data škálovat zhruba stejně, ne pouze postavit větší model.

2 minuty čteníNaposledy aktualizováno

Přehled

Změnila způsob, jakým průmysl vyvažuje velikost modelu s trénačními daty.

Hluboký ponor

Činčilský dokument DeepMind přehodnotil škálování a vycvičil více než 400 modelů, aby našel výpočetně optimální rovnováhu. Základní pravidlo: velikost modelu a tréninkové tokeny by měly růst postupně, zhruba 20 tréninkových tokenů na parametr. Aby to dokázali, vytrénovali Chinchillu, model se 70 miliardami parametrů na 1,4 bilionu tokenů, za použití stejného výpočtu jako Gopher s 280 miliardami parametrů trénovaný na mnohem menším počtu tokenů. Činčila, přestože byla čtyřikrát menší, překonala Gopher, GPT-3 a další giganty téměř ve všech benchmarkech. Lekce vyvrátila dřívější závěr OpenAI, který upřednostňoval velikost před daty, a ukázal, že mnoho vlajkových modelů ponechává výkon na stole tím, že jsou příliš velké a příliš spotřebovávají data.

Technický přehled

Ztráta přizpůsobení činčily jako L(N,D) = E + A·N^(-α) + B·D^(-β), přičemž α a β se blíží 0,34, což znamená, že parametry a data přispívají téměř symetricky. Optimalizace při pevném výpočetním omezení (výpočet ≈ 6·N·D pro transformátory) přináší výsledek se stejným měřítkem. Menší, na data bohatý model je také levnější na provoz na základě odvození, takže jeho výhoda se sčítá při nasazení, nejen při tréninku.

Strategický dopad

Jasnější rozhodnutí

Pomůže vám oddělit jasná technická tvrzení od marketingového jazyka.

Cena a rozpočet

Než utratíte peníze nebo čas, můžete se zeptat na lepší implementační otázky.

Tým a pracovní postup

Týmy se sdíleným porozuměním dělají lepší rozhodnutí o produktech, zásadách a učení.

Budoucnost počítačově optimálního školení pro činčily

Moderní modely, jako je Llama 3, záměrně překračují poměr 20 tokenů na parametr Chinchilla, trénují malé modely na bilionech tokenů, aby byly závěry levné, a přijímají suboptimální trénovací výpočet. Vzhledem k tomu, že dobrých dat ubývá, roste zájem o opakované epochy, syntetická data a kvalitní filtrování. Činčila zůstává referenčním bodem, ale optimum stále více závisí na celoživotních inferenčních nákladech, nikoli pouze na rozpočtu na jednorázové školení.

Real-World Implementace

Volba trénovat model se 7 miliardami parametrů na 2 bilionech tokenů namísto 30miliardového modelu s příliš malým množstvím dat za stejný rozpočet.

Odhaduje se, že model s 10 miliardami parametrů potřebuje zhruba 200 miliard tokenů, aby dosáhl výpočetně optimálního sladkého bodu.

Zdůvodnění menšího nasazeného modelu, aby se snížily náklady na odvození na dotaz a zároveň se vyrovnaly kvalitě většího soupeře.

Auditování stávajícího modelu a závěr, že nebyl dostatečně proškolený, pak naplánování delšího tréninku namísto navýšení parametrů.

Rizika a zábradlí

Různé týmy mohou používat stejný termín odlišně, proto definujte rozsah včas.

Srovnávací testy mohou vypadat dobře, zatímco výkon v reálném světě je nerovnoměrný.

Ignorování kvality dat a plánů hodnocení často vytváří křehké výsledky.

Plán implementace

1

Začněte s jasnou definicí výsledku, který potřebujete.

2

Před testováním vyberte jednu metriku úspěchu a jednu podmínku selhání.

3

Spusťte malý pilotní projekt s reprezentativními údaji, nikoli leštěnou ukázkovou sadu.

4

Zdokumentujte, kde Činčila Compute-Optimal Training pomáhá a kde jsou jednodušší metody lepší.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

Co je výpočetně optimální trénink činčily?

Činčila je zjištěním DeepMind z roku 2022, že většina velkých jazykových modelů byla špatně proškolena: pro pevný výpočetní rozpočet byste měli parametry a data škálovat zhruba stejně, ne pouze postavit větší model. Přetvořilo to, jak průmysl vyvažuje velikost modelu a tréninková data.

Jaké je známé Činčilovo pravidlo pro výpočetně optimální trénink?

Parametry a tokeny nalezené DeepMind by se měly společně škálovat zhruba na 20 tokenů na parametr pro daný výpočetní rozpočet.

Jak dopadla činčila s parametrem 70B ve srovnání s Gopherem s parametrem 280B?

Činčila, trénovaná na mnohem více tokenech se stejným výkonem, porazila mnohem větší Gopher ve většině benchmarků.

Jaký klíčový problém odhalil článek Činčily o předchozích velkých modelech?

Modely jako GPT-3 a Gopher byly příliš velké vzhledem k jejich tréninkovým datům, takže výkon zůstal nerealizovaný.

Kolik tokenů zhruba navrhuje pravidlo činčily pro model s 10 miliardami parametrů?

Při 20 tokenech na parametr znamená 10 miliard parametrů přibližně 200 miliard tréninkových tokenů.

Proč je kromě efektivity školení atraktivní při nasazení menší model bohatý na data?

Méně parametrů znamená nižší výpočet na dotaz, takže úspory se skládají při každém použití modelu.