Optimální počítačový výcvik činčily
Činčila je zjištěním DeepMind z roku 2022, že většina velkých jazykových modelů byla špatně proškolena: pro pevný výpočetní rozpočet byste měli parametry a data škálovat zhruba stejně, ne pouze postavit větší model.
Přehled
Změnila způsob, jakým průmysl vyvažuje velikost modelu s trénačními daty.
Hluboký ponor
Činčilský dokument DeepMind přehodnotil škálování a vycvičil více než 400 modelů, aby našel výpočetně optimální rovnováhu. Základní pravidlo: velikost modelu a tréninkové tokeny by měly růst postupně, zhruba 20 tréninkových tokenů na parametr. Aby to dokázali, vytrénovali Chinchillu, model se 70 miliardami parametrů na 1,4 bilionu tokenů, za použití stejného výpočtu jako Gopher s 280 miliardami parametrů trénovaný na mnohem menším počtu tokenů. Činčila, přestože byla čtyřikrát menší, překonala Gopher, GPT-3 a další giganty téměř ve všech benchmarkech. Lekce vyvrátila dřívější závěr OpenAI, který upřednostňoval velikost před daty, a ukázal, že mnoho vlajkových modelů ponechává výkon na stole tím, že jsou příliš velké a příliš spotřebovávají data.
Technický přehled
Ztráta přizpůsobení činčily jako L(N,D) = E + A·N^(-α) + B·D^(-β), přičemž α a β se blíží 0,34, což znamená, že parametry a data přispívají téměř symetricky. Optimalizace při pevném výpočetním omezení (výpočet ≈ 6·N·D pro transformátory) přináší výsledek se stejným měřítkem. Menší, na data bohatý model je také levnější na provoz na základě odvození, takže jeho výhoda se sčítá při nasazení, nejen při tréninku.
Strategický dopad
Jasnější rozhodnutí
Pomůže vám oddělit jasná technická tvrzení od marketingového jazyka.
Cena a rozpočet
Než utratíte peníze nebo čas, můžete se zeptat na lepší implementační otázky.
Tým a pracovní postup
Týmy se sdíleným porozuměním dělají lepší rozhodnutí o produktech, zásadách a učení.
Budoucnost počítačově optimálního školení pro činčily
Moderní modely, jako je Llama 3, záměrně překračují poměr 20 tokenů na parametr Chinchilla, trénují malé modely na bilionech tokenů, aby byly závěry levné, a přijímají suboptimální trénovací výpočet. Vzhledem k tomu, že dobrých dat ubývá, roste zájem o opakované epochy, syntetická data a kvalitní filtrování. Činčila zůstává referenčním bodem, ale optimum stále více závisí na celoživotních inferenčních nákladech, nikoli pouze na rozpočtu na jednorázové školení.
Real-World Implementace
Volba trénovat model se 7 miliardami parametrů na 2 bilionech tokenů namísto 30miliardového modelu s příliš malým množstvím dat za stejný rozpočet.
Odhaduje se, že model s 10 miliardami parametrů potřebuje zhruba 200 miliard tokenů, aby dosáhl výpočetně optimálního sladkého bodu.
Zdůvodnění menšího nasazeného modelu, aby se snížily náklady na odvození na dotaz a zároveň se vyrovnaly kvalitě většího soupeře.
Auditování stávajícího modelu a závěr, že nebyl dostatečně proškolený, pak naplánování delšího tréninku namísto navýšení parametrů.
Rizika a zábradlí
Různé týmy mohou používat stejný termín odlišně, proto definujte rozsah včas.
Srovnávací testy mohou vypadat dobře, zatímco výkon v reálném světě je nerovnoměrný.
Ignorování kvality dat a plánů hodnocení často vytváří křehké výsledky.
Plán implementace
Začněte s jasnou definicí výsledku, který potřebujete.
Před testováním vyberte jednu metriku úspěchu a jednu podmínku selhání.
Spusťte malý pilotní projekt s reprezentativními údaji, nikoli leštěnou ukázkovou sadu.
Zdokumentujte, kde Činčila Compute-Optimal Training pomáhá a kde jsou jednodušší metody lepší.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Trénink na zkoušku
Často kladené otázky
Co je výpočetně optimální trénink činčily?
Činčila je zjištěním DeepMind z roku 2022, že většina velkých jazykových modelů byla špatně proškolena: pro pevný výpočetní rozpočet byste měli parametry a data škálovat zhruba stejně, ne pouze postavit větší model. Přetvořilo to, jak průmysl vyvažuje velikost modelu a tréninková data.
Jaké je známé Činčilovo pravidlo pro výpočetně optimální trénink?
Parametry a tokeny nalezené DeepMind by se měly společně škálovat zhruba na 20 tokenů na parametr pro daný výpočetní rozpočet.
Jak dopadla činčila s parametrem 70B ve srovnání s Gopherem s parametrem 280B?
Činčila, trénovaná na mnohem více tokenech se stejným výkonem, porazila mnohem větší Gopher ve většině benchmarků.
Jaký klíčový problém odhalil článek Činčily o předchozích velkých modelech?
Modely jako GPT-3 a Gopher byly příliš velké vzhledem k jejich tréninkovým datům, takže výkon zůstal nerealizovaný.
Kolik tokenů zhruba navrhuje pravidlo činčily pro model s 10 miliardami parametrů?
Při 20 tokenech na parametr znamená 10 miliard parametrů přibližně 200 miliard tréninkových tokenů.
Proč je kromě efektivity školení atraktivní při nasazení menší model bohatý na data?
Méně parametrů znamená nižší výpočet na dotaz, takže úspory se skládají při každém použití modelu.