Chinchilla Compute-Optimal Training
A Chinchilla egy 2022-es DeepMind megállapítása, hogy a legtöbb nagy nyelvi modell erősen alulképzett volt: egy fix számítási költségvetéshez a paramétereket és az adatokat nagyjából egyenlő arányban kell méretezni, nem csak egy nagyobb modellt építeni.
Áttekintés
It reshaped how the industry balances model size against training data.
Mély merülés
A DeepMind Chinchilla papírja újra megvizsgálta a méretezést, és több mint 400 modellt képezett ki, hogy megtalálják az optimális számítási egyensúlyt. A fejléc ökölszabálya: a modell méretének és a képzési jelzőknek lockstep-ben kell növekedniük, paraméterenként nagyjából 20 képzési tokennek kell lennie. Ennek bizonyítására Chinchillát, egy 70 milliárd paraméterű modellt 1400 milliárd tokenre képezték ki, ugyanazt a számítást alkalmazva, mint a 280 milliárd paraméterű Gopher sokkal kevesebb tokenre. A Chinchilla annak ellenére, hogy négyszer kisebb, szinte minden benchmarkon felülmúlta a Gophert, a GPT-3-at és más óriásokat. A lecke megdöntötte a korábbi OpenAI következtetést, amely a méretet részesítette előnyben az adatokkal szemben, és azt mutatta, hogy sok zászlóshajó-modell nem hagyja el a teljesítményt, mivel túl nagyok és túlságosan adathiányosak.
Technikai betekintés
A csincsilla illeszkedési vesztesége L(N,D) = E + A·N^(-α) + B·D^(-β), α és β egyaránt közel 0,34, ami azt jelenti, hogy a paraméterek és az adatok csaknem szimmetrikusan járulnak hozzá. Ennek optimalizálása rögzített számítási kényszer mellett (transzformátorok esetén ≈ 6·N·D kiszámítása) egyenlő skálázási eredményt eredményez. Egy kisebb, adatban gazdag modellt a következtetések levonásával is olcsóbb futtatni, így előnye a telepítés során is fokozódik, nem csak a képzésben.
Stratégiai hatás
Tisztább döntések
Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.
Költség és költségvetés
Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.
Csapat és munkafolyamat
A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.
A Chinchilla Compute-Optimal Training jövője
A modern modellek, mint a Llama 3, szándékosan túllépik a Chinchilla 20 token/paraméter arányát, kis modelleket trillió tokenekre tanítva, hogy olcsó következtetéseket lehessen levonni, elfogadva a szuboptimális képzési számításokat. Ahogy egyre fogy a jó adat, úgy nő az érdeklődés az ismétlődő korszakok, a szintetikus adatok és a minőségi szűrés iránt. A csincsilla továbbra is a referenciapont, de az optimum egyre inkább az élettartamra vonatkozó következtetési költségektől függ, nem csak az egyszeri képzési költségvetéstől.
Valós megvalósítás
Egy 7 milliárd paraméterű modell 2 billió tokenre történő betanítása helyett egy 30 milliárdos modellt, amely túl kevés adattal azonos költségvetés mellett.
Becslések szerint egy 10 milliárd paraméterű modell nagyjából 200 milliárd tokenre vágyik, hogy elérje a számítási szempontból optimális édes pontot.
Egy kisebb telepített modell indoklása a lekérdezésenkénti következtetési költségek csökkentése érdekében, miközben megfelel egy nagyobb rivális minőségének.
Egy meglévő modell auditálása és lezárása alulképzett volt, majd a paraméternövelés helyett hosszabb edzésterv tervezése.
Kockázatok és védőkorlátok
A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.
A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.
Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.
Végrehajtási ütemterv
Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.
A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.
Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.
Dokumentálja, hol segít a Chinchilla Compute-Optimal Training, és hol jobbak az egyszerűbb módszerek.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Tesztidős képzés
Gyakran ismételt kérdések
What is Chinchilla Compute-Optimal Training?
A Chinchilla egy 2022-es DeepMind megállapítása, hogy a legtöbb nagy nyelvi modell erősen alulképzett volt: egy fix számítási költségvetéshez a paramétereket és az adatokat nagyjából egyenlő arányban kell méretezni, nem csak egy nagyobb modellt építeni. Átalakította azt, ahogy az iparág egyensúlyba hozza a modellméretet a képzési adatokkal.
Mi a Chinchilla híres hüvelykujjszabálya a számítási szempontból optimális edzéshez?
A DeepMind talált paramétereinek és tokeneknek együtt kell skálázniuk nagyjából 20 tokennel paraméterenként egy adott számítási költségvetéshez.
Milyen volt a 70B paraméterű Chinchilla a 280B paraméterű Gopherhez képest?
Sokkal több tokenre edzett, ugyanazzal a számítással, a Chinchilla a legtöbb benchmarkon felülmúlta a sokkal nagyobb Gophert.
Milyen kulcsfontosságú problémát tárt fel a Chinchilla tanulmány a korábbi nagy modellekkel kapcsolatban?
Az olyan modellek, mint a GPT-3 és a Gopher, túl nagyok voltak az edzési adataikhoz képest, így a teljesítmény nem valósult meg.
Körülbelül hány tokent javasol a csincsilla-szabály egy 10 milliárd paraméteres modellhez?
Paraméterenként 20 tokennél 10 milliárd paraméter körülbelül 200 milliárd képzési tokent jelent.
A képzési hatékonyság mellett miért vonzó egy kisebb, adatban gazdag modell a bevezetésben?
A kevesebb paraméter alacsonyabb lekérdezésenkénti számítást jelent, így a megtakarítás minden alkalommal, amikor a modellt használja.