Chinchilla Compute-Оптимално обучение
Chinchilla е откритие на DeepMind за 2022 г., че повечето големи езикови модели са били зле обучени: за фиксиран изчислителен бюджет трябва да мащабирате параметрите и данните приблизително еднакво, а не просто да изградите по-голям модел.
Преглед
It reshaped how the industry balances model size against training data.
Дълбоко гмуркане
Документът Chinchilla на DeepMind преразгледа мащабирането и обучи над 400 модела, за да намерят оптималния баланс за изчисляване. Основното правило: размерът на модела и жетоните за обучение трябва да растат в синхрон, приблизително 20 жетона за обучение на параметър. За да го докажат, те обучиха Chinchilla, модел със 70 милиарда параметъра на 1,4 трилиона токена, използвайки същото изчисление като Gopher с 280 милиарда параметъра, обучен на много по-малко токени. Chinchilla, въпреки че е четири пъти по-малък, превъзхожда Gopher, GPT-3 и други гиганти на почти всеки показател. Урокът преобърна по-ранното заключение на OpenAI, че се предпочита размерът пред данните, показвайки, че много водещи модели оставят производителността на масата, тъй като са твърде големи и твърде гладни за данни.
Техническа информация
Загуба на съответствие на чинчила като L(N,D) = E + A·N^(-α) + B·D^(-β), като α и β са близо до 0,34, което означава, че параметрите и данните допринасят почти симетрично. Оптимизирането на това при фиксирано изчислително ограничение (изчисление ≈ 6·N·D за трансформатори) дава резултат с равно мащабиране. По-малък, богат на данни модел също е по-евтин за изпълнение при извод, така че предимството му се комбинира при внедряване, а не само при обучение.
Стратегическо въздействие
Clearer decisions
Помага ви да отделите ясните технически твърдения от маркетинговия език.
Cost and budget
Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.
Team and workflow
Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.
Бъдещето на Chinchilla Compute-оптимално обучение
Съвременните модели като Llama 3 умишлено надминават съотношението 20 токена на параметър на Chinchilla, обучавайки малки модели на трилиони токени, за да направят изводите евтини, като приемат неоптимални изчисления за обучение. Тъй като добрите данни стават все по-малко, нараства интересът към повтарящите се епохи, синтетичните данни и качественото филтриране. Чинчила остава отправна точка, но оптимумът все повече зависи от разходите за изводи през целия живот, а не само от бюджета за еднократно обучение.
Внедряване в реалния свят
Изборът да се обучи модел със 7 милиарда параметъра върху 2 трилиона токена вместо модел с 30 милиарда върху твърде малко данни за същия бюджет.
Изчислявайки, че модел с 10 милиарда параметъра иска приблизително 200 милиарда жетона, за да достигне оптималната за изчисления сладка точка.
Обосноваване на по-малък разгърнат модел за намаляване на разходите за извод на заявка, като същевременно съответства на качеството на по-голям конкурент.
Одитиране на съществуващ модел и заключение, че е бил недостатъчно обучен, след което планиране на по-дълъг тренировъчен цикъл вместо увеличаване на параметъра.
Рискове и предпазни огради
Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.
Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.
Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.
Пътна карта за изпълнение
Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.
Изберете един показател за успех и едно условие за неуспех преди тестване.
Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.
Документирайте къде Chinchilla Compute-Optimal Training помага и къде по-простите методи са по-добри.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Обучение по време на тест
Frequently asked questions
What is Chinchilla Compute-Optimal Training?
Chinchilla е откритие на DeepMind за 2022 г., че повечето големи езикови модели са били зле обучени: за фиксиран изчислителен бюджет трябва да мащабирате параметрите и данните приблизително еднакво, а не просто да изградите по-голям модел. Той промени начина, по който индустрията балансира размера на модела спрямо данните за обучение.
Кое е известното основно правило на Chinchilla за оптимално изчислително обучение?
Намерените от DeepMind параметри и токени трябва да се мащабират заедно при приблизително 20 токена на параметър за даден изчислителен бюджет.
Как се сравнява Chinchilla с параметър 70B и Gopher с параметър 280B?
Обучен на много повече токени със същото изчисление, Chinchilla победи много по-големия Gopher в повечето показатели.
Какъв ключов проблем разкри документът на Chinchilla за предишни големи модели?
Модели като GPT-3 и Gopher бяха твърде големи спрямо техните данни за обучение, оставяйки ефективността нереализирана.
Приблизително колко жетони предполага правилото на Чинчила за модел с 10 милиарда параметъра?
При 20 токена на параметър, 10 милиарда параметъра предполагат около 200 милиарда токена за обучение.
Освен ефективността на обучението, защо по-малък, богат на данни модел е привлекателен при внедряване?
По-малко параметри означават по-ниско изчисление на заявка, така че спестяванията се увеличават всеки път, когато моделът се използва.