Закони за лющене на чинчила
Законите за мащабиране на Chinchilla от DeepMind през 2022 г. показаха, че повечето големи езикови модели са недостатъчно обучени: за фиксиран изчислителен бюджет трябва да мащабирате размера на модела и данните за обучение приблизително в еднаква пропорция.
Преглед
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Дълбоко гмуркане
Преди Chinchilla тенденцията беше да се изграждат все по-големи модели (като 175B-параметър GPT-3), докато се обучават върху относително скромни количества данни. DeepMind обучи над 400 модела в различни размери и бюджети за данни, след което напасна криви, предсказващи загубата като функция на параметри и токени при бюджет с фиксиран изчисление (FLOP). Тяхното откритие: параметрите и токените за обучение трябва да се мащабират заедно, приблизително съотношение 1 към 1, което предполага около 20 токена данни за обучение на параметър. За да го докажат, те обучиха Chinchilla, модел с параметър 70B на 1,4 трилиона токена, който превъзхожда много по-големия Gopher с параметър 280B, въпреки че използва същото изчисление, защото беше обучен на много повече данни.
Техническа информация
Законите идват от монтиране на функция на параметрична загуба L(N, D), където N е параметри и D е жетони, включително условия за нередуцируема загуба, размер на модела и размер на данните. Минимизирането на загубата при изчислително ограничение (изчислението е приблизително пропорционално на N пъти D) води до резултат, че оптималните N и D растат като мощност на изчислението с подобни експоненти, така че съотношението за оптимално изчисление остава близо до 20 токена на параметър.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на законите за мащабиране на чинчили
Chinchilla измести полето от преследване на броя на параметрите към захранване на модели с много по-висококачествени данни, а съвременните модели често се обучават доста след точката на „оптималното изчисление“, за да направят изводите по-евтини. Тъй като висококачественият уеб текст става оскъден, вниманието се насочва към обработка на данни, синтетични данни, множество епохи и мултимодални данни, за да продължи мащабирането. Основният урок продължава: данните и параметрите трябва да бъдат балансирани и целта вече не е само необработеният размер.
Внедряване в реалния свят
Chinchilla със 70B параметър на DeepMind побеждава 280B Gopher при бенчмаркове, използвайки равни изчисления, като тренира върху много повече данни
Насочване на екипите към бюджетиране на приблизително 20 жетона за обучение на параметър, когато планират модел от нулата
Обосноваване на по-малки, богати на данни модели като LLaMA, които са по-евтини за изпълнение по време на извод
Оценяване дали планираният модел е „недостатъчно обучен“ и би се възползвал повече от допълнителни данни, отколкото от допълнителни параметри
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Закони за мащабиране за невронни мрежи
Frequently asked questions
What is Chinchilla Scaling Laws?
Законите за мащабиране на Chinchilla от DeepMind през 2022 г. показаха, че повечето големи езикови модели са недостатъчно обучени: за фиксиран изчислителен бюджет трябва да мащабирате размера на модела и данните за обучение приблизително в еднаква пропорция. Има значение, защото предефинира какво означава „оптимален“ размер на модела и промени начина, по който лабораториите изразходват изчисления.
Кое беше основното откритие на законите за люспене на чинчила?
Chinchilla показа, че за фиксиран изчислителен бюджет, параметрите и токените за обучение трябва да растат заедно, приблизително 1 към 1.
Приблизително колко токена за обучение на параметър предложи Chinchilla, че е оптимално за изчисляване?
Оптималното за изчисление съотношение възлиза на приблизително 20 токена за обучение за всеки параметър на модела.
Кой модел превъзхожда Chinchilla, въпреки че е много по-малък?
Chinchilla с параметър 70B победи собствения Gopher на DeepMind с параметър 280B, използвайки същото изчисление, защото се обучаваше на много повече данни.
Какво намекна Chinchilla за модели като GPT-3 по това време?
Много големи модели от онази епоха са били недостатъчно обучени, което означава, че биха се представили по-добре с много повече данни за техния брой параметри.
Приблизително как беше приблизително изчислението в анализа на Chinchilla?
Обучителните изчисления (FLOPs) са приблизително пропорционални на броя на параметрите, умножен по броя на тренировъчните жетони.