РЪКОВОДСТВО по основи

Закони за мащабиране за невронни мрежи

Законите за мащабиране са емпирични формули, показващи, че загубата на невронна мрежа намалява предсказуемо с нарастването на размера на модела, размера на набора от данни и изчисленията.

2 min readПоследна актуализация

Преглед

They matter because they let researchers forecast performance before spending millions on training a giant model.

Дълбоко гмуркане

Законите за мащабиране, популяризирани от статията на OpenAI от 2020 г. от Каплан и колегите, установиха, че загубата на тестове намалява като плавен степенен закон в три количества: брой параметри (N), токени за обучение (D) и общо изчисление (C). Начертана на логаритмични оси, загубата спрямо всеки фактор образува почти права линия, обхващаща много порядъци. Отношенията приемат формата Загуба ≈ a + b·X^(-c), където X е коефициентът на мащабиране. Най-важното е, че първоначалната работа предполага, че размерът на модела има повече значение от данните, което подтиква надпревара към все по-големи модели като 175 милиарда параметри на GPT-3. Законите за мащабиране превърнаха задълбоченото обучение от догадки в предвидима инженерна дисциплина, позволявайки на екипите да прогнозират широкообхватни резултати от малки, евтини експерименти.

Техническа информация

Формата на степенния закон означава, че всяко фиксирано мултипликативно увеличение на изчислението води до приблизително постоянен адитивен спад на загубата. Загубата се измерва в nats или битове на символ на кръстосана ентропия. Тъй като показателят c е малък (често около 0,05-0,1), печалбите са реални, но намаляващи: удвояването на изчисленията помага много по-малко от първите удвоения. Важно е, че тези закони описват нередуцируема плюс редуцируема загуба, където постоянен термин улавя присъщата ентропия на данните, която никой модел не може да победи.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на законите за мащабиране за невронни мрежи

Изследователите разширяват законите за мащабиране отвъд загубата преди обучението до точността на задачите надолу по веригата, мултимодални модели и изчисление на времето за изводи, където моделите на разсъждение изразходват повече мислене за всяка заявка. Тъй като висококачественият текст става оскъден, вниманието се измества към качеството на данните, синтетичните данни и законите за мащабиране на повтарящи се данни. Някои твърдят, че суровото мащабиране достига практически граници на пари, енергия и наличен текст, тласкайки полето към алгоритмична ефективност и нови архитектури, вместо просто да строи по-голямо.

Внедряване в реалния свят

Прогнозиране на окончателната загуба на планиран модел със 70 милиарда параметри от поредица от малки тестове със 100 милиона параметри, преди да се ангажира бюджет за GPU.

Вземане на решение колко трилиона токени да се съберат, така че фиксираният бюджет за изчисления да не се губи за недостатъчно обучен модел.

Евтино сравняване на две архитектури чрез монтиране на техните мащабиращи криви в малък мащаб, вместо обучение на двете в пълен размер.

Задаване на реалистични очаквания за точност за инвеститори или рецензенти на грантове чрез екстраполиране на кривата на загубите до целево изчислително ниво.

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде законите за мащабиране за невронни мрежи помагат и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Конволюционни невронни мрежи

Frequently asked questions

What is Scaling Laws for Neural Networks?

Законите за мащабиране са емпирични формули, показващи, че загубата на невронна мрежа намалява предсказуемо с нарастването на размера на модела, размера на набора от данни и изчисленията. Те имат значение, защото позволяват на изследователите да прогнозират ефективността, преди да похарчат милиони за обучение на гигантски модел.

На осите log-log как обикновено се държат загубите при тестове, когато изчисленията се увеличават според законите за мащабиране?

Загубата спрямо изчислението, размерът на модела или данните образуват почти права линия върху графиките log-log, подпис на степенно-законова връзка.

Кои три величини са свързани със загубата на оригиналните закони за мащабиране?

Каплан и др. изучава загубата като степенен закон в броя на параметрите (N), жетони за обучение (D) и общо изчисление (C).

Защо законите за мащабиране са толкова ценни за AI лабораториите?

Чрез монтиране на криви в малък мащаб, екипите прогнозират представянето на гигантски модел, преди да похарчат огромни суми.

Какво представлява постоянният (нередуцируем) член във формула за загуба на закон за мащабиране?

Загубата има редуцируема част, която се свива с мащаба плюс нередуцируем праг, определен от присъщата случайност на данните.

Защо печалбите от мащабиране се описват като „намаляващи“?

Тъй като показателят на степенния закон е малък, равните увеличения на мултипликативното изчисление водят до постоянно по-малки абсолютни намаления на загубите.