РЪКОВОДСТВО по основи

Намаляване на теглото и регулиране на L2

Намаляването на теглото е проста, мощна техника, която тласка теглата на модела към нула по време на тренировка, обезсърчавайки го да разчита твърде много на която и да е отделна функция.

2 min readПоследна актуализация

Преглед

It reduces overfitting and is one of the most widely used regularizers in deep learning.

Дълбоко гмуркане

Когато един модел тренира, той може да се захване с шума в данните чрез увеличаване на големи, фино настроени тегла, които пасват идеално на тренировъчния набор, но не се обобщават. Регулирането на L2 се бори с това чрез добавяне на наказание, пропорционално на сумата от теглата на квадрат към функцията на загубата. Сега оптимизаторът има две цели: да събере данните и да поддържа малки тегла, така че да се спре на по-гладки и по-стабилни решения. Разпадането на теглото е тясно свързаната идея за свиване на всяко тегло с малка част при всяка стъпка на актуализиране. При обикновен градиентен низход двете са математически еквивалентни, но при адаптивните оптимизатори като Adam те се различават, поради което AdamW беше въведен, за да отдели затихването от базираната на градиент актуализация и да го накара да се държи правилно.

Техническа информация

Регулирането L2 добавя ламбда, умножено по сумата от теглата на квадрат към загубата, така че нейният градиент добавя член, пропорционален на всяко тегло, като го изтегля към нула. Разделеното разпадане на теглото вместо това умножава всяко тегло директно по коефициент като (1 минус learning_rate умножено по ламбда). При адаптивните методи, свързването на L2 към загубата позволява мащабирането на параметър да изкриви наказанието, така че AdamW прилага свиването отделно, възстановявайки планираното равномерно изтегляне към по-малки тегла.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на намаляването на теглото и регулирането на L2

Weight decay остава съставка по подразбиране в рецептите за обучение на големи езикови модели и трансформатори на зрението и AdamW сега е стандартният оптимизатор за тях. Продължават изследванията за това как разпадането взаимодейства с графиците за скорост на обучение, нормализиращите слоеве и мащаба на модела, тъй като неговата ефективна сила се променя с нарастването на моделите. Очаквайте по-принципно, евентуално за всеки слой или съобразено с графика настройка на затихване, тъй като автоматизираното търсене на хиперпараметри и изследванията на законите за мащабиране стават зрели.

Внедряване в реалния свят

Добавяне на weight_decay в оптимизатора AdamW или SGD на PyTorch при обучение на класификатори на изображения за ограничаване на пренастройването

Настройване на ламбда коефициента в регресията на ръба, класическия L2-наказан линеен модел, за стабилизиране на прогнозите за корелирани характеристики

Рецепти за предварителна тренировка с голям езиков модел, които задават малък спад на теглото (често около 0,1) заедно с график за скорост на обучение

Комбиниране на намаляване на теглото с увеличаване на данните и отпадане, за да се предпази малък модел с медицинско изображение от запомняне на ограничени сканирания за обучение

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде Weight Decay и L2 Regularization помагат и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Регулиране

Frequently asked questions

What is Weight Decay and L2 Regularization?

Намаляването на теглото е проста, мощна техника, която тласка теглата на модела към нула по време на тренировка, обезсърчавайки го да разчита твърде много на която и да е отделна функция. Той намалява пренастройването и е един от най-широко използваните регулаторни средства в дълбокото обучение.

Какво добавя регулацията на L2 към функцията за загуба?

Регулирането на L2 добавя ламбда, умножено по сумата от теглата на квадрат, наказвайки големите тегла и насърчавайки по-малки, по-плавни решения.

Кой е основният проблем, който намаляването на теглото помага да се предотврати?

Поддържайки малки тегла, затихването на теглото обезсърчава модела да напасва шума, подобрявайки обобщаването към нови данни.

В каква посока намаляването на теглото тласка теглото на модела?

Weight decay свива теглата към нула при всяка актуализация, поради което понякога се описва като „разпадане“ на теглата.

Защо беше представен AdamW?

В Адам сгъването на L2 в загубата взаимодейства зле с мащабирането на параметър; AdamW прилага гниене отделно, за да възстанови планираното равномерно свиване.

За обикновен стохастичен градиент на спускане, как са свързани L2 регулацията и разпадането на теглото?

При обикновен SGD добавянето на наказание L2 към загубата води до същата актуализация като директното свиване на теглата, така че двете са еквивалентни.