РЪКОВОДСТВО по основи

Стохастично градиентно спускане с инерция

Momentum е настройка за градиентно спускане, която акумулира текуща средна стойност на минали градиенти, позволявайки на оптимизацията да се движи по-бързо през долини и да намалява колебанията.

2 min readПоследна актуализация

Преглед

It is one of the most widely used training tricks in deep learning.

Дълбоко гмуркане

Обикновен стохастичен градиент на спускане (SGD) актуализира параметрите, като стъпва в посока, противоположна на текущия мини-партиден градиент. В пейзажи, оформени като дълги, тесни клисури, това се движи на зиг-заг през стръмните стени, докато пълзи по полегатия под. Momentum, популяризиран от Polyak и по-късно от Rumelhart и колеги, коригира това чрез поддържане на вектор на скоростта: всяка стъпка смесва новия градиент с част (коефициента на импулса, често 0,9) от предишната скорост. Последователните посоки на градиента подсилват и ускоряват, докато осцилиращите компоненти частично компенсират. Физическата аналогия е тежка топка, търкаляща се надолу: тя развива скорост в постоянни посоки и е по-малко отклонена от шумни неравности, осигурявайки по-бърза и по-плавна конвергенция от ванилия SGD.

Техническа информация

Актуализацията поддържа скорост v, която се актуализира като v = бета * v + градиент, след което параметрите се преместват минус скоростта на обучение, умножена по v. С коефициента на импулса бета, ефективната стъпка в последователна посока се усилва грубо с коефициент 1/(1 - бета); при бета = 0,9, което е около десет пъти. Това е математически експоненциално претеглена пълзяща средна на градиентите, изглаждаща шума от мини-партиди, като същевременно запазва доминиращата посока на спускане.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на стохастично градиентно спускане с инерция

Инерцията остава основополагаща: адаптивните оптимизатори като Adam и неговите варианти вграждат оценка на първия момент в стил на инерция, а SGD с инерция все още е силна базова линия, която често обобщава по-добре от адаптивните методи върху големи модели на зрение. Продължават изследванията върху планирането на импулса, отделянето на намаляване на теглото и взаимодействието му с много голямо партидно обучение. Очаквайте инерцията да остане основен компонент, тъй като оптимизаторите се развиват за все по-големи модели.

Внедряване в реалния свят

Обучение на дълбоки конволюционни мрежи като ResNet, където SGD с инерция 0,9 е стандартна рецепта.

Изглаждане на шумни градиентни оценки при използване на малки мини-партиди.

Избягване на плитки местни плата чрез пренасяне на скорост през равнинни региони.

Служи като инерционен термин в адаптивни оптимизатори като варианти на Adam и RMSprop.

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде Stochastic Gradient Descent with Momentum помага и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Gradient Descent with Momentum quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Градиентно спускане

Frequently asked questions

What is Stochastic Gradient Descent with Momentum?

Momentum е настройка за градиентно спускане, която акумулира текуща средна стойност на минали градиенти, позволявайки на оптимизацията да се движи по-бързо през долини и да намалява колебанията. Това е един от най-широко използваните трикове за обучение в дълбокото обучение.

Какво натрупва инерционният термин по време на тренировка?

Инерцията поддържа вектор на скоростта, който е експоненциално претеглена пълзяща средна на последните градиенти, изглаждайки посоката на актуализиране.

В дълго, тясно дере какъв проблем има обикновеният SGD, който инерцията помага да се реши?

Без импулс, SGD осцилира по стръмните посоки на дере. Инерцията отменя тези трептения и се ускорява по нежното дъно на долината.

Коя физична аналогия се използва най-често за описване на импулса?

Инерцията се оприличава на тежка топка, която развива скорост в последователни посоки и се съпротивлява на отклонение от шумни неравности.

Приблизително колко инерцията усилва ефективната стъпка в последователна посока, когато бета = 0,9?

Коефициентът на усилване е приблизително 1/(1 - бета) и 1/(1 - 0,9) = 10, така че последователните посоки се ускоряват приблизително десетократно.

Кой модерен оптимизатор включва оценка за първия момент в стил на инерция?

Адам комбинира подобна на импулса оценка за първи момент (средна) на градиентите с оценка за втори момент (вариация) за адаптивно мащабиране.