Отпадане и стохастична регулация
Отпадането е трик за регулиране, който произволно изключва част от невроните по време на всяка стъпка на обучение, принуждавайки мрежата да изгради излишни, стабилни представяния.
Преглед
It became one of the most influential techniques for fighting overfitting in deep learning.
Дълбоко гмуркане
Въведено от групата на Хинтън около 2012 г., отпадането адресира ключова слабост на големите мрежи: невроните могат да се адаптират съвместно, учейки се да поправят грешките на другия по начини, които работят само върху данните за обучение. При всяко преминаване напред по време на обучение, отпадането произволно настройва изхода на всеки неврон на нула с известна вероятност p (често 0,5 в плътни слоеве). Тъй като всеки неврон може да изчезне, мрежата не може да разчита на крехки партньорства и трябва да разпространява полезна информация в много звена. Това действа като трениране на огромен ансамбъл от изтънени мрежи, които споделят тежести. По време на теста отпадането се изключва и се използва цялата мрежа, като активациите са мащабирани, така че очакваният резултат да съответства на обучението. Резултатът обикновено е по-добро обобщение с цената на малко по-дълго обучение.
Техническа информация
По време на обучението всяка единица се съхранява с вероятност (1 минус p) чрез произволна двоична маска, така че различни подмрежи се вземат проби от всяка партида. Съвременните рамки използват обърнато отпадане: оцелелите активации се разделят на (1 минус p) по време на тренировка, така че не е необходимо мащабиране при извод. Тази произволност инжектира шум, който обезсърчава съвместната адаптация и доближава осредняването върху експоненциален брой подмрежи със споделено тегло, евтина форма на групиране.
Стратегическо въздействие
Clearer decisions
Помага ви да отделите ясните технически твърдения от маркетинговия език.
Cost and budget
Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.
Team and workflow
Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.
Бъдещето на отпадането и стохастичната регулация
В мрежите за конволюционно виждане пакетната нормализация до голяма степен е изместила стандартното отпадане, но вариантите процъфтяват другаде: трансформаторите прилагат отпадане към слоевете за внимание и подаване напред, а DropPath (стохастична дълбочина) изпуска цели остатъчни блокове. Отпадането по метода Монте Карло, което поддържа отпадането активно при извод, се използва за оценка на несигурността на модела. Очаквайте стохастичната регулация да остане гъвкав набор от инструменти, адаптиран за архитектура, а не една единствена фиксирана рецепта.
Внедряване в реалния свят
Добавяне на Dropout слой с p около 0,5 между плътни слоеве на изображение или текстов класификатор в PyTorch или Keras
Трансформаторни модели, прилагащи отпадане към тежести на вниманието и активации за подаване напред по време на предварително обучение
Отпадане от Монте Карло, където отпадането остава включено при извод, за да се получат оценки на несигурността за медицински или критични за безопасността прогнози
Стохастична дълбочина (DropPath) произволно пропускане на остатъчни блокове за регулиране на много дълбоки мрежи като ResNets и визуални трансформатори
Рискове и предпазни огради
Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.
Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.
Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.
Пътна карта за изпълнение
Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.
Изберете един показател за успех и едно условие за неуспех преди тестване.
Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.
Документирайте къде отпадането и стохастичната регулация помагат и къде по-простите методи са по-добри.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dropout and Stochastic Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Стохастично градиентно спускане с инерция
Frequently asked questions
What is Dropout and Stochastic Regularization?
Отпадането е трик за регулиране, който произволно изключва част от невроните по време на всяка стъпка на обучение, принуждавайки мрежата да изгради излишни, стабилни представяния. Това се превърна в една от най-влиятелните техники за борба с пренатоварването при задълбочено обучение.
Какво прави отпадането по време на обучение?
Отпадането произволно нулира всеки неврон с вероятност p по време на обучение, така че всяка стъпка се използва различна разредена подмрежа.
Защо отпадането подобрява обобщаването?
Чрез произволно премахване на единици, отпадането спира невроните да формират крехки партньорства, които работят само върху данни за обучение, подобрявайки устойчивостта.
Какво се случва с отпадането по време на тест (извод)?
При извод цялата мрежа работи с деактивирано отпадане и активациите се мащабират, така че очакваните резултати да съответстват на разпределението на обучението.
Процент на отпадане от p = 0,5 в слой означава приблизително какво по време на обучение?
С p = 0,5 всеки неврон има 50 процента шанс да бъде нулиран, така че средно около половината се изпускат при преминаване напред.
Какво е отпадането често описвано като приблизително?
Вземането на проби от различна подмрежа на всяка стъпка се доближава до осредняването върху експоненциален брой мрежи със споделено тегло, форма на евтино групиране.