ПОСІБНИК З ОСНОВ

Випадання та стохастична регуляризація

Dropout — це трюк регуляризації, який випадковим чином вимикає частину нейронів під час кожного кроку навчання, змушуючи мережу створювати надлишкові надійні представлення.

2 хвилини читанняОстаннє оновлення

Огляд

It became one of the most influential techniques for fighting overfitting in deep learning.

Глибоке занурення

Запроваджене групою Хінтона приблизно в 2012 році, відсівання усуває ключову слабкість великих мереж: нейрони можуть коадаптуватися, навчаючись виправляти помилки один одного таким чином, щоб працювати лише на даних навчання. Під час кожного проходу вперед під час навчання, відключення випадковим чином встановлює вихід кожного нейрона на нуль з деякою ймовірністю p (часто 0,5 у щільних шарах). Оскільки будь-який нейрон може зникнути, мережа не може спиратися на крихкі партнерства і повинна поширювати корисну інформацію між багатьма підрозділами. Це діє як тренування величезного ансамблю тонких мереж, які розподіляють вагу. Під час тестування відключення вимикається, і використовується повна мережа з масштабуванням активацій, щоб очікуваний результат відповідав навчанню. Результатом є, як правило, краще узагальнення ціною трохи довшого навчання.

Технічне розуміння

Під час навчання кожна одиниця зберігається з імовірністю (1 мінус p) через випадкову двійкову маску, тому різні підмережі вибираються з кожної партії. Сучасні фреймворки використовують перевернуте вилучення: збережені активації діляться на (1 мінус p) під час тренування, тому під час висновку масштабування не потрібне. Ця випадковість створює шум, який перешкоджає коадаптації та наближає усереднення за експоненціальною кількістю підмереж із спільною вагою, що є дешевою формою ансамблю.

Стратегічний вплив

Чіткіші рішення

Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.

Вартість і бюджет

Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.

Команда та робочий процес

Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.

Майбутнє відсіву та стохастичної регуляризації

У мережах згорткового бачення пакетна нормалізація значною мірою витіснила стандартне відсівання, але варіанти процвітають в інших місцях: трансформатори застосовують відсіювання до рівнів уваги та передавання, а DropPath (стохастична глибина) відкидає цілі залишкові блоки. Для оцінки невизначеності моделі використовується відключення за методом Монте-Карло, яке зберігає відключення активним під час висновку. Очікуйте, що стохастична регулярізація залишиться гнучким інструментарієм, адаптованим до архітектури, а не єдиним фіксованим рецептом.

Реалізація в реальному світі

Додавання шару Dropout із p близько 0,5 між щільними шарами класифікатора зображення чи тексту в PyTorch або Keras

Трансформаторні моделі, які застосовують відсівання до ваг уваги та активації прямого передавання під час попереднього навчання

Відключення за методом Монте-Карло, де відключення залишається ввімкненим під час висновку для отримання оцінок невизначеності для медичних або важливих для безпеки прогнозів

Стохастична глибина (DropPath) випадковим чином пропускає залишкові блоки для регулярізації дуже глибоких мереж, таких як ResNets і трансформатори зору

Ризики та огорожі

Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.

Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.

Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.

Дорожня карта впровадження

1

Почніть із простого визначення необхідного результату.

2

Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.

3

Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.

4

Задокументуйте, де Dropout і Stochastic Regularization допомагають, а де простіші методи кращі.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Стохастичний градієнтний спуск з імпульсом

Часті запитання

What is Dropout and Stochastic Regularization?

Dropout — це трюк регуляризації, який випадковим чином вимикає частину нейронів під час кожного кроку навчання, змушуючи мережу створювати надлишкові надійні представлення. Це стало одним із найвпливовіших методів боротьби з переобладнанням у глибокому навчанні.

Що робить відсівання під час навчання?

Випадання випадковим чином обнулює кожен нейрон з імовірністю p під час навчання, тому на кожному кроці використовується інша розріджена підмережа.

Чому відсів покращує узагальнення?

Довільно видаляючи одиниці, відсівання зупиняє нейрони від формування крихких партнерств, які працюють лише на тренувальних даних, покращуючи надійність.

Що відбувається з випаданням під час перевірки (виведення)?

Під час висновку повна мережа працює з вимкненим відключенням, а активації масштабуються, щоб очікувані результати відповідали розподілу навчання.

Показник відсіву p = 0,5 у шарі означає приблизно що під час навчання?

При p = 0,5 кожен нейрон має 50-відсотковий шанс бути обнуленим, тому в середньому близько половини втрачається за один прохід вперед.

Що часто називають приблизним відсіванням?

Вибірка різних підмереж на кожному кроці наближається до усереднення за експоненціальною кількістю спільно вагових мереж, що є формою дешевого ансамблю.