РУКОВОДСТВО ПО ОСНОВАМ

Отсев и стохастическая регуляризация

Dropout — это трюк регуляризации, который случайным образом отключает часть нейронов на каждом этапе обучения, заставляя сеть строить избыточные, надежные представления.

2 минуты чтенияПоследнее обновление

Обзор

It became one of the most influential techniques for fighting overfitting in deep learning.

Глубокое погружение

Метод отсева, представленный группой Хинтона примерно в 2012 году, устраняет ключевую слабость больших сетей: нейроны могут совместно адаптироваться, обучаясь исправлять ошибки друг друга способами, которые работают только на обучающих данных. При каждом прямом проходе во время обучения метод dropout случайным образом устанавливает выходной сигнал каждого нейрона равным нулю с некоторой вероятностью p (часто 0,5 в плотных слоях). Поскольку любой нейрон может исчезнуть, сеть не может опираться на хрупкие партнерства и должна распространять полезную информацию среди многих подразделений. Это похоже на обучение огромного ансамбля прореженных сетей, имеющих общий вес. Во время тестирования отключение отключается и используется вся сеть, а активации масштабируются таким образом, чтобы ожидаемый результат соответствовал обучению. Результатом обычно является лучшее обобщение за счет немного более длительного обучения.

Техническая информация

Во время обучения каждая единица сохраняется с вероятностью (1 минус p) через случайную двоичную маску, поэтому в каждой партии отбираются разные подсети. В современных фреймворках используется инвертированное выпадение: оставшиеся активации делятся на (1 минус p) во время обучения, поэтому при выводе масштабирование не требуется. Эта случайность вносит шум, который препятствует совместной адаптации и приближает усреднение по экспоненциальному числу подсетей с общим весом, что является дешевой формой ансамбля.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее отсева и стохастической регуляризации

В сетях сверточного зрения пакетная нормализация в значительной степени вытеснила стандартное исключение, но варианты процветают и в других местах: преобразователи применяют исключение к слоям внимания и прямой связи, а DropPath (стохастическая глубина) удаляет целые остаточные блоки. Отсев по методу Монте-Карло, который поддерживает отсев активным при выводе, используется для оценки неопределенности модели. Ожидается, что стохастическая регуляризация останется гибким набором инструментов, адаптированным для каждой архитектуры, а не одним фиксированным рецептом.

Реальная реализация

Добавление слоя Dropout с p около 0,5 между плотными слоями классификатора изображения или текста в PyTorch или Keras

Модели-трансформеры, применяющие отсев к весам внимания и активации прямой связи во время предварительной тренировки

Отсев по методу Монте-Карло, когда отсев остается включенным при выводе для получения оценок неопределенности для медицинских прогнозов или прогнозов, важных для безопасности.

Стохастическая глубина (DropPath) случайным образом пропускает остаточные блоки для упорядочения очень глубоких сетей, таких как ResNet и преобразователи изображения.

Риски и ограничения

Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

1

Начните с простого определения желаемого результата.

2

Перед тестированием выберите один показатель успеха и одно условие отказа.

3

Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

4

Документируйте, где помогают Dropout и стохастическая регуляризация и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Стохастический градиентный спуск с импульсом

Часто задаваемые вопросы

What is Dropout and Stochastic Regularization?

Dropout — это трюк регуляризации, который случайным образом отключает часть нейронов на каждом этапе обучения, заставляя сеть строить избыточные, надежные представления. Это стало одним из самых влиятельных методов борьбы с переобучением в глубоком обучении.

Что делает отсев во время обучения?

Dropout случайным образом обнуляет каждый нейрон с вероятностью p во время обучения, поэтому на каждом этапе используется другая прореженная подсеть.

Почему отсев улучшает обобщение?

Случайным удалением единиц отсев не позволяет нейронам образовывать хрупкие партнерства, которые работают только с обучающими данными, повышая надежность.

Что происходит с отсевом во время тестирования (вывода)?

При выводе вся сеть работает с отключенным отключением, а активации масштабируются так, чтобы ожидаемые результаты соответствовали распределению обучения.

Что примерно означает показатель отсева p = 0,5 в слое во время обучения?

При p = 0,5 каждый нейрон имеет 50-процентную вероятность обнуления, поэтому в среднем за один проход вперед отбрасывается около половины.

Что такое отсев часто называют аппроксимацией?

Выборка из разных подсетей на каждом этапе приближается к усреднению по экспоненциальному числу сетей с общим весом, что является формой дешевого ансамбля.