Техническое РУКОВОДСТВО

Стохастическое усреднение веса

Стохастическое усреднение веса (SWA) берет простое среднее значение весов модели из нескольких точек на позднем этапе обучения, а не просто сохраняет окончательный снимок.

2 минуты чтенияПоследнее обновление

Обзор

This cheap trick often lands the model in a flatter, wider region of the loss landscape, which tends to generalize noticeably better on unseen data.

Глубокое погружение

Представленный Измайловым, Уилсоном и коллегами в 2018 году, SWA использует наблюдение о том, что SGD с постоянной или циклической скоростью обучения не сходится в одной точке — он подпрыгивает по краю широкой плоской долины. Вместо того, чтобы выбирать одну из этих шумных точек остановки, SWA использует умеренно высокую (часто постоянную или циклическую) скорость обучения для последних эпох и усредняет посещаемые веса, обычно каждую эпоху. Усредненные веса расположены ближе к центру плоской области. Поскольку статистика пакетной нормализации вычисляется для определенных весов, SWA требует одного дополнительного прямого прохода по данным для повторного расчета текущих средних значений и дисперсий BN для усредненной модели. Затраты практически бесплатны, а прирост точности одинаков для всех классификаторов изображений и за его пределами.

Техническая информация

SWA поддерживает скользящее среднее значение w_SWA = (n·w_SWA + w_i)/(n+1), обновляемое каждый цикл, в то время как действующая модель SGD продолжает исследование с относительно большой скоростью обучения. Усреднение в весовом пространстве аппроксимирует ансамбль в функциональном пространстве, но при выводе требует одной модели, а не многих. Ключевой механизм заключается в том, что плоские минимумы устойчивы к изменениям веса, поэтому поверхности потерь при обучении и тестировании остаются выровненными, уменьшая разрыв обобщения.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее стохастического усреднения веса

SWA породил такие варианты, как SWA-Gaussian (SWAG) для дешевой байесовской неопределенности, и идея усреднения теперь лежит в основе приемов экспоненциального скользящего среднего, широко используемых в диффузионных моделях, самоконтролируемом обучении и предварительном обучении больших моделей. Ожидается, что усреднение веса останется «бесплатным обедом» по умолчанию в рецептах тренировок, а исследования расширят его до объединения независимо обученных моделей (модельных супов) и улучшения калибровки наряду с грубой точностью.

Реальная реализация

Повышение точности тестирования классификаторов изображений ResNet и DenseNet на CIFAR и ImageNet без дополнительных затрат на вывод.

SWAG (SWA-Gaussian) производит калиброванные оценки неопределенности для прогнозов, чувствительных к безопасности, на основе одного обучающего запуска.

EMA-весов, стабилизирующих сеть выборки в генераторах диффузных изображений, таких как Stable Diffusion.

Построение «модельных супов» путем усреднения нескольких точно настроенных контрольных точек для повышения надежности без повторного обучения.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Weight Averaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Инициализация веса

Часто задаваемые вопросы

What is Stochastic Weight Averaging?

Стохастическое усреднение веса (SWA) берет простое среднее значение весов модели из нескольких точек на позднем этапе обучения, а не просто сохраняет окончательный снимок. Этот дешевый трюк часто приводит модель в более плоскую и широкую область ландшафта потерь, что имеет тенденцию заметно лучше обобщать невидимые данные.

Что на самом деле означает стохастическое усреднение веса?

SWA усредняет параметры модели (веса), собранные в нескольких контрольных точках на заключительном этапе обучения, а не прогнозы или градиенты.

Почему SWA имеет тенденцию улучшать обобщение?

Усреднение перемещает решение к центру плоской области поверхности потерь, а плоские минимумы лучше обобщают, поскольку потери в поезде и при тестировании остаются на одном уровне.

Какой дополнительный шаг требует SWA для сетей, использующих пакетную нормализацию?

Поскольку статистика BN зависит от конкретных весов, усредненной модели требуется один дополнительный проход данных для перерасчета текущих средних и дисперсий.

Какое поведение скорости обучения обычно используется на этапе усреднения SWA?

SWA поддерживает умеренно высокую постоянную или циклическую скорость обучения, поэтому SGD продолжает исследовать широкую плоскую область, точки которой затем усредняются.

Как стоимость вывода SWA сравнивается с традиционным ансамблем из N моделей?

SWA объединяет множество контрольных точек в один набор усредненных весов, поэтому стоимость вывода равна стоимости одной модели, а не N.