Техническое РУКОВОДСТВО

Минимизация с учетом резкости

Минимизация с учетом резкости (SAM) — это метод оптимизации, который ищет не просто низкие потери, но и низкие потери во всей окрестности весов — плоский минимум.

2 минуты чтенияПоследнее обновление

Обзор

Flatter minima tend to generalize better, so SAM often improves test accuracy and robustness without changing the model architecture.

Глубокое погружение

Стандартное обучение минимизирует потерю в одной точке весового пространства, но два решения с одинаковыми потерями при обучении могут вести себя совершенно по-разному: «резкий» минимум находится в узкой долине, где крошечные отклонения веса резко увеличивают потерю, в то время как «плоский» минимум допускает возмущения и обычно лучше обобщает невидимые данные. SAM, представленный исследователями Google в 2020 году, ясно показывает это. На каждом шаге он сначала находит ближайшее возмущение веса (в пределах небольшого радиуса rho), которое максимизирует потери (сосед наихудшего случая), а затем обновляет исходные веса, чтобы уменьшить потери в этой возмущенной точке. Эта цель min-max подталкивает оптимизацию к областям, которые равномерно низкие, что дает заметно лучшее обобщение при классификации изображений и за ее пределами.

Техническая информация

Каждый шаг SAM состоит из двух проходов. Сначала вычислите градиент при текущих весах и сделайте шаг «восхождения» размером rho в направлении градиента, чтобы достичь ближайшей точки наихудшего случая. Во-вторых, вычислите градиент в этой возмущенной точке и используйте его для обновления исходных весов. Радиус rho определяет, насколько велика территория, от которой вы защищаете. Стоимость составляет примерно два прохода вперед-назад за шаг, что удваивает объем вычислений — главный практический недостаток.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее минимизации с учетом резкости

SAM породил семейство последующих исследований, направленных на его самую большую слабость — удвоение вычислений: эффективные варианты, такие как ESAM, LookSAM, и методы, которые изменяют только подмножество весов или применяют SAM каждые несколько шагов. Адаптивный SAM (ASAM) меняет параметры радиуса, делая его масштабно-инвариантным. Исследователи продолжают спорить, почему именно плоскостность помогает и как ее измерить, а идеи, связанные с четкостью, распространяются на тонкую настройку больших языковых моделей и повышение устойчивости к сдвигу распределения.

Реальная реализация

Повышение точности Vision Transformer и ResNet в ImageNet за счет обучения с помощью SAM вместо обычного SGD.

Повышение устойчивости к шуму меток, поскольку плоские минимумы с меньшей вероятностью запоминают поврежденные метки.

Точная настройка предварительно обученных языковых моделей с помощью SAM для лучшего обобщения небольших наборов данных.

Использование вариантов ESAM или LookSAM, когда удвоенная стоимость вычислений стандартного SAM слишком высока.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sharpness-Aware Minimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

DenseNet и плотная связь

Часто задаваемые вопросы

What is Sharpness-Aware Minimization?

Минимизация с учетом резкости (SAM) — это метод оптимизации, который ищет не просто низкие потери, но и низкие потери во всей окрестности весов — плоский минимум. Более плоские минимумы имеют тенденцию лучше обобщать, поэтому SAM часто повышает точность и надежность испытаний без изменения архитектуры модели.

Какой минимум пытается найти SAM?

SAM нацелен на плоские минимумы, потому что потери, которые остаются низкими при небольших изменениях веса, имеют тенденцию лучше обобщать невидимые данные.

Сколько проходов вперед-назад требуется для стандартного шага SAM?

SAM вычисляет градиент, чтобы найти ближайшую точку для наихудшего случая, а затем еще один градиент для обновления — примерно в два раза больше обычных затрат.

Чем управляет гиперпараметр rho радиуса в SAM?

Ро устанавливает, насколько далеко перемещается шаг «восхождения», чтобы найти соседа с наихудшим случаем, определяя, насколько большую плоскую область ищет SAM.

Каков первый из двух шагов SAM на каждой итерации?

SAM сначала возмущает веса в радиусе rho в направлении, которое максимизирует потери, затем спускается из исходной точки, используя рассчитанный там градиент.

Почему SAM часто повышает устойчивость к маркировке шума?

Запоминание шумных меток обычно требует четких и узких минимумов; отдавая предпочтение плоским регионам, SAM сопротивляется такому переоснащению.