기술 가이드

확률적 가중치 평균

SWA(확률적 가중치 평균)는 최종 스냅샷을 유지하는 대신 훈련 후반의 여러 지점에서 모델 가중치의 간단한 평균을 취합니다.

2분 읽기마지막 업데이트

개요

이 값싼 트릭은 모델을 손실 환경의 더 평평하고 넓은 영역에 배치하는 경우가 많으며, 이는 보이지 않는 데이터에서 눈에 띄게 더 잘 일반화되는 경향이 있습니다.

심층 분석

2018년 Izmailov, Wilson 및 동료들이 도입한 SWA는 일정하거나 순환적인 학습 속도를 갖는 SGD가 한 지점으로 수렴하지 않고 넓고 평평한 계곡의 가장자리를 중심으로 튕겨 나온다는 관찰을 활용합니다. SWA는 시끄러운 중지 지점 중 하나를 선택하는 대신 최종 에포크에 대해 적당히 높은(종종 일정하거나 주기적) 학습 속도를 실행하고 일반적으로 모든 에포크에서 방문하는 가중치의 평균을 계산합니다. 평균 가중치는 평평한 영역의 중심에 더 가깝게 위치합니다. 배치 정규화 통계는 특정 가중치에 대해 계산되므로 SWA에서는 평균 모델에 대한 BN 실행 평균 및 분산을 다시 계산하기 위해 데이터에 대한 추가 정방향 전달이 필요합니다. 비용은 기본적으로 무료이며 정확도 향상은 이미지 분류기 및 그 이상에서 일관됩니다.

기술적 통찰력

SWA는 매 주기마다 업데이트되는 실행 평균 w_SWA = (n·w_SWA + w_i)/(n+1)을 유지하는 반면, 라이브 SGD 모델은 상대적으로 큰 학습 속도로 계속 탐색합니다. 가중치 공간의 평균화는 함수 공간의 앙상블과 유사하지만 추론 시 하나의 모델 비용이 들지만 많은 비용은 들지 않습니다. 핵심 메커니즘은 플랫 최소값이 가중치 변동에 강하므로 훈련/테스트 손실 표면이 정렬된 상태를 유지하여 일반화 격차를 줄이는 것입니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

확률적 가중치 평균의 미래

SWA는 저렴한 베이지안 불확실성을 위해 SWAG(SWA-Gaussian)와 같은 변형을 생성했으며 이제 평균화 아이디어는 확산 모델, 자기 지도 학습 및 대규모 모델 사전 학습에 널리 사용되는 지수 이동 평균 트릭을 뒷받침합니다. 독립적으로 훈련된 모델(모델 수프)을 병합하고 원시 정확도와 함께 보정을 개선하는 연구를 통해 체중 평균이 훈련 레시피에서 기본 '공짜 점심'으로 유지될 것으로 예상됩니다.

실제 구현

추가 추론 비용 없이 CIFAR 및 ImageNet에서 ResNet 및 DenseNet 이미지 분류기의 테스트 정확도를 높입니다.

SWAG(SWA-Gaussian)는 단일 훈련 실행에서 안전에 민감한 예측을 위해 보정된 불확실성 추정치를 생성합니다.

Stable Diffusion과 같은 확산 이미지 생성기에서 샘플링 네트워크를 안정화하는 EMA 가중치.

재교육 없이 견고성을 향상시키기 위해 미세 조정된 여러 체크포인트를 평균하여 '모델 수프'를 구성합니다.

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Weight Averaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

확률적 가중치 평균이란 무엇입니까?

SWA(확률적 가중치 평균)는 최종 스냅샷을 유지하는 대신 훈련 후반의 여러 지점에서 모델 가중치의 간단한 평균을 취합니다. 이 값싼 트릭은 손실 환경의 더 평평하고 넓은 영역에 모델을 배치하는 경우가 많으며, 이는 보이지 않는 데이터에서 눈에 띄게 더 잘 일반화되는 경향이 있습니다.

확률적 가중치 평균은 실제로 무엇을 평균하나요?

SWA는 예측이나 경사가 아닌 훈련의 마지막 단계 동안 여러 체크포인트에서 수집된 모델 매개변수(가중치)의 평균을 냅니다.

SWA가 일반화를 개선하는 경향이 있는 이유는 무엇입니까?

평균화는 솔루션을 손실 표면의 평탄한 영역 중심으로 이동시키고, 평탄한 최소값은 열차 손실과 테스트 손실이 정렬된 상태로 유지되기 때문에 더 잘 일반화됩니다.

배치 정규화를 사용하는 네트워크에 대해 SWA에는 어떤 추가 단계가 필요합니까?

BN 통계는 특정 가중치에 따라 달라지기 때문에 평균 모델은 실행 평균과 분산을 다시 계산하기 위해 데이터에 대한 추가 전달이 필요합니다.

SWA 평균화 단계에서는 일반적으로 어떤 학습 속도 동작이 사용됩니까?

SWA는 적당히 높은 일정 또는 순환 학습 속도를 유지하므로 SGD는 포인트가 평균화되는 넓고 평평한 영역을 계속 탐색합니다.

SWA의 추론 비용은 N 모델의 기존 앙상블과 어떻게 비교됩니까?

SWA는 많은 체크포인트를 하나의 평균 가중치 세트로 축소하므로 추론 비용은 N이 아닌 단일 모델과 동일합니다.