기본 가이드

모멘텀을 이용한 확률적 경사하강법

모멘텀은 과거 경사의 실행 평균을 누적하는 경사하강법을 조정하여 계곡을 통해 최적화가 더 빠르게 진행되고 진동을 완화할 수 있도록 합니다.

2분 읽기마지막 업데이트

개요

It is one of the most widely used training tricks in deep learning.

심층 분석

일반 확률적 경사하강법(SGD)은 현재 미니 배치 경사와 반대 방향으로 진행하여 매개변수를 업데이트합니다. 길고 좁은 계곡 모양의 풍경 속에서 이것은 지그재그로 가파른 벽을 가로지르며 완만한 바닥을 기어간다. Polyak에 의해 대중화되고 나중에 Rumelhart와 동료에 의해 대중화된 모멘텀은 속도 벡터를 유지하여 이 문제를 해결합니다. 각 단계는 새로운 기울기를 이전 속도의 분수(운동량 계수, 종종 0.9)와 혼합합니다. 일관된 경사 방향은 강화되고 가속되는 반면 진동 구성 요소는 부분적으로 상쇄됩니다. 물리적인 비유는 무거운 공이 내리막길을 굴러가는 것과 같습니다. 일정한 방향으로 속도를 높이고 시끄러운 범프에 의해 편향되는 일이 적어 바닐라 SGD보다 더 빠르고 부드러운 수렴을 제공합니다.

기술적 통찰력

업데이트는 v = 베타 * v + 기울기로 업데이트되는 속도 v를 유지하며 매개변수는 마이너스 학습 속도 x v만큼 이동합니다. 운동량 계수 베타를 사용하면 일관된 방향의 유효 단계가 대략 1/(1 - 베타)만큼 증폭됩니다. 베타 = 0.9에서는 약 10배입니다. 이는 수학적으로 기하급수적으로 가중된 경사 이동 평균으로, 지배적인 하강 방향을 유지하면서 미니 배치 노이즈를 완화합니다.

전략적 영향

더 명확한 결정들

이는 명확한 기술적 주장과 마케팅 언어를 구분하는 데 도움이 됩니다.

비용 및 예산

돈이나 시간을 들이기 전에 더 나은 구현 질문을 할 수 있습니다.

팀과 워크플로우

이해를 공유한 팀은 더 나은 제품, 정책 및 학습 결정을 내립니다.

모멘텀을 이용한 확률적 경사하강법의 미래

모멘텀은 여전히 ​​기본입니다. Adam 및 그 변형과 같은 적응형 최적화 프로그램에는 모멘텀 스타일의 첫 번째 순간 추정이 포함되어 있으며, 모멘텀이 포함된 SGD는 여전히 대형 비전 모델에서 적응형 방법보다 더 잘 일반화하는 강력한 기준입니다. 운동량 스케줄링, 분리된 체중 감소 및 대규모 배치 훈련과의 상호 작용에 대한 연구가 계속됩니다. 점점 더 큰 모델을 위해 최적화 프로그램이 발전함에 따라 핵심 구성 요소로 유지되는 추진력을 기대하세요.

실제 구현

운동량이 0.9인 SGD가 표준 레시피인 ResNet과 같은 심층 컨벌루션 네트워크를 훈련합니다.

작은 미니 배치를 사용할 때 잡음이 있는 기울기 추정을 평활화합니다.

평평한 지역을 통해 속도를 전달하여 얕은 지역 고원을 탈출합니다.

Adam 및 RMSprop 변형과 같은 적응형 최적화 프로그램 내에서 모멘텀 항으로 사용됩니다.

위험 및 가드레일

팀마다 동일한 용어를 다르게 사용할 수 있으므로 범위를 조기에 정의하세요.

벤치마크는 강력해 보이지만 실제 성능은 고르지 않을 수 있습니다.

데이터 품질 및 평가 계획을 무시하면 취약한 결과가 발생하는 경우가 많습니다.

구현 로드맵

1

필요한 결과에 대한 일반 언어 정의부터 시작하세요.

2

테스트하기 전에 하나의 성공 지표와 하나의 실패 조건을 선택하세요.

3

세련된 데모 세트가 아닌 대표 데이터를 사용하여 소규모 파일럿을 실행하세요.

4

Momentum을 사용한 Stochastic Gradient Descent가 도움이 되는 부분과 더 간단한 방법이 더 나은 부분에 대한 문서입니다.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Gradient Descent with Momentum quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

What is Stochastic Gradient Descent with Momentum?

모멘텀은 과거 경사의 실행 평균을 누적하는 경사하강법을 조정하여 계곡을 통해 최적화가 더 빠르게 진행되고 진동을 완화할 수 있도록 합니다. 이는 딥러닝에서 가장 널리 사용되는 훈련 트릭 중 하나입니다.

훈련 중에 운동량 항은 무엇을 축적합니까?

Momentum은 최근 기울기의 지수 가중 이동 평균인 속도 벡터를 유지하여 업데이트 방향을 부드럽게 합니다.

길고 좁은 계곡에서 일반 SGD가 겪고 있는 문제는 모멘텀이 해결하는 데 도움이 됩니까?

추진력이 없으면 SGD는 계곡의 가파른 방향을 가로질러 진동합니다. 운동량은 이러한 진동을 취소하고 완만한 계곡 바닥을 따라 가속합니다.

운동량을 설명하기 위해 가장 자주 사용되는 물리적 비유는 무엇입니까?

모멘텀은 일관된 방향으로 속도를 높이고 시끄러운 충돌로 인해 편향되는 것을 방지하는 무거운 공에 비유됩니다.

베타 = 0.9일 때 모멘텀은 일관된 방향으로 유효 스텝을 대략 얼마나 증폭합니까?

증폭 계수는 약 1/(1 - 베타), 1/(1 - 0.9) = 10이므로 일관된 방향의 속도가 약 10배 빨라집니다.

어떤 최신 옵티마이저가 모멘텀 스타일의 첫 번째 순간 추정을 통합합니까?

Adam은 적응형 스케일링을 위해 모멘텀과 유사한 첫 번째 순간(평균) 경사도 추정과 두 번째 순간(분산) 추정을 결합합니다.