기술 가이드

사라지고 폭발하는 그라디언트

심층 네트워크를 훈련할 때 오류 신호는 여러 계층을 통해 뒤로 이동하면서 0으로 줄어들거나 무한대로 커집니다.

2분 읽기마지막 업데이트

개요

This makes deep and recurrent models painfully slow or impossible to train without specific fixes.

심층 분석

신경망은 체인 규칙을 사용하여 레이어별로 그래디언트를 곱하는 역전파를 통해 학습합니다. 여러 레이어를 쌓으면 해당 레이어별 요소가 함께 곱해집니다. 각 요소가 지속적으로 1보다 작으면 제품이 기하급수적으로 줄어들고 초기 레이어는 거의 업데이트되지 않습니다. 즉, 그래디언트 소실 문제입니다. 각 요소가 1보다 크면 제품이 폭발하여 불안정한 업데이트 또는 NaN 값이 크게 생성됩니다. 도함수 최대값이 0.25와 1인 Sigmoid 및 tanh와 같은 포화 활성화가 대표적인 원인입니다. 이 문제는 깊은 피드포워드 네트워크와 긴 시퀀스를 처리하는 순환 네트워크(RNN)에서 가장 심각합니다. 여기서 동일한 가중치 행렬이 모든 단계에서 다시 적용되어 효과가 극적으로 복잡해집니다.

기술적 통찰력

역전파에서 초기 레이어의 기울기는 많은 야코비안 및 가중치 항의 곱입니다. 대략적으로 신호는 깊이에 따라 증가된 레이어별 요소처럼 확장됩니다. 1 미만의 값은 0으로 감소합니다. 1보다 큰 값은 무한히 커집니다. T 단계에 걸쳐 펼쳐진 RNN의 경우 지배적 항은 거듭제곱 T에 대한 반복 가중치의 최대 고유값처럼 동작하므로 1로부터의 작은 편차라도 긴 시퀀스에 걸쳐 사라지거나 폭발합니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

사라지고 폭발하는 그라디언트의 미래

핵심 완화(잔여(건너뛰기) 연결, 정규화, 게이팅 및 신중한 초기화)는 이제 표준이므로 사라지는 그라데이션이 최신 아키텍처의 훈련을 거의 차단하지 않습니다. 변환기는 하나의 행렬을 반복적으로 다시 적용하는 대신 시퀀스에 주의를 기울여 반복적 합성을 완전히 회피합니다. 수천 개의 레이어 깊이의 훈련 네트워크, 매우 긴 컨텍스트의 안정적인 모델, 단일 훈련 단계가 실행되기 전에 신호 전파를 예측하는 신경 탄젠트 커널과 같은 이론적 도구에 대한 연구가 계속되고 있습니다.

실제 구현

초기 RNN 언어 모델은 여러 단계에 걸쳐 기울기가 사라져 LSTM과 GRU에 동기를 부여했기 때문에 긴 문장에서 단어를 연결하는 데 어려움을 겪었습니다.

ResNet은 그라디언트에 직접적이고 희석되지 않은 역방향 경로를 제공하는 건너뛰기 연결을 추가하여 100개 이상의 레이어 이미지 분류기에 대한 교육을 지원했습니다.

개발자는 훈련 손실이 갑자기 NaN(그라디언트 폭발의 징후)이 되는 것을 보고 이를 안정화하기 위해 그래디언트 클리핑을 추가합니다.

PyTorch 또는 TensorFlow의 모니터링 도구는 레이어별 그라데이션 표준을 표시하므로 엔지니어는 그라데이션이 거의 0으로 축소된 레이어를 찾을 수 있습니다.

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vanishing and Exploding Gradients quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

그라데이션 체크포인트

자주 묻는 질문

What is Vanishing and Exploding Gradients?

심층 네트워크를 훈련할 때 오류 신호는 여러 계층을 통해 뒤로 이동하면서 0으로 줄어들거나 무한대로 커집니다. 이로 인해 심층적이고 반복적인 모델은 특정 수정 없이는 학습이 매우 느려지거나 불가능해집니다.

역전파의 어떤 수학적 연산이 그래디언트 소멸 및 폭발의 근본 원인입니까?

역전파는 체인 규칙을 적용하여 여러 레이어별 요소를 함께 곱합니다. 1보다 작은 값의 제품은 사라지고 1보다 큰 제품은 폭발합니다.

시그모이드 및 tanh 활성화가 특히 기울기가 사라지는 경향이 있는 이유는 무엇입니까?

시그모이드의 미분 피크는 0.25이고 tanh의 피크는 1입니다. 포화 영역에서는 둘 다 0에 접근하므로 이를 쌓으면 기울기가 0에 가까워집니다.

긴 시퀀스에 대한 그래디언트 문제로 인해 가장 심각한 영향을 받는 아키텍처는 무엇입니까?

RNN은 모든 시간 단계에서 동일한 반복 가중치 행렬을 다시 적용하므로 긴 시퀀스에 걸쳐 해당 행렬의 고유값이 시퀀스 길이로 증가하는 것과 같은 효과가 복합됩니다.

훈련 손실이 갑자기 NaN으로 바뀌는 것은 어떤 문제를 나타낼 가능성이 가장 높습니까?

폭발적인 그래디언트는 무한대 또는 NaN으로 오버플로되는 엄청난 업데이트를 생성합니다. 대신에 사라지는 그래디언트는 손실을 지연시키는 원인이 됩니다.

잔여(건너뛰기) 연결은 그래디언트 소멸에 어떻게 도움이 됩니까?

연결 건너뛰기는 ID 경로를 추가하므로 그라데이션이 중간 레이어에 의해 반복적으로 감쇠되지 않고 뒤로 흐를 수 있습니다.