기술 가이드

2차 최적화 및 뉴턴 방법

2차 최적화는 곡률 정보(2차 도함수의 헤시안 행렬)를 사용하여 기울기뿐만 아니라 최소값을 향해 더 스마트한 조치를 취합니다.

2분 읽기마지막 업데이트

개요

It can converge in dramatically fewer iterations than plain gradient descent, but the cost of computing curvature makes it tricky to scale.

심층 분석

경사하강법은 현재 지점의 기울기만 알고 있으므로 고정되거나 수동으로 조정된 단계 크기를 선택하고 최선의 결과를 기대합니다. 뉴턴의 방법은 더 나아가 모든 2차 편미분의 행렬인 헤세 행렬(Hessian)에 의해 포착된 기울기(곡률)가 어떻게 변하는지 살펴봅니다. 업데이트는 역 헤세 행렬에 그래디언트를 곱하여 각 방향의 크기를 자동으로 조정하고 로컬 2차 근사치의 최소값 근처에 도달합니다. 완벽한 이차 그릇의 경우 뉴턴의 방법은 단일 단계로 바닥에 도달합니다. 문제는 심각합니다. N 매개변수가 있는 모델에는 NxN 헤세 행렬이 있으므로 이를 저장하고 반전하는 데 대략 N 제곱 메모리와 N 큐브 컴퓨팅 비용이 소요됩니다. 10억 매개변수 네트워크의 경우 이는 불가능하므로 실무자들은 더 저렴한 근사치를 사용합니다.

기술적 통찰력

핵심 뉴턴 업데이트는 x_new = x - H_inverse 곱하기 그라디언트입니다. 여기서 H는 헤세 행렬입니다. BFGS 및 L-BFGS와 같은 준뉴턴 방법은 연속적인 기울기 차이로부터 역의 실행 근사를 구축하여 H를 직접 계산하는 것을 방지합니다. L-BFGS는 전체 행렬 대신 마지막 몇 개의 기울기 및 단계 벡터만 저장하여 수렴 속도 향상을 대부분 유지하면서 메모리를 N 제곱에서 N의 작은 배수로 줄입니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

2차 최적화와 뉴턴 방법의 미래

거대 신경망의 경우 완전한 2차 방법은 여전히 ​​비실용적이지만 근사치는 점차 자리를 잡아가고 있습니다. K-FAC 및 Shampoo와 같은 최적화 프로그램은 블록 대각선 또는 Kronecker 인수 구조를 사용하여 곡률을 근사화하고 Sophia 및 Muon과 같은 최신 방법은 저렴한 곡률 추정을 사용하여 대규모 언어 모델 사전 학습 속도를 높입니다. 거의 1차 비용으로 유용한 곡률 신호를 포착하여 Adam과 실제 뉴턴 단계 사이의 격차를 좁히려는 지속적인 노력을 기대합니다.

실제 구현

L-BFGS 피팅 로지스틱 회귀 및 scikit-learn의 기타 볼록 모델(중소 규모 데이터 세트에서 일반 경사하강법을 능가하는 경우가 많음)

Gauss-Newton 및 Levenberg-Marquardt가 카메라 포즈와 포인트 위치를 미세 조정하는 3D 재구성 및 SLAM의 번들 조정

L-BFGS가 Adam이 도달하려고 애쓰는 정밀도를 달성하는 작은 물리학 기반 신경망 훈련

헤시안 구조를 근사화하여 대규모 딥러닝 훈련을 가속화하는 샴푸와 K-FAC

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Second-Order Optimization and Newton Methods quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

그룹 관련 정책 최적화

자주 묻는 질문

What is Second-Order Optimization and Newton Methods?

2차 최적화는 곡률 정보(2차 도함수의 헤시안 행렬)를 사용하여 기울기뿐만 아니라 최소값을 향해 더 스마트한 조치를 취합니다. 일반 경사하강법보다 훨씬 적은 반복 횟수로 수렴할 수 있지만 곡률을 계산하는 데 드는 비용으로 인해 확장이 까다로워집니다.

뉴턴의 방법은 일반 경사 하강법이 사용하지 않는 어떤 정보를 사용합니까?

뉴턴의 방법은 헤세 행렬의 곡률로 기울기를 증가시켜 방향 크기를 다시 조정하고 지역 2차 최소값에 근접하게 합니다.

완벽하게 2차 목적을 달성하려면 뉴턴의 방법이 최소값에 도달하려면 몇 단계가 필요합니까?

정확한 2차 방정식에서 로컬 2차 모델은 실제 함수와 동일하므로 한 뉴턴 단계는 곧바로 최소값으로 점프합니다.

10억 매개변수 신경망에 완전 뉴턴 방법이 비실용적인 이유는 무엇입니까?

N 매개변수를 사용하면 헤세 행렬은 N 제곱 항목을 갖고 이를 반전시키는 것은 N-큐브처럼 확장됩니다. 이는 수십억 개의 매개변수에서는 실행 불가능합니다.

헤세 행렬의 비용을 피하기 위해 BFGS와 같은 준뉴턴 방법은 무엇을 합니까?

BFGS는 직접 계산을 피하면서 단계 간 기울기의 변화를 사용하여 역 헤세 행렬의 추정치를 반복적으로 업데이트합니다.

L-BFGS는 BFGS에 비해 메모리를 어떻게 줄입니까?

'L'은 제한된 메모리를 나타냅니다. L-BFGS는 소수의 최근 벡터만 유지하여 저장 공간을 N 제곱에서 대략 N의 작은 배수로 줄입니다.