기본 가이드

그로킹과 지연된 일반화

그로킹(Grokking)은 신경망이 먼저 훈련 데이터를 기억하고 오랜 시간 동안 거의 0에 가까운 검증 정확도에 머물렀다가 훈련 정확도가 100%에 도달한 후 오랜 시간이 지나 갑자기 일반화되는 놀라운 현상입니다.

2분 읽기마지막 업데이트

개요

It overturns the intuition that learning and generalization happen together.

심층 분석

2021년 OpenAI 연구원들이 모듈러 산술과 같은 작은 알고리즘 작업에서 발견한 그로킹은 날카로운 2단계 곡선을 보여줍니다. 초기에는 모델이 훈련 세트에 완벽하게 맞는 반면 검증 성능은 우연하게 유지되어 절망적으로 과적합된 것처럼 보입니다. 그러다가 뚜렷한 진전 없이 수천, 심지어 수백만 단계를 추가한 후에는 검증 정확도가 갑자기 거의 완벽에 가까워집니다. 주요 설명은 가중치 감소(정규화)가 네트워크에 천천히 압력을 가해 취약하게 기억된 솔루션을 버리고 실제로 기본 규칙을 포착하는 간결하고 구조화된 솔루션을 발견한다는 것입니다. 예를 들어 모듈식 추가를 원의 ​​회전으로 표현하는 것입니다. Grokking은 소규모 합성 데이터 세트에서 가장 눈에 띄지만 이를 이해하면 일반화가 나타나는 시기와 이유에 대한 더 깊은 메커니즘을 밝힐 수 있습니다.

기술적 통찰력

Mechanistic은 역설계된 Grokked 네트워크를 연구하고 삼각법 ID를 통해 모듈러 산술을 수행하기 위해 푸리에와 같은 원형 임베딩을 사용하는 것과 같은 깔끔한 알고리즘을 구현한다는 사실을 발견했습니다. 전환은 정규화 시 네트워크의 가중치가 더 희박해지고 규범이 낮아지는 것과 관련이 있습니다. 기억하려면 크고 불규칙한 가중치가 필요한 반면 일반화 회로는 더 간단합니다. 따라서 Grokking은 찾기가 빠른 암기 솔루션과 형성이 더 느리고 효율적인 일반화 솔루션 간의 경쟁을 보여줍니다.

전략적 영향

더 명확한 결정들

이는 명확한 기술적 주장과 마케팅 언어를 구분하는 데 도움이 됩니다.

비용 및 예산

돈이나 시간을 들이기 전에 더 나은 구현 질문을 할 수 있습니다.

팀과 워크플로우

이해를 공유한 팀은 더 나은 제품, 정책 및 학습 결정을 내립니다.

그로킹과 지연된 일반화의 미래

Grokking은 연구자들이 확장하기를 희망하는 일반화 과학에 대한 창구입니다. 공개 질문에는 지연된 일반화가 대규모 모델 내에서 자동으로 발생하는지 여부, 전환을 감지하거나 가속화하는 방법, 모델이 기억된 예와 비교하여 실제로 개념을 학습한 시기를 아는 것이 무엇을 의미하는지 등이 포함됩니다. 통찰력은 더 나은 정규화, 교육 일정 및 해석 가능성 도구에 대한 정보를 제공할 수 있으며 대규모 언어 모델에서 새로운 기능을 예측하는 데 도움이 될 수 있습니다.

실제 구현

네트워크가 학습하는 정확한 회로를 역엔지니어링하기 위한 모듈식 산술 작업 연구

체중 감소가 암기에서 진정한 일반화로 어떻게 전환되는지 보여줍니다.

분석할 명확하고 완전히 이해된 모델 동작을 제공하여 해석 가능성 연구에 정보를 제공합니다.

초기 검증 정체가 항상 모델이 학습하지 못했다는 것을 의미하는 것은 아니라는 점을 실무자에게 주의를 줍니다.

위험 및 가드레일

팀마다 동일한 용어를 다르게 사용할 수 있으므로 범위를 조기에 정의하세요.

벤치마크는 강력해 보이지만 실제 성능은 고르지 않을 수 있습니다.

데이터 품질 및 평가 계획을 무시하면 취약한 결과가 발생하는 경우가 많습니다.

구현 로드맵

1

필요한 결과에 대한 일반 언어 정의부터 시작하세요.

2

테스트하기 전에 하나의 성공 지표와 하나의 실패 조건을 선택하세요.

3

세련된 데모 세트가 아닌 대표 데이터를 사용하여 소규모 파일럿을 실행하세요.

4

Grokking 및 Delayed Generalization이 도움이 되는 부분과 더 간단한 방법이 더 나은 부분을 문서화하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grokking and Delayed Generalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

What is Grokking and Delayed Generalization?

그로킹(Grokking)은 신경망이 먼저 훈련 데이터를 기억하고 오랜 시간 동안 거의 0에 가까운 검증 정확도에 머물렀다가 훈련 정확도가 100%에 도달한 후 오랜 시간이 지나 갑자기 일반화되는 놀라운 현상입니다. 학습과 일반화가 함께 일어난다는 직관을 뒤집는다.

신경망 훈련에서 그로킹을 정의하는 것은 무엇입니까?

Grokking은 훈련 정확도가 이미 100%에 도달한 후에도 발생하는 좋은 검증 성능으로 갑자기 도약하는 것입니다.

그로킹은 어떤 종류의 작업에서 처음으로 눈에 띄게 관찰되었습니까?

OpenAI 연구원들은 2021년에 모듈 추가와 같은 작은 합성 알고리즘 문제에 대해 불만을 토로했다고 보고했습니다.

그로킹에서 일반화로의 전환을 주도하는 데 가장 흔히 사용되는 요인은 무엇입니까?

가중치 감소는 네트워크를 취약하고 기억된 솔루션에서 소형의 일반화 회로로 점차 밀어냅니다.

연구자들이 모듈식 연산을 통해 복잡한 네트워크를 리버스 엔지니어링했을 때 무엇을 발견했습니까?

기계적 해석 가능성은 네트워크가 모듈러 산술을 계산하기 위해 삼각법, 원형 표현을 학습했음을 보여줍니다.

Grokking이 두 솔루션 간의 경쟁으로 설명되는 이유는 무엇입니까?

네트워크는 신속하게 암기 솔루션을 찾지만 정규화 과정에서 결국 더 단순한 일반화 회로로 수렴됩니다.