언어 AI 가이드

변압기의 유도 헤드

유도 헤드는 간단하지만 강력한 복사 규칙을 구현하는 주의 헤드입니다. '나는 앞서 [A][B]를 봤고, 지금은 [A]를 다시 보고 있으므로 [B]를 예측하세요.' 이는 프롬프트의 몇 가지 예를 통해 상황 내 학습을 수행하는 Transformers의 놀라운 능력 뒤에 있는 핵심 메커니즘입니다.

2분 읽기마지막 업데이트

심층 분석

소형 변압기의 기계적 해석 가능성을 통해 발견된 유도 헤드는 손실이 갑자기 감소하고 상황 내 학습이 시작되는 특징적인 순간에 훈련 중에 나타납니다. 일반적으로 2헤드 회로로 작동합니다. 이전 레이어의 '이전 토큰 헤드'는 각 토큰의 이전 토큰에 대한 정보를 복사합니다. 그런 다음 유도 헤드는 이를 사용하여 접두사 일치를 수행합니다. 즉, 현재 토큰의 이전 발생을 찾고, 그 뒤에 오는 것을 살펴본 후 다시 참석하여 다음 토큰을 예측에 복사합니다. 이 패턴 완성 기능을 통해 모델은 가중치 업데이트 없이 시퀀스를 반복하고, 유추를 완성하고, 프롬프트 내에서 완전히 정의된 새로운 형식이나 단어 정의를 선택할 수 있습니다.

기술적 통찰력

회로는 여러 레이어에 걸쳐 두 개의 Attention Head로 구성됩니다. 이전 토큰 헤드는 '나 이전의 토큰은 X였습니다'를 각 위치의 잔여 스트림에 씁니다. 유도 헤드의 쿼리 키 일치(Q-K)는 현재 토큰을 이동된 키와 일치시켜 이전 [A] 위치를 찾고, 출력 값 경로(O-V)는 뒤따르는 토큰을 복사합니다. 이는 변압기 회로 연구에서 연구된 교차층 'K-구성'의 구체적인 예입니다.

전략적 영향

속도와 규모

일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.

접근 및 도달

언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.

더 명확한 결정들

자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.

변압기 유도 헤드의 미래

유도 헤드는 기계적인 해석 가능성의 대표적인 성공이며, 이 분야에서는 문자 그대로 복사하는 것이 아니라 추상화를 처리하는 보다 풍부한 '상황 내 학습 회로'로 아이디어를 확장하고 있습니다. 이러한 머리의 갑작스러운 형성을 더 큰 모델의 단계 변화 및 출현 능력과 연결하는 더 많은 작업을 기대합니다. 이러한 회로가 언제 어떻게 형성되는지 이해하면 기능을 예측하고, 더 나은 커리큘럼을 설계하고, 모델이 순전히 맥락에서 의도하지 않은 동작을 학습하는 시기를 감지하는 안전 도구를 구축하는 데 도움이 될 수 있습니다.

실제 구현

이전 컨텍스트에서 'C'를 예측하여 'A B C ... A B'와 같은 반복되는 무작위 토큰 시퀀스를 완성합니다.

모델이 이전 예에서 설명한 입력-출력 형식을 복사하는 퓨샷 프롬프트입니다.

프롬프트에 제시된 꾸며낸 단어의 의미를 학습하고 나중에 같은 구절에서 이를 올바르게 재사용합니다.

이전에 발생한 토큰을 일치시켜 긴 따옴표로 묶인 문자열이나 목록을 충실하게 에코합니다.

위험 및 가드레일

환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.

신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.

액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.

구현 로드맵

1

출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.

2

정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.

3

고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.

4

실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Induction Heads in Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

Jamba 하이브리드 변압기-Mamba 모델

자주 묻는 질문

What is Induction Heads in Transformers?

유도 헤드는 간단하지만 강력한 복사 규칙을 구현하는 주의 헤드입니다. '나는 앞서 [A][B]를 봤고, 지금은 [A]를 다시 보고 있으므로 [B]를 예측하세요.' 이는 프롬프트의 몇 가지 예를 통해 상황 내 학습을 수행하는 Transformers의 놀라운 능력 뒤에 있는 핵심 메커니즘입니다.

인덕션 헤드는 기본적으로 어떤 규칙을 구현합니까?

유도 헤드는 접두사 일치를 수행합니다. 현재 토큰이 이전에 나타난 위치를 찾고 그 뒤에 오는 모든 것을 복사합니다.

인덕션 헤드는 다음 중 어떤 기능과 가장 밀접하게 연관되어 있습니까?

그들의 출현은 상황 내 학습의 시작, 즉 가중치 업데이트 없이 프롬프트의 예에서 적응할 수 있는 능력과 일치합니다.

유도 회로에서 '이전 토큰 헤드'는 어떤 역할을 합니까?

이전 토큰 헤드는 잔여 스트림에 '내 전임자는 X였습니다'를 기록하여 유도 헤드가 일치하고 복사할 수 있도록 합니다.

표준 유도 회로에는 일반적으로 몇 개의 주의 헤드가 포함됩니까?

클래식 회로는 이전 토큰 헤드와 일치 및 복사를 수행하는 유도 헤드의 2개 헤드 구성입니다.

훈련 중에 유도 헤드가 형성될 때 주목할만한 점은 무엇입니까?

유도 헤드는 갑작스러운 손실 감소 및 상황 내 학습의 출현과 일치하는 위상 변화와 같은 순간에 나타납니다.