YaRN 컨텍스트 창 크기 조정
YaRN(Yet another RoPE extensioN)은 최소한의 미세 조정으로 변환기의 사용 가능한 컨텍스트 창을 훈련된 것 이상으로 확장하는 기술입니다.
개요
It matters because it lets existing models handle much longer documents without retraining from scratch.
심층 분석
대부분의 최신 LLM은 RoPE(Rotary Position Embedding)를 사용하여 단어 위치를 인코딩합니다. 이는 훈련 중에 모델이 본 길이까지만 잘 작동합니다. 더 긴 순서로 피드하면 모델 성능이 심하게 저하됩니다. YaRN은 주파수 인식 방식으로 RoPE의 회전 주파수를 재조정하여 이 문제를 해결합니다. 즉, 고주파 차원(로컬, 인근 관계 캡처)은 대부분 그대로 유지되는 반면 저주파 차원(장거리 위치 캡처)은 보간됩니다. 또한 장거리에서 로짓이 잘 작동하도록 주의를 기울이는 온도 조정 기능을 추가합니다. LLaMA 모델에서 입증된 결과는 원래 훈련 데이터의 약 0.1%와 수백 개의 미세 조정 단계를 사용하여 4K에서 64K-128K 토큰으로 컨텍스트를 확장합니다.
기술적 통찰력
RoPE는 위치 및 차원별 빈도에 비례하는 각도로 쿼리 및 키 벡터를 회전합니다. 순진한 선형 보간(위치 보간)은 모든 주파수를 동일하게 압축하여 로컬 디테일을 손상시킵니다. 대신 YaRN은 'NTK-by-parts'를 적용합니다. 즉, 저주파(장파장) 차원만 보간하고 고주파 차원은 그대로 두고 그 사이를 램프합니다. 주의 온도 스케일링은 엔트로피 이동을 보상하여 확장된 길이에서 정확도를 유지합니다.
전략적 영향
속도와 규모
일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.
접근 및 도달
언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.
더 명확한 결정들
자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.
YaRN 컨텍스트 창 크기 조정의 미래
YaRN 스타일의 주파수 인식 확장은 장기 컨텍스트 모델을 제공하기 위한 기본 요소가 되었습니다. 실험실이 백만 개의 토큰 창을 향해 나아가면서 변종과 후속 제품이 계속해서 나타나고 있습니다. 효율적인 주의, KV 캐시 압축, 요청에 따라 즉시 조정되는 동적 확장을 통해 더욱 긴밀한 통합을 기대하세요. 더 넓은 추세는 '모델이 학습된 기간'과 '유용하게 읽을 수 있는 기간'을 분리하여 긴 컨텍스트를 값비싼 아키텍처적 노력이 아닌 저렴한 사후 학습 기능으로 만드는 것입니다.
실제 구현
공개 LLaMA 모델을 4K에서 128K 토큰으로 확장하여 한 번에 전체 코드베이스 또는 장기 계약을 수집할 수 있습니다.
챗봇이 이전 대화 내용을 자르지 않고 매우 긴 대화 기록을 유지하도록 허용
기본 모델의 기본 창을 초과하는 책 길이의 문서 또는 여러 시간 분량의 기록을 요약합니다.
작은 미세 조정 실행만으로 긴 컨텍스트 검색 작업을 위해 사전 훈련된 모델을 저렴하게 적용
위험 및 가드레일
환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.
신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.
액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.
구현 로드맵
출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.
정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.
고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.
실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
상황별 창
자주 묻는 질문
What is YaRN Context Window Scaling?
YaRN(Yet another RoPE extensioN)은 최소한의 미세 조정으로 변환기의 사용 가능한 컨텍스트 창을 훈련된 것 이상으로 확장하는 기술입니다. 기존 모델을 처음부터 다시 학습하지 않고도 훨씬 긴 문서를 처리할 수 있기 때문에 중요합니다.
YaRN은 컨텍스트 길이를 확장하기 위해 어떤 위치 인코딩 방식을 수정합니까?
YaRN은 'Yet another RoPE extensioN'을 의미하며 Rotary Position Embeddings에 사용되는 회전 주파수의 크기를 조정하여 작동합니다.
YaRN은 고주파 RoPE 차원과 저주파 RoPE 차원을 어떻게 처리합니까?
YaRN의 'NTK-by-parts' 접근 방식은 고주파(로컬) 치수를 보존하는 동시에 저주파(장거리) 치수를 보간하여 로컬 세부 사항을 손상시키지 않습니다.
장기 컨텍스트 모델을 처음부터 훈련하는 것에 비해 YaRN의 주요 효율성 이점은 무엇입니까?
YaRN은 원래 훈련 데이터의 약 0.1%와 소수의 미세 조정 단계를 사용하여 컨텍스트를 확장할 수 있으며 이는 재훈련보다 훨씬 저렴합니다.
주파수 재조정 외에도 YaRN은 장거리 주의를 안정적으로 유지하기 위해 어떤 추가 조정을 적용합니까?
YaRN은 시퀀스가 훨씬 길어질 때 발생하는 엔트로피/로짓 이동을 보상하기 위해 주의 온도를 수정합니다.
확장 없이 RoPE 모델 시퀀스를 훈련된 것보다 훨씬 오랫동안 공급하면 어떤 문제가 발생합니까?
RoPE는 보이지 않는 긴 위치에 대해 제대로 일반화되지 않으므로 주파수를 다시 조정하지 않으면 품질이 저하됩니다.