접두사 튜닝
접두사 조정은 모든 레이어의 입력 앞에 추가되는 작은 연속 벡터 세트를 학습하여 고정된 언어 모델을 조정하는 매개변수 효율적인 방법입니다.
개요
새로운 작업에 맞게 거대한 모델을 커스터마이즈할 수 있고, 1% 미만의 파라미터만 업데이트할 수 있습니다.
심층 분석
스탠포드 연구원인 Li와 Liang이 2021년에 도입한 접두사 튜닝은 무게를 건드리지 않고 사전 훈련된 변압기를 조정합니다. 모든 매개변수를 미세 조정하는 대신 모든 주의 계층의 키와 값에 훈련 가능한 '가상 토큰'(접두사) 시퀀스를 추가합니다. 고정 모델은 마치 실제 컨텍스트인 것처럼 이 접두사에 주의를 기울여 대상 작업을 향해 동작을 조정합니다. 접두사 벡터만 학습되므로 전체 모델 복사본 대신 작업당 하나의 작은 접두사를 저장할 수 있습니다. 이를 통해 많은 작업을 저렴하게 처리하고 전체 미세 조정으로 인한 스토리지 폭발을 방지할 수 있습니다. 이는 테이블-텍스트 및 요약과 같은 생성 작업에서 특히 잘 수행되며 종종 높은 데이터 설정에서 전체 미세 조정과 일치합니다.
기술적 통찰력
입력 임베딩 레이어에만 벡터를 추가하는 프롬프트 튜닝과 달리 접두사 튜닝은 훈련 가능한 키/값 벡터를 모든 변환기 레이어의 self-attention에 주입합니다. 훈련을 안정화하기 위해 접두사는 일반적으로 직접 최적화되기보다는 작은 피드포워드 네트워크(재매개변수화 트릭)에 의해 생성됩니다. 해당 네트워크는 훈련 후에 폐기되고 학습된 접두사 행렬만 남습니다. 이러한 접두사 매개변수만 그라데이션을 수신합니다. 전체 백본은 고정된 상태로 유지됩니다.
전략적 영향
속도와 규모
일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.
접근 및 도달
언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.
더 명확한 결정들
자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.
접두사 튜닝의 미래
접두사 조정은 PEFT(매개변수 효율적인 미세 조정) 웨이브를 시작하는 데 도움이 되었으며 Hugging Face PEFT와 같은 라이브러리의 구성 요소로 남아 있습니다. 기본 모델이 수천억 개의 매개변수로 성장함에 따라 접두사와 같은 경량 어댑터는 다중 테넌트 서비스 및 기기 내 개인화에 점점 더 매력적입니다. LoRA 스타일의 낮은 순위 업데이트와 접두사를 혼합하고 전체 모델을 재교육하지 않고도 스타일, 페르소나 및 안전 동작을 제어하는 데 사용이 증가하는 지속적인 하이브리드 접근 방식을 기대합니다.
실제 구현
WebNLG 데이터 세트에서 작은 접두사를 훈련하여 테이블-텍스트 생성을 위해 하나의 고정된 GPT-2 백본을 적용합니다.
단일 공유 모델에서 수십 개의 고객별 요약 스타일을 각각 교체 가능한 접두사 파일로 제공
기본 가중치를 재교육하지 않고 챗봇에 대한 언어 모델의 어조 또는 페르소나 조정
전체 미세 조정이 과적합되는 법률 또는 의료 텍스트 생성과 같은 저데이터 도메인 적응
위험 및 가드레일
환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.
신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.
액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.
구현 로드맵
출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.
정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.
고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.
실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Prefix Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
거부 샘플링 미세 조정
자주 묻는 질문
프리픽스 튜닝이란 무엇인가요?
접두사 조정은 모든 레이어의 입력 앞에 추가되는 작은 연속 벡터 세트를 학습하여 고정된 언어 모델을 조정하는 매개변수 효율적인 방법입니다. 이를 통해 1% 미만의 매개변수를 업데이트하면서 새로운 작업에 맞게 거대한 모델을 사용자 정의할 수 있습니다.
접두사 튜닝은 실제로 무엇을 훈련합니까?
접두사 튜닝은 백본을 고정하고 작은 연속 접두사 벡터 세트만 학습하여 매개변수 효율성을 유지합니다.
접두사 벡터는 어디에 삽입됩니까?
접두사 튜닝은 입력뿐만 아니라 모든 변환기 레이어의 self-attention에 훈련 가능한 키/값 벡터를 추가합니다.
누가 접두사 튜닝을 도입했으며 대략 언제 도입했습니까?
접두사 튜닝은 2021년 스탠포드의 Xiang Lisa Li와 Percy Liang이 제안했습니다.
많은 작업을 처리하는 데 접두사 조정이 매력적인 이유는 무엇입니까?
작은 접두사만 작업별로 지정되므로 전체 모델을 복제하는 대신 작업당 하나의 작은 파일을 저장합니다.
접두사 훈련을 안정화하기 위해 자주 사용되는 방법은 무엇입니까?
작은 MLP는 안정성을 위해 훈련 중에 접두사를 생성한 다음 버려지고 학습된 접두사 행렬만 남깁니다.