희박한 주의 패턴
주의가 희박하면 각 토큰이 전체 토큰이 아닌 신중하게 선택된 다른 토큰의 하위 집합에만 참석하게 되므로 Transformer가 더 저렴해집니다.
개요
This trades a little global reach for big savings in memory and compute on long sequences.
심층 분석
Full self-attention은 모든 토큰을 다른 모든 토큰과 비교하므로 비용은 시퀀스 길이의 제곱에 따라 증가하므로 긴 문서의 경우 고통스럽습니다. 희박한 관심은 조밀한 패턴을 구조화된 패턴으로 대체합니다. 일반적인 디자인에는 각 토큰이 근처의 이웃만 보는 슬라이딩 윈도우(로컬) 주의가 포함됩니다. 멀리 있는 상황에 저렴하게 도달하기 위해 앞으로 건너뛰는 보폭형 또는 확장형 패턴; 글로벌 토큰은 모든 것에 참여하고 모든 것에 참여하며 정보 허브 역할을 하는 몇 가지 특별한 위치입니다. Longformer, BigBird 및 Sparse Transformer와 같은 모델은 이를 결합하여 총 연결 수가 2차형이 아닌 대략 선형적으로 증가하여 수천에서 수만 개의 토큰의 컨텍스트를 가능하게 합니다.
기술적 통찰력
전체 NxN Attention 매트릭스 대신 Sparse Attention은 선택된 항목(종종 로컬 창과 소수의 전역 행 및 열의 결합)만 계산합니다. BigBird는 무작위, 창 및 전역 연결을 결합하면 O(N 제곱)에서 O(N)으로 복잡성을 줄이면서 전체 주의의 이론적 표현력을 보존한다는 사실을 유명하게 입증했습니다. 효율적인 커널은 계산 후 0으로 만드는 대신 마스크 아웃된 항목을 완전히 건너뜁니다.
전략적 영향
속도와 규모
일관성을 유지하면서 언어 워크플로를 더 빠르게 진행할 수 있습니다.
접근 및 도달
언어와 의사소통 스타일 전반에 걸쳐 접근성을 확장합니다.
더 명확한 결정들
자동화가 반복을 처리하는 동안 팀은 판단에 더 많은 시간을 할애할 수 있습니다.
희소 주의 패턴의 미래
희소 관심은 긴 컨텍스트 모델링의 핵심으로 남아 있으며 FlashAttention과 같은 최적화된 커널 및 입력당 주의할 토큰을 선택하는 학습된 또는 동적 희소성과 점점 더 많이 결합됩니다. 컨텍스트 창이 수백만 개의 토큰으로 확장됨에 따라 하이브리드 스택은 희소, 밀도 및 상태 공간 레이어를 혼합합니다. 하드웨어 인식 희소 커널과 라우팅 기반 주의를 통해 매우 긴 입력을 읽는 데 드는 비용을 계속 줄일 수 있습니다.
실제 구현
Longformer는 슬라이딩 윈도우와 글로벌 관심을 사용하여 전체 과학 논문 또는 법률 문서를 한 번에 처리합니다.
BigBird는 선형 확장 주의를 기울여 긴 문서의 질문 답변 및 유전체학 시퀀스를 처리합니다.
완전히 주의를 기울이면 GPU 메모리가 소모되는 책 길이의 텍스트 요약
글로벌 허브 토큰을 사용하여 수천 개의 토큰에 걸쳐 주요 정보를 라우팅하는 검색 및 긴 컨텍스트 채팅 시스템
위험 및 가드레일
환각 사실은 보고서, 지원 흐름 또는 연구 결과에 조용히 포함될 수 있습니다.
신속한 민감도는 유사한 요청 간에 일관되지 않은 결과를 초래할 수 있습니다.
액세스 제어가 약한 경우 민감한 텍스트 데이터가 노출될 수 있습니다.
구현 로드맵
출시 전에 출력 형식, 톤, 품질 표준을 정의하세요.
정확성이 중요할 때마다 신뢰할 수 있는 출처를 통해 대응하세요.
고위험 결과물에 대한 인적 검토 체크포인트를 유지합니다.
실패 패턴을 추적하고 프롬프트나 워크플로를 정기적으로 재교육하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sparse Attention Patterns quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
블록 희소 및 네이티브 희소 관심
자주 묻는 질문
What is Sparse Attention Patterns?
주의가 희박하면 각 토큰이 전체 토큰이 아닌 신중하게 선택된 다른 토큰의 하위 집합에만 참석하게 되므로 Transformer가 더 저렴해집니다. 이는 메모리와 긴 시퀀스에 대한 계산을 크게 절약하기 위해 약간의 글로벌 도달 범위를 교환합니다.
긴 시퀀스에서 전체 셀프 어텐션이 비용이 많이 드는 이유는 무엇입니까?
Full attention은 모든 토큰을 다른 모든 토큰과 비교하여 시간과 메모리 측면에서 O(N 제곱) 비용을 제공합니다.
슬라이딩 윈도우(로컬) 어텐션이란 무엇입니까?
지역적 관심은 각 토큰의 보기를 주변 토큰의 고정 창으로 제한하여 비용을 크게 절감합니다.
희소한 관심 속에 '글로벌 토큰'의 목적은 무엇인가?
몇 개의 글로벌 토큰이 모든 위치에 연결되어 정보가 전체 시퀀스에 걸쳐 저렴하게 흐르도록 합니다.
랜덤, 윈도우, 글로벌 어텐션을 결합하면 풀 어텐션 표현력이 유지됨을 입증한 모델은 무엇인가요?
BigBird는 희소 패턴이 대략 선형적으로 확장되는 동안 시퀀스 함수의 보편적인 근사치임을 보여주었습니다.
잘 설계된 희소 관심에서 연결 수는 대략 어떻게 확장됩니까?
로컬 창과 몇 개의 전역 링크에 대한 연결을 제한하면 전체 연결이 선형적으로 늘어납니다.