PRZEWODNIK Językowy AI

Uwaga na przesuwane okno

Uwaga przesuwanego okna ogranicza każdy token do obsługi tylko otoczenia pobliskich tokenów o stałym rozmiarze, a nie całej sekwencji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

To zmniejsza koszt kwadratowy standardowej uwagi do linii liniowej, czyniąc modele długokontekstowe znacznie tańszą w uruchomieniu.

Głębokie nurkowanie

Standardowa samouważność porównuje każdy żeton z każdym innym żetonem, więc sekwencja o długości N wymaga porównań z grubsza N-kwadratów. Funkcja przesuwania okna rozwiązuje ten problem, nadając każdemu żetonowi okno o rozmiarze W (powiedzmy 4096 żetonów) i obsługując tylko sąsiadów znajdujących się w tym oknie. Koszt rośnie jako N razy W zamiast N-kwadratu. Co najważniejsze, ułożenie wielu warstw z okienkami rozszerza efektywne pole recepcyjne: po L warstwach informacja może rozprzestrzeniać się w tokenach mniej więcej L razy W, podobnie jak rosnące pole recepcyjne CNN. Mistral 7B spopularyzował to za pomocą okna zawierającego 4096 tokenów w 32 warstwach, osiągając teoretyczny rozpiętość 131 tys. tokenów. Modele często łączą warstwy okienkowe z okazjonalnymi warstwami skupiającymi całą uwagę, aby zachować połączenia dalekiego zasięgu.

Wgląd techniczny

W masce uwagi zapytanie w pozycji i może zobaczyć tylko klucze z pozycji i minus W plus 1 do i (przypadek przyczynowy). Ta rzadka maska ​​oznacza, że ​​pamięć podręczna KV potrzebuje tylko ostatnich tokenów W na warstwę, co powoduje zmniejszenie pamięci podczas generowania. Ponieważ okno zmienia się wraz z każdym nowym tokenem, łączy się ono w naturalny sposób z pamięcią podręczną bufora kroczącego, która zastępuje najstarsze wpisy, zamiast rosnąć w nieskończoność.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość uwagi przy przesuwanych oknach

Projekty hybrydowe przeplatają teraz kilka warstw globalnych lub warstw skupiających pełną uwagę pomiędzy wieloma warstwami przesuwanych okien, równoważąc wydajność z rozumowaniem prawdziwie dalekiego zasięgu. Gemma 2 i inne naprzemiennie bloki lokalne i globalne. Oczekuj połączenia uwagi okna z modelami przestrzeni stanów, pochłaniaczami uwagi i kompresją pamięci podręcznej KV, dzięki czemu modele graniczne będą obsługiwać konteksty milionów tokenów bez uciekającej pamięci. Staje się domyślnym elementem składowym, a nie egzotyczną optymalizacją.

Implementacja w świecie rzeczywistym

Mistral 7B wykorzystuje przesuwane okno o pojemności 4096 tokenów w swoich warstwach, aby tanio obsługiwać długie monity na konsumenckich procesorach graficznych.

Longformer stosuje uwagę okienkową oraz kilka globalnych tokenów do klasyfikowania i podsumowywania dokumentów wielostronicowych.

Gemma 2 zamienia lokalne warstwy przesuwanego okna z warstwami skupiającymi uwagę globalną, aby zrównoważyć prędkość i przywołanie z dużej odległości.

Pamięci podręczne KV z buforem zmiennym w asystentach czatu przechowują tylko najnowsze okno tokenów, ograniczając pamięć podczas długich rozmów.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Uwaga dotycząca zapytania grupowego

Często zadawane pytania

Czym jest uwaga w przesuwnym oknie?

Uwaga przesuwanego okna ogranicza każdy token do obsługi tylko otoczenia pobliskich tokenów o stałym rozmiarze, a nie całej sekwencji. Zmniejsza to koszt kwadratowy standardowej uwagi do liniowego, dzięki czemu modele o długim kontekście są znacznie tańsze w obsłudze.

Jaka jest główna korzyść obliczeniowa płynąca z przesuwania uwagi w oknie w porównaniu ze standardową samouwagą?

Ograniczając każdy żeton do stałego okna W sąsiadów, koszt rośnie jako N razy W (liniowo w N), a nie N-kwadrat.

Jak w projekcie Mistrala 7B informacje mogą nadal przemieszczać się daleko poza pojedyncze okno zawierające 4096 żetonów?

Podobnie jak w przypadku CNN, każda warstwa przesuwa informacje o jedno okno dalej, zatem L warstw zapewnia efektywny zakres wynoszący mniej więcej L razy W tokenów.

Dlaczego uwaga przesuwanego okna zmniejsza pamięć podczas generowania tekstu?

Ponieważ token dotyczy tylko ostatniego okna, starsze wpisy klucz/wartość można odrzucić, często za pośrednictwem pamięci podręcznej bufora kroczącego.

Jakiego wyboru projektu używają modele takie jak Gemma 2 obok przesuwanych okien, aby zachować rozumowanie dalekosiężne?

Mieszanie okazjonalnych warstw globalnych/pełnej uwagi pomiędzy warstwami lokalnymi pozwala zachować prawdziwe połączenia długodystansowe, które osłabia czyste okienkowanie.

W przypadku przyczynowego okna przesuwnego o rozmiarze W, które klawisze mogą być zapytane o pozycję, którą się zajmuję?

W przypadku przyczynowym zapytanie widzi siebie i tokeny W minus 1 bezpośrednio przed nim, nigdy przyszłe tokeny.