PRZEWODNIK Językowy AI

Skalowanie okna kontekstowego YaRN

Przędza (Jeszcze jedno rozszerzenie RoPE) to technika, która rozciąga użyteczne okno kontekstowe transformatora daleko poza to, na czym był on trenowany, przy minimalnym dostrojeniu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it lets existing models handle much longer documents without retraining from scratch.

Głębokie nurkowanie

Większość nowoczesnych LLM koduje pozycje słów za pomocą osadzania pozycji obrotowej (RoPE), które działają dobrze tylko do długości, którą model widział podczas treningu. Podawaj w dłuższej sekwencji, a model ulegnie znacznej degradacji. YaRN rozwiązuje ten problem, przeskalowując częstotliwości rotacji RoPE w sposób uwzględniający częstotliwość: wymiary o wysokiej częstotliwości (które rejestrują lokalne, pobliskie relacje) pozostają w większości nietknięte, podczas gdy wymiary o niskiej częstotliwości (które rejestrują pozycję na dużym dystansie) są interpolowane. Zwraca także uwagę na regulację temperatury, aby logity dobrze zachowywały się na długich dystansach. Wynik zademonstrowany na modelach LLaMA rozszerza kontekst tokenów od 4K do 64K-128K przy użyciu jedynie około 0,1% oryginalnych danych szkoleniowych i kilkuset kroków dostrajania.

Wgląd techniczny

RoPE obraca wektory zapytań i kluczy o kąt proporcjonalny do położenia i częstotliwości poszczególnych wymiarów. Naiwna interpolacja liniowa (interpolacja położenia) równomiernie zgniata wszystkie częstotliwości, szkodząc lokalnym szczegółom. Zamiast tego YaRN stosuje „NTK po częściach”: interpoluje tylko wymiary o niskiej częstotliwości (o dużej długości fali), pozostawia w spokoju wymiary o wysokiej częstotliwości i rampuje między nimi. Skalowanie temperatury uwagi kompensuje przesunięcie entropii, zachowując dokładność na większych długościach.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość skalowania okna kontekstowego YaRN

Rozszerzenie uwzględniające częstotliwość w stylu YaRN stało się domyślnym składnikiem modeli o długim kontekście; warianty i następcy wciąż pojawiają się, gdy laboratoria dążą do okien z milionami tokenów. Oczekuj ściślejszej integracji z wydajną uwagą, kompresją pamięci podręcznej KV i dynamicznym skalowaniem, które dostosowuje się na bieżąco w zależności od żądania. Szerszym trendem jest oddzielenie „jak długo model był szkolony” od „jak długo może z pożytkiem czytać”, co sprawia, że ​​długi kontekst jest tanią funkcją po szkoleniu, a nie kosztownym przedsięwzięciem architektonicznym.

Implementacja w świecie rzeczywistym

Rozszerzenie otwartego modelu LLaMA z 4 tys. tokenów do 128 tys., aby mógł on w jednym przebiegu przyjąć całą bazę kodu lub długi kontrakt

Pozwól chatbotowi zachować bardzo długie historie rozmów bez obcinania wcześniejszych tur

Podsumowanie dokumentów o objętości książki lub wielogodzinnych transkryptów, które przekraczają natywne okno modelu podstawowego

Tanie dostosowywanie wstępnie wyszkolonego modelu do zadań wyszukiwania w długim kontekście przy użyciu jedynie niewielkiego przebiegu dostrajania

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is YaRN Context Window Scaling?

Przędza (Jeszcze jedno rozszerzenie RoPE) to technika, która rozciąga użyteczne okno kontekstowe transformatora daleko poza to, na czym był on trenowany, przy minimalnym dostrojeniu. Ma to znaczenie, ponieważ pozwala istniejącym modelom obsługiwać znacznie dłuższe dokumenty bez konieczności ponownego szkolenia od zera.

Jaki schemat kodowania pozycji modyfikuje YaRN, aby wydłużyć długość kontekstu?

YaRN oznacza „Yet another RoPE extensioN” i działa poprzez przeskalowanie częstotliwości rotacji używanych w osadzaniu w pozycji obrotowej.

W jaki sposób YaRN traktuje wymiary RoPE o wysokiej i niskiej częstotliwości?

Podejście „NTK po częściach” zastosowane w YaRN pozwala zachować wymiary o wysokiej częstotliwości (lokalne), interpolując wymiary o niskiej częstotliwości (dalekiego zasięgu), aby uniknąć uszkodzenia lokalnych szczegółów.

Jaka jest kluczowa przewaga YaRN w zakresie wydajności w porównaniu z trenowaniem od zera modelu o długim kontekście?

YaRN może rozszerzyć kontekst, wykorzystując około 0,1% oryginalnych danych szkoleniowych i niewielką liczbę kroków dostrajających, co jest znacznie tańsze niż ponowne szkolenie.

Oprócz przeskalowania częstotliwości, jakie dodatkowe dostosowania stosuje YaRN, aby utrzymać stabilną uwagę dalekiego zasięgu?

YaRN modyfikuje temperaturę uwagi, aby skompensować przesunięcie entropii/logitowe, które występuje, gdy sekwencje stają się znacznie dłuższe.

Jaki problem pojawia się, jeśli zasilasz sekwencje modelu RoPE znacznie dłuższe niż te, na których był trenowany, bez żadnego skalowania?

RoPE słabo uogólnia na niewidoczne długie pozycje, więc jakość spada, chyba że częstotliwości zostaną przeskalowane.