Rozszerzenie długości przędzy i kontekstu
YaRN (jeszcze kolejne rozszerzenie RoPE) to wydajna technika rozciągania użytecznego okna kontekstowego modelu daleko poza to, na czym został on przeszkolony.
Przegląd
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
Głębokie nurkowanie
Większość nowoczesnych LLM koduje pozycje tokenów za pomocą RoPE (Rotary Position Embeddings), które obracają wektory zapytań i kluczy o kąty powiązane z pozycją. Kiedy podajesz sekwencje dłuższe niż długość treningu, rotacje te wchodzą w niewidoczne zakresy i model się psuje. YaRN, wprowadzony w 2023 r. przez Bowena Penga i współpracowników, rozwiązuje ten problem za pomocą interpolacji uwzględniającej NTK stosowanej dla każdej częstotliwości: pozostawia wymiary o wysokiej częstotliwości (które rejestrują lokalne relacje o krótkim zasięgu) w większości nietknięte podczas interpolacji wymiarów o niskiej częstotliwości (które śledzą pozycję dalekiego zasięgu). YaRN dodaje również możliwość dostosowania temperatury, aby przeciwdziałać zmianom entropii wynikającym z dłuższych kontekstów. Rezultatem jest wysoka wydajność w długim kontekście po dostrojeniu jedynie niewielkiej części danych i kroków, których wymagają naiwne podejścia.
Wgląd techniczny
RoPE przypisuje każdemu wymiarowi osadzenia częstotliwość obrotu. Naiwna interpolacja liniowa kompresuje wszystkie częstotliwości jednakowo, szkodząc wymiarom wysokich częstotliwości, które kodują drobne szczegóły lokalne. YaRN wykorzystuje funkcję rampy do interpolacji tylko wymiarów o niskiej częstotliwości (długiej długości fali), zachowując wymiary o wysokiej częstotliwości, a także skalowanie temperatury uwagi 1/sqrt(t), które utrzymuje stabilną ostrość softmax w miarę wzrostu długości sekwencji. Podejście NTK oparte na częściach rozszerza kontekst przy znacznie mniejszej degradacji.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość przędzy i wydłużanie długości kontekstu
Rozszerzanie kontekstu jest obecnie standardową praktyką: otwarte modele rutynowo dostarczają warianty z rozszerzeniem YaRN, które osiągają 128 tys. tokenów lub więcej. Badania zmierzają w kierunku metod rozszerzających kontekst z zerowym lub prawie zerowym dostrojeniem, łączących przeskalowanie RoPE ze sztuczkami skupiającymi uwagę i utrzymującymi jakość w całym oknie, a nie tylko na końcach. Można się spodziewać ściślejszej integracji tych technik ze szkoleniem wstępnym, tak aby kontekst był natywny, a nie doposażany.
Implementacja w świecie rzeczywistym
Rozszerzanie modelu otwartego kontekstu 4K do 32K lub 128K w celu odpowiadania na pytania dotyczące długich dokumentów z krótkim dostrajaniem
Umożliwianie systemom wspomaganym wyszukiwaniem przyjmowania wielu połączonych fragmentów bez obcinania
Zasilanie asystentów kodu, które wymagają całego dużego pliku repozytorium lub wielu plików w jednym wierszu
Dostosowanie modelu podstawowego do długich, wieloobrotowych rozmów, które kumulują dużą historię rozmów
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Interpolacja pozycji w celu rozszerzenia kontekstu
Często zadawane pytania
What is YaRN and Context Length Extension?
YaRN (jeszcze kolejne rozszerzenie RoPE) to wydajna technika rozciągania użytecznego okna kontekstowego modelu daleko poza to, na czym został on przeszkolony. Sprytnie przeskalowuje osadzanie pozycji obrotowych, dzięki czemu model wytrenowany na, powiedzmy, tokenach 4K może obsłużyć 32K lub więcej przy minimalnym dostrojeniu.
Jaką metodę kodowania pozycji modyfikuje YaRN, aby rozszerzyć kontekst?
Przędza, której nazwa oznacza Jeszcze jedno przedłużenie liny, zmienia skalę osadzania w pozycji obrotowej stosowanej w większości nowoczesnych LLM.
Co dzieje się nie tak, gdy model RoPE widzi sekwencje dłuższe niż długość treningu?
Pozycje wykraczające poza trening wytwarzają kąty obrotu, jakich model nigdy nie widział, więc zachowanie uwagi gwałtownie się pogarsza.
W jaki sposób YaRN traktuje różne wymiary częstotliwości RoPE?
YaRN wykorzystuje rampę NTK po częściach, która interpoluje przyciemnienia o niskiej częstotliwości na długich falach i pozostawia w większości nienaruszone przyciemnienia o wysokiej częstotliwości o krótkim zasięgu.
Oprócz przeskalowania częstotliwości, jakie dodatkowe dostosowania stosuje YaRN?
YaRN dodaje skalowanie temperatury do logitów uwagi, aby przeciwdziałać zmianom entropii, które występują wraz ze wzrostem kontekstu.
Jaka jest kluczowa praktyczna przewaga YaRN nad naiwną interpolacją?
YaRN osiąga wysoką jakość w długim kontekście po dostrojeniu niewielkiej części danych naiwnych, których wymagają metody.