Příze a prodloužení délky kontextu
YaRN (Ještě další rozšíření RoPE) je účinná technika pro roztažení použitelného kontextového okna modelu daleko nad rámec toho, na čem byl trénován.
Přehled
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
Hluboký ponor
Většina moderních LLM kóduje pozice tokenů pomocí RoPE (Rotary Position Embeddings), které rotují dotazovací a klíčové vektory o úhly svázané s pozicí. Když podáváte sekvence delší než tréninková délka, tyto rotace se dostanou do neviditelných rozsahů a model se rozpadne. YaRN, představený v roce 2023 Bowenem Pengem a spolupracovníky, to napravuje interpolací s vědomím NTK aplikovanou na frekvenci: ponechává vysokofrekvenční dimenze (které zachycují místní vztahy s krátkým dosahem) většinou nedotčené, zatímco interpoluje nízkofrekvenční dimenze (které sledují pozici na dlouhé vzdálenosti). YaRN také přidává do pozornosti úpravu teploty, aby se zabránilo změnám entropie, které pocházejí z delších kontextů. Výsledkem je silný dlouhodobý výkon po doladění pouze malého zlomku dat a kroků, které naivní přístupy vyžadují.
Technický přehled
RoPE přiřadí každému rozměru vložení frekvenci otáčení. Naivní lineární interpolace komprimuje všechny frekvence stejně, což poškozuje vysokofrekvenční dimenze, které kódují jemné místní detaily. YaRN používá funkci rampy k interpolaci pouze nízkofrekvenčních (dlouhovlnných) rozměrů při zachování vysokofrekvenčních rozměrů, plus škálování teploty pozornosti 1/sqrt(t), které udržuje ostrost softmax stabilní s rostoucí délkou sekvence. Tento přístup NTK po částech rozšiřuje kontext s mnohem menší degradací.
Strategický dopad
Cena a rozpočet
Rozhodnutí o architektuře zvyšují výkon a provozní náklady po mnoho let.
Jasnější rozhodnutí
Technické vzdělání pomáhá týmům vybrat ten správný stack, nejen ten nejnovější.
Kontrola kvality
Lepší konstrukční volby snižují výskyt problémů se spolehlivostí ve výrobě.
Budoucnost YaRN a rozšíření délky kontextu
Rozšíření kontextu je nyní standardní praxí: otevřené modely běžně dodávají varianty s rozšířením YaRN dosahující 128 tisíc tokenů nebo více. Výzkum se posouvá směrem k metodám, které rozšiřují kontext pomocí nulového nebo téměř nulového jemného doladění, kombinují změnu měřítka RoPE s triky se vzorem pozornosti a udržují kvalitu v celém okně, nikoli pouze na koncích. Očekávejte těsnější integraci těchto technik do předtréninku, takže dlouhý kontext je spíše nativní než dovybavený.
Real-World Implementace
Rozšíření modelu s otevřeným kontextem 4K na 32K nebo 128K pro zodpovězení otázek týkajících se dlouhého dokumentu s krátkým doladěním
Umožňuje systémům rozšířeným o načítání přijímat mnoho zřetězených pasáží bez zkrácení
Napájení asistentů kódu, kteří potřebují celý velký soubor úložiště nebo více souborů v jedné výzvě
Přizpůsobení základního modelu pro dlouhé konverzace s více odbočkami, které hromadí velké historie chatu
Rizika a zábradlí
Optimalizace jednoho benchmarku může skrýt širší systémové slabiny.
Náklady na infrastrukturu a údržbu jsou často podceňovány.
Mezery v zabezpečení a pozorovatelnosti se mohou zvětšovat, jak se systémy stávají složitějšími.
Plán implementace
Před implementací definujte cíle latence, kvality a nákladů.
Benchmark za realistických podmínek zatížení a dat.
Monitorování chyb, posunu a dopadu na uživatele.
Před škálováním připravte cesty vrácení zpět a reakce na incidenty.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Interpolace pozice pro kontextové rozšíření
Často kladené otázky
What is YaRN and Context Length Extension?
YaRN (Ještě další rozšíření RoPE) je účinná technika pro roztažení použitelného kontextového okna modelu daleko nad rámec toho, na čem byl trénován. Chytře mění měřítko vložení rotační polohy, takže model trénovaný na, řekněme, 4K tokeny zvládne 32K nebo více s minimálním doladěním.
Jakou metodu kódování pozice YaRN upravuje, aby rozšířil kontext?
YaRN, jehož název znamená Ještě další rozšíření RoPE, mění měřítko uložení rotačních poloh používaných ve většině moderních LLM.
Co se pokazí, když model RoPE vidí sekvence delší, než je jeho tréninková délka?
Pozice mimo trénink vytvářejí úhly rotace, které model nikdy neviděl, takže chování pozornosti prudce klesá.
Jak YaRN zachází s různými rozměry frekvence RoPE?
YaRN používá NTK-by-parts ramp, která interpoluje nízkofrekvenční stmívání na dlouhých vlnových délkách a nechává vysokofrekvenční tlumení krátkého dosahu většinou nedotčená.
Jaké další úpravy kromě přeškálování frekvencí používá YaRN?
YaRN přidává teplotní škálování do logitů pozornosti, aby čelilo posunům entropie, ke kterým dochází s rostoucím kontextem.
Jaká je klíčová praktická výhoda YaRN oproti naivní interpolaci?
YaRN dosahuje silné kvality dlouhého kontextu po jemném doladění malého zlomku dat, které naivní metody vyžadují.