GHID tehnic

Extensia YRN și a lungimii contextului

YaRN (Yet another ROPE extension) este o tehnică eficientă pentru a extinde fereastra de context utilizabilă a unui model cu mult dincolo de ceea ce a fost antrenat.

2 minute de lecturăUltima actualizare

Prezentare generală

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Scufundare în profunzime

Majoritatea LLM-urilor moderne codifică pozițiile jetonelor cu RoPE (Rotary Position Embeddings), care rotesc interogarea și vectorii cheie în funcție de unghiuri legate de poziție. Când alimentați secvențe mai lungi decât durata antrenamentului, aceste rotații intră în intervale nevăzute și modelul se defectează. YaRN, introdus în 2023 de Bowen Peng și colaboratori, rezolvă acest lucru cu interpolarea conștientă de NTK aplicată pe frecvență: lasă dimensiunile de înaltă frecvență (care captează relațiile locale, pe distanță scurtă) în mare parte neatinse, în timp ce interpolează dimensiunile de joasă frecvență (care urmăresc poziția pe distanță lungă). YaRN adaugă, de asemenea, o ajustare a temperaturii atenției pentru a contracara modificările entropiei care provin din contexte mai lungi. Rezultatul este o performanță puternică în context lung, după reglarea fină pe doar o mică parte a datelor și a pașilor pe care îi necesită abordările naive.

Perspectivă tehnică

RoPE atribuie fiecărei dimensiuni de încorporare o frecvență de rotație. Interpolarea liniară naivă comprimă toate frecvențele în mod egal, dăunând dimensiunilor de înaltă frecvență care codifică detalii locale fine. YaRN folosește o funcție de rampă pentru a interpola doar dimensiunile de joasă frecvență (lungime de undă lungă) în timp ce le păstrează pe cele de înaltă frecvență, plus o scalare a temperaturii de atenție 1/sqrt(t) care menține stabilă claritatea softmax pe măsură ce lungimea secvenței crește. Această abordare NTK-by-parts extinde contextul cu mult mai puțină degradare.

Impact strategic

Cost și buget

Deciziile de arhitectură generează performanța și costurile de operare de ani de zile.

Decizii mai clare

Educația tehnică ajută echipele să aleagă stiva potrivită, nu doar cea mai nouă.

Controlul calității

Opțiuni de inginerie mai bune reduc incidentele de fiabilitate în producție.

Viitorul YaRN și extinderea lungimii contextului

Extensia contextului este acum o practică standard: modelele deschise livrează în mod obișnuit variante extinse YaRN care ating 128.000 de jetoane sau mai mult. Cercetările se îndreaptă către metode care extind contextul cu reglaj fin zero sau aproape zero, combină redimensionarea RoPE cu trucuri de model de atenție și mențin calitatea pe toată fereastra, mai degrabă decât doar la capete. Așteptați-vă la o integrare mai strânsă a acestor tehnici în preformare, astfel încât contextul de lungă durată este mai degrabă nativ decât modernizat.

Implementare în lumea reală

Extinderea unui model de context 4K deschis la 32K sau 128K pentru răspunsuri lungi la întrebări la documente cu o scurtă reglare fină

Permiterea sistemelor optimizate de recuperare pentru a ingera multe pasaje concatenate fără trunchiere

Alimentarea asistenților de cod care au nevoie de un întreg fișier de depozit mare sau mai multe fișiere într-un singur prompt

Adaptarea unui model de bază pentru conversații lungi cu mai multe rânduri care acumulează istorice mari de chat

Riscuri și balustrade

Optimizarea unui punct de referință poate ascunde slăbiciunile mai largi ale sistemului.

Costurile de infrastructură și întreținere sunt adesea subestimate.

Lacunele de securitate și observabilitate pot crește pe măsură ce sistemele devin mai complexe.

Foaia de parcurs de implementare

1

Definiți obiectivele de latență, calitate și cost înainte de implementare.

2

Benchmark în condiții realiste de încărcare și date.

3

Monitorizarea instrumentelor pentru erori, deriva și impactul utilizatorului.

4

Pregătiți căile de retragere și răspuns la incident înainte de scalare.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Interpolarea poziției pentru extensia contextului

Întrebări frecvente

What is YaRN and Context Length Extension?

YaRN (Yet another ROPE extension) este o tehnică eficientă pentru a extinde fereastra de context utilizabilă a unui model cu mult dincolo de ceea ce a fost antrenat. Redimensionează în mod inteligent înglobările de poziție rotativă, astfel încât un model antrenat pe, să zicem, jetoane 4K să poată gestiona 32K sau mai mult cu o reglare fină minimă.

Ce metodă de codificare a poziției modifică YaRN pentru a extinde contextul?

YaRN, al cărui nume înseamnă încă o altă extensie RoPE, redimensionează încorporațiile de poziție rotativă utilizate în majoritatea LLM-urilor moderne.

Ce nu merge bine când un model RoPE vede secvențe mai lungi decât lungimea de antrenament?

Pozițiile dincolo de antrenament produc unghiuri de rotație pe care modelul nu le-a văzut niciodată, așa că comportamentul atenției se degradează brusc.

Cum tratează YaRN diferitele dimensiuni ale frecvenței Corzii?

YaRN folosește o rampă NTK-by-parts care interpolează dim-urile de joasă frecvență cu lungime de undă lungă și lasă intacte dim-urile de înaltă frecvență cu rază scurtă.

Pe lângă redimensionarea frecvențelor, ce ajustare suplimentară se aplică YaRN?

YaRN adaugă o scalare a temperaturii la logit-urile de atenție pentru a contracara schimbările de entropie care apar pe măsură ce contextul crește.

Care este un avantaj practic cheie al YaRN față de interpolarea naivă?

YaRN atinge o calitate puternică a contextului lung după reglajul fin pe o mică parte din datele necesare metodelor naive.