Technische GIDS

YaRN en contextlengte-extensie

YaRN (Nog een andere RoPE-extensioN) is een efficiënte techniek om het bruikbare contextvenster van een model veel verder uit te strekken dan waarop het is getraind.

2 min readLaatst bijgewerkt

Overzicht

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Diepe duik

De meeste moderne LLM's coderen tokenposities met RoPE (Rotary Position Embeddings), die query- en sleutelvectoren roteren volgens hoeken die aan de positie zijn gekoppeld. Wanneer u reeksen invoert die langer zijn dan de trainingslengte, komen deze rotaties in onzichtbare bereiken terecht en gaat het model kapot. YaRN, geïntroduceerd in 2023 door Bowen Peng en medewerkers, lost dit op met NTK-bewuste interpolatie toegepast per frequentie: het laat hoogfrequente dimensies (die lokale korteafstandsrelaties vastleggen) grotendeels onaangeroerd, terwijl laagfrequente dimensies worden geïnterpoleerd (die lange afstandspositie volgen). YaRN voegt ook een temperatuuraanpassing toe aan de aandacht om de entropieveranderingen die voortkomen uit langere contexten tegen te gaan. Het resultaat is een sterke prestatie op de lange context na het verfijnen van slechts een klein deel van de gegevens en stappen die naïeve benaderingen vereisen.

Technisch inzicht

RoPE kent aan elke inbeddingsdimensie een rotatiefrequentie toe. Naïeve lineaire interpolatie comprimeert alle frequenties gelijkmatig, waardoor de hoogfrequente dimensies die fijne lokale details coderen, worden geschaad. YaRN gebruikt een ramp-functie om alleen de laagfrequente (lange golflengte) dimensies te interpoleren, terwijl de hoogfrequente dimensies behouden blijven, plus een 1/sqrt(t) aandachtstemperatuurschaling die de softmax-scherpte stabiel houdt naarmate de reekslengte toeneemt. Deze NTK-aanpak breidt de context uit met veel minder degradatie.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van YaRN en uitbreiding van de contextlengte

Contextuitbreiding is nu de standaardpraktijk: open modellen verzenden routinematig YaRN-uitgebreide varianten die 128K-tokens of meer bereiken. Onderzoek beweegt zich in de richting van methoden die de context uitbreiden met nul of bijna nul verfijning, RoPE-herschaling combineren met aandachtspatroontrucs en de kwaliteit over het hele venster behouden in plaats van alleen aan de uiteinden. Verwacht een nauwere integratie van deze technieken in de vooropleiding, zodat de lange context native is en niet achteraf wordt aangepast.

Implementatie in de echte wereld

Uitbreiding van een open 4K-contextmodel naar 32K of 128K voor het beantwoorden van vragen over lange documenten met korte verfijning

Systemen met ophaalmogelijkheden in staat stellen veel aaneengeschakelde passages op te nemen zonder afkapping

Het aandrijven van code-assistenten die een volledig groot repositorybestand of meerdere bestanden in één prompt nodig hebben

Een basismodel aanpassen voor lange gesprekken met meerdere beurten die een grote chatgeschiedenis opleveren

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Positie-interpolatie voor contextextensie

Frequently asked questions

What is YaRN and Context Length Extension?

YaRN (Nog een andere RoPE-extensioN) is een efficiënte techniek om het bruikbare contextvenster van een model veel verder uit te strekken dan waarop het is getraind. Het schaalt op slimme wijze de insluitingen van de draaiposities opnieuw, zodat een model dat is getraind op bijvoorbeeld 4K-tokens 32K of meer kan verwerken met minimale fijnafstemming.

Welke positiecoderingsmethode wijzigt YaRN om de context uit te breiden?

YaRN, waarvan de naam Nog een RoPE-extensie betekent, herschaalt de inbedding van de draaipositie die in de meeste moderne LLM's wordt gebruikt.

Wat gaat er mis als een RoPE-model reeksen ziet die langer zijn dan de trainingsduur?

Posities buiten training produceren rotatiehoeken die het model nooit heeft gezien, waardoor het aandachtsgedrag sterk verslechtert.

Hoe gaat YaRN om met verschillende RoPE-frequentiedimensies?

YaRN maakt gebruik van een NTK-by-parts-ramp die laagfrequente dimmen met lange golflengte interpoleert en hoogfrequente dimmen met een kort bereik grotendeels intact laat.

Welke extra aanpassing past YaRN toe, naast het herschalen van frequenties?

YaRN voegt een temperatuurschaling toe aan aandachtslogits om entropieverschuivingen tegen te gaan die optreden naarmate de context groeit.

Wat is een belangrijk praktisch voordeel van YaRN ten opzichte van naïeve interpolatie?

YaRN bereikt een sterke lange-contextkwaliteit na verfijning van een klein deel van de data-naïeve methoden die nodig zijn.