Taal AI-GIDS

Schalen van YaRN-contextvenster

YaRN (Nog een RoPE-extensioN) is een techniek die het bruikbare contextvenster van een transformator veel verder uitbreidt dan waarop hij is getraind, met minimale fijnafstemming.

2 min readLaatst bijgewerkt

Overzicht

It matters because it lets existing models handle much longer documents without retraining from scratch.

Diepe duik

De meeste moderne LLM's coderen woordposities met behulp van Rotary Position Embeddings (RoPE), die alleen goed werken tot de lengte die het model tijdens de training zag. Voer een langere reeks in en het model verslechtert ernstig. YaRN lost dit op door de rotatiefrequenties van RoPE op een frequentiebewuste manier te herschalen: hoogfrequente dimensies (die lokale, nabije relaties vastleggen) blijven grotendeels onaangeroerd, terwijl laagfrequente dimensies (die langeafstandsposities vastleggen) worden geïnterpoleerd. Het voegt ook een temperatuuraanpassing toe aan de aandacht om ervoor te zorgen dat logits zich op lange afstanden goed gedragen. Het resultaat, gedemonstreerd op LLaMA-modellen, breidt de context uit van 4K naar 64K-128K-tokens met slechts ongeveer 0,1% van de oorspronkelijke trainingsgegevens en een paar honderd stappen voor verfijning.

Technisch inzicht

RoPE roteert query- en sleutelvectoren over een hoek die evenredig is met de positie en een frequentie per dimensie. Naïeve lineaire interpolatie (Position Interpolation) verplettert alle frequenties in gelijke mate, waardoor lokale details worden geschaad. YaRN past in plaats daarvan 'NTK-by-parts' toe: het interpoleert alleen de laagfrequente (lange golflengte) dimensies, laat de hoogfrequente dimensies met rust, en loopt daartussen op. Een schaalverdeling van de aandachtstemperatuur compenseert de entropieverschuiving, waardoor de nauwkeurigheid bij langere lengtes behouden blijft.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van het schalen van YaRN-contextvensters

Frequentiebewuste extensie in YaRN-stijl is een standaardingrediënt geworden voor het verzenden van lange-contextmodellen; varianten en opvolgers blijven verschijnen terwijl laboratoria richting vensters met miljoenen tokens streven. Verwacht een nauwere integratie met efficiënte aandacht, KV-cache-compressie en dynamische schaling die zich direct per verzoek aanpast. De bredere trend is het loskoppelen van ‘hoe lang een model is getraind’ en ‘hoe lang het nuttig kan lezen’, waardoor een lange context een goedkope functie na de training wordt in plaats van een dure architectonische verplichting.

Implementatie in de echte wereld

Een open LLaMA-model uitbreiden van 4K naar 128K tokens, zodat het in één keer een volledige codebase of een lang contract kan opnemen

Een chatbot een zeer lange gespreksgeschiedenis laten bewaren zonder eerdere beurten af te korten

Het samenvatten van documenten ter grootte van een boek of transcripties van meerdere uren die het oorspronkelijke venster van het basismodel overschrijden

Een vooraf getraind model goedkoop aanpassen voor ophaaltaken met een lange context, met slechts een kleine verfijningsrun

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Contextvensters

Frequently asked questions

What is YaRN Context Window Scaling?

YaRN (Nog een RoPE-extensioN) is een techniek die het bruikbare contextvenster van een transformator veel verder uitbreidt dan waarop hij is getraind, met minimale fijnafstemming. Het is belangrijk omdat bestaande modellen veel langere documenten kunnen verwerken zonder dat ze helemaal opnieuw hoeven te worden getraind.

Welk positiecoderingsschema wijzigt YaRN om de contextlengte te verlengen?

YaRN staat voor 'Yet another RoPE extensioN' en werkt door het herschalen van de rotatiefrequenties die worden gebruikt in Rotary Position Embeddings.

Hoe behandelt YaRN hoogfrequente versus laagfrequente RoPE-dimensies?

De 'NTK-by-parts'-benadering van YaRN behoudt de hoogfrequente (lokale) dimensies, terwijl de laagfrequente (langeafstands) dimensies worden geïnterpoleerd om schade aan lokale details te voorkomen.

Wat is een belangrijk efficiëntievoordeel van YaRN ten opzichte van het helemaal opnieuw trainen van een lang-contextmodel?

YaRN kan de context uitbreiden met behulp van ongeveer 0,1% van de oorspronkelijke trainingsgegevens en een klein aantal verfijningsstappen, veel goedkoper dan omscholing.

Welke extra aanpassing past YaRN toe, naast het herschalen van frequenties, om de aandacht op lange afstand stabiel te houden?

YaRN wijzigt de aandachtstemperatuur om de entropie/logit-verschuiving te compenseren die optreedt wanneer reeksen veel langer worden.

Welk probleem doet zich voor als u een RoPE-modelreeksen veel langer invoert dan waarop het is getraind, zonder enige schaalvergroting?

RoPE generaliseert slecht naar onzichtbare longposities, waardoor de kwaliteit instort tenzij de frequenties opnieuw worden geschaald.