Teknisk GUIDE

YaRN og Context Length Extension

YARN (Yet another RoPE extension) er en effektiv teknikk for å strekke en modells brukbare kontekstvindu langt utover det den ble trent på.

2 min lesingSist oppdatert

Oversikt

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Dypdykk

De fleste moderne LLM-er koder token-posisjoner med RoPE (Rotary Position Embeddings), som roterer spørrings- og nøkkelvektorer etter vinkler knyttet til posisjon. Når du mater sekvenser som er lengre enn treningslengden, går disse rotasjonene inn i usynlige områder og modellen bryter sammen. YaRN, introdusert i 2023 av Bowen Peng og samarbeidspartnere, fikser dette med NTK-bevisst interpolering brukt per frekvens: det lar høyfrekvente dimensjoner (som fanger opp lokale, kortdistanseforhold) stort sett urørt mens den interpolerer lavfrekvente dimensjoner (som sporer langdistanseposisjon). YaRN legger også til en temperaturjustering for å motvirke entropiendringene som kommer fra lengre sammenhenger. Resultatet er sterk langkontekstytelse etter finjustering på bare en liten brøkdel av dataene og trinnene som naive tilnærminger krever.

Teknisk innsikt

RoPE tildeler hver innstøpingsdimensjon en rotasjonsfrekvens. Naiv lineær interpolasjon komprimerer alle frekvenser likt, og skader høyfrekvente dimensjoner som koder for fine lokale detaljer. YaRN bruker en rampefunksjon for å interpolere kun lavfrekvente (langbølgelengde) dimensjoner samtidig som høyfrekvente dimensjoner bevares, pluss en 1/sqrt(t) oppmerksomhetstemperaturskalering som holder softmax-skarpheten stabil når sekvenslengden vokser. Denne NTK-for-deler-tilnærmingen utvider kontekst med langt mindre forringelse.

Strategisk innvirkning

Cost and budget

Arkitekturbeslutninger driver ytelse og driftskostnader i årevis.

Tydeligere avgjørelser

Teknisk utdanning hjelper team med å velge riktig stabel, ikke bare den nyeste.

Quality control

Bedre ingeniørvalg reduserer pålitelighetshendelser i produksjonen.

The Future of YaRN og Context Length Extension

Kontekstutvidelse er nå standardpraksis: åpne modeller sender rutinemessig YaRN-utvidede varianter som når 128 000 tokens eller mer. Forskning beveger seg mot metoder som utvider kontekst med null eller nesten null finjustering, kombinerer RoPE-reskalering med oppmerksomhetsmønstertriks, og opprettholder kvalitet over hele vinduet i stedet for bare endene. Forvent tettere integrering av disse teknikkene i fortrening så lang kontekst er innfødt i stedet for ettermontert.

Real-World Implementering

Utvide en åpen 4K-kontekstmodell til 32K eller 128K for svar på lange dokumentspørsmål med kort finjustering

Gjør det mulig for gjenfinningsforsterkede systemer å innta mange sammenkoblede passasjer uten trunkering

Drivende kodeassistenter som trenger en hel stor depotfil eller flere filer i én ledetekst

Tilpasning av en basismodell for lange samtaler med flere svinger som samler store chattehistorier

Risikoer og rekkverk

Optimalisering av ett benchmark kan skjule bredere systemsvakheter.

Infrastruktur- og vedlikeholdskostnader er ofte undervurdert.

Sikkerhets- og observerbarhetsgap kan vokse etter hvert som systemene blir mer komplekse.

Veikart for implementering

1

Definer ventetid, kvalitet og kostnadsmål før implementering.

2

Benchmark under realistiske belastnings- og dataforhold.

3

Instrumentovervåking for feil, drift og brukerpåvirkning.

4

Forbered tilbakerulling og hendelsesresponsbaner før skalering.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Posisjonsinterpolasjon for kontekstutvidelse

Ofte stilte spørsmål

What is YaRN and Context Length Extension?

YARN (Yet another RoPE extension) er en effektiv teknikk for å strekke en modells brukbare kontekstvindu langt utover det den ble trent på. Den omskalerer roterende posisjoner på en smart måte, slik at en modell trent på for eksempel 4K-tokens kan håndtere 32K eller mer med minimal finjustering.

Hvilken posisjonskodingsmetode endrer YaRN for å utvide konteksten?

YaRN, hvis navn betyr enda en tauforlengelse, omskalerer rotasjonsposisjonene som brukes i de fleste moderne LLM-er.

Hva går galt når en RoPE-modell ser sekvenser som er lengre enn treningslengden?

Posisjoner utover trening produserer rotasjonsvinkler modellen aldri så, så oppmerksomhetsatferden forringes kraftig.

Hvordan behandler YaRN forskjellige RoPE-frekvensdimensjoner?

YaRN bruker en NTK-for-deler rampe som interpolerer langbølgelengde lavfrekvente dimminger og lar kortdistanse høyfrekvente dimminger stort sett være intakte.

Foruten omskalering av frekvenser, hvilken ekstra justering gjelder YaRN?

YaRN legger til en temperaturskalering til oppmerksomhetslogitter for å motvirke entropiskifter som oppstår når konteksten vokser.

Hva er en viktig praktisk fordel med YaRN fremfor naiv interpolering?

YaRN oppnår sterk langkontekstkvalitet etter finjustering på en liten brøkdel av datanaive metoder krever.