Tilbake til Nyheter
InnovasjonAI Understanding orientering

Audit finner SWIFT mer nøyaktig og raskere enn ConfLayers for effektiv LLM-slutning

En tre-seed-revisjon rapporterer at SWIFT generelt overgikk konfidensstyrt lag som hopper over nøyaktighet og oppnådde høyere ren inferenshastighet etter at søkeoverhead ble separert. Studien fant også beskjedne gevinster, men betydelige nøyaktighetstap for to trente rutingmetoder.

5 min readRead the primary source
Source-provided image accompanying Audit finds SWIFT more accurate and faster than ConfLayers for efficient LLM inference
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.28846
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Inferens
Kjøretidsfasen der en trent modell genererer spådommer eller utdata.
Convolutional Neural Network (CNN)
En nevral arkitektur optimalisert for å behandle rutenettlignende data som bilder.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Et nytt arXiv forhåndstrykk evaluerer metoder som hopper over noen transformatorlag under store språkmodellslutninger. Forfatterne sammenligner vanilje autoregressiv dekoding med ConfLayers, en konfidensstyrt tidlig-exit-metode, og SWIFT, en selvspekulativ dekodingsmetode, på tvers av Qwen2.5-0.5B og Qwen2.5-1.5B på GSM8K-resonnement og CNN/DailyMail-oppsummeringsoppgaver.

Fortrykket presenterer det det kaller en rigor-matchet, tre-frø revisjon av periodiske-trinns lag-hopping-metoder. Disse systemene bestemmer hvilke transformatorlag som skal utføres for en inngang og går tilbake til den beslutningen med noen få generasjonstrinn. Sammenligningen inkluderer vanilje autoregressiv dekoding, ConfLayers og SWIFT. ConfLayers beskrives som en tillitsbasert tidlig exit-baseline, mens SWIFT beskrives som ekte selvspekulativ dekoding. Forfatterne evaluerer begge metodene på to Qwen2.5-modellskalaer, 0,5 milliarder og 1,5 milliarder parametere, og på to oppgaver: GSM8K-resonnering og CNN/DailyMail-oppsummering.

Papiret rapporterer at SWIFT var den sterkeste metoden for nøyaktighet i tre av de fire modell-og-oppgave-kombinasjonene. ConfLayers ble angivelig dominert i hver celle, med spesielt store underskudd på GSM8K på 1,5B-skalaen. Kilden gir ikke den fullstendige tabellen over nøyaktighetsverdier i den medfølgende teksten, så de nøyaktige margene kan ikke angis uavhengig her. Det sentrale resultatet er derfor forfatternes komparative rangering snarere enn en påstand om at begge metodene er universelt overlegne på tvers av alle språkmodeller eller arbeidsbelastninger.

En sentral del av tilsynet skiller overhead for nettsøk fra kostnadene ved å kjøre selve modellen. På det målet rapporterer forfatterne at SWIFTs rene slutningshastighet var 5 % til 21 % høyere enn ConfLayers i alle fire cellene, og reverserte den naive veggklokke-rangeringen i tre tilfeller. ConfLayers søkeoverhead ble rapportert som liten og stabil, med 1 % til 2 % av kostnadene, mens SWIFTs var større og mer variabel, og nådde så høyt som 28,7 %. Oppgaven inkluderer også en tilleggsanalyse av LayerRoute og LayerDrop, to opplærte rutingmetoder som tar beslutninger med grovere granulariteter. Under det forfatterne kaller en verifisert protokoll, produserte begge beskjedne hastigheter på 1,08x til 1,33x, men nøyaktigheten var lavere enn de periodiske trinn-metodene. LayerRoutes rapporterte gjennomsnittlige eksakte match på GSM8K ved 1,5B var 0,003 over tre frø.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Papiret argumenterer for at effektivitetssammenligninger kan være misvisende når online søkekostnader og faktiske slutningskostnader kombineres uten å skille dem. Resultatene tyder på at en metode som vises raskere i veggklokkemålinger, kan være mindre effektiv når kostnaden for å bestemme hvilke lag som skal hoppes over er tatt med.

Det praktiske problemet er at slutningseffektivitet har mer enn én komponent. En metode for å hoppe over lag kan redusere mengden nevrale nettverksberegninger samtidig som den legger til en egen beslutningsprosess som velger hva som skal kjøres. Hvis evalueringer bare rapporterer ende-til-ende veggklokke-tid, eller bare kostnadene for de utførte modelllagene, kan de produsere forskjellige rangeringer. Avisens sammenligning fremhever dette måleproblemet og gir en protokoll som er ment å gjøre effektivitetskrav mer direkte sammenlignbare.

For operatører som betjener språkmodeller, tyder de rapporterte resultatene på at reduksjon av utførte lag ikke er tilstrekkelig i seg selv. Nøyaktighet, beslutningsoverhead og granulariteten som ruting skjer med, betyr noe. En metode med en beskjeden beregningssnarvei kan være lite attraktiv hvis kvaliteten faller kraftig på resonneringsoppgaver. Omvendt kan en metode med høyere søkekostnader fortsatt være å foretrekke hvis den beholder mer nøyaktighet og gir bedre ren slutningshastighet under det testede oppsettet. Dette er implikasjoner av de rapporterte eksperimentene, ikke bevis på at noen spesiell metode vil redusere kostnadene i produksjonen.

Studien illustrerer også risikoen ved å sammenligne opplærte rutesystemer med elektroniske, periodiske trinnmetoder uten å samsvare med evalueringsprotokollen. Forfatterne sier at de brukte en ekte full-modell baseline, ekte per-input gating og ekte inferens-tidsberegningshopping for den supplerende analysen. Disse kontrollene er viktige fordi en nominelt sparsom eller rutet modell kan mislykkes i å lagre reell beregning hvis implementeringen fortsatt utfører mye av det hoppet over. Avisens rapporterte nesten kollaps for LayerRoute på én GSM8K-innstilling indikerer videre at hastighetsøkninger kan komme med alvorlige oppgavespesifikke kvalitetsavveininger.

Kilden gir et nyttig metodologisk bidrag ved å gi ut den fullstendige revisjonsprotokollen som en mal for strenge effektivitetssammenligninger. Det kan hjelpe forskere og ingeniørteam med å rapportere søkeoverhead, slutningskostnader, nøyaktighet, modellskala og oppgaveforhold på en mer konsistent måte. Kilden fastslår likevel ikke at protokollen er tatt i bruk av andre forskere, og viser heller ikke resultater på kommersielle modeller, spesialisert slutningsmaskinvare, lengre kontekster, interaktive arbeidsbelastninger eller reelle brukere.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Funnene må testes på tvers av flere modellstørrelser, arkitekturer, oppgaver, maskinvareinnstillinger og implementeringsmiljøer. Oppgaven er en versjon én-fortrykk, og konklusjonene er basert på forfatternes rapporterte protokoll i stedet for uavhengig replikering eller bevis på produksjonsdistribusjon.

Det viktigste neste trinnet er replikering utover de to Qwen2.5-modellstørrelsene og de to evaluerte oppgavene. GSM8K og CNN/DailyMail representerer resonnement og oppsummering, men de dekker ikke hele spekteret av arbeidsbelastninger som slutningseffektivitet er viktig for. Resultatene kan variere for koding, flerspråklig generering, langkontekstinnhenting, verktøybruk, strukturert utgang eller multimodale modeller. Kilden rapporterer ikke om slike tester.

Maskinvare- og programvareimplementering vil også ha betydning. Den medfølgende kilden rapporterer relative kostnader og hastigheter, men identifiserer ikke maskinvaren, kjøretidskonfigurasjonen, batchstørrelsene, tokengenereringsinnstillingene eller distribusjonsforholdene som ble brukt i eksperimentene. Disse detaljene er nødvendige for å avgjøre om de målte avveiningene overføres til datasenterservering, lokal slutning eller andre miljøer. Ingen produksjonskostnader, energi, ventetid-tjenestenivå eller tilgjengelighetsresultat er etablert av kilden.

Oppgaven bør også leses som et resultat før trykk i stedet for en fast konsensus. Den ble sendt til arXiv som versjon én 28. august 2026, og kilden identifiserer ikke noe resultat av fagfellevurdering eller uavhengig validering. Forfatternes påstander om ConfLayers, SWIFT, LayerRoute og LayerDrop er begrenset av deres valgte implementeringer og protokoll. Kilden sier ikke om senere versjoner, alternative innstillingsvalg eller forskjellige rutingterskler vil endre rangeringene.

Videre arbeid bør klargjøre forholdet mellom søkeoverhead og totale systemkostnader under realistiske arbeidsbelastninger. SWIFTs overhead ble rapportert som variabel og så høy som 28,7 %, mens dens rene slutningshastighet var høyere enn ConfLayers i de testede cellene. Hvorvidt denne avveiningen er gunstig avhenger av arbeidsbelastningsform, latenstidsmål, maskinvareutnyttelse og verdien som settes på nøyaktighet. Lesere bør se etter større revisjoner, utgitt kode eller benchmark-artefakter, uavhengige replikasjoner og evalueringer som rapporterer både ende-til-ende-forsinkelse og dekomponerte beregningskostnader.

Relaterte guider og quizer

AI-modeller forklartTransformatorerAI treningKIs fremtidTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?