Vissza a Hírekhez
InnovációAI Understanding eligazítás

Az Audit a SWIFT-et pontosabbnak és gyorsabbnak találja, mint a ConfLayers a hatékony LLM-következtetés érdekében

Egy hárommagos audit jelentése szerint a SWIFT általában jobban teljesített, mint a megbízhatóságfüggő rétegek kihagyása a pontosság tekintetében, és nagyobb tiszta következtetési sebességet ért el a keresési többlet leválasztása után. A tanulmány szerény nyereséget, de jelentős pontossági veszteséget is talált két betanított útválasztási módszer esetében.

5 min readRead the primary source
Source-provided image accompanying Audit finds SWIFT more accurate and faster than ConfLayers for efficient LLM inference
Elsődleges forrású dokumentumForrás rögzített
Kiadó
arxiv.org
Forrás link
arxiv.orghttps://arxiv.org/abs/2608.28846
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

Nagy nyelvű modell (LLM)
Hatalmas szövegkorpusokra kiképzett nyelvi modell szöveg generálására és elemzésére.
Következtetés
Az a futásidejű fázis, amelyben egy betanított modell előrejelzéseket vagy kimeneteket generál.
Konvolúciós Neurális Hálózat (CNN)
Rácsszerű adatok, például képek feldolgozására optimalizált neurális architektúra.
Teszteld magadAI modellek magyarázata kvíz

Mi történt

Az új arXiv preprint olyan módszereket értékel, amelyek kihagynak néhány transzformátorréteget a nagy nyelvi modellkövetkeztetés során. A szerzők összehasonlítják a vanília autoregresszív dekódolást a ConfLayers-szel, egy bizalomkapuzott korai kilépési módszerrel és a SWIFT-tel, egy önspekulatív dekódolási módszerrel a Qwen2.5-0.5B és Qwen2.5-1.5B között a GSM8K érvelési és CNN/DailyMail összegzési feladatokon.

A preprint bemutatja az úgynevezett szigorúan illeszkedő, hárommagos auditálást a periodikus lépéses rétegátugrási módszerekről. Ezek a rendszerek eldöntik, hogy mely transzformátorrétegeket hajtsák végre egy bemenethez, és néhány generációs lépésenként újragondolják ezt a döntést. Az összehasonlítás tartalmazza a vanília autoregresszív dekódolást, a ConfLayereket és a SWIFT-et. A ConfLayersről úgy írnak, mint egy bizalomkapuzott korai kilépési alapvonalnak, míg a SWIFT-et valódi önspekulatív dekódolásnak. A szerzők mindkét módszert két Qwen2.5 modellskálán, 0,5 milliárd és 1,5 milliárd paraméteren, valamint két feladaton értékelik: GSM8K érvelés és CNN/DailyMail összegzés.

A cikk arról számol be, hogy a SWIFT volt a legerősebb módszer a pontosság tekintetében a négy modell-feladat kombináció közül háromban. A jelentések szerint a ConfLayers minden cellában dominált, különösen nagy hiányosságokkal a GSM8K-n az 1,5 B-s skálán. A forrás nem tartalmazza a pontossági értékek teljes táblázatát a mellékelt szövegben, így a pontos margók itt nem adhatók meg önállóan. A központi eredmény tehát a szerzők összehasonlító rangsorolása, nem pedig az az állítás, hogy bármelyik módszer univerzálisan felülmúlja az összes nyelvi modellt vagy munkaterhelést.

Az audit kulcsfontosságú része elkülöníti az online keresés általános költségeit magának a modellnek a működtetésének költségeitől. Ezzel kapcsolatban a szerzők arról számolnak be, hogy a SWIFT tiszta következtetési sebessége 5-21%-kal magasabb volt, mint a ConfLayers-é mind a négy cellában, ami három esetben megfordította a falióra naiv besorolását. A ConfLayers keresési többletköltsége kicsinek és stabilnak bizonyult, a költségek 1-2%-ával, míg a SWIFT-é nagyobb és változóbb volt, elérve a 28,7%-ot. A cikk a LayerRoute és a LayerDrop kiegészítő elemzését is tartalmazza, amelyek két betanított útválasztási módszer, amelyek durvább részletességgel hoznak döntéseket. A szerzők által ellenőrzött protokollnak nevezett protokoll szerint mindkettő szerény, 1,08-1,33-szoros gyorsulást produkált, de a pontosságuk elmaradt a periodikus lépéses módszerekétől. A LayerRoute által jelentett átlagos pontos egyezés a GSM8K-n 1,5B-nél 0,003 volt három magon belül.

Forrás részletei: arxiv.org ↗

Miért számít

A cikk azzal érvel, hogy a hatékonyság-összehasonlítások félrevezetőek lehetnek, ha az online keresés költségeit és a tényleges következtetési költségeket úgy kombinálják, hogy nem különítik el őket. Eredményei arra utalnak, hogy a falióra-méréseknél gyorsabban megjelenő módszer kevésbé lehet hatékony, ha figyelembe vesszük a kihagyandó rétegek eldöntésének költségét.

A gyakorlati probléma az, hogy a következtetés hatékonyságának több összetevője van. A rétegátugrási módszer csökkentheti a neurális hálózat számítási mennyiségét, miközben külön döntési folyamatot ad hozzá, amely kiválasztja, hogy mit kell futtatni. Ha a kiértékelések csak a falióra végétől végpontig terjedő idejét, vagy csak a végrehajtott modellrétegek költségét adják meg, különböző rangsorokat állíthatnak elő. A cikk összehasonlítása rávilágít erre a mérési problémára, és egy protokollt ad, amelynek célja a hatékonysági állítások közvetlenebb összehasonlítása.

A nyelvi modelleket kiszolgáló operátorok esetében a közölt eredmények arra utalnak, hogy a végrehajtott rétegek csökkentése önmagában nem elegendő. A pontosság, a döntési költségek és az útválasztás pontossága mind számít. Egy szerény számítási parancsikont tartalmazó módszer nem lehet vonzó, ha minősége erősen csökken az érvelési feladatokon. Ezzel szemben a magasabb keresési költségű módszer továbbra is előnyösebb lehet, ha megőrzi a nagyobb pontosságot és jobb tiszta következtetési sebességet biztosít a tesztelt beállítás mellett. Ezek a jelentett kísérletek következményei, nem pedig annak bizonyítékai, hogy bármely konkrét módszer csökkenti a termelési költségeket.

A tanulmány bemutatja a betanított útválasztási rendszerek online, periodikus lépéses módszerekkel való összehasonlításának kockázatait is, anélkül, hogy az értékelési protokollt egyeztetnék. A szerzők azt mondják, hogy valódi teljes modell alapvonalat, valódi bemenetenkénti kapuzást és valódi következtetés-idő számítási kihagyást használtak a kiegészítő elemzéshez. Ezek a vezérlők azért fontosak, mert egy névlegesen ritka vagy irányított modell nem tudja megmenteni a valós számítást, ha a megvalósítás továbbra is elvégzi a kihagyott munka nagy részét. A lap jelentése szerint a LayerRoute egy GSM8K beállításon majdnem összeomlott, továbbá azt jelzi, hogy a sebességnövekedés súlyos, feladatspecifikus minőségi kompromisszumokkal járhat.

A forrás hasznos módszertani hozzájárulást nyújt azáltal, hogy kiadja a teljes audit protokollt, mint sablont a szigorúan illeszkedő hatékonyság-összehasonlításokhoz. Ez segítheti a kutatókat és a mérnöki csapatokat a keresési költségekről, a következtetési költségekről, a pontosságról, a modell méretarányáról és a feladatkörülményekről következetesebb módon jelenteni. Ennek ellenére a forrás nem állapítja meg, hogy a protokollt más kutatók is átvették volna, és nem mutat eredményt kereskedelmi modellekre, speciális következtetési hardverekre, hosszabb kontextusokra, interaktív munkaterhelésekre vagy valódi felhasználókra.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktív koncepció ellenőrzése+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Mit nézzünk ezután

Az eredményeket több modellméreten, architektúrán, feladaton, hardverbeállításon és megvalósítási környezetben kell tesztelni. A cikk egy előzetes verzió, és következtetései a szerzők által közölt protokollon alapulnak, nem pedig a független replikáción vagy a termelési telepítés bizonyítékán.

A legfontosabb következő lépés a két Qwen2.5 modellméreten és a két kiértékelt feladaton túli replikáció. A GSM8K és a CNN/DailyMail érvelést és összefoglalást jelent, de nem fedik le a munkaterhelések teljes skáláját, amelyeknél a következtetés hatékonysága számít. Az eredmények eltérőek lehetnek a kódolás, a többnyelvű generálás, a hosszú kontextusú visszakeresés, az eszközhasználat, a strukturált kimenet vagy a multimodális modellek esetében. A forrás nem számol be ilyen tesztekről.

A hardver és a szoftver megvalósítása is számít. A mellékelt forrás relatív többletköltségeket és gyorsulásokat jelent, de nem azonosítja a kísérletekben használt hardvert, futásidejű konfigurációt, kötegméreteket, tokengenerálási beállításokat vagy telepítési feltételeket. Ezek a részletek szükségesek annak meghatározásához, hogy a mért kompromisszumok átkerülnek-e az adatközponti kiszolgálásra, a helyi következtetésekre vagy más környezetekre. A forrás nem határoz meg termelési költséget, energiát, késleltetési szolgáltatási szintet vagy rendelkezésre állási eredményt.

A papírt szintén nyomtatás előtti eredményként kell értelmezni, nem pedig állandó konszenzusként. 2026. augusztus 28-án benyújtották a arXiv első verziójának, és a forrás nem azonosított szakértői értékelés eredményét vagy független érvényesítést. A szerzők ConfLayers-re, SWIFT-re, LayerRoute-ra és LayerDrop-ra vonatkozó állításait az általuk kiválasztott megvalósítások és protokollok korlátozzák. A forrás nem árulja el, hogy a későbbi verziók, az alternatív hangolási lehetőségek vagy az eltérő útválasztási küszöbök megváltoztatnák-e a rangsort.

A további munkának tisztáznia kell a keresési általános költségek és a teljes rendszerköltség közötti kapcsolatot reális munkaterhelés mellett. A SWIFT többletterhelése változónak bizonyult, és 28,7%-ot is elért, míg a tiszta következtetési sebessége nagyobb volt, mint a ConfLayeré a tesztelt cellákban. Az, hogy ez a kompromisszum kedvező-e, a munkaterhelés alakjától, a késleltetési céloktól, a hardverhasználattól és a pontosság értékétől függ. Az olvasóknak figyelniük kell a nagyobb ellenőrzéseket, a kiadott kód- vagy benchmark műtermékeket, a független replikációkat és a végpontok közötti késleltetést és a lebontott számítási költségeket egyaránt jelentő kiértékeléseket.

Kapcsolódó útmutatók és vetélkedők

Az AI modellek magyarázataTranszformátorokAI képzésAz MI jövőjeTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?