Műszaki ÚTMUTATÓ

Spekulatív dekódolás az EAGLE segítségével

A spekulatív dekódolás felgyorsítja a nagy nyelvi modellek következtetéseit azáltal, hogy hagyja, hogy egy apró vázlatmodell több tokent előre találjon, amit a nagy modell egy menetben ellenőriz.

2 perc olvasásUtoljára frissítve

Áttekintés

EAGLE is a state-of-the-art version that drafts at the feature level rather than the token level, delivering 2-4x speedups with zero loss in output quality.

Mély merülés

A normál LLM-generálás autoregresszív: a modell egy tokent állít elő, visszaadja és megismétli, így minden token teljes előrehaladást igényel több milliárd paraméteren. A spekulatív dekódolás megtöri ezt a szűk keresztmetszetet. Egy olcsó fogalmazó felajánl egy darab jelölt tokent, és a drága célmodell mindegyiket egyetlen párhuzamos menetben ellenőrzi, elfogadva a leghosszabb helyes előtagot. Az EAGLE (Extrapolation Algorithm for Greater Language-model Efficiency) javítja a korábbi módszereket azáltal, hogy a modell rejtett jellemzőterében rajzol, és visszacsatolja az előző token valódi beágyazását a bizonytalanság csökkentése érdekében. Az EAGLE-2 dinamikus vázlatfát ad hozzá, az EAGLE-3 pedig eldob egy jellemző-előrejelzési kényszert a jobb méretezés érdekében. Lényeges, hogy az ellenőrzés garantálja, hogy a kimenet megegyezik azzal, amit a célmodell önmagában produkált volna.

Technikai betekintés

Az EAGLE kiképez egy kis autoregresszív fejet, amely megjósolja a célmodell következő rejtett állapotú jellemzőjét, majd újra felhasználja a célpont saját LM fejét, hogy a jellemzőket token jelöltekké alakítsa. Az eltolt tokenszekvencia és a korábbi szolgáltatások kondicionálásával csökkenti a csak jellemzők vázlatát sújtó kétértelműséget. A jelöltek egy fája azonnal ellenőrzésre kerül; a célmodell eloszlása ​​pontosan megmarad, mert az elfogadott tokeneknek meg kell egyeznie a mintavételezett vagy argmax választásával, így a gyorsítás veszteségmentes.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A spekulatív dekódolás jövője az EAGLE segítségével

A spekulatív dekódolás alapértelmezett infrastruktúrává válik az olyan veremek kiszolgálásában, mint a vLLM és a TensorRT-LLM. Szigorúbb integrációra számíthat a kötegelés és a KV-gyorsítótár megosztása, az önrajzoló modellek, amelyekhez nincs szükség külön rajzolóra, és a párhuzamos ellenőrzést feltételező hardver-társ tervezés. Az EAGLE-stílusú funkciószerkesztést kiterjesztik a multimodális és érvelési modellekre, ahol a hosszú gondolatláncok különösen fájdalmassá teszik a tokenenkénti költségeket, valamint az eszközön történő következtetésekre, ahol a késleltetés a legfontosabb.

Valós megvalósítás

Csökkenti a késleltetést a csevegési asszisztensekben, így a válaszok 2-3-szor gyorsabban érkeznek a modell válaszainak megváltoztatása nélkül

A nagy volumenű API-szolgáltatók GPU-szolgáltatási költségeinek csökkentése azáltal, hogy több tokenek generálnak egy előrehaladási lépésenként

A hosszú gondolati láncolatú gondolkodási modellek felgyorsítása, ahol több ezer token keletkezik lekérdezésenként

A kódkiegészítő eszközök felgyorsítása, ahol a kiszámítható, ismétlődő tokenszekvenciák magas vázlat-elfogadási arányt eredményeznek

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding with EAGLE quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Speculative Decoding with EAGLE?

A spekulatív dekódolás felgyorsítja a nagy nyelvi modellek következtetéseit azáltal, hogy hagyja, hogy egy apró vázlatmodell több tokent előre találjon, amit a nagy modell egy menetben ellenőriz. Az EAGLE egy csúcstechnológiás változat, amely nem a token szintjén, hanem a szolgáltatás szintjén rajzol, 2-4-szeres gyorsítást biztosítva, a kimeneti minőségben nulla veszteség nélkül.

Mi a spekulatív dekódolás alapötlete?

Egy kis rajzoló több tokent sejt előre, és a nagy célmodell együtt ellenőrzi őket, elfogadva a leghosszabb helyes előtagot.

Miben különbözik az EAGLE a korábbi spekulatív dekódolási megközelítésektől?

Az EAGLE előrejelzi a célmodell rejtett jellemzőit, és újra felhasználja az LM-fejet, amely pontosabb piszkozatokat állít elő, mint a csak token módszerek.

Miért tekintik veszteségmentesnek a spekulatív dekódolást?

Mivel a célmodell minden vázolt tokent ellenőrzi a saját eloszlásával, az elfogadott kimenet pontosan az, amit a cél önmagában generált volna.

Milyen problémát segít megoldani az EAGLE jellemző vázlatában az előző token beágyazás visszacsatolása?

A tényleges előző token feltétele csökkenti a következő rejtett jellemző előrejelzésének kétértelműségét, javítva a piszkozat pontosságát.

Mit tett hozzá az EAGLE-2 az eredeti EAGLE-hez?

Az EAGLE-2 bevezetett egy környezettudatos dinamikus vázlatfát, amely az ígéretes ágakat kiterjesztette az elfogadási arány növelésére.