Műszaki ÚTMUTATÓ

Spekulatív dekódolás

A spekulatív dekódolás segítségével a nagy nyelvi modellek gyorsabban generálnak szöveget, mivel egy kis, gyors „piszkozat” modell segítségével több token előre kitalál, majd a nagy modell egyszerre ellenőrzi őket.

2 perc olvasásUtoljára frissítve

Áttekintés

It speeds up inference 2-3x with identical output quality.

Mély merülés

Általában egy LLM egyenként hoz létre szöveget: minden tokenhez teljes előrehaladás szükséges az óriási modellen, és nem indíthatja el a következőt, amíg az aktuális be nem fejeződik. Ez lassú, mert memóriához, nem számításhoz kötött – a GPU ideje nagy részét súlyok betöltésével tölti, nem matematikával. A spekulatív dekódolás áttöri a szűk keresztmetszetet. Egy kicsi, olcsó vázlatmodell mondjuk öt jelölt tokenből álló darabot javasol. A nagy „cél” modell ezután egyetlen párhuzamos előremenetben feldolgozza mind az ötöt, és ellenőrzi őket. Elfogadják azokat a tokeneket, amelyek megegyeznek azzal, amit termelt volna; az első nézeteltérésnél kijavítja és elveti a többit. Mivel sok token ellenőrzése körülbelül ugyanannyiba kerül, mint egy generálása, az elfogadott találgatások szinte ingyenesek.

Technikai betekintés

Az okos rész egy elutasítási mintavételi szabály, amely garantálja, hogy a kimeneti eloszlás matematikailag megegyezik a célmodell egyedüli futtatásával – tehát a minőség nem közelítő, hanem pontos. Az elfogadási arány növeli a sebességet: minél jobban megjósolja a kis modell a nagyot, annál több token ragad meg egy ellenőrzési lépésben. Az olyan változatok, mint a Medusa, extra előrejelző fejeket adnak magának a célmodellnek, és az EAGLE-vázlatokat a funkciótérben, így nincs szükség külön vázlatmodellre.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A spekulatív dekódolás jövője

A spekulatív dekódolás alapértelmezetté válik az olyan kiszolgálási veremekben, mint a vLLM és a TensorRT-LLM. Arra számíthat, hogy az önrajzoló módszerek (Medusa, EAGLE, Lookahead) dominálnak, mivel elkerülik a második modell fenntartását, valamint a faalapú spekulációt, amely lépésenként több jelölt ágat ellenőriz. A modellek növekedésével a memóriához kötött szűk keresztmetszet súlyosbodik, ami még értékesebbé teszi a spekulációkat, a hardvertudatos rajzolók pedig feljebb tolják a valós világ gyorsításait.

Valós megvalósítás

Egy 7B vázlatos modell, amely tokeneket javasol egy 70B csevegési modellhez, hogy csökkentsék a válaszadási késést egy éles asszisztensben

Medusa fejek egy LLM-re csavarozva, így egyszerre több jövőbeli tokent jósol meg külön vázlatmodell nélkül

vLLM, amely lehetővé teszi a spekulatív dekódolást a tokenek másodpercenkénti átviteli sebességének növelésére a kiszolgáló fürtön

EAGLE rajzolás a modell rejtett funkcióterében az elfogadási arány és az általános sebesség növelése érdekében

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Spekulatív dekódolás az EAGLE segítségével

Gyakran ismételt kérdések

What is Speculative Decoding?

A spekulatív dekódolás segítségével a nagy nyelvi modellek gyorsabban generálnak szöveget, mivel egy kis, gyors „piszkozat” modell segítségével több token előre kitalál, majd a nagy modell egyszerre ellenőrzi őket. 2-3-szorosára gyorsítja a következtetést azonos kimeneti minőség mellett.

Mi a spekulatív dekódolás alapötlete?

A gyorsvázlatos modell több tokent javasol, a nagy célmodell pedig mindegyiket egyetlen párhuzamos menetben ellenőrzi.

Miért lassú a normál, egy-egy tokent LLM-generálás?

Minden lépés elsősorban a hatalmas súlymátrixokat tölti be a memóriából, nem pedig nehéz számításokat végez, így a GPU alulhasznált.

Mi történik az első tokennél, ahol a vázlat és a célmodell nem egyezik?

A nézeteltérésig jelző jelzőket elfogadjuk; az eltéréstől kezdve a rendszer elutasítja őket, és a célmodell helyes tokenje megmarad.

Hogyan befolyásolja a spekulatív dekódolás a kimenet minőségét?

Az elutasítási mintavételi szabály garantálja, hogy a végső eloszlás pontosan megegyezik a célmodellel, így a minőség változatlan.

Mi határozza meg a legközvetlenebbül a spekulatív dekódolás gyorsítását?

Minél több kidolgozott tokent fogad el a célmodell ellenőrzési lépésenként, annál nagyobb a sebesség.